2026년 8월 3일, Qwen 팀은 Qwen3.8-Max를 공식 발표했습니다. 이 모델은 총 2.4조 파라미터, 토큰당 950억 활성 파라미터, 100만 토큰 컨텍스트, 텍스트·이미지·비디오 입력을 지원합니다. 8월 중순에는 오픈 웨이트 모델 Qwen3.8-2.4T-A95B와 Qwen3.8-27B도 공개됐습니다.
기업에 중요한 변화는 단순한 모델 크기가 아닙니다. Qwen3.8이라는 하나의 이름 아래에 관리형 Max API, 초대형 MoE 자체 호스팅, 27B 로컬 배포라는 세 가지 경로가 생겼습니다. 기능, 비용, 운영 책임이 서로 다르므로 동일한 제품처럼 비교해서는 안 됩니다.

1. 제품 구성: Max API, 2.4T-A95B, 27B는 서로 다른 선택지입니다
Qwen 공식 발표와 Alibaba Group 공지에 따르면 Qwen3.8-Max는 먼저 관리형 클라우드 모델로 출시됐습니다. Qwen3.8-2.4T-A95B는 같은 계열의 오픈 웨이트 기반 모델이며, Qwen3.8-27B는 자체 배포 가능성을 높인 Dense 모델입니다.
| 항목 | Qwen3.8-Max API | Qwen3.8-2.4T-A95B | Qwen3.8-27B |
|---|---|---|---|
| 이용 방식 | QwenCloud / Alibaba Cloud API | 오픈 웨이트, 자체 호스팅 | 오픈 웨이트, 자체 호스팅 |
| 규모 | 2.4T, 95B 활성 | 2.4T, 95B 활성 | 27B Dense |
| 주요 입력 | 텍스트, 이미지, 비디오 | 텍스트 | 텍스트, 이미지, 비디오 |
| 기본 컨텍스트 | 1M | 262K, 약 1M까지 확장 | 262K, 약 1M까지 확장 |
| 추론 모드 | Thinking / Non-thinking | Thinking 중심 | 요청별 Thinking 제어 |
| 도구 | 검색, 코드 실행, 웹 추출 등 | 기업이 직접 통합 | 기업이 직접 통합 |
API에는 모델뿐 아니라 추론 서비스, 캐시, 도구, 운영 기능이 포함됩니다. 오픈 웨이트는 기본적으로 모델 가중치를 제공합니다. 자체 호스팅 기업은 추론 엔진, 권한, 로그, 모니터링, 도구 샌드박스, 업데이트 정책을 직접 구성해야 합니다. 🔗 한국어 페이지가 확인되지 않은 관련 글은 사이트 규칙에 따라 영어 링크를 사용합니다. Enterprise AI agent development에서 모델 외부의 실행 환경이 신뢰성에 미치는 영향을 확인할 수 있습니다.
2. 아키텍처: 매 토큰마다 2.4조 파라미터를 계산하지 않습니다
Qwen3.8은 희소 Mixture-of-Experts와 하이브리드 어텐션 구조를 사용합니다. 총 2.4조 파라미터를 저장하지만 토큰마다 약 950억 파라미터만 활성화합니다. 이를 통해 능력을 여러 전문가 모듈에 분산하면서 동일 규모의 Dense 모델보다 토큰당 연산량을 낮춥니다.
오픈 모델 사양은 92개 레이어와 512개 전문가를 설명합니다. 각 토큰은 10개 라우팅 전문가와 1개 공유 전문가를 사용합니다. Gated DeltaNet은 긴 컨텍스트 처리 비용을 줄이고, Gated Attention은 정밀한 참조가 필요한 구간을 담당합니다. Multi-Token Prediction도 생성 처리량을 높이는 데 사용됩니다.
기업은 세 가지를 구분해야 합니다.
- 활성 파라미터는 연산량에, 총 파라미터는 저장과 상주 메모리에 영향을 줍니다.
- 긴 컨텍스트는 무료가 아닙니다. KV cache, 첫 토큰 지연, 비용이 함께 증가합니다.
- MoE 성능은 클러스터 통신과 스케줄링에 좌우됩니다. GPU 모델명만으로 실제 처리량을 판단하기 어렵습니다.
🔗 기존 GPU 클러스터에서 MoE를 평가한다면 GPU utilization guide를 함께 검토해야 합니다.
3. 벤치마크: 강한 결과지만 대부분 공급자 발표 수치입니다
Qwen이 발표한 기업 관련 주요 결과는 다음과 같습니다.
| 벤치마크 | Qwen3.8-Max 발표 점수 | 평가 대상 | 해석 제한 |
|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 터미널 및 환경 실행 | Harness와 도구 정책에 따라 변동 |
| SWE-bench Pro | 67.7 | 저장소 수준 코드 수정 | 모든 언어와 사내 코드를 대표하지 않음 |
| PaperBench | 93.0 | 논문 및 실험 재현 | 모델 심사와 시간 제한 사용 |
| OSWorld-Verified | 86.1 | 데스크톱 앱 조작 | 사내 앱은 별도 테스트 필요 |
| Toolathlon-Verified | 72.5 | 다중 도구 실행 | 같은 표에서 더 높은 모델 존재 |
| WebArena-Verified | 66.8 | 웹 작업 | 사이트 변화와 보안 정책의 영향 |
이 점수는 Qwen 출시 자료에서 나온 값이며 모두 동일 조건에서 독립 재평가된 결과는 아닙니다. EvoLink의 증거 검토는 Harness, 도구, API 경로, 추론 예산이 바뀌면 결과가 달라질 수 있다고 지적합니다. BenchLM 모델 프로필도 Qwen3.8-Max가 일부 항목에서는 앞서지만 Toolathlon과 일부 데스크톱 작업에서는 그렇지 않다는 점을 보여줍니다.
기업 평가는 공개 점수로 능력 방향을 확인하고, 측정 조건을 검토한 뒤, 20~50개 내부 작업으로 성공률·수정 시간·지연·비용을 비교하는 순서가 적절합니다. 🔗 MCP-based AI agents를 평가할 때도 모델, 도구, 권한, 오케스트레이션을 하나의 시스템으로 봐야 합니다.
4. API 비용: 백만 토큰 단가는 출발점일 뿐입니다
2026년 8월 19일 기준 QwenCloud 공식 가격은 다음과 같습니다.
| 토큰 유형 | 가격 |
|---|---|
| 입력 | 백만 토큰당 US$2 |
| 출력 | 백만 토큰당 US$6 |
| 암시적 캐시 입력 | 백만 토큰당 US$0.25 |
| 명시적 캐시 생성 | 백만 토큰당 US$2.50 |
| 명시적 캐시 읽기 | 백만 토큰당 US$0.17 |
기업은 추론 토큰, 유료 도구, 실패 재시도, 사람의 검토 시간도 포함해야 합니다. 장시간 Agent에서는 외부 작업과 검토 비용이 모델 호출료보다 커질 수 있습니다.
캐시는 정책, 매뉴얼, 코드베이스 정보처럼 여러 요청이 동일한 접두부를 공유할 때 효과적입니다. 매번 다른 문서를 넣는 작업에서는 낮은 캐시 단가가 실제 절감으로 이어지지 않습니다. 🔗 API와 자체 GPU를 비교하는 팀은 한국어 버전이 확인된 클라우드와 온프레미스 비교를 이용해 3년 TCO를 계산할 수 있습니다.
5. 자체 호스팅: 27B는 현실적인 시작점, 2.4T는 인프라 프로그램입니다
27B Dense 모델은 가중치만 BF16 약 54GB, FP8 약 27GB, 4-bit 약 14GB가 필요합니다. KV cache, 멀티모달 구성 요소, 추론 프레임워크 메모리는 별도입니다. 16GB GPU에서도 짧은 컨텍스트와 강한 양자화로 실행할 수 있지만 기업 용량 계획 기준으로는 부족합니다. 단일 사용자 PoC는 24~32GB가 더 현실적이며, 긴 컨텍스트와 동시 사용에는 추가 메모리나 다중 GPU가 필요합니다.
2.4T-A95B는 다른 등급입니다. 4-bit 가중치만 약 1.2TB에 달합니다. 고속 인터커넥트, 분산 추론, 스토리지, 모니터링, 이중화를 포함한 인프라 프로젝트로 접근해야 합니다.
| 상황 | 권장 시작점 | 이유 |
|---|---|---|
| 2주 안에 능력 검증 | Max API | 추론 클러스터가 필요 없음 |
| 긴 문서·멀티모달 | Max API | 기능 구성이 가장 완전함 |
| 코드나 고객 데이터를 내부에 유지 | 27B | 자체 호스팅 범위를 관리하기 쉬움 |
| 기존 다중 노드 인프라 보유 | Max 테스트 후 2.4T 검토 | 투자 전에 업무 가치를 검증 |
| 여러 부서와 여러 모델 | MaaS 플랫폼 | 부서별 중복 구축 방지 |
🔗 Enterprise MaaS guide는 업무별로 다른 모델과 하드웨어를 제공하는 공유 방식의 장점을 설명합니다.
6. 4주 기업 PoC 설계
1주차: 실제 작업 20~50개를 구성합니다
고객 응답, 사내 정책, 기술 문서, 스프레드시트, PDF, 코드 저장소, 도구 실행을 포함합니다. 허용되는 답, 금지 행동, 사람의 평가 기준을 미리 정의합니다.
2주차: Max와 27B를 같은 조건에서 비교합니다
Max로 능력 상한을 확인하고 27B로 로컬 가능성을 검증합니다. 컨텍스트, 추론 모드, 양자화, 도구, 프롬프트를 기록합니다.
3주차: 실패와 권한 시나리오를 추가합니다
오래된 문서, 상충 지시, 손상 파일, 도구 타임아웃, 권한 거부를 넣습니다. 불확실한 상황에서 중단하는지, 질문하는지, 추측해서 계속 실행하는지 확인합니다.
4주차: 성공 작업당 비용을 계산합니다
토큰, GPU 시간, 스토리지, 운영, 재시도, 검토자의 시간을 모두 포함합니다. 백만 토큰 단가가 아니라 성공한 작업 하나의 비용으로 비교합니다.
7. 결론: Qwen3.8은 테스트할 가치가 있지만 첫날부터 전면 전환할 이유는 없습니다
기업 관점에서 중요한 변화는 네 가지입니다.
- Max급 오픈 웨이트가 선택지가 됐지만 2.4T 운영 난도는 여전히 높습니다.
- 단일 답변보다 장시간 Agent와 도구 실행이 중요한 평가 대상이 됐습니다.
- Max API와 오픈 체크포인트를 분리해서 평가해야 합니다.
- 대부분 기업에는 27B가 더 현실적인 자체 호스팅 시작점입니다.
권장 순서는 Max API로 능력 기준을 만든 뒤 27B로 프라이버시, 운영, 로컬 비용을 검증하는 것입니다. 실제 작업에서 27B가 부족하고 API가 거버넌스 요건을 충족하지 못할 때만 2.4T-A95B 클러스터를 검토하면 됩니다.
모델은 하루 만에 발표되지만 기업 시스템은 수년간 운영됩니다. Qwen3.8의 가치는 기존 모델을 즉시 모두 교체하는 데 있지 않고, 검증할 수 있는 유력한 선택지가 하나 더 생겼다는 데 있습니다.