Qwen 3.8 프리뷰 — 2.4T 멀티모달, 아직 '공개되지 않은' 것들
Alibaba가 공개한 2.4조 파라미터 멀티모달 모델 Qwen 3.8(Max Preview)을 정리합니다. Kimi K3 공개 며칠 뒤 나온 이 발표에서 무엇이 알려졌고(2.4T sparse MoE·1M 컨텍스트·텍스트/이미지/비디오/문서 멀티모달) 무엇이 아직 비공개인지(활성 파라미터·라이선스·모델 카드·공식 벤치마크·가격), 그리고 발표를 어떻게 읽어야 하는지 다룹니다.
며칠 전 Kimi K3가 2.8조 오픈웨이트로 시장을 흔든 직후, Alibaba가 곧바로 Qwen 3.8을 꺼냈습니다. 2026년 7월 19일 X를 통해 공개된 2.4조(2.4T) 파라미터 멀티모달 모델로, Alibaba는 자체 평가에서 "Claude Fable 5 바로 아래"라고 주장합니다. 다만 이번 발표는 **정식 릴리스가 아니라 프리뷰(preview)**이고, 오픈웨이트는 "곧(soon)"이라고만 했을 뿐 날짜·라이선스·모델 카드·공식 벤치마크·가격이 아직 나오지 않았습니다. 그래서 이 글은 스펙 자랑보다 **"발표에서 무엇이 확인됐고 무엇이 아직 빈칸인지"**를 냉정하게 구분하는 데 초점을 둡니다.
이 글에서 배우는 것
- Qwen 3.8 프리뷰에서 실제로 확인된 사양과 아직 비공개인 항목
- Kimi K3와의 대비 — 같은 "오픈 트릴리언 MoE" 흐름에서의 위치
- 발표된 벤치마크 주장을 어떻게 (조심스럽게) 읽을 것인가
- 활성 파라미터 미공개가 자체 호스팅 판단을 왜 어렵게 만드는지
- 지금 무엇을 하고 무엇을 기다려야 하는지
⚠️ 아래 내용은 2026년 7월 프리뷰 발표 및 초기 보도 기준입니다. 프리뷰 단계라 상당수 값이 미확정이며, 특히 벤치마크는 대부분 자체 주장이거나 소규모 커뮤니티 실측입니다. 도입 판단 전 반드시 공식 모델 카드·라이선스를 확인하세요. 오픈 모델 전반은 2026 AI 모델 현황을 참고하세요.
1. Qwen 3.8 프리뷰에서 확인된 것
먼저 발표에서 실제로 알려진 사양입니다.
- 파라미터: 2.4조(2.4T), 희소(sparse) Mixture-of-Experts(MoE)
- 멀티모달: 텍스트·이미지·비디오·문서를 다루는 네이티브 멀티모달
- 컨텍스트: 1M 토큰급(Qwen Cloud 메타데이터 기준 약 983,616 토큰), 최대 출력 약 131,072(128K) 토큰
- 변형: Qwen3.8-Max(현재
Qwen3.8-Max-Preview) - 개선 주장: 이전 세대 대비 코딩·풀스택 개발·데이터 분석·오피스 워크플로에서 향상
- 접근: 프리뷰가 Token Plan·Qoder·QoderWork에서 이용 가능
- 발표: 2026-07-19(X), 오픈웨이트는 "곧" 예고
2. 아직 '공개되지 않은' 것들
여기가 이 글의 핵심입니다. 프리뷰 발표라 비어 있는 칸이 많습니다. 이 빈칸들은 실무 도입 판단에 직접 영향을 줍니다.
| 항목 | 상태 | 왜 중요한가 |
|---|---|---|
| 활성 파라미터 | ❌ 미공개 | sparse MoE에서 토큰당 실제 연산량·서빙 비용을 좌우하는 가장 중요한 수치 |
| 오픈웨이트 공개일 | ❌ 미확정("곧") | "오픈웨이트"라지만 아직 내려받을 수 없음 |
| 라이선스 | ❌ 미공개 | 상업적 사용·재배포 가능 여부가 결정되지 않음 |
| 모델 카드 | ❌ 미공개 | 학습·평가·안전성·한계에 대한 공식 문서 부재 |
| 공식 벤치마크 표 | ❌ 미공개 | 성능 주장을 검증할 근거가 없음 |
| 표준 per-token 가격 | ❌ 미공개 | TCO 산정 불가 |
한 문장으로: "발표됐다 ≠ 쓸 수 있다." Qwen 3.8은 현재 프리뷰이며, "오픈웨이트"는 약속이지 아직 배포된 산출물이 아닙니다.
3. Kimi K3와의 대비
며칠 차이로 나온 두 발표는 성격이 다릅니다. 같은 "오픈 트릴리언 MoE" 흐름 안에서 위치를 비교하면 이렇습니다.
| 항목 | Qwen 3.8 (Max Preview) | Kimi K3 |
|---|---|---|
| 파라미터(총) | 2.4T (sparse MoE) | 2.8T (MoE) |
| 활성 파라미터 | 미공개 | 16 / 896 전문가(≈1.8%) |
| 컨텍스트 | ~984K(1M급) | 1M |
| 멀티모달 | 텍스트·이미지·비디오·문서 | 텍스트·이미지(비주얼) |
| 오픈웨이트 | "곧"(날짜 미정) | 가중치 공개 예정일 명시 |
| 벤치마크 | 공식 표 없음(자체 주장) | 독립 평가 수치 존재 |
| 상태 | 프리뷰 | 정식 발표 |
핵심 차이는 **"검증 가능성"**입니다. Kimi K3는 독립 평가 수치와 가중치 공개 일정이 있는 반면, Qwen 3.8은 현재 대부분이 Alibaba의 주장입니다. 두 모델 모두 "오픈웨이트"를 표방하지만, 실제로 손에 쥘 수 있는 시점과 근거의 두께가 다릅니다.
4. 알려진 역량 — 어디에 강점을 주장하나
Alibaba가 강조하는 개선 영역은 개발·데이터·업무 자동화에 몰려 있습니다.
- 코딩·풀스택 개발 — 이전 세대 대비 향상 주장. 에이전트형 개발 도구(Qoder 등)와 함께 노출.
- 데이터 분석 — 표·문서를 함께 이해하는 멀티모달이 데이터 파이프라인 맥락과 맞닿음.
- 오피스 워크플로 — 문서 처리·업무 자동화.
- 비디오·문서 멀티모달 — Kimi K3(주로 이미지)보다 넓은 입력 모달리티를 주장하는 점이 차별점.
다만 이 모든 것은 현재 자체 주장이며, 독립 벤치마크로 확인된 바는 없습니다.
5. 벤치마크를 어떻게 볼 것인가
성능 이야기는 특히 조심해서 읽어야 합니다.
- Alibaba 자체 평가: "Fable 5 바로 아래" 수준이라고 주장.
- 커뮤니티 실측(KingBench 3 등): Qwen3.8-Max가 Opus 4.8·Kimi K3를 앞서고 Fable 5만 위라는 보고가 있으나, 공식 표가 아니라 소규모 유저 실측입니다.
- 독립 3자 벤치마크: 현재 없음.
즉 지금 떠도는 순위표는 자체 주장 또는 표본이 작은 실측입니다. 프리뷰 단계의 성능 수치는 "가능성의 신호"로만 받아들이고, 도입 결정의 근거로 삼기엔 이릅니다.
⚠️ 벤치마크 리더보드 자체의 한계도 있습니다. 높은 점수가 곧 우리 워크로드에서의 실효 성능을 뜻하지는 않습니다. 자체 태스크로 직접 평가하는 것이 언제나 최선입니다.
6. 자체 호스팅 관점 — 왜 지금은 계산이 안 서나
2.4T라는 총 파라미터만 보면 Kimi K3 글에서 다룬 것과 같은 서빙 부담이 예상됩니다. 하지만 결정적 변수가 빠져 있습니다.
활성 파라미터가 공개되지 않아, 토큰당 실제 연산량(FLOPs)과 서빙 비용을 추정할 수 없습니다.
sparse MoE에서 총 파라미터는 메모리(VRAM) 부담을, 활성 파라미터는 연산 부담을 각각 결정합니다. Kimi K3는 "16/896 활성"이 공개돼 있어 "메모리는 크지만 토큰당 계산은 가볍다"는 계산이 가능했지만, Qwen 3.8은 그 절반이 빈칸입니다. 게다가 라이선스·가중치가 아직 없으니 애초에 자체 호스팅을 계획할 수도 없습니다. 가중치 VRAM 근사(FP16 1B당 ~2GB, 4비트 ~0.5GB)로 총량의 감은 잡되, 활성 파라미터·양자화 포맷이 공개되기 전까지는 구체적 서빙 설계를 미루는 편이 합리적입니다.
7. 정리 — 지금 무엇을 하고 무엇을 기다릴까
Qwen 3.8은 "오픈 트릴리언 MoE 경쟁이 주(週) 단위로 가열되고 있다"는 신호로서 의미가 큽니다. 하지만 프리뷰라는 성격을 감안하면 지금의 행동은 명확합니다.
| 상황 | 지금 권장 |
|---|---|
| 당장 프로덕션에 도입 | 아직 이르다 — 정식 릴리스·라이선스·벤치 대기 |
| 역량을 미리 가늠 | 프리뷰(Token Plan/Qoder)로 자체 태스크 평가 |
| 오픈웨이트 자체 호스팅 검토 | 활성 파라미터·라이선스·가중치 공개까지 보류 |
| 지금 안정적으로 오픈웨이트가 필요 | 이미 가중치가 나온 Kimi K3 등 검토 |
결론: Qwen 3.8은 "지켜보되, 아직 배팅하지 않는다"가 맞는 단계입니다. 프리뷰로 감을 잡고, 정식 릴리스에서 라이선스·모델 카드·독립 벤치마크가 나오면 그때 판단하세요.
더 넓은 맥락은 2026 AI 모델 현황과 오픈소스 LLM 비교에서 이어서 보실 수 있습니다. 온프렘 LLM 도입을 검토 중이라면 문의하기로 연락 주세요.
용어집
본문에 나온 용어를 한자리에 정리했습니다. 더 넓은 AI 용어는 AI 용어집을 참고하세요.
| 용어 | 뜻 |
|---|---|
| 프런티어 모델(Frontier Model) | 그 시점에 가장 앞선 최고 성능 모델군(예: Claude Fable 5·Opus, GPT). Qwen 3.8은 "프런티어 바로 아래"를 주장. |
| 오픈웨이트(Open-Weight, 오픈메이트) | 학습된 모델 가중치를 공개해 직접 내려받아 실행·서빙할 수 있는 형태. "오픈메이트"라고도 부른다. 단, Qwen 3.8처럼 "곧 공개" 약속만 있고 아직 배포 전인 경우 실제로는 손에 쥘 수 없다. |
| 프리뷰(Preview) | 정식 릴리스 전, 일부 채널에 먼저 공개하는 미완 단계. 라이선스·모델 카드·최종 벤치마크가 아직 없을 수 있다. |
| MoE(Mixture-of-Experts, 전문가 혼합) | 모델을 여러 전문가 서브네트워크로 나누고 토큰마다 일부만 켜는 구조. 총 파라미터는 크지만 토큰당 연산은 활성분만 발생. |
| 희소 MoE(Sparse MoE) | 전체 전문가 중 극히 일부만 활성화하는 MoE. Qwen 3.8이 이 방식이나 활성 비율은 미공개. |
| 활성 파라미터(Active Parameters) | 한 토큰을 처리할 때 실제 계산에 참여하는 파라미터. 연산량(FLOPs)·서빙 비용의 기준. Qwen 3.8은 이 값을 공개하지 않았다. |
| 멀티모달(Multimodal) | 텍스트뿐 아니라 이미지·비디오·문서 등 여러 형식을 함께 입력·이해하는 능력. Qwen 3.8은 네이티브 멀티모달을 주장. |
| 컨텍스트 윈도우(Context Window) | 모델이 한 번에 참고할 수 있는 최대 토큰 길이. Qwen 3.8은 약 984K(1M급). |
| 최대 출력(Max Output) | 한 응답에서 생성 가능한 최대 토큰 수. Qwen 3.8은 약 128K. |
| 모델 카드(Model Card) | 학습 데이터·평가·안전성·한계·라이선스를 정리한 공식 문서. 프리뷰 단계에선 없을 수 있다. |
| 라이선스(License) | 모델의 상업적 사용·재배포·수정 허용 범위를 규정하는 법적 조건. 미공개면 실사용 가능 여부가 불확실. |
| 벤치마크(Benchmark) | 표준 과제로 모델 성능을 측정한 점수. 자체 주장·커뮤니티 실측·독립 3자 검증은 신뢰도가 다르며, 높은 점수가 곧 우리 워크로드 성능은 아니다. |
| 양자화(Quantization) | 가중치 정밀도를 낮춰(FP16→8·4비트) 메모리·연산을 줄이는 기법. 큰 모델을 현실적인 VRAM에 올리는 핵심 수단. |
| VRAM | GPU 메모리. 가중치+KV 캐시+활성값을 모두 담아야 하며, 트릴리언급 모델 서빙의 1차 병목. |
| FLOPs | 부동소수점 연산량. 추론 비용·속도의 근사 지표로, MoE에서는 활성 파라미터가 기준. |
| TCO(총소유비용) | 도입·운영에 드는 총비용(GPU·전력·운영 인력 등 포함). 가격·활성 파라미터가 없으면 산정 불가. |