Blog
QwenQwen 3.8Alibabaopen-weightLLMMoE

Qwen 3.8 프리뷰 — 2.4T 멀티모달, 아직 '공개되지 않은' 것들

Alibaba가 공개한 2.4조 파라미터 멀티모달 모델 Qwen 3.8(Max Preview)을 정리합니다. Kimi K3 공개 며칠 뒤 나온 이 발표에서 무엇이 알려졌고(2.4T sparse MoE·1M 컨텍스트·텍스트/이미지/비디오/문서 멀티모달) 무엇이 아직 비공개인지(활성 파라미터·라이선스·모델 카드·공식 벤치마크·가격), 그리고 발표를 어떻게 읽어야 하는지 다룹니다.

Data Dynamics2026年7月20日16 min read
This post is not yet translated. The original Korean version is shown below.

며칠 전 Kimi K3가 2.8조 오픈웨이트로 시장을 흔든 직후, Alibaba가 곧바로 Qwen 3.8을 꺼냈습니다. 2026년 7월 19일 X를 통해 공개된 2.4조(2.4T) 파라미터 멀티모달 모델로, Alibaba는 자체 평가에서 "Claude Fable 5 바로 아래"라고 주장합니다. 다만 이번 발표는 **정식 릴리스가 아니라 프리뷰(preview)**이고, 오픈웨이트는 "곧(soon)"이라고만 했을 뿐 날짜·라이선스·모델 카드·공식 벤치마크·가격이 아직 나오지 않았습니다. 그래서 이 글은 스펙 자랑보다 **"발표에서 무엇이 확인됐고 무엇이 아직 빈칸인지"**를 냉정하게 구분하는 데 초점을 둡니다.

이 글에서 배우는 것

  • Qwen 3.8 프리뷰에서 실제로 확인된 사양과 아직 비공개인 항목
  • Kimi K3와의 대비 — 같은 "오픈 트릴리언 MoE" 흐름에서의 위치
  • 발표된 벤치마크 주장을 어떻게 (조심스럽게) 읽을 것인가
  • 활성 파라미터 미공개가 자체 호스팅 판단을 왜 어렵게 만드는지
  • 지금 무엇을 하고 무엇을 기다려야 하는지

⚠️ 아래 내용은 2026년 7월 프리뷰 발표 및 초기 보도 기준입니다. 프리뷰 단계라 상당수 값이 미확정이며, 특히 벤치마크는 대부분 자체 주장이거나 소규모 커뮤니티 실측입니다. 도입 판단 전 반드시 공식 모델 카드·라이선스를 확인하세요. 오픈 모델 전반은 2026 AI 모델 현황을 참고하세요.

1. Qwen 3.8 프리뷰에서 확인된 것

먼저 발표에서 실제로 알려진 사양입니다.

  • 파라미터: 2.4조(2.4T), 희소(sparse) Mixture-of-Experts(MoE)
  • 멀티모달: 텍스트·이미지·비디오·문서를 다루는 네이티브 멀티모달
  • 컨텍스트: 1M 토큰급(Qwen Cloud 메타데이터 기준 약 983,616 토큰), 최대 출력 약 131,072(128K) 토큰
  • 변형: Qwen3.8-Max(현재 Qwen3.8-Max-Preview)
  • 개선 주장: 이전 세대 대비 코딩·풀스택 개발·데이터 분석·오피스 워크플로에서 향상
  • 접근: 프리뷰가 Token Plan·Qoder·QoderWork에서 이용 가능
  • 발표: 2026-07-19(X), 오픈웨이트는 "곧" 예고

2. 아직 '공개되지 않은' 것들

여기가 이 글의 핵심입니다. 프리뷰 발표라 비어 있는 칸이 많습니다. 이 빈칸들은 실무 도입 판단에 직접 영향을 줍니다.

항목상태왜 중요한가
활성 파라미터❌ 미공개sparse MoE에서 토큰당 실제 연산량·서빙 비용을 좌우하는 가장 중요한 수치
오픈웨이트 공개일❌ 미확정("곧")"오픈웨이트"라지만 아직 내려받을 수 없음
라이선스❌ 미공개상업적 사용·재배포 가능 여부가 결정되지 않음
모델 카드❌ 미공개학습·평가·안전성·한계에 대한 공식 문서 부재
공식 벤치마크 표❌ 미공개성능 주장을 검증할 근거가 없음
표준 per-token 가격❌ 미공개TCO 산정 불가

한 문장으로: "발표됐다 ≠ 쓸 수 있다." Qwen 3.8은 현재 프리뷰이며, "오픈웨이트"는 약속이지 아직 배포된 산출물이 아닙니다.

3. Kimi K3와의 대비

며칠 차이로 나온 두 발표는 성격이 다릅니다. 같은 "오픈 트릴리언 MoE" 흐름 안에서 위치를 비교하면 이렇습니다.

항목Qwen 3.8 (Max Preview)Kimi K3
파라미터(총)2.4T (sparse MoE)2.8T (MoE)
활성 파라미터미공개16 / 896 전문가(≈1.8%)
컨텍스트~984K(1M급)1M
멀티모달텍스트·이미지·비디오·문서텍스트·이미지(비주얼)
오픈웨이트"곧"(날짜 미정)가중치 공개 예정일 명시
벤치마크공식 표 없음(자체 주장)독립 평가 수치 존재
상태프리뷰정식 발표

핵심 차이는 **"검증 가능성"**입니다. Kimi K3는 독립 평가 수치와 가중치 공개 일정이 있는 반면, Qwen 3.8은 현재 대부분이 Alibaba의 주장입니다. 두 모델 모두 "오픈웨이트"를 표방하지만, 실제로 손에 쥘 수 있는 시점과 근거의 두께가 다릅니다.

4. 알려진 역량 — 어디에 강점을 주장하나

Alibaba가 강조하는 개선 영역은 개발·데이터·업무 자동화에 몰려 있습니다.

  • 코딩·풀스택 개발 — 이전 세대 대비 향상 주장. 에이전트형 개발 도구(Qoder 등)와 함께 노출.
  • 데이터 분석 — 표·문서를 함께 이해하는 멀티모달이 데이터 파이프라인 맥락과 맞닿음.
  • 오피스 워크플로 — 문서 처리·업무 자동화.
  • 비디오·문서 멀티모달 — Kimi K3(주로 이미지)보다 넓은 입력 모달리티를 주장하는 점이 차별점.

다만 이 모든 것은 현재 자체 주장이며, 독립 벤치마크로 확인된 바는 없습니다.

5. 벤치마크를 어떻게 볼 것인가

성능 이야기는 특히 조심해서 읽어야 합니다.

  • Alibaba 자체 평가: "Fable 5 바로 아래" 수준이라고 주장.
  • 커뮤니티 실측(KingBench 3 등): Qwen3.8-Max가 Opus 4.8·Kimi K3를 앞서고 Fable 5만 위라는 보고가 있으나, 공식 표가 아니라 소규모 유저 실측입니다.
  • 독립 3자 벤치마크: 현재 없음.

즉 지금 떠도는 순위표는 자체 주장 또는 표본이 작은 실측입니다. 프리뷰 단계의 성능 수치는 "가능성의 신호"로만 받아들이고, 도입 결정의 근거로 삼기엔 이릅니다.

⚠️ 벤치마크 리더보드 자체의 한계도 있습니다. 높은 점수가 곧 우리 워크로드에서의 실효 성능을 뜻하지는 않습니다. 자체 태스크로 직접 평가하는 것이 언제나 최선입니다.

6. 자체 호스팅 관점 — 왜 지금은 계산이 안 서나

2.4T라는 총 파라미터만 보면 Kimi K3 글에서 다룬 것과 같은 서빙 부담이 예상됩니다. 하지만 결정적 변수가 빠져 있습니다.

활성 파라미터가 공개되지 않아, 토큰당 실제 연산량(FLOPs)과 서빙 비용을 추정할 수 없습니다.

sparse MoE에서 총 파라미터는 메모리(VRAM) 부담을, 활성 파라미터는 연산 부담을 각각 결정합니다. Kimi K3는 "16/896 활성"이 공개돼 있어 "메모리는 크지만 토큰당 계산은 가볍다"는 계산이 가능했지만, Qwen 3.8은 그 절반이 빈칸입니다. 게다가 라이선스·가중치가 아직 없으니 애초에 자체 호스팅을 계획할 수도 없습니다. 가중치 VRAM 근사(FP16 1B당 ~2GB, 4비트 ~0.5GB)로 총량의 감은 잡되, 활성 파라미터·양자화 포맷이 공개되기 전까지는 구체적 서빙 설계를 미루는 편이 합리적입니다.

7. 정리 — 지금 무엇을 하고 무엇을 기다릴까

Qwen 3.8은 "오픈 트릴리언 MoE 경쟁이 주(週) 단위로 가열되고 있다"는 신호로서 의미가 큽니다. 하지만 프리뷰라는 성격을 감안하면 지금의 행동은 명확합니다.

상황지금 권장
당장 프로덕션에 도입아직 이르다 — 정식 릴리스·라이선스·벤치 대기
역량을 미리 가늠프리뷰(Token Plan/Qoder)로 자체 태스크 평가
오픈웨이트 자체 호스팅 검토활성 파라미터·라이선스·가중치 공개까지 보류
지금 안정적으로 오픈웨이트가 필요이미 가중치가 나온 Kimi K3 등 검토

결론: Qwen 3.8은 "지켜보되, 아직 배팅하지 않는다"가 맞는 단계입니다. 프리뷰로 감을 잡고, 정식 릴리스에서 라이선스·모델 카드·독립 벤치마크가 나오면 그때 판단하세요.

더 넓은 맥락은 2026 AI 모델 현황오픈소스 LLM 비교에서 이어서 보실 수 있습니다. 온프렘 LLM 도입을 검토 중이라면 문의하기로 연락 주세요.


용어집

본문에 나온 용어를 한자리에 정리했습니다. 더 넓은 AI 용어는 AI 용어집을 참고하세요.

용어
프런티어 모델(Frontier Model)그 시점에 가장 앞선 최고 성능 모델군(예: Claude Fable 5·Opus, GPT). Qwen 3.8은 "프런티어 바로 아래"를 주장.
오픈웨이트(Open-Weight, 오픈메이트)학습된 모델 가중치를 공개해 직접 내려받아 실행·서빙할 수 있는 형태. "오픈메이트"라고도 부른다. 단, Qwen 3.8처럼 "곧 공개" 약속만 있고 아직 배포 전인 경우 실제로는 손에 쥘 수 없다.
프리뷰(Preview)정식 릴리스 전, 일부 채널에 먼저 공개하는 미완 단계. 라이선스·모델 카드·최종 벤치마크가 아직 없을 수 있다.
MoE(Mixture-of-Experts, 전문가 혼합)모델을 여러 전문가 서브네트워크로 나누고 토큰마다 일부만 켜는 구조. 총 파라미터는 크지만 토큰당 연산은 활성분만 발생.
희소 MoE(Sparse MoE)전체 전문가 중 극히 일부만 활성화하는 MoE. Qwen 3.8이 이 방식이나 활성 비율은 미공개.
활성 파라미터(Active Parameters)한 토큰을 처리할 때 실제 계산에 참여하는 파라미터. 연산량(FLOPs)·서빙 비용의 기준. Qwen 3.8은 이 값을 공개하지 않았다.
멀티모달(Multimodal)텍스트뿐 아니라 이미지·비디오·문서 등 여러 형식을 함께 입력·이해하는 능력. Qwen 3.8은 네이티브 멀티모달을 주장.
컨텍스트 윈도우(Context Window)모델이 한 번에 참고할 수 있는 최대 토큰 길이. Qwen 3.8은 약 984K(1M급).
최대 출력(Max Output)한 응답에서 생성 가능한 최대 토큰 수. Qwen 3.8은 약 128K.
모델 카드(Model Card)학습 데이터·평가·안전성·한계·라이선스를 정리한 공식 문서. 프리뷰 단계에선 없을 수 있다.
라이선스(License)모델의 상업적 사용·재배포·수정 허용 범위를 규정하는 법적 조건. 미공개면 실사용 가능 여부가 불확실.
벤치마크(Benchmark)표준 과제로 모델 성능을 측정한 점수. 자체 주장·커뮤니티 실측·독립 3자 검증은 신뢰도가 다르며, 높은 점수가 곧 우리 워크로드 성능은 아니다.
양자화(Quantization)가중치 정밀도를 낮춰(FP16→8·4비트) 메모리·연산을 줄이는 기법. 큰 모델을 현실적인 VRAM에 올리는 핵심 수단.
VRAMGPU 메모리. 가중치+KV 캐시+활성값을 모두 담아야 하며, 트릴리언급 모델 서빙의 1차 병목.
FLOPs부동소수점 연산량. 추론 비용·속도의 근사 지표로, MoE에서는 활성 파라미터가 기준.
TCO(총소유비용)도입·운영에 드는 총비용(GPU·전력·운영 인력 등 포함). 가격·활성 파라미터가 없으면 산정 불가.