중국 AI 경쟁이 갈수록 뜨거워지고 있습니다. 이번엔 알리바바가 조용히, 그러나 꽤 묵직한 한 방을 날렸습니다.
2026년 8월 26일 밤, 알리바바의 AI 언어모델 브랜드인 통이 Qwen(千问) 팀이 새로운 모델 Qwen3.8-Flash를 공식 발표하면서 동시에 차세대 아키텍처 기반의 Qwen3.8-Flash-Next의 오픈소스 가중치(모델 내부 학습 데이터)까지 공개했습니다. 단순한 업그레이드가 아니라, 다음 세대인 Qwen4 시리즈의 설계 방향을 미리 보여주는 ‘청사진 공개’라는 점에서 업계의 주목을 받고 있습니다.
훈련 비용은 전작의 9분의 1 수준이라는데, 과연 어떤 모델인지 하나씩 살펴보겠습니다.

Qwen3.8-Flash, 어떤 모델인가?
먼저 이름부터 풀어보겠습니다. Qwen3.8-Flash는 알리바바의 AI 연구 브랜드 ‘통이(通义)’가 개발한 대규모 언어 모델(LLM)입니다. 정식 명칭인 ‘통의천문’에서 천문에 해당하는 QianWen을 줄여서 Qwen이라고 부르고 있습니다.
여기서 ‘Flash’는 빠르고 효율적이라는 의미를 담고 있고, ‘Next’가 붙은 버전은 다음 세대 아키텍처를 미리 적용한 실험적 모델이라고 보면 됩니다.
이 모델의 가장 큰 특징은 MoE(Mixture of Experts, 전문가 혼합) 구조를 채택했다는 점입니다. MoE는 쉽게 말해, 모델 전체를 한꺼번에 다 쓰는 게 아니라 필요한 부분만 골라서 쓰는 방식입니다. 마치 회사에서 모든 직원이 동시에 일하는 게 아니라, 해당 업무에 맞는 전문가만 투입하는 것과 비슷하죠.
덕분에 전체 파라미터(모델의 학습 변수 수)는 125B(1,250억 개)에 달하지만, 실제로 한 번에 작동하는 파라미터는 6B(60억 개)에 불과합니다. 여기에 추가로 51B 규모의 N-gram Embedding이라는 보조 구조도 탑재되어 있습니다.
또 하나 눈에 띄는 스펙은 컨텍스트 길이입니다. 기본적으로 262,144 토큰(약 20만 단어 분량)을 처리할 수 있고, YaRN이라는 기술을 통해 최대 100만 토큰(1M tokens)까지 확장이 가능합니다. 100만 토큰이면 소설 한 권 분량을 통째로 집어넣고 대화할 수 있는 수준입니다. 이 정도면 단순한 챗봇이 아니라 방대한 문서를 분석하는 업무용 AI로도 충분히 활용 가능한 스펙입니다.
Qwen3.8-Flash의 4가지 핵심 업그레이드
Qwen3.8-Flash는 크게 네 가지 방향에서 구조적인 개선이 이루어졌습니다. 기술 용어가 낯설 수 있으니 최대한 쉽게 풀어보겠습니다.
① Attention(어텐션) : 긴 문장도 빠르게 처리
AI 모델이 긴 글을 읽을 때 가장 힘든 부분이 바로 ‘어디에 집중해야 하는가’를 판단하는 것입니다. 이를 담당하는 게 Attention 메커니즘인데, Qwen3.8-Flash는 여기에 GDN(Gated DeltaNet)과 QSA(Qwen Sparse Attention)를 혼합한 새로운 구조를 도입했습니다.
GDN은 과거 정보를 효율적으로 압축하고, QSA는 중요한 맥락만 골라내는 역할을 합니다. 그 결과, 100만 토큰의 초장문 처리 시 기존 대비 최대 7.6배(입력 단계), 4.9배(출력 단계)의 속도 향상을 달성했다고 합니다. 숫자만 봐도 꽤 인상적입니다.
② Residual(잔차 연결) : 정보 흐름을 4개 경로로 분산
AI 모델 내부에서 정보가 층층이 전달될 때 손실이 생기지 않도록 하는 구조가 Residual(잔차 연결)입니다. Qwen3.8-Flash는 여기에 Gated Residual(GR) 메커니즘을 도입해 정보 흐름을 4개의 병렬 경로로 나눠 처리합니다.
또한 잔차 상태를 FP8 형식으로 저장해 메모리 사용량을 크게 줄였습니다. FP8은 데이터를 더 작은 단위로 압축 저장하는 방식으로, 성능은 유지하면서 메모리 효율을 높이는 기술입니다.
③ Embedding(임베딩) : 51B짜리 보조 두뇌 탑재
N-gram Embedding은 주변 단어들의 패턴을 참고해 모델의 이해 능력을 확장하는 구조입니다.
51B라는 방대한 파라미터를 가지고 있지만, 이 부분은 GPU 메모리가 아닌 일반 시스템 메모리(Host Memory)에 올려두고 비동기 방식으로 불러오기 때문에 GPU 자원을 장기간 점유하지 않습니다.
즉, 성능은 챙기면서 비용은 아끼는 설계입니다.
④ Optimization(최적화): 새로운 학습 알고리즘 적용
학습 과정에서는 Muon Optimizer라는 새로운 최적화 알고리즘을 사용했습니다.
기존의 Adam 계열 옵티마이저와 달리, 행렬의 직교성을 유지하면서 학습하는 방식으로 더 안정적이고 효율적인 훈련이 가능하다고 알려져 있습니다. 이 새로운 아키텍처에 맞게 Scaling Law(스케일링 법칙)도 새로 설계했다고 합니다.
Scaling Law란 모델 크기와 데이터 양, 성능 간의 관계를 예측하는 공식인데, 새 구조에 맞게 이를 다시 정립했다는 것은 단순한 업그레이드가 아닌 근본적인 재설계에 가깝다는 의미입니다.
성능은 어느 정도? 벤치마크 결과 살펴보기
성능 지표도 눈여겨볼 만합니다. Qwen3.8-Flash-Next-Base는 총 14개의 주요 벤치마크(AI 성능 평가 시험) 중 8개에서 최고 성적을 기록했습니다. 특히 주목할 항목들은 다음과 같습니다.
| MMLU-Pro | 다양한 학문 분야의 전문 지식을 평가하는 시험 |
| SuperGPQA | 대학원 수준의 전문 지식 평가 |
| BBH(BIG-Bench Hard) | 복잡한 추론 능력 평가 |
| SWEBench-Pretrain | 소프트웨어 엔지니어링 능력 평가 |
| MGSM | 다국어 수학 문제 풀이 능력 |
| MMMU | 멀티모달(텍스트+이미지) 이해 능력 |
6B라는 비교적 작은 활성 파라미터 수를 감안하면 상당히 인상적인 결과입니다. 특히 이 모델은 텍스트만 처리하는 게 아니라 이미지도 함께 이해하는 멀티모달 MoE 모델이라는 점도 중요합니다. 텍스트와 이미지를 동시에 처리할 수 있다는 건 실제 업무 활용 범위가 그만큼 넓다는 뜻이니까요.
훈련 비용 1/9, 이게 왜 중요한가 하면,
이번 발표에서 가장 화제가 된 부분은 단연 훈련 비용입니다.
알리바바 측에 따르면, Qwen3.8-Flash의 훈련 비용은 전작인 Qwen3.7-Plus 대비 약 9분의 1 수준에 불과하다고 합니다. 그러면서도 코딩과 오피스 업무 처리 능력은 오히려 더 뛰어나다고 밝혔습니다.
AI 모델 훈련에는 엄청난 비용이 들어갑니다. 수천 개의 고성능 GPU를 수주에서 수개월간 돌려야 하기 때문에, 대형 모델 하나를 훈련하는 데 수백억 원이 드는 경우도 드물지 않습니다.
그런데 비슷하거나 더 나은 성능을 내면서 비용을 9분의 1로 줄였다는 건, 단순히 ‘저렴하다’는 의미를 넘어 AI 개발의 경제성 자체를 바꿀 수 있는 신호입니다. 더 많은 기업과 연구자들이 고성능 AI를 개발하고 활용할 수 있는 문턱이 낮아지는 것이죠.
중국 AI 기업들이 이처럼 비용 효율성을 빠르게 높여가고 있다는 건, 글로벌 AI 경쟁에서 자본력 만으로는 우위를 점하기 어려워지고 있다는 뜻이기도 합니다.
오픈소스 공개 및 API 가격 – 누구나 쓸 수 있다
알리바바는 Qwen3.8-Flash-Next의 모델 가중치를 2026년 8월 26일 밤 11시(베이징 시간)에 Hugging Face와 ModelScope 플랫폼을 통해 오픈소스로 공개했습니다. FP8 양자화(모델을 더 가볍게 압축한) 버전도 함께 배포되었습니다.
API 서비스 가격도 공개되었는데, 입력 100만 토큰당 1위안(약 190원), 출력 100만 토큰당 3위안(약 570원) 수준입니다. 중국 내 AI API 시장의 가격 경쟁이 워낙 치열하다 보니 이 정도 가격은 이미 업계 표준처럼 굳어지고 있는 분위기입니다. Qwen3.8-Flash는 곧 알리바바의 Qwen AI 플랫폼에도 정식 탑재될 예정입니다.
또한 Qwen3.8-Flash-Next는 기본적으로 100만 토큰 컨텍스트를 지원하며, 공식 도구들도 내장되어 있어 별도 설정 없이 바로 활용할 수 있습니다.
Qwen4의 예고편? 앞으로가 더 주목된다
이번 발표에서 또 하나 놓치면 안 되는 포인트가 있습니다.
알리바바 측은 Qwen3.8-Flash-Next의 아키텍처가 차세대 Qwen4 시리즈의 기반이 될 것이라고 명시했습니다. 즉, 이번 모델은 완성품이기도 하지만 동시에 다음 세대를 위한 기술 검증 무대이기도 한 셈입니다.
Qwen 시리즈는 지금까지 꾸준히 빠른 속도로 버전을 올려왔습니다. Qwen3.5, Qwen3.6, Qwen3.7을 거쳐 이제 Qwen3.8에 이르렀고, 그 다음은 Qwen4입니다. 각 버전마다 성능 향상과 함께 구조적인 혁신이 더해지고 있다는 점에서, 알리바바의 AI 개발 속도는 결코 무시할 수 없는 수준입니다.
중국 AI 모델들이 오픈소스로 공개되면서 전 세계 개발자들이 이를 기반으로 다양한 서비스를 만들어내고 있습니다. 알리바바의 Qwen 시리즈는 이미 글로벌 오픈소스 AI 커뮤니티에서 상당한 존재감을 갖고 있고, 이번 Qwen3.8-Flash 역시 그 흐름을 이어가고 있습니다.
중국 AI의 발전 속도를 단순히 ‘중국 내부 이야기’로 치부하기엔, 이미 그 영향력이 우리 일상 가까이까지 와 있다는 점을 기억할 필요가 있습니다.