Qwen

1,719 단어·4 분·원문(.md)

알리바바 클라우드의 모델이다. 중국의 통이첸원. 네 모델중 가장 넓은 라인업을 가지고 있다.

오픈웨이트 생태계에서 다운로드 수, 파인튜닝 파생 모델 수 1위다.

시기모델특징
2025.5Qwen3dense 0.6B~32B + MoE 30B-A3B, 235B-A22B. thinking/non-thinking 통합 + 사고 예산. 36T 토큰, 119개 언어, 전부 Apache 2.0
2025.9Qwen3-Next-80B-A3BGated DeltaNet 3:1 하이브리드 도입. Qwen3-32B 훈련 비용의 **9.3%**로 동등 이상 성능
2026.2.16Qwen3.5-397B-A17B하이브리드를 세대 전체로. 얼리퓨전 네이티브 멀티모달, 512 전문가, 201개 언어, 1M 컨텍스트. Qwen3-Max 대비 디코딩 처리량 19배
2026.2~33.5 소형 물결122B-A10B, 35B-A3B, 27B, 9B, 4B, 2B, 0.8B
2026.4Qwen3.635B-A3B(4/16), 27B dense(4/22)
2026.5~83.7-Max, 3.8-Max클로즈드 전환. 3.8 오픈 릴리스는 예고 상태

모든 사람이 모든 크기로 모든 언어로 쓸수 있게하자는 설계철학을 갖고있다.

  • 사이즈 스펙트럼: 0.8B(휴대폰)부터 397B(데이터센터)까지 같은 세대에 제공하낟. 다른 모델은 플래그십 하나에 집중하지만, Qwen은 전 구간을 채운다.
  • 라이센스 개방: 오픈 모델은 대부분 Apache 2.0으로 가장 관대하다.
  • 다국어: Qwen3에서 119개 언어, Qwen3.5에서 201개의 언어와 방언으로 확대했다. 지역별 문화 및 뉘앙스까지 목표로 삼는다.

구현 기법 #

Qwen3 세대 (전통적 트랜스포머 방식)

  • GQA, SwiGLU, RoPE, RMSNorm + Pre-Norm
  • Qwen2의 QKV 편향을 제거하고 QK-Norm 도입 (학습 안정화)
  • MoEsms 128 전문가, 그중 8개를 활성화, 공유 전문가는 없고 전역 배치 로드밸런싱 손실로 전문화를 유도했다.
  • thinking / non-thinking 통합 프레임워크 + 사고 예산

Qwen3.5/3.6세대 (하이브리드)

  • Gated DeltaNet3: Gated Attetnion 1 배치로 층의 75%가 선형 어텐션
  • 예: Qwen3.6-35B-A3B는 40층 = (GDN x 3 + Gated Attention x 1) x 10
  • Gated Attetnion: 쿼리 헤드 16 KV헤드 2, 헤드 차원 256, RoPE 차원 64
  • MoE: 256중 8라우팅 + 1 공유
  • MTP 다단계 학습 -> 투기적 디코딩
  • 얼리퓨전 멀티모달: 별도 VL 어댑터를 붙이는 대신에 처음부터 텍스트 이미지 비디오 토큰을 함께 학습함
  • 네이티브 262K 컨텍스트, YaRN으로 약 1M까지 확장
  • 백만 에이전트 환경 규모의 RL

강점 #

  1. 강점 1: 로컬 실행에서 좋다. Qwen3.6-27B는 dense 모델이고 4비트 양자화시 약 17GB이다. RTX 4090이나 3090 한 장에 들어간다. 그런데 성능은 Qwen3.5의 397B 플래그십을 코딩 벤치마크에서 앞선다.(SWE-bench Verified 77.2 vs 76.2, Terminal-Bench 2.0 59.3 vs 52.5).

왜 그러냐면 dense27B는 MoE와 달리 모든 파라미터가 매번 켜져서다. 배치1(개인사용환경) 에서는 MoE의 이점이 적고 오히려 층 파라미터를 메모리에 다 올려야하는 부담만 남는다 + 상위 모데로부터의 strong-to-weak 증류로 작은 모델이 큰 모델의 능력을 물려받는다 + 하이브리드 어텐션덕에 작은 모델도 256K 컨텍스트를 감당한다 = 단일 GPU 최강 코더라는 자리를 만들었다

  1. 강점 2: 다국어 특히 CJK, 한국어 - 일본어 - 중국어 처리에서 서구 모델 대비 뚜렷한 우위가 오래 유지되어 왔다. 201개의 언어 확장으로 저자원 언어까지 넓혔고 한국 사용자에게 실질적 의미가 크다.

  2. 강점 3: 생태계 두께, 다운로드가 많다는 것은 곧 문제가 생겼을때 먼저 겪은 사람이 있다는 뜻이고, GGUF 변환본, 파인튜닝 레시피및 Ollama/LM Studio 지원, 양자화 프리셋이 가장 먼저 가장 많이 나온다. 실무에서는 이 지루한 장점이 벤치마크 2점보다 클때가 많았다.

  3. 훈련 효율: Qwen3-Next는 Qwen3-32B 컴퓨트의 9.3%로 동등 이상 성능을 냈다. 10만 달러가 9300달러가 되는셈 하이브리드 아키텍처의 위력이다.

  4. 강점 5: 네이티브 멀티모달. 얼리퓨전이라 별도 VL 모델없이 이미지 비디오를 직접 이해해야한다.

약점과 주의점 #

  • 최상위 모델이 클로즈드로 갔다: Qwen3.7-Max, Qwen3.8-Max는 api 전용이고 오픈이라는 인식으로 최상위 성능을 기대하면 안된다 2026년 8월에는 현재 다운 가능한 범용모델은 3.6-27B이며 3.8 오픈 릴리즈가 예고된 상태긴하다.
  • 하이브리드 검색의 한계: 선형 어텐션 비중이 75%라는 것은 아주 정밀한 장거리 검색에서 이론적 약점이 있다. 전체 어텐션 층으로 보완하지만 완전하지는 않다.
  • 버전이 너무 빨라 인지부하 큼: 3 3.5 3.6 3.7 3.8이 1년반안에 다 나온거라 어떤 세대를 표준으로 삼을지 힘들다.
  • 플래그십은 멀티모달 오버헤드 때문에 순수 텍스트모델보다 요청당 계산 비용이 높다.

언제 쓰나 #

O:
로컬 온프레미스로 돌려야할때 1순위고 한국어를 비롯한 다국어 작업이나 파인튜닝해서 사내 전용 모델을 만들 때

엣지 모바일등 아주 작은 모델이 필요할 때 이미지 비디오 이해가 함께 필요할때

apache 2.0의 관대한 라이선스가 필요할때 등이 있다.

X: 오픈 가중치로 절대 성능 최상단을 원할 때 100만급 토큰급 초 장문 에이전트 워크로드 GLM/Kimi가 더 적합하다.

AI/ow/qwen.md