「Qwen3.8-Flash-Next」がオープンモデルとして公開される、Qwen4の次世代アーキテクチャを使用

AlibabaのAI研究チームであるQwenがAIモデル「Qwen3.8-Flash-Next」を2026年8月26日に公開しました。Qwen3.8-Flash-NextはQwen4シリーズで採用される予定の次世代アーキテクチャを用いて開発されており、学習コストを抑えつつ高性能なモデルを構築することに成功しています。また、すでにUnslothによる量子化版モデルも公開されています。
Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency
https://qwen.ai/blog?id=qwen3.8-flash-next
⚡Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight!
— Qwen (@Alibaba_Qwen) August 26, 2026
The production version Qwen3.8-Flash will be available soon via QwenCloud API at just $ 0.16/1M input tokens and $ 0.47/1M output tokens.
125B parameters + 51B N-gram… pic.twitter.com/SScnmzWS7O
Qwen3.8-Flash-Nextは履歴の効率的な圧縮が可能な「Gated DeltaNet(GDN)」やアテンション処理のコストを大幅に削減する「Qwen Sparse Attention(QSA)」を取り入れたハイブリッドアーキテクチャを採用しています。また、モデルの表現可能な語彙をわずかな追加計算で拡張できる「N-gram Embedding」も組み込んでいます。総パラメーター数は1250億、アクティブパラメーター数は60億で、N-gram Embeddingのパラメーター数は510億です。標準状態で26万2144トークンのコンテキスト長に対応し、コンテキスト長を拡張する「YaRN」によって最大100万トークンまで対応できます。

「Qwen3.8-Flash-Next」「Qwen3.8-27B」「Qwen3.7-Plus」「DeepSeek-V4-Flash-0731」「Claude-Opus-4.8(Max)」の各種ベンチマーク結果が以下。Qwen3.8-Flash-Nextは多くのテストでClaude-Opus-4.8(Max)を上回っています。なお、Qwen3.8-Flash-Nextのトレーニングに必要な期間はQwen3.8-27Bの9分の1とのこと。

Qwen3.8-Flash-Nextは長大なトークンを処理する際のプリフィルとデコード双方のスループット低下を抑えられているのも特徴です。以下のグラフはQwen3.7-Plusを基準としてコンテキスト長ごとのプリフィルの速度差を示したもの。100万トークンを処理する場合、Qwen3.8-Flash-NextはQwen3.7-Plusの8.6倍高速です。

Qwen3.8-Flash-NextはオープンモデルとしてHugging FaceとModelScopeで公開されています。
Qwen/Qwen3.8-Flash-Next · Hugging Face
https://huggingface.co/Qwen/Qwen3.8-Flash-Next

千问3.8-Flash-Next · 模型库
https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next

また、Unslothによる量子化版も発表と同日に公開されています。1bit版は75GB以上のRAMを搭載したマシンで実行可能で、フルモデルの80%の精度を維持しているとのこと。Unslothのドキュメントでは「RAMに読み込んで実行する場合でも、VRAMに読み込んだ際と同等の性能を実現可能」とアピールされています。
unsloth/Qwen3.8-Flash-Next-GGUF · Hugging Face
https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF

・関連記事
謎の高性能AI「Ox Alpha」の正体は「GLM-5.3-Flash」だったことが判明、Claude Opus 4.8と同等性能のオープンモデル&中国製チップで運用可能 - GIGAZINE
ローカルで動く中国製オープンモデル「Qwen3.8 27B」はGPT-5.6 Terra超えのエージェント性能で同等規模のモデルより圧倒的に高性能という分析結果 - GIGAZINE
アリババのAI「Qwen」が6カ月間に30億回ダウンロードされる世界1位のAIモデルに - GIGAZINE
音声クローンが可能な音声合成AI「Qwen-Audio-3.0-TTS」が登場、日本語対応でGemini超えの性能 - GIGAZINE
画像生成AI「Qwen-Image-3.0」が登場したので使ってみた、イラストや日本語テキストの描画性能はいかに - GIGAZINE
・関連コンテンツ
in AI, Posted by log1o_hf
You can read the machine translated English article 'Qwen3.8-Flash-Next' is released as an o….







