
Qwen 3.8-Flash 全网最全对比:Flash-Next、DeepSeek V4 Flash 怎么选?
Qwen 3.8-Flash 是官方生产版(1M 上下文、API 输入 1 元/百万 Token);Flash-Next 是 125B 开源预览版,每 token 仅激活 6B。本文含官方基准数据、Reddit/NVIDIA/HuggingFace 一手社区反馈与本地部署显存估算。
结论先说:Qwen 3.8-Flash 是官方生产版本,默认 100 万 Token 上下文、内置官方工具,API 价格为输入 1 元/百万 Token、输出 3 元/百万 Token;Qwen3.8-Flash-Next 是开放权重的架构预览版,125B 主参数 + 51B N-gram 嵌入,每 Token 仅激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9。要在线上跑长上下文和 Agent,选 Qwen 3.8-Flash;要本地研究下一代 Qwen4 架构,选 Flash-Next(4-bit 量化约需 82GB 显存+内存)。
2026年9月1日更新:本文对比数据已按 Qwen 官方模型卡与社区实测复核(2026 年 8 月版),并新增了常见问题解答。
本文信息核验时间为 2026 年 8 月 26 日,内容来自 Qwen 官方博客、Hugging Face 模型卡、技术报告,以及 Reddit r/LocalLLaMA、NVIDIA 开发者论坛、Hugging Face 讨论区的一手用户反馈,由 AI345 AI 指南编辑部整理。
Qwen 3.8-Flash 是什么?先分清三个版本
很多人搜“Qwen 3.8 Flash”时,其实混淆了两个不同的东西:官方生产版和开源预览版。先看这张对照表:
| 名称 | 定位 | 参数规模 | 获取方式 | 上下文 |
|---|---|---|---|---|
| Qwen 3.8-Flash | 官方生产版本 | 未公开 | 千问 AI 平台 API | 默认 1M |
| Qwen3.8-Flash-Next | 开源权重预览版 | 125B+51B N-gram(激活 6B) | Hugging Face / ModelScope | 原生 262K,YaRN 扩至 1M |
| Qwen3.8-Max | Qwen 家族最强模型 | 未公开 | Qwen 平台 | — |
| Qwen3.8-27B | 开源稠密模型 | 27B(全激活) | Hugging Face / ModelScope | — |
| DeepSeek V4 Flash | 对比对象 | 284B(激活 13B) | DeepSeek API | — |
官方博客原话是:Qwen3.8-Flash-Next 是“Qwen4 所用模型结构的先导预览”,角色相当于当年 Qwen3-Next 之于 Qwen3.5——先放出一个架构实验版让社区练手,完整的 Qwen4 家族随后就到。而生产版 Qwen3.8-Flash 以“默认 1M 上下文 + 官方内置工具”的形态在千问 AI 平台提供服务,API 即将上线。

图:Hugging Face 上的 Qwen3.8-Flash-Next 模型卡。截至 2026 年 8 月 26 日已获 3.2k 点赞,许可证为 qwen-community-1.0。
Qwen 3.8-Flash 基准实测:官方数据全表
以下是 Qwen 官方博客公布的 Qwen3.8-Flash-Next 成绩(生产版 Flash 基于同一架构):
| 基准(能力) | Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash |
|---|---|---|---|---|
| DeepSWE 1.1(Agentic 编程) | 58.7 | 42.2 | 16.5 | 54.4 |
| SWE-bench Pro(Agentic 编程) | 62.5 | 61.7 | 55.8 | 56.0 |
| SWE-bench Multilingual(多语言工程) | 81.0 | 73.8 | 75.8 | — |
| NL2Repo-Bench(仓库级生成) | 48.1 | 42.3 | 41.1 | 54.2 |
| CoWorkBench(长周期办公) | 73.9 | 70.7 | 65.1 | 45.1 |
| JobBench(职业任务) | 55.7 | 33.4 | 27.6 | 41.3 |
| Agents Last Exam(前沿 Agent) | 24.3 | 20.4 | 13.2 | 25.2 |
| Toolathlon(真实工具调用) | 73.5 | 67.1 | 50.6 | 70.3 |
| GPQA Diamond(科学推理) | 91.7 | 89.2 | 90.3 | 90.8 |
| LiveCodeBench v6(竞赛编程) | 91.9 | 90.3 | 89.6 | 90.6 |
三个值得注意的细节:
- 不是全盘碾压。仓库级代码生成(NL2Repo-Bench)上 DeepSeek V4 Flash 拿 54.2 分,反超 Flash-Next 的 48.1;Agents Last Exam 的 Pass@1 也是 DeepSeek 略高(25.2 vs 24.3)。如果你的场景是大型仓库理解和前沿 Agent 任务,别只看 Qwen 的宣传图。
- 编程和办公场景优势明显。DeepSWE 1.1 领先 4.3 分、CoWorkBench 领先 28.8 分、JobBench 领先 14.4 分,这与官方“编码和办公任务更强”的定位一致。
- 对 397B 的 Qwen3.7-Plus 是降维打击。训练成本仅 1/9,Agentic 编程分数却从 16.5 拉到 58.7。

图:Qwen 官方博客公布的模型表现对比表,涵盖纯文本与多模态基准。
Qwen 3.8-Flash 架构解读:为什么每 Token 只激活 6B
Flash-Next 的参数构成是“125B 主模型 + 51B N-gram 嵌入 + 每 Token 激活 6B”。三块架构升级撑起了这个数字:
- GDN + QSA 混合注意力:每四层中三层用 Gated DeltaNet 把历史信息压缩进固定状态(高效“记住”),一层用 Qwen Sparse Attention 在 micro-block 粒度筛选重要上下文(精准“查找”)。官方数据:在 1M Token 上,QSA 的注意力内核 Prefill 阶段最高加速 7.6 倍,Decode 阶段最高 4.9 倍。
- Gated Residual:残差流从 1 条扩成 4 条分支,由动态 Gate 控制读写,NVIDIA 论坛用户 Digital_David 形容这是“给模型 4 条信息通道而不是 1 条”。
- N-gram Embedding:51B 参数的查表不进 GPU 显存,可以卸载到主机内存,还能用异步预取和计算重叠——这是它能塞进消费级设备的关键。
- Muon 优化器:按参数类别分工使用 Muon 与 AdamW,并针对新架构重新拟合了 Scaling Law。

图:Qwen 官方发布的 Qwen3.8-Flash-Next 架构示意图(来自官方博客)。
社区真实反馈:Reddit、Hugging Face、NVIDIA 论坛怎么说
发布 24 小时内,这个模型在三个社区都炸出了高质量讨论。以下是我们逐条读完后挑出的一手信息。
Reddit:4-bit 量化约 82GB,架构“对本地玩家意外友好”
r/LocalLLaMA 用户 pmv143 发帖估算:
“Qwen3.8-Flash-Next(约 125B-A6B + 51B n-gram)显存估算:理想 4-bit 量化约 82GB(58GB 主权重 + 24GB n-gram 表),真实世界量化大概率落在 80–90GB 区间。巨大的 n-gram 表访问稀疏,是系统内存卸载的绝佳候选。权重一旦放出,这套架构可能对本地部署意外友好。”

图:Reddit 用户 pmv143 对 Qwen3.8-Flash-Next 的 4-bit 量化显存估算。
另一条高赞讨论来自 AXYZE8,他提醒跑分要冷静:
“新模型见过有利于新基准的数据。往下翻会发现老基准如 SciCode 上 Qwen3.7-Plus 反而比 Qwen 3.8 27B 更好……基准有用,但要对比同期发布的模型。”
这条评论和 smithy_dll 的“Qwen 3.8 27B 在编程基准上比 Qwen 3.7 Plus 强很多”形成了有趣的互补——社区共识是:新基准领先明显,老任务需自测。
Hugging Face:满屏都在求 35B 小版本
模型卡讨论区最火的一条是 MaxDaddyLongs 的“35B-A3B or 35B-A5B”(33 个爱心、17 个叹气、15 个火苗),原文只有一句话:“Humanity needs this MoE model...”。跟帖里 KhronosAion 直说“180B 的模型跑不动”,uburrato 算了笔账:“拥有统一内存或 3090/4080 级显卡的人占 PC 用户比例很低”。
另一条讨论“Can see, can touch but can’t use”里,Dampfinchen 的判断更冷静:
“即便 q4 量化也需要 64GB 以上内存。大多数人的机器是 16-32GB 内存 + 4-8GB 显存。”
不过 ordisbold 指出了转机:“51B n-gram 嵌入活在 CPU 内存里,不在 VRAM,查查 PLE 卸载。”DogOnKeyboard 则建议等推理引擎跟进:“量化就是为此准备的,但可能还要再等几天让推理引擎兼容好。A6B 跑起来应该会非常快。”

图:Hugging Face 讨论区用户请求发布 35B 小参数版本的讨论。
NVIDIA 论坛:DGX Spark 用户已在等量化版
DGX Spark / GB10 板块的用户反应最热烈。Digital_David 发帖说“有big hope,未来一周量化微调后这可能成为终极 DGX 模型,等 INT4 上单台 Spark”。0rand 判断官方瞄准的正是“Mac 96-128GB、DGX Spark、Strix Halo 128GB”这类统一内存设备。
目前社区已经在动手:unsloth 放出了 GGUF(1-bit 版本 72GB,是首个小于 100GB 的版本),Inferact 放出了 NVFP4 版本。但 coder543 提醒:
“模型几分钟前才发布,这是第一个用 Engrams 的正经模型……我怀疑软件还没完全准备好。这是 Qwen4 的预览。”

图:NVIDIA 开发者论坛上 DGX Spark 用户对 Qwen3.8-Flash-Next 部署前景的讨论。
Qwen3.8-Flash-Next 本地部署:硬件要求与步骤
综合官方模型卡与社区实测估算,本地跑 Flash-Next 的硬件门槛如下:
| 方案 | 显存/内存需求 | 适合设备 |
|---|---|---|
| BF16 全量 | 350GB+ | 服务器多卡 |
| 4-bit 量化 | 约 82GB(58GB 主权重+24GB n-gram 表) | Mac 96-128GB、DGX Spark、Strix Halo 128GB |
| 1-bit GGUF(unsloth) | 72GB | 同上 |
| NVFP4(Inferact) | 待社区验证 | DGX Spark |
部署路径(以官方模型卡为准):
- 生态选择:Transformers、vLLM、SGLang 均为 day-0 支持,SGLang 官方发帖确认是首发合作伙伴。
- vLLM 方式:
vllm serve "Qwen/Qwen3.8-Flash-Next",之后走 OpenAI 兼容接口。 - SGLang 方式:
python3 -m sglang.launch_server --model-path "Qwen/Qwen3.8-Flash-Next"。 - 量化优先:消费级设备直接用 unsloth 的 GGUF 或 Inferact 的 NVFP4 版本,别硬扛原始权重。
两个必须知道的坑:
- 引擎兼容还在跟进。coder543 提醒“软件还没完全准备好”,vLLM/SGLang 对 Engrams 的支持与懒加载优化仍在快速迭代,部署前先看官方仓库的 issue 区。
- 51B n-gram 表的位置。这 51B 参数默认在 CPU 内存不在显存,算显存时别漏,算内存时也别少算。
预算不够或想先试效果,可以走云端:官方 API(输入 1 元/百万 Token)或第三方托管。此前我们实测过通过 OpenRouter 调用各类模型的完整流程,见 OpenRouter 使用教程:注册、充值到 API 调用全流程。想在 Mac 上跑小一点的同门模型,参考 Qwen3.8-27B 本地部署指南:16G 内存 Mac 也能跑。
Qwen 3.8-Flash vs DeepSeek V4 Flash:按任务选
两个“Flash”不是同一种快。结合官方基准与社区反馈,我们的选型建议:
| 你的任务 | 推荐 | 理由 |
|---|---|---|
| Agentic 编程(Claude Code、多轮改代码) | Qwen 3.8-Flash | DeepSWE 58.7 vs 54.4,SWE-bench Pro 领先 |
| 长周期办公/职业任务 Agent | Qwen 3.8-Flash | CoWorkBench 领先近 29 分,差距最大的一项 |
| 大型仓库理解与生成 | DeepSeek V4 Flash | NL2Repo-Bench 54.2 vs 48.1 反超 |
| 中文长文档+1M 上下文 | Qwen 3.8-Flash | 默认 1M 上下文是硬指标 |
| 本地部署研究新架构 | Qwen3.8-Flash-Next | 开放权重 + n-gram 可卸载,社区生态已就位 |
一句话:偏编程 Agent 和办公 Agent 选 Qwen 3.8-Flash;偏仓库级代码理解和前沿 Agent 基准的场景,把 DeepSeek V4 Flash 一起拉进测试集。要做严谨的内部评测,可以按 AI Agent 评测怎么做?2026 指标、框架与基准全解 的方法搭一套自己的任务集。
Qwen 3.8-Flash 价格与免费额度说明
- 生产版 Qwen 3.8-Flash(API):官方博客公布价格为每百万 Token 输入 1 元、输出 3 元,API 上线时间以千问 AI 平台公告为准。
- 开源版 Qwen3.8-Flash-Next(权重):Hugging Face 与 ModelScope 免费下载,许可证为 qwen-community-1.0。注意:可下载不等于任意商用免费,商用前务必核对许可证条款。
- 隐性成本:本地部署要算显存/内存硬件成本(4-bit 约 82GB 门槛)与运维时间;云端按 Token 计费则要算缓存与长上下文的实际开销。
延伸阅读
Qwen 3.8-Flash 常见问题(FAQ)
Qwen 3.8-Flash 和 Qwen3.8-Flash-Next 是同一个模型吗?
不是。Flash-Next 是开放权重的架构预览版(125B 主参数 + 51B N-gram 嵌入,激活 6B),供本地部署和研究;Qwen 3.8-Flash 是基于同一架构的官方生产版本,默认 1M 上下文并内置官方工具,通过千问 AI 平台的 API 提供服务。
Qwen 3.8-Flash 是免费的吗?
分两头看。API 按官方定价收费(输入 1 元/百万 Token、输出 3 元/百万 Token);Flash-Next 权重免费下载但遵循 qwen-community-1.0 许可证,商用需核对条款。
Qwen 3.8-Flash 能本地部署吗?
生产版 Flash 目前通过云端 API 提供。想本地部署的是 Flash-Next:4-bit 量化约需 82GB 显存+内存,适合 Mac 96-128GB、DGX Spark、Strix Halo 128GB 这类统一内存设备;普通 16-32GB 内存的消费级 PC 目前跑不动,建议等更小的版本或走云端。
Qwen 3.8-Flash 和 DeepSeek V4 Flash 哪个更强?
看任务。Agentic 编程(DeepSWE 58.7 vs 54.4)和办公 Agent(CoWorkBench 73.9 vs 45.1)Qwen 明显领先;仓库级代码生成(NL2Repo 48.1 vs 54.2)和前沿 Agent 基准 Pass@1(24.3 vs 25.2)DeepSeek 反超。别信任何“全面碾压”的说法。
Qwen 3.8-Flash 支持多长上下文?
生产版默认 1M Token。开源版 Flash-Next 原生 262,144 Token,可通过 YaRN 技术扩展到 1,000,000 Token。
Qwen3.8-Flash-Next 适合做 AI Agent 吗?
架构上非常适合:Toolathlon 工具调用 73.5 分、Agents Last Exam Score 51.2 分,官方定位就是编码与办公 Agent。SGLang 也是 day-0 支持。但要注意 Reddit 用户对跑分的提醒——新模型在新基准上有数据优势,上线前用你自己的任务集验证。如果要把模型接进 Agent 工作流,先弄清 MCP 和 Skill 的区别:AI Agent 工作流该先用哪个。
Qwen 3.8-Flash 和 Flash-Next 有什么区别?
简单说:3.8-Flash 是官方生产版(1M 上下文、API 正式定价、稳定可商用),Flash-Next 是更激进的实验分支(新特性先上、稳定性略低)。生产环境用 3.8-Flash,尝鲜测试用 Flash-Next。本文正文有完整对比表。
Qwen 3.8 Flash-Next 的 NVFP4 量化版是什么?
NVFP4 是英伟达主导的 4bit 浮点量化格式,可以在大幅降低显存占用的同时比传统 4bit 量化更少损失精度。Flash-Next 提供 NVFP4 版本后,单卡就能跑更大的上下文,这也是它最近搜索热度上升的原因。
Qwen 3.8-Flash 本地部署需要多少显存?
本文「本地部署」一节给了估算:完整权重约需 82GB 级显存;如果用量化版本,门槛可以降到单卡 24–48GB。没有本地硬件的话,建议直接用官方 API(输入 1 元/百万 Token)。
总结:三步选对版本
- 线上做长上下文、编程 Agent、办公 Agent:等 Qwen 3.8-Flash API(输入 1 元/百万 Token),或先用同架构的 Flash-Next 云端托管。
- 本地研究 Qwen4 新架构:下载 Flash-Next 权重,96GB+ 统一内存设备走 4-bit 量化(约 82GB),注意推理引擎对 Engrams 的支持还在完善。
- 仓库级代码任务:把 DeepSeek V4 Flash 拉进同一测试集,官方数据表明它在这项反超。
本文数据核验于 2026 年 8 月 26 日。模型迭代很快,价格与版本信息以 Qwen 官方博客、Hugging Face 模型卡与官方技术报告为准。

京ICP备2024094994号-29