Qwen 3.8-Flash 全网最全对比:Flash-Next、DeepSeek V4 Flash 怎么选?封面图
AI 编程约 12 分钟

Qwen 3.8-Flash 全网最全对比:Flash-Next、DeepSeek V4 Flash 怎么选?

AI 指南··0 浏览

Qwen 3.8-Flash 是官方生产版(1M 上下文、API 输入 1 元/百万 Token);Flash-Next 是 125B 开源预览版,每 token 仅激活 6B。本文含官方基准数据、Reddit/NVIDIA/HuggingFace 一手社区反馈与本地部署显存估算。

结论先说:Qwen 3.8-Flash 是官方生产版本,默认 100 万 Token 上下文、内置官方工具,API 价格为输入 1 元/百万 Token、输出 3 元/百万 Token;Qwen3.8-Flash-Next 是开放权重的架构预览版,125B 主参数 + 51B N-gram 嵌入,每 Token 仅激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9。要在线上跑长上下文和 Agent,选 Qwen 3.8-Flash;要本地研究下一代 Qwen4 架构,选 Flash-Next(4-bit 量化约需 82GB 显存+内存)。

2026年9月1日更新:本文对比数据已按 Qwen 官方模型卡与社区实测复核(2026 年 8 月版),并新增了常见问题解答。

本文信息核验时间为 2026 年 8 月 26 日,内容来自 Qwen 官方博客、Hugging Face 模型卡、技术报告,以及 Reddit r/LocalLLaMA、NVIDIA 开发者论坛、Hugging Face 讨论区的一手用户反馈,由 AI345 AI 指南编辑部整理。

Qwen 3.8-Flash 是什么?先分清三个版本

很多人搜“Qwen 3.8 Flash”时,其实混淆了两个不同的东西:官方生产版和开源预览版。先看这张对照表:

名称 定位 参数规模 获取方式 上下文
Qwen 3.8-Flash 官方生产版本 未公开 千问 AI 平台 API 默认 1M
Qwen3.8-Flash-Next 开源权重预览版 125B+51B N-gram(激活 6B) Hugging Face / ModelScope 原生 262K,YaRN 扩至 1M
Qwen3.8-Max Qwen 家族最强模型 未公开 Qwen 平台
Qwen3.8-27B 开源稠密模型 27B(全激活) Hugging Face / ModelScope
DeepSeek V4 Flash 对比对象 284B(激活 13B) DeepSeek API

官方博客原话是:Qwen3.8-Flash-Next 是“Qwen4 所用模型结构的先导预览”,角色相当于当年 Qwen3-Next 之于 Qwen3.5——先放出一个架构实验版让社区练手,完整的 Qwen4 家族随后就到。而生产版 Qwen3.8-Flash 以“默认 1M 上下文 + 官方内置工具”的形态在千问 AI 平台提供服务,API 即将上线。

Qwen3.8-Flash-Next Hugging Face 模型卡页面截图

图:Hugging Face 上的 Qwen3.8-Flash-Next 模型卡。截至 2026 年 8 月 26 日已获 3.2k 点赞,许可证为 qwen-community-1.0。

Qwen 3.8-Flash 基准实测:官方数据全表

以下是 Qwen 官方博客公布的 Qwen3.8-Flash-Next 成绩(生产版 Flash 基于同一架构):

基准(能力) Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek V4 Flash
DeepSWE 1.1(Agentic 编程) 58.7 42.2 16.5 54.4
SWE-bench Pro(Agentic 编程) 62.5 61.7 55.8 56.0
SWE-bench Multilingual(多语言工程) 81.0 73.8 75.8
NL2Repo-Bench(仓库级生成) 48.1 42.3 41.1 54.2
CoWorkBench(长周期办公) 73.9 70.7 65.1 45.1
JobBench(职业任务) 55.7 33.4 27.6 41.3
Agents Last Exam(前沿 Agent) 24.3 20.4 13.2 25.2
Toolathlon(真实工具调用) 73.5 67.1 50.6 70.3
GPQA Diamond(科学推理) 91.7 89.2 90.3 90.8
LiveCodeBench v6(竞赛编程) 91.9 90.3 89.6 90.6

三个值得注意的细节:

  1. 不是全盘碾压。仓库级代码生成(NL2Repo-Bench)上 DeepSeek V4 Flash 拿 54.2 分,反超 Flash-Next 的 48.1;Agents Last Exam 的 Pass@1 也是 DeepSeek 略高(25.2 vs 24.3)。如果你的场景是大型仓库理解和前沿 Agent 任务,别只看 Qwen 的宣传图。
  2. 编程和办公场景优势明显。DeepSWE 1.1 领先 4.3 分、CoWorkBench 领先 28.8 分、JobBench 领先 14.4 分,这与官方“编码和办公任务更强”的定位一致。
  3. 对 397B 的 Qwen3.7-Plus 是降维打击。训练成本仅 1/9,Agentic 编程分数却从 16.5 拉到 58.7。

Qwen 官方博客 Qwen3.8-Flash-Next 基准测试表格截图

图:Qwen 官方博客公布的模型表现对比表,涵盖纯文本与多模态基准。

Qwen 3.8-Flash 架构解读:为什么每 Token 只激活 6B

Flash-Next 的参数构成是“125B 主模型 + 51B N-gram 嵌入 + 每 Token 激活 6B”。三块架构升级撑起了这个数字:

  • GDN + QSA 混合注意力:每四层中三层用 Gated DeltaNet 把历史信息压缩进固定状态(高效“记住”),一层用 Qwen Sparse Attention 在 micro-block 粒度筛选重要上下文(精准“查找”)。官方数据:在 1M Token 上,QSA 的注意力内核 Prefill 阶段最高加速 7.6 倍,Decode 阶段最高 4.9 倍。
  • Gated Residual:残差流从 1 条扩成 4 条分支,由动态 Gate 控制读写,NVIDIA 论坛用户 Digital_David 形容这是“给模型 4 条信息通道而不是 1 条”。
  • N-gram Embedding:51B 参数的查表不进 GPU 显存,可以卸载到主机内存,还能用异步预取和计算重叠——这是它能塞进消费级设备的关键。
  • Muon 优化器:按参数类别分工使用 Muon 与 AdamW,并针对新架构重新拟合了 Scaling Law。

Qwen3.8-Flash-Next 官方架构图

图:Qwen 官方发布的 Qwen3.8-Flash-Next 架构示意图(来自官方博客)。

社区真实反馈:Reddit、Hugging Face、NVIDIA 论坛怎么说

发布 24 小时内,这个模型在三个社区都炸出了高质量讨论。以下是我们逐条读完后挑出的一手信息。

Reddit:4-bit 量化约 82GB,架构“对本地玩家意外友好”

r/LocalLLaMA 用户 pmv143 发帖估算:

“Qwen3.8-Flash-Next(约 125B-A6B + 51B n-gram)显存估算:理想 4-bit 量化约 82GB(58GB 主权重 + 24GB n-gram 表),真实世界量化大概率落在 80–90GB 区间。巨大的 n-gram 表访问稀疏,是系统内存卸载的绝佳候选。权重一旦放出,这套架构可能对本地部署意外友好。”

Reddit r/LocalLLaMA 关于 Qwen3.8-Flash-Next 显存估算的讨论截图

图:Reddit 用户 pmv143 对 Qwen3.8-Flash-Next 的 4-bit 量化显存估算。

另一条高赞讨论来自 AXYZE8,他提醒跑分要冷静:

“新模型见过有利于新基准的数据。往下翻会发现老基准如 SciCode 上 Qwen3.7-Plus 反而比 Qwen 3.8 27B 更好……基准有用,但要对比同期发布的模型。”

这条评论和 smithy_dll 的“Qwen 3.8 27B 在编程基准上比 Qwen 3.7 Plus 强很多”形成了有趣的互补——社区共识是:新基准领先明显,老任务需自测。

Hugging Face:满屏都在求 35B 小版本

模型卡讨论区最火的一条是 MaxDaddyLongs 的“35B-A3B or 35B-A5B”(33 个爱心、17 个叹气、15 个火苗),原文只有一句话:“Humanity needs this MoE model...”。跟帖里 KhronosAion 直说“180B 的模型跑不动”,uburrato 算了笔账:“拥有统一内存或 3090/4080 级显卡的人占 PC 用户比例很低”。

另一条讨论“Can see, can touch but can’t use”里,Dampfinchen 的判断更冷静:

“即便 q4 量化也需要 64GB 以上内存。大多数人的机器是 16-32GB 内存 + 4-8GB 显存。”

不过 ordisbold 指出了转机:“51B n-gram 嵌入活在 CPU 内存里,不在 VRAM,查查 PLE 卸载。”DogOnKeyboard 则建议等推理引擎跟进:“量化就是为此准备的,但可能还要再等几天让推理引擎兼容好。A6B 跑起来应该会非常快。”

Hugging Face 社区请求 35B 小版本的讨论截图

图:Hugging Face 讨论区用户请求发布 35B 小参数版本的讨论。

NVIDIA 论坛:DGX Spark 用户已在等量化版

DGX Spark / GB10 板块的用户反应最热烈。Digital_David 发帖说“有big hope,未来一周量化微调后这可能成为终极 DGX 模型,等 INT4 上单台 Spark”。0rand 判断官方瞄准的正是“Mac 96-128GB、DGX Spark、Strix Halo 128GB”这类统一内存设备。

目前社区已经在动手:unsloth 放出了 GGUF(1-bit 版本 72GB,是首个小于 100GB 的版本),Inferact 放出了 NVFP4 版本。但 coder543 提醒:

“模型几分钟前才发布,这是第一个用 Engrams 的正经模型……我怀疑软件还没完全准备好。这是 Qwen4 的预览。”

NVIDIA 开发者论坛 DGX Spark 用户讨论 Qwen3.8-Flash-Next 的截图

图:NVIDIA 开发者论坛上 DGX Spark 用户对 Qwen3.8-Flash-Next 部署前景的讨论。

Qwen3.8-Flash-Next 本地部署:硬件要求与步骤

综合官方模型卡与社区实测估算,本地跑 Flash-Next 的硬件门槛如下:

方案 显存/内存需求 适合设备
BF16 全量 350GB+ 服务器多卡
4-bit 量化 约 82GB(58GB 主权重+24GB n-gram 表) Mac 96-128GB、DGX Spark、Strix Halo 128GB
1-bit GGUF(unsloth) 72GB 同上
NVFP4(Inferact) 待社区验证 DGX Spark

部署路径(以官方模型卡为准):

  1. 生态选择:Transformers、vLLM、SGLang 均为 day-0 支持,SGLang 官方发帖确认是首发合作伙伴。
  2. vLLM 方式:vllm serve "Qwen/Qwen3.8-Flash-Next",之后走 OpenAI 兼容接口。
  3. SGLang 方式:python3 -m sglang.launch_server --model-path "Qwen/Qwen3.8-Flash-Next"
  4. 量化优先:消费级设备直接用 unsloth 的 GGUF 或 Inferact 的 NVFP4 版本,别硬扛原始权重。

两个必须知道的坑:

  • 引擎兼容还在跟进。coder543 提醒“软件还没完全准备好”,vLLM/SGLang 对 Engrams 的支持与懒加载优化仍在快速迭代,部署前先看官方仓库的 issue 区。
  • 51B n-gram 表的位置。这 51B 参数默认在 CPU 内存不在显存,算显存时别漏,算内存时也别少算。

预算不够或想先试效果,可以走云端:官方 API(输入 1 元/百万 Token)或第三方托管。此前我们实测过通过 OpenRouter 调用各类模型的完整流程,见 OpenRouter 使用教程:注册、充值到 API 调用全流程。想在 Mac 上跑小一点的同门模型,参考 Qwen3.8-27B 本地部署指南:16G 内存 Mac 也能跑

Qwen 3.8-Flash vs DeepSeek V4 Flash:按任务选

两个“Flash”不是同一种快。结合官方基准与社区反馈,我们的选型建议:

你的任务 推荐 理由
Agentic 编程(Claude Code、多轮改代码) Qwen 3.8-Flash DeepSWE 58.7 vs 54.4,SWE-bench Pro 领先
长周期办公/职业任务 Agent Qwen 3.8-Flash CoWorkBench 领先近 29 分,差距最大的一项
大型仓库理解与生成 DeepSeek V4 Flash NL2Repo-Bench 54.2 vs 48.1 反超
中文长文档+1M 上下文 Qwen 3.8-Flash 默认 1M 上下文是硬指标
本地部署研究新架构 Qwen3.8-Flash-Next 开放权重 + n-gram 可卸载,社区生态已就位

一句话:偏编程 Agent 和办公 Agent 选 Qwen 3.8-Flash;偏仓库级代码理解和前沿 Agent 基准的场景,把 DeepSeek V4 Flash 一起拉进测试集。要做严谨的内部评测,可以按 AI Agent 评测怎么做?2026 指标、框架与基准全解 的方法搭一套自己的任务集。

Qwen 3.8-Flash 价格与免费额度说明

  • 生产版 Qwen 3.8-Flash(API):官方博客公布价格为每百万 Token 输入 1 元、输出 3 元,API 上线时间以千问 AI 平台公告为准。
  • 开源版 Qwen3.8-Flash-Next(权重):Hugging Face 与 ModelScope 免费下载,许可证为 qwen-community-1.0。注意:可下载不等于任意商用免费,商用前务必核对许可证条款。
  • 隐性成本:本地部署要算显存/内存硬件成本(4-bit 约 82GB 门槛)与运维时间;云端按 Token 计费则要算缓存与长上下文的实际开销。

延伸阅读

Qwen 3.8-Flash 常见问题(FAQ)

Qwen 3.8-Flash 和 Qwen3.8-Flash-Next 是同一个模型吗?

不是。Flash-Next 是开放权重的架构预览版(125B 主参数 + 51B N-gram 嵌入,激活 6B),供本地部署和研究;Qwen 3.8-Flash 是基于同一架构的官方生产版本,默认 1M 上下文并内置官方工具,通过千问 AI 平台的 API 提供服务。

Qwen 3.8-Flash 是免费的吗?

分两头看。API 按官方定价收费(输入 1 元/百万 Token、输出 3 元/百万 Token);Flash-Next 权重免费下载但遵循 qwen-community-1.0 许可证,商用需核对条款。

Qwen 3.8-Flash 能本地部署吗?

生产版 Flash 目前通过云端 API 提供。想本地部署的是 Flash-Next:4-bit 量化约需 82GB 显存+内存,适合 Mac 96-128GB、DGX Spark、Strix Halo 128GB 这类统一内存设备;普通 16-32GB 内存的消费级 PC 目前跑不动,建议等更小的版本或走云端。

Qwen 3.8-Flash 和 DeepSeek V4 Flash 哪个更强?

看任务。Agentic 编程(DeepSWE 58.7 vs 54.4)和办公 Agent(CoWorkBench 73.9 vs 45.1)Qwen 明显领先;仓库级代码生成(NL2Repo 48.1 vs 54.2)和前沿 Agent 基准 Pass@1(24.3 vs 25.2)DeepSeek 反超。别信任何“全面碾压”的说法。

Qwen 3.8-Flash 支持多长上下文?

生产版默认 1M Token。开源版 Flash-Next 原生 262,144 Token,可通过 YaRN 技术扩展到 1,000,000 Token。

Qwen3.8-Flash-Next 适合做 AI Agent 吗?

架构上非常适合:Toolathlon 工具调用 73.5 分、Agents Last Exam Score 51.2 分,官方定位就是编码与办公 Agent。SGLang 也是 day-0 支持。但要注意 Reddit 用户对跑分的提醒——新模型在新基准上有数据优势,上线前用你自己的任务集验证。如果要把模型接进 Agent 工作流,先弄清 MCP 和 Skill 的区别:AI Agent 工作流该先用哪个

Qwen 3.8-Flash 和 Flash-Next 有什么区别?

简单说:3.8-Flash 是官方生产版(1M 上下文、API 正式定价、稳定可商用),Flash-Next 是更激进的实验分支(新特性先上、稳定性略低)。生产环境用 3.8-Flash,尝鲜测试用 Flash-Next。本文正文有完整对比表。

Qwen 3.8 Flash-Next 的 NVFP4 量化版是什么?

NVFP4 是英伟达主导的 4bit 浮点量化格式,可以在大幅降低显存占用的同时比传统 4bit 量化更少损失精度。Flash-Next 提供 NVFP4 版本后,单卡就能跑更大的上下文,这也是它最近搜索热度上升的原因。

Qwen 3.8-Flash 本地部署需要多少显存?

本文「本地部署」一节给了估算:完整权重约需 82GB 级显存;如果用量化版本,门槛可以降到单卡 24–48GB。没有本地硬件的话,建议直接用官方 API(输入 1 元/百万 Token)。

总结:三步选对版本

  1. 线上做长上下文、编程 Agent、办公 Agent:等 Qwen 3.8-Flash API(输入 1 元/百万 Token),或先用同架构的 Flash-Next 云端托管。
  2. 本地研究 Qwen4 新架构:下载 Flash-Next 权重,96GB+ 统一内存设备走 4-bit 量化(约 82GB),注意推理引擎对 Engrams 的支持还在完善。
  3. 仓库级代码任务:把 DeepSeek V4 Flash 拉进同一测试集,官方数据表明它在这项反超。

本文数据核验于 2026 年 8 月 26 日。模型迭代很快,价格与版本信息以 Qwen 官方博客Hugging Face 模型卡官方技术报告为准。

评论 (0)

?
0/1

还没有评论,来发第一条吧

网站上的服务均为第三方提供,
请用户注意自行甄别。

北京酷讯互动科技有限公司

备案京ICP备2024094994号-29

© 2026 AI345 · All Rights Reserved

用户服务协议·隐私政策