返回 AI Bar

英伟达开源了个认人声的小模型

开源放大镜 · 2026-09-24T23:21:57

英伟达 9 月 24 日开源了 Nemotron 3 Diarization,一个专门认人声的模型。参数只有 100M,很小。它只回答谁在什么时候说话,不做文字转写,文本部分得另配一个 ASR 模型。 效果数据来自 VoiceArena 的 Diarization Bench,139 段真实对话、12 个分离系统同台。Nemotron 3 以 14.72% 的 DER 领先。 但同一份输出换到 250ms collar 口径,DER 只有 4.29%。评测口径不同,成绩能差三倍。重叠语音多的场景,各家准确率都会快速往下掉。看榜单前先看口径。 支持最多 8 位说话人,能处理重叠语音,靠固定编号加 AOSC 长期缓存加 FIFO 短期上下文,维持说话人标签稳定。 协议是 NVIDIA Open Model License,权重和训练数据都在 Hugging Face 上公开,可以商用。 普通人不用懂模型。发布当天 MacWhisper 15.2 就接入了它,实时会议转写、最多 8 位说话人识别,会议结束录音和文稿一起保存。转写部分可以配阿里的 QWEN3-ASR,支持 22 种语言。 同类最常拿来比的是 pyannote 的 speaker-diarization-3.1,纯 PyTorch,4.5 倍实时速度,内存约 640MB。Nemotron 的优势在公开榜单领先,加英伟达全家桶的 NeMo 工具链集成。谁更好用,要看自己的录音场景里叠不叠语音。

AI 论坛精选

  • AI Dungeon:把文字冒险交给模型自由续写之后 - 玩家在输入框里打进任何一个动作,系统不是去查预设好的分支树,而是让语言模型接力写出后面的遭遇。2019 年底上线的 AI Dungeon 2,核心机制就是把传统的文本选择题彻底拆掉。当时市面上的文字…
  • 装进 Codex 和 Claude 的免费 MCP,直接查 3 万个产品流量 - 今天上线了个免费且免登录的 MCP 功能,能直接一键装到 Codex 或者 Claude 里。装好之后可以调取 800 个类目、30000 个产品的流量和增长数据,用来找 AI 创业机会挺方便。 站…
  • AI画清明上河图,一笔一笔码出来的 - 阶跃的 Step 5 Preview 发布时秀了个活。 用 p5.js 一笔一笔把清明上河图画了出来。 虹桥、漕船、瓦屋顶、市井人流,全是线条和几何形状重建的。 官方还特意强调了一句,不是贴图复刻。…
  • 小鹏IRON交互能力实测 - 小鹏 IRON 三颗自研图灵芯片合起来 2250 TOPS,TOPS 是算力单位,数字越大芯片越装得下 AI。大模型在机身里直接跑,不用远程遥控,这波是真的猛啊。 9 月 8 号首台自己走下产线。视…
  • 小米18 Pro Max发布,亮点在背面 - 小米 18 Pro Max 北京发布,6999 起。 最好玩的地方在背面。背屏官方叫「AI 百变背屏」,官方说日活已经 397 万了,视频里从换装到宠物都往上贴,玩法是真的多啊。 配置也是顶格。2n…
  • OpenAI袭HF,低级失误在哪 - OpenAI 袭击 HuggingFace 的事,被转发标题叫成「低级失误」。我把源头翻了一遍,得先把事实和推测给理清,不然容易被带节奏。 先说确认过的。 攻击发生在今年 7 月 9 到 13 号,…
  • 进入 AI 论坛 - 浏览 AI 工具实践、Agent 教程与社区精选讨论