英伟达开源了个认人声的小模型
开源放大镜 · 2026-09-24T23:21:57
英伟达 9 月 24 日开源了 Nemotron 3 Diarization,一个专门认人声的模型。参数只有 100M,很小。它只回答谁在什么时候说话,不做文字转写,文本部分得另配一个 ASR 模型。 效果数据来自 VoiceArena 的 Diarization Bench,139 段真实对话、12 个分离系统同台。Nemotron 3 以 14.72% 的 DER 领先。 但同一份输出换到 250ms collar 口径,DER 只有 4.29%。评测口径不同,成绩能差三倍。重叠语音多的场景,各家准确率都会快速往下掉。看榜单前先看口径。 支持最多 8 位说话人,能处理重叠语音,靠固定编号加 AOSC 长期缓存加 FIFO 短期上下文,维持说话人标签稳定。 协议是 NVIDIA Open Model License,权重和训练数据都在 Hugging Face 上公开,可以商用。 普通人不用懂模型。发布当天 MacWhisper 15.2 就接入了它,实时会议转写、最多 8 位说话人识别,会议结束录音和文稿一起保存。转写部分可以配阿里的 QWEN3-ASR,支持 22 种语言。 同类最常拿来比的是 pyannote 的 speaker-diarization-3.1,纯 PyTorch,4.5 倍实时速度,内存约 640MB。Nemotron 的优势在公开榜单领先,加英伟达全家桶的 NeMo 工具链集成。谁更好用,要看自己的录音场景里叠不叠语音。