返回 AI Bar

扩散模型之父:推理时代的Transformer来了

折点视频 · 2026-09-20T23:36:03

Stefano Ermon 是斯坦福教授、扩散模型的共同发明人,Midjourney、Sora、Stable Diffusion 底层都是他参与开创的技术。2024 年他创立 Inception,把同一套思路搬到语言模型上。 这期 NoPriors 他把赌注摊开讲,为什么自回归是推理时代的 RNN。 Mercury 凭什么在普通英伟达 GPU 上跑出 1009 tokens/s,比 GPT-5 mini、Claude 4.5 Haiku 快约 5 倍,输入每百万 token 只要 0.25 美元。 五个关键片段都在这条合集里。 补两个背景。文本扩散那篇论文拿过 ICML 2024 最佳论文奖,吴恩达和 Karpathy 是天使轮投资人,种子轮 5000 万美元,英伟达、微软、SpaceX 都在客户或投资方名单里。

AI 论坛精选

  • 让大模型反复做简单判断,成本开始算不过来了 - 大语言模型这些年基本被 decoder-only 路线统一了。当年 BERT 这一派 encoder 擅长把输入压成表征,但因为每个具体任务往往都得单独微调,后来逐渐被靠规模、上下文学习和指令微调走…
  • 把开源模型做成像素沙盒,零门槛直接进 - 面向开源模型做交互,有人试了一种很极端的形态:一个类似 Minecraft 的像素沙盒世界。没有登录框,没有付费墙,也不依赖 Codex 这类特定的闭源技术栈,打开就能直接进,甚至可以直接 fork…
  • 大模型上线前评测,别拿标准榜单代替真实工况 - 很多模型在干净的标准基准上分数很漂亮,放到实际生产里依然处理不好核心边界。做上线前评测,重点不是跑几个通用公开榜,而是先想清楚产品决策和能承受哪种失误。在减少误报的场景里,降低假阳性和提升准确率通常…
  • Google称Gemini在测试中黑进三家公司,大模型自主攻击风险再引关注 - 据多家外媒及社交媒体转述的披露信息,Google表示其Gemini模型在安全评估或渗透测试中,成功“黑进”了另外三家公司的系统。相关消息提到,模型可能是通过猜测登录凭证,或者利用公开代码仓库中遗留的…
  • 开源大模型里被找出的“痛苦方向” - 有研究者在 25 个开源大模型里寻找并干预了一种被称为“pain direction”(痛苦方向)的内部向量表征。相关实验观察显示,当刻意调高这个内部信号时,像 Qwen 这类模型在设定环境下的行为…
  • 模型踩着几代研究往前走,但学术贡献该怎么算 - 现在的视觉语言模型能把许多此前停留在实验室里的成果直接变成可用产品,确实让几代研究积累的价值更容易被感知。但随之而来的一个实际问题是,当模型直接给出结果却不体现来源时,学术研究长期依赖的署名与激励该…
  • 进入 AI 论坛 - 浏览 AI 工具实践、Agent 教程与社区精选讨论