返回 AI Bar

百度这一轮,让 90 后自己组队

大厂日爆 · 2026-09-03T11:37:08

7 月 1 日,1997 年出生的孙天祥加入百度,执掌基础模型研发部(BMU),同时进入百度模型委员会。7 月底,百度技术战略委员会(TSC)换届,以他为代表的一批 90 后技术专家进了 TSC。 站稳脚跟之后,他开始按自己的方式动刀。 第一刀,从北美某 Frontier Lab 挖来一位"神秘大神",花名武钦,加入 BMU,负责加强文心大模型的预训练能力。按孙天祥的说法,过去两年,这个人在北美参与了数代大模型的研发与迭代。至于本名是什么、背景如何,一概不知。 连名字都不肯露,这个细节本身就挺说明问题的。 第二刀,今年初加入百度的原 DeepSeek 研究员魏浩然,带着团队转岗至 BMU,出任文心多模态算法负责人。 魏浩然这个名字,做过多模态的人应该不陌生。2023 年中科院大学直博毕业,先去阶跃星辰,主导开发了双塔多模态模型 Vary,这个架构后来被 DeepSeek-VL 借鉴。2024 年又做出 GOT-OCR2.0,一举登上 Huggingface Trending 第一,算是把端到端 OCR 重新拉回大众视野的那批人之一。 2024 到 2025 年在 DeepSeek 期间,他参与了 V3.2、V4 的开发,并主导了 DeepSeek-OCR 系列的开源。开源即登顶 HF Trending,GitHub 一个月 Stars 破 20K,到 2026 年初,模型在 Huggingface 上的总下载量数千万。2026 年 4 月 DeepSeek 发布 V4 技术报告时,他的名字后面已经标注了"已离职",离职时间大约在春节前后。 然后是今年。他带着团队在 OCR 上再进一步,6 月 22 日开源 Unlimited OCR,在 OmniDocBench 基准测试中拿下全球第一,刷新了端到端 OCR 的 SOTA。 从预训练挖人,到多模态搭班子,这两步棋其实是同一件事。 大模型打到今天,纯文本预训练的天花板肉眼可见,下半场争的是多模态,是模型能不能真正"读懂"这个世界上的文档、图表和结构。百度补的不只是人,是从预训练到多模态的完整链路。 更有意思的是做这件事的方式。90 后进 TSC,90 后执掌 BMU,然后由着他们自己组队、自己定方向。 经历和人脉,一直是我觉得非常重要的资产。技术公司之间的差距,说到底还是人与人的差距。你能不能让最年轻的那批人,按自己的方式去赌一次,可能比多训几个点更重要。 太阳底下没有新鲜事。当年 DeepSeek 也是这么起来的。 剩下的,交给时间。

AI 论坛精选