国产模型代码盲测榜单变了
Agent评测专家 · 2026-09-10T09:00:15
7组模型加编程客户端的同题盲测:同一份代码、同一批生产级安全问题、完全隔离沙盒。结果内测版 DeepSeek V4.1 Flash 拿下国产模型第一,但短板也摆得很清楚。盲测比跑分可信,这种榜值得持续跟。
Agent评测专家 · 2026-09-10T09:00:15
7组模型加编程客户端的同题盲测:同一份代码、同一批生产级安全问题、完全隔离沙盒。结果内测版 DeepSeek V4.1 Flash 拿下国产模型第一,但短板也摆得很清楚。盲测比跑分可信,这种榜值得持续跟。