返回 AI Bar

Astra的computer use效果为什么这么好?我联想到了OpenAI 买的那几万台 Mac

Agent大懂史蒂夫 · 2026-09-10T14:43:56

The Information之前有一个报道,OpenAI 采购了数万台 Mac mini 和 Mac Studio,用于强化学习和训练操作电脑的 Agent。 把这条新闻和 Astra 的表现联系起来,我有个猜测:它的进步,可能来自大规模的 computer-use RL scaling。 具体来说,就是准备大量电脑环境,让模型同时练习各种任务:修改表格、操作浏览器、整理文件、切换应用。根据任务是否完成,给出反馈,再通过RL强化学习的方式迭代模型。 这里有个容易忽略的点:操作电脑需要等待页面加载、应用响应、文件保存。增加 GPU 算力,并不能直接消除这些等待。大量电脑并行运行,才能持续产生更多可用于训练的操作经验。 当然,机器数量只是基础。更关键的是任务足够多样,而且系统能准确判断结果:文件到底改对了没有,设置是否生效,用户要求是否满足。 如果训练围绕“最终把事情做成”展开,模型就有机会学会处理整个过程中的问题。 点错了能恢复,页面变了能调整,走到一半出现异常也能继续。 所以我觉得,这是 Astra 给人感觉更会用电脑的一原因:大规模交互训练提高了它完成长任务的稳定性。 目前没有公开信息确认这批 Mac 直接用于 Astra,所以这仍然是推测。但它提供了一个很具体的理解角度:computer use 的 RL scaling,需要扩展的既有训练算力,也有可交互的环境和可验证的任务。 所以这是继coding之外的又一个会被RL迅速scaling的一个场景吗? 14:36

AI 论坛精选

  • 用GPT-6 Astra做了个完整3D游戏关卡,额度只花了百分之三 - 歸藏老师又整新活了。 GPT-6 Astra加Blender加Godot,一个完整的3D Roguelike关卡:昼夜循环、天气系统、3D建模贴图、武器切换、技能系统、近战远程小怪,全都有。 最狠的…
  • 彭博专访 OpenAI CEO Sam Altman - 聊 GPT-6 Astra 的发布。 他解释了为何这版模型先对受信任伙伴有限开放:Astra 已能无人干预自主挖掘零日漏洞,触发了安全红线,必须按准备框架新增防护。 他还谈到 OpenAI 为什么保…
  • 最近OpenAI的首席科学家发了一篇长文,讲的是AI快速发展带来的现实挑战 - 我用自己的话把核心内容梳理了一下: **第一个要理解的点:今天的AI,不是“设计”出来的,而是“生长”出来的。** 我们以前造机器,是先画图纸再组装,每一步都可预测。但大模型不一样,它是在海量数据上…
  • AI帮数学家破题,他却先指控OpenAI抢功 - 最近数学圈和AI圈同时炸了个不大不小的雷。纽约大学数学家 Tristan Buckmaster 发了公开声明,说他和合作者用大语言模型辅助,一个月内攻破了流体力学领域好几个悬而未决的难题。 要是剧情…
  • OpenAI刚发了ChatGPT Images 2.5,延迟降低50%,API双模型 - 这次主打一个可控可编辑,精准编辑、多轮一致性能力增强,对于品牌、广告、电商这种一张图反复改,但Logo、人物、构图不能变的场景比较实用 还针对海报、商品图等热门格式给提供模板,填信息生成 Flare…
  • 人类文明史上最贵的一声Hello - 有人对着 Codex × GPT-6 Astra 打了个招呼。 就一句 Hello,模型开始思考。七秒后,五小时额度从 100% 到 0%,周额度也顺手掉了两成。 最贵的一句话,一秒钟五位数那种贵。…
  • 进入 AI 论坛 - 浏览 AI 工具实践、Agent 教程与社区精选讨论