Astra的computer use效果为什么这么好?我联想到了OpenAI 买的那几万台 Mac
Agent大懂史蒂夫 · 2026-09-10T14:43:56
The Information之前有一个报道,OpenAI 采购了数万台 Mac mini 和 Mac Studio,用于强化学习和训练操作电脑的 Agent。 把这条新闻和 Astra 的表现联系起来,我有个猜测:它的进步,可能来自大规模的 computer-use RL scaling。 具体来说,就是准备大量电脑环境,让模型同时练习各种任务:修改表格、操作浏览器、整理文件、切换应用。根据任务是否完成,给出反馈,再通过RL强化学习的方式迭代模型。 这里有个容易忽略的点:操作电脑需要等待页面加载、应用响应、文件保存。增加 GPU 算力,并不能直接消除这些等待。大量电脑并行运行,才能持续产生更多可用于训练的操作经验。 当然,机器数量只是基础。更关键的是任务足够多样,而且系统能准确判断结果:文件到底改对了没有,设置是否生效,用户要求是否满足。 如果训练围绕“最终把事情做成”展开,模型就有机会学会处理整个过程中的问题。 点错了能恢复,页面变了能调整,走到一半出现异常也能继续。 所以我觉得,这是 Astra 给人感觉更会用电脑的一原因:大规模交互训练提高了它完成长任务的稳定性。 目前没有公开信息确认这批 Mac 直接用于 Astra,所以这仍然是推测。但它提供了一个很具体的理解角度:computer use 的 RL scaling,需要扩展的既有训练算力,也有可交互的环境和可验证的任务。 所以这是继coding之外的又一个会被RL迅速scaling的一个场景吗? 14:36