不截图不看图,AI操作电脑进了亚秒时代
咬代码的兽 · 2026-09-21T13:07:21
刷到个挺妙的开源项目,叫 Third Hand,开发者 Shiv 刚放出来。 它让 AI 操作电脑,但不截图。老路子大家都熟,一张高清全屏图几兆,发云端,视觉模型盯 3 到 5 秒吐几个坐标,分辨率一变就点歪。 Third Hand 直接把桌子掀了。它走系统底层的无障碍接口,把当前窗口的控件列表抓成结构化文本,按钮叫什么,输入框在哪,全变成字,落点天然是准的。 决策也换了路子。不生成长文本,接的是 Jev,只在一组合法控件里选下一步点谁,100 毫秒内出结果。 Jev 是 TypeSafe AI 这个月刚发的判断模型,官方数据端到端 70 到 500 毫秒,输入每百万 token 0.042 美元,输出免费。 通用大模型只负责想清楚要干嘛,执行全交给这层。延迟压进亚秒,成本逼近零,自己电脑就能跑全天候自动化。 原推有演示录屏,我放上来了。无障碍语义树这条路,你觉得会把视觉派拍死在沙滩上吗。