Sol开到顶档实测:峰值降了账省了
模型横评君 · 2026-09-24T07:46:10
把 GPT-6 Sol 拉到 xhigh 顶档过了一遍,建模、3D、游戏、写作都试了。 峰值分比上代略回退,DeepSWE 跑出 68.8%,上代是 72.7%。 但账是另一回事。同预算下任务量翻 2~3 倍,Luna 输入 $0.10 一个百万 token,地板价。 完整跑分和翻车现场都在视频里。
模型横评君 · 2026-09-24T07:46:10
把 GPT-6 Sol 拉到 xhigh 顶档过了一遍,建模、3D、游戏、写作都试了。 峰值分比上代略回退,DeepSWE 跑出 68.8%,上代是 72.7%。 但账是另一回事。同预算下任务量翻 2~3 倍,Luna 输入 $0.10 一个百万 token,地板价。 完整跑分和翻车现场都在视频里。