想象一下,你给AI下达“打开画图软件,把我照片重画一遍”的指令,然后看着它自己移动鼠标、点击调色板、一笔一笔画出来——这不再是科幻演示,而是GPT-6 Astra(OpenAI最新旗舰模型,也是目前我实测过最强的模型)日常能做的事。这篇文章来自一位深度使用者的评测,同时带出了近期AI圈最热的两个话题:Astra为何在图形与电脑操控上异常突出?以及传闻中“隐藏推理轨迹”与“循环Transformer”架构到底有什么关系?我读了全文后,把最值得开发者关心的技术细节整理如下。
先看Astra的实际战力。作者实测后给出的结论是:它在几乎所有类别(写作、数学、编码)上都碾压前代GPT-5.6,但最夸张的进步出现在3D渲染和动画任务上,比如用Blender渲染纽约城、做虚拟看房demo。独立评测机构Artificial Analysis的数据也印证了这一点:Astra在ARC-AGI-3基准(一个混合逻辑谜题与泛化能力测试的指标)上拿到99.9%,而GPT-5.6 Sol只有7.8%;数学和编码类基准同样大幅领先。不过,在更贴近真实工程师场景的“编码Agent指数”上,Astra虽然处于领先,但没有拉开断层差距。作者特别提醒:这些独立基准通常使用统一测试框架(例如GDPval-AA用的Stirrup、Terminal-Bench v2.1用的Terminus 2),但模型厂商在训练时往往只针对自家主框架调优,所以某些评测可能低估了Astra在它最顺手框架下的真实水平。要精确对比,得跨框架跑同一任务才知道。
Astra真正的杀手锏是“电脑使用”(Computer Use)能力——通过Codex/ChatGPT应用,模型能直接控制你本机的图形界面。作者给了一个亲身对比:让Astra的Medium和High档位用鼠标在浏览器版MS Paint里重画他的照片,画得又快又像。这背后不是简单的生成图片,而是模型理解界面截图、规划鼠标点击和键盘操作、再观察新截图的闭环。作者指出,这种能力之前也有模型尝试,但通常不成熟,因为LLM天然是文本模型,擅长的是代码和API调用;而电脑操作的意义在于,很多软件没有CLI(命令行接口),与其等待厂商开发,不如让模型直接学会用GUI(图形用户界面)。他用了一个类比:人形机器人虽然效率不如专用机械臂,但胜在通用——电脑操控也是同理,能让AI帮普通人处理“帮我报税”这类日常任务。
训练这种能力的方式也很有意思。据The Information报道,OpenAI买了数万台Mac Mini和Mac Studio用于强化学习——注意,这些Mac不是用来跑前向计算(那还是GPU的活),而是用来充当“环境”:训练时给模型布置任务(比如“打开应用X做Y”),模型通过截屏感知屏幕状态,输出鼠标/键盘动作,执行后观察新截屏,反复试错,用成功/失败信号做强化学习反馈。这其实就是把“交互式环境”嵌进训练流程,模型在探索中学会操作macOS生态里的工具。作者预测,未来几个月到几年,模型和Agent框架都会重点打磨这种能力,AI会越来越像“能动手的同事”。
顺带一个实用建议:作者提到,他同事和Claude Code负责人都不约而同建议——把项目里那些老的AGENTS.md和SKILL.md文件删掉或归档一部分。原因是新版LLM已经更擅长理解提示词和直接解决问题,过多的“手把手指令”反而可能限制模型发挥,导致更差的方案。当然这不是说全丢,而是对于已经被模型熟悉的工作流,旧描述可能过时,重新生成一份更精简的说明也许更好。这个经验特别适合在工程实践中踩坑的开发者。
至于文章标题里提到的“循环Transformer”和“隐藏思维链”,原文本篇幅较长,我在这个版本里只提炼了前半部分——后半部分详细解释了循环Transformer(一种让模型多次叠加深层的变形结构,类似于在时间维度上重复计算)的原理,以及它如何可能与“隐藏推理轨迹”相关。限于篇幅,这里不再展开。总之,这篇评测给我们两个启发:一是评估模型别只看厂商自报的分数,独立基准和真实任务场景更靠谱;二是AI正从“文本助手”走向“全桌面操作员”,这会让很多没有API的旧软件焕发新生。如果你在做Agent或工具链,值得研究一下如何给模型留出自主操作的空间,而不是写死每一步。

























内容与图片版权归原作者所有 · 原文: https://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-and