最近 Astra 发布,我的信息流里有一种 AGI 已经到来的气氛。

无论是官方演示,还是社区里不断出现的分享,最让我注意的都是它直接操作软件的表现:画图、建模,在各种应用里完成一串原本需要人动手的步骤。Coding 当然也有人讨论,但至少在我刷到的内容里,它反而没有占据最重的位置。

这让我有点好奇。过去几轮模型更新,我很关注的事情是它写代码、改代码、理解项目的能力又进步了多少。这次最容易引起兴奋的,却是它在屏幕上操作那些大家熟悉的软件。

我自己也试了。最近我在开发我的自动开发 loop,一套让 Agent 参与开发、审查和修复的自动化流程。我让 Astra 对项目做了一轮完整的 code review(代码审查),再让 GLM 5.3 修复,然后继续 review、继续修,两轮就收敛了。

过程挺顺利,但我没有被突然找出来的一大批安全漏洞震住,也没有感受到特别明确的代际提升。

不过,这个比较其实很不严谨。Review 的模型从 Sol 5.6 换成了 Astra,修复的模型也从 GLM 5.3 Flash 换成了 GLM 5.3。两轮收敛,到底是前者审得更准,还是后者修得更好,我分不清。我也不是能够独立判断整轮 review 质量的工程师:没有找出很多漏洞,可能是项目问题不多,也可能是它没找到。

所以这段体验只能说明我自己的感受,不能用来证明 Astra 的 coding 能力究竟提升了多少。

后来我看了第三方的数据。Artificial Analysis 在 9 月 3 日发布的评测中,Astra 在 Codex 中的 Coding Agent Index 得分是 67,比 Sol 高约 2 分,与 Claude Code 中的 Fable 5 基本持平,低于 Fable 5.1 的 70 分。

模型与运行环境 Coding Agent Index
GPT-5.6 Sol / Codex,max 约 65
GPT-6 Astra / Codex,max 67
Claude Fable 5 / Claude Code 约 67
Claude Fable 5.1 / Claude Code 70

这里沿用报告的取整口径,Sol 的约 65 分来自报告所述“Astra 比 Sol 高 2 分”。它比较的是模型在各自 Coding Agent 环境中的表现,并不是统一运行环境下的纯模型测试。来源:Artificial Analysis,2026-09-03

至少在这份独立评测里,Astra 的编程任务得分有进步,但仍然处于现有头部模型的水平区间,没有拉开代际差距。

同一份报告里还有一个不能漏掉的结果:在这套编程评测中,Astra 的 token 用量约为 Sol 的三分之一,单任务成本与 Sol 大致相当。得分之外,效率的进步很明显。仅仅看 token 单价,会低估这部分变化。来源:同一评测的成本与效率分析

但这也让我更想弄明白:为什么 Computer Use(计算机操作)的这次表现,会让这么多人感到 AI 又跨过了一道门槛?

从写代码,到操作我每天使用的软件

我觉得,一个很直接的原因是,能感受到变化的人越来越多了。

Coding 能力进步当然重要,但能直接看懂这种进步的人,首先还是工程师。再向外,是像我这样对 AI 很感兴趣、已经开始用它做 vibe coding 的人。

我会关心一个模型能不能理解整个项目,能不能找到跨文件的问题,修改之后会不会破坏原来的功能。但如果一个人不写代码,也没有尝试让 AI 帮自己开发东西,那么“它修好了一个很难的 bug”与自己的日常工作之间,还是隔着一段距离。

后来,Claude Cowork、ChatGPT Work、WorkBuddy 这类面向通用工作的 Agent 进入了我的视野。大家开始展示 AI 怎么处理文件、整理数据、做表格、做 PPT。对这些事情有切身体会的人,比关心代码审查的人多得多。

一个每天要处理文件的人,不一定理解某个 coding benchmark 上升了几分意味着什么,但他知道整理一堆表格有多烦,也知道反复调整 PPT 格式会花掉多少时间。

到了 Astra 这次,我感受到的又是更大一圈的扩展。

当 AI 可以直接进入软件,使用里面的工具,按照目标连续操作,很多人的第一反应可能就变成了:“这不就是我每天在干的事吗?”

以前需要先想一想自己的工作能不能转成代码、能不能整理成一个文件任务,现在只要工作发生在电脑和软件里,就更容易想象它与自己有什么关系。当然,能想象不等于已经能稳定替代,演示中的一个任务也不等于整个职业。但潜在的关联范围,确实一下变大了。

这里还有一个区别:操作过程本身容易被理解。

给我看一段生成的代码,我未必知道它到底有多好;给我看 AI 在一个熟悉的软件里选工具、调整参数、检查结果,我能认出那些原本需要自己动手的步骤。能力提升变成了一件可以直接看见的事。

这几类人群当然不是严格分开的,AI 也不是到了今天才服务非工程师。这里只是我理解这次传播反响的一条线索。

再加上我自己的信息茧房——本来就关注很多 AI 内容,平台又会继续给我推类似的东西——最终呈现在我眼前的,就像是一场所有人都在参加的狂欢。

看着它操作软件,我想到的却是接口

我认可这种进步的价值。它让更多人能直接感受到 AI 的力量,也让过去需要专门接入、专门编排的任务,有了另一条可能的路径。

至于价格,我暂时还不能毫无负担地把所有任务都交给 Astra。前面的评测已经说明,单价高不一定意味着每项任务都更贵;我更关心的,是这种能力什么时候能便宜到让人不再犹豫,成为日常使用的默认选项。我倾向于相信成本还会继续下降,但速度和幅度需要观察。

不过,看着它越来越熟练地使用人类的软件,我脑子里冒出了另一个问题:

这些软件界面,会一直是 AI 完成任务最合适的路径吗?

这也是我之前两篇文章里一直在追问的变化:在《从传统开放平台到 AI 时代:当调用方从人变成 Agent》里,我讨论的是 Agent 开始接手读文档、写代码、完成集成之后,平台需要怎样调整;到了《当开放平台面对的 Agent,从开发者变成服务调用方》,我又往前推了一步:如果 Agent 开始代表用户直接调用服务、执行操作,平台又该怎样设计。

从帮人开发软件,到代表人使用服务,Agent 正在从开发工具变成软件的使用方。沿着这条线往下想,软件的设计方式也会跟着改变。

我一直持有的判断是,未来的软件不一定都需要优先设计给人直接操作,但会越来越有动力提供适合 Agent 调用的方式。可能是开放 API,可能通过 MCP 暴露工具,也可能配合 Skill 或其他机制告诉 Agent 怎样使用这些能力。具体形式还会变,但方向是让它能够直接表达意图、调用功能、取得结果。

想象一下,同一个任务,一条路径是让 AI 看屏幕、找到按钮、点击、等待,再观察界面有没有变;另一条路径是软件直接提供一个含义清楚的能力入口,让它传入参数并取得结构化结果。

如果后者完整、稳定,而且拥有合适的授权机制,我很难找到理由,要求 Agent 永远坚持前一种操作方式。

这不是说视觉操作在每个任务里都更贵,也不是说现有 API 已经足够好。有些接口根本没有覆盖用户真正需要的功能,有些接入过程比手动操作还麻烦。但对于可以被良好接口覆盖的任务,直接调用更容易省去反复识别界面和确认状态的过程。

所以,我对 Computer Use 的一个判断是:它在数字世界中的一部分价值,来自今天的软件主要是为人设计的。

当 Agent 成为越来越重要的使用者,软件本身也会调整。到那个时候,模仿人操作软件,未必还是最主要的路径。

物理世界没那么容易换一套接口

沿着这个想法往下走,我反而想到了物理世界。

数字软件可以增加一个接口,可以把原本需要点好几层菜单的功能直接开放出来。只要不影响人继续使用,它甚至可以同时保留两套交互方式。

但在我家里,一把椅子、一扇门、一件厨房用具,都没有那么容易为了 AI 换一套设计。

人仍然要坐那把椅子、推开那扇门、拿起那件工具。至少在家庭、办公室、公共空间这些人持续生活和活动的地方,人的身体、习惯和便利性,会长期是设计的重要前提。

当然,物理世界也会为了机器改造。无人仓库和自动化工厂就是不同的环境。我想到的主要是人与机器共享的那些地方:我们不太可能为了让一个机器人进入家庭,先把整个家改成一座自动化工厂。

这就形成了一个让我很在意的差别:

数字世界更容易为 Agent 改变接口;人类生活的物理世界,可能更长期地要求 Agent 适应已有环境。

如果是这样,那么 Astra 展示出来的、让我真正好奇的能力,就不只是“它会用这个软件”。而是它在一个环境里识别工具,理解当前状态,选择动作,观察结果,再继续往下做的能力。

我会忍不住想:这种能力继续发展,价值会不会延伸到屏幕之外?

从 Computer Use,到我暂且称为 Everything Use 的东西——让 AI 学习使用人类已经创造出来的各种工具,而不是要求所有工具都先为 AI 重新设计一遍。

这里的 Everything 当然不是说什么都已经能用,也不是我在给一项成熟技术起名字。它只是一个方向性的想象:当环境不会充分迁就 AI,AI 就需要学会迁就环境。

这也是我认为人形机器人有必要被探索的原因之一。很多环境和工具已经围绕人的身体设计,接近人的形态可能有助于进入这些环境。但这不足以证明人形一定是最优方案,本文也不展开这个话题。

这个想法还停在哪里

从软件操作想到物理工具,并不意味着中间的路已经走通。

在屏幕上拖动一个物体,与在现实中拿起一个物体,是两件不同的事。后者要面对空间、重量、摩擦、接触和动作失败的真实后果。看起来相似的“观察—行动—反馈”,底下可能需要很不一样的能力。

我也不能仅凭一次产品演示,就说模型已经学会了在陌生物理环境中学习。能完成一个任务,与能从反馈中获得可迁移的新能力,中间还差着证据。

所以这篇文章写到这里,仍然是我从表层表现往下推的一次思考。它让我觉得值得关注,但还不是已经得到验证的结论。

回到数字世界,我也不认为 Computer Use 会因为 API 和 Agent 接口的发展而消失。

软件不会一夜之间去掉 UI。很多 legacy 软件没有动力或条件做适配;即使是新软件,也未必愿意开放所有功能。人和 Agent 长期共用软件,还会留下大量需要视觉理解和界面操作的场景。

因此,与其说它是一项很快会过时的过渡技术,我更愿意说:随着软件为 Agent 调整,它在数字世界里的角色可能会变化,有些地方转向直接调用,有些地方长期保留界面操作。

我接下来想看的,是这类能力面对不熟悉的环境时,能否理解工具能做什么,在失败后修正动作,并把学到的东西带到下一个任务里。尤其是,当环境不再是一块屏幕的时候。

Astra 这次让我产生的好奇,最后落在了这里:软件可以为了 AI 改变,但我们生活的世界不会那么快改变。如果 AI 需要走进这个世界,它还得学会使用我们已经在使用的那些东西。