2026/9/14 2:04:26

GPT-6 Astra发布:从会聊到会操作电脑,大模型换了条赛道

GPT-6 Astra发布:从会聊到会操作电脑,大模型换了条赛道 9月3日OpenAI 发布了新一代旗舰模型 GPT-6 Astra。总裁 Greg Brockman 在吹风会上用欢迎来到 AGI 时代收尾并把这款模型称为一次代际跃迁。据报道发布会前后 ChatGPT、Claude、Grok 还经历了一次集体宕机但发布节奏没有受影响。热闹归热闹值得开发者关心的其实不是AGI 到底来没来而是这次模型换了什么路线。一、规格和价格参数拉满价格也拉满先把硬指标摆出来。据报道Astra 的上下文窗口是 105 万 token最大输出 12.8 万 token知识截止到 2026 年 4 月 30 日支持 low、medium、high、xhigh、max 五档推理强度。价格上标准模式每百万输入 token 收 10 美元、输出 50 美元单次输入超过 27.2 万 token 后输入和缓存价格翻倍、输出涨到 75 美元想用快速模式还要再付两倍价钱。这个价大约是上一代 GPT-5.6 Sol 促销价的 2.5 倍和 Anthropic 的 Fable 5.1 持平。官方数据确实亮眼研究级数学测试 FrontierMath Tier 4 拿到 97.6%科学知识测试 GPQA Diamond 96%长程软件工程测试 DeepSWE 74.1%CAD 测试 BenchCAD 95.9%漏洞利用测试 ExploitBench 100%。OpenAI 更爱提的是 ARC-AGI-3 的 99.9%——模型进入一个没有任何规则说明的陌生小游戏世界靠自己观察摸索出规则再行动这项测试今年 3 月刚公布时最强 AI 只有 0.51%。但第三方独立评测给这套叙事降了温。据报道在 Artificial Analysis 的 Intelligence Index v4.1.1 里Astra max 只有 61 分和 GPT-5.6 Sol max 持平低于 Fable 5.1 的 66 分、Opus 5 的 63 分和 Muse Spark 1.3 的 62 分。也就是说论谁更聪明Astra 并没有碾压同行。真正的差别在别的地方。二、技术本质从给 AI 写接口到让 AI 自己用电脑过去两年让 AI 用上外部系统的主流做法是先写 API、再接 MCPModel Context Protocol这类协议把工具和数据一个个接进来。每接一个系统就要重新处理权限、数据格式和调用逻辑。麻烦的是大量老旧的政务、医疗、企业软件根本拿不出像样的 API。Astra 走的是另一条路直接操作 GUI。模型看懂屏幕、理解当前界面状态然后点鼠标、敲键盘。这条路线的意义我理解下来是三层接口的通用性屏幕、键盘、鼠标是已经为人类这种通用智能服务了几十年的接口兼容无数新旧软件。模型会用 GUI等于现成软件不用改造就能成为它的工具。衡量标准变了据报道在 Computer Use 测试 OSWorld 2.0 上Astra 得分 72.6%高于 Sol 的 65.7%平均完成一项任务约 40 分钟Sol 约 75 分钟耗时少了约 47%。成本逻辑变了GUI 任务动辄几十分钟、几百步观察和操作每一步都会产生截图、上下文和推理 token。所以单 token 单价不再是唯一指标跑完一件事要烧多少 token才是。这一点很关键。Astra 单价高但据报道它的 token 用量大约只有 Sol max 的三分之一、Opus 5 high 的五分之一在 Artificial Analysis 的 Coding Agent Index 里拿到 67 分只比榜首少 3 分。OpenAI 自己估算用最高档配置完成一个 DeepSWE 任务API 成本比 Sol 低约 57%。另外 Artificial Analysis 测出它的幻觉率为 51%明显低于 Sol 的 92%。没变的是什么通用智能没有断层式领先模型照样会出错、会幻觉变的是执行这一段——它能理解一个模糊目标跨软件把活干完。据报道内测里公开的案例包括找猫咪寄养服务人类平均要半小时它用 5 分 27 秒以及填表单、整理日历、在 Excel 和 Power BI 里处理数据、在 Blender 里建模再转到 UE5。法律科技公司 Legora 用一次 Agent 运行审查了 41 份财务文件几分钟内找出全部 4 处人为埋入的错误。三、对普通开发者意味着什么先说结论短期内别急着把线上业务迁到 Astra但有三件事值得现在就做。1. 重新算一遍 Agent 的成本账。单价 × token 数 ≠ 实际成本。可以写个小脚本把候选模型按每任务 token 量折算一下deftask_cost(input_tokens,output_tokens,in_price,out_price):按每百万 token 单价估算单任务成本美元returninput_tokens/1_000_000*in_priceoutput_tokens/1_000_000*out_price# 以 Astra 标准价为例输入 10 美元/百万输出 50 美元/百万astratask_cost(input_tokens120_000,output_tokens20_000,in_price10,out_price50)print(fAstra 单任务约{astra:.3f}美元)# 换成某个列表价便宜、但 token 消耗 3 倍的模型cheapertask_cost(input_tokens360_000,output_tokens60_000,in_price2,out_price8)print(f便宜模型3 倍 token约{cheaper:.3f}美元)跑一下就能看出来贵不贵取决于跑完一件事烧多少 token而不是列表价。长任务里 token 效率的差距会被步数放大。2. GUI 和 API/MCP 不是二选一。有稳定 API 的系统继续走 API快、稳、便宜、可审计只有那些没有 API、又必须用的老系统GUI Agent 才是补位方案。把 GUI 当成兜底通道比一上来就让它接管整个流程要靠谱。3. 几个坑要提前想清楚。权限与安全让模型接管键鼠等于给它开了半个系统的门。高危操作要有审批和中断机制别直接连生产环境。可观测性几百步的任务出错了得能回放——截图、动作、决策都要留痕否则没法排查。结果校验不管跑分多好看涉及钱和数据的结果都要有人工或规则的校验环节。据报道OpenAI 首席科学家 Jakub Pachocki 也提醒智能进步不会自动带来对齐进步模型越强越难准确理解它在做什么。可用性据报道Astra 先向少量可信合作企业开放ChatGPT 各级会员和 API 会在随后几天陆续推送想立刻上生产并不现实。结尾这次发布真正有意思的地方不是AGI这三个字母而是 AI 开始适应人类的软件世界而不是反过来等整个软件世界先为它改造一遍。对开发者来说这意味着会写 API和会调 API之外的第三件事——怎么把一件模糊的事拆成 Agent 能自己跑完的流程。你的项目里有哪些活是没有 API、但人天天在点鼠标的你会考虑交给 GUI Agent 吗评论区聊聊。