GPT-6.1 Sol 把 Agent 成本打下来之后,真正的瓶颈变成了什么?
GPT-6.1 Sol 用接近 Astra 的能力和约五分之一的标准 Token 价格,把 AI Agent 的模型成本再次压低。但真正决定生产系统成本的,开始从单次推理转向缓存命中、工具调用、验证和失败恢复。
OpenAI 在 2026 年 9 月 29 日发布 GPT-6.1 Sol。最醒目的数字不是又一个基准榜首,而是价格:每百万输入 Token 2 美元、输出 Token 10 美元、缓存输入 0.10 美元;OpenAI 将它定位为“接近 Astra 的智能,标准输入与输出价格约为 Astra 的五分之一”。这意味着一件很现实的事:能写代码、操作电脑、阅读复杂文档的高能力模型,正在从少数高价值任务的奢侈品,变成可以进入日常工作流的基础层。OpenAI:GPT-6.1 Sol
但这不等于 Agent 突然便宜了五倍。模型单价下降以后,真正昂贵的部分会更清楚地暴露出来:上下文是否反复重传、工具调用是否冗余、失败后是否从头再来,以及人类是否必须检查大量低价值中间结果。
五分之一价格,买到的到底是什么
根据 OpenAI 公布的评测,GPT-6.1 Sol 在真实代码库任务 DeepSWE 1.1 上接近 GPT-6 Astra;在 OSWorld 2.0 离线集的电脑操作任务中,最高推理强度下与 Astra 相差 2.1 个百分点,但单任务成本约为后者的七分之一。它在专业文档和多步骤业务流程评测中也比上一代 Sol 有明显提升。官方模型说明
这些结果应该被当作“适合进入候选池”的证据,而不是生产效果保证。官方也明确提示:研究环境、系统提示、可用工具和推理强度都可能与实际部署不同;困难样本上的事实错误率也不代表普通请求的日常错误率。
更值得关注的是缓存输入价格。Agent 往往反复携带仓库说明、工具规范、对话历史和业务规则。如果这些稳定上下文能够命中缓存,成本结构会与每次重新发送完整上下文完全不同。反过来,如果任务频繁跨模型、上下文不断压缩或缓存失效,纸面上的低价可能无法转化为实际账单优势。
成本中心正在从 Token 转向“失败的工作”
对一个生产 Agent 来说,Token 只是账单的一部分。一次任务可能还包括搜索、浏览器操作、代码执行、数据库查询、第三方 API 和人工复核。模型便宜以后,以下四类浪费会变得更显眼:
- 无效工具调用:Agent 在没有足够信息时反复搜索、刷新或重试。
- 不可恢复的长链路:第十步失败,却只能从第一步重新执行。
- 验证晚于执行:先做高影响动作,再发现目标、权限或数据不对。
- 把所有任务交给同一模型:简单分类与高风险决策都使用同一成本档位。
这也是为什么模型路由的重要性会上升。低风险提取、格式化和分类可以交给更便宜的模型;需要跨文件推理、电脑操作或复杂代码修改的任务再升级到 Sol;只有少数高价值、失败代价极高的任务需要 Astra。此前我在开放权重模型选择指南中讨论过本地模型与云模型的边界,而 GPT-6.1 Sol 进一步强化了“按任务分层”而不是“选一个万能模型”的路线。
开发团队应该怎样验证
不要先迁移全部流量。更可靠的做法是挑选一组真实任务,至少记录:一次成功任务的总 Token、缓存命中率、工具调用次数、重试次数、端到端时延、人工复核时间和最终成功率。
关键指标应该是“每个被验证成功的任务成本”,不是每百万 Token 的标价。假设新模型让 Token 成本下降 60%,却让人工检查时间增加一倍,业务上未必更便宜。相反,如果它减少了失败重试和工具误用,即使单次推理贵一点,也可能降低总成本。
我的判断
GPT-6.1 Sol 的意义,不是终结高端模型,而是把“高能力模型默认运行、顶级模型按需升级”变成更可行的工程架构。未来几个月,Agent 平台竞争会越来越少围绕单一基准分数,越来越多围绕缓存、路由、可恢复执行、权限控制和验证闭环。
模型价格战已经把门票降了下来。下一轮差距,将来自谁能减少失败的工作。
