GPT-6 Sol 和 Claude Opus 5.5 发布,直接杀死比赛!

文章来源声明: 原文作者:JavaGuide; 来源站点:掘金; 原文链接:https://juejin.cn/post/7688571406653849646; 本文基于上述来源整理/加工,觅优补充点评,仅供技术学习交流。版权归原作者所有。
觅优短评

两家同天升级降价,对高频跑 Agent 写代码的团队最实在:Sol 的缓存折扣利好长上下文反复读取,Opus 5.5 适合大型代码迁移与重构。建议按自身任务实测再选型。

今天凌晨,OpenAI 和 Anthropic 接连发布了 **GPT-6 Sol 和 Claude Opus 5.5**。两家又撞到同一天了,针尖对麦芒啊!

我刷到了很多很牛逼的 Claude Opus 5.5 案例,看到不少博主也在夸。说实话,看得我有点心动,又去整了一个 Claude 账号,还把 Pro 的钱付了。

结果,付完款之后发现根本用不了。打开页面,直接给我来了一句 “Organization disabled”,组织被停用了。

太曹丹了……

Claude 组织停用提示

我已经通过 Google Play 申请退款,还要等审核。。。

Google Play 退款申请回执

GPT-6 Sol:把 Astra 的能力带到更便宜的档位

OpenAI 把 Sol 放在 Astra 之下。Astra 仍然负责最难的任务,Sol 则把这一代在编程、电脑操作和事实准确性上的进步,带到更适合频繁调用的价位。

先看最容易感受到的价格变化,直接放 OpenAI 官网的说明。

GPT-6 API 价格

Sol 的输入、输出单价都便宜了一半。 OpenAI 同时发布了更低价的 GPT-6 Luna,这篇先把重点放在 Sol 上。

编程方面,OpenAI 的发布说明提到,Sol 在 FrontierCode 1.1 Main 上比上一代有明显提升。这项测试会看代码能否合并到真实仓库,检查范围包含测试质量、代码风格,以及有没有遵守项目约定。

FrontierCode 评测结果

另一个考察复杂软件工程长任务的 DeepSWE 1.1,Sol 在 max 档拿到了 68.8%。

对经常让 Agent 改项目的人来说,这类测试比较有参考价值。一个功能写出来以后,还要补测试、检查改动范围、处理原有代码的约束,这些都会影响最后能不能交付。

事实准确性也有更新。OpenAI 用过去被用户标记出事实错误的对话做内部评测,Sol 的错误数约为上一代的一半。这里测的是一批容易出错的样本,日常对话是否也有同样幅度的改善,还要看后续使用。

很多朋友更在意的变化是缓存。GPT-6 提高了提示词缓存命中率,缓存读取享受 90% 折扣;中途调整推理强度、增减可用工具,也能继续复用之前的上下文。

比如让 Agent 先读仓库,再改代码、跑测试,前面读过的项目规则和历史对话会反复参与后续请求。如果切换推理档位时还能复用这些内容,长任务就能少付一部分重复读取的费用。最后省多少,仍然取决于缓存命中、输出量和返工次数。

官方新增的缓存仪表盘可以查看命中率随时间的变化,以及缓存读取、写入和未缓存输入各占多少。下面是官方界面示例,图中数值不代表本文实测结果。

OpenAI 缓存仪表盘示例

Sol 和 Luna 已在 ChatGPT Work、Codex 与 API 上推出,暂时还没有进入普通 Chat 对话。Sol 的 API 模型 ID 是 gpt-6-sol

Opus 5.5:长任务更快,回答也更好读了

Anthropic 对 Opus 5.5 的定位很明确:多数任务达到 Fable 5.1 的水平,成本比 Opus 5 更低。

这次 Opus 的标准 API 价格也降了,缓存读取的降幅尤其明显。下面是 Anthropic 官网的新旧价格对照。

Opus API 价格

这里要区分两个数字:输入、输出单价降低了 20%;官方所说的“典型任务便宜 40%”,还包含默认设置下完成任务时更少的 Token 消耗。输出生成速度也比 Opus 5 快了超过 30%。

大型代码修改里,Anthropic 给了一个 HAProxy 迁移案例。它让 Opus 5.5 和 Fable 5.1 把这个用 C 编写的软件改成 Rust,两边都通过了几乎全部原项目回归测试。Opus 5.5 用了 9.5 小时,Fable 5.1 用了 12 小时,前者成本低 51%。

这项内部测试吸引我的地方,是它保留了原项目测试作为验收依据。迁移成熟项目,要把原来的行为一起保留下来,不能只看生成了多少行 Rust 代码。当然,通过“几乎全部”回归测试,还不能直接等同于已经可以替换生产版本。

Terminal-Bench 4.0 上,Opus 5.5 在 xhigh 档拿到 66.4%,Opus 5 在 max 档为 52.3%。这些是 Anthropic 报告的结果,也不是与今天的 GPT-6 Sol 在同一套环境里做的正面对比。

Terminal-Bench 4.0 评测结果

还有一个日常使用更容易感受到的改动:回答更清楚了。 Anthropic 说 Opus 5.5 会把重要信息放在前面,减少术语堆砌,更好地遵守用户给定的写作规则。

跑长任务时,模型经常一口气改很多文件。回来看它的汇报,能快速知道改了什么、测试到哪一步、哪里需要自己拿主意,会省下不少来回追问。

订阅用户也有变化:Pro、Max、Team 和按席位计费的 Enterprise 计划提高了五小时使用限额,还提供了一次可以保存、择时使用的额度重置。API 模型 ID 是 claude-opus-5-5

X 上已经有人拿它做 3D 场景了

先看 Addy Osmani 分享的 Three.js 骑车鹈鹕。这条帖子在截图时已经有 37.7 万次浏览

鹈鹕骑着自行车穿过街道,两侧有建筑、树木和停靠的车辆,画面上还有速度与收集进度。拿熟悉的“鹈鹕骑自行车”题目做成这样一个 3D 场景,效果比单看一段文字介绍直观得多。

Addy Osmani 原帖

Addy Osmani 的骑车鹈鹕

鹈鹕骑自行车这个题目,还有一个版本更让我心动,效果太顶了……

戴着头盔和墨镜、系着红围巾的鹈鹕,骑车经过海边,车篮里还装着鱼。夕阳照在海面上,自行车的辐条、车座弹簧这些小细节也都做出来了,整个画面一下就丰富了很多。

海边骑车的鹈鹕

界面上还能看到自由环绕、追随、侧面跟拍、电影运镜和鹈鹕视角等选项,速度、踏频、档位、里程也都有显示。光看这些画面和界面细节,就很想打开玩一会儿。

我也确实,下午玩了 20 多分钟。。。

海边鹈鹕骑车案例原帖

还有一个是 Ethan Mollick 的塔楼 shader。他沿用了此前测试 Fable 5.1 的提示词,让 Opus 5.5 生成被水淹没的新哥特式塔楼场景。

高耸的建筑、狭窄的水道、雾中的远景,都在这段演示里。Shader 可以理解成负责计算画面颜色、光照等效果的程序,这类作品很适合观察模型能不能把视觉描述落实成代码。

Ethan Mollick 原帖

Opus 5.5 塔楼 shader 演示

Mollick 对新模型的早期表现评价不错,但也提到,Claude 近期模型文字偏密的问题还没有完全解决。官方说表达有改善,实际用起来是否合胃口,还是得放到自己的写作和开发任务里看。

总结

这次两家的更新都挺实在。GPT-6 Sol 把更强的编程和电脑操作能力带到了更低的价位,Opus 5.5 则在长任务效率、成本和表达上继续改进。对经常用 AI 干活的人来说,能少等一会儿、少改几轮、少花点钱,都是值得升级的理由。

说实话,我是真想试试 Claude ,可惜万恶的 A 社不给机会,直接封号。。。