Claude Opus5.5的关键信息和实测结果!

文章来源声明: 原文作者:甲维斯; 来源站点:掘金; 原文链接:https://juejin.cn/post/7689030783365873690; 本文基于上述来源整理/加工,觅优补充点评,仅供技术学习交流。版权归原作者所有。
觅优短评

实测信息量大,适合关注模型选型与AI编程工作流的开发者、产品经理和内容创作者参考;重点在成本下降与Agent自主规划能力带来的效率差距。

终于,Opus5.5 配额烧完了,安心写文章!

“O哥”全服第一,实至名归!

“国模”的差距有多少,我不说,你们看就好了。

作为 Claude “大中华区唯一代言人”(自封的,出来混,面子是自己给的!)给你们好好讲讲 Opus5.5!

如果大家有兴趣,我也可以分享下“为啥我的账号这么坚挺”,以及“我是如何解封小号的”!

今天这篇主要是围绕 Opus5.5 的官方数据,以及我的实测结果来讲的!

不管你之前有没有听过,有没有用过这个模型,看完之后,你对这个模型就会有非常全面的了解了。

1、基础信息

大家可能对 Claude Opus5.5 这个目前最强的 AI 模型还不太了解。我就根据官推的信息给大家逐条解读一下。

第一条:格局!

文字内容为:

给大家介绍下 Claude Opus 5.5,这是我们全新 Claude 5.5 系列中的首个模型。 它在大多数任务上的表现达到了 Claude Fable 5.1 的水平,并且运行成本比 Opus 5 低 40%。

这里有两个关键词:5.5 系列首个模型,成本低 40%!

然后配了一个很抽象的视频,视频中闪过了各种各样的内容。但是唯一不变的是一个词叫“discover”!

视频链接(后续例子的视频演示也是这个地址)

Claude 每次发布的配图和视频是最有“逼格”(内涵)的!

整部短片采用快速蒙太奇节奏,在背景女声轻灵悠扬的吟唱中,画面不断变换,但屏幕下方始终保持着一道完全吻合、恒定不变的“凸起圆弧”,形似地平线。

我给大家逐帧解读一下:

​
<span>1.</span> 宏观宇宙与地球晨昏线(00:00):从近地轨道俯瞰地球边缘,大气层在深空中泛着橙红色的黎明曙光。
​
<span>2.</span> 微观流体力学(00:01):金黄琥珀色液体在表面张力下形成的弯液面与微小气泡。
​
<span>3.</span> 恒星光晕与尘埃微粒(00:02):暖光透射的弧形边缘,悬浮着细碎的漂浮粒子。
​
<span>4.</span> 建筑与球体结构剖面(00:03):具有厚实质感的半球体建筑构造与空间切面。
​
<span>5.</span> 工程蓝图与技术制图(00:04):经典的蓝底白线工程图纸,同心圆弧与精密几何标线。
​
<span>6.</span> 植物叶脉与生命切面(00:05):一片鲜嫩绿叶的边缘与微细叶脉网络。
​
<span>7.</span> 微流控与化学反应(00:06):深色背景下,玫红色的弧面边缘整齐排列着微小的表面液滴。
​
<span>8.</span> 古典文明陶器(00:07):古希腊/古代器皿边缘绘制的经典回形几何纹饰(Greek Key pattern)。
​
<span>9.</span> 早期视觉探索/走马灯(00:08):环形跑道上奔跑的骑士与马匹动画插画(致敬人类对运动视觉与电影起源的探索)。
​
<span>10.</span> 艺术绘画与质感色彩(00:09):充满张力的表现主义油画笔触与色块,此时文字首次出现:“There’s”。
​
<span>11.</span> 重现地球大气地平线(00:10):再次切回地球日出的晨昏弧线,呼应开篇。
​
<span>12.</span> 纺织工艺与刺绣纹理(00:11):细腻的红褐色提花织物与落叶图案,文字推进为:“more to”。
​
<span>13.</span> 地质矿物晶体切面(00:12):玛瑙/晶石内部层叠生长的自然纹路,文字定格:“discover”。
​
<span>14.</span> 地质岩层与风化脊线(00:13):历经亿万年风蚀形成的自然岩石山脊。
​
<span>15.</span> 显微镜下的生物维管束(00:14):植物茎干横切面在显微镜下的细胞构造(犹如微笑面孔的维管束群)。
​
<span>16.</span> 文艺复兴时期的科学手稿(00:15):泛黄羊皮纸上的古典素描图谱(类似达芬奇的植物与解剖研究笔记)。
​
<span>17.</span> 定格与揭晓(00:16 - 00:20):纯净深邃的背景中浮现优雅衬线字体:Opus 5.5随后切换为 Anthropic 标志性的图标与 Claude字样,最后在静谧的大气晨昏线中渐渐淡出。

哈哈,不装了,这是 G 哥花了 16 秒搞定的。

有些解读是对的,有些是不对的,留给大家找茬。但是有一个重点是不变的:内涵丰富。

视频的核心视觉语言和艺术隐喻:

  • 恒定的“地平线”
  • 跨越宏观到微观的“全尺度穿梭”
  • 科学与人文的融合

主要是想表达:

  • 探索,永无止境
  • 从容克制的力量感
  • Opus 5.5 的使命:作为人类拓展认知边界的“科学与探索引擎”

大家应该能感受到视频寓意了吧,不愧是我A,格局拉满!

Anthropic:源自古希腊语 ἄνθρωπος(ánthrōpos),意为 “人” 或 “人类” !可以理解为与人类相关的或以人类为中心的。

完蛋了,“上价值”这部分太长了,文章要写不完了!

我们快速推进!

第二条:减速!

这部分叫做“踩着油门减速”!

主要表达,发布前做了充分的对齐,只会提供帮助,不会危及人类。

这个事情的背景是:达里奥发起的减速计划,奥特曼、马斯克纷纷响应。

第三部分:秀肌肉!

说起基准,国模都可以第一,Opus5.5基本上都是第一名, 没毛病吧!

注意看编程智能体三项基准全部第一! 超过了 Fable 5.1 和 Astra!

高价值知识工作、跨学科推理、电脑操作、图表多模态识别和分析,全部第一!

只有自动化业务流程和科学探索部分低于 GPT-6!

所以,两个顶级模型怎么选,大家应该知道了吧

这里没有 DeepSWE,提都没提!

第四部分:价格!

首先从绝对数值上看,Opus5.5 相比上一代,加量还降价!

输入输出便宜 20%,缓存打了 4 折, Claude也开始降价了,真的少见!

整体来说会比上一代少消耗 40%!

我插一嘴:Opus5.5 的套餐配额明显比 Astra 耐用很多很多!

这一部分还有另外一张图:

单任务消耗!

可以看到它全方位优于 Opus 5!

成本要比 GPT-6 Astra 低很多,能力也不差。

第五部分:说人话!

Opus 4.6 之后不说人话的问题越来越严重。就是活干得很好,但是说的话越来越难懂,越来越不自然。

官方专门提出这一点,说明了两个问题,第一确实存在,第二个它们已经修改!

这一点也非常重要的,尤其是对于写作和阅读理解!

另外还有一点:增加 5 小时配额和重置!

背景信息,我就介绍到这里了。

如果要完整地了解这个模型,可以查看完整的博客内容和 230 页模型卡片:

链接:

www.anthropic.com/claude-opus…

anthropic.com/claude-opus…

每次写 200 多页模型卡片,也就只有 Anthropic 了!

X 上还有各种“哇哇哇”非常哇塞的实例,我就不放了,我主要放我自己测试的部分!

2、实测结果

我这次测试使用的是官方的Claude Code 桌面版+Pro订阅!

测试只用了 60% 的周配额,之前在 Opus 5 上用掉了 40%,用来改进之前的“坦克世界”。

花了一天多时间,测试得也挺充分的!

总的来说,没有一个让我失望的,每个都是抽卡一次,但是每次都发挥稳定,下限和上限都极高!

基于视觉的多模态推理

我先来一个小测试,作为开胃菜!

题目如下:

它的答案是:

第一枪打穿基地左侧的砖墙,第二枪直接打中老鹰,基地被摧毁,游戏结束(GAME OVER)。

完全正确!

我用全新的对话,连测 5 次全部正确。证明它确实理解了!

在此之前,除了 GPT-6,没有一个模型可以 100% 回答正确,GPT-5.6 不行,Fable 5 也不行!

这个问题其实很简单,但是很多死记硬背的模型容易犯经验主义错误。因为经典的坦克大战打两枪基地不会炸。而我这个图片是我自己做的,改变了墙的对应关系。

赛博清明上河图

这是我主打的例子,很抽象,有些人可能不知道在测什么。但是看了 Opus5.5 的例子,很多人都 get 到了!

Opus5.5 空间纵深感无敌,赛博朋克风格和清明上河图风格融合得也很好。前排的古建筑和后排的现代建筑相映成趣。 画面中的人物、动物、建筑,细节非常丰富。

我的结论是:Opus 一直是这个项目的记录保持者,也是这个比赛的终结者!

这个题目最能考验模型的空间感,审美,创造力和融合能力。简单来说,就是这个题目没法死记硬背,现实世界没有标准答案,所以也很难做针对性训练。

所以这是一个好题难题!

很多人可能不喜欢赛博朋克风,那么就来一个原汁原味的风格吧!

我让 Opus 抛弃赛博朋克的概念,重新画一个它想象中的清明上河图!

意境、氛围、风格、配乐、建筑、山水、人物,一气呵成,无需多言!

虽然还有一些细节问题,但是瑕不掩瑜!

这 TM 都是一轮的结果哦,我没有反复修改过,也没有抽卡好多次。就是一次成型,你要微调也是指哪打哪。

游戏复刻

每个模型发布,我都会让它们复刻一下超级玛丽。这个 8090 的经典游戏,其实网上都有比较详细的源代码。但是很多模型真的是抄都抄不好。具体如何不好,请参考小米最新版 MiMo 以及其他。

下面是 Opus5.5 的结果:

我严重怀疑它拿原版糊弄我! 地图、角色、玩法、隐藏蘑菇、地下通道,几乎还原了 95%。

唯一能发现不对劲的地方是:

长大之后,下半身好像不协调!

另外我还让它做了一个不同风格的超级玛丽:

现代化的宽屏的赛博风格的超级玛丽! 它使用了全新的自动生成的素材和配音,还加了一些玩法,比如弹簧、飞鸟等。

也是一句话的事情。

好像也没啥好评论的了,Opus 5.5 又杀死了比赛!

然后我给大家一个关键数据:

Opus5.5 完成这个例子大约 23 分钟,其中写代码约 17 分钟,测试和修 bug 约 6 分钟。

我再给一些对比数据:

Step5 搞了 6 小时,豆包 3 小时,其它模型一般 1 小时起步!

效果最好的是 Opus5.5!

也就是说,O哥是又快又好!

贵么?按套餐来算也不贵,可能便宜到离谱,约等于不要钱!

一个月 20 美金,一周 5 美金,分成 10 个五小时周期……开发这个例子只用了五小时周期里的一部分而已。

天文机械表

这个例子的难点是一次性提出了大量的需求,脑子不好的模型就会丢三落四。当然要画的界面也有一定的难度。

Opus5.5 的结果如下:

相比它之前的版本,这个表的外形和表带设计有很大的提升,里面的指针全部正常!

月相的表盘和以往有点不一样,我查过了,这也是一种正确的表达方式。

另外这个表上的"旋钮"不是摆设,是可以按的!!!

这个例子,Claude 模型很早之前就几乎满分了,这次表现依旧稳定。

UI 设计感觉更上一层楼了!

甲维斯的车库

这个例子主要是测试网页复刻和 3D 建模能力! 我给是给了一个参考页面和角色图片的!

Opus 的结果如下:

网页复刻方面,自然是没啥大毛病,所有布局图、内容、控件都是按照参考图来复刻的。

钢铁侠战甲这部分表现突出,它在保持四色不变的情况下,设计了四套颜色,每套颜色包含两种颜色,黑金套装也很酷。而且面罩是可以打开和关闭的。之前无人做到,也无人想到。

建模方面,曲面建模和渲染效果都很好。

唯一的缺点是轮廓方面还是差点意思:

材质、玻璃效果、反光、曲线、位置关系,都很好。

它应该是唯一一个自己处理好屁股和座位之间关系、头顶和车顶之间关系,没有明显穿模的模型。

但是建模外形还是和目标车型有不小的差别!

即便给参考图,也无法做到 1:1 建模!

这一个例子,Opus 5.5 还没有登顶。但是依旧比其他模型强很多!

做了一个简单的对比图:

Opus5.5这个大头有点搞笑,但是整体细节和效果优势还是很明显的。 其他人做的样“卤蛋”!

建模方便比Fable5也是强很多!

关键是“O哥”这个能飞啊!

除了上面的标准测试之外,我还花了两个小时开发了两款完成度比较高的游戏。

一个是模仿“战争雷霆”的:

被我抓到一个 bug,奇怪的屋顶,已经修好!

一个是类似卡丁车的沙滩赛车:

一个侧重真实的物理效果,一个是侧重角色、玩法、美术设计。

Opus5.5 基本上在一轮一个小时内给出一个完成度较高、完全可以玩的游戏。

两个游戏,全部由代码完成,没有使用任何外部素材。

最终大小不超过 1M,其中大部分是 three.js,它写的核心代码非常精简!

我体验下来,同样是 Agent,Claude+Opus5.5 完全是另一个级别了。

它确实有自主完成一个项目的能力。包括任务分解、数据采集、编码落地、测试、修改、迭代升级、视觉验证。

你根本不需要刻意去写 SPEC 和设置 GOAL! 你只要告诉它核心目标,以及你的核心需求即可,细节它按最优路径来完成。

那些自以为是的研究八股提示词的人真的可以收手了,你们的提示词,就是它的短板,直接限制了它的上限。当然特别的场景除外,有些场景就是非常严苛的。

我主要表达的是,要学会放手。

一个项目如果从零开始,最高效的方式是让它自己规划,效率最高,效果最好。一个新功能也是这样的。老项目的维护升级,也只要说清楚核心规则,探讨好方案,说明注意点,制定总体目标即可。

举个栗子

我简单举一个例子,让它搞了一个有点难度的项目。

我根本没玩过这个游戏,我自然也不知道具体的玩法和手感了。

我的逻辑是这样的:让它自己去探索游戏规则,然后获取官方截图。

这样玩法和视觉效果都有了,其他部分就看它的落地能力了。

它吃透规则的效率和开发效率比我高 100 倍。

另外,这个项目是没有源代码可以抄的,只有描述,非常考验落地能力。

最终结果肯定无法做到一模一样,但是完成度真的还不错,远超同行。

我发现它处理图片非常溜,它会一次性把所有图片收集拼接好。

开发和验证节奏也非常好,重点是自己发现问题和修正问题的能力很强。

因为这涉及到物理模拟,所以它先看了一下我的显卡,做了一个规划,写了一个测试页。它要充分考虑真实感和显卡性能之间的平衡。

然后自己看截图,自己修改。

看它的开发过程非常享受,精准有序,粒度和节奏非常好!

而且最让我惊奇的是它写的AI 玩家都很厉害,它自己玩游戏也很厉害,甚至运镜都特别厉害……!

我找角度截图录视频,完全比不过它!

真的有点“人工智能”的感觉了!

现在其他模型也会有这样的过程,但是很多都是形式大于内容,反复思考浪费了大量时间和 tokens,最后结果还很差。

毫不夸张地说,Opus5.5 一小时的工作量,是顶级国产模型 10 小时的量。

当然,它们即便干 100 小时,也干不到 Opus5.5 的效果,这个是能力上限决定的。

你们体会过干 6 小时,给你一坨的痛苦么?我体会过很多次!

由于“O哥”太优秀,所以我基本上没放太多对比图,放了就有点“侮辱人”的意思了。免得说我拉踩、崇洋媚外啥的!

我写这篇文章,是没有任何好处的,就是自己想写,爱写。

老粉应该很清楚我的为人和其它模型的效果。

国内外的几十个模型的所有测试结果,我都放在了网上。

要提示词的,要源代码的,要看对比效果的都可以移步 topai。

地址:

topai.jarvisuni.com

这里不光有同一个例子,不同模型的对比效果。

还有同一个例子,不同版本的对比效果!

还有同一个模型,不同场景的对比效果。

这不是权威测试,但是可以给大家一个直观的参考!

兴奋过后就会有点虚脱,文章写完了,我休息一下。展示过的例子,我都会逐步发布。

能看到这里的都是用心在看了,可以花一秒钟,点个赞!

不枉我花了两天时间来测试和写文章!

节日快乐,收工收工!