2026年7月24日星期五

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半

Anthropic推出Claude Opus 5,智能水平接近顶级模型Fable 5,但输入每百万token仅5美元,输出25美元,价格减半。该模型在ARC-AGI 3评测中分数为第二名三倍,并能自主编写视觉管线解决无图建模任务,适合开发者与AI高级用户。需注意其网络安全能力虽强但攻击操作仍受限。

Tags:

又是半夜,Anthropic 发新模型了:Claude Opus 5。

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半

我第一反应是,哦,Opus 4.8 的例行升级呗,版本号往上走一格,跑分涨几个点,发条博客,正常操作。这两年大模型发布会看多了,多少有点麻了。

结果我点进官方博客,看到中间一个案例的时候,还是有被惊艳到。

这个案例我先按住不讲,放到后面,咱先看完铺垫,才能体会到那种「卧槽还能这样?」的感觉。

先把基本盘说清楚。

Opus 5 是 Anthropic 家 Claude 5 系列的新成员,官方的定位很直白,智能水平接近他们最顶的旗舰 Fable 5,但价格只有一半。

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半

输入 5 美元每百万 token,输出 25 美元,跟上一代 Opus 4.8 一模一样的价。

而且它现在是 Claude Max 的默认模型,也是 Pro 订阅里能用到的最强模型。

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半

至于跑分,先看整体跑分:

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半

其它的跑分,我建议你按顺序看,因为它是一层比一层离谱的。

第一层,Frontier-Bench,一个考验模型干真实软件工程活的评测。

Opus 5 超过了所有模型,分数是自家上一代 Opus 4.8 的两倍还多,而且单个任务的成本反而更低。嗯,不错,但也就是「新模型该有的样子」。

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半

第二层,CursorBench,开到最大力度的时候,它跟旗舰 Fable 5 的峰值分数只差 0.5%。成本,一半。这就开始有点意思了,等于你花中杯的钱,喝到了大杯还差一口的量。

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半

第三层,ARC-AGI 3。这个评测专门考模型解没见过的新题,最防「背题家」的一个测试。Opus 5 的分数,是第二名的三倍。

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半

三倍???有点离谱了。

第四层,OSWorld 2.0,电脑操作评测,就是让模型真的去点鼠标敲键盘干活的那种。Opus 5 在任何成本档位上都赢了所有对手,并且用三分之一多一点的钱,超过了 Fable 5 的最好成绩。

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半

到这我以为已经到顶了。

结果真正让人绷不住的,是前面说的那个案例。

在 Frontier-Bench 的一个任务里,测试人员给了 Opus 5 一张机械零件的图纸,让它写代码,在 FreeCAD 里把这个零件重建成 3D 模型。

听着不难对吧,看图建模嘛。

但这个任务里藏了一个坑,模型被故意剥夺了直接查看这张图的能力。图就在那,它「看」不了。

正常剧本是什么,模型试几次,发现看不到图,然后摊手说抱歉我无法访问该图片。同样条件下,其他家的模型试了五次,全都没做出来。

Opus 5 干了件什么事呢。它发现自己看不了图之后,自己写了一套计算机视觉的处理管线,从原始像素里硬生生把几何信息抠了出来,然后照着抠出来的数据,把整个零件重建了。

而且不是瞎猫碰上死耗子,是稳定复现。

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半

我跟你说,我看到这段的时候真的坐直了。因为这已经不是「答题答得好」的范畴了。这是它发现手里没有工具,然后,自己造了一个工具。

你想想看,人类学里判断智能的经典标志是什么,是造工具。几百万年前某个原始人捡起石头砸开坚果的那一下,被我们追认成了智慧的起点。而现在,一个模型在评测里被掐断了眼睛,它的反应不是认输,是给自己造了一双眼睛。

这个行为模式,比任何一个跑分数字都让我觉得不一样了。

顺着这个再聊聊,因为官方博客里还有两个小故事,跟这个是一个味的。

一个是修 bug。给它一个流行开源包管理器里的真实 bug,Opus 5 不光找到了根因,还顺手修掉了一个社区自己打的补丁都漏掉的边缘情况。对比组的某个竞品模型,只把表面症状糊上了,然后汇报说 bug 已解决。

一个更工作真实感。某家交易公司的工程师,用 Opus 5 在一个会话里给新交易所搭好了整条市场数据流。之前的模型给再详细的计划都干不完这个活。中间有个细节特别妙,没有现成的实时数据流可以用来验证代码对不对,Opus 5 就自己搭了个测试环境,自己验证自己解析数据的代码写没写对。

发现规律没有。这三个故事的共同点,不是聪明,是它会怀疑自己,然后想办法验证自己。

说实话,我一直觉得大厂官方博客里的用户证言要打个七折听,都是挑最好的讲。但这三个案例指向的是同一种行为特质,也挺耐人寻味的,就不知道是不是有意而为之。

对齐和安全这块也提一嘴,因为这次有几个数字挺有信息量。

Anthropic 自己的自动化行为审计里,Opus 5 是他们至今最「对齐」的模型,欺骗行为发生率最低,最不容易被人套路着去干坏事,也最不爱做那种覆水难收的鲁莽操作。整体不对齐行为的评分是 2.3,近期所有模型里最低。

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半

网络安全这边更有意思。

Anthropic 明确说了,他们刻意没有拿网络攻击类任务去训练 Opus 5。但因为模型整体变强了,它找安全漏洞的能力还是水涨船高,已经接近他们那个管控最严的 Mythos 5 了。不过在把漏洞变成真正能用的攻击这一步上,还差得远。

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半

安全分类器的策略也变了,比 Fable 5 少拦大概 85% 的请求,允许你在源代码里找漏洞,但渗透测试、写 exploit 这些还是会被挡,被挡的请求默认回落到 Opus 4.8 处理。

这个「模型能力放开、危险动作收紧」的分层思路,反正我觉得是目前看到比较成熟的做法了。

说实话,以上全部是官方口径加我的读后感,我自己还没来得及深度跑这个模型,跑分和真实体感之间隔着一条河,这个道理大家都懂。

可以先看官方的 demo,他们放了两段视频,一段是空气流过气动和非气动物体,一段是可交互的细胞图解,给大家感受下,他们说的极强的渲染能力。

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半
已关注
关注
重播 分享
JackCui

0/0

00:00/00:25
进度条,百分之0
00:00
/
00:25
00:25
全屏

倍速播放中

继续观看

Claude Opus 5深夜发布,比Fable 5更强!价格减半!

转载
,
Claude Opus 5深夜发布,比Fable 5更强!价格减半!
JackCui
已同步到看一看写下你的评论

Claude Opus 5发布 性能媲美旗舰Fable 5 价格仅一半
已关注
关注
重播 分享
JackCui

0/0

00:00/00:19
进度条,百分之0
00:00
/
00:19
00:19
全屏

倍速播放中

继续观看

Claude Opus 5深夜发布,比Fable 5更强!价格减半!

转载
,
Claude Opus 5深夜发布,比Fable 5更强!价格减半!
JackCui
已同步到看一看写下你的评论

匹配 Fable 5 性能,价格只有其一半的 Claude Opus 5,挺香的。

我先去烧烧额度了,等我拿它干几天真活,有惊喜或者有坑,再回来跟大家汇报。

好了,本期内容就是这么多,我是 Jack,我们下期再见~

没有评论:

发表评论

AI剪辑实战课从一句话指令到完整成片单篇1。99美元起

这套AI剪辑实战课共6节,教你用自然语言驱动ChatCut和Codex完成从口播剪辑到教学动画与产品宣传片的完整工作流。单篇1.99美元起,月卡5.99美元,年卡29.00美元,适合自媒体创作者、小团队及希望摆脱反复返工的剪辑新手。课程强调人工检查与项目保留,不依赖一键生成。 T...