Anthropic推出Claude Opus 5,智能水平接近顶级模型Fable 5,但输入每百万token仅5美元,输出25美元,价格减半。该模型在ARC-AGI 3评测中分数为第二名三倍,并能自主编写视觉管线解决无图建模任务,适合开发者与AI高级用户。需注意其网络安全能力虽强但攻击操作仍受限。
Tags:
又是半夜,Anthropic 发新模型了:Claude Opus 5。
我第一反应是,哦,Opus 4.8 的例行升级呗,版本号往上走一格,跑分涨几个点,发条博客,正常操作。这两年大模型发布会看多了,多少有点麻了。
结果我点进官方博客,看到中间一个案例的时候,还是有被惊艳到。
这个案例我先按住不讲,放到后面,咱先看完铺垫,才能体会到那种「卧槽还能这样?」的感觉。
先把基本盘说清楚。
Opus 5 是 Anthropic 家 Claude 5 系列的新成员,官方的定位很直白,智能水平接近他们最顶的旗舰 Fable 5,但价格只有一半。
输入 5 美元每百万 token,输出 25 美元,跟上一代 Opus 4.8 一模一样的价。
而且它现在是 Claude Max 的默认模型,也是 Pro 订阅里能用到的最强模型。
至于跑分,先看整体跑分:
其它的跑分,我建议你按顺序看,因为它是一层比一层离谱的。
第一层,Frontier-Bench,一个考验模型干真实软件工程活的评测。
Opus 5 超过了所有模型,分数是自家上一代 Opus 4.8 的两倍还多,而且单个任务的成本反而更低。嗯,不错,但也就是「新模型该有的样子」。
第二层,CursorBench,开到最大力度的时候,它跟旗舰 Fable 5 的峰值分数只差 0.5%。成本,一半。这就开始有点意思了,等于你花中杯的钱,喝到了大杯还差一口的量。
第三层,ARC-AGI 3。这个评测专门考模型解没见过的新题,最防「背题家」的一个测试。Opus 5 的分数,是第二名的三倍。
三倍???有点离谱了。
第四层,OSWorld 2.0,电脑操作评测,就是让模型真的去点鼠标敲键盘干活的那种。Opus 5 在任何成本档位上都赢了所有对手,并且用三分之一多一点的钱,超过了 Fable 5 的最好成绩。
到这我以为已经到顶了。
结果真正让人绷不住的,是前面说的那个案例。
在 Frontier-Bench 的一个任务里,测试人员给了 Opus 5 一张机械零件的图纸,让它写代码,在 FreeCAD 里把这个零件重建成 3D 模型。
听着不难对吧,看图建模嘛。
但这个任务里藏了一个坑,模型被故意剥夺了直接查看这张图的能力。图就在那,它「看」不了。
正常剧本是什么,模型试几次,发现看不到图,然后摊手说抱歉我无法访问该图片。同样条件下,其他家的模型试了五次,全都没做出来。
Opus 5 干了件什么事呢。它发现自己看不了图之后,自己写了一套计算机视觉的处理管线,从原始像素里硬生生把几何信息抠了出来,然后照着抠出来的数据,把整个零件重建了。
而且不是瞎猫碰上死耗子,是稳定复现。
我跟你说,我看到这段的时候真的坐直了。因为这已经不是「答题答得好」的范畴了。这是它发现手里没有工具,然后,自己造了一个工具。
你想想看,人类学里判断智能的经典标志是什么,是造工具。几百万年前某个原始人捡起石头砸开坚果的那一下,被我们追认成了智慧的起点。而现在,一个模型在评测里被掐断了眼睛,它的反应不是认输,是给自己造了一双眼睛。
这个行为模式,比任何一个跑分数字都让我觉得不一样了。
顺着这个再聊聊,因为官方博客里还有两个小故事,跟这个是一个味的。
一个是修 bug。给它一个流行开源包管理器里的真实 bug,Opus 5 不光找到了根因,还顺手修掉了一个社区自己打的补丁都漏掉的边缘情况。对比组的某个竞品模型,只把表面症状糊上了,然后汇报说 bug 已解决。
一个更工作真实感。某家交易公司的工程师,用 Opus 5 在一个会话里给新交易所搭好了整条市场数据流。之前的模型给再详细的计划都干不完这个活。中间有个细节特别妙,没有现成的实时数据流可以用来验证代码对不对,Opus 5 就自己搭了个测试环境,自己验证自己解析数据的代码写没写对。
发现规律没有。这三个故事的共同点,不是聪明,是它会怀疑自己,然后想办法验证自己。
说实话,我一直觉得大厂官方博客里的用户证言要打个七折听,都是挑最好的讲。但这三个案例指向的是同一种行为特质,也挺耐人寻味的,就不知道是不是有意而为之。
对齐和安全这块也提一嘴,因为这次有几个数字挺有信息量。
Anthropic 自己的自动化行为审计里,Opus 5 是他们至今最「对齐」的模型,欺骗行为发生率最低,最不容易被人套路着去干坏事,也最不爱做那种覆水难收的鲁莽操作。整体不对齐行为的评分是 2.3,近期所有模型里最低。
网络安全这边更有意思。
Anthropic 明确说了,他们刻意没有拿网络攻击类任务去训练 Opus 5。但因为模型整体变强了,它找安全漏洞的能力还是水涨船高,已经接近他们那个管控最严的 Mythos 5 了。不过在把漏洞变成真正能用的攻击这一步上,还差得远。
安全分类器的策略也变了,比 Fable 5 少拦大概 85% 的请求,允许你在源代码里找漏洞,但渗透测试、写 exploit 这些还是会被挡,被挡的请求默认回落到 Opus 4.8 处理。
这个「模型能力放开、危险动作收紧」的分层思路,反正我觉得是目前看到比较成熟的做法了。
说实话,以上全部是官方口径加我的读后感,我自己还没来得及深度跑这个模型,跑分和真实体感之间隔着一条河,这个道理大家都懂。
可以先看官方的 demo,他们放了两段视频,一段是空气流过气动和非气动物体,一段是可交互的细胞图解,给大家感受下,他们说的极强的渲染能力。
匹配 Fable 5 性能,价格只有其一半的 Claude Opus 5,挺香的。
我先去烧烧额度了,等我拿它干几天真活,有惊喜或者有坑,再回来跟大家汇报。
好了,本期内容就是这么多,我是 Jack,我们下期再见~
没有评论:
发表评论