Anthropic于凌晨发布Claude Opus 5,已全量上线,上下文100万,知识截止2026年5月。输入每百万Token 5美元,输出25美元,价格与Opus 4.8持平,仅为Fable 5的一半。适合开发者、产品经理用于编程、Agent任务和方案Review。实测显示Opus 5在工具使用和任务完成率上接近Fable 5,但方案规划仍弱于Fable 5。注意Claude Code需简化提示词,建议运行doctor命令清理冗余规则。
Tags:
Anthropic给Opus 5的定位非常清楚,它在很多领域已经逼近Fable 5了。
就像上面那张跑分图。
甚至在ARC-AGI-3上,是最夸张的,Opus 5是30.2%,GPT-5.6 Sol是7.8%,Opus 4.8只有1.5%,可惜Fable 5没有这块的跑分,不知道能到都多少。
它相当于直接做到了第二名的接近四倍。
这种抽象推理、动态适应和陌生任务泛化,一直是模型最容易露怯的。
因为过去的模型经常能复述世界,能模仿答案,但是一旦规则没见过,立刻开始犯蠢了,所以ARC-AGI-3,在现在的时间点,挺能代表一个模型真正的智力和泛化程度的。
甚至在AA的跑分上,居然比Fable 5还要强。
但是价格只有Fable 5的一半。
输入每百万Token 5美元,输出每百万Token 25美元,价格跟Opus 4.8一样。
还有一个Fast Mode,速度大约提升到2.5倍,价格翻倍。
所以如果只问Opus 5有没有把Fable 5彻底淘汰,答案很简单,暂时没有。
可如果问它是不是当前最适合大规模拿来干活的Claude,我个人已经准备直接切了。
尤其是那些过去觉得Fable最好用,又实在舍不得额度,最后只能咬牙退回Opus 4.8的任务,主要还是每周的Token额度Fable 5只能用50%,另外50%不用光,那是真的就浪费掉了。
这次终于有一个舒服得多的中间解了,50%额度的Claude Fable 5+50%额度的Claude Opus 5,而且效果确实不错。
比如我今天重构了一下AIHOT的整个API、RSS还有Skill,那玩意其实之前推出的太仓促了,效果不是很好,所以呢,就是为了让大家请求起来体验更好,同时也降低对我服务器的请求次数,让我压力更小点,就重搞了一下。
因为Fable 5我的额度用完了,于是我用了一个邪修的方式,直接让ChatGPT网页版的GPT-5.6 Sol Pro来干了,这个其实是一个小技巧,就是在Review深度、思考深度上,都比Codex本地的Max或者Ultra更好用,而且,还不烧你的Codex额度。
这个东西搞完以后,我其实把方案扔给了Codex上的GPT-5.6 Sol、Kimi K3、Opus 4.8,让三者来深度Review,看看这个方案对不对,是不是能解决本质问题,还有没有可以优化的空间。
这三者给的答复几乎就是没啥问题,只能硬挑一点小问题。
然后我就直接给GPT-5.6 Sol Ultra设了个目标,让他自己去干了,大概3个小时,不知道开了多少个Agent,干完了。
又用K3、GPT-5.6 Sol自己开了对抗式审查,看看有没有BUG和漏洞啥的,基本也就一些小的无关痛痒的,我以为就没啥问题了。
结果刚刚用Claude Opus 5跑了一下,给我吓得一身冷汗,验证了一下,确实对的,赶紧改。。。
而且这个问题还挺严重的。。。
除了体验之外,又发现了漏洞。
第一个漏洞给我吓尿了,我现在看到什么击穿边缘缓存几个字我就PTSD,两周前被各种攻击爬流量给我账单干崩就是这么干出来的。。。
立马就直接开修去了。
确实能感觉到,更聪明一点,有一点Fable 5那个味了,虽然Fable 5经常看完我之前做的东西,就会跟我说,你之前做的是一坨屎,有更好的办法,我觉得你可以重构。。。
而且在配合Claude Design以后,我觉得UI设计的细节也变得更好了一些,比如为了配合新的API啥的上线,我就把Agent接入界面也给重做了一些,之前GPT-5.6 Sol真的设计的就是一坨屎,给我干完长这样,我人都麻了,我想骂人。
Opus 4.8设计了一版,也不是特别好看,晚上拿Claude Opus 5重设计了一下,正常多了。
写作这块大家也不用看了,继续拉完了。
依然还是Claude Opus 4.6最好。
文章第一张核心图,画的是一个Claude真正看到的完整上下文。
System Prompt里写着根据情况留下文档,Skill里写着禁止添加注释,用户又说做得跟旧版本一样。
模型当然可以理解,可它必须花思考Token去调和冲突,猜哪条优先,猜所谓旧版本到底包括哪些东西。
上下文越长,类似的小冲突越多。
所以呢,Anthropic把Claude 5时代的变化总结成六组心法:
过去给规则,现在给判断空间。
过去给大量示例,现在设计好接口。
过去把全部内容塞在最前面,现在按需展开。
过去在不同地方重复提醒,现在把工具说明写得简单清楚。
过去把记忆塞进CLAUDE.md,现在交给自动记忆。
过去只写一份简单规格,现在直接提供代码、测试、HTML原型和完整参考物。
其实你会发现,就是从手册制,你给模型规划好任务的方案,变成了设计Harness,设计一个让模型自己完成目标的工作环境。
真正强的Harness,会把状态、权限、约束和反馈做进环境里,把目标和判断留给模型。
X上的大佬其实也提到了。
我因为一直几乎是裸的,除了几个自己的Skills,几个MCP,几个官方的插件,一些规范化的文档,其实就没啥了,所以我一上手的体验反而非常好。
这里其实官方也感受到了这个问题,所以他们非常推荐大家在Claude Code里,先运行一下/doctor这个命令,来帮大家清除一些垃圾。
是时候,简化你的Agent和工作流了,模型,会吞噬一切。
最后,在今天这个时间点,也简单的再给大家分享一下我的工作流和使用的模型吧。
大体量重构方案规划和底层研究:Claude Fable 5。
常规方案设计+Review:Claude Opus 5。
代码执行+BUG修复:Claude Opus 5或GPT-5.6 Sol(看人在电脑前还是不在电脑前,在电脑前我选Claude,人在外面我选GPT)
大型代码Review:ChaGPT网页版上的GPT-5.6 Sol Pro。
UI设计:Claude Design + Claude Opus 5。
部分项目的展示站:Kimi K3(直出前端太好看了)。
大概就是这样。
感觉这个列表,未来会轮动的越来越快,模型进化的速度,好像迈过了某种奇点。
就像Grok在收购了Cursor之后,模型能力瞬间起飞,迭代速度也变得极其恐怖,接下来,真的就是两周一更新了。
几乎每天一睁眼,我们就有新模型用,我们的能力边界,又再进一步扩宽。
真的,好像没有比这更幸福的事了。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。
>/ 作者:卡兹克
>/ 投稿或爆料,请联系邮箱:wzglyay@virxact.com
没有评论:
发表评论