Anthropic 正式发布 Claude Opus 5。一句话版结论:价格按 Opus 档位卖,表现在多条硬核榜上咬住甚至反超 Fable 5。
定价方面,百万 token 仍是输入 5 美元、输出 25 美元,相对 Opus 4.8 提质不加价,大约是 Fable 5 的一半。CursorBench 最高努力设置下,峰值只比 Fable 5 低约 0.5%。Frontier-Bench 上它反超包括 Fable 5 在内的对手,分数约是上一代 Opus 4.8 的两倍。上线半天,社区就把游戏、3D、CAD、自建测试一类重活跑了一轮;泄露期「简直像 Fable 6」的说法,正式版出来后反而更响了。
官方 demo 也偏「能看出来工程量」:实时气流路径的风洞、可 360 度旋转且核糖体都画出来的 3D 细胞结构。同步变化不只在模型——Claude Code 系统提示词被砍掉八成以上,编码评测却没掉分。下面按实测、成本、跑分、产品改动四块拆开看。
实测速览:社区半天交卷
游戏与可交互场景
博主 am.will 开测前默认它是「便宜版 Fable」,测完改口「大错特错」:5 倍 Max 订阅额度只用了 27%,就做出他见过最好的 Rocket League 克隆,能玩,代码还开源在评论区。
OmedTheVibeCoder 做竞技场对决动画,评价从「以为会接近」变成「完全甩开」;「Fable 6」的说法正是看完这波结果后出来的。补完多模型对比后,他形容「差点从椅子上摔下来」——Opus 5 Max 直接打穿了自己原来的测试标尺,画面不像代码拼出来的截图,更像提示词进了图像模型,却吐出一整张能走进去的地图。
滑雪场景(Alex Ermolov):「和 Fable 5 打平,甩开其余测过的模型」,首遍无明显穿模,滑行物理也对。Minecraft 复刻(Chetaslua):「迄今为止最好的一次」。Unity 接入侧反馈偏「开挂」;连环机关场景里,物理环节与真实规律贴得更紧。
重约束 demo
Noema 的题更狠:单 HTML 文件,街区从 1945 变到 2055,建筑、车辆、店铺、人群、灯光、音效全跟年份走。effort 从 max 降到 high,仍把 Fable 5、GPT-5.6 Sol 压在后面,评语三个词:「是个怪物」。阿波罗点火升空一类片:喷焰到实时遥测基本靠程序生成,不是拼素材库。CAD / 机械设计方向,社区亦有多份「多项任务超过 Fable」的反馈。
教育向:Matt Shumer 给 @AlphaSchool 做的实时 AI 家教原型——Opus 5 管对话和方向,小型世界模型管实时渲染;还粗糙,但已能讲分数时同步在画板画图。
科学可视化侧有三羧酸循环 3D 网页 demo(Opus 5 Low Effort):模型只写原子清单与键表(含反应前后键级),几何交给优化器按键长、杂化、键角与排斥约束求解,再用 Three.js 渲染;代码单独抽出校验键长键角后再出片,反应过程与结构量都能对上。
实测小结: 在「能跑起来的复杂前端 / 游戏 / 物理场景」上,社区观感普遍是:不是小幅贴近 Fable 5,而是经常打平或反超,且首遍成品率偏高。
性价比对打:谁贵、谁对
atomic.chat:三道破坏题
题目统一:龙卷风卷场地、重锤砸楼、卡车压桁架桥。
| 模型 | 花费 | 结果(材料描述) |
|---|---|---|
| Opus 5 | 0.508 美元 | 三题全对 |
| Fable 5 | 约 Opus 5 的两倍 | 龙卷风卷不起地面物;楼在锤到前自塌;桥炸成木棍堆 |
| GPT 5.6 | 约 0.14 美元 | 最便宜,但锤子未碰到楼 |
| Kimi K3 | — | 水平与 GPT 5.6 接近 |
泄露期有质疑:Opus 5 单价低,token 烧太多,综合未必省。至少在这一组对照里,半价优势没有被「狂烧」吃光。
波音 747:交货速度 vs 验收标准
Victor M 的题:按公开数据,浏览器内重建可转可看的 747 三维模型。
| 维度 | Fable 5 | Opus 5 |
|---|---|---|
| 用时 | 42 分钟 | 71 分钟 |
| 代码量 | 4 文件 / 约 1000 行 | 20 模块 / 约 4000 行 |
| 渲染管线 | Puppeteer | Playwright |
| 渲染与镜头 | 17 轮、54 张截图 | 25 套镜头预设 |
| 验收方式 | 肉眼对图 | 正射轮廓 + 翼展、轴距、前缘扫掠角等 14 项公差核对 |
Opus 5 额外动作:前 43 分钟只渲素模,轮廓过关再贴皮;可单部件调试;6 视角拼成联系表。Victor M 结论:Fable 5 大约快 40%,尺寸表更好读;两边引用的都是同一套 747-400 数据,但 Fable 5 没把成模再量回去。
评测观察: 若只比「先交一张能看的图」,Fable 5 更快;若比「模型是否经得起公开数据回测」,Opus 5 的流程更完整。
官方与工程案例:同一条能力线
Frontier-Bench:零件图纸 → FreeCAD 重建,且不给直接看图接口。Opus 5 自写计算机视觉管道从像素抽几何,反复成功;同设定下其他模型五次未成。
开源包管理器真实 bug:社区补丁只压症状,它追到根因并修边缘情况。量化工程师搭新交易所实时行情:此前模型做不出;它发现无实时数据可验,就自建测试环境核对解析逻辑。
把这些和 747 案例放一起看,卖点不在「会写长代码」,而在更愿意自建校验闭环。
跑分与定价:半价咬住 Fable 5
价格: 百万 token 输入 5 美元 / 输出 25 美元(对齐 Opus 4.8 价位);约 Fable 5 一半。Fast 模式:两倍价换约 2.5 倍速。
关键榜单(源材料数字):
| 评测 | Opus 5 | 对照 |
|---|---|---|
| Frontier-Bench v0.1 | 43.3% | Fable 5 33.7%;Opus 4.8 21.1% |
| ARC-AGI-3 | 30.2% | GPT-5.6 Sol 7.8% |
| Human’s Last Exam(无工具) | 56.3% | Fable 5 56.5% |
| Human’s Last Exam(开工具) | 64.7% | Fable 5 63.9% |
| BrowseComp | 90.8% | Fable 5 87.4% |
| AA Coding Agent Index | 66.7% | Fable 5 65.8% |
| DeepSearchQA | 95% | Fable 5 94.7% |
| OSWorld 2.0 | 70.6% | Fable 5 66.1% |
读法简记:
- 编程硬核(Frontier-Bench): 明显领先 Fable 5,约为 Opus 4.8 的两倍级。
- 未见过的新问题(ARC-AGI-3): 30.2% 对 GPT-5.6 Sol 7.8%,近四倍;相对 Opus 4.8 为近 20 倍量级跃升(源文表述)。
- Human’s Last Exam: 无工具几乎持平(56.3% vs 56.5%);开工具 64.7% 略超 63.9%。
- 搜索 / Agent 索引: 小幅领先。
- 电脑操作 OSWorld 2.0: 70.6% vs 66.1%,官方称成本不到 Fable 5 三分之一。
Cursor 联创原话方向:Opus 价位,摸到接近 Fable 的性能。另:Anthropic 早先一版 FrontierCode 通告曾把更低分的 Opus 标成赢家,bug 已修。IMO 2026 满分、无外部工具。安全拦截预计触发频率较 Fable 5 降约 85%——体感上可能比单项分数更明显。
产品侧:Claude Code 提示词砍八成
同日,Anthropic 工程师 Thariq 披露上下文设计调整:Claude Code 系统提示词删超 80%,编码评测不降。删减对象明确是 Opus 5 / Fable 5 这代模型。
规则从「默认不写注释」改为「贴合周围代码风格,匹配注释密度、命名与习惯」。工具侧少堆示例、多收紧接口(如 Todo 仅「待处理 / 进行中 / 已完成」)。上下文改渐进式披露:代码审查等低频说明拆成技能文件按需加载;记忆从手写 CLAUDE.md 扩展为模型自判可记内容并落盘。
评测含义: 这不是营销彩蛋,而是配套结论——模型判断力上来后,长系统提示词这层脚手架可以拆。
外部声音与总评
马斯克晒 FrontierCode 性价比图,称仅 Grok 4.5 与 Opus 5 在帕累托前沿;并称 Grok 4.5 弱于 Opus 5,但是同等性能下最低价档之一。这是竞品视角,和官方榜、社区实测并列参考即可。
总评
| 维度 | 简评 |
|---|---|
| 定价 | Opus 档价,约 Fable 5 一半;Fast 两倍价换 2.5 倍速 |
| 硬核编程榜 | Frontier-Bench 明显占优 |
| 通用难题 / 工具题 | HLE 持平或微超;ARC-AGI-3 拉开大差距 |
| 社区场景 demo | 游戏 / 3D / 重约束 HTML 反馈强 |
| 工程自检 | 747、FreeCAD、自建测试环境等案例突出 |
| 交付速度 | 个别对照里 Fable 5 更快(约 40%) |
| 产品配套 | Claude Code 提示词大幅精简,评测不掉 |
一句话: 若你按「半价能不能顶上 Fable 5 那一档」来选,现有跑分和社区实测给出的答案偏是——在多项任务上可以咬住,编程与自检链路甚至更敢打;代价是部分场景耗时更长、代码更重。护栏触发率下降约 85%,对日常写代码的体感也可能不小。