AI最新资讯 275

Claude Opus 5 评测:半价咬住 Fable 5,实测与跑分怎么看

Anthropic 正式发布 Claude Opus 5。一句话版结论:价格按 Opus 档位卖,表现在多条硬核榜上咬住甚至反超 Fable 5。

定价方面,百万 token 仍是输入 5 美元、输出 25 美元,相对 Opus 4.8 提质不加价,大约是 Fable 5 的一半。CursorBench 最高努力设置下,峰值只比 Fable 5 低约 0.5%。Frontier-Bench 上它反超包括 Fable 5 在内的对手,分数约是上一代 Opus 4.8 的两倍。上线半天,社区就把游戏、3D、CAD、自建测试一类重活跑了一轮;泄露期「简直像 Fable 6」的说法,正式版出来后反而更响了。

官方 demo 也偏「能看出来工程量」:实时气流路径的风洞、可 360 度旋转且核糖体都画出来的 3D 细胞结构。同步变化不只在模型——Claude Code 系统提示词被砍掉八成以上,编码评测却没掉分。下面按实测、成本、跑分、产品改动四块拆开看。

实测速览:社区半天交卷

游戏与可交互场景

博主 am.will 开测前默认它是「便宜版 Fable」,测完改口「大错特错」:5 倍 Max 订阅额度只用了 27%,就做出他见过最好的 Rocket League 克隆,能玩,代码还开源在评论区。

OmedTheVibeCoder 做竞技场对决动画,评价从「以为会接近」变成「完全甩开」;「Fable 6」的说法正是看完这波结果后出来的。补完多模型对比后,他形容「差点从椅子上摔下来」——Opus 5 Max 直接打穿了自己原来的测试标尺,画面不像代码拼出来的截图,更像提示词进了图像模型,却吐出一整张能走进去的地图。

滑雪场景(Alex Ermolov):「和 Fable 5 打平,甩开其余测过的模型」,首遍无明显穿模,滑行物理也对。Minecraft 复刻(Chetaslua):「迄今为止最好的一次」。Unity 接入侧反馈偏「开挂」;连环机关场景里,物理环节与真实规律贴得更紧。

重约束 demo

Noema 的题更狠:单 HTML 文件,街区从 1945 变到 2055,建筑、车辆、店铺、人群、灯光、音效全跟年份走。effort 从 max 降到 high,仍把 Fable 5、GPT-5.6 Sol 压在后面,评语三个词:「是个怪物」。阿波罗点火升空一类片:喷焰到实时遥测基本靠程序生成,不是拼素材库。CAD / 机械设计方向,社区亦有多份「多项任务超过 Fable」的反馈。

教育向:Matt Shumer 给 @AlphaSchool 做的实时 AI 家教原型——Opus 5 管对话和方向,小型世界模型管实时渲染;还粗糙,但已能讲分数时同步在画板画图。

科学可视化侧有三羧酸循环 3D 网页 demo(Opus 5 Low Effort):模型只写原子清单与键表(含反应前后键级),几何交给优化器按键长、杂化、键角与排斥约束求解,再用 Three.js 渲染;代码单独抽出校验键长键角后再出片,反应过程与结构量都能对上。

实测小结: 在「能跑起来的复杂前端 / 游戏 / 物理场景」上,社区观感普遍是:不是小幅贴近 Fable 5,而是经常打平或反超,且首遍成品率偏高。

性价比对打:谁贵、谁对

atomic.chat:三道破坏题

题目统一:龙卷风卷场地、重锤砸楼、卡车压桁架桥。

模型 花费 结果(材料描述)
Opus 5 0.508 美元 三题全对
Fable 5 约 Opus 5 的两倍 龙卷风卷不起地面物;楼在锤到前自塌;桥炸成木棍堆
GPT 5.6 约 0.14 美元 最便宜,但锤子未碰到楼
Kimi K3 水平与 GPT 5.6 接近

泄露期有质疑:Opus 5 单价低,token 烧太多,综合未必省。至少在这一组对照里,半价优势没有被「狂烧」吃光。

波音 747:交货速度 vs 验收标准

Victor M 的题:按公开数据,浏览器内重建可转可看的 747 三维模型。

维度 Fable 5 Opus 5
用时 42 分钟 71 分钟
代码量 4 文件 / 约 1000 行 20 模块 / 约 4000 行
渲染管线 Puppeteer Playwright
渲染与镜头 17 轮、54 张截图 25 套镜头预设
验收方式 肉眼对图 正射轮廓 + 翼展、轴距、前缘扫掠角等 14 项公差核对

Opus 5 额外动作:前 43 分钟只渲素模,轮廓过关再贴皮;可单部件调试;6 视角拼成联系表。Victor M 结论:Fable 5 大约快 40%,尺寸表更好读;两边引用的都是同一套 747-400 数据,但 Fable 5 没把成模再量回去。

评测观察: 若只比「先交一张能看的图」,Fable 5 更快;若比「模型是否经得起公开数据回测」,Opus 5 的流程更完整。

官方与工程案例:同一条能力线

Frontier-Bench:零件图纸 → FreeCAD 重建,且不给直接看图接口。Opus 5 自写计算机视觉管道从像素抽几何,反复成功;同设定下其他模型五次未成。

开源包管理器真实 bug:社区补丁只压症状,它追到根因并修边缘情况。量化工程师搭新交易所实时行情:此前模型做不出;它发现无实时数据可验,就自建测试环境核对解析逻辑。

把这些和 747 案例放一起看,卖点不在「会写长代码」,而在更愿意自建校验闭环。

跑分与定价:半价咬住 Fable 5

价格: 百万 token 输入 5 美元 / 输出 25 美元(对齐 Opus 4.8 价位);约 Fable 5 一半。Fast 模式:两倍价换约 2.5 倍速。

关键榜单(源材料数字):

评测 Opus 5 对照
Frontier-Bench v0.1 43.3% Fable 5 33.7%;Opus 4.8 21.1%
ARC-AGI-3 30.2% GPT-5.6 Sol 7.8%
Human’s Last Exam(无工具) 56.3% Fable 5 56.5%
Human’s Last Exam(开工具) 64.7% Fable 5 63.9%
BrowseComp 90.8% Fable 5 87.4%
AA Coding Agent Index 66.7% Fable 5 65.8%
DeepSearchQA 95% Fable 5 94.7%
OSWorld 2.0 70.6% Fable 5 66.1%

读法简记:

  • 编程硬核(Frontier-Bench): 明显领先 Fable 5,约为 Opus 4.8 的两倍级。
  • 未见过的新问题(ARC-AGI-3): 30.2% 对 GPT-5.6 Sol 7.8%,近四倍;相对 Opus 4.8 为近 20 倍量级跃升(源文表述)。
  • Human’s Last Exam: 无工具几乎持平(56.3% vs 56.5%);开工具 64.7% 略超 63.9%。
  • 搜索 / Agent 索引: 小幅领先。
  • 电脑操作 OSWorld 2.0: 70.6% vs 66.1%,官方称成本不到 Fable 5 三分之一。

Cursor 联创原话方向:Opus 价位,摸到接近 Fable 的性能。另:Anthropic 早先一版 FrontierCode 通告曾把更低分的 Opus 标成赢家,bug 已修。IMO 2026 满分、无外部工具。安全拦截预计触发频率较 Fable 5 降约 85%——体感上可能比单项分数更明显。

产品侧:Claude Code 提示词砍八成

同日,Anthropic 工程师 Thariq 披露上下文设计调整:Claude Code 系统提示词删超 80%,编码评测不降。删减对象明确是 Opus 5 / Fable 5 这代模型。

规则从「默认不写注释」改为「贴合周围代码风格,匹配注释密度、命名与习惯」。工具侧少堆示例、多收紧接口(如 Todo 仅「待处理 / 进行中 / 已完成」)。上下文改渐进式披露:代码审查等低频说明拆成技能文件按需加载;记忆从手写 CLAUDE.md 扩展为模型自判可记内容并落盘。

评测含义: 这不是营销彩蛋,而是配套结论——模型判断力上来后,长系统提示词这层脚手架可以拆。

外部声音与总评

马斯克晒 FrontierCode 性价比图,称仅 Grok 4.5 与 Opus 5 在帕累托前沿;并称 Grok 4.5 弱于 Opus 5,但是同等性能下最低价档之一。这是竞品视角,和官方榜、社区实测并列参考即可。

总评

维度 简评
定价 Opus 档价,约 Fable 5 一半;Fast 两倍价换 2.5 倍速
硬核编程榜 Frontier-Bench 明显占优
通用难题 / 工具题 HLE 持平或微超;ARC-AGI-3 拉开大差距
社区场景 demo 游戏 / 3D / 重约束 HTML 反馈强
工程自检 747、FreeCAD、自建测试环境等案例突出
交付速度 个别对照里 Fable 5 更快(约 40%)
产品配套 Claude Code 提示词大幅精简,评测不掉

一句话: 若你按「半价能不能顶上 Fable 5 那一档」来选,现有跑分和社区实测给出的答案偏是——在多项任务上可以咬住,编程与自检链路甚至更敢打;代价是部分场景耗时更长、代码更重。护栏触发率下降约 85%,对日常写代码的体感也可能不小。

感谢阅读,如果这篇文章对你有帮助,欢迎继续浏览同栏目内容。

返回 AI最新资讯