让同一个模型画一只骑自行车的鹈鹕,最低推理档位花 10 美分、2000 个输出 token,最高档位花 3.3 美元、6.6 万个输出 token,效果从'能看出是鹈鹕'变成'戴着蓝帽子、车筐里还有条鱼'。这就是 Anthropic 新发布的 Claude Fable 5.1 在五个推理级别下的真实差距。
先交代背景。Anthropic 在 2026 年 9 月 1 日发布 Fable 5.1(和 Mythos 5.1),官方称它'为编码、知识工作和长周期问题求解设定了新标准'。最亮眼的数字来自全新的 Terminal-Bench-Science 0.1 基准测试(一个专门衡量模型在真实终端环境里完成科学计算任务的测试集,8 月 27 日刚发布):Fable 5.1 拿到 52.6%,而上一代 Fable 5 只有 24.7%,Opus 5 是 29.0%,GPT-5.6 Sol 是 22.4%。其他基准提升不大,但科学任务这一项几乎是翻倍。
不过,基准分数是一回事,实际生成质量是另一回事。有人用'鹈鹕基准'来测试模型:让模型生成一个 SVG(可缩放矢量图形,用代码描述图像,浏览器可以直接渲染)——一只骑自行车的鹈鹕。这个测试看起来不正经,但能直观反映模型对空间关系、细节和审美意图的理解。Fable 5.1 提供五个推理级别:low、medium、high、xhigh、max,而且不能完全关闭推理。推理级别控制模型在输出前内部思考的深度,级别越高,思考越久,成本也越高。
完整结果如下:

展示了这组鹈鹕。low 和 medium 两个档位,模型几乎没有显示推理过程,输出 token(模型生成内容的最小单位)分别只有 1998 和 1977,耗时约 23 秒,成本约 10 美分。high 档位开始出现少量推理,输出 2612 token,耗时 29.6 秒,成本 13 美分,但生成的鹈鹕和低档位差别不大。

对应 high 的版本:白色身体、橙色喙、自行车,中规中矩。
到了 xhigh,情况突变:输出 token 暴涨到 36767,耗时 7 分 51 秒,成本 1.83 美元。推理轨迹里出现了'让鹈鹕故意比自行车大一圈来制造喜剧效果''接受略粗的线条作为魅力而不是过度工程化'这类设计决策。

对应的鹈鹕开始有表情和姿态。
最高档 max 则交出了测试者见过的最好鹈鹕:65,927 个输出 token,耗时 13 分 54 秒,成本 3.3 美元。背景有品味,腿在车架两侧,脚踩在脚踏上,翅膀搭在车把上,还戴了一顶蓝色帽子,车筐里放着一条鱼。推理轨迹里能看到模型在纠结:要不要加围巾?头盔会不会和鹈鹕的喉囊抢视觉空间? beak 坐标 (484,84) 会和头盔重叠,所以需要缩小头盔、调整弧线端点。它甚至检查头盔通风孔的位置是否在描边宽度和圆头端点下仍然合理,还发现前叉控制点导致车架后倾,需要右移修正。

就是这只精心设计的鹈鹕。
最让人意外的是,xhigh 和 max 的推理轨迹已经不像'生成代码',更像一个设计师在画草图时自言自语。模型会主动做取舍:'跳过车铃和轮胎高光,因为没必要''把羽毛边缘改成扇形曲线而不是一条平滑线,更自然'。这种对视觉细节的推敲,在低档位完全看不到。
静态图之后,有人(Hacker News 用户 swalsh)评论说:既然这个基准已经解决了,能不能来个动画版?于是测试者把 max 生成的 SVG 直接作为输入,用默认 high 推理级别让它'动画化'。输入 6121 token,输出 26201 token,成本 1.37 美元,得到一只轮子会转的鹈鹕。

是动画中的一帧。视频里轮子看起来反转了,但测试者认为那是转成 MP4 时的转换伪影,原始 SVG 里方向是对的。
这个测试给我们的启发很直接:推理级别不是'开得越高越好',而是'按任务复杂度选档'。简单任务用 low/medium 足够,便宜且快;复杂生成任务(尤其是需要空间布局、视觉审美、多约束协调的)用 xhigh/max 能带来质的飞跃,但成本和时间也指数级上升。如果你在做 AI 生成类应用,可以把高推理级别的输出当作中间草稿,再交给低推理级别做后续加工,比如这次动画化就是拿 max 的静态结果去换 high 的动画能力,省了重新从零生成的费用。另一个坑是:推理轨迹本身是很好的调试信息,能看出模型为什么做某个设计决策,但也会占用大量输出 token,计费时别忽略。
内容与图片版权归原作者所有 · 原文: https://simonwillison.net/2026/Sep/1/claude-fable-5-1/