
图片:@ClaudeDevs (X)(视频截图)
摘要
- Anthropic于9月28日发布Claude Sonnet 5.5开发指南,整理了从Sonnet 5迁移时的五项不兼容变更和一项响应结构变更。
- 关闭思考、强制工具调用和旧的计算机使用声明都会返回400错误,指南建议改用between_tools设置以及auto加strict工具。
- Sonnet 5.5比Sonnet 5快30%,单任务成本最多降低30%,Claude Code从v2.1.284起将sonnet别名指向新模型。
Anthropic于9月28日在开发者博客上发布了Claude Sonnet 5.5开发指南。指南的结论是,仅仅更换模型名称并不能完成迁移。从Sonnet 5迁移过来的代码需要处理五项不兼容变更和一项响应结构变更,其中不少会让请求直接返回400错误。Anthropic开发者账号ClaudeDevs当天在X上发布的介绍帖浏览量超过100万次。
指南作者Addy Osmani表示,Sonnet 5.5比Sonnet 5快30%,每个token的价格不变,但完成同样的工作所需token更少,因此大多数工作的成本最多可降低30%。Metal此前报道过Anthropic发布Claude Sonnet 5.5,这份指南则是写给把该模型投入实际产品的人的说明书。根据发布说明,Sonnet 5.5在智能体编码评测Terminal-Bench 4.0中得分70.6%,远高于Sonnet 5的10.3%。
指南首先明确了分工。它把修复漏洞、快速迭代功能、对照需求验证等范围明确的日常编码,以及反复运行的调查、审查、起草类智能体任务交给Sonnet 5.5,把长周期智能体编码和需要审慎判断的知识工作交给Opus 5.5。Osmani写道,Sonnet 5.5最适合有明确规格且有办法检验结果的任务。面向大批量、低延迟工作的Claude Haiku 5.5将在几周内加入该系列。
第一个陷阱是思考功能。Sonnet 5.5默认开启思考,响应可能以思考块开头,直接读取第一个块文本的代码会出错。过去关闭思考的thinking disabled设置现在会返回400错误。改用新的between_tools设置后,模型只在工具调用之间思考,但该设置只在low、medium、high三档努力程度下有效,在xhigh或max下同样返回400错误。

强制工具调用也被关闭。把tool_choice设为any或指定某个工具,连token计数端点都会返回400错误,指南建议改为auto,并给工具加上strict选项,使输入符合模式。计算机使用功能只能通过新的工具集computer_toolset_20260801使用,旧的声明会报错,不过Amazon Bedrock仍接受旧方式。在顾问工具中,Sonnet 5.5执行者不接受Opus 4.8、Opus 4.7和Sonnet 5作为顾问,被接受的顾问给出的建议也以加密形式返回,代码无法读取其内容。
思考块与模型和对话绑定。Sonnet 5.5能读取Sonnet 5的思考块,因此在对话中途切换模型推理可以延续,但没有其他模型能读取Sonnet 5.5的思考块。因此指南要求保持对话只追加不修改的结构。不想手动迁移的开发者可以在Claude Code中把迁移交给/claude-api命令,内置的Claude API技能会一次性替换整个代码库中的模型ID和不兼容参数。
努力程度需要重新测量。指南表示努力档位经过重新校准,Sonnet 5的设置值不再产生同样多的思考。Claude API的默认值为high,Claude Code为medium。指南建议智能体编码从medium开始,只把较难的任务调到high,聊天等对延迟敏感的工作从medium或low开始。指南还指出,在系统提示词中要求少思考并不能稳定减少思考量,应当降低努力档位。像"不要偷懒"这类为Sonnet 5加上的变通提示应当删除,并先重新运行评测。
成本结构也有调整。可缓存的最小提示词长度从1,024个token降到512个,较短的系统提示词和工具定义也能被缓存。缓存读取价格是输入价格的十分之一,但在请求之间更改顶层努力档位会使缓存失效。图像采用长边最高2576像素的高分辨率档,一张2000×1500的图像所用token约为Sonnet 4.6的2.5倍;指定只在美国境内推理则按标准价格的1.1倍计费。上下文窗口无需beta头即为100万token,最大输出为12.8万token,知识截止时间为2026年6月。
外部开发商的反馈集中在速度和token节省上。Epic Games首席运营官Daniel Vogel表示:"新模型处理了用于游戏系统架构的数万行代码,保持了快速响应,并完成了长达数小时的任务。"代码审查公司CodeRabbit的AI副总裁David Loker表示:"我们计划现在就把简单和中等难度的审查迁移过去,并在接下来几周迁移更多。"

拒绝的处理方式也变了。被拒绝的请求会以HTTP 200返回并附上拒绝原因,原因分为网络安全、生物、前沿LLM、推理提取和一般危害五类。Anthropic表示,Sonnet 5.5是首个配备与其最强模型类似的网络安全防护措施的Sonnet模型,服务器端回退功能只会把网络安全和前沿LLM类别的拒绝转交Sonnet 5重试。指南建议,为避免触发推理提取拒绝,不要要求模型在响应中写出推理过程,而应读取摘要形式的思考显示。
Metal查看的指南中40秒演示视频里,两个模型看着同一张照片,用自己编写的Python代码重新作画。据画面说明,整个过程没有使用图像生成模型;画作完成时,Sonnet 5调用了自己构建的画笔引擎12,249次,Sonnet 5.5调用了44,561次,把城市夜景填充得更加细密。该X帖子附有一条仍在评分中的读者建议背景说明,称拍摄参考照片的原作者表示照片未经署名和许可被使用,而指南正文中则把该原作者账号列为参考图片提供者。
在Claude Code中,从v2.1.284起sonnet别名指向Sonnet 5.5,并以medium努力程度运行。该模型无法关闭思考,也没有快速模式,默认模型仍是Opus 5.5。该模型可在Claude API、Amazon Bedrock、AWS上的Claude平台、Google Cloud和Microsoft Foundry上使用,其中Foundry仅在Global Standard部署中提供。
从工程师的角度看,这份指南的兼容性清单比性能表还长。为了换来更便宜、更快的模型,思考默认值、强制工具调用、计算机使用和顾问组合同时发生变化,Anthropic选择用/claude-api命令和技能来减轻这一成本。这份文件对开发者提出的要求是:在改动一行模型ID之前,先核对400错误清单并重新测量努力程度。





评论