
图片:@ClaudeDevs (X)(视频截图)
摘要
- Anthropic 于 9 月 30 日正式开设面向使用 Claude 进行开发者的开发者中心 claude.dev,表示将刊载工程深度文章、Claude Code 与 API 指南以及彩蛋。
- 据该中心的代表性文章,Anthropic 在 8 月为期两周的冲刺中与 Claude 一起无事故合并了 3,000 多项变更,使 claude.ai 的核心使用体验提速约 3 倍。
- 评估设计文章介绍了 claude-api 技能中的 build-eval 与 hillclimb 命令,在一项客服实验中,保留测试集准确率从 78.6% 提升至 90.5%,成本降至约五分之一。
Anthropic 于 9 月 30 日正式开设面向使用 Claude 进行开发者的开发者中心 claude.dev。公司开发者账号 ClaudeDevs 在 X 上将 claude.dev 介绍为"使用 Claude 进行开发者的新家",并表示将刊载工程深度文章、Claude Code 与 API 指南、打造 Claude 的团队的心得,以及一些有趣的彩蛋。这条帖子发布不到一天浏览量就超过 11 万次。Anthropic 实际上是把分散各处的技术文章集中到了一个面向开发者的地址。
网站的定位体现在首页的一句话里。claude.dev 自称是分享 Anthropic 开发者技巧与观点的地方,并为每篇文章标注以分钟计的阅读时长。首页展示的 10 篇文章发布于 5 月 20 日至 9 月 28 日之间,大多是实务主题,例如用 21 分钟篇幅拆解 Opus 5.5 上完成一项任务的成本、Claude 5 代模型的上下文工程新规则、Claude Code 团队如何使用技能等。页面下方附有官方 YouTube 视频,页脚汇集了通往 Claude Academy、Discord、线下聚会和 Reddit 社区的入口。
彩蛋确实存在。METAL 确认的 claude.dev 终端页面,以 10 月 1 日浏览器访问为准,打开时是用点阵拼出 CLAUDE.DEV 字样的 ASCII 图,并提示输入 /help 可以发现其他命令,输入 /posts 可调出文章列表。X 帖子附带的 30 秒视频是像素游戏 Clawd's Quest 的游玩画面。在"某个夜晚天空忘了醒来"的设定中,橙色像素角色 Clawd 收集 5 个火花后太阳升起,屏幕上出现感谢的话语。在面向开发者的网站里藏一款游戏,可以理解为让网站看起来更像社区空间而非文档站点的选择。
中心里分量最重的文章,是两周内让 claude.ai 提速三倍的记录。根据 Raymond Wang、Sam Attard 和 Issac G. 三位工程师 9 月 23 日撰写的这篇文章,Anthropic 在 8 月为期两周的冲刺中,使 claude.ai 网页版和桌面应用的核心使用体验提速约 3 倍。团队瞄准占用户活动 95% 的四条使用路径。按第 75 百分位计算,全新加载 claude.ai 到可输入页面的时间从 3.1 秒降至 0.55 秒,新建 Claude Code 会话从 0.8 秒降至 0.3 秒,加载 Claude Cowork 云端会话从 2.6 秒降至 0.73 秒。13 项测量指标中有 12 项目标在三天内达成。
工作方式与结果同样引人注目。团队把所有讨论串集中在一个 Slack 频道里,并在每个讨论串中接入 Claude。Anthropic 表示,他们通过 Claude Tag 测试版运行了一款与 Opus 5.5 大致相当的内部研究模型。Claude 负责寻找瓶颈、构建基准测试、提交变更并监控部署,人类则负责设定目标、权衡取舍并批准每一项变更。就这样,团队合并了 3,000 多项变更,没有发生任何面向客户的事故或回滚。最忙的日子一天落地 200 多项变更,一度同时运行的讨论串超过 150 个。团队引入了近 200 个功能开关,并在冲刺期内清理了其中一半以上。

发现的内容十分具体。Claude 在输入框的打字路径中找到了每次按键都会重新渲染的 6,900 个 React 钩子和 900 个状态订阅,还揪出了每天在后台悄然发生 50 万次的隐藏刷新。代码块高亮卡顿约 1 秒的原因竟是破折号。只要回复中含有破折号或弯引号之类的字符,V8 就会把整个字符串以 UTF-16 存储并走较慢的路径,Claude 用一个 20 行的改动修复了这个问题。长回复阻塞主线程的时间从约 750 毫秒降至 200 毫秒,在 120Hz 的 MacBook 上从头到尾保持每秒 120 帧。
人的角色不是调节速度,而是调节雄心。据文章介绍,Claude 默认会谨慎地划定范围,并把估算留得很宽。当达成目标的讨论串放慢节奏时,Attard 在一个又一个讨论串里留下同样的话:"我们继续往下压,目标不是终点。下一步是什么?要有野心。"频道里的工程师 Shelley Vohr 评价这个模型是"数字狂魔"。在内部分享成果时,Issac G. 说:"哪怕在六个月前,你也无法说服我这是可能的。"
另一篇代表性文章讨论评估设计。Lance Martin 于 9 月 28 日撰写的文章表示,claude-api 技能新增了 /claude-api build-eval 和 /claude-api hillclimb 两个命令。前者通过访谈用户在代码库内构建评估集,后者每次只应用一项变更来提升分数。评估用例被分为训练集和从不展示的测试集,如果只有训练分数上升而测试分数持平,就视为过拟合并撤回该变更。
示例中的数字偏向成本。在一项使用 44 张内部客服工单、其中 30 张用于搜索、14 张留作保留集的实验中,起点是默认努力设置下的 Opus 4.8,决策准确率 74.4%,每张工单 4.6 美分。整理提示词后改用低努力设置的 Opus 5.5,得到 87.8% 和 1.9 美分;低努力设置的 Sonnet 5 则以约 1 美分取得 88.9%。据 Anthropic 介绍,Opus 5.5 的输入与输出 token 价格比 Opus 4.8 低 20%,缓存读取低 60%。在搜索过程从未见过的 14 张工单上,最终配置以约五分之一的成本取得 90.5%,高于原始配置的 78.6%。claude-api 技能自身的评估分数也从 66% 提升到约 88%。
从运营工程团队的角度看,这个中心卖的不是功能,而是一种工作方式。两篇文章的结论相同:只要能计数,Claude 就能改进,因此人要做的是增加可测量的对象,并先铺好回滚机制。METAL 此前曾报道 Anthropic 发布 Claude Opus 5.5,而 claude.dev 上的文章则像一本运营手册,展示真实团队按照怎样的流程驾驭这款模型。
公司自己也写下了剩余的课题。三倍提速文章表示,第 95 百分位、其他使用路径以及超长对话仍有改进空间,并预告将另文介绍冲刺期间向 Electron、Chromium、Node.js 等上游项目所作的贡献。claude.dev 要超越产品公告渠道、成为开发者愿意反复回访的地址,关键在于这类后续记录能否持续积累。





评论