工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

OpenAI Build Week优胜作品揭晓:8个获奖项目

186个国家、4.7万人参赛,提交项目超过8000件,OpenAI于8月25日公布了各赛道获奖作品。四个冠军团队里,有两个是零编程经验的兽医和心内科医生。

이미지: OpenAI

摘要

  • OpenAI于8月25日公布了Build Week挑战赛各赛道的获奖作品。
  • 来自186个国家的近4.7万人参赛,提交项目超过8000件,奖金总额达10万美元。
  • 四个冠军团队中有两个是零编程经验的兽医和心内科医生。
오픈AI 공식 영상 — 전 세계 빌드위크 참가자들이 코덱스로 만든 프로젝트

OpenAI于8月25日公布了"Build Week"的获奖作品,这是OpenAI历史上规模最大的一次黑客松,吸引了来自186个国家近4.7万人参加。

规则只有一条:用Codex和GPT-5.6做出真正能跑起来的东西。8天时间里,收到的项目超过8000件,期间还同步举办了7场线上活动和60场线下社区活动。

奖金10万美元,评审标准分四项

挑战赛于7月13日启动,原定7月21日太平洋时间下午5点截止。由于提交系统出现故障,截止时间延后了一个小时;而由于提交量远超预期,结果公布也推迟到了8月25日。

奖金总额为10万美元。每个赛道的第一名可获1.5万美元,第二名1万美元,冠军团队还能获得DevDay门票、与Codex团队会面的机会,以及一年期的ChatGPT Pro。评审标准分四项:技术实现、设计与可用性、影响力,以及创意本身的质量。

赛道共分四类:生活应用(Apps for Your Life)、办公与生产力(Work & Productivity)、开发者工具(Developer Tools)、教育(Education)。每个赛道公布一名冠军、一名亚军,外加三个入围作品。

生活应用——那些说不出口的话,变成了应用

冠军作品Second Voice的作者拉维特兹·敦德蒂(Ravitez Dondeti)有一位患语言障碍的亲人。小时候两人靠肢体动作交流,直到这位亲人离世后,他才意识到自己错过了多少想问却没问出口的话。这个作品是他在Build Week的8天里独自完成的。

应用会把患构音障碍或运动受限人群不完整的发声,结合他们自己的常用短语库和当下的语境,拼出几句可能的完整句子供选择。只有在用户选定或修改之后,应用才会朗读出来——最终说出口的内容,始终由使用者本人把关。

敦德蒂原以为最难的部分会是还原句子本身,但真正卡住他的,是一些最细小的决定:该同时显示几个候选选项、显示速度多快、确认动作要按几次键。

视频: Ravitez Dondeti · 简体中文字幕 METAL LAB

"最小的UX决定反而分量最重。一个技术上跑得起来的应用,如果实际用不了,那就没有意义。"

亚军作品AirBridge for Windows源于一个具体困扰:家里的AirPlay音箱,在Windows电脑上根本没法用。亚当·塔兰蒂诺(Adam Tarantino)在2024年之前用旧版OpenAI模型试过一次,没能做成产品,这次他又重新拾起了这个想法。

这款应用无需虚拟音频线缆或临时文件,就能把Windows的声音串流到HomePod、Apple TV和Mac上。它支持多台音箱同时播放、针对不同房间分别校正延迟,还带有一个浏览器扩展,通过延后画面(而非声音)来对齐口型。GPT-5.6负责用语音操控系统,本地策略层决定哪些操作可以执行,最终结果会在真实硬件上验证。

视频: Adam Tarantino · 简体中文字幕 METAL LAB

"我做了十多年软件,但这是我第一次参加黑客松。不参加,就不可能赢。"

三个入围作品分别是:Bander让AI助手在操作账户前,先把要做的事让家人过目确认;O2 by Agent9把空气质量、山火、警报和预报整合到一个界面上;SayAhead帮助听障人士读懂、主导并掌控电话通话。

办公与生产力——三名兽医变成一名之后

今年,保利宠物医院(Paoli VetCare)的兽医从三名减到了一名。病患主人的来电量没变,但已经没有足够的人手能顾上所有病例。

冠军作品veTriage的作者是这家医院61岁的兽医艾琳·唐斯(Erin Downes),她没有任何编程经验。这款应用帮助前台人员询问必要病史、识别紧急信号,并把病例分派到合适的处理流程,但绝不让非临床人员做出医疗判断。核心理念很简单:日程排满了,不代表病情就没那么紧急——临床需求和医院接诊能力,必须分开处理。

Codex把唐斯的临床判断逻辑,转化成了一套真正能运行的工作流程,GPT-5.6负责协助前台对话,但不做任何医疗决策。唐斯的团队现在正在实际试运行这套系统。

视频: Erin Downes · 简体中文字幕 METAL LAB

"我今年61岁,我希望大家明白:哪怕有很深的行业经验,现在开始做开发者也不算晚。"

亚军作品Pulse是开罗心内科医生穆罕默德·穆斯塔法·阿布·塔勒布(Mohamed Mostafa Abu Taleb)在医院轮班间隙做出的一个研究原型。在心脏停搏抢救中,团队负责人要同时追踪心律、除颤情况、给药时间、CPR周期以及胸外按压的中断情况——而现场往往同时有多人在大声报告状况。

Pulse会实时监听现场的声音,持续追踪临床状态,还专门考虑了埃及阿拉伯语与英语混杂的说话方式。GPT-5.6负责解析这些嘈杂的语音,一套可审计的确定性代码负责追踪抢救流程,一旦依据不明确,系统会向团队发出确认请求。

视频: Mohamed Mostafa Abu Taleb · 简体中文字幕 METAL LAB

"没有团队,没有实验室,没有资金——我就是在开罗,趁着轮班间隙做出来的。"

三个入围作品分别是:LabSpace AI把实验室及其中的一切,变成一张可搜索的空间地图;OpenCounsel把混乱的法律文书,变成来源可核验、能直接提交的正式文件;Tomok把日程、规格书和报告串联起来,帮助基建团队追溯延误的源头。

开发者工具——把声音画成线框图

空间音效通常要等游戏场景全部搭建完成后才能试听,这意味着在设计初期,根本没有办法探索"这个空间该听起来是什么样"。

冠军作品Echo Canvas把这个顺序倒了过来。凯文·杨(Kevin Yang)做的这款工具,让设计师像用网页设计中的灰色方框先搭骨架、之后再选颜色一样,先在浏览器里画出空间草图,放置声源和听者位置,然后打开一扇门或更换墙体材质,当场就能听到变化——这也是他把它称为"声学线框图"的原因。

几何计算和声学运算全部交给确定性系统处理,音频在浏览器本地实时渲染。GPT-5.6只在受限的结构框架内,负责编排和解释场景。

视频: Kevin Yang · 简体中文字幕 METAL LAB

"多打几条光线追踪,不会让产品变得更好。"

亚军作品Sentinel是一款MCP服务器安全扫描工具。MCP服务器会向智能体开放文件、API、数据库和shell命令的访问权限。马利克·巴沙尔·贾瓦伊德(Malik Bashaar Javaid)一次又一次遇到那种被当作"快速入门模板"分享出来的MCP服务器——里面充斥着未经清理的shell调用、硬编码在代码里的凭证,以及形同虚设的权限边界。

Sentinel同时运行三套机制:确定性静态分析、在真实源码上下文中运行的、受到严格约束的GPT-5.6审查,以及基于Docker隔离的探测。模型可以支持或反驳分析发现,但不能凭空编造执行探测结果,也不能引用不存在的代码。检测结果会映射到OWASP智能体安全Top 10清单,并可接入GitHub代码扫描流程。

视频: Malik Bashaar Javaid · 简体中文字幕 METAL LAB

"约束模型,比写提示词难得多。"他刚从计算机专业毕业,这是他第一次参加黑客松。

三个入围作品分别是:Emberframe Studio是一款用于AI智能体协作创作的空间式画布;GenUI能把模型生成的JSON,转换成经过验证的原生SwiftUI代码;Vibe Signal让用户能在iPhone和Apple Watch上监控和指挥Codex。

教育——挡住一位25年老开发者的那道墙

冠军作品Mechanica的灵感来自博物馆。"我都不记得自己撞过多少次展柜玻璃了,因为完全被玻璃后面的那件东西迷住了。"作者单薇(Shan Wei,音译)这样说道。光是看,远远不够——她想亲手触摸,想把它拆开看看内部结构。

这个项目把四种仅存零星文字记录的中国古代机械装置,复原成了可实际运转的模型,从天文报时塔到比现代计算机早了几个世纪、就已能编程操作的织布机都有。参观者可以转动、拆解这些机械,追溯每一个尺寸数据的出处——它可能来自古代文献、实测文物,或是明确标注的学术推测。在学者意见存在分歧的地方,这个项目没有强行给出一个"正确答案",而是把几种相互竞争的复原方案并排展示出来。

朱伟英(Weiying Zhu,音译)、李宇坤(Yukun Li,音译)和单薇三人都有多年软件开发经验,但都是第一次接触3D建模、物理模拟和动画制作。Codex帮他们跨过了这块陌生领域,GPT-5.6则扮演了博物馆AI讲解员的角色——它会引用博物馆提供的依据,如果没有依据支撑,就直接拒绝回答。

视频: Weiying Zhu·Yukun Li·Shan Wei · 简体中文字幕 METAL LAB

"我做了25年软件,但3D和动画完全是我的知识盲区——结果那道墙就这么消失了。"

亚军作品Dấu的作者罗伯特·惠恩(Robert Huynh)之前参加过一次黑客松,因为觉得"自己不够技术",半天就退出了。这一次,他在河内独自完成了作品。

越南语中,同一个音节根据声调和发声方式的不同,可以表达六种完全不同的含义。Dấu让学习者录下一个词,随即把用户自己的音高曲线与经过验证的母语者参考曲线并排画出来,告诉用户刚才那个发音实际表达了什么意思,再给出具体的发音矫正建议。声调判定由确定性信号处理完成,GPT-5.6只负责教学指导——一旦依据不足,系统会让用户重新录一次,而不会自信满满地给出错误答案。

视频: Robert Huynh · 简体中文字幕 METAL LAB

"从当年纠结'我技术够不够格参加黑客松',到现在一个人做出来的作品能进入决赛圈,这一路走了很远。"

三个入围作品分别是:Canopy让用户能在编程沙盒中,直接实践AI刚教过的内容;**Encore!**把孩子考试中做错的题目,转化为量身定制的绘本课程;ResearchOS能帮用户把每一条研究论断,一路追溯回原始出处。

获奖作品一览

赛道冠军亚军
生活应用Second Voice——把不完整的发声变成句子AirBridge——把Windows的声音接入AirPlay
办公与生产力veTriage——动物医院电话分诊Pulse——心脏停搏抢救记录
开发者工具Echo Canvas——声学线框图Sentinel——MCP服务器安全扫描
教育Mechanica——中国古代机械复原Dấu——越南语声调教练

编辑观察

把这八个获奖作品摆在一起看,会发现两个共同点。

第一,真正获胜的不是最会写代码的人,而是最懂问题本身的人。四个冠军团队里,有两个分别是兽医和心内科医生。剩下两个团队,也是靠Codex跨过了本行之外的3D建模和空间音效领域。黑客松本该是比拼开发速度的场合,但这次的胜负天平明显偏向了行业知识那一端。

第二点,对实际做产品的人来说可能更重要——大多数获奖作品,都把AI的能力范围框得很窄。

Pulse把抢救流程的追踪工作交给确定性代码处理,只让模型负责解析语音;Echo Canvas自己写几何计算和实时音频渲染逻辑,模型只被用作编排和解释层;Dấu用信号处理判定声调,只让模型做教学辅导;Sentinel的作者更是直接说,他大部分工作量根本不在写提示词上,而是在设定约束条件。

如果你实际用过多个编程智能体工作,大概都遇到过同一个坎:交给模型自主处理的范围越大,第一次演示往往越炫,但从第二次运行开始,结果就开始不稳定。所以在真正的实践中,大量时间最终都会花在用结构和规则,把模型能触碰的范围收窄上。

这些获奖作品共同传达的,正是这个道理:判断、计算和流程逻辑,交给人写的代码把关;模型只负责听懂人话、把话讲清楚这一环。一旦依据不明确,就该主动追问,而不是编造答案。

从8000多件作品里挑出来的这八个,方向惊人地一致,这不太可能只是评委的个人偏好,更像是对"这项技术现在该怎么用"这个问题给出的答案:模型被当作适配器来用时,才真正发挥出它的价值,而不是被当成引擎。

这一点,对国内团队同样适用。医院、物流仓库、法务团队、制造产线这类深谙一线业务的组织,现在恰恰站在最有利的位置上。他们需要的不是招更多开发人员,而是把Codex交到那个在一线干了20年的人手里,再给他们腾出两周时间。veTriage正是这样做出来的,现在它已经在真实的动物医院里投入运行。

评论