
图片:OpenAI
摘要
- OpenAI在8月25日公布了"Build Week"挑战赛各赛道的8个获奖作品。
- 来自186个国家、近4.7万人参赛,提交项目超过8000个,总奖金为10万美元。
- 四支冠军团队中有两支的成员是没有编程经验的兽医和心脏内科医生。
OpenAI在8月25日公布了"Build Week"获奖作品共8个。这是OpenAI历来规模最大的一次黑客松,吸引了来自186个国家、近4.7万人参与。
参赛条件只有一条:用Codex和GPT-5.6做出真正能跑起来的东西。8天里提交的项目超过8000个,同期还举办了7场线上活动和60场线下社区活动。
总奖金10万美元,评审看四个维度
挑战赛于7月13日启动,原定7月21日太平洋时间下午5点截止。因提交系统出现故障,截止时间推迟了一小时;而公布获奖名单则因提交量远超预期,一直拖到了8月25日。
总奖金为10万美元。每个赛道的第一名奖金1.5万美元,第二名1万美元,冠军团队还能获得DevDay门票、与Codex团队面谈的机会,以及一年期ChatGPT Pro。评审标准分四项:技术实现、设计与可用性、影响力,以及想法本身的质量。
赛道共设四个:日常生活应用(Apps for Your Life)、办公与生产力(Work & Productivity)、开发者工具(Developer Tools)、教育(Education)。每个赛道公布一名冠军、一名亚军,外加3个入围作品。
日常生活应用——那些说不出口的话,变成了应用
冠军作品Second Voice的作者拉维特兹·顿德蒂(Ravitez Dondeti)有一位患有语言障碍的亲人。小时候两人靠肢体动作交流,直到这位亲人离世,他才意识到自己错过了多少本该问出口的话。这个项目是他独自在Build Week的8天里完成的。
对于有构音障碍或运动受限的人说出的不完整语音,应用会结合他自己的常用短语库和当下的语境,给出几个最可能的完整句子供选择,用户挑选或修改后应用才会念出声。整个过程中,说什么始终由用户自己掌握。
顿德蒂原以为最难的部分是还原句子本身,但实际上真正卡住他的,是最琐碎的那些决定:该弹出几个选项、弹出速度多快、确认动作需要点几次手指。
"最微小的UX决定,反而是最重的。技术上跑得起来的应用,如果实际用不了,就没有意义。"
亚军作品AirBridge for Windows源自一个很实际的问题:家里的AirPlay音箱,在Windows电脑上根本没法用。亚当·塔兰蒂诺(Adam Tarantino)曾在2024年之前用旧版OpenAI模型尝试过一次,没能做成产品,这次他又重新挑战了一遍。
这次不需要虚拟声卡,也不用临时文件,就能把Windows的声音串流到HomePod、Apple TV和Mac上。它支持多台音箱同步播放、按房间做不同的延迟补偿,还配了一个浏览器扩展——通过延迟画面而不是延迟声音来对齐口型。GPT-5.6负责用语音操控系统,本地的策略层则决定哪些操作被允许,最后再用实际硬件验证结果。
"我做软件十几年了,这却是第一次参加黑客松。不参加,就不可能赢。"
入围作品共3个。Bander让家人能在AI助手操作账户前先看到它打算做什么。O2 by Agent9把空气质量、野火、预警和预报整合到同一个界面。SayAhead帮助听障人士阅读、引导并掌控电话通话。
办公与生产力——三位兽医变成一位之后
今年,保利兽医诊所的兽医从三人减少到一人,但客户来电量没有变,能接诊所有病例的人却没了。
冠军作品veTriage的作者艾琳·唐斯(Erin Downes)正是这家诊所的兽医,今年61岁,没有任何编程经验。这个工具帮助前台人员询问必要的病史、识别紧急信号,并把病例分派到合适的处理流程,但**不会让非临床人员做出医学判断。**核心逻辑很简单:日程排满不等于病情不再紧急,临床需求和诊所接诊能力必须分开处理。
Codex把唐斯的临床判断转化成了可运行的工作流,GPT-5.6负责协助前台对话,但不做医学决策。目前唐斯的团队正在实际试运行这套系统。
"我今年61岁,我希望大家知道,拥有深厚领域知识的人,现在成为开发者也不算太晚。"
亚军作品Pulse是开罗心脏内科医生穆罕默德·穆斯塔法·阿布·塔勒布在换班间隙做出的研究原型。在心脏骤停抢救时,团队负责人要同时追踪心律、除颤情况、给药时间、CPR周期以及胸外按压的中断记录,而现场各种指令又同时从四面八方喊出。
Pulse能听懂手术室里的声音,持续追踪临床状态,还专门考虑了埃及阿拉伯语和英语混杂的口音。GPT-5.6负责解读嘈杂的语音指令,由可审计的确定性代码追踪抢救流程,如果依据不明确,系统会向团队反向确认。
"没有团队,没有实验室,没有资金,就在开罗,靠换班之间的空隙做出来的。"
入围作品共3个。LabSpace AI把实验室及其中的一切都变成可检索的空间地图。OpenCounsel能把不完整的法律文书修正为出处可查、可直接提交的文件。Tomok把工程进度表、规格文件和报告串联起来,帮助基建团队追溯延期的源头。
开发者工具——把声音画成线框图
空间音效通常要等游戏场景全部搭好之后才能听到效果,这意味着在设计初期,根本没有办法探索"这个空间该听起来是什么样"。
冠军作品Echo Canvas把这个顺序倒了过来。凯文·杨(Kevin Yang)做的这个工具,让用户能像网页设计师在定色之前先用灰色方块搭骨架一样,在浏览器里直接勾画空间——放置音源和听者的位置,一开门或换一种墙面材质,声音就会立刻实时变化。他把这个叫做"声学线框图"。
几何计算和音效运算由确定性系统完成,音频在浏览器本地渲染。GPT-5.6只负责在有限的结构范围内搭建和描述场景。
"多打几条射线,并不会让产品变得更好。"
亚军作品Sentinel是一款MCP服务器安全扫描工具。MCP服务器会把文件系统、API、数据库和shell命令权限开放给智能体。马利克·巴沙尔·贾瓦伊德(Malik Bashaar Javaid)反复遇到那种以"快速上手模板"形式共享出去的MCP服务器,里面充斥着未经清理的shell调用、硬编码的凭证,以及松散的权限边界。
Sentinel同时运行确定性静态分析、在真实源码上下文内严格受限的GPT-5.6审查,以及Docker隔离的探测程序。模型可以支持或反驳分析发现,但无法编造执行探测结果,也不能引用不存在的代码。检测结果会映射到OWASP智能体十大风险清单,并可接入GitHub代码扫描。
"约束模型,比写提示词难得多。"他刚从计算机专业毕业,这是他第一次参加黑客松。
入围作品共3个。Emberframe Studio是一个用AI智能体进行创作的空间化画布。GenUI能把模型生成的JSON转换成经过验证的原生SwiftUI代码。Vibe Signal让用户能在iPhone和Apple Watch上监控并指挥Codex。
教育——挡在一位有25年经验的开发者面前的那道墙
冠军作品Mechanica的故事始于一座博物馆。"我数不清自己撞在玻璃展柜上多少次了,因为太沉迷于背后的展品。"单薇(Shan Wei)这样说道。光看是不够的,她想动手拆解。
这个项目把只剩下寥寥几行文字记载的四种中国古代机械复原成了可以实际运转的模型——从天文报时钟塔,到比现代计算机早几个世纪出现的可编程织机。参观者可以转动机械、拆开零件,每一处尺寸都能追溯到原始文献、实测文物,或者被明确标注为学术推断的部分。遇到学者意见分歧的地方,项目不会强行给出一个"正确答案",而是并列展示多种存在争议的复原方案。
朱伟英(Weiying Zhu)、李宇坤(Yukun Li)和单薇三人都有多年软件开发经验,但都是第一次接触3D建模、物理模拟和动画制作。Codex帮他们跨过了这个陌生领域,GPT-5.6则化身AI讲解员,引用博物馆资料作答,遇到没有依据的问题就直接拒绝回答。
"我做软件25年了,3D和动画完全是我的知识盲区,但这道墙就这么消失了。"
亚军作品Dấu的作者罗伯特·惠恩(Robert Huynh)曾在之前一场黑客松上,因为觉得自己"技术含量不够",半天就退场了。这一次,他独自一人从河内参加了比赛。
越南语有一个特点:同一个音节,凭声调高低和发声方式的不同,能表达出六种完全不同的意思。Dấu让学习者录下自己发的音,把音高曲线和经过验证的母语者参考曲线并排展示,告诉他们刚才这个发音实际上被理解成了什么意思,再给出具体的发音矫正建议。声调判定由确定性信号处理完成,GPT-5.6只负责教学辅导。一旦依据不够明确,系统不会给出一个自信但错误的答案,而是让学习者再试一次。
"曾经我还在犹豫自己够不够格参加黑客松,现在一个人做的项目居然进了决赛。"
入围作品共3个。Canopy让学习者能在编程沙盒里立刻实践AI刚教过的内容。**Encore!**把孩子考试中做错的题,转化成为其量身定制的绘本课程。ResearchOS让每一条研究结论都能被追溯到原始出处。
获奖作品一览
| 赛道 | 冠军 | 亚军 |
|---|---|---|
| 日常生活应用 | Second Voice——把不完整的语音变成句子 | AirBridge——把Windows的声音变成AirPlay音频 |
| 办公与生产力 | veTriage——动物医院电话分诊系统 | Pulse——心脏骤停抢救记录工具 |
| 开发者工具 | Echo Canvas——声学线框图 | Sentinel——MCP服务器安全扫描工具 |
| 教育 | Mechanica——中国古代机械复原 | Dấu——越南语声调教练 |
编辑视角
把这8个获奖作品摆在一起看,能发现两个共同点。
第一,赢的不是那些代码写得好的人,而是真正懂问题的人。四支冠军团队中,有两支的成员分别是兽医和心脏内科医生。剩下两支团队,也是靠Codex跨过了3D建模和空间音效这类本职工作之外的领域。黑客松原本比的是开发速度,但今年的重心明显偏向了领域知识。
第二点对实际做产品的人更重要:大多数获奖作品,都把AI的活动范围圈得很窄。
Pulse把抢救流程的追踪交给确定性代码,只让模型负责解读语音。Echo Canvas自己写几何计算和实时音频渲染,模型只被当作创作和解说的一层来用。Dấu的声调判定靠信号处理完成,模型只负责教学辅导。做Sentinel的人更是直接说,自己大部分工作量不是写提示词,而是设定约束条件。
带过多个编程智能体项目就知道,问题总在同一个地方爆发:交给模型自主发挥的范围越大,第一次演示效果就越炫,但第二次运行结果就开始不稳定。所以在实际工作中,大部分时间最终都花在了用结构和规则把模型能碰的范围收窄上。
这些获奖作品共同传达的信息,恰恰就是这一点:判断、计算和流程执行交给人写的代码来掌控,模型只负责听懂人说的话、解释清楚。一旦依据模糊,就该反问而不是编造答案。
8000多个项目里挑出来的这8个作品,都指向同一个方向,这不是评委个人偏好的问题,更像是对"这项技术现在该怎么用"给出的一个答案:模型当成适配层来用,才能发挥出真正的价值,而不是当成引擎。
这对国内团队同样适用。医院、物流仓库、法务团队、生产线这类真正懂现场的组织,现在恰恰站在最有利的位置上。眼下需要做的不是扩充开发人员,而是把Codex交到在一线干了20年的人手里,再给他们空出两周时间。veTriage正是这样做出来的,现在也确实在真实的诊所里运行着。





评论