
이미지: METAL LAB 생성
摘要
- 开发者MrRowTheBoat在Hacker News上发布了一款用语音审问嫌疑人的网页推理游戏,获得200多个推荐
- 对话通过OpenAI的gpt-realtime-2.1模型结合WebRTC以语音对语音方式进行
- 玩家指认嫌疑人后,gpt-5-mini模型作为独立评判者,只认可玩家实际提出的证据为有效
- 개발자
- MrRowTheBoat (해커뉴스 사용자)
- 음성 모델
- OpenAI gpt-realtime-2.1, WebRTC 기반 음성-음성 대화
- 판정 모델
- gpt-5-mini가 진술된 증거의 진위를 별도로 심사
- 이용 제한
- Clerk 인증 계정 필요, 세션당 30분 타이머 적용
- 기술 스택
- Next.js, MongoDB, Clerk
- 반응
- 해커뉴스 게시 후 추천 200개 이상 획득
用嘴审问的杀人案
一款直接向嫌疑人提问、通过找出答案漏洞来锁定凶手的推理游戏,近日在Hacker News上引发热议。开发者MrRowTheBoat发布的这个项目,特点在于并非通过文字,而是用真实的声音来审问嫌疑人。对话采用OpenAI的语音模型gpt-realtime-2.1,并结合WebRTC实现语音对语音的交流方式。开发者表示模型使用成本不小,因此设置了Clerk账号认证以及每次会话30分钟的时长限制。当玩家最终指认嫌疑人时,系统会调用一个独立工具,记录玩家指认了谁、实际提到了哪些证据,随后由gpt-5-mini模型对此进行评判,判断玩家是否真正提出了案件所需的证据。即便换一种说法表达也会被认可,但含糊的怀疑或诱导性提问则不会被视为有效证据。
为何现在才能实现
这个项目最初其实是2~3年前做的原型。当时同样处于AI热潮之中,但语音AI代理技术尚处早期阶段,开发者当时对成品并不满意。据推测,他最近重新挑战这一项目的原因,正是语音AI技术本身发生了巨大变化。实时语音对话系统一直被认为是一个难题,需要同时解决判断说话是否结束的"轮次检测"、准备回答所需的延迟时间,以及在对话过程中无缝衔接下一句话的处理问题。OpenAI在8月4日公布的第三代语音系统GPT-Live架构中曾提到,采用了全双工语音模型取代独立的轮次检测器,并将需要深度推理的部分以异步方式交由GPT-5.5处理的结构。像这款游戏一样,将语音对话本身用作游戏机制的尝试不断增多,也可视为这类底层技术正在迅速趋于稳定的一个佐证。将证据判定交由独立评分模型负责的设计同样值得关注。如果由同一个模型同时负责对话和判定,一致性容易出现问题,因此将角色分开——对话交给实时语音模型,规则判断交由另一个语言模型——可以说是一种解决方案。
这意味着什么变化
这款游戏本身与其说是商业服务,更接近于个人开发者的业余项目。但它展示了即便在个人开发者层面,也能制作出利用语音AI的互动内容。几年前,要实现语音代理还需要组合各种独立的语音识别与合成引擎,但如今仅凭一个实时语音模型加上WebRTC连接,就能打造出对话型角色。与此同时,成本问题依然是一大障碍。开发者设置会话时长限制和登录认证,也是因为实时语音模型的调用成本远高于基于文本的模型。考虑到这些限制,短期内基于语音AI的互动内容很可能会先以小规模实验作品的形式逐渐增多。


