DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues
AI语音助手该根据场景改变何时插话、何时倾听,少量人类反馈就能教会它
能同时听说的全双工AI语音助手目前无论场景如何都用同一套抢话/等待方式,这与人类实际行为不符。DuplexGen让语言模型先找出对话中可能轮流发言的时机点,再用每个场景收集的小规模人类标注对预测结果进行校准来解决这个问题。在辅导、谈判、闲聊等六种场景中,经过校准的模型比单纯提示词或用通用对话数据训练的方法更贴近人类的轮流发言偏好,用其生成数据训练的全双工模型也表现出人类评审更偏好的场景化行为。
METAL LAB 解读图
DuplexGen如何把普通文本对话转化为场景化的轮流发言数据
证据状态已报告实测结果
- 1. 口语化转换大语言模型将文本对话改写为带有语气词和口语停顿(如'嗯''那个')的口语化文本。
- 2. 时隙识别以从句或句子边界为依据,大约每隔8个token标出一个可插话的候选时隙。
- 3. 人类与LLM标注248名Prolific参与者中每个时隙由5人标注,加上LLM各自标注每个场景下每个时隙的LISTEN/BACKCHANNEL/TAKE_FLOOR偏好。
- 4. 通过微调进行校准对Qwen3模型进行微调,使其预测的行动分布与人类偏好分布之间的KL散度最小化。
- 5. 场景化合成与模型训练校准后的模型生成各场景的轮流发言对话,用于微调全双工模型(PersonaPlex),使其表现出场景特定的行为。
他们做了什么
- DuplexGen先把书面对话转换成带有语气词和口语停顿的口语化文本,再在每句话中标出听者可能行动的候选'时隙',间隔大约每8个token一个。
- 在每个时隙,一个大语言模型会预测三种行动的概率分布——保持沉默(LISTEN)、简短应和(BACKCHANNEL)、抢话发言(TAKE_FLOOR),并通过微调让这一预测对齐248名Prolific参与者(每个时隙由5人标注)收集到的人类偏好分布。
- 该框架被应用于六项任务:三项合作型场景(辅导、计划制定、面试)和三项竞争型场景(谈判、说服、社交闲聊),均基于MultiWOZ、CraigslistBargain等现有文本数据集构建。
- 先用Switchboard人类对话数据微调、再用DuplexGen小规模校准集微调的方法(SWBD+DUPLEXGEN)在大多数模型规模和场景下与人类判断最接近(KL散度最低),优于仅用提示词或仅用Switchboard的基线方法。
- 用1623小时DuplexGen生成对话微调的全双工语音模型(PersonaPlex)在不同场景下表现出更明显的差异化轮流发言模式,在竞争型场景中更频繁地抢话,并在人类评审的轮流发言自然度和GPT-4.1评估的指令遵循度上均高于未微调的基线模型。

研究结果
- 除竞争型场景彼此之间外,人类在不同场景下的轮流发言偏好存在系统性差异(卡方检验,p<0.05),合作型任务中回应词更常见,竞争型任务中抢话更常见。
- 在各模型规模下,SWBD+DUPLEXGEN与人类判断的平均KL散度最低(例如4B模型平均为0.335,14B模型平均为0.360),在大多数设置下优于仅用提示词和仅用Switchboard训练的方法。
- 尽管SWBD-ONLY使用了规模大得多的数据(2400段对话),但它与人类判断的一致性始终不如用DuplexGen小规模校准集训练的DUPLEXGEN-ONLY,且倾向于高估沉默、低估回应词。
- 用DuplexGen数据微调的PP-DG相比Moshi和未微调的PersonaPlex,在不同场景下表现出更明显的抢话和回应词频率差异,在谈判、说服、社交闲聊等竞争型场景中更频繁地抢话。
- 在人类听感评估中,PP-DG的轮流发言自然度平均得分3.69、指令遵循度平均得分3.55,均高于PersonaPlex(3.56、3.41)和Moshi(3.48、2.61),Welch t检验显示PP-DG显著优于PP(p=0.034)和Moshi(p=0.0026)。

可应用场景
- 为需要针对辅导、谈判、闲聊等不同场景采用不同插话方式的全双工语音助手生成训练数据。
- 构建用每个场景少量人类标注而非大规模通用语音语料来校准AI对话时机的流程。
- 评估现有语音AI系统在特定任务场景下的插话/回应词频率是否符合人类期望。

局限与待验证事项
- 合成数据集仅覆盖六种场景,更广泛的场景和交互类型上的泛化能力尚未验证。
- 模型行为对训练数据和超参数(如轮流切换延迟、停顿时长、学习率)高度敏感,尚未建立稳健的训练方案。
- 校准基于逐步展开的文本转录,未直接利用语调、停顿时长、语气、语速、重叠发言或视觉线索等信息,文本层面的偏好是否与语音层面的偏好一致尚不明确。
- 下游听感研究评估的是实际合成语音输出,但并未确认基于文本的判断与基于语音的判断之间是否一致,配对的文本/语音标注和多模态校准留待未来研究。
- PP-DG与PP、Moshi的比较虽经过统计显著性检验,但更广泛的模型覆盖和大规模多模态校准仍有待验证。

为什么重要
能同时听说的语音AI目前无论是在辅导学生还是在价格谈判中都采用相同的插话方式,这可能显得不合社交常理。这项研究表明,真正教会模型何时该插话、何时该沉默的关键并非更多原始语音数据或更巧妙的提示词,而是针对每个场景收集少量人类反馈进行校准。
本文术语
- 全双工模型(Full-duplex model) · 能够同时听和说、而非严格轮流发言的AI语音系统
- 轮流发言(Turn-taking) · 对话中随时决定谁掌握发言权的过程,即保持沉默、简短应和,还是接过话头发言
- 回应词(Backchannel) · 像'嗯''是的'这样表示在倾听但不夺取发言权的简短信号
- KL散度(KL divergence) · 衡量两个概率分布差异程度的统计指标,数值越低表示模型预测越接近人类判断
- 校准(Calibration) · 利用少量人类标注数据调整模型原始预测,使其更贴近真实人类偏好的过程
无法转载的图表
- Figure 0
- Figure 1: Scenario-specific turn-taking behaviors.
- Figure 4
- Figure 5
- Figure 2: Overview of the DUPLEXGEN framework. (1) Spoken-style dialogue conversion: converting text-based dialogue to spoken-style transcript format. (2) Turn-taking slot identification: identifying potential turn-taking slots within utterances. (3) Slot annotation and calibration: using a small set of human and LLM annotations to calibrate turn-taking predictions. (4) Turn-taking dialogue synthe
- Figure 7
论文原文摘要(英文)
Turn-taking is a central component of full-duplex interaction. Which turn-taking behaviors are appropriate varies with the scenario, yet current models apply a single norm regardless of context. This limitation originates in their training data: human-human speech corpora capture natural timing phenomena but provide little role grounding or scenario-specific norms, while heuristic or prompted synthesis methods inject turn-taking behaviors without basing them on human preferences. We introduce Du
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM AgentsAI助手在该向你提问的时候,却更愿意自己去核实事实
- SynFlow: A Multidimensional Diachronic Semantic Analysis Toolkit一款把单词意义变化拆解到语法细节的开源分析工具
- Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023)用AI总结股市新闻发现:简单的摘要方法反而比时髦的检索增强技术更靠谱
METAL LAB 最新报道
图片来源: Takyoung Kim et al., arXiv:2607.26178, CC BY-SA 4.0