学术动态

计算所百聆模型上新:BayLing-Duplex,让语音大模型边听边说全双工交互

发布时间:2026-09-21

百聆模型家族再添新成员 BayLing-Duplex,一个面向实时语音交互的原生全双工语音语言模型(SpeechLM)。

相比传统“用户说完,系统再回答”的轮次式语音大模型,BayLing-Duplex 希望让模型更接近真实对话:它可以一边听用户说话,一边生成语音回复;当用户中途打断时,模型能够及时停止当前回答,并根据新的输入继续对话。

论文:https://arxiv.org/abs/2606.14528

代码:https://github.com/BayLing-Models/BayLing-Duplex

模型:https://huggingface.co/BayLing-Models/BayLing-Duplex



为什么需要全双工语音对话?

现有语音对话系统大多仍按“用户说一轮、助手答一轮”的方式工作:系统通常依赖语音活动检测模块(VAD)先判断用户是否说完,再把这段语音交给模型生成回复。即使支持用户打断,也往往是外部系统先停止播报,再把新的用户输入作为下一轮请求处理。

但真实对话是连续的。用户可能停顿、补充,也可能在助手说话时插入新的问题。我们希望模型不只是被动接收一段段切好的语音,而是在说话的同时继续听用户输入,并自己判断什么时候该开口、什么时候该停下、什么时候该转向新的问题。

这正是 BayLing-Duplex 要解决的问题:让“听、说、停”成为语音大模型自身的生成能力,而不是依赖外部轮次判断模块。

 

 

BayLing-Duplex

BayLing-Duplex 的核心思路,是将用户输入、模型回复和交互状态统一表示为 token 序列,并交由语音大模型以自回归方式建模。这样,接话、保持沉默、停止回复、被打断后继续回答等行为,都可以转化为模型自身的 next-token prediction 问题,从而充分复用现有语音大模型的理解与生成能力。

具体来说,BayLing-Duplex 在开源语音语言模型 GLM-4-Voice 的基础上构建,并将全双工对话表示为三条交错通道:

●用户语音通道:持续接收用户输入;

●助手文本通道:作为模型的内部文本规划;

●助手语音通道:生成最终播放给用户的语音。

在具体实现上,对话状态 token 负责标记模型当前的交互状态,例如保持沉默、开始回复、继续输出语音或结束当前回复。模型在生成这些状态 token 的同时,也生成对应的文本和语音 token,从而在同一套序列建模框架中完成接话、停止和被打断后的重新回答。

因此,BayLing-Duplex 不需要额外的决策分类器或外部状态机,也不需要为全双工交互重新设计一套模型架构;它可以直接复用现有语音大模型的训练和推理框架,以较低的工程改造成本获得全双工交互能力。


 

 

训练方式

我们从已有的语音对话模型出发,构造了包含正常接话和用户打断两类场景的全双工训练数据,让模型学习实时交互中的基本时序行为。

训练分为两个阶段:

● 第一阶段通过监督微调学习多通道交错格式和基本对话状态;

● 第二阶段通过偏好优化进一步调整接话和打断时机,让模型更快、更稳地响应用户输入变化。

监督微调阶段让模型先学会多通道全双工交互格式,并具备基本的接话和打断能力;偏好优化阶段则在此基础上进一步强化时机控制,重点改善何时开始回答、何时停止当前回复。

 

 

实验表现

我们在全双工语音问答、接话和打断等场景上评测了 BayLing-Duplex,并与开源全双工语音模型 Moshi 进行比较:

实时语音交互能力

模型

接话成功率

打断成功率

回复质量

Moshi

71.9%

81.9%

2.17

BayLing-Duplex (SFT)

88.9%

91.4%

3.23

BayLing-Duplex (+DPO)

92.0%

100.0%

3.39

在实时语音交互任务中,仅经过监督微调的 BayLing-Duplex 已经显著优于 Moshi,说明多通道交错建模本身可以赋予模型较强的全双工交互能力。进一步加入偏好优化后,模型的接话和打断时机继续改善,尤其是用户打断后的停止成功率提升到 100.0%。

全双工语音问答

模型

Llama Questions

Web Questions

Moshi

21.0%

9.2%

BayLing-Duplex (SFT)

44.3%

18.0%

BayLing-Duplex (+DPO)

46.0%

18.1%

在全双工语音问答任务中,BayLing-Duplex 也取得了更好的回答准确性;进一步加入 DPO 后,模型在两个数据集上的表现继续提升。


更重要的是,BayLing-Duplex 展示了一种低成本构建全双工语音模型的路径。Moshi 针对全双工交互设计了专门模型结构,并经过约 700 万小时语音数据的大规模预训练;而 BayLing-Duplex 从现有开源语音大模型 GLM-4-Voice 出发,仅使用 400K 全双工构造数据进行微调,就将一个非全双工语音模型转换为原生全双工模型。这意味着,全双工能力不一定需要从头训练专门架构,也可以在已有语音大模型基础上高效构建。

总体来看,BayLing-Duplex 能够在不依赖外部 VAD 决策模块的情况下,实现更自然的实时语音交互。

 

 

后续计划

接下来,我们会继续改进模型在真实复杂环境中的鲁棒性,包括噪声、混响、多说话人、口音差异和更自然的多人对话场景。

我们也会持续更新代码、模型和 Demo,欢迎大家试用、反馈和一起探索更自然的语音交互模型。



附件下载: