语音识别远未解决:Mistral音频研究负责人谈技术前沿

Mistral音频研究负责人Pavan Muddireddy分享了公司全栈AI战略下的音频模型开发。他探讨了从音频理解到语音生成的端到端方法,解释了流式与批处理模型的权衡,介绍了基于连续潜变量和流匹配的TTS架构创新,并深入分析了说话人分离、抗噪性及消除模型幻觉等关键挑战。

导语

在机器学习领域,语音处理正经历着深刻的范式融合。Mistral AI作为一家全栈AI公司,其音频研究团队正致力于构建从理解到生成的统一音频模型。音频研究负责人Pavan Muddireddy在访谈中详细阐述了Mistral在音频领域的技术路线,包括如何将音频能力集成到大型语言模型中、流式处理的架构选择,以及使用连续表示和DPO对齐来提升生成质量与可靠性。他的分享揭示了当前语音技术既充满机遇又面临诸多未解难题的现状。

大纲与深读 12 章

展开「深读」看每一段讨论的问题与论据。

01

Mistral公司与研究员角色

00:44
  • Mistral是全栈AI公司,涵盖从模型层到应用层和云服务的多个层级。
  • 研究员日常工作包括训练模型、运行消融实验、评估结果,并跟踪公司内其他领域(如文本、视觉、机器人)的最新进展。
  • 公司秉持开放权重理念,发布大多数模型以促进开放生态系统的发展。
深读这一段

讨论的问题:Mistral作为全栈AI公司的具体含义是什么?研究员的工作模式和环境是怎样的?

论据 / 案例:公司提供从Mistral 7B文本模型、Mistral Code编码工具、AI Studio API平台到La Plateforme微调平台,以及Mistral Compute AI云服务。

02

多模态技术融合趋势

03:48
  • 过去十年,不同模态(语言、音频等)的研究方法正趋于融合,架构大多基于Transformer。
  • 用户期望通过单一模型处理文本、视觉、语音等多种输入输出,这是推动技术统一的自然驱动力。
  • 令人惊讶的是,这种端到端的多模态模型不仅在概念上优雅,在实际效果上也表现得非常好。
深读这一段

讨论的问题:不同AI模态(如语言和音频)的研究方法和架构为何会趋于融合?

论据 / 案例:音频领域(自两年前开始涉足)的许多技术正日益趋同于统一的预训练-后训练范式。

03

音频理解模型Voxtronic Chat

05:43
  • 首个模型Voxtronic Chat是一个音频输入、文本输出的LLM,用于通用音频理解。
  • 它可以直接处理音频,无需中间转录步骤,能回答关于音频内容的问题(如主题、发言者、时间点)。
  • 端到端方法避免了级联系统的错误传播,并能捕获转录文本可能遗漏的信息(如情感)。
深读这一段

讨论的问题:Mistral的音频理解模型(Voxtronic Chat)的核心功能和架构优势是什么?

论据 / 案例:模型可以直接分析播客或会议录音,回答“Tim在何时讨论了音频模型?”这类需要时间定位的问题。

04

音频理解模型架构

08:09
  • 架构基于文本模型主干,音频通过类似Whisper的编码器转换为连续嵌入向量,再作为标记输入解码器。
  • 编码器从梅尔频谱图开始,经过卷积层和Transformer栈,每80毫秒产生一个标记(12.5个/秒)。
  • 模型采用端到端预训练,使用交替的音频文本序列和转录模式进行训练,使音频理解能力在模型中广泛分布。
深读这一段

讨论的问题:音频理解模型的具体架构设计是什么?如何将音频模态整合到文本模型中?

论据 / 案例:音频编码器输出连续嵌入向量,以标记形式输入主Transformer解码器,与文本标记处理方式类似。

05

流式与非流式模型权衡

10:48
  • 流式模型需要原生连续监听,而非分块处理,这对实时应用至关重要。
  • 流式转录存在延迟与质量的权衡:立即转录可能产生歧义,等待更多上下文可减少错误。
  • 延迟作为模型参数,可根据应用需求(如实时字幕或后台日志)灵活调整。
深读这一段

讨论的问题:流式(实时)模型与批处理模型的核心区别和设计权衡是什么?

论据 / 案例:流式模型每80毫秒接收一次音频输入,通过“延迟流建模”技术平衡转录的及时性与准确性。

06

级联系统与端到端系统

12:35
  • 传统的ASR-LLM-TTS级联系统是错误来源,但现代智能组件组成的级联系统具有一定鲁棒性。
  • 端到端系统(如原生音频输入LLM)在处理高成本错误场景(如精确代码修改)时仍有重要价值。
  • 为提升基础音频理解质量,转录模型可通过上下文提示进行优化,而端到端模型则致力于解决特定失败案例。
深读这一段

讨论的问题:在语音智能体构建中,级联系统与端到端系统各自的优劣和发展趋势是什么?

论据 / 案例:例如,在编码任务中,转录模型对函数名或方法名的误识别可能导致下游系统出错,凸显了提升基础理解层的重要性。

07

音频生成模型架构选择

14:19
  • 音频生成的主流范式是基于神经编解码器的自回归生成,传统方法使用离散标记(如EnCodec、SoundStream)。
  • 离散标记需要残差向量量化,导致在时间维度和代码本维度上都需要自回归预测,增加了复杂性。
  • Mistral采用连续潜在嵌入和Flow Matching头,简化了架构,并提供了在生成步骤和质量之间更可控的权衡。
深读这一段

讨论的问题:为什么在音频生成(如TTS)模型中选择连续潜在表示而非离散标记?

论据 / 案例:传统方法需要预测30多个代码本的离散标记,而Flow Matching头通过在速度场上进行预测和积分来生成连续音频。

08

神经编解码器与量化技术

16:11
  • 传统神经编解码器(如EnCodec)使用残差向量量化(RVQ)瓶颈,用于压缩和通信。
  • 改进模型引入了语义代码本(接近文本空间)和声学代码本(携带声学细节)的概念。
  • Mistral的TTS模型保留了语义代码本,但将声学部分替换为有限标量量化(FSQ),其离散层级可作为连续向量处理,为后续探索提供了更大设计空间。
深读这一段

讨论的问题:神经编解码器(如EnCodec)的基本原理是什么?Mistral在其中做了哪些改进?

论据 / 案例:FSQ使用36维嵌入和21个量化层级,其输出既可被视为离散码,也可作为连续向量使用。

09

梅尔频谱图与输入表示

18:10
  • 梅尔频谱图作为一种感知音频特征,通过保留与人类听觉相关的信息来减少需要建模的维度。
  • 在小规模模型中,使用编码器和梅尔频谱图有助于提高样本效率。
  • 随着模型规模扩大和数据增多,可以移除这些归纳偏置,直接使用波形输入,这使缩放行为更可预测。
深读这一段

讨论的问题:为什么模型输入使用梅尔频谱图而非原始波形数据?这其中的权衡是什么?

论据 / 案例:梅尔频谱图捕捉了丰富的语音和背景声音信息,但仍是比原始波形更通用的特征,有助于在计算受限时提升效率。

10

模型抗噪性与微调

19:36
  • 通过数据增强(添加噪声)可以提高模型对各种声学条件的鲁棒性。
  • 模型在多样化数据上训练后通常能泛化,但针对特定部署环境进行微调(使用高质量、在分布的数据)至关重要。
  • 微调时需注意保持数据多样性以避免灾难性遗忘,平台(如Forge)提供经过验证的配方来简化这一过程。
深读这一段

讨论的问题:如何使语音识别模型对背景噪声具有鲁棒性?模型微调的最佳实践是什么?

论据 / 案例:例如,公司部署模型时,可使用内部会议录音(敏感数据)进行微调,以创建高度适用于特定声学环境的定制模型。

11

说话人日志化挑战

21:24
  • 说话人日志化被建模为自回归任务,模型预测带时间戳的转录片段,并为每个片段预测说话人ID。
  • 流式模型因上下文有限,比批处理模型更具挑战性,可能产生额外的虚假说话人。
  • 多说话人、重叠语音的场景(如多人会议)仍是未完全解决的难题,仅靠单通道音频输入存在性能上限。
深读这一段

讨论的问题:模型如何实现说话人日志化?该任务当前面临的主要挑战是什么?

论据 / 案例:在四、五人随意交谈的会议录音中,准确区分说话人非常困难,甚至对人类来说也是痛苦的标注任务。

12

幻觉与DPO对齐

23:19
  • 自回归模型一旦犯错,容易陷入重复生成、跳过片段等退化模式,因为错误使其偏离训练分布。
  • 直接偏好优化(DPO)是一种有效的后训练工具,通过使用正确转录(赢家)和退化生成(输家)构成的配对数据进行训练。
  • DPO能提供负向监督,帮助模型修正小型但关键的错误(如幻觉),而非用于添加新语言等大规模任务。
深读这一段

讨论的问题:为什么自回归模型会产生幻觉或退化输出?如何使用DPO来缓解这一问题?

论据 / 案例:收集模型自身产生的退化输出作为“输家”,并生成对应的正确版本作为“赢家”,构成DPO训练对。

金句

  • "语音是人类交流的主要方式之一,它绝对出现在文字之前。"
  • "我们尝试尽可能保持方案简单,因为我认为这经得起时间的考验,也更容易扩展。"
  • "模型不需要像人类那样遵守同样的约束,它们原则上可以比人类更强大。"

原文链接

查看完整访谈

完整内容见原文:Machine Learning Street Talk · 语音识别远未解决:Mistral音频研究负责人谈技术前沿