Skip to content

语音与音频

本页速览 语音与音频是深度学习早期落地最深的领域之一。本文从波形/MFCC/梅尔谱等表示讲起,梳理 ASR 从 CTC 到 Seq2Seq 再到 Whisper 大规模弱监督的演进,TTS 从 Tacotron/WaveNet 到 VITS 与扩散 TTS,并介绍语音增强、分离、音频大模型与流式延迟的工程权衡。

语音与音频

一句话定义:语音与音频处理是深度学习"序列建模 + 信号表示"交汇的领域——把连续的声波变成特征序列,再用RNN 与序列建模Transformer 架构学会"听"(识别)与"说"(合成)——它是深度学习最早大规模商用的战场之一,也是今天多模态大模型的重要一翼。

一、音频表示

音频在计算机里是波形(waveform):每秒 16000~48000 次采样的一维数组。直接喂神经网络可行,但长且冗余,所以行业惯例是变换到时频域

  • 短时傅里叶变换(STFT):把波形按帧(约 25ms)切块做傅里叶变换,得到"时间×频率"的谱图;
  • 梅尔谱(Mel-spectrogram):把频率轴按人耳感知(梅尔刻度)压缩,更贴合听觉——是 TTS 与许多语音模型的标准输入;
  • MFCC:对梅尔谱再做离散余弦变换取低维系数,早年 ASR 的主流特征,如今地位被深度特征取代;
  • 特征 vs 端到端:现代端到端系统常直接从波形或原始梅尔谱学习,让网络自己学特征(特征工程的思想对比见数据与数据工程)。

二、ASR 演进:从 CTC 到 Whisper

语音识别(Automatic Speech Recognition, ASR)要解决的核心难题是对齐:语音帧(每秒上百帧)与文本字词(每秒几个字)长度不齐且无标注对齐。三代方案:

  1. HMM-GMM 时代(前深度学习):手工声学模型 + 发音词典 + 语言模型,工程复杂;
  2. CTC(2006,Graves;2014+ 深度化):允许网络输出"重复+空白"的对齐路径,用动态规划汇总所有可能对齐的损失——不用逐帧标注,是深度学习 ASR 的第一块跳板;
  3. Seq2Seq 注意力 / Transformer:把语音编码成特征序列,用注意力解码出文本(Listen, Attend and Spell,2015;此后 Transformer 全面接管)。

Whisper(2022,OpenAI)是 ASR 的范式转折:用 68 万小时多语言弱监督数据(网络抓取、无人工精标)+ 大规模 Transformer 训练,实现了 99 种语言的识别、翻译与时间戳对齐,"开箱即用"覆盖远超此前所有系统。它验证了"数据规模 > 架构精巧"在语音领域同样成立(与大语言模型(LLM)的预训练逻辑一脉相承)。

三、TTS:从拼接语料到神经合成

语音合成(Text-to-Speech, TTS)的演进:

系统年份类型特点
WaveNet2016自回归波形生成(扩张因果卷积)首次超越拼接/参数式 TTS 质量,但逐样本生成极慢
Tacotron / Tacotron 22017/2018Seq2Seq 文本→梅尔谱端到端文本到语音,配合声码器出波形
FastSpeech / 并行 TTS2019非自回归(长度规整+并行)放弃逐帧自回归,速度百倍提升
VITS2021端到端 + VAE + 对抗训练单模型文本→波形,质量高、延迟低,开源社区主力
扩散 TTS(Diff-TTS/Grad-TTS)2021扩散模型生成梅尔谱质量与自然度进一步突破,见"扩散模型与生成式 AI"一文

TTS 的深层困难:声学不唯一性(同一句话有无数种自然发音)、韵律与情感长文本的稳定性(重复、跳字)。大模型时代 TTS 走向"音频语言模型"(见后文)。

四、语音增强与分离

  • 语音增强(enhancement):从带噪/混响音频里恢复干净语音,本质是回归到干净目标(常是理想掩码/频谱)。是会议系统、助听器、远场语音的核心前置模块;
  • 语音分离(separation):从多人混叠的录音里分出每个说话人的声音("鸡尾酒会问题")。方法从频谱掩码到**置换不变训练(PIT)**再到近年的大规模分离模型(SepFormer、SCNet);
  • 共同点:都是"带噪输入→干净输出"的序列到序列回归,注意力/Transformer 已是默认骨架。

五、音频大模型

2022 年后,语音与音频加速并入"大模型"叙事:

  • AudioLM(2023,Google):用类似 BERT/GPT 的方式预训练音频 token(声音被离散化成 codec token),能做无文本的音色续写、跨语言迁移;
  • 文本到音频:AudioLDM、Stable Audio、SongGen(2025,字节跳动)等用扩散模型/语言模型做音乐与音效生成(音乐生成的扩散路线见扩散模型与生成式 AI);
  • 语音大模型:GPT-4o 的"语音对话"、各类 streaming ASR/TTS 大模型把"听-想-说"压成一个模型——与多模态模型的"统一模态"路线完全同构;
  • speech-to-speech:直接把语音转语音(保留情感与音色),绕开文本中间表示。

六、流式与延迟权衡

语音系统的工程命脉是延迟

  • 流式(streaming):边听边出结果,ASR/TTS 都要"只依赖已到达的输入",这限制了注意力的"看未来"能力——流式系统常被迫用单向/因果结构(RNN 在这类场景仍有存在价值,见"RNN 与序列建模"一文);
  • 非流式(offline):整句处理、可用双向注意力,质量更高(Whisper 属此类);
  • 权衡策略:分块流式注意力(Chunked Attention)、"先快后慢"双遍识别、推理加速(KV cache、量化,见"大语言模型(LLM)"一文)都是工程对策;
  • 指标上除了 WER(词错误率)/MOS(自然度主观分),**实时率(RTF,处理 1 秒音频所需时间)**是服务设计的关键数。

工程要点

语音系统的评测比想象中苛刻:同一个人说话快慢、口音、噪声环境的不同,会让模型表现天差地别。训练/测试集分布匹配优先于刷 WER 数字,测试集设计方法见深度学习评估与实验

七、权衡与取舍

  • 流式 vs 质量:实时体验(会议、客服)必须流式,愿意等(字幕、批量转写)用非流式拿更好质量;
  • 自回归 vs 并行:自回归 TTS 自然但慢,非自回归/扩散快但需要额外机制保证稳定性;
  • 专用 vs 大而全:Whisper 类大模型泛化强但重、延迟高;轻量专用模型(端侧 ASR)快但场景窄——端侧部署考虑见MLOps 与模型部署
  • 特征 vs 端到端:MFCC 等人工特征便宜、利于传统信号处理对接;梅尔谱/原始波形端到端上限更高但更吃数据算力。

延伸阅读

参考资料