外观
语音与音频
一句话定义:语音与音频处理是深度学习"序列建模 + 信号表示"交汇的领域——把连续的声波变成特征序列,再用RNN 与序列建模或Transformer 架构学会"听"(识别)与"说"(合成)——它是深度学习最早大规模商用的战场之一,也是今天多模态大模型的重要一翼。
一、音频表示
音频在计算机里是波形(waveform):每秒 16000~48000 次采样的一维数组。直接喂神经网络可行,但长且冗余,所以行业惯例是变换到时频域:
- 短时傅里叶变换(STFT):把波形按帧(约 25ms)切块做傅里叶变换,得到"时间×频率"的谱图;
- 梅尔谱(Mel-spectrogram):把频率轴按人耳感知(梅尔刻度)压缩,更贴合听觉——是 TTS 与许多语音模型的标准输入;
- MFCC:对梅尔谱再做离散余弦变换取低维系数,早年 ASR 的主流特征,如今地位被深度特征取代;
- 特征 vs 端到端:现代端到端系统常直接从波形或原始梅尔谱学习,让网络自己学特征(特征工程的思想对比见数据与数据工程)。
二、ASR 演进:从 CTC 到 Whisper
语音识别(Automatic Speech Recognition, ASR)要解决的核心难题是对齐:语音帧(每秒上百帧)与文本字词(每秒几个字)长度不齐且无标注对齐。三代方案:
- HMM-GMM 时代(前深度学习):手工声学模型 + 发音词典 + 语言模型,工程复杂;
- CTC(2006,Graves;2014+ 深度化):允许网络输出"重复+空白"的对齐路径,用动态规划汇总所有可能对齐的损失——不用逐帧标注,是深度学习 ASR 的第一块跳板;
- Seq2Seq 注意力 / Transformer:把语音编码成特征序列,用注意力解码出文本(Listen, Attend and Spell,2015;此后 Transformer 全面接管)。
Whisper(2022,OpenAI)是 ASR 的范式转折:用 68 万小时多语言弱监督数据(网络抓取、无人工精标)+ 大规模 Transformer 训练,实现了 99 种语言的识别、翻译与时间戳对齐,"开箱即用"覆盖远超此前所有系统。它验证了"数据规模 > 架构精巧"在语音领域同样成立(与大语言模型(LLM)的预训练逻辑一脉相承)。
三、TTS:从拼接语料到神经合成
语音合成(Text-to-Speech, TTS)的演进:
| 系统 | 年份 | 类型 | 特点 |
|---|---|---|---|
| WaveNet | 2016 | 自回归波形生成(扩张因果卷积) | 首次超越拼接/参数式 TTS 质量,但逐样本生成极慢 |
| Tacotron / Tacotron 2 | 2017/2018 | Seq2Seq 文本→梅尔谱 | 端到端文本到语音,配合声码器出波形 |
| FastSpeech / 并行 TTS | 2019 | 非自回归(长度规整+并行) | 放弃逐帧自回归,速度百倍提升 |
| VITS | 2021 | 端到端 + VAE + 对抗训练 | 单模型文本→波形,质量高、延迟低,开源社区主力 |
| 扩散 TTS(Diff-TTS/Grad-TTS) | 2021 | 扩散模型生成梅尔谱 | 质量与自然度进一步突破,见"扩散模型与生成式 AI"一文 |
TTS 的深层困难:声学不唯一性(同一句话有无数种自然发音)、韵律与情感、长文本的稳定性(重复、跳字)。大模型时代 TTS 走向"音频语言模型"(见后文)。
四、语音增强与分离
- 语音增强(enhancement):从带噪/混响音频里恢复干净语音,本质是回归到干净目标(常是理想掩码/频谱)。是会议系统、助听器、远场语音的核心前置模块;
- 语音分离(separation):从多人混叠的录音里分出每个说话人的声音("鸡尾酒会问题")。方法从频谱掩码到**置换不变训练(PIT)**再到近年的大规模分离模型(SepFormer、SCNet);
- 共同点:都是"带噪输入→干净输出"的序列到序列回归,注意力/Transformer 已是默认骨架。
五、音频大模型
2022 年后,语音与音频加速并入"大模型"叙事:
- AudioLM(2023,Google):用类似 BERT/GPT 的方式预训练音频 token(声音被离散化成 codec token),能做无文本的音色续写、跨语言迁移;
- 文本到音频:AudioLDM、Stable Audio、SongGen(2025,字节跳动)等用扩散模型/语言模型做音乐与音效生成(音乐生成的扩散路线见扩散模型与生成式 AI);
- 语音大模型:GPT-4o 的"语音对话"、各类 streaming ASR/TTS 大模型把"听-想-说"压成一个模型——与多模态模型的"统一模态"路线完全同构;
- speech-to-speech:直接把语音转语音(保留情感与音色),绕开文本中间表示。
六、流式与延迟权衡
语音系统的工程命脉是延迟:
- 流式(streaming):边听边出结果,ASR/TTS 都要"只依赖已到达的输入",这限制了注意力的"看未来"能力——流式系统常被迫用单向/因果结构(RNN 在这类场景仍有存在价值,见"RNN 与序列建模"一文);
- 非流式(offline):整句处理、可用双向注意力,质量更高(Whisper 属此类);
- 权衡策略:分块流式注意力(Chunked Attention)、"先快后慢"双遍识别、推理加速(KV cache、量化,见"大语言模型(LLM)"一文)都是工程对策;
- 指标上除了 WER(词错误率)/MOS(自然度主观分),**实时率(RTF,处理 1 秒音频所需时间)**是服务设计的关键数。
工程要点
语音系统的评测比想象中苛刻:同一个人说话快慢、口音、噪声环境的不同,会让模型表现天差地别。训练/测试集分布匹配优先于刷 WER 数字,测试集设计方法见深度学习评估与实验。
七、权衡与取舍
- 流式 vs 质量:实时体验(会议、客服)必须流式,愿意等(字幕、批量转写)用非流式拿更好质量;
- 自回归 vs 并行:自回归 TTS 自然但慢,非自回归/扩散快但需要额外机制保证稳定性;
- 专用 vs 大而全:Whisper 类大模型泛化强但重、延迟高;轻量专用模型(端侧 ASR)快但场景窄——端侧部署考虑见MLOps 与模型部署;
- 特征 vs 端到端:MFCC 等人工特征便宜、利于传统信号处理对接;梅尔谱/原始波形端到端上限更高但更吃数据算力。
延伸阅读
- RNN 与序列建模——流式语音中的循环结构
- Transformer 架构——Whisper/语音大模型的骨架
- 多模态模型——语音进入统一多模态的路径
- 扩散模型与生成式 AI——扩散 TTS 与音频生成
- 大语言模型(LLM)——语音大模型背后的范式
- 数据集与工具档案——LibriSpeech 等语音数据集与工具
参考资料
- Graves et al. Connectionist Temporal Classification: Labelling Unsegmented Sequence Data with Recurrent Neural Networks (ICML 2006)
- Chan et al. Listen, Attend and Spell (ICASSP 2016)
- Radford et al. Robust Speech Recognition via Large-Scale Weak Supervision (Whisper) (ICML 2023)
- van den Oord et al. WaveNet: A Generative Model for Raw Audio (2016)
- Wang et al. Tacotron: Towards End-to-End Speech Synthesis (Interspeech 2017)
- Kim et al. Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech (VITS) (ICML 2021)
- Borsos et al. AudioLM: a Language Modeling Approach to Audio Generation (IEEE/ACM TASLP 2023)
- Panayotov et al. LibriSpeech: an ASR corpus based on public domain audio books (ICASSP 2015)