0%

Audio

Reference:李宏毅 2020 机器学习课程(语音识别部分)

语音识别概览

Audio Encoder

LAS(Seq2Seq)

Attention method 2

CTC

各方法对比总结

HMM

Phonetic Posteriorgrams(PPG)

PPG 是用于表示语音信号中音素概率分布的一种高层语音特征,它给出语音信号在每个时间帧上属于不同音素的概率。

概念拆解

音素(Phoneme)

音素是语言中最小的发音单位,能够区分词语的发音。例如英语中的 /p/ 和 /b/ 是两个不同的音素,因为它们区分了 "pat" 和 "bat"。

后验概率(Posterior Probability)

后验概率是在给定观察数据的情况下某一事件发生的概率。在语音处理的语境下,它表示给定某一帧的语音特征时,该帧属于某个音素的概率。

后验概率图(Posteriorgram)

后验概率图是一种矩阵表示:每一行代表一个时间帧,每一列代表一个音素,矩阵中每个元素表示该时间帧属于对应音素的概率。

如何计算 PPG

  1. 声学模型(Acoustic Model):用训练好的声学模型(如 DNN 或 CNN)把输入的语音信号转换为高层次特征。
  2. 概率分布:通过声学模型对每个时间帧的语音特征进行分类,得到每个音素的概率分布,这一步通常用 softmax 计算后验概率。
  3. 生成 PPG:把所有时间帧的音素概率分布组合成一个矩阵,即得到 phonetic posteriorgram。

应用

PPG 在需要高层次语音特征的任务中被广泛使用:

  • 语音合成(Speech Synthesis):PPG 可以作为中间特征,帮助生成更自然、更连贯的合成语音。
  • 语音转换(Voice Conversion):用 PPG 表示源语音的音素信息,再映射到目标语音的音素空间,从而实现高质量的语音转换。
  • 说话人识别(Speaker Recognition):PPG 提供了与具体说话人无关的语音内容信息,有助于分离内容与说话人特征。

PPG 的核心价值在于它把「说什么」和「谁在说」解耦开:音素后验只描述内容,因此适合作为跨说话人任务的中间表示。