一些声学编码学习记录
一些声学编码学习记录
lark声学与数字信号处理
将声音由模拟信号转化成数字信号需要采样、量化、编码。
PCM 脉冲编码调制,就是这三个步骤的统称。转化后的数据就是没有压缩过的原始音频数据。经由此过程产生的、没有任何处理的二进制数字序列也可以称作 PCM 或 PCM音频数据流。
那模拟声音信号是怎么来的呢?答案是麦克风设备采集。我们说话时声波在空气中传播,麦克风内部的振膜被声波推动产生振动,进而转换成连续变化的微弱电压信号。
PCM 过程是在 ADC(模数转换器)上执行的。ADC 是声卡内部的一个核心元件。
采样 简单来说,就是把连续变化的模拟信号每隔一定时间取个值,也就是进行离散化的切割,并获取采样点的模拟值。可想而知,点越多越密集,越能近似表示原来的波形,声音保真度越高,质量越好;但记录数据越多,存储容量越高。
每秒采样声音的次数称作采样频率,单位是 Hz 。
量化 将采样点的值分级量化,变换到最接近的数字,也就是用有限个数近似表示原来连续变化的值。分级越多,采样点取值更精确,声音质量越好;但同理二进制的位数更多,存储容量越大。
量化值的二进制位数称作量化位数,也叫位深
编码 将这些整数转换成二进制码。
有了这些数字信号,我们就能够保存、传输或者压缩了。
声道
简单来说,就是声音在录制或播放时,相互独立的音频信号通道。通道越多,声音的空间方位感和立体感就越强。单声道最常见,只有一路信号,没有方向感;立体声(双声道)有左右两路独立信号,能让人分辨出声音的方向;多声道(如5.1声道)则通过多个发音点,给人声音包围环绕的体验。
压缩算法
有损压缩
通过利用心理声学模型,剔除人耳不易察觉的声音信息,达到减少文件体积。常见算法有 MP3、AAC、Opus 等。
AAC 高级音频编码,是一种有损音频压缩算法。它的目的是取代 MP3,在相同码率下,它比 MP3质量更优,文件更小。它的文件格式通常是 .m4a、.aac 。
无损压缩
就是通过预测编码、熵编码等技术寻找数据里的重复规律,用更短的代码去替换重复的内容,达到减少文件体积,同时保证解压后的数据和原始数据一模一样,不丢失任何细节。常见的有 FLAC、ALAC、APE 等。
音频文件格式
纯格式
- WAV:微软的标准外壳。里面通常直接装未经压缩的原始 PCM 数据,音质最完美,但体积巨大。
- AIFF:苹果的标准外壳。相当于 Mac 系统里的 WAV 。
- M4A:苹果推广的纯音频外壳。里面可以装 AAC 算法压缩的数据,也可以装 ALAC 无损算法的数据。
算法与格式“同名”的格式
- .mp3 文件:里面装 MP3 算法压缩出来的数据。
- .flac 文件:里面装的也是 FLAC 算法压缩出来的数据。
- .aac 文件:里面装的也是 AAC 算法压缩出来的数据。
特殊用途格式
- MIDI (.mid):不是声音文件,里面只有一张乐谱指令,告诉设备什么时候、用什么乐器、弹哪个音,里面没有声音波形数据。
- DSD:专为 SACD 光盘设计的超高品质格式,采用 1bit 的极高频率采样。
比特率
又叫码率,就是每秒钟传输或处理的二进制数据量,单位是 bps。
音频压缩后每秒声音数据多大用比特率衡量,常用单位 kbps,比特率越高,保留的声音细节越多,音质越好,但文件也越大。
对于人声(如语音消息、语音识别、播客等),64 kbps 是一个非常经典的标准。在这个码率下,人声听起来非常清晰,且文件体积小,适合网络传输;如果是像听歌这种,则需要更高。
奈奎斯特定理
没研究原理,不懂。
也叫采样定理,结论主要是采样频率必须大于或等于信号最高频率的两倍,才能不失真地还原原来的声音。
eg: 人耳听觉的上限频率约为 20kHz,根据奈奎斯特定理,采样率至少需要 40kHz。因此,标准 CD 的采样率为 44.1kHz 。

