傅里叶于1822年提出一个大胆主张:任何周期信号无论多复杂都可以分解为一系列正弦波的和。这个思想在200年后支撑着从MP3到Dolby Atmos的整个数字音频大厦。
从时域到频域,看问题的维度变了
时域看声音是波形随时间变化——声压如何随秒和毫秒上下波动。频域看声音是各频率成分的能量分布——在几百Hz到几千Hz每个频率"桶"里有多少能量。傅里叶变换说:任何一个复杂波形都等于一堆不同幅度、不同频率、不同相位的正弦波叠加。
工程意义:所有音频处理(均衡、分频、压缩、混响算法、有损编码)都基于频域——因为它们都是在处理频率成分。DAC前的最后一个环节(过采样和噪声整形)在频域设计。声学仿真(EASE/CATT)在频域计算房间的脉冲响应。
FFT,工程师的日常工具
快速傅里叶变换(FFT)是离散傅里叶变换的高效算法——1965年Cooley-Tukey算法将计算量从N平方降为Nlog2(N),把傅里叶变换从理论工具变成工程实践。FFT是整个数字音频领域的频谱分析器——测量频响曲线(Smaart)、实时频谱分析(RTA)、声学测量(REW)全都基于FFT。
FFT关键参数:块大小(Block Size)——频谱分辨率=采样率/块大小。48k采样率下1024点FFT分辨率为46.9Hz(看不清低频细节),65536点为0.73Hz但时间响应变慢。实际软件通常用折中值8192或16384。窗口函数——不做窗口等于把信号周期性地截断会在频谱上泄露出不存在的频率。不同的窗(Hanning、Blackman-Harris、Flat-Top)在频率分辨率和幅度精度之间取舍。实时分析中默认Hanning,精确测幅值用Flat-Top。叠加(Overlap)——50%或75%的重叠让实时分析更连贯。
采样与量化,把连续变离散
奈奎斯特-香农采样定理:要把连续信号无失真地数字化,采样频率必须至少是信号最高频率的两倍。CD的44.1kHz采样率足够覆盖20kHz——这就是44.1>2x20=40kHz的原因。低于半采样率的信号被直接数字化保留,高于半采样率的信号被ADC前端滤波器(抗混叠滤波器)滤掉——折叠回可听频段的是"混叠"噪声无法被后期消除,所以DAC前有"重建滤波器"。
量化是将模拟信号的连续电压值映射到有限个离散数字值的过程。N位量化分2^N个阶梯。16位有65536个阶梯对应96dB动态范围,24位有1677万个阶梯对应144dB。量化误差是输入信号与最近阶梯值之差——在ADC过程中留下"量化噪声"。量化噪声等于LSB(最小有效位)/根号12,16位CD约为-98dBFS——在正常音量下很安静但留余量不足时可能被听到。
抖动,用噪声换保真度
原始ADC产生的量化误差是有相关性的(失真)——与输入信号形状相关所以产生的噪声是周期性的,人耳对这种有结构的噪声非常敏感。解决思路是引入抖动——在量化前加入微小的随机噪声(约1-2个LSB的幅度),将相关性的量化误差打散成宽带的白噪声。
代价是底噪略微升高了。
回报是原来可能产生-70dB的鬼影失真消失,换来-92dB的平坦白噪声底噪——在不增加数据量的前提下大幅度改善小信号性能。这就是即使24位音频在最终母带主控中仍使用抖动的原因。各种抖动噪声形状——TPDF(三角概率分布函数)是经典选择,噪声整形把抖动噪声推到人耳不敏感的20kHz以上让可听频段底噪进一步下降。
应用层面全貌
数字音频领域三个最关键的基础模块全部来自傅里叶变换:滤波器设计(FIR和IIR都在频域设计)、有损音频编码(MP3/AAC的心理声学模型在频域运行)、音频分析和校正(Smaart/REW的实时分析在频域运行)。没理解傅里叶变换也没关系——只要记住一件事:数字音频能工作的原因,是傅里叶证明了任何声音都可以被拆成一系列正弦波然后再拼回来。200年前的定理,至今支撑着每一首流媒体歌曲。