音响系统做的一切最终都要通过人耳评判。但人耳不是一个平坦的测量仪器——不同频率不同响度下灵敏度差异巨大,听觉感知还受心理预期、视觉信息甚至价格标签影响。理解人耳真实特性,是看懂音响设计为什么这么做的关键。
听觉阈值,人耳到底能听多轻多宽
最微弱声音对应声压约20微帕斯卡定义为0dB SPL。日常安静卧室底噪25到30dB SPL,录音棚控制室15到20dB SPL——这是你的听音环境底噪,低于这个水平再细微也听不到。
频率范围约20Hz到20kHz但不是平直线。3到4kHz附近人耳最敏感——耳道长2.5cm共振频率约3kHz(提升该频段10到15dB),中耳传声机构在该频段也有传递效率峰值。3到4kHz恰好是人类语音辅音(s、f、t、sh)的关键频段——进化使人耳在此特别灵敏。低频端200Hz以下需要明显更高声压级才能感知相同响度,高频端8kHz以上灵敏度也快速下降。这就是小音量听音乐总觉低音不够的原因——不是音箱的问题,是耳朵的等响特性使然。
等响曲线,响度不是线性的
1933年Fletcher和Munson绘制最早等响曲线,后修订成ISO 226:2003标准。展示在不同频率上需要多大SPL才能听者感觉与1kHz参考"一样响"。低声压级(20-40 phon)时低频衰减非常严重——100Hz需比1kHz高出约20dB才能感觉同样响。高声压级(90 phon以上)时曲线趋于平坦,不同频率灵敏度差异缩小。这就是大音量下低频明显变多的原因。
等响曲线在音响工程中三个直接应用:响度补偿在小音量时自动提升低频补偿自然衰减,混音师在大中小三种音量下检查频率平衡,dBA加权基于40 phon等响曲线设计大幅衰减低频。
临界频带,耳朵分辨力有限
听觉系统将频率范围划分约24个临界频带,每个频带内声音作为一个整体处理。相距在一个临界频带内的两个声音互相干扰(掩蔽),超过一个临界频带时干扰大幅减少。Bark尺度是心理声学描述这种划分的标准——低频段每带约100Hz,高频段每带可达数千Hz。
工程含义:有损音频编码利用临界频带内掩蔽效应丢弃听不到的信息,EQ的Q值不宜过窄——窄于临界频带的EQ调整在感知上浪费,房间声学测量通常按1/3倍频程进行精度与Bark尺度相当。
听觉掩蔽,一种声音怎么让另一种消失
同时掩蔽:低频更容易掩蔽高频(向上掩蔽),高频掩蔽低频效果较差,掩蔽声越响掩蔽范围越宽。人耳实际相当于频谱分析仪加掩蔽阈值计算器——只关注没被掩蔽的声音成分。时域掩蔽:强声后50到100ms弱声被掩蔽(前向),强声前10到20ms弱声也被掩蔽(反向)——听觉处理存在时间窗口。
MP3和AAC编码器心理声学模型正是基于这些原理。编码器的优劣差异本质上就是心理声学模型精度差异。
双耳听觉,怎么定位声音
ITD(耳间时间差)——侧面来的声音到达远耳比近耳晚约600到650微秒,1.5kHz以下最有效。ILD(耳间声级差)——头遮蔽使远耳声音比近耳轻,1.5kHz以上最有效。HRTF(头相关传输函数)描述声源到鼓膜间完整声学滤波,包括头部耳廓耳道散射和反射。耳廓褶皱对不同入射角高频产生独特梳状滤波——判断垂直方向的主要线索。每个人头部外形不同HRTF因人而异,虚拟环绕声对不同人效果差异巨大的原因在此。
从听觉到音响设计
为什么需要24bit/96kHz?人耳动态范围约120dB,16bit的96dB已能覆盖大部分听音场景,24bit价值主要在录音环节。为什么中音单元比高音低音更关键?人耳对中频200Hz到4kHz最敏感,也是人声和大多数乐器基频集中区。为什么小音量下低频消失?等响曲线低频衰减——不是设备故障是生理特性。为什么好编码器听起来更好?心理声学模型精度决定掩蔽阈值计算准确度。