心理声学在音响中的应用:MP3压缩HRTF听觉定位入门
从物理声学到心理声学
物理声学告诉我们声音是什么——频率、幅度、相位这些客观物理量。心理声学告诉我们人听到的是什么——因为大脑对声音的解释方式和物理输入之间有不小的差异。音响系统设计的最终目的是让人"听得好",而不是让测量仪表"测得平"。理解心理声学,就是理解为什么有些工程上的"不完美"其实无伤大雅,而有些看似微小的差异却能被立刻感知。
等响曲线——为什么小音量下低频消失了
人耳对不同频率的敏感度不是均匀的。中频 3-4kHz 最灵敏——这是因为耳道的共振频率约 3kHz,加上中耳在这个频段的传递效率最高,合计提升约 10-15dB。低频(200Hz 以下)和高频(8kHz 以上)需要高得多的声压级才能感受到同样的响度。
这个特性在等响曲线(ISO 226:2003)中展示得非常清楚。低声压级时曲线陡峭——低频被大幅衰减。高声压级时曲线趋于平坦——人耳对低频的敏感度相对提升。这就是为什么小音量听歌总觉得"低音没了",不是音响的毛病,是耳朵的生理特性。
工程上这个现象催生了响度补偿(Loudness Contour)——在小音量时主动提升低频和高频来补偿人耳的自然衰减。很多功放、播放器和 DSP 系统都有这个功能。也是 dBA 加权的生理基础——A 加权曲线正是基于 40 phon 等响曲线设计。
听觉掩蔽——MP3 和 AAC 的物理学基础
听觉掩蔽是心理声学中最重要、在音频工程中应用最广泛的现象。
同时掩蔽:一个强声使得同频率附近更弱的声音变得不可听。低频更容易掩蔽高频(向上掩蔽),而高频掩蔽低频效果较差。掩蔽效果在掩蔽声频率处最强,越远越弱。掩蔽声越响,掩蔽范围越宽。
时序掩蔽:强声结束后约 50-100ms 内,紧随其后的弱声被前向掩蔽。更让人意外的是,强声前约 10-20ms 的弱声也会被后向掩蔽——说明听觉系统存在一个"时间处理窗口"。
MP3、AAC、Opus 等有损音频编码的核心工作原理就是利用掩蔽效应。编码器运行一个心理声学模型,分析当前信号中哪些频率成分被更强成分掩蔽——被掩蔽的部分可以丢弃(不分配比特),人耳听不到差异。编码器的好坏本质上就是心理声学模型精度的差异。
高压缩比(如 128kbps MP3)之所以能听出"码率差",是因为掩蔽模型不够精确,产生了可闻的编码伪影(如预回声、频谱空洞)。而高质量的 320kbps MP3 或 256kbps AAC 在多数情况下已经接近透明——在有严格控制的 ABX 盲听中,多数人已经无法区分它们和 CD 级无损的区别。
临界频带——耳朵的分辨率上限
人耳基底膜的频率分辨能力不是无限的,听觉系统将频率范围划分为约 24 个临界频带(Bark 尺度)。每个临界频带内的声音被整体处理——当一个临界频带内有多个声音时,它们会互相掩蔽。
低频段每个 Bark 带宽仅 100Hz 左右(如 20-100Hz、100-200Hz),而高频段(15-20kHz)一个 Bark 带宽达 5000Hz。这意味着在高频段人耳的频率分辨力远不如低频段精细。
这解释了均衡器设计中为什么低于一定 Q 值的调整是浪费——如果你的 EQ 带宽比一个临界频带还窄,这种精细调整在感知上没有意义。参数均衡器的 Q 值设计参考临界频带宽度是非常合理的思路。
双耳听觉——ITD、ILD 和 HRTF 声源定位
人依靠两只耳朵接收声音的微小差异来定位声源:
ITD(耳间时间差):侧面来的声音到达远耳比近耳晚约 600-650 微秒。ITD 在 1.5kHz 以下最有效(波长大于头径,相位差唯一对应方向)。
ILD(耳间声级差):头的遮蔽效应使远耳声音衰减。ILD 在 1.5kHz 以上最有效——高频波长短,遮蔽效果明显。
HRTF(头相关传输函数):描述了从声源到鼓膜的完整声学滤波——包括头、耳廓、耳道的散射和反射效应。耳廓的褶皱对不同入射角的高频产生独特的梳状滤波——这是大脑判断声源垂直方向(仰角)的主要线索。
HRTF 因人而异(头的形状不同),这是为什么标准化的虚拟环绕声(如杜比全景声耳机模式)对不同听众效果差异大。苹果 Spatial Audio 通过 iPhone 的 TrueDepth 摄像头扫描用户耳廓来生成个性化 HRTF,是目前最先进的耳机空间音频方案。
鸡尾酒会效应与 Haas 效应
鸡尾酒会效应:在嘈杂环境中选择性聆听特定声源的能力。依靠空间线索(ITD/ILD 分离不同方向的说话者)、音色线索(音高、音色差异)、视觉线索(唇读)和上下文预测共同作用。这是助听器算法中最难解决的问题——AI 降噪技术(如 NVIDIA RTX Voice、苹果语音隔离模式)本质上就是试图模拟鸡尾酒会效应。
Haas 效应(优先效应):两个相同声源以 1-40ms 时间差到达人耳时,定位由先到的声源决定。1-5ms 声像偏向先发声源但延迟声能加宽声场,5-40ms 定位完全由先发声音决定,40-80ms 开始被感知为回声。
这在音响工程中极其重要:立体声加宽可以用延迟(10-30ms 延迟分配到对侧声道);在公共广播系统中,延迟扬声器必须设置 DSP 延时使听众先听到主扬声器直达声;房间中的早期反射如果在 40ms 内且比直达声低 10dB 以上,不会破坏声像定位,反而丰富音色。
McGurk 效应——视听之间的欺骗
当播放音节 /ba/ 的音频配上 /ga/ 的口型视频时,大多数听者会感知到 /da/ 这个"合成"音节。这说明听觉不是纯粹的"耳朵听到什么就是什么"——大脑会整合视觉信息修正听觉输入。
对音响系统设计的意义:视频与音频同步至关重要。即使音频延迟 40ms 在听觉上不明显,但与视觉不同步时会产生明显的感知冲突。这就是为什么蓝牙耳机在看视频时必须保持低延迟(一般需要