做公共广播二十年,我告诉你一个反常识的事:有损音频编码之所以能工作,不是靠数学算法有多聪明,而是靠"骗"你的耳朵。心理声学模型决定了什么该留下、什么可以丢掉。

MP3的压缩秘密

从CD的1.4Mbps(1411kbps)压缩到128kbps——压缩比超过10:1,丢掉超过90%的数据。但大多数人在大多数场景下听不出差别。核心在于:只保留人耳能感知的信息,丢弃那些"客观存在但主观听不到"的信息。这就叫感知编码。

MP3编码器的标准处理流程:先用滤波器组把音频切成32个子带(MPEG-1 Layer III用到576个频率槽)。FFT分析出频谱分布后,心理声学模型计算各频率的掩蔽阈值——"这个频率在多大音量以下人耳就听不到了"。比特分配阶段"够用的给够,不够用的挤出比特,人耳听不到的直接归零"。最后经过量化和哈夫曼编码打出最终码流。

MP3有三种码率控制:CBR(恒定码率)每个音频帧占用固定比特数,简单可预测但复杂信号会不够用。VBR(可变码率)简单段落用最少的比特、复杂段落自动加码率——同样文件大小下音质更好。ABR(平均码率)设定平均目标,单帧在较大范围内的VBR来保证最终文件大小和总体音质平衡。

AAC,MP3的进化版

AAC是"Advanced Audio Coding"——设计和MP3同一批人(MPEG),但晚了十多年,工艺成熟了很多。更精细的滤波器组(1024个频率槽对576),更灵活的整体设计(支持更多声道组合、采样率和编码工具)。

128kbps AAC大样本测试中在大多数音乐类型接近透明(接近无法与原始CD区分)。AAC是目前YouTube、Apple Music、主流游戏和系统提示默认使用的音频编码格式。

心理声学模型,编码的灵魂

最好的编码器不是丢数据最少的——是丢得最聪明、人耳听不出来的。利用同时掩蔽丢弃被强频率分量"遮住"的近邻弱频率分量,利用人耳对低频敏感、掩蔽阈值低的特点给低频分更高比特,高基频乐器的谐波序列掩蔽规则让编码器只保留能被听到的谐波。纯音和噪声的判断和速率差异直接影响比特分配。

编码器版本间差异:LAME(开源MP3编码器)多年迭代优化,-V0(最高质量VBR约245kbps)在大多数测试中被认为透明。iTunes AAC在高码率下品质稳定极难盲测区分。Fraunhofer是AAC的原始标准制定者。

从MP3到高解析

MP3发展的核心故事是128kbps从"能用"到"很好"的进化。1997年的128kbps MP3和2005年的128kbps LAME MP3音质天差地别——同样比特率十年间算法迭代带来几个dB的噪声改善和更多心理声学优化。

到2020年代,256kbps AAC已能做到绝对透明,无损FLAC和320kbps MP3在绝大部分设备上差异仅存在于测试仪器层面。但有一道门槛存在:16bit/44.1kHz的CD Red Book在实际听感中已经达到了人耳动态范围的天花板。更高的解析度(24bit/96kHz或更高)主要在录音和混音过程中有价值——提供了更宽的动态余量和更放心的操作空间。对于最终消费者而言,24bit/96kHz与16bit/44.1kHz的差异在严格的音量匹配和盲测条件下很难被可靠区分。

空间音频:下一个维度

心理声学最新的应用战场是空间音频。Apple的空间音频利用HRTF算法模拟声音从三维空间不同位置传来——这是心理声学从"频域"走向"空间域"的重大转折。传统的频域掩蔽是决定"某一频率是否被掩蔽";空间音频则是Dolby Atmos解码器实时运算128个音频对象的空间掩蔽,决定"这一声音从哪个方向传来"。