拓冰建站拓冰建站
首页 / 资讯中心 / 正文

音频质量评估指南:从客观指标到主观听感的完整框架

在聊音频质量评估指标之前先讲一件上个月真实发生的事。帮朋友调试一套近场监听系统扫频、失真、底噪全测了一遍软件弹出来的数字接近“完美”频响波动在±1dB以内THDN不到0.05%底噪低到几乎听不见。按任何量化标准这套系统都属于“数据健康”。但朋友听了一下午始终觉得高频发毛人声咬字不自然尤其女声唇齿音一出来就烦躁。后来拉了一场双盲ABX才把那点不对劲钉死在高音单元8k到11kHz之间的一个谐振峰上——频响图上只有3dB左右的小鼓包写报告都算“平直”但听感上就是一层挥之不去的金属味。这个案例基本概括了音频质量评估这个领域最让人头疼的地方指标到底在测什么指标和听感之间隔着什么以及什么时候该相信数字、什么时候该相信耳朵。这篇内容想把从主观到客观的完整框架讲清楚主观评价怎么做到严谨不玄学客观指标每一类在测什么、怎么读、怎么和听感挂钩以及现实条件下一套能落地的评测链路怎么搭。适合音频算法工程师、声学相关从业者、音频硬件评测爱好者也适合做语音通信质量优化的人参考。1. 音频质量评估的两条路线为什么“数据完美”和“听着好听”经常对不上1.1 一个“数据完美但听着不对劲”的真实案例先把前面那个案例拆开看。那对近场监听在测试环境里测得的THDN表现非常好为什么耳朵还能找出毛病原因在于THDN只衡量了总谐波失真加噪声的总能量测的是所有谐波和噪声功率加在一起后的比值不同谐波分量、不同来源的噪声被一股脑地加总了。一只扬声器如果只在特定频段存在窄带谐振这个能量占比放在整个频段里看并不大THDN很容易就被“稀释”掉。而人耳对窄带共振非常敏感尤其是中高频段哪怕只有几dB的峰都会表现为刺耳、发毛、齿音过重。测量仪器没有主观偏重它把一切误差一视同仁地计权人的听觉系统却对某些频段、某些时间特征异常敏感。这还没算另一个问题测量系统本身是稳态正弦扫频几乎不会捕捉到瞬态失真、间隙性噪声、时钟抖动边带这类随机/非平稳问题。也就是说仪器看到的是一个“平均值”世界人耳听的是一个“动态变化”世界。数字漂亮只能说明系统在测试条件下没有明显毛病不能说明系统在任何情况下都让人舒服。1.2 人耳是一种远比频谱仪复杂的“设备”为什么客观指标不能完全等价于听感因为人耳的听觉机制从来就不是一台线性频谱分析仪。具体说有这几个层次频率分辨率是可变的人耳在低频段频率分辨率较弱中高频段较强听音乐时中高频段轻微的频响不平整很容易被察觉低频室驻波则更多表现为“轰鸣感”而不是“音高变化”。响度感知是非线性的等响度曲线Fletcher-Munson曲线说明不同声压级下人对不同频率的敏感度完全不同。低音量听歌时低频听起来远小于物理测量值高频相对更突出。所以一套扬声器在85dB SPL声压级测得平直在60dB SPL下可能是另一副声音。做主观对比时音量如果不匹配结论几乎必然出偏差。掩蔽效应决定“听得到”和“听不到”的边界一个较强的信号可以掩盖同时发生或邻近频率的较弱信号但失真分量如果处于掩蔽阈值之外或者出现在背景变安静的时刻就会非常可闻。稳态总谐波失真测量不会记录“这段音乐里失真是否被掩盖”只能机械地算出比例。时间维度极重要瞬态冲击、预回声、拖尾、衰减振荡这些对听感影响巨大但很多客观指标在时间维度上是“哑巴”。所以主观评价和客观评价本质上测的是两层东西客观指标测物理信号层面的误差主观评价测人的感知层面的差异。两者的关系更像“体检报告”和“身体感受”——体检看器官指标身体感受看整体状态两者相关但永远不会完全一致。2. 主观评价怎么做才能不再是“我觉得好听”很多人在评价音频设备或算法时惯用语是“我觉得这个好听”“那个有点闷”。这种个体经验作为早期筛选可以但做产品决策、算法调参、设备选型时远远不够因为个体偏好、心理暗示、环境干扰都可能扭曲判断。主观评价升高到“方法论”层面之后完全是另一套玩法。2.1 双盲ABX测试唯一能说服自己的降噪工具ABX是我日常用得最多的主观对比方法因为它的逻辑足够简单实际执行足够严格。流程是这样的被测对象A和B系统再给一个XX随机来自A或B。试听者不知道X是哪一个只被要求回答“X是A还是B”。由于试听者自己也不知道哪个是哪个心理暗示被极大削弱如果连续多次判断都正确说明A和B之间确实存在可听得见的差异。实际操作时有几个经验电平必须匹配到±0.1dB以内。很多人做ABX实际比较的是音量差而不是音色差。响度差异对主观判断的干扰远高于其他变量。先用测量设备校准而不是靠耳朵“感觉一样响”。每轮之间要做随机化。同一首歌、同一段素材让X随机落在A或B上统计上才能排除侥幸因素。用统计显著性替代“我觉得有区别”。最常见的方法10次判断中有至少9次正确二项检验逼近p0.01基本可以认定存在可闻差异20次中至少15次正确也显著。如果只有60%正确率那不管听起来多么“明显”统计上都不支持差异存在。选测试素材要照顾敏感频段。纯低频、纯高频、密集人声、打击乐瞬态、弱混响的安静片段各准备几段。很多差异只在特定的素材条件下暴露。关于ABX工具foobar2000的ABX组件比较方便也可以用DeltaWave这类专业对比软件。后者还能顺带记录时间对齐、时钟漂移修正后的样本级差异对量化ABX结论帮助很大。2.2 MUSHRA对比多个算法时的高阶玩法如果只是对比两个设备ABX够了。但当手上同时有三五个编解码器、三五个降噪算法要横向排序时ABX的低效会让测试周期拉得极长。这时适合用MUSHRAMUlti Stimulus test with Hidden Reference and Anchor标准号ITU-R BS.1534。MUSHRA的核心设计思想是“相对比较参考锚定”。测试里会送进来多个待测样品其中包含一个隐藏的原始参考hidden reference和几个锚点anchor。锚点一般是故意降低质量的版本比如截掉3.5kHz以上的低通版本用来给评分划定“低分区间”。评听员听完全部样品后在0到100的连续刻度上给每个样品打分。因为隐藏参考理论上应该拿高分锚点理论上应该拿低分评听员的分寸感就有了锚。我做过几轮不同音频编解码器的MUSHRA测试最大的体感是这个方案极大减少了“评分员今天心情好不好”带来的方差。绝对打分靠不住相对打分靠谱得多。实际执行时要求评听员先听一遍所有样品形成整体感知尺度再开始正式评分而且同一组样品建议让评听员反复切换对比而不是听完一个评一个。2.3 MOS评分大规模主观语音质量测试的老牌方案如果是语音通话链路、VoIP效果、语音增强算法这类场景最常见的还是MOSMean Opinion Score。ITU-T P.800规定了两种典型方法ACR绝对等级评分和DCR退化等级评分。ACR就是听一段语音后直接给1到5分5是极好1是极差DCR则每次都和参考对一下比较“退化程度”适合评测增强或修复类算法。MOS看着简单落地全是细节评听员不能太少正式测试一般要求至少20到30人且都做过听力筛查材料要覆盖男声、女声、安静环境、噪声环境不能只测一种语音场地背景噪声要控制在很低水平播放设备和监听耳机也要统一。最终分数不是简单平均还要剔除异常评听员、计算置信区间必要时对分数做回归映射如MOS-LQO。所以真有团队以为“拉五个人听一遍打平均分就是MOS”那就和晒了个假成绩差不多。主观评价把这套体系走完时间成本、人力成本、环境成本都很高这也是为什么客观指标在现代音频工程里依然是第一道门。3. 客观指标全家桶基础电声指标与感知客观指标的分类拆解客观指标按测量对象可以大致切分为两大块一类是传统电声指标直接测物理量不理解调之后是什么场景另一类是感知型客观指标算法把参考/受损音频映射成估测的人耳差异输出一个类似“模拟MOS分”的结果。两者的用途完全不同混为一谈是很多误解的根源。3.1 基础电声指标频响、THDN、噪声、动态范围、IMD的测量口径我在实际工作中常看的电声指标就这几个指标常见测量条件量纲/表达对应听感问题频率响应正弦扫频1kHz归一化dB±x dB音色平衡、冷暖、亮暗THDN1kHz正弦-1/-3dBFS输入22Hz-22kHz带限% 或 dB失真、颗粒感、粗糙感信噪比SNR静音段与参考电平下的噪声比dB底噪、黑位、安静段落沙沙声动态范围从最大不失真电平到噪声底dB大小声压差、细节表现IMD互调失真SMPTE 60Hz7kHz双音或CCIF 19kHz20kHz%人声浑浊、乐器分离度下降串扰单声道信号输入测量另一声道泄漏dB声场宽度、定位模糊群延迟/相位全频段相位测量度或ms声像一致性、频率叠加干涉这里面最容易出误会的两个指标是THDN和IMD。THDN测的是谐波加噪声总能量但两个完全不同的设备可能得到相同的THDN数值一个的失真集中在二次谐波听感相对“暖”一个的失真集中在五、六次以上高次谐波听感明显更硬更刺耳。所以只看一个总百分比远远不够要养成看谐波能量分布的习惯尤其看三次、五次谐波有没有异常抬升。IMD则完全不在THD的成绩单里。两个纯音叠加后系统非线性会产生两个基频的和差分量这些分量通常落在非谐波位置人耳对非谐波失真特别敏感因为正常音乐信号里不该出现这些频率组合。很多“参数漂亮但声音脏”的设备IMD指标往往不怎么样。频响测量也有坑。普通设备上用扫频所得的频响曲线是稳态响应它不能反映时域上的能量积累。两个频响完全一样的扬声器在瀑布图衰减-频率-时间三维图上可能有完全不同的表现一个在低频段有长拖尾一个干净利落。所以测量频响最好同时看对应的CSD/瀑布图不要把一条平直的曲线当成全部真相。3.2 感知型客观指标PEAQ、PESQ/POLQA、STOI是如何“模拟人耳”的传统电声指标是物理测量的“通用货币”但不回答“人觉得怎么样”。于是出现了第二类指标感知型客观指标。它们的思路是先模拟人耳的外中耳滤波、临界频带划分、响度感知、掩蔽效应再用统计模型把“输入信号和参考信号的感知差异”映射成一个可比较的分数。代表性工具包括PEAQITU-R BS.1387用于音频编解码器质量评估输出ODGObjective Difference Grade0表示无感知差异负值越小越差。做AAC/Opus/MP3这类有损编码横向对比时我很常用能快速筛出采样率码率变化带来的影响但要记住它和任何主观分一样存在“不准的边角”。PESQITU-T P.862/ POLQAITU-T P.863用于语音质量评估。PESQ主要适配窄带电话语音POLQA是它的接任者对宽带/超宽带语音的预测准确度提升明显输出MOS-LQO。VoIP网关、通信链路的补盲阈值通常用它们来定。STOIShort-Time Objective Intelligibility这个指标衡量的是可懂度而不是质量输出0到1。语音增强算法和ASR前端链路经常会用比如去噪之后听感可能不算好但STOI显著提升说明字词辨识度确实改善了。ViSQOL同时支持全带宽音频和语音倒谱距离加听觉模型适用范围比PESQ更宽在一些音视频会议系统评测里出现过。这类感知指标最大的优势是能自动化、可重复、成本低最大的风险是它们本身是模型不完全等于人耳。尤其面对近年来神经网络的语音增强/去混响/超分算法模型输出和真人听感背离的情况并不少见。所以我的使用原则很明确感知指标用于回归测试、版本对比、快速筛查关键节点仍然用MUSHRA或ABX收口。3.3 无参考与半参考指标没有原始音源时怎么判断前面的客观指标几乎都需要参考信号原始无损/原始语音但真实场景常有拿不到参考的时候——比如实时通信监控、会议系统每日质量巡检、直播链路上某条线路持续质量劣化。这时就要用到无参考指标。业界常见的无参考方案包括传统模型P.563窄带语音MOS预估以及近年基于深度学习的NISQA、DNSMOS等。这类模型训练时用海量带标数据拟合人类评分在“趋势判断”层面有一定参考价值突然掉0.5分说明链路大概率出问题了。但它们用作绝对仲裁还不太靠谱因为训练集外的失配条件可能让预测完全失真。所以我在实时质量监控项目上的做法是无参考指标设阈值告警 告警后抓包录音 层级用ABX或POLQA复核。没有原始音频绝不断言“这路信号听感很差”。4. 把指标和听感挂钩哪些是底线哪些只是参考客观指标不能完美预测听感但不等于没规律可循。多年实践下来电子工程、声学工程、语音通信这三个领域中摸到哪些边界就有相对可靠的经验判断了。4.1 不同场景下我常用的大致达标线场景主要指标经验达标线近场监听音箱音乐制作听音位频响±1dB以内消声室条件室内允许低频区域更宽近场监听音箱THDN声学测量中频段低于1%80Hz以下允许更高监听耳机频响±3dB以内已经算很健康单扬声器同批次一致性±1.5dB模拟线路设备THDN通常要求低于0.01%-80dB0.1%以下普通听感大多可接受采样率/位深链路动态范围16bit系统约96dB24bit系统实测能达到110dB以上就算不错语音窄带通话PESQ3.0以上算可接受3.5以上算良好语音宽带通话POLQA3.8以上算良好4.0以上接近无损语音可懂度STOI0.9以上普遍认为“字字清晰”无损音频编解码PEAQ ODG-0.5以内多数人听不出问题0到-1之间存在盲区这些数字不是我拍脑袋编的而是多年对比测试和项目验收中反复验证过的粗线条。但注意这些线是用来“排除明显问题”的不是用来“证明声音好”的。4.2 一套完整的合格判定流程先查数字再上盲听日常做音频设备或链路验收我总结了一套固定流程先电测再声测然后有目的地盲听。第一步电学参数测量。把被测试设备通过标准负载接入测试系统测频响、THDN、IMD、底噪、动态范围。这一步主要排除硬件层面的基本问题。 第二步声学参数测量。如果被检对象是扬声器、耳机、房间还要用测量麦克风在听音位做声学测量看频响、失真、衰减时间、瀑布图。注意环境噪声和测量麦克风校准。 第三步听感排查。播放几个固定试听素材重点听之前测量中暴露的可疑频段。比如频响图上有个2dB到3dB的峰那就专门做ABX来定位这个峰是否可闻。 第四步如果设备之间有竞争关系要么排序、要么二选一一律上MUSHRA或ABX违背规则就是承认自己在拍脑袋。 第五步复盘盲听发现的差异对应测量数据的哪些特征如果数据里看不出来回想哪个量没测、哪个条件下没覆盖然后补测。这个循环走完你对这套东西的“指标-听感映射”会越来越准。4.3 两个典型的“数字很好、听起来不对”故障模式这里分享两个我实际踩过、也帮不少用户排查过的故障模式都属于“数据健康但听感翻车”的典型。故障模式一频响平直但低频拖尾严重。某次测量一套书架箱在普通客厅里测得低频区域在63Hz附近有个宽峰频响曲线看起来只是略高但用瀑布图看发现50Hz到80Hz的能量衰减时间比中频长了将近一倍。听感上的表现就是鼓点发闷、低音“一团浆糊”贝斯线条不清晰。如果不看时间轴单看频响曲线很容易认为这个问题不存在。处理方式是重新摆位、加低频陷阱然后再测衰减时间。故障模式二数字设备在安静段落有间歇性毛刺。一台桌面解码器THDN、动态范围指标全部优秀但在弱音量的钢琴独奏中每个音符尾巴上能听到轻微的“嘶嘶”噪音。拿去扫频测稳态指标依然没问题。后来用较长的安静录音段做FFT功率谱平均才在高频段看到一个窄带小包峰低到-100dBFS左右——稳态测量几乎不会注意到但安静片段里人耳对突发噪声极其敏感。最后查出来是USB供电隔离不足引发时钟边带干扰处理完接口供电后问题消失。这类问题说明指标之外采样时间结构、瞬态行为、窄带能量分布这些“二级特征”在听感判断中举足轻重。这也是为什么客观评测做得再熟最终仍然要对耳朵留一份尊重。5. 可以落地的小型评测实验我自己的一套低成本测试链路纸上谈兵没有意义。最后给一套我自己实际在用的、成本可控的音频质量评估方案。没有消声室、没有昂贵声学分析仪也可以做有意义的基础评估。5.1 硬件和软件选型从几百块到上千块的方案硬件上一个靠谱的USB音频接口是底线建议选两个独立声道以上、信噪比高于100dB的入门款。板载声卡首选排除因为它的底噪和时钟精度会污染测量结果。测量麦克风方面入门款如Behringer ECM8000性价比高但必须有校准文件才适合做绝对频响测量不配套校准文件的话至少不能相信3kHz以上的高频段准确度。预算允许的情况iSEMcon和Earthworks的测量麦更省心。再加一台声压计用于SPL校准整套设备控制在几千元以内没问题。软件方面我最常用的是REWRoom EQ Wizard免费且功能覆盖频响、失真、RT60、瀑布图、阻抗测量。DeltaWave用于样本级音频对比和ABX辅助。ARTA也是专业向但学习曲线稍陡。整体来说REW足够应付绝大部分音频/设备评估。5.2 用REW做一次完整的“频响失真”测量以测量一对桌面监听音箱为例完整流程大致分五步连好物理链路USB声卡输出接放大器/音箱测量麦克风放在音箱前方约1米、高音单元齐平的位置麦克风输出接声卡输入。在REW的Preferences里设置好声卡输入输出设备用声卡输出连接监听功放做“声卡回环校准”把声卡本身的延迟和频响影响扣除干净。这一步不做后续时间和相位数据都会失真。用声压计或校准文件在REW内设置SPL校准。目标是在80dB到85dB SPL左右测量接近实际听音电平声压和距离直接关系到时间窗截取是否有效。设置正弦扫频参数启动测量。用时间窗比如8ms到20ms截掉大部分房间反射得到近场意义上的直达声频响。同一位置重复测3次看重复性是否稳定。分析先看频响主曲线再看THD曲线各频率的谐波失真占比最后切到CSD瀑布图看时间维度能量衰减。实际做一遍就会发现比起简单的“声道响度对比”REW能暴露多得多的问题某个频率失真突然升高说明该频段存在结构共振瀑布图上有长拖尾说明房间驻波没处理。5.3 测量中的常见误差源为什么你的测量数据可能不靠谱这套方案做下来最常把人带偏的不是测试软件本身而是测量链路里的隐藏误差源麦克风没有校准文件。没有校准文件的简装麦克风在高频段可能偏差好几个dB频响图里的一个“谷”可能根本不存在。房间反射混入窗口。测量窗口开太长会把反射能量算进直达声高频段出现梳状滤波效应曲线变成锯齿状。窗口开太短又丢失低频信息。这是近场测量最大的取舍。环境噪声太高。空调、风扇、街道噪声会把低频底噪抬高失真曲线在低频段永远偏高。白天测和深夜测数据可能差很大。测量电平过低或过高。电平过低失真被底噪掩盖THD结果假好看电平过高系统进入削波失真结果假难看。正规做法是看输入信号记录电平控制在测量链路不削波且远离底噪的水平。声压计不校准倍频程。SPL校准误差超过±1dB后续所有声压实测数据都不可信。我自己的习惯是每次测量前都做一次声卡回环校准每季度查一次测量麦克风的校准状态每次测量完再评估一遍环境噪声是否满足条件。功夫下在数据采集之前才不至于让后续分析变成雕花垃圾。这套链路测出来的数据配合前面的ABX/MUSHRA主观流程基本能在“没啥预算”的前提下形成一套自洽的评估闭环。音频质量评估没有万能指标但也没有理由全凭感觉拍板——把主观做严谨、把客观做有边界两层工具合起来用结论的可靠度会高出一个数量级。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门