ITU标准MUSHRA:音频主观评价完整实操指南

在智能音频时代,音频技术发展突飞猛进,各类新功能、新产品、新应用场景持续涌现。如何从主观、客观两个维度科学评判音频品质,已经成为音频研发、车载声学、耳机、空间音频领域工程师高度关注的核心问题。


HBK 深耕音频测试测量领域,具备完整的全球产品方案、深厚技术沉淀与大量工程落地经验。本系列专栏将围绕音频感知主观属性、主流主观评价方法、客观参数测量等方向,拆解音频研发中的技术难点,分享 HBK 对应的测试解决方案。


本文重点讲解行业广泛使用的音频主观评价标准:MUSHRA(包含隐藏参考和锚点的多激励方法)。


什么是MUSHRA?

ITU‑R BS.1534 定义了包含隐藏参考和锚点的多激励方法(MUlti Stimulus test with Hidden Reference and Anchor, MUSHRA),专门用于中等品质音响系统的音效评估。


该方法大量应用于车载音响、扬声器阵列、耳机空间音频等产品研发测试当中。

  • 车载座舱空间狭小,低频声波会在车内发生反射、叠加形成驻波声场,乘客收听位置频响曲线并不平坦,出现明显峰值与谷值,直接拉低听觉主观感受;
  • 扬声器阵列、耳机实现空间音频重放时,不同声场重构算法、信号处理逻辑,也会带来十分显著的主观听觉差异。

MUSHRA 可以精准还原人耳真实主观听觉感知,输出可信度高的测试结果,是音频项目研发中高频使用的标准化主观评价手段。


什么是参考(Reference)?

MUSHRA 选取原始、全频带、未经任何处理的信号作为参考信号。 举个例子:开展 AR/VR 音频主观音质评价工作时,可以采用人头躯干模拟器 HATS 采集得到的双耳录音充当参考。

重要规则:如果测试人员对隐藏参考样本给出过低分数,该评价者的全部测试数据将会直接剔除,不纳入统计。


什么是锚点(Anchor)?

MUSHRA 要求至少设置2 个隐藏锚点信号,锚点的核心作用是标定打分尺度,避免轻微音质瑕疵就得到极低分数,保证评分区间合理可用:

  1. 标准锚点信号:原始信号做低通滤波,截止频率为 3.5kHz;
  2. 中等品质锚点信号:原始信号做低通滤波,截止频率为 7kHz。


MUSHRA测试完整实施要点

评价人员要求

参与 MUSHRA 测试的评价者,需要具备音频主观评价经验,可以分辨不同音频样本之间的细微差别;针对同一份音频样本,多次打分结果应当高度接近。


正式测试之前,必须对评价者开展正式或非正式训练,只有训练合格、有经验评价者产出的数据才可以用于后续统计分析。常规测试场景,评价者人数不超过 20 人,即可获得可靠结果。


音频样本设置规则

  1. 单次评价使用的音乐样本总数建议不超过 12 个。典型配置:9 个待测音乐样本 + 1 个隐藏低品质锚点 + 1 个隐藏中等品质锚点 + 1 份隐藏参考样本;
  2. 单条音频样本时长最大建议 10s,尽量不要超过 12s。缩短样本时长,能够缓解听音人员听觉疲劳,提升测试效率;
  3. 全部音乐样本必须完成等响处理,保障听音者在响度一致的条件下开展对比打分,排除响度对主观判断的干扰。

打分规则

  1. 单次测试仅评估一项主观属性,不可同时对多个属性打分。若需要评价多项音频属性,优先评估基本音频品质(Basic Audio Quality, BAQ)。BAQ 是全部 ITU 音频主观评价标准的核心指标,覆盖音色、立体声像、清晰度、空间感、混响、谐波失真等全部音频品质维度。 当评估系统带来的音质损伤时(例如低码率音频编解码、声音重放系统硬件限制等场景),BAQ 用来衡量待测音频与参考音频之间的相似度、差异程度。
  2. 测试过程中,评价者可自由切换参考信号和各个待测样本,方便捕捉样本之间细微听觉差异;
  3. MUSHRA 评分区间为0‑100 分;理想有效打分集中区间为 20‑80 分,该区间可以充分区分微小的主观听觉差异。
ITU标准MUSHRA:音频主观评价完整实操指南的图1

图1 MUSHRA主观评价的显示界面

测试后数据筛选

全部主观评价完成后,需要过滤无效评价者数据,出现以下情况的样本数据应当剔除:

  • 对音频样本分辨能力弱;
  • 多次打分结果前后矛盾、一致性差;
  • 对损伤明显的锚点样本给出很高分数。

MUSHRA与其他音频主观评价标准的区别?

ITU‑R BS.1116


Methods for the subjective assessment of small impairments in audio systems including multichannel sound systems

该标准面向高品质音响系统微小音质损伤场景评估,不适用于数字 AM、数字卫星广播、音频按需服务、音频拨号线路等低品质音频系统。


采用双盲、隐藏参考的三重激励评价方法(ABC/HR):A 为公开已知参考样本;B、C 随机分配隐藏参考样本与带微小损伤的待测样本。听音人员对比 B 与 A、C 与 A,采用 5 级评分尺度完成评价。B、C 其中一份和参考 A 听感无差别,另一份体现音频损伤。


ITU‑T P.800 / 810 / 830

这套系列标准聚焦电信系统语音信号主观评价,采用 MOS 评分量化用户语音接收感知质量,MOS 分数越高,代表语音主观音质越好。


工程案例分享

HBK 工程服务部门曾承接车载音频主观评价项目:针对 3 款车型、合计 10 种音响硬件配置开展主观测试。

  • 音乐样本:4 类曲风,包含经典、摇滚、流行、爵士;
  • 听音人员:20 名专业专家听音者;
  • 前置处理:全部声音样本完成等响处理。


测试结果分析

  1. 总体偏好维度
  2. 20 位评价者针对同一份音乐样本,分别对 10 种车型配置打分,输出平均主观评分(置信度 95%)。评分维度从 “非常不喜欢” 至 “非常喜欢”。 测试结果直观体现:不同车型音响配置之间,用户主观听觉偏好存在显著差异。



ITU标准MUSHRA:音频主观评价完整实操指南的图2

图2

  1. 不同音乐类型下的主观得分对比
  2. 对比不同曲风下各配置的平均分可以看到:车型配置之间主观听感存在分化;部分车型配置,面对不同音乐类型时得分差距很小;部分车型配置,不同曲风的评分结果十分发散。
ITU标准MUSHRA:音频主观评价完整实操指南的图3

图3

  1. 力度感 Powerfulness 属性测试
  2. 设置 4 档音量 Level 1 ~ 4:响度提升,力度感随之增强;当到达饱和点之后,继续增大音量,力度感不再继续提升。 在最高音量 Level 4 条件下,三款车型力度感评分全部出现下降,推测主要诱因是音量过高带来声音失真。
ITU标准MUSHRA:音频主观评价完整实操指南的图4

图4

  1. 主观属性相关性分析
  2. 针对全部音乐样本,对总体偏好和其余主观属性做相关性统计:
  • 总体偏好与中频强度 Midrange Strength、高音强度 Treble Strength、包围感 Envelopment 具备相关性;
  • 主观属性中,Punch 与 Bass Strength 相关性较高;Midrange Strength 与 Brilliance 明亮度相关性较高;
  • 对总体偏好做主分量分析,第一主分量为最主要贡献因子。
ITU标准MUSHRA:音频主观评价完整实操指南的图5

图5

  1. 古典音乐样本的差异化结论
  2. 经典音乐样本的相关性分析呈现不一样的特征:总体偏好主要和 Brilliance 明亮度、Punch 冲击力相关。 从主分量分析角度,有更多主分量参与结果贡献,其中第三主分量贡献占比最大。
ITU标准MUSHRA:音频主观评价完整实操指南的图6

图6

  1. 主观偏好预测模型验证
  2. 提取显著主分量搭建模型预测主观偏好,将预测结果和真实主观评分做比对。模型预测值和真实主观评价拟合效果优秀,相关系数可达 90% 以上。
ITU标准MUSHRA:音频主观评价完整实操指南的图7

图7

参考文献:

1. ITU-R. Recommendation BS.1534-3 - Method for the subjective assessment of intermediate quality level of audio systems.

2. ITU-R. Recommendation ITU-R BS.1116-3 - Methods for the subjective assessment of small impairments in audio systems.



点击这里,查看 / 下载 《HBK声学与振动产品简明目录》

您还可以通过如下方式联系我们,了解更多产品与应用详情:

邮箱:cn.info@hbkworld.com

网址:www.hbkworld.com/zh

免费热线电话:400-900-3165(周一至周五9:00-18:00)

点击这里,咨询HBK产品信息:https://www.hbkworld.com/zh/contact-us

查看全文
默认 最新
ansys结构交流群