Bestfunc · Acoustic Fingerprint
一套不用深度学习的声学质检方法。四屏讲清楚:它怎么把声音变成可比较的数字、凭什么不挑设备、如何让不同产线用同一把尺、在真实产线上跑出什么数字。
机器没法直接拿两段声音去比对,所以先把一段 4 秒录音从五个不同角度各量出一批读数,首尾接成一条“指纹”。判断两件产品像不像,比的是这约 400 个数字够不够接近。
每一个读数都有物理含义 —— 哪个频段能量多、听起来毛不毛躁、各频段起伏是否同步、波形毫秒级的重复规律、跟这件产品自己平时的样子差多少。判错了能一路查回是哪一项在起作用。
同一条音频的 398 个读数,按五组首尾相接。色深 = 该项读数在本组里的排名。
398
个读数 · 五组视角
257 ms
每件 4 秒音频 · 纯 CPU
0
个深度学习模型
每个检测点位“最灵”的视角并不相同。某汽车零部件厂的四个点位上听感指标最准;某音响厂、某轴承厂的多数点位上,反倒是最基础的“各频段能量分布”更准。
所以不去赌哪一个视角万能,而是五个一起量、合并使用 ——12 个真实点位里有 11 个,合并后不差于任何单一视角。
12 个真实点位 × 5 个视角 + 合并列。5 折样本外交叉验证。
12
个真实检测点位
11 / 12
合并后不差于任一单视角
0.5→1.0
分辨力:抛硬币→完全分开
拿同一个固定门槛去卡 12 个点位,错拦掉的合格品比例从 0.9% 到 14.4% 都有—— 不是模型不准,是每条产线的底噪、工况、麦克风位置本来就不同。
做法是把分数换算成“在本点位合格品里排第几百分位”,再按统一的误拦预算定门槛。换算之后,同样 12 个点位收进 10.0%~10.5%,一条产线定的规矩可以直接说给另一条听。
左:同一个固定门槛。右:换算成本点位分位后按 10% 预算定门槛。两图同坐标同量程。
0.9%~14.4%
12 点位错拦率区间
10.0%~10.5%
同样 12 个点位
投产头两周是最不稳的阶段:样本还少、判定门槛没找准,检出偏低、错拦偏高。系统靠日常积累的标注结果持续校准,一个月左右收敛到可用区间。
稳定之后的典型区间是检出率九成上下、错拦率回到 10% 的预算附近。起步不需要攒很久 —— 实测学习曲线上,约 10 件不合格样本就能到接近八成检出,之后每多积累一批还会继续往上走。
某汽车零部件厂一个检测点位的真实标注日,每天只用截至前一天的知识判当天的货。本图只展示投产到收敛这一段;曲线为滚动平均,反映趋势而非单日结果。
≈ 90%
稳定后的检出率
≈ 10%
稳定后的错拦率 · 贴住预算
约 1 个月
投产到收敛
10 件
起步所需的不合格样本