什么是声音指纹 01 凭什么不挑设备 02 标准怎么统一 03 真实产线上的数字 04 ← 返回巅峰表现 HOME

Bestfunc · Acoustic Fingerprint

老师傅听得出的异响,
让机器也听得出

一套不用深度学习的声学质检方法。四屏讲清楚:它怎么把声音变成可比较的数字、凭什么不挑设备、如何让不同产线用同一把尺、在真实产线上跑出什么数字。

01什么是声音指纹

把一段声音
压成约 400 个读数

机器没法直接拿两段声音去比对,所以先把一段 4 秒录音从五个不同角度各量出一批读数,首尾接成一条“指纹”。判断两件产品像不像,比的是这约 400 个数字够不够接近。

每一个读数都有物理含义 —— 哪个频段能量多、听起来毛不毛躁、各频段起伏是否同步、波形毫秒级的重复规律、跟这件产品自己平时的样子差多少。判错了能一路查回是哪一项在起作用。

同一条音频的 398 个读数,按五组首尾相接。色深 = 该项读数在本组里的排名。

398

个读数 · 五组视角

257 ms

每件 4 秒音频 · 纯 CPU

0

个深度学习模型

02凭什么不挑设备

没有万能的那一个视角,
五个合起来才稳

每个检测点位“最灵”的视角并不相同。某汽车零部件厂的四个点位上听感指标最准;某音响厂、某轴承厂的多数点位上,反倒是最基础的“各频段能量分布”更准。

所以不去赌哪一个视角万能,而是五个一起量、合并使用 ——12 个真实点位里有 11 个,合并后不差于任何单一视角

12 个真实点位 × 5 个视角 + 合并列。5 折样本外交叉验证。

12

个真实检测点位

11 / 12

合并后不差于任一单视角

0.5→1.0

分辨力:抛硬币→完全分开

03标准怎么统一

同一个门槛,
在不同产线上宽严差 16 倍

拿同一个固定门槛去卡 12 个点位,错拦掉的合格品比例从 0.9% 到 14.4% 都有—— 不是模型不准,是每条产线的底噪、工况、麦克风位置本来就不同。

做法是把分数换算成“在本点位合格品里排第几百分位”,再按统一的误拦预算定门槛。换算之后,同样 12 个点位收进 10.0%~10.5%,一条产线定的规矩可以直接说给另一条听。

左:同一个固定门槛。右:换算成本点位分位后按 10% 预算定门槛。两图同坐标同量程。

校准前

0.9%~14.4%

12 点位错拦率区间

校准后

10.0%~10.5%

同样 12 个点位

04真实产线上的数字

投产头两周最不稳,
一个月收敛到九成

投产头两周是最不稳的阶段:样本还少、判定门槛没找准,检出偏低、错拦偏高。系统靠日常积累的标注结果持续校准,一个月左右收敛到可用区间。

稳定之后的典型区间是检出率九成上下、错拦率回到 10% 的预算附近。起步不需要攒很久 —— 实测学习曲线上,约 10 件不合格样本就能到接近八成检出,之后每多积累一批还会继续往上走。

某汽车零部件厂一个检测点位的真实标注日,每天只用截至前一天的知识判当天的货。本图只展示投产到收敛这一段;曲线为滚动平均,反映趋势而非单日结果。

≈ 90%

稳定后的检出率

≈ 10%

稳定后的错拦率 · 贴住预算

约 1 个月

投产到收敛

10

起步所需的不合格样本

从一次
样件试测
开始