简体中文 繁體中文繁 · 日本語JA EnglishEN 什麼是聲音指紋 01 憑什麼不挑裝置 02 標準怎麼統一 03 真實產線上的數字 04 ← 返回巔峰表現 HOME

Bestfunc · Acoustic Fingerprint

老師傅聽得出的異響,
讓機器也聽得出

一套不用深度學習的聲學質檢方法。四屏講清楚:它怎麼把聲音變成可比較的數字、憑什麼不挑裝置、如何讓不同產線用同一把尺、在真實產線上跑出什麼數字。

01什麼是聲音指紋

把一段聲音
壓成約 400 個讀數

機器沒法直接拿兩段聲音去比對,所以先把一段 4 秒錄音從五個不同角度各量出一批讀數,首尾接成一條“指紋”。判斷兩件產品像不像,比的是這約 400 個數字夠不夠接近。

每一個讀數都有物理含義 —— 哪個頻段能量多、聽起來毛不毛躁、各頻段起伏是否同步、波形毫秒級的重複規律、跟這件產品自己平時的樣子差多少。判錯了能一路查回是哪一項在起作用。

同一條音訊的 398 個讀數,按五組首尾相接。色深 = 該項讀數在本組裡的排名。

398

個讀數 · 五組視角

257 ms

每件 4 秒音訊 · 純 CPU

0

個深度學習模型

02憑什麼不挑裝置

沒有萬能的那一個視角,
五個合起來才穩

每個檢測點位“最靈”的視角並不相同。某汽車零部件廠的四個點位上聽感指標最準;某音響廠、某軸承廠的多數點位上,反倒是最基礎的“各頻段能量分佈”更準。

所以不去賭哪一個視角萬能,而是五個一起量、合併使用 ——12 個真實點位裡有 11 個,合併後不差於任何單一視角

12 個真實點位 × 5 個視角 + 合併列。5 折樣本外交叉驗證。

12

個真實檢測點位

11 / 12

合併後不差於任一單視角

0.5→1.0

分辨力:拋硬幣→完全分開

03標準怎麼統一

同一個門檻,
在不同產線上寬嚴差 16 倍

拿同一個固定門檻去卡 12 個點位,錯攔掉的合格品比例從 0.9% 到 14.4% 都有—— 不是模型不準,是每條產線的底噪、工況、麥克風位置本來就不同。

做法是把分數換算成“在本點位合格品裡排第幾百分位”,再按統一的誤攔預算定門檻。換算之後,同樣 12 個點位收進 10.0%~10.5%,一條產線定的規矩可以直接說給另一條聽。

左:同一個固定門檻。右:換算成本點位分位後按 10% 預算定門檻。兩圖同坐標同量程。

校準前

0.9%~14.4%

12 點位錯攔率區間

校準後

10.0%~10.5%

同樣 12 個點位

04真實產線上的數字

投產頭兩週最不穩,
一個月收斂到九成

投產頭兩週是最不穩的階段:樣本還少、判定門檻沒找準,檢出偏低、錯攔偏高。系統靠日常積累的標註結果持續校準,一個月左右收斂到可用區間。

穩定之後的典型區間是檢出率九成上下、錯攔率回到 10% 的預算附近。起步不需要攢很久 —— 實測學習曲線上,約 10 件不合格樣本就能到接近八成檢出,之後每多積累一批還會繼續往上走。

某汽車零部件廠一個檢測點位的真實標註日,每天只用截至前一天的知識判當天的貨。本圖只展示投產到收斂這一段;曲線為滾動平均,反映趨勢而非單日結果。

≈ 90%

穩定後的檢出率

≈ 10%

穩定後的錯攔率 · 貼住預算

約 1 個月

投產到收斂

10

起步所需的不合格樣本

從一次
樣件試測
開始