Bestfunc · Acoustic Fingerprint
一套不用深度學習的聲學質檢方法。四屏講清楚:它怎麼把聲音變成可比較的數字、憑什麼不挑裝置、如何讓不同產線用同一把尺、在真實產線上跑出什麼數字。
機器沒法直接拿兩段聲音去比對,所以先把一段 4 秒錄音從五個不同角度各量出一批讀數,首尾接成一條“指紋”。判斷兩件產品像不像,比的是這約 400 個數字夠不夠接近。
每一個讀數都有物理含義 —— 哪個頻段能量多、聽起來毛不毛躁、各頻段起伏是否同步、波形毫秒級的重複規律、跟這件產品自己平時的樣子差多少。判錯了能一路查回是哪一項在起作用。
同一條音訊的 398 個讀數,按五組首尾相接。色深 = 該項讀數在本組裡的排名。
398
個讀數 · 五組視角
257 ms
每件 4 秒音訊 · 純 CPU
0
個深度學習模型
每個檢測點位“最靈”的視角並不相同。某汽車零部件廠的四個點位上聽感指標最準;某音響廠、某軸承廠的多數點位上,反倒是最基礎的“各頻段能量分佈”更準。
所以不去賭哪一個視角萬能,而是五個一起量、合併使用 ——12 個真實點位裡有 11 個,合併後不差於任何單一視角。
12 個真實點位 × 5 個視角 + 合併列。5 折樣本外交叉驗證。
12
個真實檢測點位
11 / 12
合併後不差於任一單視角
0.5→1.0
分辨力:拋硬幣→完全分開
拿同一個固定門檻去卡 12 個點位,錯攔掉的合格品比例從 0.9% 到 14.4% 都有—— 不是模型不準,是每條產線的底噪、工況、麥克風位置本來就不同。
做法是把分數換算成“在本點位合格品裡排第幾百分位”,再按統一的誤攔預算定門檻。換算之後,同樣 12 個點位收進 10.0%~10.5%,一條產線定的規矩可以直接說給另一條聽。
左:同一個固定門檻。右:換算成本點位分位後按 10% 預算定門檻。兩圖同坐標同量程。
0.9%~14.4%
12 點位錯攔率區間
10.0%~10.5%
同樣 12 個點位
投產頭兩週是最不穩的階段:樣本還少、判定門檻沒找準,檢出偏低、錯攔偏高。系統靠日常積累的標註結果持續校準,一個月左右收斂到可用區間。
穩定之後的典型區間是檢出率九成上下、錯攔率回到 10% 的預算附近。起步不需要攢很久 —— 實測學習曲線上,約 10 件不合格樣本就能到接近八成檢出,之後每多積累一批還會繼續往上走。
某汽車零部件廠一個檢測點位的真實標註日,每天只用截至前一天的知識判當天的貨。本圖只展示投產到收斂這一段;曲線為滾動平均,反映趨勢而非單日結果。
≈ 90%
穩定後的檢出率
≈ 10%
穩定後的錯攔率 · 貼住預算
約 1 個月
投產到收斂
10 件
起步所需的不合格樣本