為什麼產線聲音檢測這麼難
聲音往往是裝配與零件問題最早暴露的訊號,但把這份判斷穩定交給機器,比想象中難。
裝配鬆動、零件毛刺、軸承異常,常在尺寸還合格時就先在聲音裡露苗頭。產線想把「聽」納入檢查工序,落地卻接連撞上三堵牆。
靠老師傅的耳朵
老師傅的耳朵確實靈,但標準因人而異、隨疲勞漂移。更關鍵的是判定不留痕跡,無法覆盤也無法複製到下一條線。
靠聲級與頻譜的閾值規則
閾值只擅長抓「變大、變響」。現場大量異常卻是能量沒變、音色變了:多一點摩擦的沙沙,多一點週期的咔嗒。
靠有監督 AI 學缺陷
學分類的前提是缺陷夠多夠全。產線恰恰相反:良品佔絕大多數,缺陷稀少,等樣本攢夠產線早已換了一輪。
| 現場遇到的情況 | 傳統做法為什麼難 | 對演算法的真正要求 |
|---|---|---|
| 該分辨什麼,本來就說不清 | 指標由人想出來,想不到就漏掉 | 模型自己從資料裡學出該分辨什麼 |
| 缺陷罕見且不斷出新 | 學習先要缺陷樣本 | 無標註也能立判據 |
| 能量不變、音色變了 | 總量指標分辨不出 | 分辨音色與時間紋理 |
| 背景與批次持續漂移 | 固定閾值逐漸失準 | 判據隨現場更新 |
| 一條線一個脾氣 | 一套引數難通吃 | 按線挑合適的分辨方式 |
不是更多人工規則,而是會自己學的深度學習系統
在缺陷稀少、現場持續漂移的條件下仍然穩定可用。
三條設計原則
針對上一節的三堵牆,本引擎定下三條不退讓的原則。
三條原則決定後面各章的做法:沒有標註靠什麼學,擴充套件時怎麼不動已用的判定,為什麼不壓成一個指標。
不靠缺陷標註,用自監督學習
模型自己出題、自己檢驗,從無標註聲音裡學出正常聲音的表徵(模型自己形成的內部表示):能量起伏、共振位置、敲擊衰減。判據是學出來的,不是人寫的規則。
無需缺陷樣本預訓練的深度聽覺模型保持不變,只新增讀出方式
底層模型定版後權重不再改動,接新產線只重新擬合上層的讀出與門檻。不是換掉耳朵好的人,而是請他多講一種說法。
底層不重訓用多個互補視角分辨同一段聲音
有的缺陷在音色輪廓上一下就能分辨,有的只在時間紋理裡,有的要貼人耳的感受才說得清。擠進一個指標會互相稀釋,各視角獨立判斷後合併。
互補優於壓縮- 既有基準繼續有效,新增讀出可先只記錄,一致後再納入判定。
- 擴充套件可隨時關掉退回原狀;底層沒動,差異只會來自新增部分。
本手冊中的幾個說法
聽得清:同時用粗細不同的尺度
一段聲音要先被聽清楚,才談得上被判斷。本節講這套深度學習引擎是怎麼聽的。
分辨一段聲音,有個躲不開的取捨:時間上分得越準,頻率上就分得越糊;反過來也一樣。真正的問題不是選哪個折中點,而是為什麼必須只選一個。
時間分得準,頻率就分不清
只聽很短的一瞬,能說準那一聲咔嗒落在什麼時候。但這麼短的一段裡音高本來就聽不出來,泛音擠成一團,共鳴落在哪一帶也說不清。
頻率分得清,時間就分不準
連著聽很長一段,音高與共鳴能分得很細,但短促的撞擊被攤平:響在哪一刻、響了幾次、衰減多快全部丟失,而這最能說明裝配是不是鬆了。
本引擎的做法:幾種尺度同時用,信誰由模型學出
粗細不同的尺度,同時用
不二選一,而是對同一段聲音同時用幾種跨度不同的尺度各分辨一遍。長跨度把音高與共鳴分得穩,短跨度把敲擊時刻與衰減分得準,兩類資訊都在手。
讓模型在訓練中學會該信哪一種尺度
敲擊的瞬間該信短跨度,持續的嘯叫該信長跨度。這不是人工調的規則,而是模型在訓練中從正常聲音裡自己學出來的,不必逐工位手調。
同一處聲音在不同尺度下怎麼變
模型還關注同一處聲音,從長跨度換到短跨度時怎麼變。撞擊類跨度越短越突出,持續類在各種尺度下都穩定,這種變化本身就是最直接的線索,也被學進表徵裡。
學得會:自監督預訓練
基礎能力來自自監督預訓練,不來自人工標註的缺陷樣本。
客戶最常問的是要提供多少個不良品。本引擎的核心是一個深度神經網路,先在大量無標註的工業聲音上做自監督預訓練,學正常的聲音長什麼樣,不依賴缺陷標註。
自監督預訓練的迴圈
-
01
聽
送進一段現場聲音,網路形成自己的表徵。
-
02
還原
再要求模型只憑這份表徵重新描繪原聲,不許再回頭聽原聲。
-
03
自查
把還原結果與原聲逐處對照,差在哪裡模型自己就能分辨。
-
04
修正
對不上的地方成為改進方向,回到第一步再來一遍。
為什麼這樣能學到有用的東西
學出來的強過人設計的
傳統方法靠人決定該分辨哪些指標,人想不到的規律就永遠進不了判據。要準確還原裝置聲音,網路必須自己學出諧波成組、包絡起伏、共振抬升與噪聲底質地,也包括人沒想到的線索。
學會常態,才談得上察覺異常
異響之所以被察覺,是因為它偏離了本該如此的樣子。常態學紮實,偏離就有了參照,沒見過的缺陷也能察覺。
一個類比
能把剛聽過的旋律準確複述出來,說明真的聽懂了它的結構,而不是背下了一個曲名標籤。只會貼標籤的人,換一首沒聽過的曲子就無從下手。
這對現場意味著什麼
起步不依賴大量缺陷樣本
現場的不良品稀少、種類零散,也拿不到成套標註。匯入階段主要需要能代表當前工況的正常聲音。
預訓練打底,現場適配收口
預訓練在廣泛的工業裝置聲音上學到通用表徵,再透過現場適配對準每條產線,因此不易被一條線的偶然特徵帶偏。
無標註不等於不需要現場資訊
預訓練給的是基礎聽覺能力;要在具體產線上判定,仍需現場常態聲音作參照和穩定的採集條件。
辨得全:三個互補視角
同一次推理的表徵用三種方式讀出,同一個缺陷在不同視角下的可見性差別很大。
三個視角讀的是同一個深度神經網路的內部表徵,不是三套人工設計的特徵。同一份表徵,讀出方式不同,能分辨出的東西就不同;這也是它們能共享一次推理、且互補而不重複的根本原因。
三個視角各自分辨什麼
整體聲紋視角
像給這段聲音拍一張全景照。它最穩定,冷啟動階段最先可以信任。
聽感對齊視角
把同一份表徵按與人耳相關的方向重排後再比較,相當於換一把刻度更合適的尺子。
時間紋理視角
整體概括會把起伏抹平,這一路專門把節奏與週期性保留下來。
| 視角 | 擅長回答 | 直覺解釋 |
|---|---|---|
| 整體聲紋 | 整體是否偏離常態 | 全身照:體型變化一眼可見,小痣看不清 |
| 聽感對齊 | 人聽起來刺不刺耳 | 同一個東西,換一把刻度更合適的尺子 |
| 時間紋理 | 持續還是一下一下 | 不是照片,是錄影的節奏 |
互補,不是冗餘
有的缺陷在整體概括下幾乎分辨不出,換到時間紋理卻一目瞭然,反過來也有。哪個視角顯形事先無法預判,所以三路同時保留。
代價與前提
三路共享一次推理,但各自算分
三條路徑讀的是同一次推理,增加的只是讀出環節,對節拍影響很小。三者量綱與穩定性不同,混成一串會讓量綱大的一路主導,因此各自獨立評分與校準,再在分數層面彙總。
對得上人耳:聽感對齊
判定異響靠的不是能量大小,而是粗糙感、波動感、尖銳感。
現場判定異響的最終裁判是人,判據不是能量表上的讀數。引擎必須在人聽起來怎麼樣這一層上對齊。
兩段一樣響的聲音
兩段聲音能量完全相同,人聽起來卻可以一個平穩、一個刺耳。區別在於能量如何分佈、如何起伏、有無明顯的調製。
人耳在意的是哪幾件事
這些是聲學領域公開的聽感屬性,引擎用作參照方向。
引擎怎麼用這些屬性
當參照方向,讓放大有的放矢
引擎不是先算出這些屬性再判好壞,而是用它們指引方向,在深度神經網路學出的表徵裡挑出與聽感相關的成分,放到同一量級上比較。放大所有細微成分會讓噪聲一起變大,所以要挑選。
不是創造資訊,是讓資訊變得可讀
現場聲音的差異絕大部分來自背景與工況:溫度、批次、周邊工位。缺陷帶來的那部分小得多,直接比較會被完全蓋住,就像在大秤上稱一根羽毛——秤沒壞,只是刻度不合適。
对齐听感相当于换一把刻度更合适的尺子:数据没变,被掩盖的细微差异却回到了可以分辨的尺度上。
這把尺子要按現場來定
刻度依據當前產線、當前工況的正常聲音,透過現場適配確定。換線、換工位或工況明顯變化,都要重新對刻度。
判得準:分數層融合與按線擇優
三個視角各自成為完整判斷,在分數層匯合,最終結論落在工件上。
三個視角有了之後,問題變成怎麼把三份意見合成一個結論。就像三位老師傅分別聽同一件產品,不該把耳朵縫在一起,而應各自下結論再彙總。
不要硬拼
三個視角的數值尺度本來就不同,硬拼在一起會被跨度最大的那個視角主導,另兩個視角的細微差異被壓成噪聲。這就像把體溫、血壓、聽力的讀數直接相加,得先各自換算成偏離健康人群多少,再談綜合。
把表徵拼成一條
強勢視角說了算,弱勢視角被淹沒,出問題也難以定位到是哪一個視角。
不採用
各自打分,再合意見
每個視角獨立回答離本線正常有多遠,換算成可比的相對位置後在分數層彙總,各自的分辨力都保留下來。
本引擎採用
按產線擇優
不同產品、不同工位,主導的缺陷型別本來就不同:有的表現為整體音色偏移,有的表現為時間上的細碎起伏。所以給出統一機制,讓每條線用自己的證據挑選該倚重的視角。分數來自模型推理,不是人工閾值;人工設定的只有誤判預算一個旋鈕。
一件產品在採音期間被切成若干段分別打分,任一段異常即判該件異常。異常常常只出現在一瞬間,不應被整段聲音平均掉。
跟得上:滾動校準與誤判預算
門檻隨近期正常件持續重定;品質與產能的取捨由客戶用一個旋鈕設定。
產線是活的:批次、季節、工裝磨損都會讓聲音的基線慢慢移動。出廠時定死的固定門檻,久了必然要麼太鬆要麼太緊。
門檻來自近期的正常件
引擎持續收集本線近期正常件的分數,匯成現在的正常分佈,門檻落在其上並按天重新推定。批次與季節的緩慢變化因此被自然吸收。不是拿出廠的尺子量所有年份的產品,而是每天早上先量今天的正常件,再決定今天的界線。校準只重定門檻,預訓練的深度聽覺模型與其模型版本保持不變。
誤判預算:一個旋鈕
漏檢和誤判無法同時降到最低,這是取捨,不是缺陷。由客戶設定能接受多少比例的正常件被攔下複核,系統據此反推當日門檻。擰嚴一點複核量上升,擰鬆一點產能輕鬆、邊緣異常更可能透過。
可調
不同工位、不同階段可以設不同的嚴格程度。試產期與量產期本就不該一樣。
可解釋
門檻對應的是複核工作量,是一件件要人確認的產品,品質會議上可以直接討論。
可覆盤
設定值與實際攔下比例的偏離是健康度訊號。偏離持續拉大,先查採音條件與工藝變更,而不是先改門檻。
複核迴流:閉環
被攔下的工件由現場人工複核,結論迴流成為確認樣本。系統因此逐步知道本線真正的異常聽起來是什麼樣。
迴流的主要是被系統攔下的工件,學到的異常樣貌因此受複核範圍與質量影響。一開始就沒被攔下的異常,很難出現在學習材料裡。建議匯入初期對放行件也抽檢,結論一併迴流。
用得穩:現場前提與適用邊界
系統能否穩定工作,一半在演算法,一半在採音與工況守不守得住。
任何聲學檢測都建立在一個前提上:這一次聽到的聲音和上一次可比。把邊界說清楚,比宣稱無所不能更有價值。
| 前提 | 為什麼重要 | 現場做法 |
|---|---|---|
| 採音一致性 | 麥克風、位置、指向、增益、工裝任一變更,絕對水平與音色都會移位。 | 視同新部署,重新校準並重建正常基線,變更內容與日期留檔。 |
| 環境與工況一致性 | 正常範圍內的背景波動可以吸收,節拍變化與新增噪聲源不行。 | 保持節拍與背景條件穩定,出現明顯變化即重新驗證。 |
| 片段與節拍匹配 | 切得太短會把特徵切碎,切得太長會把瞬時異常平均掉。 | 匯入階段與工藝方共同確定觸發方式與片段口徑。 |
| 基線積累與現場適配 | 現場適配用正常件把預訓練模型對齊到本產線,基線不足時判定易被偶然波動帶偏。 | 匯入初期先積累,覆蓋不同班次後完成現場適配再啟用;模型版本固定,同一版本的推理結果可復現,新產線靠現場適配接入而不是重寫規則。 |
| 判定口徑與複核 | 上下游對什麼算異常的定義不一致,迴流樣本就會互相矛盾。 | 明確複核標準與責任崗位,各班組用同一份標準。 |
匯入方式:影子期
並行執行,只記錄不干預
引擎與現有流程同時工作,輸出只作記錄,不影響放行。
積累與比對
形成正常基線並完成現場適配,同時與現場判定逐件比對,確認口徑一致。
切入判定
客戶認可後按設定的誤判預算參與判定,隨時可切回只記錄。
影子期真正的價值,是把什麼算異常在系統與現場之間對齊。
適用邊界
以上任何一項前提發生變更,都應先重新校準並做一段影子期複核,再恢復正式判定,讓判定始終建立在可比的聲音之上。
常見問題
匯入前最常被問到的問題,按實況作答,不作效果承諾。
以下問題來自現場的實際關切;真實表現請在貴司產線上以影子期驗證。
傳統方法由人先選定指標、逐個設門檻,人想不到的異常進不了判據。本引擎是深度學習系統,在大量無標註聲音上預訓練,自己學出該分辨什麼,即表徵(模型自己形成的內部表示),再按產線現場適配,因此能聽出能量沒變、音色變了這類差異。
主體學習是自監督的,先學會正常聲音長什麼樣,不依賴缺陷標註即可開始。少量已確認的異常件有助於對齊口徑,但不是前提。
門檻按近期正常件持續重定,緩慢變化自然吸收;工藝、工裝或採音條件的實質變更應重新校準並做影子期複核。
每次推理都保留採音、片段與分數,可逐件回溯,判錯的件迴流校準;最終判定權仍在現場。
推理在採音完成後進行,目標是在工位節拍內完成;邊緣端還是服務端按專案條件確定。
可以回溯到哪一段觸發、哪個視角偏離最顯著,並調出那段聲音收聽;這是指向證據而非因果解釋。
流程固定:接入採音、積累基線、影子期驗證、切入判定,時間取決於產量與異常頻度。
以工件標識關聯,輸出判定結論與分數供上位系統記錄統計,介面與觸發按專案約定。
底層的深度神經網路保持穩定,升級只新增讀出方式。新的模型版本可並行影子驗證,確認一致後再切換,必要時回退。
具體產線的可行性,建議以一次影子期作為共同評估依據;貴司產品上的結論比通用說明更有參考。