简体中文 繁體中文繁 · 日本語JA EnglishEN 難在哪 01 設計原則 02 聽得清 03 學得會 04 辨得全 05 對得上人耳 06 判得準 07 跟得上 08 用得穩 09 常見問題 10 ← 返回巔峰表現 HOME

Universal Acoustic AI Inspection Engine

全量聲學 AI 檢測演算法引擎 說明手冊

本引擎是一套深度学习声学检测系统。这份手册面向品质、生产与技术负责人,说明它如何「听」产线上的声音、如何用自监督学习在没有缺陷标注的条件下自己学会判断,以及为什么这样设计出来的检测可以被信任、可以被管理。全文不涉及公式与代码,只讲设计思路与取舍。

DEEP LEARNING · SELF-SUPERVISED · CLIENT EDITION · REV. A · 2026

01

為什麼產線聲音檢測這麼難

聲音往往是裝配與零件問題最早暴露的訊號,但把這份判斷穩定交給機器,比想象中難。

裝配鬆動、零件毛刺、軸承異常,常在尺寸還合格時就先在聲音裡露苗頭。產線想把「聽」納入檢查工序,落地卻接連撞上三堵牆。

01 / 人耳

靠老師傅的耳朵

老師傅的耳朵確實靈,但標準因人而異、隨疲勞漂移。更關鍵的是判定不留痕跡,無法覆盤也無法複製到下一條線。

02 / 規則

靠聲級與頻譜的閾值規則

閾值只擅長抓「變大、變響」。現場大量異常卻是能量沒變、音色變了:多一點摩擦的沙沙,多一點週期的咔嗒。

03 / 學習

靠有監督 AI 學缺陷

學分類的前提是缺陷夠多夠全。產線恰恰相反:良品佔絕大多數,缺陷稀少,等樣本攢夠產線早已換了一輪。

更麻煩的是:現場本身一直在變
背景噪聲、來料批次、麥克風與工裝狀態都在漂移。不是模型判錯了,是腳下的地面在動。
現場遇到的情況 傳統做法為什麼難 對演算法的真正要求
該分辨什麼,本來就說不清 指標由人想出來,想不到就漏掉 模型自己從資料裡學出該分辨什麼
缺陷罕見且不斷出新 學習先要缺陷樣本 無標註也能立判據
能量不變、音色變了 總量指標分辨不出 分辨音色與時間紋理
背景與批次持續漂移 固定閾值逐漸失準 判據隨現場更新
一條線一個脾氣 一套引數難通吃 按線挑合適的分辨方式
01人耳判定标准会漂,判定留不下痕迹
02閾值規則只抓变响,抓不住音色
03有監督學習缺陷样本攒不够
OUT需要一套會自己學的聽覺系統用深度学习自己学出判据,随现场更新
三條傳統路徑各自受阻,指向同一結論。
02

三條設計原則

針對上一節的三堵牆,本引擎定下三條不退讓的原則。

三條原則決定後面各章的做法:沒有標註靠什麼學,擴充套件時怎麼不動已用的判定,為什麼不壓成一個指標。

原則 01

不靠缺陷標註,用自監督學習

模型自己出題、自己檢驗,從無標註聲音裡學出正常聲音的表徵(模型自己形成的內部表示):能量起伏、共振位置、敲擊衰減。判據是學出來的,不是人寫的規則。

無需缺陷樣本
原則 03

用多個互補視角分辨同一段聲音

有的缺陷在音色輪廓上一下就能分辨,有的只在時間紋理裡,有的要貼人耳的感受才說得清。擠進一個指標會互相稀釋,各視角獨立判斷後合併。

互補優於壓縮
01讀出方式一分辨整体音色轮廓
02讀出方式二分辨细碎的时间纹理
03讀出方式三贴着人耳的感受分辨
BASE預訓練的深度聽覺模型 · 保持不變一经定版就不再改动
同一個底座派生多路讀出,能力只在上層新增。
加法式擴充套件意味著什麼
  • 既有基準繼續有效,新增讀出可先只記錄,一致後再納入判定。
  • 擴充套件可隨時關掉退回原狀;底層沒動,差異只會來自新增部分。

本手冊中的幾個說法

預訓練的深度聽覺模型
在無標註的工業聲音上預訓練,把原始聲音轉成表徵,定版後不再改動。
讀出方式
從這份表徵取出可判斷的量,擴充套件主要在這一層。
視角
獨立的讀出方式加上自己的判斷標準。
誤判預算
產線約定的可接受誤判水平,鬆緊在其中調節。
03

聽得清:同時用粗細不同的尺度

一段聲音要先被聽清楚,才談得上被判斷。本節講這套深度學習引擎是怎麼聽的。

分辨一段聲音,有個躲不開的取捨:時間上分得越準,頻率上就分得越糊;反過來也一樣。真正的問題不是選哪個折中點,而是為什麼必須只選一個。

時間分得準,頻率就分不清

只聽很短的一瞬,能說準那一聲咔嗒落在什麼時候。但這麼短的一段裡音高本來就聽不出來,泛音擠成一團,共鳴落在哪一帶也說不清。

頻率分得清,時間就分不準

連著聽很長一段,音高與共鳴能分得很細,但短促的撞擊被攤平:響在哪一刻、響了幾次、衰減多快全部丟失,而這最能說明裝配是不是鬆了。

本引擎的做法:幾種尺度同時用,信誰由模型學出

01

粗細不同的尺度,同時用

不二選一,而是對同一段聲音同時用幾種跨度不同的尺度各分辨一遍。長跨度把音高與共鳴分得穩,短跨度把敲擊時刻與衰減分得準,兩類資訊都在手。

02

讓模型在訓練中學會該信哪一種尺度

敲擊的瞬間該信短跨度,持續的嘯叫該信長跨度。這不是人工調的規則,而是模型在訓練中從正常聲音裡自己學出來的,不必逐工位手調。

03

同一處聲音在不同尺度下怎麼變

模型還關注同一處聲音,從長跨度換到短跨度時怎麼變。撞擊類跨度越短越突出,持續類在各種尺度下都穩定,這種變化本身就是最直接的線索,也被學進表徵裡。

為什麼不把每種尺度各自拉平
每種尺度各自拉平,數值更整齊,卻抹掉了「哪一種尺度分辨得最明顯」這條資訊。金屬撞擊能和持續摩擦區分開,正因為它在短跨度上格外突出、長跨度上並不顯眼。所以幾種尺度放在同一把尺子下比較。
IN同一段聲音一次采音,几种尺度同时用
01長跨度把音高与共鸣分得稳
02中間跨度兼顾音高与变化
03短跨度把敲击的时刻与衰减分得准
OUT幾種尺度互相印證哪一种尺度最突出就是线索
同一段聲音被幾種尺度同時分辨,再互相比較。
04

學得會:自監督預訓練

基礎能力來自自監督預訓練,不來自人工標註的缺陷樣本。

客戶最常問的是要提供多少個不良品。本引擎的核心是一個深度神經網路,先在大量無標註的工業聲音上做自監督預訓練,學正常的聲音長什麼樣,不依賴缺陷標註。

自監督預訓練的迴圈

  1. 01

    送進一段現場聲音,網路形成自己的表徵。

  2. 02

    還原

    再要求模型只憑這份表徵重新描繪原聲,不許再回頭聽原聲。

  3. 03

    自查

    把還原結果與原聲逐處對照,差在哪裡模型自己就能分辨。

  4. 04

    修正

    對不上的地方成為改進方向,回到第一步再來一遍。

為什麼這樣能學到有用的東西

表徵學習

學出來的強過人設計的

傳統方法靠人決定該分辨哪些指標,人想不到的規律就永遠進不了判據。要準確還原裝置聲音,網路必須自己學出諧波成組、包絡起伏、共振抬升與噪聲底質地,也包括人沒想到的線索。

判異的基礎

學會常態,才談得上察覺異常

異響之所以被察覺,是因為它偏離了本該如此的樣子。常態學紮實,偏離就有了參照,沒見過的缺陷也能察覺。

人來設計指標想得到的才进得了判据
模型自己學出表徵没想到的规律也能学到
差別不在算得多快,在於誰來決定該分辨什麼。

一個類比

能把剛聽過的旋律準確複述出來,說明真的聽懂了它的結構,而不是背下了一個曲名標籤。只會貼標籤的人,換一首沒聽過的曲子就無從下手。

這對現場意味著什麼

起步不依賴大量缺陷樣本

現場的不良品稀少、種類零散,也拿不到成套標註。匯入階段主要需要能代表當前工況的正常聲音。

無標註不等於不需要現場資訊

預訓練給的是基礎聽覺能力;要在具體產線上判定,仍需現場常態聲音作參照和穩定的採集條件。

05

辨得全:三個互補視角

同一次推理的表徵用三種方式讀出,同一個缺陷在不同視角下的可見性差別很大。

三個視角讀的是同一個深度神經網路的內部表徵,不是三套人工設計的特徵。同一份表徵,讀出方式不同,能分辨出的東西就不同;這也是它們能共享一次推理、且互補而不重複的根本原因。

IN一次推理这一件只推理一次
01整體聲紋整體是否偏離常態
02聽感對齊人聽起來刺不刺耳
03時間紋理异常是持续还是一下一下
OUT一次判定三路各自算分后汇总
三條讀出路徑共享同一次推理,節拍幾乎不受影響。

三個視角各自分辨什麼

視角一

整體聲紋視角

像給這段聲音拍一張全景照。它最穩定,冷啟動階段最先可以信任。

視角三

時間紋理視角

整體概括會把起伏抹平,這一路專門把節奏與週期性保留下來。

視角 擅長回答 直覺解釋
整體聲紋 整體是否偏離常態 全身照:體型變化一眼可見,小痣看不清
聽感對齊 人聽起來刺不刺耳 同一個東西,換一把刻度更合適的尺子
時間紋理 持續還是一下一下 不是照片,是錄影的節奏

互補,不是冗餘

有的缺陷在整體概括下幾乎分辨不出,換到時間紋理卻一目瞭然,反過來也有。哪個視角顯形事先無法預判,所以三路同時保留。

代價與前提

三路共享一次推理,但各自算分

三條路徑讀的是同一次推理,增加的只是讀出環節,對節拍影響很小。三者量綱與穩定性不同,混成一串會讓量綱大的一路主導,因此各自獨立評分與校準,再在分數層面彙總。

06

對得上人耳:聽感對齊

判定異響靠的不是能量大小,而是粗糙感、波動感、尖銳感。

現場判定異響的最終裁判是人,判據不是能量表上的讀數。引擎必須在人聽起來怎麼樣這一層上對齊。

兩段一樣響的聲音

兩段聲音能量完全相同,人聽起來卻可以一個平穩、一個刺耳。區別在於能量如何分佈、如何起伏、有無明顯的調製。

人耳在意的是哪幾件事

粗糙度
較快的起伏疊在一起,聽著發毛。
波動感
較慢的忽強忽弱,聽著在飄。
尖銳度
能量偏高頻時的扎耳感。
響度
人感到的大小,與讀數不同。
音調性
是否突出一個明顯的音,如嗡鳴。
調製
起伏的快慢與規律,是前幾項之源。

這些是聲學領域公開的聽感屬性,引擎用作參照方向。

引擎怎麼用這些屬性

當參照方向,讓放大有的放矢

引擎不是先算出這些屬性再判好壞,而是用它們指引方向,在深度神經網路學出的表徵裡挑出與聽感相關的成分,放到同一量級上比較。放大所有細微成分會讓噪聲一起變大,所以要挑選。

BEFORE 刻度過粗的尺子 七个值落进同一格,读数一样
AFTER 刻度合適的尺子 同样七个值落进七个格,分得开
資料沒有變,變的只是刻度。

這把尺子要按現場來定

刻度依據當前產線、當前工況的正常聲音,透過現場適配確定。換線、換工位或工況明顯變化,都要重新對刻度。

07

判得準:分數層融合與按線擇優

三個視角各自成為完整判斷,在分數層匯合,最終結論落在工件上。

三個視角有了之後,問題變成怎麼把三份意見合成一個結論。就像三位老師傅分別聽同一件產品,不該把耳朵縫在一起,而應各自下結論再彙總。

不要硬拼

三個視角的數值尺度本來就不同,硬拼在一起會被跨度最大的那個視角主導,另兩個視角的細微差異被壓成噪聲。這就像把體溫、血壓、聽力的讀數直接相加,得先各自換算成偏離健康人群多少,再談綜合。

做法一

把表徵拼成一條

強勢視角說了算,弱勢視角被淹沒,出問題也難以定位到是哪一個視角。

不採用

01三視角各自打分每个视角独立说出偏离多远
02各自校準换算成可比的相对位置
03分數層融合按本线证据决定倚重谁
04工件級判定任一片段异常即判该件异常
三份意見各自校準後在分數層匯合,結論落在工件上

按產線擇優

不同產品、不同工位,主導的缺陷型別本來就不同:有的表現為整體音色偏移,有的表現為時間上的細碎起伏。所以給出統一機制,讓每條線用自己的證據挑選該倚重的視角。分數來自模型推理,不是人工閾值;人工設定的只有誤判預算一個旋鈕。

判定單位是工件,不是片段

一件產品在採音期間被切成若干段分別打分,任一段異常即判該件異常。異常常常只出現在一瞬間,不應被整段聲音平均掉。

08

跟得上:滾動校準與誤判預算

門檻隨近期正常件持續重定;品質與產能的取捨由客戶用一個旋鈕設定。

產線是活的:批次、季節、工裝磨損都會讓聲音的基線慢慢移動。出廠時定死的固定門檻,久了必然要麼太鬆要麼太緊。

門檻來自近期的正常件

引擎持續收集本線近期正常件的分數,匯成現在的正常分佈,門檻落在其上並按天重新推定。批次與季節的緩慢變化因此被自然吸收。不是拿出廠的尺子量所有年份的產品,而是每天早上先量今天的正常件,再決定今天的界線。校準只重定門檻,預訓練的深度聽覺模型與其模型版本保持不變。

誤判預算:一個旋鈕

漏檢和誤判無法同時降到最低,這是取捨,不是缺陷。由客戶設定能接受多少比例的正常件被攔下複核,系統據此反推當日門檻。擰嚴一點複核量上升,擰鬆一點產能輕鬆、邊緣異常更可能透過。

性質一

可調

不同工位、不同階段可以設不同的嚴格程度。試產期與量產期本就不該一樣。

性質二

可解釋

門檻對應的是複核工作量,是一件件要人確認的產品,品質會議上可以直接討論。

性質三

可覆盤

設定值與實際攔下比例的偏離是健康度訊號。偏離持續拉大,先查採音條件與工藝變更,而不是先改門檻。

複核迴流:閉環

被攔下的工件由現場人工複核,結論迴流成為確認樣本。系統因此逐步知道本線真正的異常聽起來是什麼樣。

01系統判定按当日门槛拦下可疑件
02人工複核现场逐件确认是否真异常
03結論迴流复核结论成为确认样本
04更新基線正常分布与门槛随之重定
更新之後回到第一步,閉環按現場節奏持續運轉
閉環有一個前提

迴流的主要是被系統攔下的工件,學到的異常樣貌因此受複核範圍與質量影響。一開始就沒被攔下的異常,很難出現在學習材料裡。建議匯入初期對放行件也抽檢,結論一併迴流。

09

用得穩:現場前提與適用邊界

系統能否穩定工作,一半在演算法,一半在採音與工況守不守得住。

任何聲學檢測都建立在一個前提上:這一次聽到的聲音和上一次可比。把邊界說清楚,比宣稱無所不能更有價值。

前提 為什麼重要 現場做法
採音一致性 麥克風、位置、指向、增益、工裝任一變更,絕對水平與音色都會移位。 視同新部署,重新校準並重建正常基線,變更內容與日期留檔。
環境與工況一致性 正常範圍內的背景波動可以吸收,節拍變化與新增噪聲源不行。 保持節拍與背景條件穩定,出現明顯變化即重新驗證。
片段與節拍匹配 切得太短會把特徵切碎,切得太長會把瞬時異常平均掉。 匯入階段與工藝方共同確定觸發方式與片段口徑。
基線積累與現場適配 現場適配用正常件把預訓練模型對齊到本產線,基線不足時判定易被偶然波動帶偏。 匯入初期先積累,覆蓋不同班次後完成現場適配再啟用;模型版本固定,同一版本的推理結果可復現,新產線靠現場適配接入而不是重寫規則。
判定口徑與複核 上下游對什麼算異常的定義不一致,迴流樣本就會互相矛盾。 明確複核標準與責任崗位,各班組用同一份標準。

匯入方式:影子期

01

並行執行,只記錄不干預

引擎與現有流程同時工作,輸出只作記錄,不影響放行。

02

積累與比對

形成正常基線並完成現場適配,同時與現場判定逐件比對,確認口徑一致。

03

切入判定

客戶認可後按設定的誤判預算參與判定,隨時可切回只記錄。

影子期真正的價值,是把什麼算異常在系統與現場之間對齊。

適用邊界

適用
面向有經驗的人能聽出差異的異常——異響、摩擦、鬆動、裝配不到位。差異體現在聲音上,模型就能學出依據。
不適用 · 一
不體現在聲音上的缺陷,如外觀、尺寸、材料內部問題,應由相應檢測手段負責。
不適用 · 二
能量落在採音鏈路有效範圍外的現象記錄不到,需先調整採音方案。
不適用 · 三
工裝與背景噪聲的件間差異超過產品自身差異時,判斷失去前提,應先改善現場條件。
一條通用規則

以上任何一項前提發生變更,都應先重新校準並做一段影子期複核,再恢復正式判定,讓判定始終建立在可比的聲音之上。

10

常見問題

匯入前最常被問到的問題,按實況作答,不作效果承諾。

以下問題來自現場的實際關切;真實表現請在貴司產線上以影子期驗證。

這和傳統的聲級或頻譜閾值檢測有什麼區別?

傳統方法由人先選定指標、逐個設門檻,人想不到的異常進不了判據。本引擎是深度學習系統,在大量無標註聲音上預訓練,自己學出該分辨什麼,即表徵(模型自己形成的內部表示),再按產線現場適配,因此能聽出能量沒變、音色變了這類差異。

需要提供多少缺陷樣本才能上線?

主體學習是自監督的,先學會正常聲音長什麼樣,不依賴缺陷標註即可開始。少量已確認的異常件有助於對齊口徑,但不是前提。

會不會因為換批次、換季節就失效?

門檻按近期正常件持續重定,緩慢變化自然吸收;工藝、工裝或採音條件的實質變更應重新校準並做影子期複核。

判錯了怎麼辦?能追溯嗎?

每次推理都保留採音、片段與分數,可逐件回溯,判錯的件迴流校準;最終判定權仍在現場。

會不會拖慢節拍?

推理在採音完成後進行,目標是在工位節拍內完成;邊緣端還是服務端按專案條件確定。

能不能告訴我它為什麼判這一件異常?

可以回溯到哪一段觸發、哪個視角偏離最顯著,並調出那段聲音收聽;這是指向證據而非因果解釋。

換一條產線要多久?

流程固定:接入採音、積累基線、影子期驗證、切入判定,時間取決於產量與異常頻度。

能和現有 MES 或質量系統對接嗎?

以工件標識關聯,輸出判定結論與分數供上位系統記錄統計,介面與觸發按專案約定。

演算法升級會不會推翻已有的判定基準?

底層的深度神經網路保持穩定,升級只新增讀出方式。新的模型版本可並行影子驗證,確認一致後再切換,必要時回退。

還有其他問題

具體產線的可行性,建議以一次影子期作為共同評估依據;貴司產品上的結論比通用說明更有參考。

具體產線的可行性,
建議以一次影子期
作為共同評估依據