中文ZH 日本語JA · EnglishEN 難しさ 01 設計原則 02 聞き分ける 03 学び取る 04 取りこぼさない 05 聴感整合 06 見極める 07 追随する 08 安定運用 09 よくある質問 10 ← 巅峰表現へ戻る HOME

Universal Acoustic AI Inspection Engine

汎用音響 AI 検査エンジン アルゴリズム解説書

本エンジンは深層学習による音響検査システムです。本書は品質・生産・技術のご担当者向けに、生産ラインの音をどのように「聞き分ける」か、自己教師あり学習によって不良ラベルなしにどのように判断を学ぶか、そしてなぜこの設計による検査が信頼でき、管理できるのかを説明します。数式やコードは扱わず、設計の考え方とその取捨選択のみを述べます。

DEEP LEARNING · SELF-SUPERVISED · CLIENT EDITION · REV. A · 2026

01

なぜ生産ラインの異音検査は難しいのか

音は組付けや部品の不具合が最も早く表に出る手がかりですが、その判断を機械に安定して任せるのは容易ではありません。

組付けの緩み、部品のバリ、軸受の異常は、寸法がまだ公差内のうちから音に現れます。「聞く」ことを検査工程に組み込みたいという要求は続いてきましたが、実装しようとすると三つの壁にぶつかります。

01 / 人の耳

熟練者の耳に頼る

熟練者の耳は鋭いのですが、基準は人により異なり疲労でずれます。さらに判定の記録が残らず、振り返りも次のラインへの複製もできません。

02 / しきい値

音圧レベルやスペクトルのしきい値に頼る

しきい値が得意なのは「大きくなる」変化だけです。現場の異常の多くは大きさが変わらず音色だけが変わり、擦れ感や周期的なカタつきが加わります。

03 / 学習

欠陥を教師あり学習で覚えさせる

分類の学習は、欠陥の数と種類がそろっていることが前提です。現場はその逆で、良品が大多数を占め欠陥は稀にしか出ず、そろう頃にはラインは別の状態になっています。

さらに厄介なのは、現場そのものが変化し続けることです
背景騒音、ロット差、マイクや治具の状態は絶えず動いています。モデルが間違えたのではなく、足元の地面が動いているのです。
現場で起こること 従来手法が苦手な理由 アルゴリズムに求められること
何を手がかりにすべきか、そもそも決めきれない 指標は人が思いつくしかなく、抜けが出る 手がかりをモデルがデータから学ぶ
欠陥は稀で、種類も増え続ける 学習には欠陥サンプルが前提 欠陥ラベルなしで判定基準を作る
大きさは同じで音色が変わる 総量的な指標では捉えられない 音色と時間的な質感で聞き分ける
背景騒音とロット差が変化する 固定しきい値は次第にずれる 判定基準が現場に追随する
ラインごとに癖が異なる 一組の設定では賄えない ラインごとに適した分け方を選ぶ
01人の耳による判定基準がぶれ、判定の記録が残りません
02しきい値の規則音量の変化しか捉えられません
03教師あり学習欠陥サンプルは足りません
OUT自ら学ぶ聴覚システムが必要です深層学習が判定基準を自ら学び、現場に追随します
三つの従来手法はいずれも行き詰まり、同じ結論に至ります。
02

三つの設計原則

前節の三つの壁に対して、本エンジンは三つの原則を崩さずに保っています。

三つの原則が以降の各章の方法を決めています。サンプルなしで何を学ぶのか、能力を広げるとき運用中の判定をどう保つのか、なぜ一つの指標にまとめないのか、に答えます。

原則 01

欠陥ラベルに頼らず、自己教師あり学習で

モデルが自ら課題を作り自ら確かめる形で、ラベルなしの音から正常な音の表現(モデル自身が形づくる内部表現)を学びます。エネルギーの変動、共振の位置、打撃後の減衰です。判定基準は学習で得たものであり、人が書いた規則ではありません。

欠陥サンプル不要
原則 03

同じ音を複数の相補的な視点で捉える

音色の輪郭で分かる不具合、時間的な質感にしか出ない不具合、人の耳の感じ方に沿って初めて説明できる不具合があります。一つの指標に押し込めば互いに薄め合うため、各視点が独立に判断してから統合します。

相補性を優先
01読み出し方 1全体の音色の輪郭を捉えます
02読み出し方 2細かな時間的な質感を捉えます
03読み出し方 3人の耳の感じ方に沿って捉えます
BASE事前学習済みの深層聴覚モデル・変更なし版を確定した後は手を入れません
同じ基礎から複数の読み出しが派生し、能力は上の層にのみ追加されます。
加算的な拡張がもたらすもの
  • 既存の基準はそのまま有効で、追加した読み出しはまず記録のみに留め、一致を確認してから判定に組み込めます。
  • どの拡張も無効化して元の状態に戻せます。基礎の層は動かしていないため、差異の原因は追加部分に限られます。

本書で用いる言い方

事前学習済みの深層聴覚モデル
ラベルなしの産業音で事前学習し、生の音を表現に変換する部分です。モデルバージョンの確定後は変更しません。
読み出し方
その表現から比較でき判断できる量を取り出す方法で、拡張は主にこの層で行います。
視点
独立した読み出し方と、それ自身の判定基準を合わせたものです。
許容できる誤判定の範囲
ラインが事前に取り決めた、許容できる誤判定の水準で、判定の厳しさはこの範囲内で調整します。
03

聞き分ける:粗さの異なる複数のスケールで

音はまず聞き分けられて初めて判断できます。本節では本エンジンがどのように聞くかを説明します。

音を分けて捉えるには避けられない取捨があります。時間を細かく分けるほど周波数は分けられなくなり、その逆もまた同じです。本当の問題は、どこで折り合うかではなく、なぜ一方しか選べないのかという点です。

時間を細かく分けると、周波数が分けられない

ごく短い一瞬だけを聞けば、そのカチッという音がいつ鳴ったかは正確に言えます。しかしこれほど短い区間では音の高さがそもそも聞き取れず、倍音は一塊になり、どの帯域で共鳴しているかも分かりません。

周波数を細かく分けると、時間が分けられない

長く続けて聞けば、音の高さと共鳴は細かく聞き分けられます。しかし短い衝突音はならされてしまい、いつ・何回鳴ったか、どれだけ速く減衰したかが失われます。組付けの緩みを最もよく表すのは、まさにその部分です。

本エンジンの方法:複数のスケールを同時に使い、どれを信じるかはモデルが学ぶ

01

粗さの異なるスケールを同時に使う

どちらかを選ぶのではなく、同じ音を長さの異なる複数のスケールで同時に捉えます。長いスケールは音の高さと共鳴を安定して捉え、短いスケールは打撃の瞬間と減衰を正確に捉え、両方の情報が手元に残ります。

02

どのスケールを信じるかを学習の中でモデル自身が身につける

打撃の瞬間は短いスケールを、持続する異音は長いスケールを信じるべきです。これは人が調整した規則ではなく、モデルが学習の中で正常音から自ら身につけたものであり、工程ごとに手で調整する必要はありません。

03

同じ箇所の音がスケールによってどう変わるかに着目する

モデルは同じ箇所の音が、長いスケールから短いスケールへどう変わるかにも着目します。衝突音はスケールが短いほど際立ち、持続音はどのスケールでも安定します。この変わり方そのものが最も直接的な手がかりであり、表現の中に学び取られます。

なぜスケールごとに揃えないのか
スケールごとに揃えれば数値は整いますが、「どのスケールで最も際立つか」という情報が消えます。金属の衝突音が持続的な摩擦音と区別できるのは、短いスケールで際立ち、長いスケールでは目立たないからです。そのため複数のスケールを同じ物差しで比べます。
IN同じ一つの音一度の収録を、複数のスケールで同時に
01長いスケール音の高さと共鳴を安定して分ける
02中くらいのスケール音の高さと変化の両方を捉える
03短いスケール打撃の瞬間と減衰を正確に分ける
OUT複数のスケールを突き合わせるどのスケールで最も際立つかが手がかりです
同じ音を複数のスケールで同時に捉え、互いに比べます。
04

学び取る:自己教師あり学習

基礎能力は自己教師あり学習による事前学習から得られ、欠陥のラベルには依存しません。

最初のご質問は、不良品をどれだけ用意すればよいかというものです。本エンジンの中核はディープニューラルネットワークであり、まずラベルなしの産業音を大量に用いた自己教師あり学習で事前学習を行い、正常な音の姿を学びます。欠陥のラベルには依存しません。

自己教師あり学習による事前学習の循環

  1. 01

    聴く

    現場の音を入力すると、ネットワークは自らの表現を形づくります。

  2. 02

    復元する

    次に、その表現だけを頼りに元の音を描き出させます。元の音は参照できません。

  3. 03

    自己点検する

    復元結果と元の音を照合します。ずれはモデル自身が把握できます。

  4. 04

    修正する

    合わなかった箇所を改善の方向として、最初の工程に戻ります。

なぜこれで有用なものが身につくのか

表現学習

学び取った表現は人が設計した指標に勝ります

従来手法では、どの指標を手がかりにするかを人が決めます。人が思いつかなかった規則性は判定根拠に入りません。設備の音を正確に復元するには、倍音のまとまり、包絡の起伏、共振の持ち上がり、暗騒音の質感を、ネットワーク自身が学び取る必要があります。人が思いつかなかった手がかりも含まれます。

異常判定の土台

正常を知って初めて異常に気づけます

異音に気づけるのは、本来あるべき姿から外れているからです。正常をしっかり学べばずれの基準が得られ、見たことのない欠陥でも捉えられます。

人が指標を設計する思いついた項目だけが判断材料になります
モデルが自ら表現を学ぶ気づかれなかった規則性も学び取ります
違いは処理の速さではなく、何を手がかりにするかを誰が決めるかにあります。

たとえ話

聞いたばかりの旋律を正確に口ずさめるのは、その構造を本当に理解している証です。曲名というラベルを覚えただけの人は、初めての曲になると手がかりを失います。

現場にとっての意味

導入時に大量の不良サンプルは不要です

現場の不良品は少なく種類もばらばらで、体系的なラベルは揃いません。導入段階で必要なのは現在の工程条件を代表する正常音です。

ラベルなしでも現場情報は必要です

事前学習が担うのは基礎的な聴取能力です。個々のラインで判定を出すには、現場の正常音という参照と、安定した収録条件が引き続き必要です。

05

取りこぼさない:三つの相補的な視点

一度の推論で得た表現を三通りに読み出します。同じ欠陥でも視点により捉えやすさが大きく異なります。

三つの視点が読み出しているのは、同一のディープニューラルネットワークの内部表現であり、人が設計した三種類の特徴量ではありません。同じ表現でも読み出し方が異なれば捉えられるものは変わります。三つが一度の推論を共有でき、しかも重複ではなく相補となるのは、このためです。

IN一度の推論一つの製品を一度だけ推論します
01全体音紋全体として正常から外れていないか
02聴感に沿った視点人の耳に耳障りかどうか
03時間的な質感異常は継続か断続か
OUT一つの判定三経路を個別に評価しまとめます
三つの読み出しは同一の推論を共有し、タクトへの影響はほとんどありません。

三つの視点はそれぞれ何を捉えているか

視点 1

全体音紋の視点

その音の全景写真を一枚撮るようなものです。最も安定しており、立ち上げ初期に最初に信頼できる経路です。

視点 3

時間的な質感の視点

全体をまとめる読み出しでは起伏がならされるため、この経路はリズムと周期性を意図的に残します。

視点 得意な問い 直感的な説明
全体音紋 全体として正常から外れていますか 全身写真です。体格の変化は一目で分かり、細かな点は見えません
聴感に沿った視点 人の耳に耳障りに聞こえますか 同じ対象を、より適した目盛りの物差しで測ります
時間的な質感 継続的ですか、断続的ですか 写真ではなく、動画のリズムです

冗長ではなく、相補です

全体をまとめた読み出しではほとんど差が出ないのに、時間的な質感では明らかになる欠陥があり、その逆もあります。どの視点で表に出るかは事前に予測できないため、三つの経路を同時に保持しています。

コストと前提

三経路は推論を共有し、評価は個別に行います

三つの経路は同一の推論を読み出しており、増えるのは読み出しの工程だけで、タクトへの影響は小さく済みます。三者は尺度も安定性も異なり、一本につなぐと尺度の大きい経路が結果を支配するため、それぞれ独立に評価・校正したうえで、スコアの段階でまとめます。

06

人の耳に合わせる:聴感整合

異音の判定は音の大きさではなく、粗さ・変動感・鋭さに依存します。

現場で異音を最終的に判定するのは人であり、その基準はレベル計の読み値ではありません。エンジンは、人にどう聞こえるかという層で整合をとる必要があります。

同じ大きさの二つの音

エネルギーが等しい二つの音でも、一方は落ち着いて、もう一方は耳障りに聞こえます。違いは、エネルギーがどう分布し、どう変動し、変調があるかどうかにあります。

人の耳が気にしているもの

ラフネス(粗さ)
比較的速い変動が重なり、ざらついて聞こえます。
変動感(変動強度)
ゆるやかな強弱の揺れで、ふらついて聞こえます。
シャープネス(鋭さ)
エネルギーが高域に偏ったときの刺す感覚です。
ラウドネス
人が感じる大きさで、計測値とは一致しません。
トーナリティ
うなりのような音が際立つかどうかです。
変調
変動の速さと規則性で、前述の各項に共通する源です。

これらは音響分野で公知の聴感属性であり、エンジンは参照の方向として利用します。

エンジンはこれらの属性をどう使うか

参照の方向として用い、的を絞って拡大します

エンジンは属性をそのまま良否判定に用いず、方向の手がかりとして使い、ディープニューラルネットワークが学び取った表現から聴感に関わる成分を選び出して同じ尺度に揃えます。すべてを拡大すればノイズも大きくなるため、選び出すことが必要です。

BEFORE 目盛りの粗い物差し 七つの値が同じ目盛りに入り、読み値は同じです
AFTER 目盛りの合った物差し 同じ七つの値が別々の目盛りに入り、区別できます
データは変わらず、変わったのは目盛りだけです。

この物差しは現場に合わせて決めます

この層の目盛りは、現在のラインと工程条件の正常音に基づき、現場適応によって決めます。ライン変更や条件の大きな変化があれば、取り直しが必要です。

07

見極める:スコア層での統合とライン別の最適化

三つの視点がそれぞれ独立した判断を出し、スコア層で統合され、結論はワーク単位で下されます。

三つの視点が揃うと、次は三つの意見をどう一つの結論にまとめるかが課題になります。三人の熟練者が同じ製品を聞くとき、耳を縫い合わせるのではなく、各自が結論を出して持ち寄るのと同じです。

単純な連結はしない

三つの視点は数値の尺度が元々異なり、単純に連結すると幅の最も大きい視点に支配され、他の二つの微細な差はノイズに埋もれます。体温・血圧・聴力の測定値をそのまま合計するようなもので、まず各項目を健常な集団からの隔たりに換算してから総合を語るべきです。

方式 1

表現を一本に連結する

値の大きい視点が判断を支配し、他の視点は埋もれます。不調の原因がどの視点にあるのかも切り分けにくくなります。

採用しない

01三視点が個別に採点各視点が逸脱の度合いを個別に示します
02個別に校正比較可能な相対位置へ換算します
03スコア層で統合当該ラインの証拠で重みを決めます
04ワーク単位で判定いずれかの区間が異常ならワークも異常です
三つの意見は校正のうえスコア層で統合され、結論はワーク単位で出ます

ライン別の最適化

製品や工程が変われば、主となる不良のあらわれ方も変わります。音色全体のずれとして現れる場合もあれば、時間方向の細かな揺らぎとして現れる場合もあります。そこで統一された仕組みを用意し、各ラインが自らの証拠で重視すべき視点を選べるようにしています。スコアはモデルの推論から得られるもので、人手で決めた閾値ではありません。人が設定するのは、誤判定の許容量という一つのつまみだけです。

判定単位はワークであり、区間ではありません

一つの製品は集音中にいくつかの区間に分けて採点され、いずれか一つでも異常と判定されればワークは異常となります。異常は一瞬だけ現れることが多く、音全体で平均されて消えてはなりません。

08

追従する:ローリング校正と過検出バジェット

しきい値は直近の正常品に合わせて定め直され、品質と生産性のトレードオフはお客様が一つのつまみで設定します。

ラインは生きています。ロット、季節、治具の摩耗によって音の基準はゆっくり移動します。出荷時に固定したしきい値は、いずれ緩すぎるか厳しすぎるかになります。

しきい値は直近の正常品から決まる

エンジンは当該ラインの直近の正常品のスコアを集めて今の正常分布を作り、しきい値はその上に置かれ日次で推定し直されます。ロットや季節による緩やかな変化は自然に吸収されます。出荷時のものさしで何年分もの製品を測るのではなく、毎朝まず今日の正常品を測り、今日の線引きを決めるのです。校正で定め直すのはしきい値だけで、事前学習済みの深層聴覚モデルとそのモデルバージョンは変わりません。

過検出バジェット:一つのつまみ

見逃しと過検出を同時に最小にすることはできません。これは欠陥ではなくトレードオフです。正常品のうちどれだけの割合が再検査に回ることを許容するかをお客様が設定し、そこから当日のしきい値を逆算します。厳しくすれば再検査の工数が増え、緩くすれば生産は楽になりますが境界付近の異常が通過しやすくなります。

性質 1

調整できる

工程ごと、段階ごとに異なる厳しさを設定できます。試作期と量産期が同じである必要はありません。

性質 2

説明できる

しきい値は再検査の工数、すなわち人が一つずつ確認する製品の数に対応し、品質会議でそのまま議論できます。

性質 3

振り返れる

設定値と実際に止められた割合とのずれは健全性の信号です。ずれが拡大し続ける場合は、しきい値を変える前に集音条件と工程変更をご確認ください。

再検査結果のフィードバック:クローズドループ

止められたワークは現場で人が再検査し、その結論が確認済みサンプルとして戻されます。システムはこのラインで実際の異常がどう聞こえるかを少しずつ把握していきます。

01システムが判定当日のしきい値で疑わしい品を止めます
02人による再検査現場で一件ずつ実際の可否を確認します
03結果のフィードバック再検査の結論が確認済みサンプルになります
04基準を更新正常分布としきい値が定め直されます
更新後は最初の段階へ戻り、現場のリズムで回り続けます
クローズドループには前提があります

フィードバックされるのは主にシステムが止めたワークですので、学ばれる異常の姿は再検査の範囲と質に左右されます。最初から止められなかった異常は、学習材料に現れにくくなります。導入初期は合格として流した品にも抜き取り検査を行い、その結果も併せてフィードバックしてください。

09

安定して使う:現場の前提と適用範囲

安定して機能するかどうかは、半分がアルゴリズム、半分が集音と工況を保てるかどうかで決まります。

あらゆる音響検査は、今回聞いた音と前回聞いた音が比較可能であるという前提の上に成り立ちます。適用範囲を明示することは、万能であると主張するより価値があると考えます。

前提 なぜ重要か 現場での対応
集音の一貫性 マイク、位置、指向、ゲイン、治具のいずれかが変われば、音の絶対レベルと音色が移動します。 新規導入と同等に扱い、再校正と正常基準の再構築を行い、変更内容と日付を記録してください。
環境と工況の一貫性 通常の範囲の暗騒音の変動は吸収できますが、タクトの変更や新たな騒音源は吸収できません。 タクトと背景条件を安定に保ち、明らかな変化があれば再検証してください。
集音区間と工程タクトの整合 短すぎると特徴が分断され、長すぎると瞬間的な異常が平均化されて消えます。 導入段階で工程担当と共に集音のトリガ方法と区間の切り方を決めてください。
基準の蓄積と現場適応 現場適応では正常品を用いて事前学習済みモデルを本ラインに合わせます。基準が不十分なうちは、判定が偶発的なばらつきに引きずられます。 導入初期はまず蓄積し、異なる直を網羅したうえで現場適応を完了してから稼働してください。モデルバージョンは固定され、同一バージョンでの推論結果は再現できます。新しいラインはルールを書き直すのではなく、現場適応によって立ち上げます。
判定基準と再検査 何を異常とするかの定義が前後工程で揃わなければ、戻されるサンプルが互いに矛盾します。 再検査の判定基準と責任者を明確にし、どの班も同一の基準をご使用ください。

導入方法:シャドー運用期間

01

並行稼働し、記録のみで介入しない

エンジンは既存の工程と並行して稼働し、出力は記録のみで合否には影響しません。

02

蓄積と突き合わせ

正常基準を形成して現場適応を完了しつつ、現場の判定と一件ずつ突き合わせ、基準の一致を確認します。

03

判定への切り替え

お客様のご承認後、設定された過検出バジェットに従って判定に参加し、いつでも記録のみへ戻せます。

シャドー運用期間の本当の価値は、何を異常とするかをシステムと現場で揃えることにあります。

適用の範囲

適用できる場合
経験のある方が音の違いとして聞き分けられる異常が対象です。異音、こすれ、緩み、組付け不良など、違いが音に現れていれば、モデルはその根拠を自ら学び取ります。
適用外 1
外観、寸法、材料内部の問題など、音にまったく現れない不良は、それぞれに適した検査手段で対応してください。
適用外 2
エネルギーが集音系の有効範囲を外れる現象は記録できず、まず集音の構成を見直す必要があります。
適用外 3
治具や背景騒音の品ごとの差が製品自体の差を上回る場合、一貫性に基づく判断は前提を失いますので、まず現場条件の改善が必要です。
共通ルール

上記の前提のいずれかが変更された場合は、再校正と一定期間のシャドー運用による確認を行ってから正式な判定に戻し、判定を常に比較可能な音の上に成り立たせてください。

10

よくあるご質問

導入前に最も多くいただくご質問に実情に即してお答えします。効果のお約束はいたしません。

以下のご質問は現場から実際に寄せられたものです。実際の性能は、貴社ご自身のラインでシャドー運用期間を通じてご確認ください。

従来の音圧レベルや周波数スペクトルのしきい値検査と、何が違いますか。

従来手法では、どの指標を手がかりにするかを人があらかじめ決め、指標ごとにしきい値を設けますので、人が想定できない異常は判定基準に入りません。本エンジンは深層学習のシステムで、大量のラベルなし音で事前学習し、何を手がかりにすべきかを自ら学びます。これが表現、すなわちモデルが自ら形成する内部的な表し方であり、その上でラインごとに現場適応します。そのため、エネルギーは変わらず音色だけが変わったような違いも捉えられます。

導入にはどれくらいの不良サンプルが必要でしょうか。

学習の主体は自己教師ありで、まず正常な音がどのようなものかを学びますので、不良ラベルがなくても開始できます。確認済みの異常品が少量あれば基準合わせに役立ちますが、前提ではありません。

ロットや季節が変わると使えなくなりませんか。

しきい値は直近の正常品から継続的に定め直され、緩やかな変化は自然に吸収されます。工程、治具、集音条件の実質的な変更があった場合は、再校正とシャドー運用による確認を行ってください。

判定を誤った場合はどうなりますか。追跡は可能ですか。

推論ごとに集音、区間、スコアを保持し、一件ずつ遡って確認でき、誤判定は校正に反映されます。最終的な判定権限は現場にあります。

タクトタイムに影響しませんか。

推論は集音の完了後に行われ、工程のタクト内で完了することを目標とします。エッジ側かサーバ側かはプロジェクトの条件で決めます。

なぜこの一件を異常と判定したのか、説明できますか。

どの区間が引き金となり、どの視点の逸脱が最も大きかったかまで遡ることができ、該当する音をその場で再生できます。これは証拠を指し示すものであり原因の説明ではなく、原因の判断は現場に委ねられます。

別のラインへ展開するにはどのくらいかかりますか。

手順は共通で、集音の接続、正常品の基準の蓄積、シャドー運用での検証、判定への切り替えとなります。所要期間は生産量と異常の発生頻度によって決まります。

既存の MES や品質システムと連携できますか。

ワーク識別子で紐づけ、判定結果とスコアを出力し、上位システムでの記録・集計にご利用いただけます。インタフェースの形式とトリガ方法はプロジェクトで取り決めます。

アルゴリズムの更新により、既存の判定基準が崩れませんか。

基盤となるディープニューラルネットワークは安定して維持され、更新は読み出し方の追加にとどまります。新しいモデルバージョンは並行してシャドー検証し、一致を確認してから切り替え、必要に応じて切り戻せます。

その他のご質問

具体的なラインでの適用可否は、一度のシャドー運用を共通の評価根拠とすることをお勧めします。貴社の製品から得られた結論のほうが、一般的な説明より参考になります。

具体的なラインでの適用可否は、
一度のシャドー運用
を共通の評価根拠とすることをお勧めします