なぜ生産ラインの異音検査は難しいのか
音は組付けや部品の不具合が最も早く表に出る手がかりですが、その判断を機械に安定して任せるのは容易ではありません。
組付けの緩み、部品のバリ、軸受の異常は、寸法がまだ公差内のうちから音に現れます。「聞く」ことを検査工程に組み込みたいという要求は続いてきましたが、実装しようとすると三つの壁にぶつかります。
熟練者の耳に頼る
熟練者の耳は鋭いのですが、基準は人により異なり疲労でずれます。さらに判定の記録が残らず、振り返りも次のラインへの複製もできません。
音圧レベルやスペクトルのしきい値に頼る
しきい値が得意なのは「大きくなる」変化だけです。現場の異常の多くは大きさが変わらず音色だけが変わり、擦れ感や周期的なカタつきが加わります。
欠陥を教師あり学習で覚えさせる
分類の学習は、欠陥の数と種類がそろっていることが前提です。現場はその逆で、良品が大多数を占め欠陥は稀にしか出ず、そろう頃にはラインは別の状態になっています。
| 現場で起こること | 従来手法が苦手な理由 | アルゴリズムに求められること |
|---|---|---|
| 何を手がかりにすべきか、そもそも決めきれない | 指標は人が思いつくしかなく、抜けが出る | 手がかりをモデルがデータから学ぶ |
| 欠陥は稀で、種類も増え続ける | 学習には欠陥サンプルが前提 | 欠陥ラベルなしで判定基準を作る |
| 大きさは同じで音色が変わる | 総量的な指標では捉えられない | 音色と時間的な質感で聞き分ける |
| 背景騒音とロット差が変化する | 固定しきい値は次第にずれる | 判定基準が現場に追随する |
| ラインごとに癖が異なる | 一組の設定では賄えない | ラインごとに適した分け方を選ぶ |
人手のルールを増やすのではなく、自ら学ぶ深層学習システムを
欠陥が乏しく現場が変化し続ける条件下でも、安定して使えることを目指しています。
三つの設計原則
前節の三つの壁に対して、本エンジンは三つの原則を崩さずに保っています。
三つの原則が以降の各章の方法を決めています。サンプルなしで何を学ぶのか、能力を広げるとき運用中の判定をどう保つのか、なぜ一つの指標にまとめないのか、に答えます。
欠陥ラベルに頼らず、自己教師あり学習で
モデルが自ら課題を作り自ら確かめる形で、ラベルなしの音から正常な音の表現(モデル自身が形づくる内部表現)を学びます。エネルギーの変動、共振の位置、打撃後の減衰です。判定基準は学習で得たものであり、人が書いた規則ではありません。
欠陥サンプル不要事前学習済みの深層聴覚モデルは動かさず、読み出し方の追加で能力を広げる
下の層のモデルは版が確定した後は重みを変更しません。新しいラインでは上の層の読み出しとしきい値を取り直すだけです。耳のよい人を替えるのではなく、別の言い方でもう一度説明してもらうということです。
基盤は再学習しない同じ音を複数の相補的な視点で捉える
音色の輪郭で分かる不具合、時間的な質感にしか出ない不具合、人の耳の感じ方に沿って初めて説明できる不具合があります。一つの指標に押し込めば互いに薄め合うため、各視点が独立に判断してから統合します。
相補性を優先- 既存の基準はそのまま有効で、追加した読み出しはまず記録のみに留め、一致を確認してから判定に組み込めます。
- どの拡張も無効化して元の状態に戻せます。基礎の層は動かしていないため、差異の原因は追加部分に限られます。
本書で用いる言い方
聞き分ける:粗さの異なる複数のスケールで
音はまず聞き分けられて初めて判断できます。本節では本エンジンがどのように聞くかを説明します。
音を分けて捉えるには避けられない取捨があります。時間を細かく分けるほど周波数は分けられなくなり、その逆もまた同じです。本当の問題は、どこで折り合うかではなく、なぜ一方しか選べないのかという点です。
時間を細かく分けると、周波数が分けられない
ごく短い一瞬だけを聞けば、そのカチッという音がいつ鳴ったかは正確に言えます。しかしこれほど短い区間では音の高さがそもそも聞き取れず、倍音は一塊になり、どの帯域で共鳴しているかも分かりません。
周波数を細かく分けると、時間が分けられない
長く続けて聞けば、音の高さと共鳴は細かく聞き分けられます。しかし短い衝突音はならされてしまい、いつ・何回鳴ったか、どれだけ速く減衰したかが失われます。組付けの緩みを最もよく表すのは、まさにその部分です。
本エンジンの方法:複数のスケールを同時に使い、どれを信じるかはモデルが学ぶ
粗さの異なるスケールを同時に使う
どちらかを選ぶのではなく、同じ音を長さの異なる複数のスケールで同時に捉えます。長いスケールは音の高さと共鳴を安定して捉え、短いスケールは打撃の瞬間と減衰を正確に捉え、両方の情報が手元に残ります。
どのスケールを信じるかを学習の中でモデル自身が身につける
打撃の瞬間は短いスケールを、持続する異音は長いスケールを信じるべきです。これは人が調整した規則ではなく、モデルが学習の中で正常音から自ら身につけたものであり、工程ごとに手で調整する必要はありません。
同じ箇所の音がスケールによってどう変わるかに着目する
モデルは同じ箇所の音が、長いスケールから短いスケールへどう変わるかにも着目します。衝突音はスケールが短いほど際立ち、持続音はどのスケールでも安定します。この変わり方そのものが最も直接的な手がかりであり、表現の中に学び取られます。
学び取る:自己教師あり学習
基礎能力は自己教師あり学習による事前学習から得られ、欠陥のラベルには依存しません。
最初のご質問は、不良品をどれだけ用意すればよいかというものです。本エンジンの中核はディープニューラルネットワークであり、まずラベルなしの産業音を大量に用いた自己教師あり学習で事前学習を行い、正常な音の姿を学びます。欠陥のラベルには依存しません。
自己教師あり学習による事前学習の循環
-
01
聴く
現場の音を入力すると、ネットワークは自らの表現を形づくります。
-
02
復元する
次に、その表現だけを頼りに元の音を描き出させます。元の音は参照できません。
-
03
自己点検する
復元結果と元の音を照合します。ずれはモデル自身が把握できます。
-
04
修正する
合わなかった箇所を改善の方向として、最初の工程に戻ります。
なぜこれで有用なものが身につくのか
学び取った表現は人が設計した指標に勝ります
従来手法では、どの指標を手がかりにするかを人が決めます。人が思いつかなかった規則性は判定根拠に入りません。設備の音を正確に復元するには、倍音のまとまり、包絡の起伏、共振の持ち上がり、暗騒音の質感を、ネットワーク自身が学び取る必要があります。人が思いつかなかった手がかりも含まれます。
正常を知って初めて異常に気づけます
異音に気づけるのは、本来あるべき姿から外れているからです。正常をしっかり学べばずれの基準が得られ、見たことのない欠陥でも捉えられます。
たとえ話
聞いたばかりの旋律を正確に口ずさめるのは、その構造を本当に理解している証です。曲名というラベルを覚えただけの人は、初めての曲になると手がかりを失います。
現場にとっての意味
導入時に大量の不良サンプルは不要です
現場の不良品は少なく種類もばらばらで、体系的なラベルは揃いません。導入段階で必要なのは現在の工程条件を代表する正常音です。
事前学習で土台を、現場適応で仕上げを
事前学習では幅広い産業設備の音から汎用的な表現を学び、その後の現場適応で各ラインに合わせ込みます。そのため特定ラインの偶発的な特徴に引きずられにくくなります。
ラベルなしでも現場情報は必要です
事前学習が担うのは基礎的な聴取能力です。個々のラインで判定を出すには、現場の正常音という参照と、安定した収録条件が引き続き必要です。
取りこぼさない:三つの相補的な視点
一度の推論で得た表現を三通りに読み出します。同じ欠陥でも視点により捉えやすさが大きく異なります。
三つの視点が読み出しているのは、同一のディープニューラルネットワークの内部表現であり、人が設計した三種類の特徴量ではありません。同じ表現でも読み出し方が異なれば捉えられるものは変わります。三つが一度の推論を共有でき、しかも重複ではなく相補となるのは、このためです。
三つの視点はそれぞれ何を捉えているか
全体音紋の視点
その音の全景写真を一枚撮るようなものです。最も安定しており、立ち上げ初期に最初に信頼できる経路です。
聴感に沿った視点
同じ表現を人の耳に関わる方向に並べ直してから比較します。目盛りのより適した物差しに持ち替えるようなものです。
時間的な質感の視点
全体をまとめる読み出しでは起伏がならされるため、この経路はリズムと周期性を意図的に残します。
| 視点 | 得意な問い | 直感的な説明 |
|---|---|---|
| 全体音紋 | 全体として正常から外れていますか | 全身写真です。体格の変化は一目で分かり、細かな点は見えません |
| 聴感に沿った視点 | 人の耳に耳障りに聞こえますか | 同じ対象を、より適した目盛りの物差しで測ります |
| 時間的な質感 | 継続的ですか、断続的ですか | 写真ではなく、動画のリズムです |
冗長ではなく、相補です
全体をまとめた読み出しではほとんど差が出ないのに、時間的な質感では明らかになる欠陥があり、その逆もあります。どの視点で表に出るかは事前に予測できないため、三つの経路を同時に保持しています。
コストと前提
三経路は推論を共有し、評価は個別に行います
三つの経路は同一の推論を読み出しており、増えるのは読み出しの工程だけで、タクトへの影響は小さく済みます。三者は尺度も安定性も異なり、一本につなぐと尺度の大きい経路が結果を支配するため、それぞれ独立に評価・校正したうえで、スコアの段階でまとめます。
人の耳に合わせる:聴感整合
異音の判定は音の大きさではなく、粗さ・変動感・鋭さに依存します。
現場で異音を最終的に判定するのは人であり、その基準はレベル計の読み値ではありません。エンジンは、人にどう聞こえるかという層で整合をとる必要があります。
同じ大きさの二つの音
エネルギーが等しい二つの音でも、一方は落ち着いて、もう一方は耳障りに聞こえます。違いは、エネルギーがどう分布し、どう変動し、変調があるかどうかにあります。
人の耳が気にしているもの
これらは音響分野で公知の聴感属性であり、エンジンは参照の方向として利用します。
エンジンはこれらの属性をどう使うか
参照の方向として用い、的を絞って拡大します
エンジンは属性をそのまま良否判定に用いず、方向の手がかりとして使い、ディープニューラルネットワークが学び取った表現から聴感に関わる成分を選び出して同じ尺度に揃えます。すべてを拡大すればノイズも大きくなるため、選び出すことが必要です。
情報を生み出すのではなく、既にある情報を読めるようにします
現場の音の違いの大部分は背景と工程条件に由来します。温度、ロット差、周辺工程などです。欠陥による違いははるかに小さく、そのまま比較すると覆い隠されます。大きな秤で羽根を量るようなもので、秤ではなく目盛りが合っていないだけです。
聴感に合わせることは、より適した目盛りの物差しに持ち替えることに相当します。データは変わらないまま、覆い隠されていた違いが識別できる尺度に戻ります。
この物差しは現場に合わせて決めます
この層の目盛りは、現在のラインと工程条件の正常音に基づき、現場適応によって決めます。ライン変更や条件の大きな変化があれば、取り直しが必要です。
見極める:スコア層での統合とライン別の最適化
三つの視点がそれぞれ独立した判断を出し、スコア層で統合され、結論はワーク単位で下されます。
三つの視点が揃うと、次は三つの意見をどう一つの結論にまとめるかが課題になります。三人の熟練者が同じ製品を聞くとき、耳を縫い合わせるのではなく、各自が結論を出して持ち寄るのと同じです。
単純な連結はしない
三つの視点は数値の尺度が元々異なり、単純に連結すると幅の最も大きい視点に支配され、他の二つの微細な差はノイズに埋もれます。体温・血圧・聴力の測定値をそのまま合計するようなもので、まず各項目を健常な集団からの隔たりに換算してから総合を語るべきです。
表現を一本に連結する
値の大きい視点が判断を支配し、他の視点は埋もれます。不調の原因がどの視点にあるのかも切り分けにくくなります。
採用しない
個別に採点し、意見を統合する
各視点が当該ラインの正常からどれだけ離れているかを独立して答え、比較可能な相対位置に換算したうえでスコア層で統合します。各視点の分解能はそのまま保たれます。
本エンジンの方式
ライン別の最適化
製品や工程が変われば、主となる不良のあらわれ方も変わります。音色全体のずれとして現れる場合もあれば、時間方向の細かな揺らぎとして現れる場合もあります。そこで統一された仕組みを用意し、各ラインが自らの証拠で重視すべき視点を選べるようにしています。スコアはモデルの推論から得られるもので、人手で決めた閾値ではありません。人が設定するのは、誤判定の許容量という一つのつまみだけです。
一つの製品は集音中にいくつかの区間に分けて採点され、いずれか一つでも異常と判定されればワークは異常となります。異常は一瞬だけ現れることが多く、音全体で平均されて消えてはなりません。
追従する:ローリング校正と過検出バジェット
しきい値は直近の正常品に合わせて定め直され、品質と生産性のトレードオフはお客様が一つのつまみで設定します。
ラインは生きています。ロット、季節、治具の摩耗によって音の基準はゆっくり移動します。出荷時に固定したしきい値は、いずれ緩すぎるか厳しすぎるかになります。
しきい値は直近の正常品から決まる
エンジンは当該ラインの直近の正常品のスコアを集めて今の正常分布を作り、しきい値はその上に置かれ日次で推定し直されます。ロットや季節による緩やかな変化は自然に吸収されます。出荷時のものさしで何年分もの製品を測るのではなく、毎朝まず今日の正常品を測り、今日の線引きを決めるのです。校正で定め直すのはしきい値だけで、事前学習済みの深層聴覚モデルとそのモデルバージョンは変わりません。
過検出バジェット:一つのつまみ
見逃しと過検出を同時に最小にすることはできません。これは欠陥ではなくトレードオフです。正常品のうちどれだけの割合が再検査に回ることを許容するかをお客様が設定し、そこから当日のしきい値を逆算します。厳しくすれば再検査の工数が増え、緩くすれば生産は楽になりますが境界付近の異常が通過しやすくなります。
調整できる
工程ごと、段階ごとに異なる厳しさを設定できます。試作期と量産期が同じである必要はありません。
説明できる
しきい値は再検査の工数、すなわち人が一つずつ確認する製品の数に対応し、品質会議でそのまま議論できます。
振り返れる
設定値と実際に止められた割合とのずれは健全性の信号です。ずれが拡大し続ける場合は、しきい値を変える前に集音条件と工程変更をご確認ください。
再検査結果のフィードバック:クローズドループ
止められたワークは現場で人が再検査し、その結論が確認済みサンプルとして戻されます。システムはこのラインで実際の異常がどう聞こえるかを少しずつ把握していきます。
フィードバックされるのは主にシステムが止めたワークですので、学ばれる異常の姿は再検査の範囲と質に左右されます。最初から止められなかった異常は、学習材料に現れにくくなります。導入初期は合格として流した品にも抜き取り検査を行い、その結果も併せてフィードバックしてください。
安定して使う:現場の前提と適用範囲
安定して機能するかどうかは、半分がアルゴリズム、半分が集音と工況を保てるかどうかで決まります。
あらゆる音響検査は、今回聞いた音と前回聞いた音が比較可能であるという前提の上に成り立ちます。適用範囲を明示することは、万能であると主張するより価値があると考えます。
| 前提 | なぜ重要か | 現場での対応 |
|---|---|---|
| 集音の一貫性 | マイク、位置、指向、ゲイン、治具のいずれかが変われば、音の絶対レベルと音色が移動します。 | 新規導入と同等に扱い、再校正と正常基準の再構築を行い、変更内容と日付を記録してください。 |
| 環境と工況の一貫性 | 通常の範囲の暗騒音の変動は吸収できますが、タクトの変更や新たな騒音源は吸収できません。 | タクトと背景条件を安定に保ち、明らかな変化があれば再検証してください。 |
| 集音区間と工程タクトの整合 | 短すぎると特徴が分断され、長すぎると瞬間的な異常が平均化されて消えます。 | 導入段階で工程担当と共に集音のトリガ方法と区間の切り方を決めてください。 |
| 基準の蓄積と現場適応 | 現場適応では正常品を用いて事前学習済みモデルを本ラインに合わせます。基準が不十分なうちは、判定が偶発的なばらつきに引きずられます。 | 導入初期はまず蓄積し、異なる直を網羅したうえで現場適応を完了してから稼働してください。モデルバージョンは固定され、同一バージョンでの推論結果は再現できます。新しいラインはルールを書き直すのではなく、現場適応によって立ち上げます。 |
| 判定基準と再検査 | 何を異常とするかの定義が前後工程で揃わなければ、戻されるサンプルが互いに矛盾します。 | 再検査の判定基準と責任者を明確にし、どの班も同一の基準をご使用ください。 |
導入方法:シャドー運用期間
並行稼働し、記録のみで介入しない
エンジンは既存の工程と並行して稼働し、出力は記録のみで合否には影響しません。
蓄積と突き合わせ
正常基準を形成して現場適応を完了しつつ、現場の判定と一件ずつ突き合わせ、基準の一致を確認します。
判定への切り替え
お客様のご承認後、設定された過検出バジェットに従って判定に参加し、いつでも記録のみへ戻せます。
シャドー運用期間の本当の価値は、何を異常とするかをシステムと現場で揃えることにあります。
適用の範囲
上記の前提のいずれかが変更された場合は、再校正と一定期間のシャドー運用による確認を行ってから正式な判定に戻し、判定を常に比較可能な音の上に成り立たせてください。
よくあるご質問
導入前に最も多くいただくご質問に実情に即してお答えします。効果のお約束はいたしません。
以下のご質問は現場から実際に寄せられたものです。実際の性能は、貴社ご自身のラインでシャドー運用期間を通じてご確認ください。
従来手法では、どの指標を手がかりにするかを人があらかじめ決め、指標ごとにしきい値を設けますので、人が想定できない異常は判定基準に入りません。本エンジンは深層学習のシステムで、大量のラベルなし音で事前学習し、何を手がかりにすべきかを自ら学びます。これが表現、すなわちモデルが自ら形成する内部的な表し方であり、その上でラインごとに現場適応します。そのため、エネルギーは変わらず音色だけが変わったような違いも捉えられます。
学習の主体は自己教師ありで、まず正常な音がどのようなものかを学びますので、不良ラベルがなくても開始できます。確認済みの異常品が少量あれば基準合わせに役立ちますが、前提ではありません。
しきい値は直近の正常品から継続的に定め直され、緩やかな変化は自然に吸収されます。工程、治具、集音条件の実質的な変更があった場合は、再校正とシャドー運用による確認を行ってください。
推論ごとに集音、区間、スコアを保持し、一件ずつ遡って確認でき、誤判定は校正に反映されます。最終的な判定権限は現場にあります。
推論は集音の完了後に行われ、工程のタクト内で完了することを目標とします。エッジ側かサーバ側かはプロジェクトの条件で決めます。
どの区間が引き金となり、どの視点の逸脱が最も大きかったかまで遡ることができ、該当する音をその場で再生できます。これは証拠を指し示すものであり原因の説明ではなく、原因の判断は現場に委ねられます。
手順は共通で、集音の接続、正常品の基準の蓄積、シャドー運用での検証、判定への切り替えとなります。所要期間は生産量と異常の発生頻度によって決まります。
ワーク識別子で紐づけ、判定結果とスコアを出力し、上位システムでの記録・集計にご利用いただけます。インタフェースの形式とトリガ方法はプロジェクトで取り決めます。
基盤となるディープニューラルネットワークは安定して維持され、更新は読み出し方の追加にとどまります。新しいモデルバージョンは並行してシャドー検証し、一致を確認してから切り替え、必要に応じて切り戻せます。
具体的なラインでの適用可否は、一度のシャドー運用を共通の評価根拠とすることをお勧めします。貴社の製品から得られた結論のほうが、一般的な説明より参考になります。