AI 品質管理を検討するとき、「画像認識の精度は何%か」「どの生成AIを使うか」から始めると、現場導入後に判断が止まりやすくなります。品質管理で必要なのは、検査を自動化するモデル単体ではありません。何を不良と定義し、測定を信頼できる状態に保ち、AIの提案を人がどう承認し、流出防止と原因対策をどう完了させ、変化後も性能を監視するかという閉ループです。本稿では、タイ工場が品質管理 AIを90日PoCからRFP・受入判定へ進めるための実務設計を、数値効果を誇張せずに整理します。
AI 品質管理は「判定モデル」ではなく閉ループ管理である
品質の仕事は、カメラがOK/NGを返した時点では終わりません。検査対象を識別し、測定条件を記録し、判定根拠を残し、必要なら保留・隔離し、原因を分析して対策し、その対策が効いたか確認するまでが一つの流れです。AIが入る場所は、その流れの一部です。
閉ループを次の8段階で定義すると、責任の抜けを見つけやすくなります。
- 定義:顧客仕様、図面、限度見本、検査標準から良否と不良分類を定める。
- 測定:カメラ、センサー、測定器、作業者入力から追跡可能なデータを得る。
- 推論:異常検知 AIや分類モデルがスコア、候補不良、根拠を出す。
- 判断:自動判定または権限を持つ人が、合格・不合格・保留を確定する。
- 封じ込め:対象品、ロット、仕掛品、出荷済み範囲を隔離・確認する。
- 原因分析:4M、設備状態、材料ロット、工程条件、前後工程を結び、不良原因を検証する。
- 是正と検証:対策を実施し、再発・副作用・別製品への影響を確認する。
- 変更管理:製品、設備、照明、材料、モデル、閾値、ラベル定義の変更を承認し、再評価する。
2026年7月公開のNISTスマート製造AI/MLロードマップは、産業ビッグデータの複雑さ、データ管理、異種センサー・制御系との統合、高リスク環境での信頼性・説明可能性を課題として挙げています。つまり、AI 品質管理の難所はモデル学習だけではなく、測定・統合・運用の全体にあります。
工程改善AIとの境界を先に決める
本稿の対象は品質判定、流出防止、原因分析、受入ガバナンスです。ボトルネック分析、サイクルタイム、設備稼働率の可視化は工程改善のテーマであり、同じ製造データを使っても意思決定が異なります。品質プロジェクトの主KPIを稼働率に置くと、検査を速く通すことが優先され、流出リスクを見落とすおそれがあります。
一方、画像を使う案件では、工場向けAI安全カメラの設計ガイドにある撮像範囲、現場運用、誤検知対応の考え方も参考になります。ただし安全監視と製品品質では、正解ラベル、損失、保持期間、責任者が違います。同じカメラ基盤を共有しても、受入基準は分けます。
最初に決めるべきは「流出」と「過剰排除」の損失
AIモデルには、見逃しと誤検知があります。品質の言葉に置き換えると、見逃しは不良を良品として通す流出、誤検知は良品を不良として止める過剰排除です。単純な正解率は、この二つの重さを表しません。
たとえば仮想例として、1,000個中990個が良品、10個が不良の評価データを考えます。全品を良品と答える仕組みでも正解率は99%ですが、不良10個をすべて流出させます。この99%は説明のための仮想値で、業界平均ではありません。必要なのは、次の内訳です。
| 判定 | 実際に良品 | 実際に不良 | 品質上の意味 |
|---|---|---|---|
| AIが良品 | 正しく通過 | 流出候補 | 顧客リスク、選別・返品・信用への影響 |
| AIが不良 | 過剰排除 | 正しく検出 | 廃棄、再検、停止、作業負荷への影響 |
| AIが保留 | 人が再判定 | 人が再判定 | 安全弁だが、滞留と能力計画が必要 |
コスト関数は購買仕様に書く
受入時は「精度最大」ではなく、承認済みの損失関数で閾値を選びます。考え方は次のように表せます。
評価損失 = 流出件数×流出1件の損失 + 過剰排除件数×再検・廃棄損失 + 保留件数×判定工数
ここで使う金額は、クレーム費だけでなく、顧客ライン停止、選別、特急輸送、保証、廃棄、再検、納期遅延など、会社が承認した範囲で定義します。安全・法令・重要特性は金額だけで最適化せず、許容できない条件をハードゲートにします。RFPに「ベンダーが最適閾値を提案」とだけ書かず、誰が損失を承認し、どの条件では自動合格を禁止するかを明記します。
データ契約:製造データ分析の前に意味を固定する
製造データ 分析の失敗は、データ量不足より、同じ列名が別の意味を持つことから始まります。品番、工程、設備、キャビティ、治具、材料ロット、作業者、シフト、不良コード、再加工、最終判定が、MES・QMS・設備・Excelで一致しているか確認します。
最低限のデータ契約には次を含めます。
| 項目 | 必須定義 | 受入証拠 |
|---|---|---|
| 個体識別 | シリアル、ロット、親子関係、分割・統合 | 原材料から出荷までの追跡テスト |
| 時刻 | 発生時刻、取得時刻、ICT/UTC、時計同期 | タイムゾーンをまたぐ並び順確認 |
| 製品条件 | 品番、図面版、顧客仕様、工程版 | 版変更前後を混同しない照会 |
| 設備条件 | ライン、機械、治具、キャビティ、レシピ | 同一不良を条件別に集計 |
| 材料条件 | 供給者、材料ロット、受入検査 | 不良ロットの影響範囲追跡 |
| 判定 | AIスコア、閾値、最終判定、理由、判定者 | 自動と人の判断を再現 |
| ラベル | 不良分類、定義版、限度見本、注記 | ラベル変更履歴と再学習対象 |
| 画像・波形 | 原本、前処理、装置設定、保管期限 | 同じ入力を再評価可能 |

「不良原因分析 AI」の前に相関と原因を分ける
AIは、材料ロットAと傷不良が同時に増えた、設備温度と寸法ずれが関連した、といった候補を高速に提示できます。しかし相関は原因の証明ではありません。工程変更、測定器のずれ、シフト、製品構成、再検ルールなどの交絡があり得ます。
原因候補は、①時間順序が妥当か、②再現試験で変化するか、③別ロット・別シフトでも成り立つか、④物理・工程知識と整合するか、⑤対策後に再発が減ったか、で検証します。AIのランキングを8Dやなぜなぜ分析の結論として自動転記せず、「仮説」「検証中」「確認済み」を分けます。日々の記録を整える際は、工場日報AI自動化の実装ガイドも参照できますが、日報の要約と品質記録の承認・保存要件は同一ではありません。
ゴールデンセットをシフト・製品・不良別に設計する
ゴールデンセットとは、受入判定と回帰テストに使う、承認済みの代表データです。学習データから無作為に一部を切り出すだけでは、同一ロットやほぼ同じ連続画像が学習側と評価側に入り、性能が過大に見えることがあります。
分割単位は個体ではなく漏えいリスクで決める
- 連続撮像なら、同一品・同一サイクルの画像を同じ側にまとめる。
- 材料特性が支配的なら、材料ロット単位で学習・評価を分ける。
- 治具差が大きいなら、キャビティや治具を独立層として残す。
- 季節・温湿度・照明の影響があれば、期間をまたぐ外部評価を置く。
- 新品番へ一般化させたいなら、少なくとも一部の品番を未学習で評価する。
評価結果は全体値だけでなく、品番、不良種、重大度、ライン、設備、シフト、材料供給者、撮像条件、作業者言語などで層別します。ISO/IEC TR 42106:2026の公開概要は、AIシステムの複雑さと利用文脈に応じて品質特性を差別化してベンチマークする考え方を扱っています。品質管理でも「一つの精度」ではなく、利用文脈ごとの合否が必要です。
ラベル品質そのものを測る
熟練検査員同士で限度見本の判定が割れるなら、AIは曖昧さを学習します。ラベル作成では、複数者の一致、不一致の裁定者、裁定理由、判定不能クラス、ラベル定義版を記録します。評価時に人同士の不一致を隠さず、AIの誤りと仕様の曖昧さを分けます。
希少不良を水増しするための画像変換や合成データは、補助として使えても、実品の独立評価を置き換えません。合成データ利用の有無、生成条件、学習内での比率、実品評価への混入防止を記録します。
MSA・トレーサビリティをAIの外側に置かない
入力測定が不安定なら、モデルを再学習しても工程の真実には近づきません。寸法なら校正、分解能、繰返し性・再現性、治具、温度補正を確認します。画像なら照明、焦点、露光、画角、背景、レンズ汚れ、部品姿勢、カメラ交換を測定系の要素として管理します。
MSAの手法と合否は、特性・測定方式・顧客要求に合わせて品質部門が決めます。AIベンダーに一律のGR&R基準を口約束で任せず、現行手順、サンプル、担当者、反復、環境条件、逸脱処置をRFP添付資料にします。
NIST AIMSは、統合された計測、物理モデル、AIを組み合わせ、定期的な検証とモデル更新を行う考え方を示しています。AIの入力を「データだから正しい」と扱うのではなく、計測トレーサビリティ、物理的妥当性、モデルの不確かさを一つの運用に結びます。
追跡可能にすべき版
- 製品図面・顧客仕様・検査標準
- 不良定義・限度見本・ラベル辞書
- センサー、カメラ、照明、レンズ、測定器、校正状態
- データ抽出SQL、前処理、特徴量、学習データのスナップショット
- モデル、閾値、ルール、ソフトウェア、エッジ端末設定
- 人の最終判定、上書き理由、封じ込めと是正処置
この版の組合せを判定ごとに再現できることが、顧客監査や不具合調査でモデル説明より有用な場合があります。
Human-in-the-loop:人の上書きを例外ではなく機能にする
自動化率を上げるために、人の介入を失敗扱いすると、曖昧品が無理にOK/NGへ押し込まれます。品質管理 AIでは、自動合格、自動不合格、人による保留判定の3経路を設計し、特性の重大度とモデルの確信度で許可範囲を分けます。

上書き機能には、少なくとも次の統制が必要です。
- 誰が、いつ、どの権限で変更したか。
- AIの元判定、スコア、表示された根拠は何か。
- 上書き理由を選択式と自由記述で残せるか。
- 重大特性の合格上書きに二者承認が必要か。
- 上書き品をどのロット・出荷へ戻したか。
- 上書き傾向を製品・シフト・担当者別にレビューするか。
- 上書きデータを無条件に再学習へ入れず、ラベル審査するか。
NISTのAI for Manufacturingイニシアチブは、人とAIの協働、用途適合性、解釈可能性、トレーサビリティ、意味の正しさなどの評価を扱っています。現場への説明も「AIを信じてください」ではなく、何を見て、どこまで自動化し、いつ人が止められるかを作業標準にします。
ドリフト監視と変更管理:公開後が本番
導入時に合格したモデルも、材料、設備摩耗、照明、サプライヤー、製品構成、作業方法が変われば性能が変化します。ドリフト監視は、AIスコアの分布だけでなく、入力・工程・結果の3層で行います。
| 層 | 監視例 | 行動例 |
|---|---|---|
| 入力 | 欠損、明るさ、焦点、センサー範囲、カテゴリ比率 | 清掃、再校正、データ停止 |
| 工程 | 設備、レシピ、材料、シフト、タクト、保全後 | 層別レビュー、適用範囲制限 |
| 結果 | 流出、過剰排除、保留、上書き、ラベル不一致 | 閾値見直し、封じ込め、再評価 |
アラート閾値はPoC前に固定せず、ベースラインから決めます。ただし「悪化したら確認する」だけでは足りません。責任者、確認期限、モデルを停止する条件、前版へ戻す条件、顧客通知の要否を定めます。
変更を三段階に分ける
- 軽微変更:画面文言、権限追加など、判定ロジックに影響しない。回帰テスト範囲を限定。
- 影響変更:閾値、照明、カメラ位置、前処理、材料・設備条件。ゴールデンセットで再評価。
- 重大変更:モデル、ラベル定義、対象品番、重要特性、自動合格範囲。品質責任者の承認と受入試験を再実施。
緊急修正にも期限付き承認、旧版バックアップ、影響範囲、事後レビューを要求します。ベンダーのクラウド側でモデルが自動更新されるサービスなら、更新通知、固定版、拒否、ロールバック、変更履歴の提供可否を契約で確認します。
RFPに書くべき12条項
製品機能のチェックリストではなく、証拠と責任を要求します。
- 用途と非用途:対象工程、特性、品番、不良、対象外、禁止する自動判断。
- 損失と重大度:流出・過剰排除・保留の扱い、安全・法令・顧客特性のハードゲート。
- データ権利:原データ、ラベル、学習物、ログ、派生データの所有・持出し・削除。
- 測定系:校正、MSA、撮像条件、機器交換、環境管理、トレーサビリティ。
- 評価設計:独立ゴールデンセット、層別指標、データ漏えい防止、再現可能な評価コード。
- 人の判断:保留、上書き、二者承認、理由、教育、タイ語・英語・日本語表示。
- 統合:PLC、MES、QMS、ERP、シリアル、時刻、オフライン時の動作、重複防止。
- セキュリティ:ネットワーク境界、個人ID、監査ログ、脆弱性、パッチ、遠隔支援。
- ドリフト:監視項目、アラート、レビュー、停止、再学習、再受入、ロールバック。
- 運用SLA:タイ現地支援、夜勤、障害一次切分け、交換品、保守終了日。
- 受入と支払:デモではなく合意データ・実ライン・異常シナリオのゲート連動。
- 終了設計:モデル・設定・履歴の輸出、接続解除、アカウント削除、移行支援。
価格比較では、ライセンスだけでなく、撮像・測定機器、ラベル作成、MES/QMS接続、再検能力、教育、モデル監視、変更、再受入、現地保守を含むTCO項目を同じ表で比較します。期間や金額を業界標準として決めず、自社の保守計画と契約期間に合わせます。
90日PoC:三つのゲートで投資判断する
次は推奨例であり、成果保証や標準日程ではありません。対象は1ライン、2製品群、3シフト、選定した各不良クラス30~50サンプルなどから始められますが、実際の件数は発生頻度、重大度、統計的検出力、顧客要求に基づいて決めます。希少重大不良を人工的に作れない場合は、限度見本、過去品、工程シミュレーション、従来検査との並行運用を組み合わせます。
| 期間 | 主作業 | ゲート |
|---|---|---|
| 1~30日 | 現状観察、データ契約、MSA、ラベル裁定、損失定義、ゴールデンセット凍結 | G1「測れる」:追跡・測定・正解定義が監査可能 |
| 31~60日 | ベースライン、モデル/ルール構築、影運転、シフト別評価、UI・保留・上書き | G2「判断できる」:層別した流出/過剰排除が許容範囲 |
| 61~90日 | 実ライン並行運用、異常試験、ドリフト、復旧、教育、TCO・展開計画 | G3「運用できる」:安全に止め、戻し、説明し、維持できる |

G1:データ・測定ゲート
- 対象個体が材料、工程、測定、最終判定へ一意に追跡できる。
- MSA・校正・撮像条件が承認され、測定逸脱時の処置がある。
- 不良定義と裁定ルールが版管理され、判定不能を隠していない。
- 学習・調整・ゴールデンセットが分離され、漏えい検査を通る。
- 重大不良を含む評価不足が明示され、推測で合格にしていない。
G2:モデル・業務ゲート
- 品番、不良、重大度、設備、材料、シフト別に混同行列を提示する。
- 流出、過剰排除、保留能力が承認済み損失・リスク内に入る。
- 現行検査との比較条件が同じで、都合のよい期間だけを選ばない。
- 人の保留・上書き・二者承認・監査ログが実際の端末で動く。
- タイ語・英語・日本語の欠陥名と作業指示が現場で誤解されない。
G3:運用・契約ゲート
- カメラ汚れ、照明劣化、ネットワーク断、時刻ずれ、MES停止を試験する。
- AI停止時に既存検査または安全な代替へ戻れ、未判定品を隔離できる。
- ドリフト検知から責任者通知、停止、再評価、復帰まで演習する。
- モデル・閾値・ラベル・設備変更の承認とロールバックを実演する。
- データ輸出、バックアップ復旧、契約終了時の接続解除を確認する。
- 残課題、追加費用、量産展開条件を承認し、Go/No-Goを記録する。
支払マイルストーンをG1/G2/G3の証拠承認に連動させると、「デモは動いたが運用できない」状態を減らせます。各ゲートには、合格、条件付き合格、不合格、再試験の定義と承認者を置きます。
FAT/SATで試すべき異常シナリオ
| ID | シナリオ | 合格証拠 |
|---|---|---|
| T01 | 同一画像・同一シリアルを再送 | 二重判定・二重隔離せず履歴に残る |
| T02 | MESから品番が遅延・欠落 | 自動合格せず保留し、復旧後に整合する |
| T03 | 照明を段階的に暗くする | 入力ドリフトを検知し、定めた範囲で停止する |
| T04 | カメラ交換・焦点変更 | 変更承認と再評価なしに量産復帰しない |
| T05 | 夜勤で希少不良を投入 | 正しい言語・担当者・エスカレーションで処理する |
| T06 | AIと検査員が不一致 | 保留・裁定・理由・最終判定が追跡できる |
| T07 | 重大不良を低確信で検出 | 閾値だけで合格させずハードゲートが働く |
| T08 | ネットワーク断中に連続生産 | 安全な代替検査、バッファ、順序、重複防止が働く |
| T09 | 材料ロット・レシピを変更 | 適用範囲外を認識し、層別監視を開始する |
| T10 | モデル更新後に旧データ再生 | ゴールデンセット回帰と旧版復帰を実演できる |
| T11 | 権限のない人がOKへ上書き | 拒否され、試行が監査ログに残る |
| T12 | 契約終了を模擬 | 設定・履歴・ラベルを利用可能な形式で輸出できる |
数秒、何%といった共通の合格値はありません。測定点、サンプル、信頼区間の扱い、外部サービス時間、再試験条件を自社仕様に置き換えます。
よくある失敗と回避策
PoC用のきれいなデータだけで評価する
本番には汚れ、欠損、旧設備、夜勤、切替、再加工があります。現場観察から異常条件を収集し、評価セットとSATへ入れます。
全体精度だけでベンダーを選ぶ
大量の良品が希少不良を隠します。重大度、不良種、品番、シフト別の流出・過剰排除・保留を比較します。
AIが原因を確定したと誤解する
AIは候補順位を出せても、原因の証明には工程知識と再現検証が必要です。仮説と確認済み原因を状態で分けます。
検査員の上書きを隠す
上書きを監査対象かつ改善材料にします。ただし無審査で再学習へ戻すと、誤った習慣を学ぶためラベル審査を通します。
再学習を保守作業として自動化しすぎる
再学習は判定ロジックの変更です。データ範囲、性能差、リスク、承認、回帰試験、ロールバックを変更管理します。
AI停止時の品質保証を設計しない
ネットワークやモデルが止まっても生産は続く可能性があります。既存検査へ戻す、全品保留にする、対象工程を止めるなど、重大度に応じた代替を決めます。
FAQ:品質管理 AI・異常検知 AIの実務
AI 品質管理とは何ですか?
検査画像や製造データを使って良否判定、異常候補、原因仮説、傾向を支援する仕組みです。ただし実務では、測定、トレーサビリティ、人の承認、封じ込め、是正、ドリフト監視、変更管理まで含む閉ループとして設計します。
品質管理 AIは目視検査をすべて置き換えられますか?
一律には置き換えられません。自動合格・自動不合格・保留の範囲を不良重大度、評価データ、測定系、顧客要求から決めます。初期は影運転や並行検査で流出と過剰排除を測ります。
不良 原因分析 AIは原因を自動で特定できますか?
相関の強い条件や候補順位は提示できますが、原因確定には時間順序、物理的妥当性、再現試験、対策後の確認が必要です。AI出力は仮説として管理し、品質責任者が証拠を承認します。
異常検知 AIと不良分類AIの違いは何ですか?
異常検知は正常パターンから外れた入力を見つけるのに向き、未知不良の入口になり得ます。不良分類は既知の種類を分け、処置へつなげやすい手法です。両方とも閾値、保留、人の裁定、独立評価が必要です。
製造データ 分析はどこから始めますか?
最初に意思決定を一つ選び、個体ID、時刻、品番版、設備、材料、不良定義、最終判定をデータ契約にします。大量に集める前に、追跡とラベルが再現できるかを確認します。
PoCで最低何件の不良データが必要ですか?
共通の最低件数はありません。不良の希少性、重大度、層別数、期待する誤差、検出力で決めます。本稿の30~50件は計画説明の仮想例であり、受入保証値ではありません。不足する重大不良は「未評価」と明示します。
ベンダー比較で最も重要な質問は何ですか?
「精度はいくつか」より、「どの独立データで、どの品番・不良・シフト別に、流出と過剰排除をどう測り、変化後にどう止めて戻せるか」を尋ねます。生データ、ログ、モデル版、終了時の輸出も確認します。
タイ工場で特に確認することはありますか?
タイ語・英語・日本語の不良名と作業指示、ICT/UTC、夜勤・休日、現地支援、材料サプライヤー、温湿度や照明変化、顧客別仕様を層別します。BOIの投資動向は技術導入の追い風を示しますが、自社PoCのROI証拠には置き換えません。
まとめ:AI 品質管理の合否は閉ループで決める
AI 品質管理の価値は、モデルの正解率そのものではありません。流出と過剰排除の損失を定義し、測定とラベルを信頼できる状態にし、品番・不良・設備・材料・シフト別のゴールデンセットで評価し、人が安全に保留・上書きできること。そして、ドリフトや変更を検知し、停止・再評価・ロールバックを含めて品質保証を継続できることです。90日PoCを「測れる」「判断できる」「運用できる」の三ゲートに分け、RFPと支払条件を証拠に連動させれば、デモの成功と量産の成功を混同せずに投資判断できます。
TOMAS TECHでは、現行検査・MES/QMS・測定データの棚卸し、データ契約、90日PoC、RFP、FAT/SAT受入条件の整理を支援できます。製品やベンダーを決める前の「何を測り、どこで合格とするか」という検討段階でも、お問い合わせいただけます。
参照した一次情報
- NIST, 2026 Roadmap on Artificial Intelligence and Machine Learning for Smart Manufacturing(2026年7月3日公開)
- NIST, Artificial Intelligence (AI) for Manufacturing(人とAIの協働、用途適合性、トレーサビリティ、相互運用性)
- ISO, ISO/IEC TR 42106:2026(公開メタデータ・概要のみ参照)
- BOI/OSOS, Thailand AI and Tech Inflows Surge as Country Prepares National Chip Strategy(2026年8月27日)
- BOI, บีโอไอเร่งสร้างระบบนิเวศ AI – อิเล็กทรอนิกส์(タイ語発表、topic 139206)
- NIST, Augmented Intelligence for Manufacturing Systems (AIMS)(計測・物理モデル・AI、定期検証と更新)