この用語の意味
偽陽性は、実際には対象でないものを「対象あり」と判定する誤りです。偽陰性は、実際には対象なのに「対象なし」と判定する誤りです。つまり誤検知と見逃しという二種類の間違いを区別する言葉です。AIだけでなく、検査やルールに基づく判定にも使います。
ここでの「陽性」は良い結果という意味ではありません。「不良品を探す」なら不良あり、「重要メールを探す」なら重要であることが陽性です。何を対象として検出するのかを決めてから、誤りを数える必要があります。
何ができるか
全体の正解率だけでは見えない失敗を把握できます。架空の検品で不良品が100個中2個しかなければ、全部を良品と判定しても正解率は98%です。しかし不良品はすべて見逃しています。品質管理では、何件正しかったかだけでなく、何を間違えたかが重要です。
偽陽性が増えると再検査や問い合わせが増え、偽陰性が増えると不良の流出や対応漏れにつながります。どちらの影響が大きいかを業務担当者が判断し、AIの判定基準や、人が再確認する範囲を決める材料になります。
実際に使うために必要なもの
AIの予測結果と、それとは別に確認した正解が必要です。実際に不良だったかの確認が曖昧なら、誤りの集計も信用できません。評価対象、正解を付けた方法、対象期間、判定のしきい値をそろえます。判定スコアを出す製品では、しきい値の変更可否も確認します。
費用はツールの料金だけではなく、正解確認、誤検知の再点検、見逃しによる再対応などを含みます。1日何件の警告なら担当者が確認できるかも導入条件です。件数と負担の対応を測らずに警告を増やすと、本当に必要な警告も見落としやすくなります。
特定企業が開発した製品名ではなく、分類評価の基本概念です。Googleの機械学習教材などで定義と計算方法を確認できます。医療などでは用途ごとに検証や判断の条件が異なるため、一般的な業務例の基準をそのまま転用しません。
小さく試す運用例
次は架空の部品100個を判定した例です。実際の不良品は20個、良品は80個とします。不良を正しく検出した16個を真陽性、不良を良品とした4個を偽陰性と呼びます。良品を不良とした8個が偽陽性、良品を正しく判定した72個が真陰性です。
| 実際の状態 | 不良と判定 | 良品と判定 | 合計 |
|---|---|---|---|
| 実際に不良 | 16個(真陽性) | 4個(偽陰性・見逃し) | 20個 |
| 実際に良品 | 8個(偽陽性・誤検知) | 72個(真陰性) | 80個 |
この例の正解率は(16+72)÷100=88%です。不良品の見逃し率は4÷20=20%、良品の誤検知率は8÷80=10%となります。分母が異なるため、単に「誤りは何%」と書かず、何に対する割合かを明記します。
さらに、検出した不良候補24個のうち本当に不良だった割合(適合率)は16÷24≒66.7%、実際の不良20個を見つけた割合(再現率)は16÷20=80%です。「警告の信頼性」と「対象の拾い上げ方」を別々に確認できます。
試行では既存の検品と並行して判定し、実際の出荷判断を変えずに集計します。複数のしきい値で誤りの件数と再検査時間を比較し、「見逃しを従来より増やさず、再検査が担当者の処理能力内に収まる」などを採用条件にします。上記の数値は説明用で、合格水準ではありません。
人が確認すること・注意点
同じモデルのしきい値を下げて陽性と判定しやすくすると、見逃しが減る一方、誤検知が増える方向に動きます。しきい値だけですべてを解決できるとは限らず、撮影条件、データ、分類方法を改善する必要もあります。
不良が少ない現場では、誤検知率が低くても警告の多くが良品になる場合があります。試験用に不良例を増やしたデータの適合率を、そのまま本番へ当てはめないようにします。日々の対象割合と、製品・時期ごとの誤りを記録します。
評価で見逃しが0件でも、将来の見逃しがない証明にはなりません。件数が少ない試行では偶然の影響が大きくなります。陰性とされたものも抜き取り確認し、現場で判明した見逃しを評価へ戻す仕組みを用意します。
関連する事例・テンプレート
試験結果の過大評価を避けるにはデータリーケージ、継続的な監視にはMLOpsを参照してください。記録表では「実際の状態/予測/しきい値/再確認時間/誤りの影響」を一件ごとに残します。
参考情報
- Google:Thresholds and the confusion matrix(確認日:2026-09-26)
- Google:Accuracy, recall, precision, and related metrics(確認日:2026-09-26)
関連する用語・実践記事
- Gmailの重要メールをAIで自動判定し、緊急メールだけ通知する:誤通知と緊急メールの見逃しを考える。