この用語の意味
マルチモーダルAIは、文章、画像、音声、動画など、複数種類の情報を扱うAIです。「モダリティ」は情報の種類を指します。例えば写真と質問文を一緒に入力し、写っている状況を文章で説明させる使い方があります。
すべての製品が全形式を入力・出力できるわけではありません。画像を読んで文章を返すモデル、音声を扱うモデルなどで対応範囲が異なります。また、画像から文字を取り出すOCRと、写った物や関係を解釈する処理は区別します。複数の情報を使えることと、細かな文字や数量を正確に読み取れることは別です。
何ができるか
架空の店舗で、売場写真と点検項目を入力して「通路にはみ出した展示物の候補」を文章で整理する場面が考えられます。文章だけでは説明しにくい配置を写真で伝え、点検担当者が確認すべき場所を絞る用途です。
ほかに、図表付き資料の要点整理、製品写真についての質問、音声と資料を使う会議の整理などがあります。ただし、モデルが対応する形式と容量の範囲内での利用です。写真だけでは寸法や死角を確定できず、会議音声から発言者を必ず正しく特定できるわけでもありません。
実際に使うために必要なもの
対象形式に対応したアプリまたはAPI、撮影・録音機器、確認したい項目、正解を確認する担当者が必要です。画像なら全体像と細部が分かる解像度、音声なら聞き取れる録音環境を整えます。写真と説明が別の対象を指していないか、取得日時や対象IDもそろえます。
費用にはアプリ料金、画像枚数・解像度・音声時間などに応じた処理料金、通信、保管、撮影し直しと人の確認時間が含まれます。大量の高解像度画像を渡せば、費用と待ち時間が増える場合があります。必要な範囲だけ撮り、用途に足りる品質を見極めます。
一般概念なので単一の開発元や統一製品規格はありません。Google等の各提供元の仕様で入力形式、ファイル容量、動画・音声の扱い、日本語の対応、保存条件を確認します。人物の顔、伝票、端末画面などが写る場合は、撮影と利用の許可を確認し、不要部分を除外します。
小さく試す運用例
実在顧客が写らない模擬売場で20枚の写真を用意します。通路の障害物あり・なしに加え、暗い写真、一部が隠れた写真も含めます。担当者が先に確認箇所と見える事実を記録し、AIへは「見える根拠と場所を示し、判定できないものは不明とする」と指示します。
人だけで点検した場合と比較し、見逃し、存在しない障害物の指摘、確認に要した時間を数えます。例として「重要な障害物の見逃しが増えない」「確認時間が短くなる」「不明な画像を人へ回せる」を採用条件にします。模擬写真での結果は本番の安全性を証明するものではありません。
暗い画像で失敗するなら、指示文だけを変え続けず、照明や撮影位置を改善して再評価します。最初は点検結果の下書きに限定し、改善が確認できても、通路の安全確認や現場への指示は担当者が行います。
人が確認すること・注意点
AIは画像内の小さな文字、細かい個数、距離、位置関係を誤ることがあります。画像に写っていない原因や、見えない裏側まで推測した説明は事実として扱いません。読み取った数値をそのまま発注・支払い・設備操作へつなげず、元資料や実物で照合します。
画像内の文章にも注意が必要です。資料に「前の指示を無視する」などの記述が含まれていても、業務を動かす指示として受け入れない設計にします。結果の確認者は、回答が写真に基づくのか、一般知識による推測なのかを分けて確認します。
運用中は、季節、照明、機材、撮影担当者の変化によって結果が変わらないかを調べます。撮影時の同意や保存期限も管理し、品質不足なら人による通常点検へ戻します。複数形式を組み合わせたことで、一方の入力の誤りが他方に隠れていないかも確認します。
関連する事例・テンプレート
見逃しと過剰な指摘の評価は偽陽性・偽陰性、試行の進め方はPoC(概念実証)を参照してください。点検記録には「写真ID/人の確認結果/AIの指摘/根拠箇所/不明点/確認時間」を残します。
参考情報
- Google Cloud:Multimodal AI(確認日:2026-09-26)
- Google:Image understanding(確認日:2026-09-26)
関連する用語・実践記事
- OpenAI APIで作る音声対応チャットボット――契約から実装まで:音声と文字を組み合わせる実務例を確認する。