マルチモーダルAI
マルチモーダルAIとは、テキスト、画像、音声、動画など、複数種類の情報を入力または出力として扱うAIです。
モダリティとは
モダリティは情報の種類や表現形式を指します。テキストだけを扱うモデルは単一モダリティ、画像と文章を同時に扱うモデルはマルチモーダルです。入力が複数でも出力は文章だけ、または文章から画像と音声を作るなど組合せはさまざまです。
業務での組合せ
| 入力 | 出力 | 業務例 |
|---|---|---|
| 請求書画像+指示文 | 項目一覧 | 日付、金額、取引先の抽出候補を作る |
| 会議音声+資料 | 議事録 | 発言と議題を対応付けて要約する |
| 現場写真+点検基準 | 確認候補 | 破損や表示漏れの候補を抽出する |
| 説明文+商品画像 | 代替テキスト | 画像内容を説明する文章案を作る |
OCRや音声認識との違い
OCRは画像内の文字をテキストへ変換し、音声認識は音声を文字に変換することが中心です。マルチモーダルAIは変換した内容だけでなく、画像の配置、周囲の文章、会話の流れなど複数の情報を組み合わせて推論・生成します。ただし、専用OCRの方が帳票項目を安定して読める場合もあります。
評価を形式ごとに分ける
- 画像: 小さい文字、表、回転、低解像度でも読めるか
- 音声: 話者、固有名詞、雑音、同時発話を扱えるか
- 動画: 必要な時間帯や動作を見落とさないか
- 出力: 元の情報と推測を区別できるか
ファイルを渡す前の確認
画像の背景に写った名札、ホワイトボード、位置情報、音声に含まれる第三者の発言など、利用者が意識していない情報も入力されます。個人情報、営業秘密、著作物、録音・撮影への同意、サービス側の保存設定を確認します。
視覚障害者向けの代替テキストなどに使う場合も、AI出力だけに任せず、伝えるべき目的と内容が含まれているか人が確認します。
参考情報
最終確認日: 2026年7月22日
スポンサーリンク