マルチモーダルAI

マルチモーダルAIとは、テキスト、画像、音声、動画など、複数種類の情報を入力または出力として扱うAIです。

モダリティとは

モダリティは情報の種類や表現形式を指します。テキストだけを扱うモデルは単一モダリティ、画像と文章を同時に扱うモデルはマルチモーダルです。入力が複数でも出力は文章だけ、または文章から画像と音声を作るなど組合せはさまざまです。

業務での組合せ

入力出力業務例
請求書画像+指示文項目一覧日付、金額、取引先の抽出候補を作る
会議音声+資料議事録発言と議題を対応付けて要約する
現場写真+点検基準確認候補破損や表示漏れの候補を抽出する
説明文+商品画像代替テキスト画像内容を説明する文章案を作る

OCRや音声認識との違い

OCRは画像内の文字をテキストへ変換し、音声認識は音声を文字に変換することが中心です。マルチモーダルAIは変換した内容だけでなく、画像の配置、周囲の文章、会話の流れなど複数の情報を組み合わせて推論・生成します。ただし、専用OCRの方が帳票項目を安定して読める場合もあります。

評価を形式ごとに分ける

  • 画像: 小さい文字、表、回転、低解像度でも読めるか
  • 音声: 話者、固有名詞、雑音、同時発話を扱えるか
  • 動画: 必要な時間帯や動作を見落とさないか
  • 出力: 元の情報と推測を区別できるか

ファイルを渡す前の確認

画像の背景に写った名札、ホワイトボード、位置情報、音声に含まれる第三者の発言など、利用者が意識していない情報も入力されます。個人情報、営業秘密、著作物、録音・撮影への同意、サービス側の保存設定を確認します。

視覚障害者向けの代替テキストなどに使う場合も、AI出力だけに任せず、伝えるべき目的と内容が含まれているか人が確認します。

参考情報

最終確認日: 2026年7月22日

スポンサーリンク