約2分

文章だけでは扱えない情報を読む、マルチモーダルAI

マルチモーダルは、文章だけでなく画像や音声など複数の情報をまとめて扱える AI の性質です。

請求書の画像、会議の録音、製品の写真、画面のキャプチャ。仕事の情報は、いつも文章の形で届くとは限りません。

マルチモーダルは、AI が文字だけでなく、画像や音声、場合によっては動画もまとめて受け取って扱える性質です。証言だけでなく、写真や録音やメモを机に並べて全体像をつかむ探偵のように、形式の違う手がかりを一度に見られます。

  • 写真を見せて、不具合報告の下書きを作る
  • 会議の音声を文字にして、要点をまとめる
  • 画面のキャプチャから、操作マニュアルの案を作る
  • 書類の画像から必要な項目を拾って、確認作業を進める

仕事の入口を広げやすいのが、この性質の強みです。

「読めた」と「分かった」は違う

画像や音声を受け取れても、中身を正しく理解しているとは限りません。画質が粗い、録音が聞き取りにくい、撮影の角度が悪い。そうした条件で、読み取りの精度は大きく落ちます。

画像が読めるからといって、図表の意味や現場の事情まで理解しているとも限りません。何を見てそう判断したのかを説明しにくい場面もあります。書類の文字と見た目の情報が食い違うときは、人が判断します。契約書、医療画像、設備点検のように判断の重い仕事では、下書きの補助として使い、原資料と人の確認を外さない運用が向いています。

扱える形式が増えれば扱うデータも増える

入力の幅が広がるぶん、AI に渡るデータの種類も増えます。写真に写り込んだ人の顔、録音に入った個人名、画面キャプチャの端に映った顧客情報。文章だけを扱っていたときより、渡す前に確かめることが増えます。

個人情報や機密情報、著作権、保存される範囲。何をどこまで入れてよいかを、使い始める前に決めておきましょう。