マルチモーダルとは
Multimodal
画像認識AI
音声認識AI
文章だけでなく、画像・音声・動画も一緒に扱えるAIの性質です。写真を見せて質問したり、会議の録音から議事録を作ったりできます。
初期の生成AIは文章だけを扱っていました。いまは画像を読み取れるモデルが主流で、音声を扱えるものも増えています。一方、動画をそのまま理解できるモデルはまだ限られます。どこまで扱えるかはモデルごとに違うため、使う前に対応範囲を確認してください。
実務では、この違いが大きく効きます。手書きのメモを撮影して文字に起こす、グラフの画像から数値を読み取る、会議の録音から決定事項を抜き出す——いずれも入力の手間がなくなります。
実務での使いどころ
紙・写真・録音といった「これまでAIに渡せなかったもの」を棚卸しすると、手つかずの効率化の余地が見つかります。