もう少し詳しく
テキストだけでなく、画像や音声などを入力や出力に利用します。扱える組み合わせはモデルによって異なり、画像を読めることと画像を作れることは別の能力です。
異なるモダリティを一つの処理で扱う背景には、現実の仕事が文章だけで完結しないという事情があります。画像の領域、音声の時間、テキストの語順などを対応づける処理が必要で、入力の品質や対応形式を確認して利用します。
HISTORY
開発された年代と歴史
この用語を大きな流れで見ると、1990年代〜に発展してきました。
- 1990年代画像・音声・文章を横断するマルチメディア検索の研究が進んだ。
- 2021CLIPが画像と文章を同じ表現空間で扱う方法を示した。
- 2023〜Geminiなど、複数の入力形式を最初から扱う基盤モデルが登場。
キーマン・関わった研究者
Alec Radford、Google DeepMindのGemini研究者、マルチメディア研究者
技術の変遷
単一メディア → 複数モデルの連携 → 統合されたマルチモーダル基盤モデル
理解のポイント
- 文章と画像、文章と音声など、異なる種類の情報を組み合わせて扱う考え方です。
- 画像を読み取れるモデルが、画像を生成できるとは限りません。入力と出力の能力を分けて確認します。
- 写真について質問するときは、画像そのものに加えて何を読み取ってほしいかも伝えます。
たとえば、こんな場面で
商品の写真を見せながら、写っている部品の名前を文章で説明してもらいます。
覚えておきたいこと
対応する入力形式・出力形式を確認して使う必要があります。