もう少し詳しく

2017年の論文で提案された構造です。文章の中の離れた位置にある情報も関連づけて処理でき、多くの言語モデルの基盤になっています。

Transformerは、系列を順番に処理する方式だけでは長距離の関係を扱いにくいという課題を背景に提案されました。Attentionと並列計算を組み合わせ、事前学習・追加学習・推論を分けて設計できることが、現在の言語モデルやマルチモーダルモデルへ広がった理由です。

HISTORY

開発された年代と歴史

この用語を大きな流れで見ると、2017年〜に発展してきました。

  1. 2017Google Brainなどの8名が「Attention Is All You Need」を発表。
  2. 2018〜BERT、GPTなどがTransformerを大規模言語モデルへ応用。
  3. 2020年代画像、音声、動画、タンパク質などにも広がった。

キーマン・関わった研究者

Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Aidan Gomezほか

技術の変遷

RNN・CNNの系列処理 → Self-Attention → 大規模・マルチモーダル基盤モデル

理解のポイント

  • Attentionによって、入力のどの部分をどの程度参照するかを扱い、離れた語の関係も表現します。
  • Transformerはモデルの構造を指す言葉です。LLMは言語を扱うモデルの呼び名で、同じ分類ではありません。
  • 同じ構造を使っていても、学習データや調整方法によって得意分野と回答品質は変わります。
FOR EXAMPLE

たとえば、こんな場面で

「その本は面白かった」という文を処理するとき、別の文で出てきた本の情報との関係を扱います。

覚えておきたいこと

Transformerという構造だけで、学習データや性能が決まるわけではありません。

参考資料

Attention Is All You Need(原論文) Attention Is All You Need(NeurIPS 2017)