もう少し詳しく

2017年の論文で提案された構造です。文章の中の離れた位置にある情報も関連づけて処理でき、多くの言語モデルの基盤になっています。

FOR EXAMPLE

たとえば、こんな場面で

「その本は面白かった」という文を処理するとき、別の文で出てきた本の情報との関係を扱います。

覚えておきたいこと

Transformerという構造だけで、学習データや性能が決まるわけではありません。

参考資料

Attention Is All You Need(原論文)