もう少し詳しく

文章中の関係やパターンを学習し、文脈に合う出力を生成します。文章生成型のLLMは、基本的に次に続くトークンを予測しながら文章を作ります。

LLMは、文章の続きや欠けた部分を予測する学習を大規模に行うことで、翻訳や要約など複数の言語課題に応用できる表現を獲得します。利用時の品質はモデルの規模だけでなく、トークン化、文脈の与え方、追加学習、出力の評価にも左右されます。

HISTORY

開発された年代と歴史

この用語を大きな流れで見ると、2017年〜に発展してきました。

  1. 2017Transformerが長い依存関係を並列に扱う設計として発表された。
  2. 2018BERTやGPTの登場で、事前学習した言語モデルを多用途に使う流れが強まる。
  3. 2020年代大規模化、指示調整、ツール利用によって対話・開発へ広がった。

キーマン・関わった研究者

Ashish Vaswani、Noam Shazeer、Jacob Devlin、OpenAI・Google・Anthropicの研究者

技術の変遷

統計言語モデル → 事前学習モデル → 指示追従型の基盤モデル

理解のポイント

  • 文章生成型のLLMは、文脈に応じて次のトークンを予測する処理を重ね、回答を作ります。
  • モデルそのものと、検索やファイル操作を組み合わせたサービス全体は区別します。
  • 質問に答えられても最新情報を参照したとは限りません。必要な資料が入力や検索で渡されているかを確認します。
FOR EXAMPLE

たとえば、こんな場面で

長い議事録から決定事項を抜き出したり、文章を別の言語に翻訳したりします。

覚えておきたいこと

LLMが単体で常にインターネットを検索しているわけではありません。検索機能の有無はサービスによります。

参考資料

Attention Is All You Need(NeurIPS 2017)