もう少し詳しく

言語モデルなどの土台を作る段階です。文章やその他のデータを使い、後のさまざまな課題に利用できる表現を学習します。

事前学習は、個別の課題の正解を覚えさせる前に、言語やデータの一般的な規則性を学ばせる段階です。データの収集・重複除去・品質管理・計算資源の選択が、後のモデルの知識や偏り、学習コストに影響します。

HISTORY

開発された年代と歴史

この用語を大きな流れで見ると、2010年代〜に発展してきました。

  1. 2013word2vecが大量テキストから語の表現を学ぶ流れを広げた。
  2. 2018ELMoとBERTが、下流タスクの前に言語表現を学ぶ事前学習を定着させた。
  3. 2020年代Webなどの大量データで基盤モデルを作り、後から用途に合わせて調整する方式が主流になった。

キーマン・関わった研究者

Tomas Mikolov、Matthew Peters、Jacob Devlin、基盤モデル研究者

技術の変遷

タスク別学習 → 自己教師あり事前学習 → 基盤モデル+後段調整

理解のポイント

  • 幅広いデータから基礎的な表現を学び、後のさまざまな用途に使うモデルの土台を作ります。
  • 特定業務向けに調整する追加学習と、基礎を作る事前学習では学習の目的が異なります。
  • 事前学習のデータ構成によって扱える知識や偏りが変わり、あらゆる分野を網羅するわけではありません。
FOR EXAMPLE

たとえば、こんな場面で

幅広い文章から学んだ言語モデルを、後から問い合わせ対応向けに調整します。

覚えておきたいこと

学習対象はインターネットの文章だけとは限らず、モデルによってデータの構成が異なります。