もう少し詳しく

高性能なモデルが作った回答などを学習材料に使います。大きなモデルから小さなモデルに能力を移す目的で利用されることがあります。

蒸留は、大きなモデルの推論コストやメモリ使用量を下げながら、特定の能力を小さなモデルで再現したいという背景で使われます。教師の確率分布や回答例を学習材料にできますが、対象タスクと端末環境に合わせて速度・サイズ・精度を測定します。

HISTORY

開発された年代と歴史

この用語を大きな流れで見ると、2015年〜に発展してきました。

  1. 2015Hinton、Vinyals、Deanが、教師モデルの「暗黙の知識」を小さなモデルへ移す知識蒸留を整理した。
  2. 2018〜BERTなどの圧縮・高速化へ応用。
  3. 2020年代小型LLM、エッジ推論、費用削減の方法として使われる。

キーマン・関わった研究者

Geoffrey Hinton、Oriol Vinyals、Jeff Dean

技術の変遷

大規模教師 → 知識蒸留 → 小型・高速モデル

理解のポイント

  • 教師モデルの出力や振る舞いを学習材料にして、別のモデルへ能力を移します。
  • 小さいモデルで必要な仕事をこなせれば、用途に応じて計算量と品質の釣り合いを取りやすくなります。
  • 教師の能力が丸ごと移るわけではありません。引き継ぎたい課題で実際に評価します。
FOR EXAMPLE

たとえば、こんな場面で

大きなモデルで作った分類の見本を使い、端末で動かしやすい小さなモデルを学習させます。

覚えておきたいこと

教師と同じ能力がすべて移るわけではなく、用途ごとの評価が必要です。