もう少し詳しく

学習時の成績が良くても、未知のデータでは精度が出ない状態です。学習用とは別のデータで評価することが、発見の手がかりになります。

過学習は、モデルが課題の一般的な規則ではなく、学習データ固有の偶然やノイズまで覚えた状態です。交差検証、正則化、データ拡張、早期終了などを組み合わせ、実運用に近いデータで性能が保たれるかを確かめます。

HISTORY

開発された年代と歴史

この用語を大きな流れで見ると、1950年代〜に発展してきました。

  1. 1950〜60年代統計モデルが訓練データに合わせすぎる問題が認識された。
  2. 1990年代統計的学習理論と正則化が、汎化性能を考える共通の枠組みになった。
  3. 2010年代〜大規模モデルでもデータ分割、正則化、評価セットが不可欠になった。

キーマン・関わった研究者

Vladimir Vapnik、Corinna Cortes、機械学習評価研究者

技術の変遷

訓練データへの適合 → 正則化・検証 → 大規模モデルの汎化管理

理解のポイント

  • 学習データでの成績は良いのに、未知のデータで成績が落ちるという差に注目します。
  • 学習用と評価用のデータを分け、覚えた例への対応と新しい例への対応を区別します。
  • 学習を長く続けること自体を目標にせず、未知のデータでの改善が続いているかを確かめます。
FOR EXAMPLE

たとえば、こんな場面で

過去の顧客データでは高精度なのに、新しい顧客の予測では誤りが増えます。

覚えておきたいこと

学習の回数を増やせば、いつでも性能が良くなるわけではありません。