もう少し詳しく

正確さだけでなく、必要な項目を満たすか、安全に動くか、時間や費用が許容範囲かなどを調べます。実際の利用場面に近い課題を用意することが大切です。

AIの評価は、モデルの能力を一つの順位で決めるのではなく、利用目的に対する合否を判断するために行います。代表例と失敗しやすい例を含む評価セットを固定し、プロンプトやモデルを変更するたびに品質・安全性・費用・速度の変化を記録します。

HISTORY

開発された年代と歴史

この用語を大きな流れで見ると、1950年代〜現在に発展してきました。

  1. 1950Alan Turingが機械の知的振る舞いを考えるテストを提案。
  2. 2010年代GLUEなど共通ベンチマークがモデル比較を促進。
  3. 2022〜HELM、実運用評価、安全性評価など、多面的な測定へ広がった。

キーマン・関わった研究者

Alan Turing、ニューヨーク大学・Stanford CRFMの評価研究者

技術の変遷

人手の印象 → ベンチマーク → タスク・安全性・運用を含む評価

理解のポイント

  • 利用場面に近い課題を用意し、正確さ・必要項目・処理時間・費用など目的に合う基準で測ります。
  • モデルの一般的なスコアが高くても、自分の業務で必要な品質を満たすとは限りません。
  • 変更前後を同じ条件で比べ、平均点だけでなく重大な誤りが起きるケースにも注目します。
FOR EXAMPLE

たとえば、こんな場面で

問い合わせ例を用意して、正しい案内ができた割合と、判断できないときに確認を求めた割合を測ります。

覚えておきたいこと

一つのスコアだけで、すべての用途に向いているとは判断できません。