もう少し詳しく
正確さだけでなく、必要な項目を満たすか、安全に動くか、時間や費用が許容範囲かなどを調べます。実際の利用場面に近い課題を用意することが大切です。
AIの評価は、モデルの能力を一つの順位で決めるのではなく、利用目的に対する合否を判断するために行います。代表例と失敗しやすい例を含む評価セットを固定し、プロンプトやモデルを変更するたびに品質・安全性・費用・速度の変化を記録します。
HISTORY
開発された年代と歴史
この用語を大きな流れで見ると、1950年代〜現在に発展してきました。
- 1950Alan Turingが機械の知的振る舞いを考えるテストを提案。
- 2010年代GLUEなど共通ベンチマークがモデル比較を促進。
- 2022〜HELM、実運用評価、安全性評価など、多面的な測定へ広がった。
キーマン・関わった研究者
Alan Turing、ニューヨーク大学・Stanford CRFMの評価研究者
技術の変遷
人手の印象 → ベンチマーク → タスク・安全性・運用を含む評価
理解のポイント
- 利用場面に近い課題を用意し、正確さ・必要項目・処理時間・費用など目的に合う基準で測ります。
- モデルの一般的なスコアが高くても、自分の業務で必要な品質を満たすとは限りません。
- 変更前後を同じ条件で比べ、平均点だけでなく重大な誤りが起きるケースにも注目します。
たとえば、こんな場面で
問い合わせ例を用意して、正しい案内ができた割合と、判断できないときに確認を求めた割合を測ります。
覚えておきたいこと
一つのスコアだけで、すべての用途に向いているとは判断できません。