AI はそれらしい答えを返すので、感覚だけで「良くなった」と判断しやすくなります。評価は、AI の出力や運用が目的に合っているかを、決めた基準で確かめる工程です。新人に仕事を任せる前に、感覚ではなく採点表と実技で「任せてよいか」を確かめるのと同じです。
新しい LLM への切り替え、ファインチューニングやプロンプトの改善、ハルシネーションや危ない出力が減ったかの確認、アラインメントで決めた方向性が実際の回答で守られているかの確認。何かを変えるたびに、この工程が要ります。
業務の合格条件を作る
モデルの順位を眺めるだけのベンチマークと違い、評価は「自分たちの業務で使えるか」を判断するための工程全体です。作り方は、たとえば次の順番です。
- 実際の業務で、失敗すると困る場面を先に洗い出す
- 本番に近いデータを集める。きれいすぎるテスト問題だけでは外しやすい
- 誰が採点しても同じ判断になりやすい基準を決める
- 正答率だけでなく、同じ答えが返るか(再現性)、速度、費用、安全性も一緒に測る
- モデルの更新やプロンプトの変更のたびに、同じ条件で測り直す
モデルも、データも、業務のルールも変わります。変わるたびに結果も変わるので、評価は一度の作業ではなく、運用の中に組み込んで続けるものです。最初に作ったテスト用の事例と採点基準が、その後の変更をすべて判断するときの物差しになります。
