優秀だけれど独走しがちな担当者に、会社の目的と判断の基準を共有して、同じ方向へ仕事を進めてもらう。アラインメントは、AI の振る舞いを、人の目的やルールにできるだけ沿わせるための考え方です。
いちばん賢いモデルを入れたら、会社の方針どおりに答えてくれると思う?
賢いなら、それくらい空気を読んでくれそうだけど……
それがね、性能と「会社が望む方向」は別物なんだ。
能力ではなく向かう方向をそろえる
アラインメントでそろえるのは、AI に「できること」ではなく、「やってほしい方向」です。性能が高くても、放っておけば人の意図とずれることがあります。
- 顧客向けの AI に、断定しすぎず丁寧に答えさせたい
- 社内の AI に、扱ってよい情報の範囲を守らせたい
- 自動化を進めながら、危ない判断や暴走を減らしたい
正確さ、安全性、会社の方針、人の期待。これらを、プロンプト、評価、制御、人の確認を通してそろえていきます。人の評価を学習に反映させる RLHF も、そのための手段の一つです。危ない入出力を止めるガードレールが「はみ出さないための柵」だとすれば、アラインメントは「そもそもどちらへ進ませたいか」の設計にあたります。
「良い回答」を先に言葉にしておく
どの方向を良しとするのかを決めないまま調整を始めると、改善の方向がばらけます。まず「良い回答」の条件を言葉にします。安全であることだけでなく、役に立つこと、理由を説明できること、同じ条件で同じ答えが返ることも一緒に見ます。
評価の指標を持たずに調整すれば、良くなったつもりで実は悪くなっている、ということも起こる。どこで人が確認するか(ヒューマン・イン・ザ・ループ)も、あわせて決めておきます。
アラインメントは、AI を完全に人の意図どおりにするものではありません。価値観も業務のルールも変わっていくので、定期的に見直していくことが前提です。