約2分

AIの振る舞いを目的に合わせる、アラインメントの考え方

アラインメントは、AI の振る舞いを人の目的やルールにできるだけ沿わせるための考え方です。

優秀だけれど独走しがちな担当者に、会社の目的と判断の基準を共有して、同じ方向へ仕事を進めてもらう。アラインメントは、AI の振る舞いを、人の目的やルールにできるだけ沿わせるための考え方です。

AI Tatoediaの案内役
案内役

いちばん賢いモデルを入れたら、会社の方針どおりに答えてくれると思う?

AI Tatoediaの読者モブ
読者さん

賢いなら、それくらい空気を読んでくれそうだけど……

AI Tatoediaの案内役
案内役

それがね、性能と「会社が望む方向」は別物なんだ。

能力ではなく向かう方向をそろえる

アラインメントでそろえるのは、AI に「できること」ではなく、「やってほしい方向」です。性能が高くても、放っておけば人の意図とずれることがあります。

  • 顧客向けの AI に、断定しすぎず丁寧に答えさせたい
  • 社内の AI に、扱ってよい情報の範囲を守らせたい
  • 自動化を進めながら、危ない判断や暴走を減らしたい

正確さ、安全性、会社の方針、人の期待。これらを、プロンプト、評価、制御、人の確認を通してそろえていきます。人の評価を学習に反映させる RLHF も、そのための手段の一つです。危ない入出力を止めるガードレールが「はみ出さないための柵」だとすれば、アラインメントは「そもそもどちらへ進ませたいか」の設計にあたります。

「良い回答」を先に言葉にしておく

どの方向を良しとするのかを決めないまま調整を始めると、改善の方向がばらけます。まず「良い回答」の条件を言葉にします。安全であることだけでなく、役に立つこと、理由を説明できること、同じ条件で同じ答えが返ることも一緒に見ます。

評価の指標を持たずに調整すれば、良くなったつもりで実は悪くなっている、ということも起こる。どこで人が確認するか(ヒューマン・イン・ザ・ループ)も、あわせて決めておきます。

アラインメントは、AI を完全に人の意図どおりにするものではありません。価値観も業務のルールも変わっていくので、定期的に見直していくことが前提です。