高速道路のガードレールは、事故そのものをなくすものではありません。はみ出したときに、被害を大きくしないための囲いです。AI のガードレールも同じで、AI を業務で使うときに「ここまでは通す、ここから先は止める」を決めておく安全装置です。
社内チャットボットで機密情報に触れるかもしれない、顧客向けの回答を自動で作るので誤った案内が許されない、法務や医療や金融のように説明責任が重い。こうした現場に AI を置くなら、便利さと同時に必要になります。AI の振る舞いを人の目的に沿わせるという、より広い考え方はアラインメントと呼ばれます。
囲いは一か所ではなく何か所にも置く
ガードレールは「禁止ワードのリスト」のことではありません。どこで止めるかによって、置けるものが変わります。
| 置き場所 | 止めるもの | たとえば |
|---|---|---|
| 入力 | AI に渡してはいけない情報や、危ない依頼 | 個人情報を伏せる、業務外の依頼を断る |
| 出力 | 返してはいけない内容 | 不適切な表現や、根拠のない断定を止める(モデレーション) |
| ツールの実行 | 勝手に動かしてはいけない操作 | 送信、削除、支払いの前に止める |
| 人の承認 | 自動では判断させないこと | 重要な回答を人が確認してから出す |
モデルに任せきりにせず、決まったルールでの判定や、人の確認を組み合わせます。
止めたあとのことまで決める
最初にやるのは、防ぎたい事故を言葉にすることです。ここが曖昧だと、設定が形だけになります。
そして、止めたあとの扱いを決めておきます。止められた依頼は誰が見るのか、利用者には何と返すのか。例外への対応がなければ、止めるたびに現場の仕事が止まります。
想定していない入力や新しい攻撃は、必ず出てきます。ガードレールは一度作って終わりではなく、記録(ログ)を見ながら定期的に見直して更新していくものです。