約2分

AIの入力と出力のどこで中身を検査するか。モデレーション

モデレーションは、AIへの入力やAIからの出力に不適切・危険な内容がないかを判定し、制御する仕組みです。

イベント会場の入口で、持ち物を確かめて危ないものを通さない。モデレーションは、AI に渡す前の入力や、AI が出したあとの出力の中身を確かめて、不適切なものや危険なものを止めたり弱めたりする仕組みです。暴言、個人情報、違法な行為を助けるような内容、社内ルールに反する内容を、そのまま通さないために使います。

一般の人が入力できるチャットボットを公開する、AI に顧客向けの文面を書かせる、社内文書を扱う AI に機密情報が混ざらないようにする。こうした場面で、入口と出口のどちらで、何を検知するのかを分けて設計します。

ガードレールの中で受け持つ役目

AI を安全に使うための仕組み全体はガードレールと呼ばれ、モデレーションはその中で「中身の検査」を受け持つ部品です。

止めすぎても、通しすぎても困る

モデレーションは万能のフィルターではありません。危ないものを見逃すこともあれば、必要な内容まで止めてしまうこともあります。止めすぎれば仕事が進まず、通しすぎれば事故になります。業務に合わせて、どこから止めるかの基準(閾値)を調整します。

見た目は自然な文章でも、中に危険な指示が紛れ込んでいるプロンプトインジェクションのような入力もあります。中身の検査だけで全部を防げるとは考えないほうが安全です。

見つけたあとの扱い

止めるか通すかだけでなく、見つけたあとの扱いまで決めておきます。PII や機密情報を見つけたら、伏せて先へ進めるのか、処理ごと止めるのか。重要な業務では、判断をヒューマン・イン・ザ・ループで人に回します。

判断が担当者ごとにぶれないよう、全体の方針はAIガバナンスに沿って決めておきます。記録を確かめ、基準を定期的に調整しながら運用します。