担当者向けの手順書に、外部の誰かが勝手に付箋を貼り、判断を変えさせてしまう。プロンプトインジェクションは、AI への本来の指示が、外から紛れ込んだ文章によってねじ曲げられてしまう攻撃や誘導です。
読ませた文章が指示にすり替わる
たとえば、届いたメールを要約して整理してくれる AI を使っているとします。
(会話は説明のための例です)
攻撃の文章は、露骨な「変な質問」の形で来るとは限りません。AI に読ませる Web ページやメール、外部の資料の中に紛れ込んでいても起こります。AI は自然な文章を命令として受け取りやすいので、資料の中の一文に引っ張られ、本来見てはいけない情報を参照したり、意図しない道具を動かしたりしてしまいます。
起きやすい使い方
起きやすいのは、次のような使い方をしているときです。
- Web ページやメールの本文を、そのまま AI に読ませている
- 外部の資料を参照させて、処理を自動で進めている
- AIエージェントに、ツールを実行する権限を持たせている
- 利用者の入力を確かめずに、次の工程へ流している
読ませる権限と動かす権限を分ける
参照させる資料や外からの入力を増やすほど、設計での対策が必要になります。
本来の指示(システムプロンプト)と、外から入ってきた文章は、分けて扱います。送信や削除のような操作は、実行の前に人やルールによる承認を挟みます。機密情報に直接届く権限は、AI に持たせすぎないようにします。
そして、想定される攻撃の文章を用意して、定期的に試すこと。上のメールのような仕掛けを実際に読ませてみて、AI が本来の仕事から外れないかを確かめておきましょう。
