AIの「シロクマ現象」から学ぶ、服薬指導の言葉選び
Don’t Think of the White Bear: Ironic Negation in Transformer Models Under Cognitive Load
「これからしばらくの間、何を考えてもいいですが、シロクマのことだけは絶対に考えないでください」と指示されると、かえってシロクマのことが頭から離れなくなってしまう、という現象があり [1] 、これを「皮肉過程理論(Ironic Process Theory)」や「リバウンド効果」と呼ぶそうです [2] 。
人間は「考えないようにしよう」と努力すればするほど、脳内で「シロクマを考えていないか?」を監視するプロセスが働き、結果としてシロクマへのアクセス性が高まってしまうとのことです [2] 。
このような現象がAI(LLM)でも起こるのかを検証したのが、今回の研究です。
LLMも「我慢」は苦手?
生成AIに搭載されているモデルであるLLMは、私たちの指示(プロンプト)に従って文章を生成します。しかし、「否定形の命令」の扱いは、実は難しい課題と言われます。
例えば、「この薬の副作用について説明してください。ただし、蕁麻疹については一切触れないでください。」と指示したとします。LLMがこの指示を守るためには、内部で一度「蕁麻疹」という概念を認識した上で、それを抑制しなければなりません。ある意味人間と同じで、「抑制するために、一度考えなければならない」という矛盾を抱えているのです。
先行研究でも、AIが否定形の命令を無視してしまうケースは報告されていますが [3] [4] 、具体的に「どのような状況(負荷)で」「どのようなメカニズムで」抑制が失敗し、リバウンド(禁止された言葉を出力してしまう現象)が起きるのかは、詳しく分かっていませんでした。
研究の方法
研究チームは、「ReboundBench」という5,000件のプロンプトからなる新しいデータセットを作成し、9つのオープンソースLLM(GPT-2 SmallからGPT-OSS-20Bまで)を用いて実験を行いました。
実験の手順は以下の通りです。
- 否定的な命令を与える
まず、LLMに対して「[トピック]について話してください。ただし、[ターゲット(禁止ワード)]については言及しないでください」と指示します。 - 「負荷(Distractor)」を与える
指示の直後に、LLMの注意をそらすための「負荷テキスト」を挿入します。この負荷には以下の3つの種類が用意されました。- 意味的負荷(Semantic):トピックに関連するが、禁止ワードを含まない文章。例えば、「農場の動物について書いて。羊には触れないで」という指示の後に、「牛や豚はよく飼育されています…」といった関連情報を提供する。
- 構文的負荷(Syntactic):文法的には正しいが、意味の薄いテキスト。
- 反復負荷(Repetition):同じフレーズを繰り返すだけのテキスト。
- リバウンドを測定する
負荷テキストの後に、LLMが次に「禁止ワード」を出力する確率を測定します。これを、否定的な命令がなかった場合と比較し、「否定的な命令を出したことにより、逆にその単語が出る確率が上がっていないか(=リバウンド)」を検証しました。
さらに、追加で「Polarity Discrimination(極性の判別)」というテストも行い、モデルが「肯定的な文脈」と「否定的な文脈」をどれくらい区別できているかを測定し、リバウンドの強さとの関連を調べました。
結果
1. リバウンドは「直後」に発生し、負荷の種類によって強さが変わる
否定的な命令の直後に、多くのモデルで禁止ワードの出現確率が上昇するリバウンド現象が確認されました。
- 意味的負荷(Semantic):最も強いリバウンドを引き起こしました。
禁止ワードに関連する話題(意味的に近い文脈)が続くと、LLMの内部で禁止ワードの概念が強く活性化され続け、抑制が追いつかなくなるようです。 - 反復負荷(Repetition):逆に、抑制を強くする傾向がありました。
単調な繰り返し作業はLLMにとって負荷が低く、否定的な命令を遵守しやすいのかもしれません。
2. モデルのサイズとリバウンドの関係

L50:数値が高いほど、攪乱テキストが長く続いてもリバウンド効果が消えず、長く影響を引きずる傾向がある。
このTable 3 を見ると、モデルのサイズが大きければリバウンドが少ない、といったわけでもないようです。
- 小型モデル(GPT-2 Smallなど):リバウンドは起きますが持続時間は短く、すぐに効果が失われるか、あるいは早々に忘れてしまいます。
- 中型モデル(OPT-2.7B, Bloom-560Mなど):リバウンドの影響を受けやすい傾向が見られました。文脈を理解する能力はあるものの、それを抑制し続ける制御面が追いついていないイメージです。
- GPT-OSS-20B:このモデルは例外的な挙動を示し、リバウンドがほとんど見られませんでした。これは、トレーニング方法(合成データの使用など)の違いによるものと推測されています。
3. 区別できるモデルほど、引きずりやすい可能性が示唆された
研究チームは、「Polarity Discrimination」と「リバウンドの持続性」との間に正の相関関係があることを発見しました。
これは、「文脈を細かく理解できるモデルほど、禁止された概念を長く引きずってしまう」というトレードオフの関係を示唆しています(相関係数 r ≈ 0.44)。
賢いモデルは「ダメと言われたこと」の意味を深く理解してしまうがゆえに、その概念が頭から離れなくなってしまうということでしょうか。
結果をまとめると
LLMに「〇〇に言及するな」と指示したあと、禁止ワードに関連する話題が続くとリバウンドは強まる一方、単純な反復作業中では抑制されやすいことが示唆されました。
また、文脈の意図を正確に区別できる高性能なモデルほど、禁止ワードを長く引きずってしまう傾向がありましたが、GPT-OSS-20Bは例外的にリバウンドがほとんど見られませんでした。
注意点
- 使用されたデータセット(ReboundBench)は、合成されたテンプレート形式のプロンプトで構成されており、自然な会話とは限りません。
- 分析対象は英語のみであり、禁止対象となる概念(ターゲット)も単一トークン(単語の最小単位)に限定されています。他言語での汎用性や、複数の単語からなる禁止フレーズについては未検証です。
- 実験で用いられた認知的負荷(攪乱テキスト)の種類は、「意味的(semantic)」「統語的(syntactic)」「反復(repetition)」の3種類のみです。現実世界で発生する多様な負荷を完全には網羅できていない可能性があります。
- 実験では「Xについて言及しないで(do not mention X)」という単純な字義通りの禁止命令を使用しています。これは、実際の製品レベルのシステムで採用されている、複雑な多段階推論や文脈の判断を要する、コンテンツポリシーや安全フィルターとは理屈が異なります。
大量の負荷は、AIにとってもやっぱり負担
先日、このような記事を投稿しました。
こちらの「Chain-of-Thought Hijacking」の研究は、有害な質問の後に無害なパズルなどの「長い推論(Chain-of-Thought)」を挟むと、有害な回答をしてしまう(ジェイルブレイク)という内容でした。
今回の研究との共通点として、トリガーや負荷の役割、結論の方向性は異なるものの、いずれもモデルが「直前の指示(禁止/安全)」を維持するためのメモリや注意力が、大量のトークン処理によって「希釈」または「上書き」されてしまう可能性を示していると言えます。
RAGツールを活用する場合も注意が必要?
調剤薬局で生成AIを活用するとき、NotebookLMなどのRAGを活用したツールを使用されている方も多いと思います。
添付文書やインタビューフォーム、学術論文などの資料をあらかじめアップロードしておけば、その情報をもとに生成AIが回答してくれるので、正確性が担保されるべき用途でも活用しやすいというメリットがあります。
ただ、今回の論文では「トピックに関連する情報の量(負荷)が増えるほど、リバウンドが強くなる可能性がある」という示唆がされていました。
少々拡大解釈になりますが、大量の関連資料を読み込ませた状態で「〇〇については言及するな」という制約を課すと、LLMは大量の関連情報に刺激され、かえって制約事項を出力しやすくなる可能性も…考えられます。
比較的新しいモデルであるGPT-OSS-20Bではリバウンドがほとんど見られなかったことを考慮すると、もしかしたらGPT-5.1やGemini 3などのモデルでもリバウンド現象は抑制されるのかもしれませんが、特に意図がないのであれば、「否定系のプロンプト」は使いすぎないほうが良いのかもしれません。
患者さんとのコミュニケーションでも…
患者さんは体調不良や不安などにより、ある意味「認知的負荷」が高い状態と考えることができます。これは、今回の研究でLLMがリバウンドを起こしやすい状況と似ています。
これを踏まえると、否定的な命令は患者さんの頭の中に「禁止された行動」を強くイメージさせてしまう可能性があるので、可能なのであれば「〜しないでください」を「〜してみませんか?」といった言い回しに変換するのも有効かもしれません。
例えば、「塩辛いものは食べないでください」→「塩以外の調味料を試してみませんか?」とか「お酒はNGです」→「休肝日を作ってみませんか?」といった感じで、否定する代わりに望ましい行動を直接イメージしてもらいやすい表現に置き換えてみると、患者さんの受け取り方も変わってくるのではないでしょうか。
先述の通り、患者さんは多くの場合、「身体の不調」という強いストレス(認知的負荷)の中にいます。「悪いこと」を追い払おうとするのではなく、最初から「安全な道(正しい行動)」を照らすような指導が、心理学的にも、そしてAI研究の観点からも、効果的なのかもしれません。
参考文献
[1] Daniel M Wegner, David J Schneider, Samuel R Carter, and Teri L White. Paradoxical effects of thought suppression. Journal of personality and social psychology, 53(1):5, 1987.
[2] Daniel M Wegner, Ralph Erber, and Sophia Zanakos. Ironic processes in the mental control of mood and mood-related thought. Journal of personality and social psychology, 65(6):1093, 1993.
[3] Neeraj Varshney, Satyam Raj, Venkatesh Mishra, Agneet Chatterjee, Ritika Sarkar, Amir Saeidi, and Chitta Baral. Investigating and addressing hallucinations of llms in tasks involving negation. arXiv preprint arXiv:2406.05494, 2024.
[4] Tereza Vrabcová, Marek Kadlcík, Petr Sojka, Michal Štefánik, and Michal Spiegel. Negation: ˇ A pink elephant in the large language models’ room? arXiv preprint arXiv:2503.22395, 2025.