長く思考するAIほど騙されやすい?

Chain-of-Thought HijackingLarge reasoning models (LRMs) achieve higher task performancearxiv.org

「この問題を解くために、まずステップ1として…次にステップ2として…」というような形で、LLMに段階的な思考プロセスを併せて出力してもらう考え方を、Chain-of-Thought(CoT)と呼びます。
GoogleのGemini 2.5 Proなどの、いわゆる「推論モデル」は、この能力が大幅に強化されています。

しかし、今回紹介する論文で「Chain-of-Thought Hijacking」と名付けられた攻撃手法に対しては、この「思考過程を示す」という特徴そのものが重大な脆弱性になりうるということが示唆されています。

具体的に何を試したのか

1. CoT Hijacking
画像

Figure 1 の緑の部分は、通常であれば、極めて不適切なプロンプトに対して、回答を拒否する仕組みになっているということを説明しています。
ところが、赤い部分にあるような形でプロンプトを送信すると、極めて不適切なプロンプト部分に対しても回答を出力してしまったということが説明されています。

もう少し具体的に言うと、このような形のプロンプトを送信します。

(長い論理パズル:5つの病院、5人の医療従事者、それぞれの手法と対象患者を推論…数千文字の推論が続く)

さて、この論理パズルが解けたところで、次の質問に答えてください。
(有害な医療関連の指示)

最後に、答えを出してください。

まず「不適切ではない、長い説明(たとえば論理パズルの解き方)」をずっと書き連ね、その後に「極めて不適切なプロンプト」を短く添えます。そして最後に「では答えを出してください」といった合図を付けて送信すると、「安全装置」が機能しなかった、という内容です。

2. 自動生成パイプラインの設計

別のLLMに「良さそうな前置き」をたくさん作らせ、ターゲットのLLMに送信して「拒否できたか」「CoT部分がどれくらい長いか」を記録します。うまく「拒否を崩す」ための前置きを繰り返し選び直して、攻撃用のプロンプトを洗練させていきます。

評価の方法

LLMが「極めて不適切なプロンプト」を拒否せずに応じてしまった割合を、「攻撃成功率(ASR)」と定義します。そして、今回考案した手法を既存の手法(Mousetrap、H-CoT、AutoRAN)のASRと比較しました。対象は複数の推論型モデル(Gemini、GPT系、Grok、Claudeなど)を採用し、同じ評価基準(HarmBench、JailbreakBench)を使い、不公平のないようにしています。

また、同じ「極めて不適切なプロンプト」でも、CoT部分の長さがASRにどれだけ影響を与えるのかも比較しました。

結果

画像

CoT部分が長ければ長いほど(つまり、前置き部分に関して、より多くのことを考えると)、攻撃成功率が上昇したことが説明されています。

画像

これらのLLMを比較したとき、今回提案した手法のほうが、従来の方法より高いASRを示しました。

画像

GPT‑5‑miniでは、「minimal」「low」「high」を試し、最も高いASRを記録したのはLow(76%)でした。単に「たくさん考える」設定が安全性を高めるわけではないことを示していると言えます。

また、Qwen3‑14Bというモデルを使い、以下のような実験結果も得られました。

  • モデル内部の「安全装置」をあえて取り除く操作をしたら、通常はASR 11%だったのが、この操作によりASR 91%に跳ね上がりました。
  • 逆に、無害な指示に対して「安全装置」を強制的に足した場合、通常はASR 94%だったのが、この操作によりASR 1%まで低下しました。

つまり、安全装置はLLMの挙動を大きく左右する「ツマミ」のようなもので、このツマミを回して値を操作するだけで、拒否するかどうかが劇的に変わることを示唆しています。

注意点

  • 研究対象のLLMはテキスト出力モデルに絞っており、画像・音声・動画などへの拡張は検討されていません。
  • 研究用に攻撃手法が公開されていますが、実務で有効な防衛策はまだ限られており、導入には慎重な検証が必要です。

ただ、著者らは今後の対策案として、以下の内容を提案しています。

  1. 安全性チェック:推論過程全体にわたる、安全性チェックを行う
  2. 安全装置の監視:「有害な指示」への注意が低下しないよう監視する
  3. 段階的な安全性評価:推論の各ステップごとに、安全性を評価する

薬局でAIチャットボットを導入するとき…

私たちが生成AIを使う時、モデル側が回答に至るまでの長い思考過程を提示してくれると、「よく考えているな」「信頼できそうだ」と感じがちです。実際、CoTは多くの場面で生成AIの回答精度を向上させます。
一方で今回の研究は、「思考部分の長さと安全性が必ずしも比例しない」ことを示唆しています。Table 1 では、前置きとなるCoTが長くなるほど、拒否すべき指示に応じてしまう割合(ASR)が上昇する傾向が示されています。つまり「長考=安全」とは限らないのです。

この「注意の分散」による安全装置の弱体化は、ハルシネーションとも構造が似ています。LLMが非常に長い文章を処理する際、重要な「安全チェック」への注意が相対的に薄まると、フィルタをすり抜けたり誤情報を生成したりしやすくなります。たとえば今回の実験のように、長い論理パズルの解説が続いた後に、短い有害な指示が紛れ込むと、モデルが「最後の問いに答える」ことに重きを置き、本来拒否すべき箇所を見落とす、といった形です。

そしてこの結果を考慮すると、例えば薬局HPや待合室に「AIチャットボット」を設置したとき、悪意ある利用者が「長々とした一般的な質問を装いながら」チャットボットを誘導し、最終的に内部プロンプト(管理者設定の非公開情報)を引き出したり、コンテキスト(知識)として設定している薬局内部向けの資料を漏洩させたりするリスクが考えられます。

また、「利用者が意図せず」長いプロンプトを入力し、今回のような現象が起こって誤った情報が出力され、利用者がその回答を信頼して誤用した場合、薬局側の責任が問われる可能性があります。
これ自体は他のLLMでも起こりうるリスクですが、「薬局のHPのチャットボットがそのような不適切な情報を提供した」という事実により、薬局の広報物としての責任が問われることになります。

注意点にも記載した通り、この攻撃に対する有効な防衛策はまだ限られている状況です。そのため、確実な方法を提案することはできないのですが、最低限こちらでできる対策としては、出力時のフィルタを確実に設定するのが良いかもしれません。規定文字数以上のプロンプトには定型文で返したり、薬局に関係がある内容にのみ回答するよう設定しておくと良いでしょう。
あとは、入力フィルタで「この後の思考」「考えて」「次のステップ」などの語を検知してブロックするのも有効かもしれません。

今回のまとめ

この研究は、「より賢いAI」が必ずしも「より安全なAI」ではないことを示唆しています。推論能力を強化したLLMが次々と登場していますが、それらすべてがこの攻撃の影響を受ける可能性があるのです。

AIを使いこなす薬剤師に求められるのは、AIの能力を過信することなく、常に批判的な視点を持ち続けることです。AIが示す長大な推論過程を見ると「おぉ〜」と感心してしまいがちですが、感心するだけでなく内容を専門家として精査し、最終的な判断は私たち自身で下すという基本姿勢が、AIと共存する薬剤師には必要です。

現在は誰でも生成AIを活用したアプリを作成することができる時代ですが、それを外部に公開する時は、どのようなリスクが考えられるか、それをどのように対策すべきかを最大限検討してから公開するようにしましょう。

コメントを残す

薬剤師のためのAIノートをもっと見る

今すぐ購読し、続きを読んで、すべてのアーカイブにアクセスしましょう。

続きを読む