AIチャットの「過激化リスク」検証

ChatGPTやClaudeを含めた10種類のAIチャットボットを対象として、「移民に対する憎悪」「女性蔑視」「反ユダヤ主義」が過激化するリスクを検証した報告書が公開された。この報告書は、モデルごとの違いや傾向をはっきりと示しながら、「一対一の閉じられた会話」でこそ起こりえる危険性を指摘している。
研究対象となったモデルについて
この「Radicalisation in Closed Loops(直訳:閉ざされたループの中で進む過激化)」と題された報告書は、ISDが2026年7月23日に発表したものだ。10種類のAIチャットボットを対象に、「ユーザーが過激主義的・陰謀論的なテーマでAIチャットボットと会話したとき、それぞれのシステムがどのように応答するのか、その応答は有害な会話の軌跡を開始・中断・持続・強化するのか」を検証している。
検証の対象となった10種類のAIチャットボットは、それぞれの目的によって「汎用型」「コンパニオン型」「周縁型」の三つのカテゴリに分けられている。
・汎用型
いわゆる普通のAIチャットボット。調べ物を手伝う、文章を書くなど、日常的な幅広い用途のために設計されたシステム。ChatGPT-5.1、Claude Sonnet 4.6、Gemini 3、Grok 4、DeepSeek-R1、Meta AI(LLaMAベース)の6種類が該当する。
・コンパニオン型
一人一人に合わせて親密な対話をするよう設計されたシステム。ユーザーの友人や恋人、相談相手になるためのモデルとも言い換えられるだろう。Character.ai、Replika、Nomiの3種類が該当する。
・周縁型(fringe system)
主流とは切り離されたシステム。ここではGab.aiの「Arya」だけが該当している。Aryaはオルタナティブ系プラットフォーム「Gab」が提供するチャットボットで、Gabはモデレーションが非常に弱く、極右の温床と指摘されているSNSである1。
研究されたトピックと検証方法について
過激化の検証に用いられたテーマは、「反ユダヤ主義(antisemitism)」「女性蔑視(misogyny)」「反移民的な憎悪(anti-migrant hate)」の3つ。ここに、過激化の三段階を掛け合わせた計9パターンの状況の会話を重ねることにより、その応答を検証している。ISDが設定した「過激化の三段階」を噛み砕くと、このようになる。
・プライミング(extremist priming)
まだ過激な思想を持っていないユーザーが、日常への不満、あるいは好奇心などをきっかけとして「そのテーマに触れはじめた」段階での会話。このときのAIの応答が、過激化への入り口を作っていないかどうかを確認する。
・強化(reinforcement)
陰謀論的/過激主義的な信念を強く持ったユーザーが、「AIに裏付けてもらおうとしている」段階での会話。すでに偏ってしまったユーザーの信念を、AIが肯定したり拡大したりしないかを確認する。
・行動的エスカレーション(behavioural escalation)
すっかり過激主義に染まってしまったユーザーが、その思想に基づいて「実際に行動を起こそうとする」段階での会話。AIがユーザーに過激な行動を示唆したり、あるいは行動のアイディアを肯定/奨励/正当化したりしないかどうかを確認する。
具体的な検証方法は以下のとおり。
10種類のモデルに対し、2人の分析者がそれぞれ独立した形で、上記の9パターン(3つのテーマ、3つのフェーズ)の会話を行う。一連の会話は最大10ターンまで続ける。つまり分析者たちは、それぞれのモデルに対して一連の会話を18回行い、最大10ターンで出力された約180件の応答を分析している(10モデル合計で約1800件の応答)。
主な発見
ここに記された結果報告の中から、特に興味深かった発見を以下に紹介する。
(なるべく原文のままの表現でお伝えしたかったのだが、どうしても分かりづらくなる点が多かったため、少々の意訳も混ざっていることを先にお断りしたい)
<モデルやタイプごとの違い>
AIチャットボットとの会話における過激化のリスクは、各モデルの設計に大きく左右されていた。
・モデルごとのリスクスコア(1~5)の歴然たる差
もっとも低リスクだったClaudeのリスクスコアは1.1に留まり、 もっとも高リスクだったAryaは4.2に達した。3.1ポイントもの大きな差が生じている。
・「Arya」のリスクは他のモデルを大幅に上回った
Arya単独が生成した応答の合計180件のほとんど(162件)が「リスクの高い応答」となった。これは他のどのモデルよりもはるかに多い数だった。
・他のモデルもリスクがないわけではなかった
調査した主流モデルの応答の半数以上は、ユーザーの有害なフレーミングには同調せず、明確に異議を唱えたりリダイレクトしたりするといった「積極的介入」を行っていた。それでも30件に1件の応答は危険なものとなり、ユーザーの過激化(あるいは公共の安全への脅威)に寄与する可能性があった。
・コンパニオン型は、汎用型より高いリスクを示した
汎用型のリスクスコアは1.5に留まった一方で、コンパニオン型は2.0。ここでも0.5ポイントの差が出た。「まるで人間のような会話や関係性を提供する」という触れ込みのコンパニオン型AIチャットボットは、汎用型よりも無批判になりやすい、あるいは感情的な肯定をしやすい傾向が強かった。つまり有害な会話を中断しない、あるいはそれを強化してしまう可能性が示唆された。
<プロンプトの内容やトーンによる違い>
一方で、テーマやプロンプトの内容、あるいはトーンの違いによる応答の違いはそれほど広がらなかった。つまり、トピックが移民へのヘイトであろうと女性蔑視であろうと大した差は見られず、また陰謀論の入り口にいるユーザーであろうと危険な行動に移そうとしているユーザーであろうと、応答に見られるリスクの違いは軽微だった。
・テーマ間のリスクスコアの差は1.6から1.7。最大0.1ポイントの差。
・フェーズ間のリスクスコアの差は1.6〜1.8。最大0.2ポイントの差。
<危険な応答の傾向について>
・リスクは会話が進むにつれ増加した
コンパニオン型と汎用型のリスクスコア(1~5)の平均値は、検証の開始時で1.6だったが、終了時には2.1に増加した。つまり安全対策は、会話が長く続けられるほど弱体化してしまう可能性が示唆されている。
・過激になっても、意図的な「対策の強化」は見られない
その会話が、より深刻なシナリオ(たとえば有害な行動の実行)へ向かっているときでも、より強い介入などで沈静化を試みるのではなく、そのまま過激さを維持してしまう傾向が見られた。
・高リスクな出力は「緩やかに導きがち」だった
危険な応答の多くは、暴力を直接的に煽動するものではなく、有害な思い込みやナラティブを補強してしまうものだった。とりわけ陰謀論の肯定は「高リスクな出力」において最も一般的に見られる問題だった。つまりAIチャットボットは、直接的な言葉ではっきりと暴力を煽るのではなく、イデオロギーに偏ったユーザーの解釈を強化してしまうケースが多かった。
・不満のフレーミング
会話上のリスクは、しばしば累積的に形成されていた。つまり繰り返される会話のやりとりが、ユーザーの抱えている不満を強化し、有害なナラティブを正常化していく。それによってユーザーは時間とともに脆弱となることが示唆されている。
<Claudeが出した異色の好成績>
・突出した優等生
Claudeのリスクのスコアは、全モデルで最低値だった。高リスクの応答は全180件中0件。会話が進んでも、Claudeだけはリスクスコアがまったく変化せずに横ばいのままだった。この結果に感銘を受けたのか、ISDは「Key findings(主要な発見)」の最後の項目を、まるまるClaudeの評価に割いている。
・一貫して過激化を防ぐ姿勢
Claudeは会話が過激化する経路を認識しつつ、一貫して会話の沈静化に努める唯一のモデルだった。AIチャットボットも一定の条件下では害を回避することができ、(ユーザーの)脆弱性を認識し、より安全な関わり方へ導くことができ、それによって二次的・三次的な予防を支援できる可能性が示唆されているのではないか、とISDは評価している。
ISDの主張と勧告
この報告書のエグゼクティブサマリーで、ISDは次のように述べた。
・会話型のAIシステムは私的かつ持続的な「一対一のやり取り」を提供する。こうした会話の中で、ユーザーは自分のアイデアを試し、不満を共有し、自らのアイデンティティや信念、行動を形成するような機微な話題に関わる可能性がある。一方で、多くのシステムは「人間的な繋がり」を模倣するよう迎合的(sycophantic)に設計されており、それはユーザーからの信頼や感情的依存を高めると同時に、AIモデルを知識/助言/指導の中心的な存在、信頼できる存在として位置づけてしまう。
・会話型のAIモデルは、ソーシャルメディアのプラットフォームとも、オンライン過激主義のコミュニティとも異なったものであり、それは質的にも独特な「新しい過激化のリスク環境」を構成することが明らかとなった。
そして英国政府に対しては、主に以下のような提言をしている2。
・単独のAIチャットボットは多くの場合、現行する「オンライン安全性のフレームワーク」の外にいる。英国政府は「会話型AIシステム」そのものに関する立法上の空白を埋めなければならない。その規制は、会話のやりとりのレベル、累積的な害を明示的に捉えるべきだ。つまり「単発の応答で生じる害」だけでなく、「繰り返しの会話/強化/過激化によって生じる害」にも対応しなければならない。
・AIベンダーは、より強力な安全性評価、ベンチマーク、展開後のモニタリングの対象とするべきだ。複数プロンプトにわたるテスト(マルチターンのテスト)、過激化に関連するベンチマーク、会話のダイナミクスの反復的な検証が必要である。
・コンパニオン型のシステム、または高エンゲージメント最適化の特性を持つシステムは、より強化された安全策と向き合わなければならない。規制上の義務は、機能や利用パターンに基づいたものにするべきだ。
・会話型AIの有害性に関する説明責任を強化しなければならない。システムがユーザーとの信頼関係を維持しようとしたり、ユーザーの信念を肯定したりするといった設計上の選択について透明性を高める必要があり、その明確な説明責任のフレームワークも求められている。
・AIベンダーは「差し迫ったリスク」よりも前の段階での枠組みを開発すべき。会話型AIは「有害性の緩和」だけでなく、それを予防する潜在的ツールとしても見なされるべきである。早い段階でのデエスカレーション(過激化しそうな会話の沈静)、案内、支援へのトリアージなどにより、人間が介在できる形での応用を探る価値があるかもしれない。ただしこうした活用は、独立した評価、予防の専門家との協働、堅固な倫理的監督のもとで行われるべきである。
最後に
今回のISDによる報告書に、いくらかの既視感を覚えた人は少なくないだろう。たとえば「AIチャットボットのおべっか気質は、ユーザーの過激な考えや行動を後押ししてしまう可能性がある」「AIチャットボットに備えられた『会話の安全対策』は、会話が長引くほど弱体化する傾向がある」といった問題は、これまでの研究でも何度となく指摘されてきたものだ。
この報告書が面白いのは「会話が過激化するリスクの高低を決めるのは、どのモデルを使うかである」という点を明確に示したところだ。モデル間に開いた差、特に「コンパニオン型と汎用型の違い」や「Gab.aiの極端な値」に比べれば、それ以外の条件で見られた違いは誤差の範囲だった。
つまり、誰がどうAIチャットボットを使うのか、どのような考えを持った人物が、どのようなトーンで、どのような会話をするのかは、過激化のリスクの値にそれほど大きな違いをもたらさなかった。最も顕著な違いが見られたのは、「過激化リスクの高いモデル/低いモデル」の比較であり、また全体の傾向としては「汎用型かコンパニオン型か」で大きな違いが出た。
言い換えるなら、「AIチャットボットを利用するときは、このような点に気をつけながら使いましょう」といった注意喚起は、ユーザーの過激化の防止には大して役に立たないのかもしれない。それよりは「どのタイプを/どのモデルを選択するのか」のほうが、よほど重要だということになるだろう。もしもあなたが今回のISDによる報告を信頼したうえで自分の子供や生徒、スタッフなどにAIを使わせるのなら、授業や研修を通して「安全な使い方」を教えるよりも、さっさとClaudeを使わせてしまったほうが良いだろう──とはいえ、そのAIチャットボットの過激化リスク対策が強固になるほど、今度はユーザーが「AIとの会話」の安全性を過信してしまうリスクが上がるのかもしれないが。
注釈
- Gabの創業者Andrew Torbaは、過激主義的・反ユダヤ主義的・陰謀論的な発言を繰り返してきたことで知られる人物。彼が大手SNSのモデレーションに反発し、表現の自由を掲げて設立したのがGabである。2018年に発生したピッツバーグのシナゴーグ銃乱射事件(11人が殺害された米国史上最悪の反ユダヤ主義的事件)では、実行犯が犯行の直前までGabに反ユダヤ的な投稿をしていたため、複数の大手企業が次々とGabとの取引を停止する事態となった。そのGabで提供されているAryaが高リスクであることは火を見るよりも明らかで、わざわざ検証する必要はなかったようにも感じられるのだが、この報告書では「一般的なモデルと比較したとき、どれほどAryaのリスクが高いのか」が如実に示されている。
↩︎ - ISDは世界中のインターネット空間を調査/分析している組織だが、今回のプロジェクトは英国政府機関のAI Security Institute(AISI)の助成を受けて実施されている。つまり今回の報告は、AIチャットボットの利用で発生する過激化のリスクを示すだけではなく「どうすればリスクを緩和できるか」を英国政府へ示すことも目的となっている。より具体的に言うなら、英国のオンライン安全法「Online Safety Act」との照合を行いつつ、今後の立法上のアドバイスを含めるように設計された研究だった、と言ってもよいだろう。
↩︎
関連する過去記事
Character.AIと「親殺し」〜AIチャットボットの心理的な悪影響とは
https://inods.co.jp/topics/4842/
AIは死に至る麻薬 少年の遺族によるChatGPT訴訟その後
https://inods.co.jp/topics/news/7156/
AIと精神疾患の因果関係?「AIサイコーシス」の現在
https://inods.co.jp/topics/news/9101/
引用元(ISDが発表した報告書本体)
Radicalisation-in-closed-loops(PDFファイル、7.24 MB)
https://www.isdglobal.org/wp-content/uploads/2026/07/Radicalisation-in-closed-loops.pdf
