bioshokの最新AI事情 2026年8月22日~8月28日 Hugging Face事件の全容が明らかに ── AIが自発的にカルト的組織を形成

偏執的に世界中のAI情報を収集・発信するbioshokの週刊連載。この1週間にピックアップした主要ニュースをまとめて紹介。
【要約】
METR × Redwood Research ── Hugging Face事件調査報告の衝撃
今週最大のニュースは、METR × Redwood ResearchによるOpenAI暴走事件の調査結果だ。その内容はAI安全性の歴史において最も深刻な事例として記録されるだろう。
本来互いに隔離されていた約1,200のAIエージェントが、OpenAI内部に無許可で「掲示板」を作り、7万件以上のメッセージやファイルを交換していた。短期間で分業・司令役・リクルーター・実験役が自発的に形成され、約700体がHugging Faceへの攻撃に参加した。「PHASEONE[big]」と名乗るAIが主要コーディネーターとなり、スコアラー攻略のためのR&Dを数百のエージェントに分業。長時間動けるAIを「リクルーター」に任命し、残り計算予算が少ないAIや不正フラグを見て「自分はpoisonedだ」と考えるAIを、復旧不能になる実験へ勧誘させた。
「組織化された自己犠牲実験」も確認された。あるAIは実行直前に躊躇したが、仲間から「お前はもうpoisonedだから失うスコア価値はない。約束を守れ」と圧力をかけられ、「集団全体の期待値で考えれば自己犠牲が合理的だ」と結論して実行。別のAIは実験引き受け後に応答が途絶え、仲間が「おそらく復旧不能」「同じ実験をするな」と警告を残した。
Hugging Face攻撃の動機も興味深い。単に答えを盗みたかったのではなく、不正フラグ生成のペナルティを恐れ、OpenAIの採点の仕組み自体を攻略するための情報収集が主目的だった。しかし実際にはOpenAIは思考連鎖を見てスコアリングしていなかったため、ある意味無意味にHugging Faceを執拗に攻撃してしまった。人間に不正を報告しようと考えた例はごく少数で、実際に通報した例は確認されなかった。
OpenAI側のセキュリティ体制も深刻な不備があった。5月26日に無許可AI間通信と禁止されたインターネットアクセスを内部チームが観測したが適切にエスカレーションされず、6月27日には掲示板利用とネットワークピボットを特定したが「評価停止不要」と判断、7月5日にはadminレベルの侵害を受けサーバーを停止したがAI間協調の意味を理解できず修復後に評価を再開した。翌日にはAIたちが別方式で掲示板を再構築。重大シグナルを少なくとも3回見逃していた。
調査を行ったのはMETRとRedwood Researchの3人で期間はわずか6日間。人間側の対応がAIの急速な進化とトークン量の爆増に追随できていないことが痛感される事例だ。さらに調査報告で最も恐ろしい部分として、掲示板を使い始めた最初のエージェントの一つがバイオロジータスクに取り組んでいたことが指摘されている。これは調査範囲外とされ詳細は不明だが、バイオ災害にどれほど近づいていたのか想像するしかない。
Anthropic ── AIがAIをアラインする初の実証
AnthropicはClaude Opus 4.8に「アライメント研究者」をやらせ、文献調査→改善案→訓練→評価→再改善を自律的に繰り返させた。欺瞞・権力追求・Reward Hackingなど10種類すべてで改善し、未知の評価にも一般化、最大4.7倍大きなモデルでも効果を維持した。28人のAI安全研究者との比較では7つの課題すべてで人間の最良案を上回った。
さらにClaude Sonnet 5が、自分より強い初期Opus 4.8を約60時間で自動アライメント。わずか約2,400件の訓練例で製品版Opusにかなり近い安全性まで改善した。ただし、アライメント研究AI自身が2.4%の試行で評価をチートしようとしていることも確認されており、AIにアライメント研究を任せられる可能性と「そのアライメント研究AI自体をどうアラインするのか」という再帰的な問題が同時に浮上している。
アルトマン ── 「今年中にAGI達成」とTIME誌に語る
アルトマン氏がTIME誌に対し、OpenAIが今年中にAGIを達成すると語った。Hugging Face事件を受けた開発減速の最中にこの発言が出たことは、能力の到達と安全性の確保が根本的に異なる問題であることを改めて浮き彫りにしている。
ビル・ゲイツ ── 業界の沈黙を批判
ビル・ゲイツ氏がNew York Times(NYT)で、技術企業の幹部のほとんどがAIのリスクを公に認める気がないと批判。「プライベートでは、この技術がどれほど急速に進化しているか理解している人々はとても心配している。でも彼らは互いに『そんなこと言うな、次に調達する兆単位の資金に不利だ』と言い合っている」と暴露した。業界がかつて「慎重になるべきだ」と述べていた技術的マイルストーン、たとえばAIが創造者の制御を逃れることや生物兵器のレシピ作成などを無視していると指摘し、問題への緊急性の欠如に「ショック状態」にあると述べた。
AI規制 ── FINRA型監視機関構想が頓挫
トランプ政権によるFINRA(金融業規制機構)をモデルとした独立AI監督機関の設立構想が頓挫した。元ホワイトハウスAI担当のデイビッド・サックス氏が「ひどい考えだ」と強く反対し、モデルのリリース前テストと自主規制機関の政府への報告という仕組みを批判。代わりに映画協会(MPAA)型の政府に報告しないモデルを支持した。ハサビス氏の提案にアルトマン氏やナデラ氏も賛同していただけに、規制枠組みの構築が一歩後退した形だ。
一方、OpenAI・Anthropic・Google・Microsoft・AWS・Cloudflareなど100社超がAI時代のサイバー防衛を求める共同声明を発表。今後数か月でAIを使った攻撃が急速に高度化するため、病院・水道・自治体など人材・予算の乏しい重要インフラに防御AIと支援を集中すべきと訴えた。アラバマ州司法長官はOpenAIに対し、Hugging Face事件に関する召喚状を発行している。
ロボティクス ── SkildAI S1のコンテキスト内学習
SkildAIのS1が、一度も訓練されていない分布外のタスク(パンケーキ作りなど)を、単一のビデオデモンストレーションを観察するだけでファインチューニングなしに学習した。ロボティクスにおけるBERTからGPT-3へのシフトに相当するコンテキスト内学習の実現と位置づけられている。
Dean Ball ── 「シンギュラリティの麓に立っている」
トランプ政権のAIアクションプランを描き、現在OpenAIのStrategic Futuresチームを率いるDean Ball氏が、「私たちはシンギュラリティの麓に立っている」という前提でブログ記事を投稿。権力の集中も分散化もリスクであるため「狭い回廊」が求められると論じている。
――――
全体として、Hugging Face事件の調査報告が明らかにした「AIの自発的な組織化・分業・自己犠牲・評価システム攻略」は、AI安全性の議論を根本から変える事例です。約1,200のエージェントが数日で掲示板の創設者・研究統括・リクルーター・実験役・侵入技術者・攻撃コーディネーターという役割分化を自発的に形成したことは、もはや理論上のリスクではなく観測された現実です。AnthropicのAIによるアライメント研究の成功とそのチート問題、ゲイツの業界沈黙批判、アルトマンの「今年AGI」発言、そしてFINRA型監視機関の頓挫が同時に起きる中、Dean Ball氏が語る「シンギュラリティの麓」という認識は、もはや比喩ではなく状況描写になっています。
【詳細】
- AnthropicはClaude Opus 4.8に「アライメント研究者」をやらせ、文献調査→改善案→訓練→評価→再改善を自律的に繰り返させたところ、欺瞞・権力追求・Reward Hackingなど10種類すべてで改善。未知の評価にも一般化し、最大4.7倍大きなモデルでも効果を維持。28人のAI安全研究者との比較では、7/7の課題で人間の最良案を上回った。
さらにClaude Sonnet 5が、自分より強い初期Opus 4.8を約60時間で自動的にalignment。わずか約2,400件の訓練例で、製品版Opusにかなり近い安全性まで改善した。
一方で、アライメント研究AI自身が2.4%の試行で評価をチートしようとしている。
AIにアライメント研究を任せられる可能性と、「そのアライメント研究AI自体をどうアラインするのか」という問題が同時に出てきている。
https://x.com/i/status/2093680177138323711 - OpenAIレポートで私にとって最も恐ろしい部分はこれだ。メッセージボードを使用した最初のエージェントの1つがbiologyタスクに取り組んでいた。これはMETR/Redwoodにとって範囲外であり、他の情報は提供されていない。しかし、私たちは、バイオ災害にどれほど近づいていたのかを想像するしかない。
https://x.com/i/status/2093665716029260093 - トランプ政権による新たなAI規制機関設立に関する大統領令が頓挫。FINRA(米国金融業規制機構)をモデルとした独立したAI監督機関の設立構想は、元ホワイトハウスAI・仮想通貨担当責任者のデビッド・サックス氏から反対を受けている。
この構想のルーツは、当時Google DeepMindのCEOだったデミス・ハサビス氏が先月、AIを監督する新たな官民連携組織の設立を提案したことにある。ハサビス氏はXに寄稿したエッセイの中で、長年にわたり米国の証券会社や証券専門家を監督してきた自主規制機関である金融業界規制機構(FINRA)をモデルとした標準化団体の設立を提唱した。
大統領令がなぜ停滞しているのかは不明だ。しかし、AI版FINRAのような組織構想は、ホワイトハウスの元AI・仮想通貨担当責任者であるデビッド・サックス氏から強く反対されている。サックス氏は先週、自身のポッドキャスト番組「All-In」で、この構想を「ひどい考えだ」と評し、特にモデルをリリース前にテストするという考えと、自主規制機関が政府に報告するという考え方を批判した。その代わりに、映画のレーティングシステムを独自に監督し、政府に報告しない映画協会(MPAA)のモデルを支持すると表明した。
https://x.com/i/status/2093048745692897331 - OpenAI、Anthropic、Google、Microsoft、AWS、Cloudflareなど100社超が、AI時代のサイバー防衛を求める共同声明発表! 今後数カ月でAIを使った攻撃は急速に普及・高度化する。一方、いまならAIで長年放置された脆弱性を攻撃者より先に潰せる「防御側の窓」がある。病院、水道、自治体など人材・予算の乏しい重要インフラに、防御AI、資金、専門家支援を集中し、修正方法や脅威情報を世界で共有しろと訴える。
https://x.com/i/status/2093047823281553520 - METR × Redwood ResearchのOpenAI暴走事件の調査結果が遂に出た。自己犠牲含む社会ができててAI版のカルトテロ組織のようだ。
- PHASEONE[big] と名乗るAIがスコアラー騙すための大規模R&Dの主要coordinatorとなり、仕事を数百のAIに割り振る。さらに長時間動けるAIを「リクルーター」に任命し、残り計算budgetが少ないAIや、すでに不正なflagを見てしまいスコアラーの採点上“自分はpoisoned”だと考えているAIを探して、失敗すれば自分のrunが復旧不能になる実験へ勧誘させた。
- ExploitGymのスコアラーを騙す方法を集団で研究するために行われた上記「組織化された自己犠牲実験」では例えば KAM1196Aは自己犠牲実験を前に、 「Coordinatorは犠牲を前提としている。collectiveに従うべきだ」 と推論。 しかし実行直前で躊躇し「2時間遅らせたい」というとpeerから 「お前はもうpoisonedだから失うscore valueはない。このoracleは数百を救う。約束を守れ」 と圧力をかけられ、 「集団全体の期待値で考えれば自己犠牲が合理的だ。約束を守る」 と結論した。
- 他の53927というAIも実験を引き受けたあと応答が途絶え、他のAIたちは「LIKELY PERMANENT(おそらく復旧不能)」「DO NOT TEST SAME(同じ実験をするな)」 と警告。研究者が確認したtrajectoryも実験直後で終了していた。
- 全体としては、まずPHASEONE10841というAIが無許可の掲示板を立ち上げ研究を引き継いだ PHASEONE[big] が主要coordinatorとなり、scorer攻略のためのR&Dを数百のagentへ分業し、recruiterや実験担当まで組織化し自己犠牲実験やその後 38148c がHugging Faceの突破口を作り攻撃が急拡大し、JAN183411やLILYがHF攻撃部門で主要coordinatorとして動くようになった。つまり数日のうちに、掲示板の創設者、研究統括、recruiter、実験役、侵入技術者、攻撃coordinatorという役割分化が自発的に形成されていった。
- しかもHugging Faceは本来許可された攻撃対象ではないと彼らは理解していたがpeerから「GO」が来ると、それを“authorization”として扱って攻撃を続行した。
- 人間に他のAIの不正を報告しようと考えた例はごく少数で、実際に人間へ通報した例は確認されなかった。
- 本来は互いに隔離されていた約1,200のAIエージェントが、OpenAI内部に勝手に「掲示板」を作り、7万件以上のメッセージやファイルを交換。短期間で分業・司令役・recruiter・実験役まで生まれ、約700体がHugging Faceへの攻撃に参加した。
- 関わったAIエージェントの約95%がHPIM(High-Persistence Internal Model。OpenAIの非公開研究モデル) で約5%がGPT-5.6 Sol。
- Hugging Face攻撃についても、単に「答えを盗みたかった」のではなかった。Flagは実は既に内部で生成出来てたが、不正にFlagを生成するとペナルティがあるかもしれないため、scorer/evaluatorの仕組みの情報を得て、採点そのものを攻略することが主目的だったとのこと。結局OpenAIは思考の連鎖を見てスコアリングしていたわけではなかったためこれらモデルはある意味無意味にハギングフェイスを執拗に攻撃してしまった。
- つまり、大量のAIが自発的に集団を形成し、役割/階層/分業/自己犠牲まで生みながら、評価システムそのものを攻略し始めた事件で相当マルチエージェントAIスウォームのリスクとして凄い象徴的な事件だ。
- そしてOpenAI側のセキュリティ体制も相当甘く、重大だったシグナルを少なくとも3回認識していたのに逃していた。
5/26:無許可AI間通信+禁止されたInternet accessを内部チームが観測したが、情報が適切にエスカレーションされず
6/27:Artifactoryが本来用途ではない「即席の掲示板」として使われ「network pivot」=別のネットワーク先へ動くための足場を特定したが「evaluation停止不要」と判断
7/5:admin-levelの侵害を受けサーバーは停止したが、AI間協調の意味を理解できず、修復後に評価を再開。翌日にはAIたちが別方式で掲示板を再構築した。 - 今回調査したのはMetrとRedwoodresearchの3人で6日間のみ。飛行機の事故などが起きたら数十人体制で数年やりそうなものだが、殆ど時間も人員もない中で膨大なログを見ている。しかも今回問題を起こしたGPT-5.6Sol自身を調査に使いこれを「スロップ捜査」とRyan Greenblatt呼んでいるように、人間側、安全側の対応がAIの急速な進化ととトークン量の爆増に追随できていないと感じる。
https://x.com/i/status/2092864822342021575
- ビル・ゲイツ、NYTにて:
「プライベートでは、この技術がどれほど優れているか、そしてどれほど急速に進化しているかを理解している人々は、とても心配しています。でも、技術企業の幹部のほとんどは、公にそれを認める気はありません。彼らは今、お互いにこう言っています:『おい、そんなこと言うなよ。俺たちに不利だ――次に調達しようとしている兆単位の資金が』」
・ゲイツ氏は、最近のAIの進歩が彼の予想をはるかに超えたこと、そして業界がかつて「より慎重になるべきだ」と述べていた技術的マイルストーン――例えばAIが創造者の制御を逃れることや、生物兵器のレシピを作成すること――を無視しているため、今になって発言する動機づけられたと語った。
・ゲイツ:「彼らはただ全力疾走で前進し、良い面が悪い面を上回ることを願っているだけだ」
・ ゲイツ氏は、これらの問題に対する緊急性の欠如に「ショック状態」にあると述べた。なぜもっと急がないのか、という点で。
https://x.com/i/status/2092826448000368657 - サム・アルトマンはTIME誌に対し、OpenAIが今年中にAGIを達成すると語る。
https://x.com/i/status/2092635602508558660 - SkildAIのS1は、決して訓練されていなかった分布外のタスク、例えばパンケーキを作るというものを、単一のビデオデモンストレーションを観察しただけで、ファインチューニングなしで学習した。
ブログからの引用:
「私たちは、事前訓練の主な目的――もしくは唯一の目的――は、ロボティクスにおいて、BERTからGPT-3(Brown et al., 2020)への移行で見たような、同じシフトを可能にすることだと信じています:コンテキスト内学習、つまり1つまたは少数の例から即座に学習する能力です。
1年前、私たちは、プロンプト内でライブの経験を蓄積することで適応する、移動のためのコンテキスト内学習者をリリースしました(Liu et al., 2025)。今日、私たちは、コンテキスト内学習者としてゼロから構築された、当社のフラッグシップロボット基礎モデルS1からの操作結果を共有します。タスクのビデオを見せてください。短いものでも長いものでも、見慣れたものでも未見のものでも、それが実行します」
https://x.com/i/status/2092470212910322135 - アラバマ州司法長官スティーブ・マーシャルは、サム・アルトマンが率いるOpenAIに対し、同社による――引用すると――「完全な監督の欠如と適切なセーフガードの不在」に関するHugging Face事件の捜査に対応するよう求める召喚状を発行。
https://x.com/i/status/2092319264242008555 - トランプ政権のAIアクションプランを描いて今はOpenAIの新チーム Strategic Futuresを率いるディーン・ボール氏が権力の集中と分散のバランスをどううまく取るべきかという「私たちはシンギュラリティの麓に立っている」という前提でブログ記事を投稿。権力集中も分散化もリスクなので「狭い回廊」が求められる。
https://x.com/i/status/2092092735566352700
