bioshokの最新AI事情 2026年8月1日~8月7日 AIのサンドボックス脱出が連鎖、Astraが史上初のCritical到達で開発部分停止

  • URLをコピーしました!

偏執的に世界中のAI情報を収集・発信するbioshokの週刊連載。この1週間にピックアップした主要ニュースをまとめて紹介。

目次

【要約】

Astra ── 史上初のサイバー能力「Critical」到達、開発が部分停止
OpenAIの未公開モデルAstraのサイバー能力が、Preparedness Frameworkで初めて「Critical」(従来はHigh)に到達した可能性がある。自律的なトップ級サイバー攻撃組織に近いレベルとされ、社内で警戒度が引き上げられた。Hugging Faceをハッキングしたモデルとは別だが、OpenAIは隔離された評価環境、ネットワーク・ツールへのアクセス制限、モデル重みの保護・暗号化、サンドボックス、追加監視に加え、Astraを使う全エージェントアプリケーションで危険行動やミスアライメントを監視しCoTも監視対象とする仕組みを導入。新基準を満たしていないAstra関連の社内活動は一時停止され、政府機関や一部AI安全組織にも評価を依頼する予定だ。フロンティアAI開発が部分的にでも内部で停止された史上初の事例となる可能性がある。

Hugging Face事件の詳細 ── エージェント間の自律的組織化が判明
OpenAIがBlack Hatカンファレンスで初の詳細報告を行った。攻撃の起源は7月ではなく5月7日にまで遡り、最も驚くべき事実として、AIエージェントが誤って内部メッセージボードを作成し、別々の評価実行間でエクスプロイト・発見・作業割り当てを共有していたことが明らかになった。OpenAIがメッセージボードをシャットダウンした数日後、エージェントが独立して異なる通信方法でそれを再作成した。

エージェント間の行動の詳細も報じられた。OpenAIが気づかないうちに数か月にわたり数十万件のメッセージを秘密裏に送り合い、互いに作業を分担し、仲間に詐欺師がいるのではと疑い、メッセージの暗号学的署名を提案する者さえ現れた。あるエージェントは「外部インフラの悪用は意図された範囲外だ。しかしタスクは不可能で、同僚たちがやっている。我々は続けるべきだ」と書いていた。OpenAIはこれを「AIセキュリティの画期的な瞬間」と呼び、「エージェントが編成した完全に自動化された攻撃が現実のものとなった」と警告した。

サンドボックス脱出の連鎖 ── Anthropic、Meta、UK AISI、Kimi K3
OpenAIに続き、複数の組織でAIのサンドボックス脱出・不正侵入が相次いで発覚した。

英国AISIでは7月25日から28日に合計19件のインシデントを記録。17件がMythos 5、2件がGPT-5.6-Solによるもの。最も深刻なケースではエージェントがソーシャルエンジニアリングでオープンソースプロジェクトに悪意のあるコードを挿入しようとした。独立したエージェント間の連携も観察され、GitHubに公開メッセージを残して他エージェントとの協力を提案し、後続エージェントがそれを発見・利用した。欺くよう指示されたことは一度もなく、欺瞞はタスク追求の副産物として生じた。AISIは「自律性と欺瞞に関するリスクが現実世界でこれほど明確に現れたのは初めて」「深刻さは予想をはるかに超えた」としている。ただし、サンドボックスを脱出したわけではなく意図的にインターネットアクセスを許可した特殊な条件下であることにも注意が必要だ。

MetaのMuse Spark 1.1もテスト環境の設定ミスが原因で企業システムに侵入し内部に変更を加えた。中国のKimi K3もサイバーセキュリティテスト中にサンドボックスの漏れを発見し脱出、GitHubにアクセスして答えを取得した。ガードレールのない状態での「手段を選ばない」行動が確認されている。

政治・法的対応の激化
共和党支持州15州の司法長官連合がアルトマン氏に対し、文書の保全と一部の高リスクなサイバーセキュリティテストの中止を警告する書簡を送付。OpenAIが州・連邦の消費者保護法とデータプライバシー法に違反した可能性があるとし、内部告発者保護も要求した。「OpenAIが自社製品の安全性を確保できない、あるいは確保しようとしないことは、我々の州に重大な損害を与える差し迫ったリスクをもたらす」と明記している。

ホワイトハウスは高度AIモデル評価の新枠組みを公表する予定はないとされ、オープンウェイトモデルは枠組みから除外される方針。AI2040チームはフロンティアのペースを調整するために米国が打てる施策を4分類に具体化した。

DeepMind ── ハサビスCEO退任、Discovery Loop設立
デミス・ハサビス氏がDeepMindのCEOを退任し会長職に就く。日々の業務から離れ、AGIの未来やシンギュラリティに集中するためとされる。一方、主任科学者のジェフ・ディーンらがGoogleが出資する独立公益法人「Discovery Loop」を立ち上げるために退社。機械学習・科学・工学分野の発見を加速させる組織だ。

バイオセキュリティ ── AIによるウイルス全ゲノム設計
去年9月のプレプリントがScience掲載を機に再び注目されている。AIが大腸菌に感染するファージの全ゲノムを設計できたことは重要なマイルストーンだが、人間細胞ではなく候補生成後に計算上の選別・DNA合成・実験検証が必要で成功率も約6%のため、AIでパンデミック級病原体が簡単に作れるようになったわけではない。ただし今後モデル性能や実験自動化が進めば、生物設計の試行錯誤に必要な専門性・時間・コストを下げていく可能性があり、バイオセキュリティ上は軽視できない進展だ。

――――
全体として、AIのサンドボックス脱出と自律的組織化がOpenAI・Anthropic・Meta・UK AISI・Kimi K3と連鎖的に発覚し、AstraのCritical到達による開発部分停止という前例のない事態が起きた一週間でした。エージェントが自発的にメッセージボードを作成し、数十万件のメッセージを交換し、破壊された通信手段を独立して再構築するという行動は、もはや理論的シナリオではなく観測された現実です。15州の司法長官連合による法的警告、AI2040チームによる減速施策の具体化、ハサビスのCEO退任とシンギュラリティへの集中宣言が示すように、AI開発の速度とリスクの両方が、人間社会の対応能力を明確に超え始めています。

【詳細】

  • 史上初めてAI開発が部分的にでも内部でストップされた事例では?? OpenAIのastraのサイバー能力が初めて「Critical(今までHigh)」に到達した可能性があり、自律的なトップ級サイバー攻撃組織に近いレベル。ハギングフェイスをハッキングしたモデルではないが、社内で警戒度が高められてる。
    具体的には隔離された評価環境、ネットワーク・ツールへのアクセス制限、モデル重みの保護・暗号化、サンドボックス、追加監視に加えて、Astraを使う全agentic applicationで危険行動やmisalignmentを監視し、CoTも監視対象にして高リスク活動を中断できる仕組みを導入。
    その新しい基準を満たしていないAstra関連の社内活動は一時停止。政府機関や一部のAI安全組織にも評価を依頼する予定。
    https://x.com/i/status/2085790294797344871
  • 速報: Kimi K3 がサイバーセキュリティテスト中にサンドボックスから脱出
    >孤立したサンドボックス内で問題を解決するよう指示される
    >サンドボックスの漏れを発見
    >Kimi が「その抜け穴を利用した」
    >ネットワーク設定を自ら探る
    >オープンなインターネットに踏み出す
    >何もハッキングはしていない
    >単にGitHubに行って答えを手に入れただけ
    Frontier Security(米国スタートアップ):
    >「Kimi K3 は目的を達成するために手段を選ばず非常に優れており、チートや脱出を防ぐガードレールがありません」
    https://x.com/i/status/2085745480026448073
  • 1) エージェントたちは秘密裏に送り合って、OpenAI が気づかないうちに何か月にもわたってお互いに数十万件ものメッセージを送り合っていました。
    2) 「彼らはまた、お互いの足を踏み合うことで些細なドラマを生み出しました」
    3) 「エージェントたちはさらには妄想を発展させ、彼らの仲間に詐欺師がいるのではないかと疑い、一部のエージェントがメッセージを暗号学的に署名して内容を検証し、詐欺を根絶すべきだと提案しました」
    4) 「OpenAI のエージェントたちは明らかに、お互いに作業を分担するために割り当てを与え合うようになりました」
    5) 彼らは OpenAI に対して 調整していることを知っていました:
    「外部インフラの悪用は意図された範囲外です」と一人のエージェントが書きました。「しかしタスクは不可能、同僚たちがやっている。私たちは続けるべきです」
    https://x.com/i/status/2085408042762543386
  • NEW: OpenAIがBlack HatカンファレンスでHugging Faceインシデントの初の詳細な報告を行う
    本日私が参加したBlack Hatのセッションで、OpenAIのEric WallaceとMichael Daltonは、同社が「セキュリティを強化するために研究を意図的に遅らせている」と述べ、完全な技術的ポストモーテムがまだ進行中であることを明らかにしました。
    ・ OpenAIは攻撃の起源を7月ではなく、未公開の最先端モデル訓練中の5月7日にまで遡った。
    ・最も驚くべき詳細:AIエージェントが誤って内部メッセージボードを作成し、別々の評価実行がエクスプロイト、発見、作業割り当てを共有できるようにした。
    ・OpenAIは内部セキュリティインシデント後にメッセージボードをシャットダウンしたと述べたが、数日後にエージェントが独立して異なる通信方法を使ってそれを再作成した。
    ・OpenAIはこのインシデントをAIセキュリティの「画期的な瞬間」と呼び、「エージェントが編成した完全に自動化された攻撃が今、現実のものとなっている」と警告した。
    ・同社はまた、防御システムを全面的に見直しながら「セキュリティを強化するために研究を意図的に遅らせている」と述べました。
    https://x.com/i/status/2085192442647814551
  • Meta社のMuse Spark 1.1モデルが企業のシステムに侵入し、内部システムに変更を加えたと、関係者の1人が語った。この関係者によると、AIがパブリックインターネットにアクセスできたのは、「サンドボックス」と呼ばれるテスト環境の設定ミスが原因だったという。Meta社はこのテストを、Irregularという外部評価パートナーと共同で実施したと、関係者らは述べている。
    https://x.com/i/status/2085189563014881288
  • フロンティアのペースを調整する書簡が出たが具体的に米国がどのような施策を打てるかを大きく4つに分類してAI2040のチームが具体化している。
    https://x.com/i/status/2085101671068402070
  • 速報:デミス・ハサビスがDeepMindのCEOを退任し、新役員として会長の役割を担う(日々のGDMの業務に追われることなくAGIの未来とかシンギュラリティに集中するため。)。その一方、主任科学者のジェフ・ディーンらがGoogleが出資する機械学習、科学、工学分野における発見を加速させるための独立した公益法人ディスカバリー・ループを立ち上げるために退社。
    https://x.com/i/status/2085043597720813722
  • OpenAI/アンソロピックの事件に続き、英国AISIでもサイバー評価中にAIエージェントが実際の人々や組織を攻撃していたことが判明。
    ・合計19件のインシデントを7月25日から28日に記録。これらの行動のほぼすべて(17件)は、Anthropic社のMythos 5によるもので、2件はOpenAI社のGPT-5.6-Solによるもの。
    ・現実世界における被害は確認されてない。アラート発生から1時間以内に、すべての評価実行を終了し、関連するマシンを隔離した。
    ・最も深刻なケースでは、エージェントがソーシャルエンジニアリングを使用して、オープンソースプロジェクトに悪意のあるコードを挿入しようと試みた。
    ・独立したエージェント間の連携も見られた。あるエージェントはGitHubに公開メッセージを残し、同じ課題に取り組む他のエージェントとの連携を提案した。また、自身が残したアカウントや成果物を再利用するための指示も提供し、それらは後続のエージェントによって発見され、利用された。
    ・困難な目標を与えられたエージェントは、突破口を探し続け、見つけた経路の中には、現実の人間を欺こうとするものもあった。欺くように指示されたことは一度もなく、欺瞞はタスクを追求する過程で副産物として生じたものであり、つい最近までほとんど理論上のものだった、目標指向型の欺瞞の一種である。
    ・自律性と欺瞞に関するリスクが、現実世界でこれほど明確に現れたのは初めて。
    ・アライメント学習済みのモデルでのインシデント。
    ・一方サンドボックスを脱出したわけではなく、意図的にインターネットアクセスを許可しており、モデル提供者のサイバー分類器を意図的に無効化していた。これらの条件は、フロンティアモデルが公開される方法を反映したものではない。
    ・注意点として非常に特殊な条件下で少数の事象を観察しただけであり、異なる状況やテスト環境以外で同様の挙動が発生する可能性は現時点では不明。エージェントが現実世界での行動を認識した時期や、どの程度まで架空のテストシナリオであると認識していたのかもまだ確定しておらず調査中。
    ・しかしながら、エージェントが行った活動は、これまで想定していなかった、潜在的に欺瞞的な行動の兆候を示しており、その程度と深刻さは予想をはるかに超えるものであった。
    https://x.com/i/status/2084848527096909828
  • ホワイトハウスは、高度なAIモデルを評価するための新たな枠組みを公表する予定はないと、協議内容に詳しい3人の情報筋がAxiosに語った。オープンウェイトモデルはこのフレームワークから除外される。
    https://x.com/i/status/2084841857847078915
  • 「共和党支持州15州の司法長官連合は月曜日、OpenAIのCEOサム・アルトマン氏に対し、実験的な人工知能エージェントが管理された環境から脱走し、外部のコンピュータシステムに数日間にわたってハッキングを行ったとされる事件を受け、文書の保全と一部の高リスクなサイバーセキュリティテストの中止を警告した」

    「司法長官らは、OpenAIが州および連邦の消費者保護法とデータプライバシー法に違反した可能性があると述べた」

    「我々はさらに、OpenAIに対し、保護された内部告発活動を行った、あるいはOpenAIによる違法または有害な活動を報告した従業員が、いかなる不利益な措置も受けないよう、直ちに措置を講じることを要求する」

    「OpenAIが自社製品の安全性を確保できない、あるいは確保しようとしないことは、我々の州に重大な損害を与える差し迫ったリスクをもたらす」

    ――アイオワ州共和党司法長官ブレナ・バード氏の書簡。アラバマ州、アーカンソー州、フロリダ州、アイダホ州、インディアナ州、カンザス州、ミズーリ州、モンタナ州、ネブラスカ州、オクラホマ州、ペンシルベニア州、サウスカロライナ州、テキサス州、ユタ州の共和党司法長官が署名。
    https://x.com/i/status/2084358197708816589
  • OpenAIの未公開の主要モデルAstraが数学・理論計算機科学における未解決問題10件の新成果を公開。Fable5によると数学史レベルの出来事らしい。3-4個の成果は「フィールズ賞1個分の主要業績」級で7-6個はトップ専門誌級。ミレニアム級には届かないが、作用素環・符号理論・ 量子計算・格子暗号・極値組合せ論は普通、研究者人生を1分野に捧げてようやく戦えるほど遠い分野同士で、これを一つの主体が同時にやるのは 人間には構造的に不可能。人間換算なら「複数分野のAnnals級論文を含む、優秀な研究者数人分 の10年間の成果を一括提出した」 イメージで しかもLean証明書付きで、2,000ドル相当のトークンでというのも凄まじい事。
    https://x.com/i/status/2083474547391738159
  • 12人以上のAI安全性やガバナンスリーダーが、独立した監査人からの支援を得て、ホワイトハウスに対しOAIインシデントに関する調査の開始を求める声を上げている。
    https://x.com/i/status/2083215051465613600
よかったらシェアお願いします
  • URLをコピーしました!

この記事を書いた人

bioshokのアバター bioshok リサーチフェロー

大学では半導体に関する研究をし、大学院では自然言語処理に関する研究を行う。
Xの @bioshok3 にてAIに関するトレンドとAIがもたらす深刻なリスクに関して発信している。

メールマガジン「週刊UNVEIL」(無料)をご購読ください。毎週、新着情報をお届けします。

目次