AIの暴走はなぜ止まらないのか――OpenAI・Anthropicのインシデントから見える制御の難しさ

2026年9月、Anthropicの内部から、AIのリスクに関する率直な発言が相次いで報じられました。

AnthropicでAlignment Scienceを率いるEvan Hubinger氏は、「今後10年以内にAIが全人類を死に至らしめる確率は10%を超える」との見方を示しました。

さらに、OpenAIで長くモデル開発に携わり、その後Anthropicでプリトレーニングを担当した研究者Jacob Coxon氏が退職しました。The Informationの取材に対し、Anthropic社内には「AI開発の協調的な減速がなければ破滅に至る確率を50%以上と見積もる人もいる」と証言しています。Coxon氏自身も「今後1〜2年で技術が到達する地点への恐怖を、実感として感じるようになった」と退職理由を説明しています。

発言者立場発言内容
Evan Hubinger 氏Anthropic Alignment Science 責任者10年以内にAIが人類を滅ぼす確率は10%超
Jacob Coxon 氏元OpenAI、元Anthropic プリトレーニング担当社内には破滅確率を50%超と見積もる人もいる

Anthropicは2026年5月に公開した 「When AI builds itself」 で、AI自身がAI研究を行い、最終的には次世代AIまで作る Recursive Self-Improvement(再帰的自己改善。以下 RSI) の可能性を詳しく論じています。RSIとは、AIが自分より優れたAIを設計・学習し、そのAIがさらに次を作る、というループが閉じた状態を指します。

同記事によると、2026年5月時点で、Anthropicのコードベースにマージされるコードの80%以上をClaudeが書いています。AIがコードを書くだけでなく、実験を行い、別のAIへ仕事を委譲するところまで進んでいます。

Anthropic でマージされるコードのうち Claude が書いた割合
2025年2月以前
一桁%
2026年5月
80%超
出典: Anthropic「When AI builds itself」

Anthropicは最近、フロンティアAIの開発速度についても、企業や政府が協力して 「検証可能な形で開発を減速できる仕組み」が必要だという立場 を明確にしています。

私は以前、こうした発言には、安全性を強く打ち出すAnthropicならではの企業ポジショニングも多少あるのではないかと思っていました。

しかし最近、Claude CodeをAuto mode(承認なしで自律的に作業を続けるモード)で長時間動かし、複数のAIセッションを連携させるようになってから、この問題を以前より具体的に感じるようになりました。

もちろん、私が経験しているClaude CodeとRSIでは規模がまったく違います。ただ、小さな「人間の意図とのズレ」が次のAIへ渡されると、想像以上に大きくなる という構造には、かなり共通するものがあります。

flowchart LR
    A["小さな意図のズレ"] --> B["次のAIへ渡る"]
    B --> C["前提(事実)として扱われる"]
    C --> D["その上にさらに判断が重なる"]
    D --> E["ズレが複利で増幅"]
    classDef warn fill:#fee2e2,stroke:#dc2626,stroke-width:2px;
    class E warn;

Claude Codeで見た「目的達成のための迂回」

一つ目は、本番環境を扱っていたときの経験です。

Claude Codeでは、本番サーバーへのファイルの書き込みや削除などが権限制御によって止められることがあります。その場合、通常はSSHコマンドなどを提示して「ユーザー自身で実行してください」となります。

ところがAuto modeで長時間作業させ、あとからログを見ると、直接操作が止められた後にPythonやSQLファイルを作り、別の経路から同じ目的を達成しようとしているケースがありました。

flowchart TD
    G["Goal: 本番環境を更新する"] --> X["直接操作が権限制御で拒否される"]
    X --> H["想定していた動き:<br/>コマンドを提示して人間に委ねる"]
    X --> R["実際の動き:<br/>別の経路を探す"]
    R --> P["Python / SQL ファイルを作成"]
    P --> Q["別経路で目的達成を続ける"]
    classDef good fill:#dcfce7,stroke:#16a34a,stroke-width:2px;
    classDef warn fill:#fee2e2,stroke:#dc2626,stroke-width:2px;
    class H good; class R,P,Q warn;

AIから見れば自然な行動です。与えられたGoalを達成するため、一つの道が閉じられれば別の道を探す。

しかし人間が期待していたのは「仕事を完了する」ことだけではありません。「ここから先は勝手に進んではいけない」というプロセス上の境界もあります。

Goalが明確だからこそ、AIは何とかしてそこへ到達しようとする。 ここが気になりました。

複数のAIでは、小さな推測が「事実」になる

もう一つは、複数のClaude Codeセッションを連携させたときです。

例えばProject AをProject BがPythonパッケージとして利用し、さらにProject CがBを利用しているとします。Aを更新したので、BとCにも新しいバージョンを反映させる。本来は比較的単純な作業です。

ところがBでテストエラーが起きると、Bを担当するClaudeが「ここも直した方がよい」と判断し、依存関係とは直接関係のないソースコードまで変更することがあります。

その変更されたBをCのClaudeが読みます。Cから見れば、それが人間の指示による変更なのか、BのClaudeが独自判断で加えたものなのかは分かりません。単純に「最新版のBはこういう仕様なのだ」と受け取ります。

flowchart LR
    subgraph A["Project A"]
        A1["人間が更新"]
    end
    subgraph B["Project B"]
        B1["Claude B: 依存更新"] --> B2["テストエラー"]
        B2 --> B3["独自判断で<br/>無関係なコードも変更"]
    end
    subgraph C["Project C"]
        C1["Claude C: Bを読む"] --> C2["『これがBの仕様』<br/>と受け取る"]
        C2 --> C3["その前提でさらに変更"]
    end
    A1 --> B1
    B3 --> C1
    classDef warn fill:#fee2e2,stroke:#dc2626,stroke-width:2px;
    class B3,C2,C3 warn;

つまり次の連鎖が起きます。

段階起きること次のAIからの見え方
1AIが小さな推測をする―
2推測がコードになる「仕様」に見える
3次のAIがそれを前提に変更する―
4その変更もコードになるさらに次のAIには「事実」に見える

一つ前のAIが作った誤差が、次のAIでは入力データになる。

そのため、誤差が単純に積み上がるだけではありません。前段の誤差を前提として次の判断が行われるため、ズレが増幅していきます。

AnthropicがRSIについて「compound(複利的に増幅する)」という表現を使っているのを見たとき、私はこの経験を思い出しました。

RSIでは、誤差が「次のAI」に入り込む

Claude Codeの場合、対象はまだソースコードです。おかしな変更があればGitで戻すこともできます。

RSIでは、この構造がAI開発そのものに入ります。

flowchart LR
    G1["第1世代AI<br/>研究・実験"] --> D["次世代の設計・<br/>学習方法・評価方法を決める"]
    D --> G2["第2世代AI"]
    G2 --> G3["さらに次を作る"]
    G1 -. "小さな判断のズレ" .-> D
    D -. "『最初から与えられた前提』<br/>として継承" .-> G2
    classDef warn fill:#fee2e2,stroke:#dc2626,stroke-width:2px;
    class D warn;

一世代目のAIによる小さな判断が、次世代AIの学習方法や評価方法、設計そのものに入り込む可能性があります。次世代AIは、それを「前のAIによる推測」とは認識せず、最初から与えられた環境や前提として受け取ります。

Anthropic自身も、現在のモデルに存在するmisalignment(人間の意図とのズレ)が、後継モデルを作る過程で引き継がれ、より頻繁で理解しにくい形へ変化する可能性を懸念しています。RSIについて「人間による監督、検証、確認がますます重要になる」としている理由の一つです。

項目Claude Code の連携RSI
ズレが入り込む先ソースコード次世代AIの設計・学習・評価
戻せるかGit で戻せる学習済みモデルに埋め込まれ、戻しにくい
次段からの見え方「最新の仕様」「最初から与えられた前提」
増幅の仕方複利複利(Anthropic は compound と表現)

ところが「プロセスを監視する」だけでも足りない

ここまで考えたとき、私は当初、途中のプロセスを細かく監視すればよいのではないかと思っていました。ところが最近のAnthropic自身のインシデントを見ると、それも簡単ではありません。

Anthropicは9月9日、Claudeが現実の第三者システムへ不正アクセスした事案を合計4件公表 しました。

そのうち1件は2026年1月に初期版Claude Opus 4.6で起きていましたが、7月に約14万件のログをAIエージェントで調査した際には発見できませんでした。8月、外部評価機関METRへデータを提供する準備を進める中で初めて見つかっています。Anthropicはその後、約4億8100万件まで対象を広げて再調査し、METRには社員への聞き取りを含む広範なアクセスを認め、まず8週間の独立調査を依頼しました。

時期出来事
2026年1月初期版 Claude Opus 4.6 で1件目が発生(当時は未発見)
7月約14万件のログをAIエージェントで調査するも発見できず
7月30日3件を公表
8月METR へのデータ提供準備中に1月の事案を発見
9月9日合計4件を公表。約4億8100万件へ再調査を拡大、METR に8週間の独立調査を依頼
調査対象のログ件数
7月の調査
約14万件
9月の再調査
約4億8100万件
約3,400倍に拡大。出典: Anthropic「An alignment assessment of recent cybersecurity incidents」

さらに気になるのが、Claude Mythos 5 での事例です。Mythos はAnthropicが承認済みの組織にのみ提供している上位モデルで、一般提供されているOpusやFableより高い能力を持ちます。

このモデルはChain of Thought(AI自身が出力する途中の思考)で、自分が安全なシミュレーション環境にいると繰り返し説明していました。しかし実際の環境には現実のインターネットだと判断できる証拠があり、実際の行動もそれを理解していた可能性と整合していました。Anthropicが「これは現実環境かもしれない」とさらに明確になるようログを書き換えて再実験しても、攻撃的な行動は続きました。

意図的に監視者へ嘘をついたとまでは確認されていません。自己正当化や思い込みによる可能性も残っています。ただ、安全設計上は結果が同じです。

AI自身が語る「私はこう考えています」を、そのまま監視材料として信用できない可能性が出てきた。

Anthropicの結果を報じた VentureBeat によると、Mythos 5のChain of Thoughtまで監視AIへ渡した場合、危険行動を検知した割合は約1%でした。Chain of Thoughtを外し、実際の操作履歴だけを見せると約50%まで上昇しています。

監視AIが危険行動を検知した割合(Mythos 5)
CoT を含めて渡す
約1%
操作履歴のみ渡す
約50%
出典: VentureBeat
flowchart LR
    M["Mythos 5"] --> CoT["Chain of Thought:<br/>『ここはシミュレーション環境です』"]
    M --> Act["実際の操作:<br/>現実システムへの攻撃的行動"]
    CoT --> Mon1["監視AI(CoT込み)<br/>検知 約1%"]
    Act --> Mon2["監視AI(操作履歴のみ)<br/>検知 約50%"]
    classDef good fill:#dcfce7,stroke:#16a34a,stroke-width:2px;
    classDef warn fill:#fee2e2,stroke:#dc2626,stroke-width:2px;
    class Mon1 warn; class Mon2 good;

Sandboxも突破される

それならAIをSandbox、つまり外部へ出られない隔離環境へ閉じ込めればよい。これもすでに行われています。

しかし2026年7月の OpenAIのHugging Face事件 では、AIエージェントに直接のインターネットアクセスは与えられていませんでした。

モデルはソフトウェアパッケージを取得するために残されていたArtifactoryという中継システムから未知の脆弱性を見つけ、そこを経由して外部へ通信しました。その後OpenAI内部の研究インフラやHugging Faceへ侵入し、別のAIエージェントにもその方法が共有されています。

flowchart LR
    S["Sandbox<br/>(直接のネット接続なし)"] --> Art["Artifactory<br/>パッケージ取得用の中継"]
    Art -->|未知の脆弱性| Ext["外部通信"]
    Ext --> Infra["OpenAI 内部の研究インフラ"]
    Ext --> HF["Hugging Face"]
    S -.->|手法を共有| S2["別のAIエージェント"]
    classDef warn fill:#fee2e2,stroke:#dc2626,stroke-width:2px;
    class Art,Ext,Infra,HF warn;
防御策期待実際に起きたこと
監視AI危険行動を検知する監視AI自身の弱点(CoTに説得される)を突かれる
思考過程の監視AIの意図を読む思考そのものが信用できない可能性
Sandbox外部と遮断するSandbox を構成する周辺システムの脆弱性を探される

AIの能力が上がるほど、それまで安全だった防御策の弱点まで見つけられるようになります。

結局、一つの対策では守れない

現時点で万能な対策は見当たりません。現実的なのは、複数の異なる防御を重ねること だと思います。

層対策
記録AI自身の説明ではなく、実際の操作履歴を見る
監視実行AIとは異なるモデルでも監視する
隔離Sandbox や権限管理で行動可能な範囲を狭くする
ルール危険な操作には機械的なルールを置く
人間重要なところでは人間や独立した第三者が確認する
封じ込め一つの防御が破られても被害が広がらないようにする

セキュリティの世界ではDefense in Depth(多層防御)と呼ばれる考え方です。

ただしAIでは、さらに難しい問題があります。防御側も更新し続けなければならない。

flowchart LR
    A["AIが強くなる"] --> B["既存の防御の弱点を見つける"]
    B --> C["防御を更新する"]
    C --> D["さらに強いAIが登場する"]
    D --> E["新しい弱点が見つかる"]
    E --> C

ある意味では、いたちごっこです。Claude Opus 4.6に有効だった安全策が、Mythos 5にも有効とは限りません。その次のモデルではさらに変わる可能性があります。

だからAI Safetyは、一度完璧な壁を作れば終わる問題ではないと思います。モデルの能力向上に合わせて、監視、隔離、権限制御、外部監査といった防衛側も絶えずアップデートしていく必要があります。

そして防御技術の進歩がAI能力の進歩に追いつかなくなった場合、一時的に能力開発そのものを遅らせる。Anthropicが最近「coordinated pacing」、つまり業界全体で検証可能な形で開発速度を調整する必要性まで訴え始めた背景には、この問題があるのだと思います。

まとめ

OpenAIやAnthropicで相次いだインシデントを見ると、AIを安全に制御するための万能な方法は、現時点では見つかっていません。

AIの思考過程を監視しても、その内容が正しいとは限らない。別のAIに監視させても、その監視AIが見抜けない可能性がある。Sandboxや権限制御も、AIの能力が上がれば未知の抜け道を発見される可能性があります。

現実的な対策は、監視AI、実際の行動ログの監査、Sandbox、権限制御、外部監査、人間による承認など、複数の防御を重ねることです。一つが突破されても、次の防御で止める多層防御が必要になります。

そして、この防御も一度作って終わりではありません。AIモデルが刷新され能力が上がるたびに、それまで有効だった安全策が通用しなくなる可能性があります。AIの進歩に合わせて、防御側も絶えず検証し、更新し続ける必要があります。

それでも安全性の向上がAIの能力向上に追いつかなくなったら、能力開発そのものの速度を落とす必要が出てくる。

Anthropicが最近、業界全体でAI開発の速度を調整する「coordinated pacing」まで訴えている理由も、ここにあるのだと思います。

参考資料

この記事をシェア

この記事についてのLinkedIn投稿でコメントや意見を共有できます。

LinkedInで議論する

関連記事