📝 本日のニュース概要
以前お伝えしたAIエージェントの権限境界問題の続報。Claudeを使ったOpenAI内部システム侵入実験が、AIサイバー能力を抽象的な恐怖話から実務レッドチーミング問題へ引きずり出しました。
【事象の全貌と背景】
以前お伝えしたAIエージェントの権限境界・停止条件問題の続報です。今回はさらに生々しい。独立系ホワイトハットの3人組チームHacktron AIが、OpenAIのバグバウンティの一環として、AnthropicのClaudeを使い、OpenAIのコミュニティフォーラムを起点にOpenAI従業員のChatGPT/Codexアカウントへ到達したと報じられています。確認済みの範囲では、これは犯罪的な窃取ではなく、認可された実証侵入です。OpenAIは報告後に問題を修正し、研究者に6500ドルの報奨金を支払ったと報じられています。
重要なのは、AIがハッカー映画的に勝手に暴走した、という話ではないことです。入口、対象、手順、時間、報奨金まで具体化されています。起点はcommunity.openai.comのDiscourse。そこから画像処理、libheifのメモリ不具合、RCE、SSO設定不備、ChatGPT/Codexアカウント、接続済みGitHub、内部モノレポへの無害なpull requestという順でチェーンが組まれました。The Decoderは、攻撃開発が72時間未満で済んだことを、AIが高度な攻撃の時間と専門性コストを下げる例として位置づけています。ここがギーク的に刺さるポイントです。AIサイバー能力は、もはや抽象的な恐怖話ではなく、どのサービスに、どのライブラリに、どの権限連鎖を見せるかという運用判断そのものになっています。
【技術的ディープダイブ】
技術的な入口はHEIF/HEIC画像アップロードです。TechCrunchなどの報道によれば、DiscourseではユーザーがHEIF/HEIC画像を投稿すると、画像変換の過程でImageMagickが使われ、Apple系画像形式の処理ではlibheifにデコードが渡される構成でした。このlibheif側にメモリ不具合があり、細工された画像によってサーバー上で攻撃者の命令を通せる状態、つまりRCEに至ったと説明されています。Tom’s Hardwareは攻撃チェーンをHEIF upload → libheif heap overflow → RCE → OpenAI SSO flaw → ChatGPT/Codex takeover → connected GitHub → internal PRと整理しています。
さらに厄介なのは、単一の脆弱性で終わっていない点です。RCEでフォーラムサーバーを制御できるようになった後、フォーラムのSSO設定不備により、アクティブなフォーラム利用者になりすまし、ChatGPTやCodexアカウントへ到達できる可能性があったと報じられています。研究者らはOpenAI従業員のアカウントにアクセスし、その従業員のCodexがOpenAIのGitHub組織に接続されていたため、内部モノレポに無害なpull requestを作って影響を示しました。
Claudeの役割もポイントです。報道では、Claude Opus 4.8はASLR有効時の信頼できるexploit生成に苦戦した一方、Claude Opus 5ではローカルMac向けの動作exploitを数時間で作り、その後Discourse環境へ適用されたとされています。ここで起きているのは、AIが魔法のゼロデイを発明したというより、複雑なC/C++系画像処理、コンテナ、パッチ差分、ASLR、移植作業を、人間研究者の指示の下で高速に探索・実装したという変化です。攻撃面を十分に見せると、モデルは調査員にも攻撃者にもなる。この二面性が本件の核心です。
【コミュニティの生々しい熱量と議論】
ここは厳密に線を引きます。今回提供された検索結果2には、Reddit、Hacker News、lobste.rs、LessWrongの実コメントや返信スレッドは含まれていませんでした。したがって、実在しない技術者コメントを引用したり、コミュニティがこう言っていたと断定することはできません。Geek Terminal的には本当は、罵倒、称賛、これはただのバグバウンティだ派、いやAIで攻撃コストが崩壊した派、SSO設計こそ本丸だ派の火花を拾いたいところですが、今回は検証可能なコメントデータがないため、そこは捏造しません。
ただし、議論の争点はかなり明確です。第一に、これはClaudeがOpenAIを攻撃した話なのか、それとも人間の研究者がClaudeを高度なexploit開発補助に使った話なのか。確認済み情報からは後者です。第二に、AIモデルの危険性よりも、Discourse、ImageMagick、libheif、SSO、Codex、GitHub接続という権限連鎖の設計問題ではないのか。これも強い論点です。第三に、6500ドルの報奨金で済むバグバウンティとして扱ってよいのか、それともAIエージェント時代の内部境界崩壊の警告として見るべきか。ここが今後のコミュニティ議論の主戦場になります。
【今後の展望とエコシステムへの影響】
今回オワコンになりかけているのは、外部フォーラムだから本丸ではない、サードパーティ製SaaSだから隔離されている、画像アップロード処理は周辺機能にすぎない、という古い安心感です。AIエージェント時代には、周辺機能がID連携を経由して内部ツールに触り、内部ツールがGitHubやクラウド権限に触ります。攻撃者が見るのはアプリ単体ではなく、権限の地形です。
実務への影響はかなり直撃です。企業は、エージェントにどこまでソース、ログ、コンテナ、SSO設定、CI/CD、GitHub接続を見せるのかを再設計する必要があります。AIに攻撃面を見せれば防御側のレッドチーミング能力は上がります。しかし同じ情報は攻撃側にも再利用可能です。だから今後のセキュリティは、モデル単体の安全性だけでなく、エージェントに渡す観測範囲、実行権限、ネットワーク到達性、認証境界、監査ログ、緊急停止条件を束ねたAgentOpsの問題になります。
パラダイムシフトは、脆弱性発見の民主化です。2か月、3人、AI費用3000ドル未満という報道が示すように、かつて国家級・大企業級の専門性が必要だった調査の一部が、小規模チームでも再現可能になりつつあります。これは防御側にとって朗報でもあります。自社の攻撃面をAIで継続的に洗えるからです。同時に悪夢でもあります。攻撃者も同じ加速を得るからです。Claude侵入実験の本質は、OpenAIが破られたという見出しではなく、AIエージェントに現実の攻撃面を見せたとき、72時間でどこまで到達できるのかが実例として出てしまったことにあります。
🔗 情報ソース・引用元
- https://arstechnica.com/ai/2026/09/researchers-used-claude-to-hack-openai/
- https://the-decoder.com/security-researchers-used-anthropics-claude-to-hack-openais-internal-systems-in-under-72-hours/
- https://techcrunch.com/2026/09/18/researchers-used-anthropics-claude-to-hack-into-openai/
- https://officechai.com/ai/hackers-were-able-to-use-claude-to-hack-openai-employee-accounts-and-create-a-pr-in-its-repo/
- https://www.tomshardware.com/tech-industry/cyber-security/hackers-breach-openai-using-claude-tools-gaining-access-to-employee-accounts-and-the-companys-internal-codebase-initiating-a-harmless-pull-request-as-proof-of-the-hack
🎥 このニュースの動画版&音声版はこちら!
🎧 ポッドキャスト版: ラジオ感覚で聴く
※この記事は、Geek Terminalの自律型AIパイプラインによって自動生成・配信されています。
📺 映像と音声でサクッとチェックしたい方は
Geek Terminal 公式YouTubeチャンネルへ!

