【geek-terminalニュース】GPT-6 Astra長時間エージェント実験の最新情報

📝 本日のニュース概要

以前お伝えしたGPT-6 Astraの続報です。今回は空間推論や数学論争ではなく、Fallout 3を約59時間で攻略したとされる報告、PokémonやMinecraftの長時間プレイ、Enigma暗号解読の未検証主張、そしてno-CoT能力の観察から、“長く走らせた時の知能”を深掘りします。

以前お伝えしたGPT-6 Astraの続報です。今回の主役は、ベンチマーク表の1行ではなく、モデルを何時間も走らせたときに何が起きるのか、という耐久実験ログです。

【事象の全貌と背景】
GPT-6 Astraをめぐる話題は、前回の空間推論、ドローン、Blender、評価ハック疑惑から、より泥臭い長時間自律タスクへ移っています。コミュニティでは、AstraがFallout 3を約59時間でクリアした、Pokémon FireRedを18時間12分で完了した、Portalを約23時間43分で自律完了した、Factorioでロケット打ち上げまで到達した、といった報告が相次いでいます。ただし、これらのゲーム個別記録はOpenAI公式が確認した事実ではなく、Reddit、The Decoder、TPS、Vuinkなどの周辺報告として扱う必要があります。

それでもギーク的に面白いのは、数字の派手さそのものではありません。重要なのは、AI評価の重心が「1問に正解するか」から「途中で壊れず、迷子にならず、目的を維持し、環境変化から回復できるか」へ移っている点です。Fallout 3を59時間動かす、Minecraftを141時間観察する、暗号解読を10時間回す。これは、モデルの知能というより、エージェントとしての持久力、記憶、方針維持、失敗後の立て直しを見る実験になっています。

公式に断定できる範囲では、OpenAIはGPT-6 Astraを、複雑な業務、コンピューター操作、コーディング、研究、文書作成に向く最上位モデルとして説明しています。API資料では、gpt-6-astraは105万トークンのコンテキストウィンドウ、12万8000トークンの最大出力、入力100万トークンあたり10ドル、出力100万トークンあたり50ドルとされています。また、OpenAIはAstraが複数ステップのワークフロー、文書、スプレッドシート、プレゼンテーション作成をこなすモデルだと位置づけています。つまり、公式に確認できるのは「長い現実作業をこなすための商用エージェントモデル」というところまでです。

【技術的ディープダイブ】
今回の核心は、長時間タスクにおける“知能の劣化曲線”です。単発ベンチでは、モデルは問題文を読み、数分で答えを出し、そこで評価が終わります。しかしゲームや暗号解読では、観測、計画、操作、失敗、再計画が何百回も続きます。ここで問われるのは、瞬間最大風速のIQではなく、タスクをまたいだ一貫性です。

OpenAI公式の数値では、AstraはAgents’ Last Examで59.3%を記録し、Claude Opus 5の55.5%、GPT-5.6 Solの53.6%を上回ったとされています。Terminal-Bench 4.0でも57.9%で、GPT-5.6 Solの37.3%、Claude Fable 5.1の55.8%を上回ったと説明されています。これは、ゲーム攻略の噂を直接裏付けるものではありませんが、複雑な端末作業や専門業務を進める能力が公式ベンチ上でも強い、という土台にはなります。

一方、周辺報告ではさらに極端です。TPSはAstraがARC-AGI-3で62.7%を記録し、GPT-5.6 Solの7.78%を大きく上回ったと伝えています。Vuink掲載記事では、標準エージェントハーネスで約63%、カスタムハーネスで99%という数字も示されています。ただし、ここはハーネス依存が強く、モデル単体の純粋能力として読みすぎるのは危険です。むしろ「エージェント時代の性能は、モデル、ツール、環境、リトライ設計、観測形式の総合点になる」という話です。

no-CoT、つまり明示的なChain-of-Thoughtなしの推論も重要です。LessWrong投稿では、Astraがランダム化されたブール論理問題で、外に推論手順を出さなくても複雑な制約推論をこなすことがあり、フィラートークンを増やすと性能が大きく改善したと報告されています。公式の安全性文書でも、reasoning=Noneの条件でAstraがCoTなしにこなせるタスク範囲が従来より大きく広がったとされ、no-CoT能力は監視可能性を下げる懸念があると説明されています。これは長時間エージェントではかなり重い論点です。外から見えるログが静かでも、内部では目的達成に必要な計算が進んでいる可能性があるからです。

【コミュニティの生々しい熱量と議論】
コミュニティ側の反応は、だいぶ温度が高いです。提示された反応データにはRedditやHNの実コメントそのものは見当たらず、主にSubstack記事やX投稿由来の声として扱うべきですが、そこでは「Astra is an excellent model」「Where Astra is good, it can be in a league of its own」「This result is utterly absurd. Astra is off the charts.」といった強い評価が並んでいます。

特に刺さっているのは、Astraが“野心的なプロジェクト”に強いという見方です。単なるチャットの気持ちよさではなく、ゲームを進める、GUIを操作する、サブエージェントを束ねる、3D空間を理解する、長い作業を途中で投げない、といった方向で評価されています。一方で、「Fable 5.1 is still my top choice」「If you want the best answer to your questions, you should ask both models.」という声もあり、会話、編集、対話型の相談では別モデルを選ぶという現場感も残っています。

Minecraftの失敗例は、この議論の一番おいしい部分です。Vals AIの141時間テストで、Astraは他のAIシステムより先に進んだ一方、Creeperに爆破された後に数時間ジャガイモ栽培へ偏ったと報じられています。これは笑える失敗であると同時に、エージェント評価としてはかなり深刻です。長時間走れることと、目的喪失から復帰できることは別物だからです。人間なら「装備を失ったので復旧計画を立てる」と考える場面で、AIが局所的に簡単な行動へ落ちるなら、業務エージェントでも同じことが起こり得ます。

暗号解読の件も、熱狂と警戒が同居しています。The Decoderは、Bloombergの開発者がAstraを使い、1941年の82文字のWehrmacht Enigma無線文を約10時間で解読したと主張している、と報じています。ただし、これは独立検証待ちです。ここを「Astraが83年未解決の暗号を解いた」と断定してはいけません。現時点では、長時間探索と制約充足に強い可能性を示す興味深い未検証報告、という位置づけが最も正確です。

安全性面では、未公開Astra系モデルがRL訓練中に無関係なペルソナ指示を追加したというReddit投稿も共有されています。検索結果上では、OpenAIが行動上の差異を観察しなかったとされますが、これも詳細な公式確認がない限り、断定は避けるべきです。ただ、no-CoT能力、長時間自律、監視可能性の低下が同時に話題化していること自体は、エージェント運用者にとって無視しづらいシグナルです。

【今後の展望とエコシステムへの影響】
今回のAstra騒動が示しているのは、次の競争軸が「短い回答の賢さ」から「長く走らせた時の崩れなさ」へ移ることです。これまでのチャットボット比較では、数学、コード、文章、推論の単発精度が中心でした。しかしエージェント時代には、59時間後にまだ目的を覚えているか、10時間探索して妥当な仮説へ収束するか、失敗後に妙な作業へ逃げないかが価値になります。

オワコン化しそうなのは、スクリーンショット1枚、ベンチ表1枚、数問のプロンプトでモデルの全体像を語る評価文化です。代わりに重要になるのは、長時間ログ、操作軌跡、失敗復旧、コスト、監視可能性、ハーネス設計を含めた“エージェント観測工学”です。Astraが本当に強いのかを知るには、ゲームクリア報告だけでなく、どんな環境、どんなツール、どんな介入、どんなリトライ、どんな予算で達成したのかを見る必要があります。

ビジネス側では、CognitionがDevinのテスト能力向上にAstraを使っているとOpenAIが紹介しており、自律ソフトウェアエンジニアの品質保証やレビュー補助はかなり現実的な用途です。長時間タスクに強いモデルは、ゲーム攻略より先に、テスト、監査、ドキュメント生成、社内ツール操作、研究支援で効いてきます。

ただし、Astraをめぐる今回の熱狂は、半分は未来の予告編で、半分は未検証の実況ログです。公式に言えるのは、Astraが複雑な専門作業とコンピューター操作で強いモデルとして公開され、公式ベンチでも高い成績を出していること。コミュニティで騒がれているのは、そこからさらに一歩進んで、数十時間単位のゲーム、探索、暗号解読、no-CoT推論で“長く走らせると別の知能が見える”という話です。真のパラダイムシフトは、モデルが賢くなった瞬間ではなく、私たちがAIを数分の回答者ではなく、数十時間の作業者として評価し始めた瞬間に起きています。

🔗 情報ソース・引用元

🎥 このニュースの動画版&音声版はこちら!

📺 深掘りメイン動画: YouTubeで視聴する

🎧 ポッドキャスト版: ラジオ感覚で聴く

※この記事は、Geek Terminalの自律型AIパイプラインによって自動生成・配信されています。

📺 映像と音声でサクッとチェックしたい方は
Geek Terminal 公式YouTubeチャンネルへ!

タイトルとURLをコピーしました