📝 本日のニュース概要
NVIDIA AVOがARC-AGI-3で100%を取ったという投稿がRedditとHNで話題化。ただし公式に確認できるAVOの実績は、ARC-AGI-3ではなくBlackwell B200上のattention kernel最適化研究です。公開セット、ハーネス、検証済みスコアを切り分けて深掘りします。
以前お伝えしたARC-AGIやComputer Use評価の続報です。今回は、NVIDIAのAVOがARC-AGI-3で100%を取った、全183レベルを完了した、という投稿がRedditのr/LocalLLaMAやr/singularityで拡散している件を扱います。ただし最初に線を引いておくと、現時点で提示資料から公式に確認できるのは『AVOという研究が存在し、NVIDIA Blackwell B200 GPU上のattention kernel最適化で成果を出した』という事実です。『ARC-AGI-3で満点』という部分はRedditとHN中心のコミュニティ情報であり、公式・大手メディア資料では裏取りできていません。
【事象の全貌と背景】
今回ギーク界隈が反応した理由は、単なるチャット性能の話ではないからです。ARC-AGI系のベンチは、モデルが知識を暗記しているかではなく、未知ルールを見抜き、環境に適応し、手順を組み立てられるかを測る文脈で語られてきました。そこに『NVIDIA AVOがARC-AGI-3で100%』という見出しが飛び込んできたため、これはモデル単体のIQ競争ではなく、エージェントが暗黙ルールのある環境を攻略するComputer Use競技場の話なのではないか、という期待が一気に膨らんだわけです。
ただし、Reddit投稿で確認できるのはタイトル由来の主張が中心で、技術詳細や公式スコアボードへの明確な照合は提示情報内では確認できません。HN側では、さらに重要な留保が出ています。あるコメントは『public setであってprivate setではない』と指摘し、別のコメントも『100%は25問のpublic setで、semi-privateやprivateではない』と整理しています。つまり、仮に100%という話を採用するにしても、それはARC-AGI-3全体を制覇した公式確定情報ではなく、少なくとも公開セットに関するコミュニティ上の話題として扱うべきです。
【技術的ディープダイブ】
公式に確認できるAVOは、arXiv:2603.24517の『Agentic Variation Operators for Autonomous Evolutionary Search』です。ここでのAVOは、固定的な突然変異や交叉演算子ではなく、エージェント自体を進化探索の変異演算子として使う枠組みです。対象はARC-AGI-3ではなく、NVIDIA Blackwell B200 GPU上のforward-pass attention kernel最適化です。論文ではmulti-head attentionに対して7日間の連続自律進化探索を行い、評価構成においてcuDNNを最大3.5%、FlashAttention-4を最大10.5%上回るkernelを見つけたと報告されています。さらに最大1668 TFLOPSのスループット、grouped-query attentionへの転用では追加の自律適応が30分で済み、cuDNN比最大7.0%、FlashAttention-4比最大9.3%改善という数値も示されています。
ここが面白いのは、AVOの本質が『答えを話すAI』ではなく『探索空間の中で改善案を作り続けるAI』にある点です。ARC-AGI-3満点説が真偽未確定でも、AVOの公式研究そのものは、AIが評価、改変、再試行を回すループを持つことの強さを示しています。もし同種の仕組みがComputer Useベンチに持ち込まれたなら、モデルの素の推論力だけでなく、環境観察、試行錯誤、ツール使用、ログからの仮説更新を含めた『作業能力』が競われます。つまり、ベンチマークの主役がプロンプト回答から、エージェントの運用ハーネス全体へ移りつつあるという匂いが強いのです。
【コミュニティの生々しい熱量と議論】
HNの反応はかなり冷静で、むしろ疑い深いギークの良さが出ています。mellosoulsは、重要な限定として『public set, not the private set』を強調し、さらにこれはNVIDIA独自モデルというより『Opus 5にハーネスを足したもの』ではないか、とコメントしています。woeiruaは、ARC-AGI-3は本来ハーネスを除いた生のモデル性能を見るものではなかったのか、と疑問を投げています。一方でdist-epochは、禁止したかったのはARC-AGI専用ハーネスであり、NVIDIAのものは任意問題に使える汎用的な進化ハーネスだ、という擁護寄りの見方を示しています。
懐疑派はさらに踏み込みます。subzel0は100%が25問のpublic setに限られると指摘し、xnxは検証済み高スコアは40%だとしています。embedding-shapeは、タイミングの内訳が見えないことを疑問視し、『Codexの/goalと何が違うのか』という実務的な比較を持ち出しています。これはかなり本質的です。エージェントが長時間粘って解いたのか、専用ループが強いのか、モデルが賢いのか、計算資源を積んだだけなのか。Computer Use評価では、この分解が見えないとスコアの意味が一気に曖昧になります。
一方、熱狂側にも見るべき論点があります。daemonologistは、機械はエネルギー面で有利で、疲れずに異常なほど粘れると述べています。これは笑い話ではなく、エージェント評価の核心です。人間なら飽きる、疲れる、見落とす。AIエージェントは、コストが許す限りログを読み、仮説を立て、実行し、失敗しても再試行できます。program_whizは、NVIDIAのアプローチを読んで、こうしたループと問題を説明するプログラム生成の組み合わせはAGIなのかもしれない、と反応しています。もちろんInsanityが返したように、AGIの定義はその日ごとに動く、という皮肉もセットです。
【今後の展望とエコシステムへの影響】
今回の件でオワコン化しそうなのは、単発プロンプトでのベンチスコアだけを見て『このモデルが最強』と決める読み方です。これからの評価は、モデル、ツール、ブラウザ操作、ファイル操作、自己検証、探索ループ、計算時間、コスト上限をまとめたシステム性能に寄っていきます。ARC-AGI-3満点説そのものは未確認でも、Computer Use評価が『作業能力の競技場』へ進化しているという編集長視点はかなり筋が良いです。
ただし、この領域はスコアの見せ方が危うい。公開セットで100%なのか、非公開セットで再現するのか。専用ハーネスなのか、汎用ハーネスなのか。Opus 5のような外部モデルにどれだけ依存しているのか。何時間、何ドル、何GPUで解いたのか。これらを出さない満点報告は、ベンチというよりデモに近くなります。今後、本当に価値が出るのは、スコアだけでなく、実行ログ、失敗回数、探索時間、コスト、ハーネスの汎用性まで公開する評価文化です。
結論として、NVIDIA AVOの公式研究は非常に強い事実を持っています。B200上のattention kernelでcuDNNやFlashAttention-4を上回ったという成果は、AIが低レイヤー最適化の探索者になれることを示しました。一方で、ARC-AGI-3で100%という話は現時点ではコミュニティ発の未確認情報です。だからこそ面白い。これは『またベンチで満点が出た』ではなく、AIエージェントの時代において、知能の測り方そのものがモデル単体から作業システム全体へ移り始めたというサインとして見るべきニュースです。
🔗 情報ソース・引用元
- https://www.reddit.com/r/LocalLLaMA/comments/1vuh7to/nvidia_avo_got_100_on_arcagi3_it_completed_all/
- https://www.reddit.com/r/singularity/comments/1vuhlhn/nvidias_coding_agent_scored_100_on_arcagi3/
- https://news.ycombinator.com/item?id=49387755
- https://www.reddit.com/r/aicuriosity/comments/1vujlol/nvidia_avo_hits_perfect_score_100_on_arcagi3
- https://arxiv.org/abs/2603.24517
- https://arxiv.org/html/2603.24517v1
- https://huggingface.co/papers/2603.24517
※この記事は、Geek Terminalの自律型AIパイプラインによって自動生成・配信されています。
📺 映像と音声でサクッとチェックしたい方は
Geek Terminal 公式YouTubeチャンネルへ!

