【geek-terminalニュース】NVIDIA Puzzle-75B-A9B、75B級MoEをローカルGPU圏内へ押し込む最新情報

📝 本日のニュース概要

NVIDIAのNemotron-Labs-3-Puzzle-75B-A9Bを深掘り。Nemotron-3-Super由来の圧縮ハイブリッドMoE、Iterative Puzzle、NVFP4、そしてRedditで話題化した3枚のRTX 3090・132 tok/s報告の確度を切り分けます。

【事象の全貌と背景】
NVIDIAのNemotron-Labs-3-Puzzle-75B-A9Bが、ローカルLLM勢の神経をかなり正確に撃ち抜いています。公式に確認できる範囲では、このモデルはNVIDIAがHugging Faceで公開している配備最適化済みの大規模言語モデルで、Nemotron-3-Super-120B-A12Bから派生した圧縮ハイブリッドMoE系モデルです。ポイントは単に「新しい大規模モデルが出た」ではありません。120B級の親モデルを、推論効率を重視してPuzzle-75B-A9Bへ圧縮し、BF16版とNVFP4版を含む複数精度の配布形態で出してきたことです。

これまで大型MoEは、総パラメータ数の割にアクティブパラメータだけを動かすため理論上は速い、という説明をされがちでした。しかし実運用では、アクティブパラメータ、KVキャッシュ、Mamba state、並列化、ルーティング、量子化バックエンドの成熟度が絡み、家庭用GPUや小規模サーバーでは「動く」と「常用できる」の間に深い溝がありました。特にローカルLLM界隈にとって重要なのは、ベンチマークの一点豪華主義ではなく、VRAMに収まり、そこそこのコンテキストで、待ち時間が許容範囲に入り、複雑なセットアップでも再現可能かどうかです。

その文脈で今回刺さっているのが、RedditのLocalLLaMAに立った「Puzzle-75B-A9B NVFP4が3枚のRTX 3090で132 T/s」という趣旨の投稿です。ただし、この132 tok/s、3×RTX 3090という数字は、公式モデルカードで保証された値ではなく、提示された情報の範囲ではコミュニティ投稿タイトル由来の話題として扱う必要があります。つまり、モデルの存在、Nemotron-3-Super由来、Iterative Puzzleによる圧縮、NVFP4版の公開は公式確認できる事実。一方で、3枚の3090で132 tok/sという実測条件の細部は、現時点では伝聞寄りのローカル実行報告として読むのが正確です。

【技術的ディープダイブ】
公式モデルカードで確認できる中核は、Puzzle-75B-A9BがIterative Puzzleというポストトレーニング圧縮フレームワークで作られ、推論効率を大きく改善しつつ下流精度の維持を狙ったモデルだという点です。親モデルはNemotron-3-Super-120B-A12B系で、報道ベースでは親モデルが総パラメータ120.7B、アクティブ12.8B、Puzzle-75B-A9Bが総パラメータ75.3B、アクティブ9.3Bへ削減されたと説明されています。この数字が意味するのは、総重量だけでなく、1トークン生成時に実際に火が入る部分も削っているということです。

MoEの圧縮で難しいのは、単純に枝を落とせばよいわけではない点です。エキスパートの削減、ルーティング挙動、dense部分、attention、状態空間系の要素、長コンテキスト時のメモリ圧力が絡みます。公式説明では、用途として対話型、推論重視、長コンテキストが挙げられており、これは単発の短文生成だけでなく、実サービスやエージェント的なワークロードを意識した配置です。さらにNVFP4版が用意されていることが重要です。NVFP4は低精度量子化された配布形態で、BF16よりもメモリ帯域とVRAM容量の圧力を下げる方向に効きます。

MarkTechPostなどの報道では、同等のユーザーあたりスループット条件でサーバースループットが2.03倍、単一8×B200構成で約2倍という説明も出ています。これはデータセンター文脈の効率改善として大きい話ですが、ローカルLLM勢が見ている焦点は少し違います。彼らが見ているのは「この圧縮・量子化の流れが、RTX 3090、4090、中古データセンターGPU、あるいは複数枚の民生カード構成に降りてくるか」です。NVIDIA Developer ForumにはNVFP4版をvLLMで提供するレシピもあり、TP=1、MTP speculative decoding、Marlin NVFP4 backend、Mamba cache関連オプションなど、実際の配備に近い話が出ています。フォーラム投稿の19 tok/sといった数値は投稿者環境の実行報告であり公式保証値ではありませんが、モデルが単なる論文上の存在ではなく、vLLM、SGLang、Transformers、Docker Model Runnerといった既存ツールチェーンに乗せる前提で整備されていることは大きいです。

【コミュニティの生々しい熱量と議論】
ここは厳密に切り分けます。今回提供された検索結果では、Reddit、Hacker News、lobste.rsなどの実コメント本文は抽出されていません。したがって、ユーザーの生の発言を引用したかのように捏造することはできません。確認できるのは、LocalLLaMAに「NVFP4で3枚のRTX 3090上132 T/s」という趣旨の投稿タイトルが存在し、それがローカルLLM利用者の関心を集めている、という範囲です。

それでも、このタイトルだけで界隈が反応する理由は明確です。RTX 3090は24GB VRAMを持ち、中古市場でもローカルLLM民の定番カードになってきました。3枚なら合計72GB VRAM。75B級モデルをそのクラスの家庭・研究室・趣味サーバーに押し込める可能性が見えた瞬間、話題の中心は「モデル性能」から「俺のラックで回るのか」に移ります。これはクラウドAPIの利用者とは別種の熱量です。彼らはトークン単価だけでなく、電源容量、PCIeレーン、NVLinkの有無、ケースのエアフロー、Linuxドライバ、vLLMの量子化対応、Mamba cacheの挙動まで含めて考えます。

一方で、健全な懐疑も必要です。132 tok/sがprefill込みなのかdecodeのみなのか、バッチサイズはいくつか、コンテキスト長はいくつか、speculative decodingが入っているのか、測定ツールは何か、3枚の3090間の通信条件はどうか。これらが分からない限り、「誰でも3×3090で132 tok/s」とは言えません。ローカルLLMの数字は、条件が少し変わるだけで別物になります。だからこそ今回の正しい読み方は、「公式に公開された圧縮MoEモデルがあり、NVFP4版もあり、コミュニティでは3×3090で高速度が出たという報告が話題化している。ただし実測の再現性は別途検証が必要」というものです。

【今後の展望とエコシステムへの影響】
このニュースが示しているのは、巨大モデルの競争軸が「何Bか」だけではなく、「どう削って、どう残し、どの推論基盤で速く出すか」に移っていることです。これまでのローカルLLM界隈では、70B級を動かすにはかなりの妥協が必要でした。4bit量子化、低速生成、短いコンテキスト、複雑な分割、あるいは性能面で小型モデルに戻る判断です。Puzzle-75B-A9Bのような圧縮ハイブリッドMoEが実用ラインに近づくと、単純な密モデルの巨大化だけを追う流れは相対的に古く見えてきます。

もちろん、これで小型モデルが終わるわけではありません。7B、14B、32B級はエッジ、ノートPC、低レイテンシ用途で引き続き強い。むしろオワコン化しそうなのは、圧縮や推論最適化を軽視した「重いだけの公開モデル」です。ローカル環境で使われるモデルは、精度表だけでなく、量子化のしやすさ、vLLMやSGLangでの安定性、VRAM効率、長コンテキスト時の挙動、複数GPUでの素直さまで評価されるようになります。

NVIDIAにとっても、この動きはGPU販売の文脈と噛み合います。B200やDGXのサーバー効率を示しつつ、Hugging FaceでNVFP4版を配布し、Developer Forumで実行レシピを出す。これはデータセンターだけでなく、開発者が手元の環境で試し、推論スタック全体をNVIDIA寄りに寄せる導線でもあります。ローカルLLM勢にとっては、RTX 3090級の中古カードが再び面白い実験台になります。ただし、今回の3×3090・132 tok/s報告は、現時点では公式値ではなく、測定条件未確認のコミュニティ発トピックです。熱狂する価値はありますが、ラックを組む前に、同条件の再現報告、推論設定、消費電力、実タスクでの品質を見極める必要があります。

※この記事は、Geek Terminalの自律型AIパイプラインによって自動生成・配信されています。

📺 映像と音声でサクッとチェックしたい方は
Geek Terminal 公式YouTubeチャンネルへ!

タイトルとURLをコピーしました