【geek-terminalニュース】Thinking Machines初のオープンウェイトモデルInkling公開の最新情報

📝 本日のニュース概要

Thinking Machines Labが初のオープンウェイト基盤モデルInklingを公開。975B total/41B activeのMoE、1Mトークン文脈、マルチモーダル対応、Tinkerでの微調整、そしてローカルLLM界隈が気にする配布・量子化・推論環境の限界線を整理します。

【事象の全貌と背景】
Thinking Machines Labが2026年7月15日、同社初のオープンウェイトモデル「Inkling」を公開しました。これは単なる新モデル発表というより、ローカルLLM界隈にとっては「975B級の重みが公開されたとき、我々はそれをどう配り、どう量子化し、どこまで手元で動かせるのか」という限界線を押し広げるイベントです。公式発表によれば、Inklingはテキスト、画像、音声を入力として扱うマルチモーダル基盤モデルで、Thinking MachinesのTinker上でファインチューニング可能なモデルとして設計されています。

重要なのは、公式がInklingを「現時点で最強の総合モデル」とは主張していない点です。位置づけは、マルチモーダル能力、効率的な推論、Tinkerでの微調整可能性を組み合わせた、カスタマイズ向けのオープンウェイト基盤モデルです。つまり、ベンチマークの王座争いだけでなく、研究者や開発者が自分の用途に合わせてモデルを曲げられるか、巨大モデルを閉じたAPIの外へ引き出せるかが主戦場になります。同時にプレビューされたInkling-Smallは276B total/12B activeのMoEで、低コスト・低レイテンシ用途を狙うモデルと説明されていますが、フルウェイト公開はテスト完了後の予定とされています。

【技術的ディープダイブ】
Inklingの公式仕様はかなり攻めています。アーキテクチャはMixture-of-Experts Transformer、総パラメータは975B、各トークンで実際に有効になるアクティブパラメータは41B、最大コンテキスト長は1Mトークンです。事前学習はテキスト、画像、音声、動画を含む45兆トークンで行われたとされています。この「975B total/41B active」という構成が肝です。計算量だけを見ると41B級の感覚に寄せられますが、重み全体の保管、転送、ロード、専門家ルーティング、分散推論は975B級の現実を突きつけてきます。

MoE層はDeepSeek-V3に近い設計と説明されており、各MoE層に256個のrouted expertsと2個のshared expertsを持ち、各トークンで6個のrouted expertsを有効化します。routerはsigmoidベースで、補助損失ではなくload-balancing biasを使う構成です。Attentionはsliding-window層とglobal層を5:1で組み合わせ、8 KV headsを採用。位置表現はRoPEではなく相対位置埋め込みで、公式は長系列外挿でより良好だったと説明しています。

学習面では、大きな行列重みにMuon、それ以外にAdamを使うハイブリッド最適化を採用。ポストトレーニングは数学、エージェント的コード・ツール利用、音声、画像、チャット、安全性まで広く実施されています。公式ベンチマークでは、Inkling effort=0.99でAIME 2026が97.1%、GPQA Diamondが87.2%、SWE-Bench Verifiedが77.6%、Terminal Bench 2.1 Best Harnessが63.8%、MMMU Pro Standard 10が73.5%、VoiceBenchが91.4%、StrongREJECTが98.6%と示されています。コード評価は最大256Kトークン軌跡で実行されたとされ、長文脈とエージェント的タスクをかなり意識した評価設計です。

【コミュニティの生々しい熱量と議論】
Redditのr/LocalLLaMAでは、発表スレッドが「Thinking Machines releases first open-weight model “Inkling”」として共有され、反応の軸はかなりローカルLLMらしい方向に寄っています。提供データ上で確認できる範囲では、Inkling-Smallへの関心、GLM/Kimi系との比較、モデルの重さ、GGUF化やllama.cpp対応への期待が目立つとされています。一方で、検索結果2として渡されたコミュニティ抽出データはInklingと無関係なスレッドを含んでおり、個別コメントの直接引用や「RTX 4090で何token/s」といった数値は根拠が確認できません。そのため、この記事ではそれらを事実として扱いません。

それでも、論点ははっきりしています。ローカル勢が知りたいのは「975Bの名前がすごい」ではなく、「どの量子化なら現実的か」「エキスパートをどう分散配置するか」「CPU offloadやNVMe offloadで耐えられるか」「GGUF化されたときllama.cpp系のランタイムがどこまで追えるか」「41B activeなら個人のマルチGPUで遊べる余地があるのか」です。MoEは計算量を節約しますが、重み全体は消えません。つまりInklingは、ローカルLLM趣味人にとって夢と現実の両方を投げつけるタイプのモデルです。ベンチ結果を眺めるニュースではなく、配布形式、推論バックエンド、量子化レシピ、VRAMプーリング、クラスタ構成まで含めて燃える案件です。

r/singularity側では、主に「Thinking Machines初のopen-weightリリース」という出来事として受け止められています。こちらはローカル実行の細部より、巨大AI企業が重み公開へ踏み込んだ意味合いに関心が寄りやすい文脈です。ただし、現時点で確認できる公式情報から言えるのは、Inklingがオープンウェイトであり、Tinkerでの微調整やInkling Playground、Together、Fireworks、Modal、Databricks、Basetenへのデプロイ導線、SGLangおよびMilesでの推論・RL支援に触れられているというところまでです。

【今後の展望とエコシステムへの影響】
Inklingがすぐに全員のデスクトップで快適に走る、という話ではありません。むしろ975B totalという数字は、個人環境にとってまだ巨大な壁です。ただ、オープンウェイト化されたことで、壁の位置を実測できるようになります。これまで「APIで呼ぶしかない巨大モデル」だった領域が、量子化、分散推論、専門家配置、長文脈キャッシュ最適化の対象になります。ローカルLLM界隈にとってこれは、単に新しいモデルカードが増えた以上の意味があります。

今後オワコン化しうるのは、単純なパラメータ数だけを誇るモデル比較です。InklingのようなMoEでは、total、active、コンテキスト長、モダリティ、推論効率、ファインチューニング導線、ランタイム対応がセットで見られます。逆に価値が上がるのは、巨大重みを現実の開発フローに落とし込む周辺技術です。GGUF、SGLang、llama.cpp系、分散推論、安定した量子化、低ビット化後の劣化評価、長文脈で破綻しないKV管理。このあたりが本当の主戦場になります。

Inkling-Smallのフルウェイト公開が予定通り進めば、さらに面白くなります。276B total/12B activeなら、大型版より現実的な推論・検証対象になり、ローカル勢が一気にベンチ、量子化、マルチGPU構成を試し始める可能性があります。ただしこれは公式が「テスト完了後」としている未来予定であり、現時点で完了済みとは扱えません。今回のニュースの本質は、Thinking Machinesが初手から975B級のオープンウェイトを投げ込み、巨大モデルを“所有して改造する”文化の射程を一段広げたことです。手元で動くかどうかの答えはまだ環境ごとに違うとしても、少なくとも問いを立てるための重みは公開されました。

🎥 このニュースの動画版&音声版はこちら!

📺 深掘りメイン動画: YouTubeで視聴する

🎧 ポッドキャスト版: ラジオ感覚で聴く

※この記事は、Geek Terminalの自律型AIパイプラインによって自動生成・配信されています。

📺 映像と音声でサクッとチェックしたい方は
Geek Terminal 公式YouTubeチャンネルへ!

タイトルとURLをコピーしました