量子化

ハードウェア&インフラ

【geek-terminalニュース】Apple M7 Ultra 1.5TB統一メモリ噂の最新情報

📝 本日のニュース概要 以前お伝えしたApple Siliconの統一メモリ問題の続報です。Apple M7 Ultraが最大1.5TBのRAMをサポートする可能性が報じられ、ローカルLLM界隈ではGPU枚数ではなく巨大ユニファイドメモリ箱...
ローカルLLM

【geek-terminalニュース】744B MoEを25GB RAMで動かす?ローカルLLM省メモリ限界突破ログ

📝 本日のニュース概要 以前お伝えしたPuzzle-75BやMiniMax巨大MoEの続報です。今回はGLM-5.2 744B MoEを消費者環境で動かす省メモリ実装、Qwen3.6 NVFP4/Unsloth量子化、speculative...
ローカルLLM

【geek-terminalニュース】MiniMax 2.7兆パラメータ級オープンモデル計画の最新情報

📝 本日のニュース概要 MiniMaxが2.7兆パラメータ規模のLLMを開発中で、2026年後半にもオープンウェイト/オープンソース公開を計画していると報じられました。MoE、active params、量子化、配布、ローカル推論の限界まで...
ローカルLLM

【geek-terminalニュース】Gemma 4 QATとKVキャッシュ量子化の奇跡的シナジーと限界

📝 本日のニュース概要 先日お伝えしたGemma 4 QATとKVキャッシュ極限圧縮の続報!2つの変態的アプローチが奇跡的なシナジーを生むという歴史的発見の裏で、コミュニティで囁かれるSWA量子化の罠と長文コンテキストでの限界について深掘り...
ローカルLLM

【geek-terminalニュース】TurboQuant vs OSCAR!ローカルLLMのKVキャッシュ極限圧縮バトル

📝 本日のニュース概要 ローカルLLM推論における最大のボトルネック「VRAM枯渇」。その元凶であるKVキャッシュを情報理論の限界まで削り取る最先端の圧縮アルゴリズム「TurboQuant」「OSCAR」「EpiCache」、そしてシステム...
未分類

【量子化の聖杯】Google Gemma 4 QAT公開!学習段階から4ビット化を織り込み、精度低下を「完全克服」したオンデバイスLLMの破壊的インパクトを解説

📝 本日のニュース概要 前日のGemma 4 12Bに続き、Google DeepMindがとんでもない爆弾を投下しました。事後量子化(PTQ)による精度低下に終止符を打つ、学習段階から4ビット化を織り込んだ「QAT(Quantizatio...
未分類

【変態アーキテクチャ】VRAM不足の救世主?ついに『1-Bit画像生成』モデル「Bonsai Image 4B」が登場との噂!スマホや軽量ノートで高品質なDiffusion推論が動く未来へ【Geek Terminal】

📝 本日のニュース概要 2026年4月20日にお伝えした驚異の1-Bit LLM「Bonsai」の画期的な続報です!理論上の極限だった「1ビット量子化」が、ついに40億パラメータ(4B)規模の『ローカル画像生成』にまで到達したという驚くべき...
ローカルLLM

【衝撃】10年前のGTX 1080が最新30B MoEで24 tok/sを記録!?富豪ハードへの「最適化」という名の反逆

📝 本日のニュース概要 2026年、ローカルLLM界隈に激震が走っています。かつての名機、8GB VRAMのGTX 1080が、最新の30BクラスMoEモデルを24 tokens per secondという実用速度で回したという報告が相次い...
ローカルLLM

【VRAM 12GBの奇跡】Qwen3.6異端版が80tok/sec到達!19個のMTPを完全保持した変態的最適化の正体

📝 本日のニュース概要 2026年5月8日に第一報をお伝えしたQwen3.6の検閲切除版「heretic v2」が、ついに実用極限のパフォーマンスに到達しました。12GB VRAMという、ミドルレンジGPU(RTX 4070/5060クラス...
ハードウェア&インフラ

【Local AI】押し入れの3060が「VRAMタンク」に化ける!旧型GPUを接ぎ木するLocalLLaMA民の執念と変態ハックの全貌

📝 本日のニュース概要 2026年、AIモデルの巨大化は止まりません。最新のRTX 60シリーズ(仮)を待つLocal LLMユーザーたちが選んだのは、意外にも「旧型GPUの増設」という泥臭い生存戦略でした。Reddit(r/LocalLL...