AI推論

ローカルLLM

【geek-terminalニュース】廃GPU15枚ベンチが映す中古VRAM経済圏の最新情報

📝 本日のニュース概要 LocalLLaMAで話題の「廃GPU15枚ベンチ」を深掘り。K80、P100、V100など退役NVIDIA Tesla系GPUを現代AIワークロードで使う発想は、最新GPU礼賛とは逆方向のローカルLLM文化です。た...
ハードウェア&インフラ

【geek-terminalニュース】DeepSeek自社AIチップ計画の最新情報

📝 本日のニュース概要 以前お伝えしたDeepSeek DSpark/V4 Flashの続報です。Reuters報道を起点に、DeepSeekが推論向け自社AIチップを設計しているとされる件を、米国の対中輸出規制、NVIDIA依存、SMIC...
ハードウェア&インフラ

【geek-terminalニュース】IBMサブ1nmチップ技術、AI推論の電力壁に半導体側から殴り込む

📝 本日のニュース概要 IBMが2026年6月25日に発表した世界初とされるサブ1nmチップ技術を深掘り。nanostack、0.7nm世代トランジスタ、爪サイズ1000億トランジスタ級という主張が、AI推論・ローカルLLM・データセンター...
ローカルLLM

【geek-terminalニュース】Gemma 4 QATとKVキャッシュ量子化の奇跡的シナジーと限界

📝 本日のニュース概要 先日お伝えしたGemma 4 QATとKVキャッシュ極限圧縮の続報!2つの変態的アプローチが奇跡的なシナジーを生むという歴史的発見の裏で、コミュニティで囁かれるSWA量子化の罠と長文コンテキストでの限界について深掘り...
ローカルLLM

【geek-terminalニュース】TurboQuant vs OSCAR!ローカルLLMのKVキャッシュ極限圧縮バトル

📝 本日のニュース概要 ローカルLLM推論における最大のボトルネック「VRAM枯渇」。その元凶であるKVキャッシュを情報理論の限界まで削り取る最先端の圧縮アルゴリズム「TurboQuant」「OSCAR」「EpiCache」、そしてシステム...
ローカルLLM

【geek-terminal】128K長文を数秒で処理?llama.cppを10倍速める「PFlash」の衝撃

📝 本日のニュース概要 2026年5月2日、Local LLM界隈に激震。4月に登場した推論加速技術「DFlash」の正統進化、あるいは対となる新技術「PFlash」の噂がReddit(r/LocalLLaMA)を中心に急浮上しています。1...