llama.cpp

ローカルLLM

【geek-terminalニュース】Qwen3.8-27B量子化、4-bit実用域と1-bit崩壊ラインの最新情報

📝 本日のニュース概要 以前お伝えしたQwen3.8-27B量子化実測の続報です。BF16比99%をうたうtask-aware quant、4-bit運用の実用性、1-bitでの品質崩壊ラインを、Reddit/HN/Lobste.rsの現場...
ローカルLLM

【geek-terminalニュース】CADローカルLLMの最新情報

📝 本日のニュース概要 以前お伝えした3D自動設計ハックの続報。llama.cppとFreeCADをつなぎ、ローカルLLMで3Dプリント可能な機械部品生成へ向かう個人設計自動化パイプラインを深掘りします。 以前お伝えしたRhinoMCP系3...
ローカルLLM

【geek-terminalニュース】Qwen3.8-Flash-Next実測祭り、Mac最適化とGLM比較の最新情報

📝 本日のニュース概要 以前お伝えしたQwen3.8-Flash-Next疑惑の続報です。今回は公式ベンチではなく、LocalLLaMA周辺で共有されているMac実測、大容量RAM、N-gramオフロード、GLM-5.3-Flash比較、そ...
ローカルLLM

【geek-terminalニュース】Kimi K3重み公開でローカルLLM勢がVRAM戦争へ突入

📝 本日のニュース概要 以前お伝えしたKimi K3と中国オープンウェイトAI論争の続報です。今回は政策論ではなく、Kimi K3のweights公開を受けて、実際に手元で動くのか、A100/H200級GPUが何枚必要なのか、Hugging...
ローカルLLM

【geek-terminalニュース】llama.cpp MCP対応でローカルLLMが実行主体へ近づく最新情報

📝 本日のニュース概要 llama.cppのfull MCP supportがコミュニティで話題化。ローカルLLMが単なるチャットから、MCP経由で手元のツールを叩くエージェント基盤へ変わる可能性を、権限境界、WebUI/CLI、Reddi...
ローカルLLM

【geek-terminalニュース】Thinking Machines初のオープンウェイトモデルInkling公開の最新情報

📝 本日のニュース概要 Thinking Machines Labが初のオープンウェイト基盤モデルInklingを公開。975B total/41B activeのMoE、1Mトークン文脈、マルチモーダル対応、Tinkerでの微調整、そして...
ローカルLLM

【geek-terminalニュース】Bonsai 27Bの最新情報:27B推論モデルを1-bit/Ternaryでスマホ級へ押し込むローカルLLM圧縮実験

📝 本日のニュース概要 以前お伝えしたBonsai 1-bit系の続報です。PrismMLが発表したBonsai 27Bは、Qwen3.6-27B由来の27B級オープンウェイト推論モデルを1-bit binary版と1.58-bit ter...
ローカルLLM

【geek-terminalニュース】廃GPU15枚ベンチが映す中古VRAM経済圏の最新情報

📝 本日のニュース概要 LocalLLaMAで話題の「廃GPU15枚ベンチ」を深掘り。K80、P100、V100など退役NVIDIA Tesla系GPUを現代AIワークロードで使う発想は、最新GPU礼賛とは逆方向のローカルLLM文化です。た...
ローカルLLM

【geek-terminalニュース】744B MoEを25GB RAMで動かす?ローカルLLM省メモリ限界突破ログ

📝 本日のニュース概要 以前お伝えしたPuzzle-75BやMiniMax巨大MoEの続報です。今回はGLM-5.2 744B MoEを消費者環境で動かす省メモリ実装、Qwen3.6 NVFP4/Unsloth量子化、speculative...
ローカルLLM

【geek-terminalニュース】100%ローカル声AIの実装公開、音声入力から応答までクラウドを介さないLocalLLaMA的アシスタントが熱い

📝 本日のニュース概要 以前お伝えした完全ローカルAIエージェント/ローカルLLM運用の続報です。今回は、音声入力、音声認識、LLM応答、音声合成までをローカル環境で閉じるvoice-to-voice assistant実装を深掘りします。...