vLLM

ローカルLLM

【geek-terminalニュース】Z.ai GLM-5.3本体がHugging Faceで公開、ローカルLLM勢のモデル選定表がまた揺れる

📝 本日のニュース概要 以前お伝えしたGLM-5.3-Flash公開の続報です。今回はZ.ai公式Hugging Faceに登場したGLM-5.3本体のオープンウェイト化を、Flashとの違い、753B規模、vLLM/SGLang/Tran...
ローカルLLM

【geek-terminalニュース】Ox Alpha=GLM-5.3-Flash確認騒動と低単価フロンティア推論の最新情報

📝 本日のニュース概要 以前お伝えした低価格Flash戦略の続報です。OpenRouter上の謎モデルOx AlphaとZ.aiのGLM-5.3-Flashをめぐる確認・同定騒動、Hugging Face公開、320B総パラメータ・18Bア...
ローカルLLM

【geek-terminalニュース】Qwen3.8-27B FP8公開、ローカルLLM勢がテンプレ修正と旧版同一疑惑まで即検証

📝 本日のニュース概要 以前お伝えしたQwen3.8-2.4T-A95B公開の続報です。今回は巨大MoEではなく、実際にローカル勢が触れる27B級denseモデル、Qwen3.8-27B FP8に焦点を当てます。Apache 2.0、FP8...
ローカルLLM

【geek-terminalニュース】744B MoEを25GB RAMで動かす?ローカルLLM省メモリ限界突破ログ

📝 本日のニュース概要 以前お伝えしたPuzzle-75BやMiniMax巨大MoEの続報です。今回はGLM-5.2 744B MoEを消費者環境で動かす省メモリ実装、Qwen3.6 NVFP4/Unsloth量子化、speculative...
ローカルLLM

【geek-terminalニュース】NVIDIA Puzzle-75B-A9B、75B級MoEをローカルGPU圏内へ押し込む最新情報

📝 本日のニュース概要 NVIDIAのNemotron-Labs-3-Puzzle-75B-A9Bを深掘り。Nemotron-3-Super由来の圧縮ハイブリッドMoE、Iterative Puzzle、NVFP4、そしてRedditで話題...
ローカルLLM

【geek-terminalニュース】100%ローカル声AIの実装公開、音声入力から応答までクラウドを介さないLocalLLaMA的アシスタントが熱い

📝 本日のニュース概要 以前お伝えした完全ローカルAIエージェント/ローカルLLM運用の続報です。今回は、音声入力、音声認識、LLM応答、音声合成までをローカル環境で閉じるvoice-to-voice assistant実装を深掘りします。...
ローカルLLM

【geek-terminalニュース】DeepSeek DSparkでローカルLLM推論高速化が実運用検証フェーズへ

📝 本日のニュース概要 以前お伝えしたDeepSeek-V4/DSparkとDFlash・llama.cpp高速化の続報です。DeepSeekのDSpark、DeepSeek-V4-Flash、llama.cppパッチ、RTX 5090/R...
ローカルLLM

【geek-terminalニュース】DeepSeek DSpark投機デコードの最新情報

📝 本日のニュース概要 DeepSeek-V4向け投機的デコーディング・フレームワークDSparkを深掘り。MTP-1比60〜85%高速化という報道、論文PDF、LocalLLaMA/NVIDIAフォーラム周辺の実測議論を整理します。 以前...
ハードウェア&インフラ

【200ポンドの狂気】中古の爆安サーバー用GPU「Tesla V100」を3Dプリンタとダクトファンで一般PCへ強引に移植する変態肉体派ハックが話題に!

📝 本日のニュース概要 2026年現在、高騰を極めるコンシューマー向け大容量VRAM GPU。そんな中、数年前のデータセンター向けモンスターGPU「Tesla V100」が中古市場に200ポンド(約4万円)で大量放出されていることに目をつけ...
ローカルLLM

【geek-terminal】MoEオフロードの「呪い」が解けた!Prefill加速で巨大LLM常用時代へ

📝 本日のニュース概要 2026年4月19日、ローカルLLM界隈を震撼させた「--n-cpu-moe」フラグの発見。VRAM容量を超えた巨大なMoEモデルを動作させる魔法の杖でしたが、そこには「プロンプト処理(Prefill)が地獄のように...