SGLang

ローカルLLM

【geek-terminalニュース】Qwen3.8-27B量子化、4-bit実用域と1-bit崩壊ラインの最新情報

📝 本日のニュース概要 以前お伝えしたQwen3.8-27B量子化実測の続報です。BF16比99%をうたうtask-aware quant、4-bit運用の実用性、1-bitでの品質崩壊ラインを、Reddit/HN/Lobste.rsの現場...
ローカルLLM

【geek-terminalニュース】Z.ai GLM-5.3本体がHugging Faceで公開、ローカルLLM勢のモデル選定表がまた揺れる

📝 本日のニュース概要 以前お伝えしたGLM-5.3-Flash公開の続報です。今回はZ.ai公式Hugging Faceに登場したGLM-5.3本体のオープンウェイト化を、Flashとの違い、753B規模、vLLM/SGLang/Tran...
ローカルLLM

【geek-terminalニュース】Ox Alpha=GLM-5.3-Flash確認騒動と低単価フロンティア推論の最新情報

📝 本日のニュース概要 以前お伝えした低価格Flash戦略の続報です。OpenRouter上の謎モデルOx AlphaとZ.aiのGLM-5.3-Flashをめぐる確認・同定騒動、Hugging Face公開、320B総パラメータ・18Bア...
ローカルLLM

【geek-terminalニュース】LFM2.5-DSpark、最大3.18倍高速デコードの最新情報

📝 本日のニュース概要 Liquid AIのLFM2.5向けDSpark draft modelが、投機的デコードで最大3.18倍の高速化をうたっています。モデルの賢さを上げる話ではなく、出力品質を維持したままレイテンシと推論コストを削る、...
ローカルLLM

【geek-terminalニュース】Qwen3.8-27B FP8公開、ローカルLLM勢がテンプレ修正と旧版同一疑惑まで即検証

📝 本日のニュース概要 以前お伝えしたQwen3.8-2.4T-A95B公開の続報です。今回は巨大MoEではなく、実際にローカル勢が触れる27B級denseモデル、Qwen3.8-27B FP8に焦点を当てます。Apache 2.0、FP8...
ローカルLLM

【geek-terminalニュース】NVIDIA Puzzle-75B-A9B、75B級MoEをローカルGPU圏内へ押し込む最新情報

📝 本日のニュース概要 NVIDIAのNemotron-Labs-3-Puzzle-75B-A9Bを深掘り。Nemotron-3-Super由来の圧縮ハイブリッドMoE、Iterative Puzzle、NVFP4、そしてRedditで話題...
ローカルLLM

【geek-terminalニュース】DeepSeek DSparkでローカルLLM推論高速化が実運用検証フェーズへ

📝 本日のニュース概要 以前お伝えしたDeepSeek-V4/DSparkとDFlash・llama.cpp高速化の続報です。DeepSeekのDSpark、DeepSeek-V4-Flash、llama.cppパッチ、RTX 5090/R...