投機的デコーディング

ローカルLLM

【geek-terminalニュース】DeepSeek DSparkでローカルLLM推論高速化が実運用検証フェーズへ

📝 本日のニュース概要 以前お伝えしたDeepSeek-V4/DSparkとDFlash・llama.cpp高速化の続報です。DeepSeekのDSpark、DeepSeek-V4-Flash、llama.cppパッチ、RTX 5090/R...
ローカルLLM

【geek-terminalニュース】DFlashのllama.cpp統合報告、ローカルLLM高速化が“周辺ハック”から日常運用へ近づく続報

📝 本日のニュース概要 以前お伝えしたDFlashトレンドの続報です。RedditのLocalLLaMAで「DFlash support merged into llama.cpp」と話題になり、ローカルLLM推論のtok/s、メモリ効率、...
ローカルLLM

【geek-terminalニュース】DeepSeek DSpark投機デコードの最新情報

📝 本日のニュース概要 DeepSeek-V4向け投機的デコーディング・フレームワークDSparkを深掘り。MTP-1比60〜85%高速化という報道、論文PDF、LocalLLaMA/NVIDIAフォーラム周辺の実測議論を整理します。 以前...
ローカルLLM

【geek-terminalニュース】旧世代V100で27Bモデルが秒間1000トークン!? 投機デコーディングを極限まで研ぎ澄ました「MTP並列最適化」の変態的ハックがRedditで話題に

📝 本日のニュース概要 2026/05/22にお伝えした「Qwen3.6 35Bが110 tps」という驚異の記録からわずか数日。今度は、骨董品とも言われかねない旧世代のエンタープライズGPU「NVIDIA V100」を使い、27Bクラスの...