KV cache

ローカルLLM

【geek-terminalニュース】DeepSeek V4.1 Flashで1M文脈とFP4 KV Cacheが来た件

📝 本日のニュース概要 DeepSeek V4.1 Flashを、単なる新モデルではなく長時間エージェントの記憶コストを変える推論ランタイム部品として深掘りします。1Mコンテキスト、FP4 KV Cache、Cross-Layer Atte...
ハードウェア&インフラ

【geek-terminalニュース】KVキャッシュが“エージェント実行基盤”になる説の最新情報

📝 本日のニュース概要 以前お伝えしたKVキャッシュ高速化・圧縮・量子化の続報です。今回は、KVキャッシュを単なる推論最適化ではなく、AIエージェントの状態、記憶、実行文脈として扱う発想を深掘りします。KV cache routing、pr...
AIツール&サービス

【geek-terminalニュース】DeepSeek V4 Pro 0813 API展開で揺れる推論インフラ戦争

📝 本日のニュース概要 以前お伝えしたDeepSeek APIコスト論とV4 Flash実務評価の続報です。OpenRouter上で話題化したDeepSeek V4 Pro 0813を起点に、1Mトークン文脈、MoE、APIルーティング、キ...
ローカルLLM

【geek-terminalニュース】DeepSeek V4 Flash 0731の癖評価、ARC-AGI高得点と実運用の不安定さが同時に燃える

📝 本日のニュース概要 以前お伝えしたDeepSeek V4 Flash低価格推論・ローカル実行の続報です。今回はベンチ順位ではなく、ARC-AGI、コーディング、非コーディング、ツール呼び出し、KV cache量子化、キャッシュ設計で挙動...
ローカルLLM

【geek-terminalニュース】744B MoEを25GB RAMで動かす?ローカルLLM省メモリ限界突破ログ

📝 本日のニュース概要 以前お伝えしたPuzzle-75BやMiniMax巨大MoEの続報です。今回はGLM-5.2 744B MoEを消費者環境で動かす省メモリ実装、Qwen3.6 NVFP4/Unsloth量子化、speculative...