推論コスト

ローカルLLM

【geek-terminalニュース】Qwen3.8-Flash-Next疑惑、125B MoEなのに6B activeというQwen4先出し級アーキテクチャの最新情報

📝 本日のニュース概要 以前お伝えしたQwen3.8-27B評価の続報です。今回は、Qwen3.8-Flash-Nextと呼ばれる125B MoE・6B active・マルチモーダル・Qwen4アーキテクチャ先行プレビュー疑惑を、公式確認済...
AIツール&サービス

【geek-terminalニュース】DeepSeek V4 Pro 0813 API展開で揺れる推論インフラ戦争

📝 本日のニュース概要 以前お伝えしたDeepSeek APIコスト論とV4 Flash実務評価の続報です。OpenRouter上で話題化したDeepSeek V4 Pro 0813を起点に、1Mトークン文脈、MoE、APIルーティング、キ...
商用巨大LLM

【geek-terminalニュース】Grok 4.6検証、上位モデル級で安い説の最新情報

📝 本日のニュース概要 以前お伝えしたGrok 4.5価格性能トピックの続報です。Grok 4.6がOpenAI上位モデル級に迫り、価格では下回るという主張が出ています。ただし公式・大手メディアの裏付けではGrok 4.6固有のベンチ、価格...
商用巨大LLM

【geek-terminalニュース】ByteDance 10兆パラメータ級AIモデル訓練報道の最新情報

📝 本日のニュース概要 以前お伝えしたQwen3.8-MaxやKimi K3など兆級MoE競争の続報です。ByteDanceが最大10兆パラメータ級のAIモデルを訓練していると報じられ、中国フロンティアAI競争はモデルサイズ、MoE設計、訓...
AIツール&サービス

【geek-terminalニュース】DeepSeek値上げ観測でAI推論コスト競争が新フェーズへ

📝 本日のニュース概要 以前お伝えしたDeepSeek V4 Flash低価格推論競争の続報です。今回は性能ベンチではなく、DeepSeek APIの値上げ観測、割引、クラウド経由の実効単価、エージェント運用コストを深掘りします。 以前お伝...
商用巨大LLM

GPT-5.6値下げで推論費の前提が変わる最新情報

📝 本日のニュース概要 GPT-5.6 Luna/Terraの値下げ、Solによる推論基盤最適化、Fast mode、ARC-AGI-3をめぐる議論を、公式情報とコミュニティ反応に分けて整理します。 【事象の全貌と背景】以前お伝えしたGPT...
プログラミング

【geek-terminalニュース】モデル分業Codingの最新情報

📝 本日のニュース概要 以前お伝えしたCursor Routerの続報です。今回はリクエスト単位のモデル振り分けではなく、フロンティアモデルを計画役、安価なモデルや専用コーディングモデルを実行役にする“推論費のOS設計”として、Cursor...
商用巨大LLM

【geek-terminalニュース】Claude Opus 5の最新情報

📝 本日のニュース概要 AnthropicがClaude Opus 5を発表。Fable 5級に近い能力を半分の価格で狙う新Opusを、ベンチ、価格、effort設定、音声モード、コミュニティの反応から深掘りします。 以前お伝えしたClau...
プログラミング

【geek-terminalニュース】Cursor Routerの最新情報

📝 本日のニュース概要 以前お伝えしたGemini Flash低コスト戦略やAIコードハーネス設計の続報です。CursorがTeams/Enterprise向けに発表したCursor Routerを、リクエスト単位のモデル選択、キャッシュ損...
商用巨大LLM

【geek-terminalニュース】Grok 4.5価格性能ショックの最新情報

📝 本日のニュース概要 Grok 4.5をめぐり、ベンチマーク競争より推論単価がアプリ設計を変えるのではないかという議論が浮上。ただし公式に確認できる具体的な価格数値は提示資料内にありません。 【事象の全貌と背景】Grok 4.5をめぐる今...