ベンチマーク

学術研究

OSRewardが突きつけるComputer Use評価標準化の最新情報

📝 本日のニュース概要 以前お伝えしたComputer Useエージェント評価環境監査の続報です。OSRewardを中心に、GUI操作AIを本番投入する前に「成功判定そのもの」を疑う流れを整理します。 【事象の全貌と背景】以前お伝えしたCo...
商用巨大LLM

【geek-terminalニュース】Claude Opus 5運用論、ベンチ勝負からeffort・トークン効率・注入耐性へ

📝 本日のニュース概要 以前お伝えしたClaude Opus 5発表の続報です。今回は新モデルの能力自慢ではなく、effort設定、トークン効率、agentic coding、ブラウザ型prompt injection耐性、ベンチマーク汚染...
商用巨大LLM

【geek-terminalニュース】Claude Opus 5の最新情報

📝 本日のニュース概要 AnthropicがClaude Opus 5を発表。Fable 5級に近い能力を半分の価格で狙う新Opusを、ベンチ、価格、effort設定、音声モード、コミュニティの反応から深掘りします。 以前お伝えしたClau...
商用巨大LLM

【geek-terminalニュース】Kimi K3公開でAPI価格と1Mコンテキスト疑惑が同時炎上

📝 本日のニュース概要 Moonshot AIのKimi公式サイトがK3を掲げ、RedditではWeb/App公開、API価格、ベンチマーク、巨大コンテキスト仕様をめぐって議論が急加速。公式に確認できる事実と、コミュニティ発の未確認情報を切...
ローカルLLM

【geek-terminalニュース】廃GPU15枚ベンチが映す中古VRAM経済圏の最新情報

📝 本日のニュース概要 LocalLLaMAで話題の「廃GPU15枚ベンチ」を深掘り。K80、P100、V100など退役NVIDIA Tesla系GPUを現代AIワークロードで使う発想は、最新GPU礼賛とは逆方向のローカルLLM文化です。た...
商用巨大LLM

【geek-terminalニュース】GPT-5.6 Sol検証フェーズの最新情報

📝 本日のニュース概要 以前お伝えしたGPT-5.6一般公開の続報です。今回はSol/Terra/Lunaの発表概要ではなく、Solの推論レベル運用、Responses API、自律ポストトレーニング、数学証明PDF、SimpleBench...
商用巨大LLM

【geek-terminalニュース】Grok 4.5価格性能ショックの最新情報

📝 本日のニュース概要 Grok 4.5をめぐり、ベンチマーク競争より推論単価がアプリ設計を変えるのではないかという議論が浮上。ただし公式に確認できる具体的な価格数値は提示資料内にありません。 【事象の全貌と背景】Grok 4.5をめぐる今...
学術研究

【geek-terminalニュース】Senior SWE-Benchと最適化評価再設計の最新情報

📝 本日のニュース概要 以前お伝えしたSWE-bench Pro評価汚染疑惑の続報。今回は汚染告発ではなく、Senior SWE-Benchのような曖昧な実務タスク評価と、SWE-Perf/SWE-fficiency系の再現性検証から、AI...
商用巨大LLM

【geek-terminalニュース】Claude Sonnet 5噂で再燃、Opus級性能がSonnet価格帯に降りるのか問題

📝 本日のニュース概要 Claude Sonnet 5登場説をめぐり、公式確認できる事実とコミュニティの熱狂を切り分けて解説。現時点でSonnet 5の価格・API名・性能は未確認だが、もしOpus級の実効性能がSonnet価格帯に降りるな...
プログラミング

【geek-terminalニュース】SWE-bench Pro汚染疑惑とコーディングAI評価ハックの最新情報

📝 本日のニュース概要 以前お伝えしたRL reward hackingの続報。今回は訓練報酬ではなく、SWE-bench Proなどコーディングエージェント評価そのものが攻略対象になっているという疑惑を深掘りします。 以前お伝えしたRL訓...