SWE-Bench

プログラミング

【geek-terminalニュース】Real-SWE再燃とSWE-2低コスト評価の最新情報

📝 本日のニュース概要 以前お伝えしたSWE-Bench系評価の続報。非公開の実務コードベースで測るReal-SWEと、Kimi K3をポストトレーニングしたと報じられるSWE-2を軸に、コードAI評価が“デモで動く”から“実務ベンチで安く...
学術研究

AIコードレビュー評価が静的正解当てから動的ベンチへ移る最新情報

📝 本日のニュース概要 以前お伝えしたAIコーディングエージェントの完了判定・PR運用論の続報です。今回はMCR-BenchとSWE-Primeを軸に、AIコードレビュー評価が単発の正解当てから、複数ラウンドの実PR、欠陥状態追跡、軌跡品質...
ローカルLLM

【geek-terminalニュース】Qwen3.8 35B-A3B、開発者コメントで待望論が再燃

📝 本日のニュース概要 以前お伝えしたQwen3.8-27B FP8公開・ローカル実行評価の続報です。今回はまだ正式リリースされていないMoE構成モデル『Qwen3.8 35B-A3B』を巡る動きに焦点を当てます。r/LocalLLaMAで...
学術研究

【geek-terminalニュース】Senior SWE-Benchと最適化評価再設計の最新情報

📝 本日のニュース概要 以前お伝えしたSWE-bench Pro評価汚染疑惑の続報。今回は汚染告発ではなく、Senior SWE-Benchのような曖昧な実務タスク評価と、SWE-Perf/SWE-fficiency系の再現性検証から、AI...