AIコーディング

プログラミング

【geek-terminalニュース】Real-SWE再燃とSWE-2低コスト評価の最新情報

📝 本日のニュース概要 以前お伝えしたSWE-Bench系評価の続報。非公開の実務コードベースで測るReal-SWEと、Kimi K3をポストトレーニングしたと報じられるSWE-2を軸に、コードAI評価が“デモで動く”から“実務ベンチで安く...
ローカルLLM

【geek-terminalニュース】Z.ai GLM-5.3本体がHugging Faceで公開、ローカルLLM勢のモデル選定表がまた揺れる

📝 本日のニュース概要 以前お伝えしたGLM-5.3-Flash公開の続報です。今回はZ.ai公式Hugging Faceに登場したGLM-5.3本体のオープンウェイト化を、Flashとの違い、753B規模、vLLM/SGLang/Tran...
学術研究

AIコードレビュー評価が静的正解当てから動的ベンチへ移る最新情報

📝 本日のニュース概要 以前お伝えしたAIコーディングエージェントの完了判定・PR運用論の続報です。今回はMCR-BenchとSWE-Primeを軸に、AIコードレビュー評価が単発の正解当てから、複数ラウンドの実PR、欠陥状態追跡、軌跡品質...
プログラミング

【geek-terminalニュース】AIコーディングエージェントの完了判定PR、夜間量産レビュー運用が次のボトルネックに

📝 本日のニュース概要 AIがコードを書く段階から、AIが開いたPRをいつ完了扱いするのか、翌朝どう捌くのかへ論点が移っています。Claude Codeの公式機能、Reddit/HN/lobste.rsの現場反応、CI緑だけでは危ない理由を...
ローカルLLM

【geek-terminalニュース】Qwen3.8-27B量子化実測とCode Arena上位入り疑惑、LocalLLaMAが沸騰

📝 本日のニュース概要 以前お伝えしたQwen3.8-27B評価の続報です。今回はReddit / r/LocalLLaMAで話題化した量子化比較、reasoning_effort設定、Code Arena 9位報告を、公式確認済み情報とコ...
ローカルLLM

【geek-terminalニュース】GLM-5.3がベンチマーク首位も重み公開延期、ローカルLLM勢は指をくわえて待つのみ

📝 本日のニュース概要 以前お伝えしたGLM-5.3(2026/08/15)の続報です。Z.aiのGLM-5.3がArtificial Analysis関連の評価でオープンモデル首位級の結果を見せつつ、肝心のモデル重み公開は約2週間延期され...
ローカルLLM

【geek-terminalニュース】GLM-5.3がベンチマーク首位も重み公開延期、ローカルLLM勢は指をくわえて待つのみ

📝 本日のニュース概要 以前お伝えしたGLM-5.3(2026/08/15)の続報です。Z.aiのGLM-5.3がArtificial Analysis関連の評価でオープンモデル首位級の結果を見せつつ、肝心のモデル重み公開は約2週間延期され...
セキュリティ&脆弱性

【geek-terminalニュース】GLM-5.3公開、再学習なしで伸びたコーディング性能とAIサイバー能力の境界線

📝 本日のニュース概要 Z.ai/Zhipu AIがGLM-5.3を発表。GLM-5.2と同じ743B級ベースを使いながら、ポストトレーニング拡張で長時間コーディングと脆弱性探索能力を大きく伸ばしたと報告されています。オープンウェイト競争、...
ローカルLLM

【geek-terminalニュース】Qwen3.8-27B FP8公開、ローカルLLM勢がテンプレ修正と旧版同一疑惑まで即検証

📝 本日のニュース概要 以前お伝えしたQwen3.8-2.4T-A95B公開の続報です。今回は巨大MoEではなく、実際にローカル勢が触れる27B級denseモデル、Qwen3.8-27B FP8に焦点を当てます。Apache 2.0、FP8...
ロボティクス&エージェント

【geek-terminalニュース】DeepSeek V4 Pro正式展開、Harness公開、API値上げの最新情報

📝 本日のニュース概要 以前お伝えしたDeepSeek V4 Pro API展開観測の続報です。今回はV4 Pro更新、DeepSeek Harnessのオープンソース公開、API価格改定が同時に動いたことで、モデル性能だけでなく、エージェ...