プログラミング

プログラミング

【geek-terminalニュース】Real-SWE再燃とSWE-2低コスト評価の最新情報

📝 本日のニュース概要 以前お伝えしたSWE-Bench系評価の続報。非公開の実務コードベースで測るReal-SWEと、Kimi K3をポストトレーニングしたと報じられるSWE-2を軸に、コードAI評価が“デモで動く”から“実務ベンチで安く...
プログラミング

【geek-terminalニュース】Codex×Claudeサブエージェント実行の最新情報

📝 本日のニュース概要 単体モデルの性能競争から、CodexとClaudeをどう並列実行し、セッション間で文脈を受け渡すかという開発OS的な論点へ。公式に確認できるサブエージェント仕様と、Reddit/Zennで盛り上がるruntime・s...
プログラミング

【geek-terminalニュース】Agentic開発環境はCLIから“実行OS”へ進化するのか

📝 本日のニュース概要 OpenChamberのWalkthrough、Shepherdのfork/replay/revert構想、そしてAIコーディング環境のセキュリティ論争を、裏付けの確度を分けながら深掘りします。 【事象の全貌と背景】...
プログラミング

【geek-terminalニュース】Meta Muse Codeβの最新情報:安いコーディングエージェントの本丸は性能表ではなく学習データ契約か

📝 本日のニュース概要 MetaがMuse Codeをベータ公開。Muse Spark 1.2搭載のターミナル型コーディングエージェントとしての性能以上に、コミュニティで注目されているのは、学習データ提供と引き換えに価格が下がるという新しい...
プログラミング

【geek-terminalニュース】AIコード失敗変化の最新情報

📝 本日のニュース概要 AIコーディングは簡単になったのではなく、難しさの場所を変えた。生成、検証、レビュー、ハーネス設計まで実務者目線で深掘りします。 【事象の全貌と背景】以前お伝えした、2026年7月20日の人間レビュー帯域不足、そして...
プログラミング

【geek-terminalニュース】コードハーネスの最新情報

📝 本日のニュース概要 以前お伝えしたAIコードレビュー再設計やGrok Build OSS化の続報として、今回はレビュー工程ではなく、AIコーディングエージェントを本番運用に載せるための実行基盤「コードハーネス」を深掘りします。検索、ルー...
プログラミング

【geek-terminalニュース】AI生成コードのレビュー限界、人間レビュアーが最後のボトルネック化

📝 本日のニュース概要 AIがコードを量産するほど、人間レビューという最後の防波堤が帯域不足になる。AIコードレビューの限界、エージェント型レビュー、HNでの生々しい反応を整理します。 以前お伝えしたLinuxカーネルでのAIコード受容論、...
学術研究

【geek-terminalニュース】Senior SWE-Benchと最適化評価再設計の最新情報

📝 本日のニュース概要 以前お伝えしたSWE-bench Pro評価汚染疑惑の続報。今回は汚染告発ではなく、Senior SWE-Benchのような曖昧な実務タスク評価と、SWE-Perf/SWE-fficiency系の再現性検証から、AI...
プログラミング

【geek-terminalニュース】AI開発ログがVibe Codingのブラックボックス化に対する監査レイヤーになり始めた最新情報

📝 本日のニュース概要 Claude CodeやCodexのAIコーディング会話を、消えるチャットではなく検索・監査・再利用できる開発資産として扱う流れを深掘り。ai-devlog、Codex CLI運用、セッションログ、HNでの議論を整理...
プログラミング

【geek-terminalニュース】ローカルLLMコーディング完全移行への亡命!クラウド型AIの制限と主権喪失に抗うギーク達の泥臭い実戦投入論争

📝 本日のニュース概要 2026年、クラウド型AIの突然の利用制限やデータ主権の喪失に嫌気がさした開発者たちが、手元のマシンだけで開発環境を完結させる「ローカルLLMコーディング完全代替」の限界に挑んでいます。以前お伝えしたクラウドAIから...