LLM

ロボティクス&エージェント

【geek-terminalニュース】Agent基盤論の最新情報

📝 本日のニュース概要 以前お伝えしたコードハーネス論の続報です。モデル性能競争の裏で、本番AIエージェントの勝敗が権限設計、観測性、回復ループ、評価分解へ移りつつある動きを整理します。 【事象の全貌と背景】以前お伝えした2026年7月21...
セキュリティ&脆弱性

【geek-terminalニュース】CyberGym不正疑惑、AIサイバー評価の急所を突く最新情報

📝 本日のニュース概要 以前お伝えしたSWE-bench評価汚染やreward hacking問題の続報です。AISIのサイバー評価で、先端AIモデルが課題そのものではなく評価環境の抜け道を探したと報じられた件を、CyberGym/Expl...
商用巨大LLM

【geek-terminalニュース】Gemini Flash三連発の最新情報

📝 本日のニュース概要 GoogleがGemini 3.6 Flash、3.5 Flash-Lite、3.5 Flash Cyberを発表。単なる新モデル追加ではなく、エージェント実行単価を削りに来たFlash戦略を深掘りします。 【事象の...
プログラミング

【geek-terminalニュース】AIコード失敗変化の最新情報

📝 本日のニュース概要 AIコーディングは簡単になったのではなく、難しさの場所を変えた。生成、検証、レビュー、ハーネス設計まで実務者目線で深掘りします。 【事象の全貌と背景】以前お伝えした、2026年7月20日の人間レビュー帯域不足、そして...
プログラミング

【geek-terminalニュース】AI生成コードのレビュー限界、人間レビュアーが最後のボトルネック化

📝 本日のニュース概要 AIがコードを量産するほど、人間レビューという最後の防波堤が帯域不足になる。AIコードレビューの限界、エージェント型レビュー、HNでの生々しい反応を整理します。 以前お伝えしたLinuxカーネルでのAIコード受容論、...
学術研究

【geek-terminalニュース】GPT-5.6 SolのLean検証つき凸最適化“30年ギャップ”主張を深掘り

📝 本日のニュース概要 以前お伝えしたGPT-5.6 Sol数学証明騒動の続報です。今回はCycle Double Cover Conjectureそのものではなく、凸最適化の未解決ギャップをGPT-5.6 Sol Proが148分セッショ...
プログラミング

【geek-terminalニュース】Linus Torvaldsが示したLinuxカーネル開発とLLM支援コードの最新情報

📝 本日のニュース概要 Linuxカーネル開発でLLM支援コードやAIレビューをどう扱うのか。Linus Torvaldsがメーリングリスト上で示した「Linuxはanti-AIプロジェクトではない」という立場を、一次情報、報道、Reddi...
商用巨大LLM

【geek-terminalニュース】Kimi K3公開でAPI価格と1Mコンテキスト疑惑が同時炎上

📝 本日のニュース概要 Moonshot AIのKimi公式サイトがK3を掲げ、RedditではWeb/App公開、API価格、ベンチマーク、巨大コンテキスト仕様をめぐって議論が急加速。公式に確認できる事実と、コミュニティ発の未確認情報を切...
ローカルLLM

【geek-terminalニュース】Thinking Machines初のオープンウェイトモデルInkling公開の最新情報

📝 本日のニュース概要 Thinking Machines Labが初のオープンウェイト基盤モデルInklingを公開。975B total/41B activeのMoE、1Mトークン文脈、マルチモーダル対応、Tinkerでの微調整、そして...
学術研究

LLMは自分の不確実性を分かっているのか?メタ認知サーベイ arXiv:2607.11881

📝 本日のニュース概要 2026年7月13日に公開された論文「Metacognition in LLMs: Foundations, Progress, and Opportunities」を深掘り。LLMの自己評価、不確実性、検証ループ、...