LLM

商用巨大LLM

Gemini 3.8 Flash低価格戦の最新情報

📝 本日のニュース概要 Gemini 3.8 FlashとGemini 3.8 Flash Cyberの同時発表を深掘り。低価格Flash路線、Cyber特化版、推論単価、安全評価、用途別アクセス設計の意味を整理します。 【事象の全貌と背景...
商用巨大LLM

【geek-terminalニュース】OpenAI Astra不可視推論の最新情報

📝 本日のニュース概要 以前お伝えしたAstraの数学・サイバー能力疑惑の続報。今回は、次期OpenAIモデルと噂されるAstraのrecurrent depth、looped transformer、不可視推論、監査不能性をめぐる議論を深...
商用巨大LLM

【geek-terminalニュース】Claude Fable 5.1登場疑惑とMythos Previewベンチ議論の最新情報

📝 本日のニュース概要 以前お伝えしたFable 5 / Mythos 5系の続報。Fable 5.1登場をめぐるコミュニティ発の観測、Anthropic公式で確認できるMythos Preview情報、Reddit/HN/lobste.r...
学術研究

【geek-terminalニュース】ベンチ信頼危機の最新情報

📝 本日のニュース概要 Terminal-Bench 4.0の順位変動、31,000件超の時間別LLMベンチ分析、Google DeepMindの暗号的な二重盲検評価案を軸に、LLMベンチマークの再現性・汚染・監査問題を深掘りします。 以前...
学術研究

AIコードレビュー評価が静的正解当てから動的ベンチへ移る最新情報

📝 本日のニュース概要 以前お伝えしたAIコーディングエージェントの完了判定・PR運用論の続報です。今回はMCR-BenchとSWE-Primeを軸に、AIコードレビュー評価が単発の正解当てから、複数ラウンドの実PR、欠陥状態追跡、軌跡品質...
ローカルLLM

【geek-terminalニュース】IBM Granite 4.2、企業向けオープンウェイトLLMに推論とエージェント能力を載せる

📝 本日のニュース概要 IBM Granite 4.2をめぐる報道とコミュニティ反応を整理。Apache 2.0、ローカルLLM、agentic RL、VRAM、ベンチマーク論争まで深掘りします。 【事象の全貌と背景】IBMのGranite...
セキュリティ&脆弱性

【geek-terminalニュース】AI防火壁破りの最新情報

📝 本日のニュース概要 以前お伝えしたAIエージェント権限境界問題の続報です。AIファイアウォールを置けば安心という防御幻想が、プロンプト注入、表層監視、ツール実行権限の現場論によって揺らいでいます。 以前お伝えしたAIエージェントの権限境...
セキュリティ&脆弱性

【geek-terminalニュース】AIエージェント権限境界の最新情報

📝 本日のニュース概要 以前お伝えしたAI安全性テスト・サプライチェーン攻撃回の続報です。HRボット、OSSマルウェア疑惑、推論エンジン悪用、SKILL.md監査を横断し、AIエージェントを“便利な自動化”ではなく権限を持つ攻撃面として整理...
ロボティクス&エージェント

【geek-terminalニュース】DeepSeek Harness開発者プレビュー公開の最新情報

📝 本日のニュース概要 DeepSeek Harnessが開発者プレビューへ移行したと報じられています。CLIツール`dsh`、MITライセンス、「Everything is a Plugin」という設計思想、そして公式発表と並走するように...
学術研究

【geek-terminalニュース】MathCode登場、数学AIは証明する知性なのか超高速な探索装置なのか

📝 本日のニュース概要 MathCodeは自然言語の数学問題をLean 4定理へ変換し、形式証明を試みる端末型AIコーディングエージェントです。永続Lean REPL、Mathlib補題探索、LSP診断修復、並列プランナーを軸に、数学AIの...