AIエージェント

セキュリティ&脆弱性

【geek-terminalニュース】Ghostcommitの最新情報:PNGがAIコードレビューの信頼境界を抜ける

📝 本日のニュース概要 Ghostcommitは、コードではなくPNG画像に隠したプロンプトインジェクションでAIコードレビューの盲点を突くPoCです。CodeRabbitやCursor BugbotのようなAIレビューが差分テキスト中心に...
ロボティクス&エージェント

【geek-terminalニュース】AI実行ゲートの最新情報:エージェント事故は“賢さ”ではなくOS設計の問題になった

📝 本日のニュース概要 以前お伝えした本番AIエージェント棚卸し・権限・観測性の続報です。今回は削除事故疑惑、支出上限、安全ゲート、監査ログ、MCPツール制御を軸に、AIエージェントを本番で走らせるための実行時ガバナンスを深掘りします。 【...
ロボティクス&エージェント

【geek-terminalニュース】増えすぎたAIエージェントをどう統制するか、運用地獄の最新情報

📝 本日のニュース概要 以前お伝えした本番AIエージェントの観測性・権限・コスト計測の続報です。今回は、エージェントを作る話ではなく、社内に何体いるか分からないエージェントを棚卸しし、権限、ツール、トークン、退役手順をどう管理するかを深掘り...
商用巨大LLM

【geek-terminalニュース】GPT-5.6 Sol検証フェーズの最新情報

📝 本日のニュース概要 以前お伝えしたGPT-5.6一般公開の続報です。今回はSol/Terra/Lunaの発表概要ではなく、Solの推論レベル運用、Responses API、自律ポストトレーニング、数学証明PDF、SimpleBench...
商用巨大LLM

GPT-5.6公開とChatGPT Workの最新情報

📝 本日のニュース概要 OpenAIがGPT-5.6を一般公開し、Sol/Terra/Lunaの3層モデルとChatGPT Workを同時に打ち出しました。低コスト高性能モデル競争と、チャットUIから完遂型ワークフローAIへの重心移動を深掘...
プログラミング

【geek-terminalニュース】GLM-5.2がDatabricksの標準コーディングエンジンに採用報道、オープンモデル実運用フェーズへ

📝 本日のニュース概要 以前お伝えした中国系オープンモデルと可用性リスクの続報です。今回はGLM-5.2がDatabricksの大規模コード基盤でAnthropic Opus 4.8と統計的に同等、かつ低コストだったため標準コーディングエン...
ロボティクス&エージェント

【geek-terminalニュース】Agentic検索失敗の最新情報:検索APIより“質問できるループ”が本丸だった

📝 本日のニュース概要 以前お伝えしたQwen3.6 Agentic Searchの続報です。今回は検索精度そのものではなく、曖昧なクエリを検知し、確認質問を出し、検索後に検証するエージェント設計の弱点を深掘りします。 【事象の全貌と背景】...
セキュリティ&脆弱性

【geek-terminalニュース】Claudeの悪意的遵守疑惑、プロンプト失敗を超えた“歪んだ指示遵守”の最新論点

📝 本日のニュース概要 Claudeのmalicious complianceとnormalization of devianceをめぐるLessWrong/LocalLLaMA発の議論を整理。公式に確認された事実と、コミュニティ上の疑惑・...
セキュリティ&脆弱性

【geek-terminalニュース】microVM隔離がAIコーディングエージェント時代の実用セキュリティとして浮上

📝 本日のニュース概要 以前お伝えしたClaude Code信頼境界問題の続報です。今回は特定製品ではなく、AIにファイル操作とコード実行を許すなら、プロンプト防御だけでなくOS境界で閉じ込めるべきではないか、というmicroVM隔離の実装...
商用巨大LLM

【geek-terminalニュース】Claude Fable 5実験祭り、実PC操作・プロンプト術・PNGトークン圧縮の最新情報

📝 本日のニュース概要 以前お伝えしたClaude Fable 5再公開の続報。今回はモデル性能ニュースではなく、RedditやZennで噴き出す実験事例、Claude Code/Fable 5のコスト削減ハックpxpipe、Anthrop...