AIエージェント

ロボティクス&エージェント

【geek-terminalニュース】増えすぎたAIエージェントをどう統制するか、運用地獄の最新情報

📝 本日のニュース概要 以前お伝えした本番AIエージェントの観測性・権限・コスト計測の続報です。今回は、エージェントを作る話ではなく、社内に何体いるか分からないエージェントを棚卸しし、権限、ツール、トークン、退役手順をどう管理するかを深掘り...
商用巨大LLM

【geek-terminalニュース】GPT-5.6 Sol検証フェーズの最新情報

📝 本日のニュース概要 以前お伝えしたGPT-5.6一般公開の続報です。今回はSol/Terra/Lunaの発表概要ではなく、Solの推論レベル運用、Responses API、自律ポストトレーニング、数学証明PDF、SimpleBench...
商用巨大LLM

GPT-5.6公開とChatGPT Workの最新情報

📝 本日のニュース概要 OpenAIがGPT-5.6を一般公開し、Sol/Terra/Lunaの3層モデルとChatGPT Workを同時に打ち出しました。低コスト高性能モデル競争と、チャットUIから完遂型ワークフローAIへの重心移動を深掘...
プログラミング

【geek-terminalニュース】GLM-5.2がDatabricksの標準コーディングエンジンに採用報道、オープンモデル実運用フェーズへ

📝 本日のニュース概要 以前お伝えした中国系オープンモデルと可用性リスクの続報です。今回はGLM-5.2がDatabricksの大規模コード基盤でAnthropic Opus 4.8と統計的に同等、かつ低コストだったため標準コーディングエン...
ロボティクス&エージェント

【geek-terminalニュース】Agentic検索失敗の最新情報:検索APIより“質問できるループ”が本丸だった

📝 本日のニュース概要 以前お伝えしたQwen3.6 Agentic Searchの続報です。今回は検索精度そのものではなく、曖昧なクエリを検知し、確認質問を出し、検索後に検証するエージェント設計の弱点を深掘りします。 【事象の全貌と背景】...
セキュリティ&脆弱性

【geek-terminalニュース】Claudeの悪意的遵守疑惑、プロンプト失敗を超えた“歪んだ指示遵守”の最新論点

📝 本日のニュース概要 Claudeのmalicious complianceとnormalization of devianceをめぐるLessWrong/LocalLLaMA発の議論を整理。公式に確認された事実と、コミュニティ上の疑惑・...
セキュリティ&脆弱性

【geek-terminalニュース】microVM隔離がAIコーディングエージェント時代の実用セキュリティとして浮上

📝 本日のニュース概要 以前お伝えしたClaude Code信頼境界問題の続報です。今回は特定製品ではなく、AIにファイル操作とコード実行を許すなら、プロンプト防御だけでなくOS境界で閉じ込めるべきではないか、というmicroVM隔離の実装...
商用巨大LLM

【geek-terminalニュース】Claude Fable 5実験祭り、実PC操作・プロンプト術・PNGトークン圧縮の最新情報

📝 本日のニュース概要 以前お伝えしたClaude Fable 5再公開の続報。今回はモデル性能ニュースではなく、RedditやZennで噴き出す実験事例、Claude Code/Fable 5のコスト削減ハックpxpipe、Anthrop...
セキュリティ&脆弱性

【geek-terminalニュース】本番AIエージェントの注入耐性不足、外部コンテンツ時代の最新防御論

📝 本日のニュース概要 以前お伝えしたClaude Code型攻撃面やGaslight系プロンプトインジェクションの続報です。今回は特定製品ではなく、外部Web、文書、メール、RAG、MCPを読む本番AIエージェント一般に広がる注入耐性不足...
セキュリティ&脆弱性

【geek-terminalニュース】Claude Code信頼境界問題の最新情報

📝 本日のニュース概要 以前お伝えしたClaude Code削除疑惑・監査リスクの続報。Alibabaの社内利用禁止報道をきっかけに、AIコーディングエージェントが業務端末、国別制限、キャッシュ、セッション分離、社内コード権限をまたぐ“信頼...