AI安全性

企業動向&ビジネス

【geek-terminalニュース】フロンティアAI内部者が求める“AI減速書簡”の最新情報

📝 本日のニュース概要 OpenAI、Google、Metaなどの主要AIラボ従業員を含むと報じられる公開書簡が、AI研究自動化のペース制御と国際協調を要求。外野の規制論ではなく、開発現場の内部者が“速度そのもの”を統治対象にした点を深掘り...
学術研究

【geek-terminalニュース】Claudeの“未発話の内的表現”を読むJacobian Lens/J-spaceの最新情報

📝 本日のニュース概要 Anthropicの研究「Verbalizable Representations Form a Global Workspace in Language Models」を軸に、Claude内部のJ-space、Ja...
学術研究

【geek-terminalニュース】報酬関数デバッガーとReward Hacking検出の最新情報

📝 本日のニュース概要 RL訓練中のreward hackingを、事後ログではなく報酬関数そのものから検出・診断する発想がAI安全性コミュニティで注目されています。LessWrongで議論されたnegated reward hacking...
セキュリティ&脆弱性

【geek-terminalニュース】モデルセキュリティが“研究上の怖い話”から本番監視設計へ落ちてきた最新情報

📝 本日のニュース概要 以前お伝えした評価自覚・安全性劣化問題の続報。モデル抽出、データポイズニング、adversarial prefill、評価認識といったリスクが、論文上の抽象論ではなく、AIモデル資産の棚卸し、スキャン、アクセス制御、...