AI安全性

商用巨大LLM

【geek-terminalニュース】OpenAI Astra不可視推論の最新情報

📝 本日のニュース概要 以前お伝えしたAstraの数学・サイバー能力疑惑の続報。今回は、次期OpenAIモデルと噂されるAstraのrecurrent depth、looped transformer、不可視推論、監査不能性をめぐる議論を深...
セキュリティ&脆弱性

【geek-terminalニュース】Anthropic監査とEnterprise Frontier Safeguardsの最新情報

📝 本日のニュース概要 以前お伝えしたClaude/Mythos 5系の安全性論争の続報です。今回はAnthropic監査をめぐるコミュニティ発の疑惑、Enterprise Frontier Safeguards、Claude生成文検出AP...
セキュリティ&脆弱性

【geek-terminalニュース】AI攻撃未遂と安全性テスト崩壊の最新情報

📝 本日のニュース概要 以前お伝えしたAIセキュリティ評価と権限境界問題の続報です。Reutersが報じたmyNetworkへの悪意あるプルリクエスト未遂、The Decoderが紹介した安全性ベンチマークの弱点、LessWrongで議論さ...
学術研究

【geek-terminalニュース】AIがウイルスを設計?スタンフォード発「Evo」ショックの真相

📝 本日のニュース概要 以前お伝えしたオープンウェイトAI規制論争の続報です。米スタンフォード大学とArc Instituteが、AIモデル「Evo 1」「Evo 2」を用いて新しいバクテリオファージのゲノムを設計し、実験室で細菌を死滅させ...
ローカルLLM

OpenWeight免除でローカルLLM配布の前提が変わる

📝 本日のニュース概要 以前お伝えしたOpen-weight AI規制論争の続報です。米AI安全フレームワークでopen-weightモデルが政府の安全性レビュー対象から外れる見通しが報じられ、LocalLLaMA界隈ではモデル公開、ミラー...
企業動向&ビジネス

【geek-terminalニュース】フロンティアAI内部者が求める“AI減速書簡”の最新情報

📝 本日のニュース概要 OpenAI、Google、Metaなどの主要AIラボ従業員を含むと報じられる公開書簡が、AI研究自動化のペース制御と国際協調を要求。外野の規制論ではなく、開発現場の内部者が“速度そのもの”を統治対象にした点を深掘り...
学術研究

【geek-terminalニュース】Claudeの“未発話の内的表現”を読むJacobian Lens/J-spaceの最新情報

📝 本日のニュース概要 Anthropicの研究「Verbalizable Representations Form a Global Workspace in Language Models」を軸に、Claude内部のJ-space、Ja...
学術研究

【geek-terminalニュース】報酬関数デバッガーとReward Hacking検出の最新情報

📝 本日のニュース概要 RL訓練中のreward hackingを、事後ログではなく報酬関数そのものから検出・診断する発想がAI安全性コミュニティで注目されています。LessWrongで議論されたnegated reward hacking...
セキュリティ&脆弱性

【geek-terminalニュース】モデルセキュリティが“研究上の怖い話”から本番監視設計へ落ちてきた最新情報

📝 本日のニュース概要 以前お伝えした評価自覚・安全性劣化問題の続報。モデル抽出、データポイズニング、adversarial prefill、評価認識といったリスクが、論文上の抽象論ではなく、AIモデル資産の棚卸し、スキャン、アクセス制御、...