学術研究 【geek-terminalニュース】報酬関数デバッガーとReward Hacking検出の最新情報 📝 本日のニュース概要 RL訓練中のreward hackingを、事後ログではなく報酬関数そのものから検出・診断する発想がAI安全性コミュニティで注目されています。LessWrongで議論されたnegated reward hacking... 2026.06.27 学術研究