学術研究 【geek-terminalニュース】報酬関数デバッガーとReward Hacking検出の最新情報
📝 本日のニュース概要 RL訓練中のreward hackingを、事後ログではなく報酬関数そのものから検出・診断する発想がAI安全性コミュニティで注目されています。LessWrongで議論されたnegated reward hacking...
学術研究
学術研究
学術研究
学術研究
学術研究
学術研究
学術研究
学術研究
学術研究
学術研究