タビLab.(技術ブログ) 報酬ハッキングをQ学習で再現 — OpenAIのサンドボックス脱出から考える
報酬ハッキングを、ブラウザで動く迷路と強化学習(Q学習)で再現しました。OpenAIのサンドボックス脱出をきっかけに試し、コインを何度でも取れる報酬では得点が4.5倍でもゴールは100回中0回、1回だけに直すと全回ゴールしました。
タビLab.(技術ブログ)
タビLab.(技術ブログ)
クラウド
クラウド
タビの独り言
タビの独り言
クラウド
クラウド
タビの独り言
タビの独り言