アルゴリズム

タビLab.(技術ブログ)

報酬ハッキングをQ学習で再現 — OpenAIのサンドボックス脱出から考える

報酬ハッキングを、ブラウザで動く迷路と強化学習(Q学習)で再現しました。OpenAIのサンドボックス脱出をきっかけに試し、コインを何度でも取れる報酬では得点が4.5倍でもゴールは100回中0回、1回だけに直すと全回ゴールしました。
AI活用

生成AI時代にこそ効く「思考の土台」— エンジニアのためのCS基礎3本柱

「新人はAI使用禁止」が議論される今、本当に必要なのはAIの出力を判断できる土台。4月に行った講義をもとに、アルゴリズム・データ管理・リソース管理の3本柱で「AIに強い人の思考」を解説します。
タイトルとURLをコピーしました