Apple ML Research、自己生成フィードバックで強化学習の効率改善「RLTL;DR」を発表
Apple ML Research(アップル・エムエル・リサーチ)は10月(現地時間)、自己生成フィードバックを用いた強化学習の新手法「RLTL;DR(アールエルティーエル・ディーアール)」に関する研究成果を公開した。本手法は、困難なタスクにおいてエージェントが自らフィードバックを生成し、それを内部化することで学習効率を向上させるアプローチを提示。既存手法では学習が困難だったデータセットにおいて、RLTL;DRはPass@1で最大31%の性能改善を記録した。