階層的強化タスクの構造を学ぶ


9

私は階層的強化学習問題を研究しており、多くの論文がポリシーを学習するためのアルゴリズムを提案していますが、それらはすべて、ドメイン内のアクションの階層を説明するグラフ構造を事前に知っていると想定しているようです。たとえば、Dietterichによる階層的強化学習のMAXQメソッドは、単純なタクシードメインのアクションとサブタスクのグラフを記述しますが、このグラフがどのように発見されたかは記述していません。ポリシーだけでなく、このグラフの階層をどのように学習しますか?

言い換えると、紙の例を使用して、タクシーが無意識に運転していて、世界についての予備知識がほとんどなく、原始的な左移動/右移動などのアクションのみを実行する場合、次のようなより高いレベルのアクションをどのように学習しますか?乗車客?論文を正しく理解している場合(そうでない場合もあります)、これらの高レベルのアクションのポリシーを更新する方法は提案されていますが、そもそもそれらがどのように形成されているかは提案されていません。

回答:


8

この論文によると

現在の最先端技術では、RLシステムの設計者は通常、タスクに関する事前知識を使用して、エージェントが利用できる基本アクションのセットに特定のオプションセットを追加します。

同じ用紙のセクション6.2学習タスク階層も参照してください。

私の頭に浮かぶ最初のアイデアは、タスク階層がわからない場合は、非階層強化学習から始めて、その後または学習中に構造を発見すること、つまりモデルを一般化しようとすることです。私にとって、このタスクはHMMのベイジアンモデルマージ手法に似ています(たとえば、この論文を参照してください)。

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.