私は階層的強化学習問題を研究しており、多くの論文がポリシーを学習するためのアルゴリズムを提案していますが、それらはすべて、ドメイン内のアクションの階層を説明するグラフ構造を事前に知っていると想定しているようです。たとえば、Dietterichによる階層的強化学習のMAXQメソッドは、単純なタクシードメインのアクションとサブタスクのグラフを記述しますが、このグラフがどのように発見されたかは記述していません。ポリシーだけでなく、このグラフの階層をどのように学習しますか?
言い換えると、紙の例を使用して、タクシーが無意識に運転していて、世界についての予備知識がほとんどなく、原始的な左移動/右移動などのアクションのみを実行する場合、次のようなより高いレベルのアクションをどのように学習しますか?乗車客?論文を正しく理解している場合(そうでない場合もあります)、これらの高レベルのアクションのポリシーを更新する方法は提案されていますが、そもそもそれらがどのように形成されているかは提案されていません。