ランダムに生成されたツリーの予想される深さは?


19

私はずっと前にこの問題について考えましたが、それについての考えがありません。

生成アルゴリズムは次のとおりです。0からn − 1までの番号が付けられたn離散ノードがあると仮定します。そして、それぞれの私で{ 1 、... 、nは- 1 }、我々は作る私ツリー内の番目のノードの親はランダムノードで{ 0 、... 、I - 1 }。結果がルートノード0のランダムツリーになるように、各iを順に繰り返します。(おそらくこれは十分にランダムではありませんが、これは重要ではありません。)0n−1i{1,…,n−1}i{0,…,i−1}i0

このツリーの予想される深さは何ですか?


私は仮定しv0「それぞれのその後:ルートであり、あなたが言うことを意味しiでは[1,n)、私たちが作るi番目のノードの親...」。右?
— 無題14

何を試しましたか?ノードiの予想される深さであるについて、再帰関係を書いてみましたか?d(i)i
— DW

3
これらのオブジェクトは、「ランダム再帰ツリー」という名前で知られています。
— ジェームズマーティン14

回答:


15

elog⁡nに関して集中的な結果があると思いますが、詳細はまだ記入していません。

ノードが0を含まないd個の先祖を持つ確率の上限を取得できます。各可能な完全なチェーンのためのDの祖先の非ゼロ(1、2、。。。、D)、その鎖の確率である(1nd0d(a1,a2,...,ad)。これは1に対応します(1a1)(1a2)⋯(1ad)×1n(1+1の項の n倍1nここで、用語は順序付けられています。したがって、この確率の上限は1です(1+12+13+⋯1n−1)dここで、Hn−1は、n−1次高調波数1+1です。1n(d!)Hn−1dHn−1n−1。HN-1つの≈ログ(N-1)+γ。固定dおよびn→∞の場合、ノードnが深さd+1にある確率は最大で1+12+...+1n−1Hn−1≈log⁡(n−1)+γdn→∞nd+1

(log⁡n)dn(d!)(1+o(1))

スターリングの近似により、これを次のように推定できます。

1n2πd(elog⁡nd)d.

e log nよりも大きい場合、指数の底は小さいため、この境界は小さく、union境界を使用して、dが 0でない先祖を持つノードが少なくとも1つ存在する確率は小さい。delog⁡nd


見る

Luc Devroye、Omar Fawzi、Nicolas Fraiman。「スケーリングされた添付ファイルのランダム再帰ツリーの深度プロパティ。」

B.ピッテル。ランダム再帰ツリーとランダムm-ary探索ツリーの高さに注意してください。ランダム構造とアルゴリズム、5:337–348、1994

前者は、後者が最大の深さがである可能性が高いことを示し、別の証拠を提供すると主張しています。(e+o(1))log⁡n


2
非常に素晴らしい。他の読者のために明確にするため:繰り返すことができないため、用語(1 + 1aiは単なる上限です。(1+12+…+1n−1)d
— ピーターショー14

3

この質問は数年前に回答されましたが、楽しみのために、ここに上限の簡単な証明があります。期待値に限界を与え、次にテール限界を与えます。

RVの定義ノードの深さであることが私∈ { 0 、1 、... 、N - 1 }。ϕ i = ∑ i j = 0 e d jを定義します。dii∈{0,1,…,n−1}ϕi=∑j=0iedj.

eE[maxidi]eHn−1

証明。最大の深さは最大です。最後にます。 E [ LN φ N - 1 ] ≤ Eln⁡ϕn−1E[ln⁡ϕn−1]≤eHn−1

いずれかのためにに、コンディショニングの検査によって、 φ I - 1 φ I E [ φ Ii≥1ϕi−1ϕi

E[ϕi|ϕi−1]=ϕi−1+E[edi]=ϕi−1+eiϕi−1=(1+ei)ϕi−1.

帰納法により、

E[ϕn−1]=∏i=1n−1(1+ei)<∏i=1n−1exp⁡(ei)=exp⁡(eHn−1).

したがって、対数の凹によって、

E[ln⁡ϕn−1]≤ln⁡E[ϕn−1]<ln⁡exp⁡(eHn−1)=eHn−1.       ◻

テールバウンドは次のとおりです。

補題2. 修正します。次にであり、最大で。c≥0Pr[maxidi]≥eHn−1+cexp⁡(−c)

証明。およびマルコフ境界の 検査により、問題の確率は最大 補題1の証明から、。これを上記の右側に代入すると、証明が完了します。ϕ

Pr[ϕn−1≥exp⁡(eHn−1+c)]≤E[ϕn−1]exp⁡(eHn−1+c).
E[ϕn−1]≤exp⁡(eHn−1)   ◻

下限に関しては、考慮することにより、下限がかなり簡単に続くと思います。しかし...(e−1)Hn−O(1)maxidi≥ln⁡ϕt−ln⁡n [編集:話が早すぎた]

の厳密な下限を示すのはそれほど簡単ではないようです...(1−o(1))eHn


2

数か月前に、同じ質問を(まったく異なる形式で)考え、実際にはいくつかの類似したバリエーションについて考えました。

閉じた形式(/漸近的)の解決策はありませんが、このビューが役立つと思うかもしれません(おそらく上限だけを探しているのでしょうか?)。

ここで説明するプロセスは、Chinese Restaurant Processの一般化です。各「テーブル」は、ルートの親がであるサブツリーです。v0

また、これはあなたの質問に対する再帰式を提供します。

表すを有するこのようなツリープロセスの予想される高さノード。h(n)n

表す(分布の確率サブツリーへのノード)。Pn(B)=Πb∈B(b−1)!n!B

次に、探している量は次のように与えられます。h(n)

h(n)=∑B∈BnPn(B)⋅maxb∈Bh(b)

この再帰をコーディングする場合は、無限ループに陥らないように、次を使用してください。

h(n)=∑B∈Bn∖{{n}}Pn(B)⋅maxb∈Bh(b)1−1n!

ここで、は、同一のボールを任意の数の空でないビンに分割するすべてのセットのセットであり、です。 nh(1)=1Bnnh(1)=1


実際には、これが必要なときにを推定するために単純なモンテカルロ法を使用しました。この方法で実際にを計算しようとすると、非常に非効率的です。hh(n)h


1
アイデアをありがとう!実際、この問題に遭遇したときに初めてモンテカルロプログラムを作成しましたが、驚いたことに、正確な結果を得るのは非常に困難です。
— zhxchen17 14
弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.