可能性を厳密に定義する方法は?


30

尤度は、たとえば、いくつかの方法で定義できます。

  • 関数からマップをすなわち、。LΘ×バツ(θ、バツ)L(θ∣バツ)L:Θ×バツ→R

  • ランダム関数L(⋅∣バツ)

  • また、尤度は「観測された」尤度のみであると考えることもできL(⋅∣バツobs)

  • 実際には、尤度は\ thetaの情報をθ乗法定数までしか持ち込まないため、尤度は関数ではなく関数の等価クラスと考えることができます

パラメーター化の変更を検討する際に別の問題が発生します:ϕ=θ2が新しいパラメーター化である場合、一般にL(ϕ∣バツ)で\ phiの尤度を示しϕ、これは前の関数L(⋅∣バツ)でθ2が、でϕ。これは虐待的だが有用な表記法であり、強調しないと初心者に困難をもたらす可能性がある。

尤度のあなたのお気に入りの厳密な定義は何ですか?

さらに、どのようにL(\ theta \ mid x)を呼び出すのL(θ∣バツ)ですか?私は通常「xが観測されたときの\ thetaの尤度」のようなことを言います。θバツ

編集:以下のいくつかのコメントを考慮して、私はコンテキストを正確にすべきだったと思います。各f(\ cdot \ mid \ theta)を使用して、何らかの支配的なメジャーに関する密度のパラメトリックファミリー\ {f(\ cdot \ mid \ theta)、\ theta \ in \ Theta \}によって与えられる統計モデルを検討します。観測空間{\ cal X}で定義されます。したがって、L(\ theta \ mid x)= f(x \ mid \ theta)を定義し、問題は「Lとは何ですか?」(質問は尤度の一般的な定義に関するものではありません){f(⋅∣θ)、θ∈Θ}f(⋅∣θ)バツL(θ∣バツ)=f(バツ∣θ)L


2
(1)すべてのについてため、の定数でさえ定義されていると思います。(2)やようなパラメーターを単に分布の多様体の座標であると考える場合、パラメーター化の変更には本質的な数学的意味はありません。それは単に説明の変更です。(3)英語のネイティブスピーカーは、より自然に、「見込み言うの「に。」」ではなく (4)「が観測されるとき」という節には、ほとんどのが観測されないため、哲学的な困難があります。単に「与えられた可能性」と言ってはいけない∫L(θ|x)dx=1θLϕθ θxxθx "?
— whuber

1
@whuber:(1)については、定数が明確に定義されているとは思わない。「正規化がarbitrary意的であるため、尤度は確率ではない」と書いているET Jaynesの本を参照してください。
— ニールG

3
Neil:Jaynesはではなく介した積分による正規化を参照していました。θx
— whuber

1
@whuber:を変更すると対数尤度に一定量が追加されるため、Cramer-Raoの境界ではスケーリング係数は重要ではないと思います。k
— ニールG

1
私は、一定の役割を果たしている任意のアプリケーションが表示されない、ニールに同意する
— ステファン・ローラン

回答:


13

3番目の項目は、厳密な定義として最も頻繁に使用されるものです。

他のものも面白いです(+1)。特に、最初の方法は魅力的で、サンプルサイズが(まだ)定義されていないという難しさがあるため、 "from"セットを定義することは困難です。

私にとって、尤度の基本的な直観は、確率変数の関数ではなく、モデルとそのパラメーターの関数であるということです(また、教育目的の重要なポイント)。だから、3番目の定義に固執します。

表記法の乱用の原因は、尤度の「from」セットが暗黙的であることにあります。これは通常、明確に定義された関数には当てはまりません。ここで、最も厳密なアプローチは、変換後の尤度が別のモデルに関連していることを認識することです。これは最初のモデルと同等ですが、さらに別のモデルです。そのため、尤度表記法は、どのモデルを参照するかを示す必要があります(下付きまたはその他)。私はもちろんそれを決してしませんが、教えるために、そうするかもしれません。

最後に、以前の答えと一致するように、最後の式で「可能性」と言います。θ


ありがとう。そして、乗法定数までの平等に関するあなたのアドバイスは何ですか?
— ステファンローラン

個人的には、定義にハードコードするよりも、必要なときに呼び出すことを好みます。そして、モデルの選択/比較では、この「乗法定数」までの等式は成り立たないと思います。
— gui11aume

OK。名前については、2つの可能性のある観測値の尤度およびについて議論することを想像できます。このような場合、「観測されたときのの尤度」、または「観測の尤度」、または他の何かを言うでしょうか?Lを(θは、| xは2)θ X 1 θ のx 1L(θ∣x1)L(θ∣x2)θx1θバツ1
— ステファンローラン

1
モデルを再パラメータ化すると、実際には、尤度は関数合成として計算されますここで、です。この場合、はから進むため、尤度の定義セット(「from」セットと呼ばれる)は同じではなくなります。同じ関数ではないため、最初の関数と2番目の呼び出すことができます。 L (。| X )∘ G (。)G (Y )= Y 2、G R R + L 1(。|)L 2(。|)ϕ=θ2L(.|x)∘g(.)g(y)=y2gRR+L1(.|)L2(。|)
— gui11aume

1
3番目の定義はどのように厳密ですか?そして、サンプルサイズが定義されていない問題は何ですか?サンプル空間対応するシグマ代数を自然に存在させると言うので、なぜ尤度の並列定義ができないのですか?Ω nはP(バツ1、バツ2、…、バツn∣θ)Ωn
— ニールG

8

私はそれを何か違うものと呼ぶと思います。尤度は、与えられた関数として表されるパラメーター値を与えられた観測されたxの確率密度です。比例定数についての見解は共有しません。尤度の単調関数を最大化すると、についても同じ解が得られるため、これが効果を発揮すると思います。したがって、または一般的に行われるなどの他の単調関数に対してを最大化できます。θ X θ C L (θ | X )、C > 0 のログ(L (θ | X ))θxθcL(θ∣x)c>0log⁡(L(θ∣x))


4
最大化だけでなく、:アップツー比例も尤度比の概念であり、ベイズ統計のベイズ式に遊びに来て
— ステファン・ローラン

誰かが私の答えに反対票を投じるかもしれないと思った。しかし、この方法で尤度を定義することは、プロポーショナルなものを尤度と呼ぶことなく決定的な確率として定義することは非常に合理的だと思います。@StéphaneLaurentは、事前分布に関するコメントです。関数が積分可能な場合、密度に正規化できます。事後は、尤度に事前を掛けたものに比例します。事後は積分で除算することで正規化する必要があるため、事前分布を分布として指定することもできます。これは、拡張された意味でのみ、これが不適切な事前分布に適用されます。
— マイケルR.チャーニック

1
なぜ誰かがこの答えに反対票を投じるのかはよくわかりません。OPの2番目と質問に最初の質問よりも多く回答しようとしているようです。おそらく、他の読者には完全に明らかではなかったでしょう。乾杯。:)
— 枢機

@Michael私もこの答えに反対票を投じる必要はないと思います。情報価値のない事前事態について(これは別の議論であり、)この主題についての新しい議論を開くつもりです。英語は簡単ではないので、すぐにやるつもりはありません。これは数学よりも「哲学」を書くのが難しいからです。
— ステファンローラン

1
@Stephane:必要に応じて、他の質問を直接フランス語で投稿することを検討してください。このサイトにはフランス語を母国語とする人が何人かいますが、これらはおそらくあなたが確信できない文章を翻訳するのに役立つでしょう。これには、モデレーターと非常に優れた英語統計ジャーナルの編集者が含まれます。質問を楽しみにしています。
— 枢機

6

厳密な数学的定義の試みは次のとおりです。

LET濃度認めランダムベクトルでありある程度に対してに、用、上の密度のファミリーであるに対して。次に、任意のについて、尤度関数をに定義します。明確にするため、それぞれの、私たちは持っている。は特定のポテンシャルであると考えることができます F (X | θ 0)ν R N θ ∈ Θ { F (X | θ ):θ ∈ Θ } R N ν X ∈ R N L (θ | X )F (X | θ )x L x:Θ → R x x o bバツ:Ω→Rnf(バツ|θ0)νRnθ∈Θ{f(バツ|θ):θ∈Θ}Rnνバツ∈RnL(θ|バツ)f(バツ|θ)バツLバツ:Θ→Rバツ θ 0 θバツobsおよびが「真の」値になるようにします。θ0θ

この定義に関するいくつかの観察:

  1. この定義は、離散、連続、およびその他の種類の分布ファミリーを処理するのに十分堅牢です。バツ
  2. 確率分布/測定のレベルではなく、密度関数のレベルで尤度を定義しています。この理由は、密度が一意ではないためです。これは、密度の同等クラスに渡しても安全である状況ではないことがわかります。連続した場合、密度の選択が異なるとMLEが異なります。ただし、ほとんどの場合、理論的に望ましい密度のファミリの自然な選択があります。
  3. この定義が気に入っているのは、作業中のランダム変数が組み込まれているためです。また、設計上、分布を割り当てる必要があるため、の "true but unknown"値の概念も厳密に組み込まれています。示されます。私にとって、学生として、可能性について厳格になるという課題は、常に「真の」および「観察された」の現実世界の概念を数学とどのように調和させるかでした。多くの場合、これらの概念は形式的ではないと主張するインストラクターによって助けられませんでしたが、物事を証明するときにそれらを回して正式に使用します!そのため、この定義では正式に扱います。θ 0 θ X O B Sθθ0θバツobs
  4. 編集:もちろん、通常のランダムな要素、およびを自由に考えることができます。あなたが注意している限り(または、そのレベルの厳密さがあなたにとって重要でない場合でもそうでない場合でも)。S (θ | X )I(θ | X )L(θ|バツ)S(θ|バツ)私(θ|バツ)

4
@ Xi'anをで均一にします。2つの密度と。どちらもと有効のために密度のあるが、下の MLEが存在し、に等しい下のに対し、、我々が持っているそうを設定すると、尤度になり、実際にはMLEは存在しません。(0 、θ )F 1(X )= θ - 1 I [ 0 < X < θ ] F 2(X )= θ - 1 I [ 0 ≤ X ≤ θ ] F 1 、F 2 U(0 、θ )f 2 maxバツ1、。。。、バツn(0、θ)f1(バツ)=θ−1私[0<バツ<θ]f2(バツ)=θ−1私[0≤バツ≤θ]f1f2うん(0、θ)f2F 1 ΠのJ F 1(のx J |最大X I)= 0 θ = 最大X I 0 SUP θ Π J F 1(X | θ )θ最大バツ私f1∏jf1(バツj|最大バツ私)=0θ^=最大バツ私0supθ∏jf1(バツ|θ)は、どのについても達成されません。θ
— 男

1
@男:ありがとう、この興味深い反例については知りませんでした。
— 西安

1
@guyあなたはがどのに対しても達成されないと言いました。ただし、以下に示すように、この最高点はある時点で達成されます ここで。すべてのについてと仮定しています。1を確認するのは簡単です場合、です。2.、もし。続行...θ L 1(θ ; X )= N Πの J = 1 F 1(XのJ | θ )= θ - N N Πの J = 1 I ( 0 < X J < θ ) = θ - N I ( 0 < Msupθ∏jf1(xj|θ)θM = 最大{ X 1、... 、xはN } xは、J > 0 、J = 1 、... 、N L 1(θ ; X )= 0 0 < θ ≤ M L 1(θ ; X )= θを− n M < θ < ∞
L1(θ;x)=∏j=1nf1(xj|θ)=θ−n∏j=1nI(0<xj<θ)=θ−nI(0<M<θ),
M=max{x1,…,xn}xj>0j=1,…,nL1(θ;x)=00<θ≤ML1(θ;x)=θ−nM<θ<∞
— アレクサンドルパトリオタ14年

1
@guy:続き...つまり、すべての、です。最大値はありませんが、上限は存在し、で与えられ、引数は おそらく、通常の漸近はここでは適用されず、他のいくつかの通行料が採用されるべきです。しかし、の上限は存在するか、非常に基本的な概念をいくつか見逃していました。θ ∈ (0 、∞ )SUP θ ∈ (0 、∞ ) L 1(θ 、X )= M - N M = argをSUP θ ∈ (0 、∞ ) L 1(θ ; x )。
L1(θ;バツ)∈[0、M−n)、
θ∈(0、∞)
supθ∈(0、∞)L1(θ、バツ)=M−n
M=arg⁡supθ∈(0、∞)L1(θ;バツ)。
L1(θ;バツ)
— アレクサンドルパトリオタ14年

1
@AlexandrePatriota明らかに、最高は存在しますが、それは関数によって達成されません。という表記の意味がわからないため、を生成するの引数はありません。MLEは、(通常)に到達するとして定義され、ここでは到達しないはありません。明らかにそれを回避する方法があります-私たちが訴える漸近性は、そのような特性を持つ可能性が存在することを要求し、そこにあります。ではなく、単にです。L 1(θ ; X )SUPをL 1(θ 、M )= 0 θ SUP θ SUP L 2 L 1arg⁡supL1(θ;バツ)supL1(θ;M)=0θ^supθ^supL2L1
— 男14年
弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.