可能性の最大化とクロスエントロピーの最小化の間の関係


回答:


10

ラベル用 yi∈{0,1}、パラメータ付きのベルヌーイモデルでのバイナリデータの可能性 θ です

L(θ)=∏i=1np(yi=1|θ)yip(yi=0|θ)1−yi
対数尤度は
log⁡L(θ)=∑i=1nyilog⁡p(y=1|θ)+(1−yi)log⁡p(y=0|θ)

そして、バイナリのクロスエントロピーは

L(θ)=−1n∑i=1nyilog⁡p(y=1|θ)+(1−yi)log⁡p(y=0|θ)

明らかに log⁡L(θ)=−nL(θ)。

最適値は θ∗ どちらの場合でもそれを観察できるため、両方で同じです θ これは最適ではありません。 1nL(θ)>1nL(θ∗)、それは 1n>0。(クロスエントロピーを最小化したいので、最適なθ∗ 最も少ない L(θ∗)。)

同様に、最適な値は θ∗ 同じです log⁡L(θ) そして L(θ) なぜなら log⁡(x) は単調増加関数です x∈R+、私たちは書くことができます log⁡L(θ)<log⁡L(θ∗)。(可能性を最大化したいので、最適なθ∗ 最も多い L(θ∗)。)

一部のソースは省略します 1nクロスエントロピーから。明らかに、これが唯一の変更値のをL(θ)、ただしオプティマの場所ではないため、最適化の観点からは区別は重要ではありません。ただし、負の符号は最大化と最小化の違いであるため、明らかに重要です。

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.