2つの変数間の


8

まず、についての議論は一般に(つまり、回帰における決定係数)についての説明を引き起こすことを理解しています。私が答えようとしている問題は、2つの変数間の相関のすべてのインスタンスにそれを一般化することです。R 2r2R2

だから、私はかなりの間、分散の分散について困惑してきました。私はいくつかの説明を提供しましたが、それらはすべて問題があるようです:

  1. これは共分散の別の用語です。因子分析の文献ではPCAとEFAを区別するため、後者は共有分散を説明し、前者は説明しないと説明しているため、これは当てはまりません(PCAは明らかに共分散行列で動作しているため、共分散を考慮しているため、共有されます分散は異なる概念でなければなりません)。

  2. 相関係数の2乗()です。見る:r2

これは少し意味があります。ここでの問題は、それが共有分散であることを意味する方法を解釈することです。たとえば、「共有分散」の解釈の1つはです。はそれまで減少しない、または確かにすぐ直感的な概念[ ; これは4次元オブジェクトです]。r 2 c o v(A 、B )2 /(v a r(A )× v a r(B ))cov(あ、B)/[var(あ)+var(B)]r2cov(あ、B)2/(var(あ)×var(B))

上記のリンクはどちらも、バレンティン図で説明しようとしています。彼らは助けにはなりません。まず、円のサイズは同じです(これは、何らかの理由で図にとって重要であるように思われます)。これは、不均一な分散を考慮していません。それは標準化された変数のバレンティンダイアグラムであり、したがって分散が等しいと想定できます。だから、、いない。r 2rr2

TL; DR:共有分散の説明はこれを言います:

係数を2乗すると、2つの変数が共有する分散のパーセンテージがわかります。

なぜそうなのでしょうか?


1
両方の点(「共分散」と「r二乗」)は正しい解釈です。私はあなたにお勧めしますこの私の答えを:共分散の2つの相対的な大きさの産物であり、準同時確率です。r2
— ttnphns 2014年

1
EFA内では、彼らは通常「共有分散」ではなく「共通分散」と言います。共通分散は、完全な共線性の領域です。一方、「共有分散」という用語は完全には定義されていません(あなたの質問はそれをどのように定義するかです)。
— ttnphns 2014年

1
ベン(バレンティン)ダイアグラムは、共分散の大きさが2つの円(分散)の交差領域ではないため、の概念を適切に関連付けることができません。共分散は両方の分散に依存します。共分散のサイズは、より小さい分散のサイズよりも大きくなる可能性があります(交差によってベンに表示することは確かに不可能です)。r2
— ttnphns 2014年

1
それは背中のregressional定義に私たちをもたらし として1 - S SのR E S I D / S S T O トン。したがって、状況が同程度である場合は、簡単に自分自身を確認できます...r21−SSres私d/SStot
— ttnphns '06 / 06/21

1
共分散は「共有分散」であり、ifの生の大きさです。相対等級に正規化され、2つのバージョン、rとr-sqがあります。r-sqは、複合分散における共有分散の%として解釈できます。
— ttnphns 2014年

回答:


3

特定の著者が「分散の分散」によって何を意味するかを推測することしかできません。この概念が(直感的に)持つべき特性を検討することで、可能性を制限したいと思うかもしれません。 「分散が追加する」ことはわかっています。合計の分散は、Xとεの共分散がゼロの場合のXとεの分散の合計です。の「共有分散」を定義するのが自然であるXをの分散によって表される合計の分散の割合であることを合計でX。これは、任意の 2つの確率変数Xの共有分散を暗示するのに十分 です。バツ+εバツεバツεバツバツバツそしてその相関係数の二乗でなければなりません。Y

この結果は、二乗相関係数の「共有分散」としての解釈に意味を与えます。適切な意味で、それは実際には合計の1つの変数に割り当てることができる合計分散の一部です。

詳細は以下の通りです。

原則とその意味

もちろん場合、それらの「共有分散」(これを「SV」と呼ぶことにしましょう)は100%になるはずです。しかし、YとXが単にスケーリングまたはシフトされたバージョンである場合はどうなりますか?たとえば、Yが都市の気温をF度で表し、Xが気温をC度で表す場合はどうでしょうか。このような場合でも、XとYの SVは100%であるべきで、XとYの測定方法に関係なく、この概念が意味を持ち続けることをお勧めします。Y=バツYバツYバツバツYバツY

(1)SV⁡(α+βバツ、γ+δY)=SV⁡(バツ、Y)

任意の数値およびゼロ以外の数値β 、δの場合。α、γβ、δ

別の原理は、がXに依存しない確率変数である場合、X + εの分散を2つの非負の部分に一意に分解できることです。εバツバツ+ε

Var⁡(バツ+ε)=Var⁡(バツ)+Var⁡(ε)、

この特殊なケースでSVを次のように定義しようとすることを示唆しています。

(2)SV⁡(バツ、バツ+ε)=Var⁡(バツ)Var⁡(バツ)+Var⁡(ε)。

これらの基準はすべて2次までです(これらは、期待値と分散の形式で変数の1次モーメントと2次モーメントのみを含む)ので、とεが独立であり、それらが無相関であることだけを要求する要件を緩和しましょう。これにより、他の場合よりも分析がより一般的になります。バツε

結果

これらの原則(受け入れた場合)は、独特で親しみやすく解釈可能な概念につながります。 トリックは、一般的なケースを合計の特別なケースに減らすことであり、そこで定義適用できます。(2)

与えられた、我々は単に分解しようとするとYをのスケール、シフトしたバージョンにXプラスと無相関である変数X(それが可能だ場合)であること、の検索を聞かせて定数:αとβとランダム変数εのためのどれ(バツ、Y)Yバツバツαβε

(3)Y=α+βバツ+ε

。分解が一意になる可能性がある場合は、Cov⁡(バツ、ε)=0

E[ε]=0

そう一度という発見され、αがによって決定されますβα

α=E[Y]−βE[バツ]。

これは線形回帰に非常によく似ており、実際にそうです。最初の原則では、とYを再スケーリングして単位分散を持たせることができ(それぞれにゼロ以外の分散があると仮定)、それが行われると、標準回帰の結果は(3 )のβの値がXとYの相関であることを表明します。バツYβ(3)バツY

(4)β=ρ(バツ、Y)。

また、分散の撮影が得られます(1)

1=Var⁡(Y)=β2Var⁡(バツ)+Var⁡(ε)=β2+Var⁡(ε)、

含意

(5)Var⁡(ε)=1−β2=1−ρ2。

したがって

SV⁡(バツ、Y)=SV⁡(バツ、α+βバツ+ε)(モデル3)=SV⁡(βバツ、βバツ+ε)(物件1)=Var⁡(βバツ)Var⁡(βバツ)+Var⁡(ε)(定義2)=β2β2+(1−β2)=β2(結果5)=ρ2(関係4)。

Yρ(Y、バツ)=ρ(バツ、Y)バツY

SV⁡(バツ、Y)=ρ(バツ、Y)2=ρ(Y、バツ)2=SV⁡(Y、バツ)。
弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.