PCAで得られた低ランクの近似行列によって、再構築エラーのどのノルムが最小化されますか?


26

PCA(またはSVD)行列の近似を考えるとX行列とX、我々は知っていることをXが最良の低ランク近似値であるX。X^X^X

これはによるとされる誘発∥⋅∥2規範(すなわち最大固有値規範)やフロベニウスに応じ∥⋅∥F標準?

回答:


30

単一の単語の答え:両方。


X2‖X‖Fは=√

‖X‖2=sup‖Xv‖2‖v‖2=max(si)
sはIXSX=USVは⊤
‖X‖F=∑ijXij2=tr(X⊤X)=∑si2,
siXSX=USV⊤

PCAは、データが中心にある場合と同じ特異値分解によって与えられます。USは主成分、Vは主軸、つまり共分散行列の固有ベクトルであり、k個の最大特異値に対応するk個の主成分のみを含むXの再構成はX_k = U_k S_k V_k ^ \ topで与えられます。XkkXk=UkSkVk⊤

エッカート・ヤングの定理はと言う再構成誤差のノルムを最小化する行列であるランクすべての行列の中。これは、フロベニウスノルムと演算子ノルムの両方に当てはまります。コメントの中で@cardinalが指摘したように、フロベニウス事件の場合、1907年に(グラムシュミット名声の)シュミットによって最初に証明されました。その後、1936年にエカートとヤングによって再発見され、現在ではほとんどがその名前に関連付けられています。Mirskyは、1958年に定理をユニタリ変換の下で不変なすべてのノルムに一般化しました。これには、演算子2-ノルムが含まれます。 ‖ X - A ‖ A 、K 2Xk‖X−A‖Ak2

この定理は、Eckart-Young-Mirsky定理と呼ばれることもあります。スチュワート(1993)は、それをシュミット近似定理と呼んでいます。シュミット・エッカート・ヤング・ミルスキーの定理と呼ばれることもあります。


演算子証明- ノルム2

ましょフルランクであること。ランクである、その零空間が有する寸法を。最大の特異値に対応するの右特異ベクトルがまたがる空間の次元はです。したがって、これら2つのスペースは交差する必要があります。してみましょう交差点から単位ベクトルとします。次に、以下を取得します。 QED。N K N - K 、K + 1 XのK + 1 W ‖ X - A ‖ 2 2 ≥ ‖ (X - A )W ‖ 2 2 = ‖ X W ‖ 2 2 = K + 1 Σ iは= 1、S 2 I(V ⊤ I W )2 ≥ S 2XnAkn−kk+1Xk+1w

‖X−A‖22≥‖(X−A)w‖22=‖Xw‖22=∑i=1k+1si2(vi⊤w)2≥sk+12=‖X−Xk‖22,

フロベニウスのノルムの証明

を最小化するランク行列を探します。を因数分解できます。ここで、は正規直交列があります。固定を最小化することは、解回帰問題です。それを差し込むと、を最小化する必要があることがわかりますここで、はの共分散行列、つまりK ‖ X - A ‖ 2 F A = B W ⊤ W K ‖ X - B W ⊤ ‖ 2 W B = X W ‖ X - X W W ⊤ ‖ 2 = ‖ X ‖ 2 - ‖ X W W ⊤ ‖ 2 = c o n s t − t r(Ak‖X−A‖F2A=BW⊤Wk‖X−BW⊤‖2WB=XW

‖X−XWW⊤‖2=‖X‖2−‖XWW⊤‖2=const−tr(WW⊤X⊤XWW⊤)=const−const⋅tr(W⊤ΣW),
ΣXΣ=X⊤X/(n−1)。再構成エラーがの列として取ることによって最小化されることをこれは意味一部の正規直交ベクトルは投影の全分散を最大化します。Wk

これらが共分散行列の最初の固有ベクトルであることはよく知られています。実際、場合、ます。に正規直交列も書き込むと、ときに最大にます。その後、定理はすぐに続きます。kX=USV⊤Σ=VS2V⊤/(n−1)=VΛV⊤R=V⊤W

tr(W⊤ΣW)=tr(R⊤ΛR)=∑iλi∑jRij2≤∑i=1kλk,
W=Vk

次の3つの関連するスレッドを参照してください。


フロベニウスノルムの証明の以前の試み

この証拠はオンラインのどこかで見つけましたが、コメントの@cardinalで説明されているように間違っています(ギャップが含まれています)。

フロベニウスのノルムは、特異値を変更しないため、ユニタリ変換では不変です。したがって、次のようになります。ここで。継続:すべての非対角要素の場合、これが最小化されるゼロであり、全ての対角項が相殺の最大特異値 [ここでギャップを:これは明らかではない]、すなわちひいては。

‖X−A‖F=‖USV⊤−A‖=‖S−U⊤AV‖=‖S−B‖,
B=U⊤AVBは、K 、K 、S 、I 、B 、O 、P tのiはmがLを = S K A O P をt iはmはL = U K S K V ⊤ kは
‖X−A‖F=∑ij(Sij−Bij)2=∑i(si−Bii)2+∑i≠jBij2.
Bkksi Boptimal=SkAoptimal=UkSkVk⊤

2
フロベニウスノルムの場合の証明は正しくありません(少なくとも完全ではありません)。なぜなら、ここでの引数は、同じランクの行列が他の対角項の一部を相殺する可能性を排除しないためです。対角線。ギャップをより明確に見るために、対角線を一定に保ち、非対角線を「ゼロ化」すると、問題のマトリックスのランクが上がることが多いことに注意してください!
— 枢機inal 14

1
また、SVDは、1874年早ければベルトラミ(少なくとも非常に一般的で、特別なケースが)とヨルダンに知られていたことに注意してください
— カーディナル

BSk∑i(si−Bii)2∑i≠jBij2
— アメーバは2014

3
私は、GW Stewart(1993)、特異値分解の初期の歴史、SIAM Review、vol。35、いいえ。4、551-566そして、あなたが過去の歴史的な問題に興味を示したことを考えると、あなたもそう思うと思います。残念ながら、スチュワートはシュミットの1907年の証拠の優雅さを意図せずに過度に却下していると思います。その中に隠されているのは、スチュワートが見落としているリグレッションの解釈であり、これは非常にきれいです。最初の対角化アプローチに従う別の証拠がありますが、ギャップを埋めるために追加の作業が必要です。(続き)
— 2014

2
@枢機inal:はい、あなたは正しいです、今私もギャップを見ます。スチュワートの論文を本当にありがとう、それは非常に興味深い読み物でした。スチュワートはシュミットとワイルの証明を提示しているようですが、どちらもここでコピーしたいものよりも複雑に見えます(そして今のところ、それらを注意深く研究する時間はありませんでした)。私は驚いています。これは非常に単純な結果であると思っていましたが、思っていたほどささいなことではないようです。特に、フロベニウスの場合が演算子の標準よりもはるかに複雑であるとは思っていませんでした。今すぐ投稿を編集します。明けましておめでとうございます!
— アメーバは、モニカを復活させる
弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.