ボールへの正則化と投影


8

私はボールへの射影とシンプレックスへのユークリッド射影に関して正則化がどのように機能するかを理解しようとしています。l∗

重みベクトルをまたはボールに投影したときの意味がよくわかりません。l1l2

正則化の概念をプログラムで理解できます。、重みベクトルの各要素を、を適用して、小さい重みを0に駆動します。l1signum(w) * max(0.0, abs(w) - shrinkageValue)shrinkageValue = regularizationParameter * eta

私はここでいくつかの数学が欠けていると思うので、私の質問は、ベクトルの投影を先ほど説明したプログラムにどのように変換するのですか?正則化とベクトル投影はどのように関連していますか?

編集:私はこの論文をうとしています高次元で学習するためのボールへの効率的な投影l1

回答:


11

正則化とベクトル投影は、制約付き最適化とKarush-Kuhn(関係なし)-Tucker条件の概念によって接続されます。

KKT条件とは何ですか?

場合は、その簡単に述べると、これらの状態問題の解決策"最小であるFを(X )に従うG (X )≤ 0 "、次にxはまた、問題を解決する∇ F (X )= λ ∇ G (X )一部のスカラーλの場合。しかし、これは言うと等価である∇ F (X )- λ ∇ G (X )= 0、手段、そのXバツf(バツ)g(バツ)≤0バツ∇f(バツ)=λ∇g(バツ)λ∇f(バツ)−λ∇g(バツ)=0バツ最小化制約なし最適化問題は、 "最小 "。f(バツ)−λg(バツ)

直感は次のいずれかです。

  • 。この場合、 xは「内部解」であるため、その点で fの勾配はゼロでなければなりません。(それがゼロでない場合、 g (x )< 0を維持しながら、 xからその方向に少し移動し、 f (x )の値を大きくすることができます。次に、 λ = 0に設定して、完了しました。g(バツ)<0バツfバツg(バツ)<0f(バツ)λ=0

  • または、です。この場合、xは可能な解空間の端にあります。局所的に、勾配に直交する超平面のような、このエッジルックス∇ G (X )、あなたが維持する方法ので、Gの(X )= 0の制約は、上に移動または全てにおける勾配ダウンしていないことです。しかしことを意味するだけ方向勾配∇ F可能性おそらくポイントとまったく同じ方向である∇ G --ifは直交するた任意の成分であった∇ G、我々は移動することができ、Xをg(バツ)=0バツ∇g(バツ)g(バツ)=0∇f∇g∇gバツその方向に少し、直交超平面に留まり、f (x )を増やします。g(バツ)=0f(バツ)

KKT条件が制約付き最小化と正則化の間の関係をどのように説明するか

もし幾つかの規範と、いくつかの定数のCは、制約G (X )≤ 0手段xは半径の球体上に位置するCことノルム下。そして、拘束されていない製剤で、減算λ G (X )最大化するために、あなたが望む機能からは、正則のペナルティを適用して終わるものです:あなたは本当に引いているλを| x | + λ C(と定数λg(バツ)=|バツ|−ccg(バツ)≤0バツcλg(バツ)λ|バツ|+λcは最適化には関係ありません)。λc

人々はしばしば、制約のない最適化と制約のある最適化の間でこの「二重性」を利用します。グーグルですぐに見つけられる例については、On the LASSO and its dualを参照してください。

ここで予測が重要なのはなぜですか?

では、なぜ誰かが高速投影に関する論文を書いているのですか?

基本的に、あなたは一般的な制約付き最適化行うことができます一つの方法- 「最大化の対象のx ∈ X」は、 -次の操作を実行することです:f(バツ)バツ∈バツ

  • f (x )の制約のない最大化のための任意の反復アルゴリズムを取りますf(バツ)
  • 推測x 0から始めるバツ0
  • アルゴリズムの1つのステップを実行:x0′←step(x0)
  • その後、セットに戻って投影:X 1 ← P X(X ' 0)。Xx1←PX(x0′)
  • そして収束するまで繰り返します。

たとえば、これは、予測された勾配降下が通常の勾配降下からどのように導出されるかです。もちろん、ここでは投影関数最適化することが非常に重要です。PX

すべてを一緒に入れて

arg⁡minβ(y−β′X)2+λ||β||1

||β||1≤ccℓ1c

PX

*もっと効率的な方法があるので、人々が実際にこれをすることはないと思います。しかし、それらも予測を使用する可能性があります。編集:@Dougalが指摘しているように、予測された亜勾配降下のより洗練された変種は、2008年についての論文を書くのに十分でした。


1
ISTA / FISTAアルゴリズムは基本的に(加速された)射影降下法です。これは、最も好まれているLASSOアルゴリズムではないかもしれませんが、それは非常に優れています(その論文が発表されたとき、2008年頃の最新技術であると思います)。
— Dougal

@Dougal:参照してくれてありがとう!私はそれを編集した。
— ベン・クーン
弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.