分析的なヤコビアンが利用可能な場合、ヘッセ行列をで近似するか、ヤコビアンの有限差分で近似する方が良いでしょうか?


19

いくつかのモデルパラメーターを計算して、残差の2乗和を最小化し、誤差がガウス分布であると仮定するとします。私のモデルは分析的な微分を生成するため、オプティマイザーは有限差分を使用する必要がありません。適合が完了したら、適合パラメーターの標準誤差を計算します。

一般に、この状況では、エラー関数のヘッシアンは次のように共分散行列に関連付けられます: ここで、は残差の分散です。σ 2

σ2H−1=C
σ2

誤差の分析的微分が利用できない場合、ヘッシアンを計算することは通常非実用的であるため、が適切な近似として採用されます。JTJ

ただし、私の場合、分析Jを持っているので、有限差分JでHを計算するのは比較的安価です。

したがって、私の質問は次のとおりです:正確なJを使用してHを近似し、上記の近似を適用するか、Jを有限差分Jで近似する方が正確ですか?

回答:


12

良い質問。まず、この近似がどこから来たかを思い出してください。してみましょう、あなたのデータポイントも、あなたのモデルになるとあなたのモデルのパラメータであること。非線形最小二乗問題の目的関数はここで、は残差のベクトルです。目的関数の正確なヘッセ行列はです。したがって、この近似の誤差は(X I、Y I)F (⋅ )β 1H≈JTJ(xi,yi)f(⋅)β、R、RI=YI-、F(XI、β)H=JTJ+は、ΣRI∇2RIH-JTJ=ΣRI∇2RI12rTrrri=yi−f(xi,β)H=JTJ+∑ri∇2riH−JTJ=∑ri∇2ri。残差自体が小さい場合、これは適切な近似です。または、残差の2次導関数が小さい場合。線形最小二乗は、残差の2次導関数がゼロである特別な場合と考えることができます。

差分近似に関しては、比較的安価です。中心の差を計算するには、ヤコビ行列をさらに回評価する必要があります(前方差分では追加評価が必要になるため、気にしません)。中心差分近似の誤差は、およびに比例します。ここで、はステップサイズです。最適なステップサイズは。ここでN ∇ 4 R H 2 H H 〜ε 12nn∇4rh2h ϵh∼ϵ13ϵマシンの精度です。そのため、残差の導関数が爆発しない限り、有限差分近似はLOTの方が良いはずです。計算は最小限ですが、簿記は重要なことです。ヤコビアン上の各差分は、各残差に対してヘッセ行列を1行与えます。その後、上記の式を使用してヘッセ行列を再構築する必要があります。

ただし、3番目のオプションがあります。ソルバーが準ニュートン法(DFP、BFGS、Bryodenなど)を使用している場合、各反復で既にヘッセ行列を近似しています。近似は、反復ごとに目的関数と勾配値を使用するため、非常に優れたものになります。ほとんどのソルバーは、最終的なヘッセ行列推定(またはその逆)へのアクセスを提供します。それがあなたのためのオプションであるなら、私はそれをヘシアンの推定値として使用します。すでに計算されており、おそらくかなり良い推定値になるでしょう。


素晴らしい反応、ありがとう。それぞれの場合の推定誤差の比較でそれを正当化することは非常に啓発的です。が有限差分の最適なステップであることをどのように知っているか尋ねることができますか?私はそれを見たことがありません。ϵ1/3
— コリンK

5
これは、切り捨てエラーと丸めエラーのバランスを取るための古いトリックです。明らかに、切り捨てエラーを最小限に抑えるには、をできるだけ小さくする必要があります。ただし、が小さくなりすぎると、重大な丸め誤差が発生し始めます。導出は比較的簡単です。中心の違いを仮定すると、打ち切り誤差は比例します。丸め誤差は常に比例します。2つを追加し、で最小化します。あなたは取得。h h 2 f ‴(x )ϵ f (x )hhh2f‴(x)時間時間〜ε1ϵf(x)hhh∼ϵ13
— ビルウォスナー

3
これは、中心的な違いにのみ当てはまります。前方差分の場合、最適なステップサイズはです。他にもトリックがあります。たとえば、実際にが何であるかを確認してください。これは馬鹿げているように聞こえますが、浮動小数点演算では奇妙なことが起こります。ここでは、正しい値を持っていることを確認するための簡単な方法です:。数学的にはもちろん、です。ただし、浮動小数点で正確に表すことができない値()を使用すると、そうではないことがわかります。 hhhactual=hdesiredh=0.0001h∼ϵ12hhh_actual = (x + h_desired) - xhactual=hdesiredh=0.0001
— ビルウォスナー

おそらく、コメントではなく、このコンテンツを回答に追加することができます。そうすれば、将来のユーザーは、回答で行われた主張に直接関係する資料を見つけるために、拡張されたコメントセクションを歩く必要がありません。
— Sycoraxが復活モニカ言う

2
あら。ヘッセ行列の準ニュートン近似は、ヘッセ行列のひどい推定値になる可能性があり、そのため、共分散行列の推定値が非常に悪くなります。アルゴリズムの最適化への進行を促進するのに役立ちますが、ヘッセ行列の推定値としては非常に貧弱な場合があります。
— マークL.ストーン
弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.