線形回帰の系統的/測定誤差


8

一連のデータがあり、測定の不確かさ{(\ Delta x_i、\ Delta y_i)}(測定装置からの系統誤差の伝搬から生じる)がそれぞれ異なると仮定しますポイント。データセットに対して線形回帰を行う場合、勾配の不確実性を計算するにはどうすればよいですか?明示的な手順または式を教えてください。(Δは、xはI、Δ Y I)(xi,yi)(Δxi,Δyi)


2
どの測定誤差がより大きなものかを知っていますか?
— Dimitriy V. Masterov

1
デルタとは、連続した測定値の違いを意味しますか?データはシーケンシャルですか?エラーには相関関係があると思いますか?相関関係が弱まることを期待していますか?何らかの独立したレプリケーションはありますか?具体的な回答を提供するには、さらに情報が必要です。
— user3903581

あなたが探している用語はエラー伝播です。入力側にエラーがあり、そこから2つのパラメーターを計算(より具体的には、推定)します。残念ながら、「線形回帰」という名前は(人気のある)モデルを表すだけで、パラメーターを推定する方法は表しません。最もよく使用される方法については、おそらく解を調べることができます(たとえば、最小二乗法)。そうでない場合は、分析的に計算するか、数値評価で概算できます。
— ケルビム2018年

回答:


4

whereとして実験をモデル化でき 真の値を示す、は測定エラー、は観測から独立した「固定」コンポーネント(センサーの誤ったキャリブレーションから発生する可能性があります)、は観測から観察し、私たちがランダムとして扱う多くの可能な要因に対応します。のy I = Y * I + 〜V I 〜U I = ˉ U + V 私は〜V iの = ˉ V + uと私はxは* I、Y * I 〜U I、〜V I ˉ U、ˉ V U 、V

xi=xi∗+u~i
yi=yi∗+v~i
u~i=u¯+vi
v~i=v¯+ui
xi∗,yi∗あなた〜私、v〜私あなた¯、v¯あなた、v

単純な線形回帰は あり、勾配のOLS推定は ただし、得られるのはβ = C O V (X *、Y *)

y私∗=α+βバツ私∗+e私
〜β =COV(X、Y)
β^=Cov(バツ∗、y∗)Var(バツ∗)
β〜=Cov(バツ、y)Var(バツ)=Cov(バツ∗+あなた、y∗+v)Var(バツ∗+あなた)=Cov(バツ∗、y∗)+Cov(バツ∗、v)+Cov(y∗、あなた)+Cov(あなた、v)Var(バツ∗)+Var(あなた)+2Cov(バツ、あなた)

ここで、がと相互に無相関であると仮定します(エラーの性質についてより多くの推論がある場合に改善できるかなり強い仮定)。次に、 をサンプル変動として 推定できます。も推定する必要があります。複数回観察できる実験がある場合、1つの簡単なアプローチは、 ] を推定することです。v、あなたバツ∗、y∗

β〜=βσバツ∗2σバツ∗2+σあなた2≈βσ^バツ2−σ^あなた2σ^バツ2=βλ^
σ^バツ2バツ私σあなた2バツ私∗σあなた2=E[σバツ2|バツ私∗

これで、たとえばブートストラップメソッドで計算されたを使用して、を修正し、。σ^β〜2β^=β〜/λ^

σ^β^2=σ^β〜2λ^2

3

@yshilovによって与えられた答えは、測定誤差を誤差項に考慮することによって間違いなく素晴らしいと思い、結果を大幅に推定します

β〜=βσバツ2σバツ2+σあなた2

詳しく説明すると、このベータには、推定量が偏っているが0に偏っているという特別な特性があります。具体的には、線形回帰の場合、E(β^1)=β1⋅[σバツ2+σバツδσバツ2+2σバツδ+σδ2]

証明は次のとおりです。単純な線形回帰では、 測定エラーの場合、、、および、私たちが得る と仮定すると、、と真の予測値の分散

β^1=Σ私=1ん(バツ私−バツ¯)y私Σ私=1ん(バツ私−バツ¯)2
バツ私O=バツ私あ=δ私y私O=y私あ+ε私y私あ=β0+β1バツ私あ
y私O=β0+β1(バツ私O−δ私)+ε私=β0+β1バツ私O+(ε私−β1δ私)
E(ε私)=E(δ私)=0var(ε私)=σε2var(δ私)=σδ2=1んΣ私=1ん(δ私−δ¯)2σバツ2=Σ(バツ私あ−バツあ¯)2ん真の予測子と誤差の相関、次にσバツδ=cov(バツあ、δ)=1んΣ私=1ん(バツ私あ−バツ私あ¯)(δ私−δ¯)

cov(バツ私O、δ)=E(バツ私Oδ)−E(バツ私O)⋅E(δ)=E(バツ私Oδ)=E[(バツ私あ+δ)δ]=E(バツ私あδ)+E(δ2)
=[E(バツ私あδ)−E(バツ私あ)⋅E(δ)]+[var(δ)+[E(δ)]2]=cov(バツ私あ、δ)+σδ2=σバツδ+σδ2
次に、と共分散の双線形性プロパティにより、期待値は バツ¯=E(バツ私)β^1
E(β^1)=E[Σ私=1ん(バツ私O−バツ¯O)y私OΣ私=1ん(バツ私O−バツ¯O)2]=E(Σ私=1んバツ私Oy私O)−E(Σ私=1んバツ¯Oy私O)Σ私=1んE[(バツ私O−E(バツ私O))2]=E(Σ私=1んバツ私Oy私O)−E(バツ私O)⋅E(Σ私=1んy私O)Σ私=1んvar(バツ私O)
=∑i=1ncov(yiO,xiO)∑i=1nvar(xiO)=∑i=1ncov(β0+β1xiO+ϵi−β1δi, xiO)∑i=1nvar(xiO)=β1⋅∑i=1nvar(xiO)−β1⋅∑i=1ncov(xiO,δi)∑i=1nvar(xiO)
=β1⋅[1−∑i=1ncov(xiO,δi)/n∑i=1nvar(xiA+δi)/n]=β1⋅[1−σxδ+σδ2σx2+2cov(xiA,δi)+σδ2]=β1⋅[σx2+σxδσx2+2σxδ+σδ2]
必要に応じて、。したがって、結果は定評があります。E(β^1)=β1⋅[σx2+σxδσx2+2σxδ+σδ2]

1

私は同様の問題を抱えています- ここに投稿されました -まだ特定の答えはありません。今のところ私がやったことは、非常によく似たXのセットを集めて、それらの行の中でYに大きな変化があるかどうかを確認することです。別の種類のアプローチは、シミュレーションです。データセットから単一のXを使用しますが、予測子の系統的エラー(rnorm(...、0,0.3)など)に従って行を複製します。勾配の信頼区間は、系統誤差範囲に似ている場合があります。


0

データにはパラメトリックブートストラップをお勧めします。これは、実際のデータセットに類似しているが、各観測の不確実性によって暗示される程度が異なる新しいデータセットを生成することを意味します。

そのための疑似コードを以下に示します。rnormR言語では通常のように、へのベクトル入力を使用していることに注意してください。また、あなたがと呼んでいるものは標準エラーであると想定しています。Δ

For each b in 1...B:
    x_PB = rnorm(x, x_se)
    y_PB = rnorm(y, y_se)
    r[b] = cor(x_PB, y_PB)

次に、rの値の分布を確認します。

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.