なぜ人々はスムーズなデータを好むのですか?


10

私は、Gaussian Process RegressionにSquared Exponentialカーネル(SE)を使用します。このカーネルの利点は次のとおりです。1)単純:3つのハイパーパラメータのみ。2)スムーズ:このカーネルはガウスです。

なぜ「なめらかさ」がとても好きなのですか?ガウスカーネルは無限に微分可能であることは知っていますが、それはそれほど重要ですか?(SEカーネルが非常に人気がある理由が他にあるかどうか教えてください。)

PS:現実世界のほとんどの信号(ノイズなし)はスムーズであると言われました。誰かがこの概念を理解するのを手伝ってくれませんか?


4
あなたはなぜ人々が滑らかさを好むのかという心理的な質問や、なぜ滑らかな関数が統計的に優れているのかという統計的な質問をしているのですか
John

@ジョンコメントありがとうございます。私はあなたのポスト内と加えて2つ目の質問、私が確認したい理由をスムーズにしている現実の世界で最も信号あるに参照のうえました
kakanana

回答:


15

Natura non facit saltus」は哲学の古い原則です。また、美しさと調和はそのような原則です。統計に影響を与えるもう1つの哲学的原則は、定性的思考です。従来、私たちは効果の大きさではなく、効果があるかどうかを考えていません。これは、仮説のテストにしましょう。推定量は、自然の知覚には正確すぎます。そのままお持ちください。

統計は人間の知覚に役立つものでなければなりません。したがって、不連続点は嫌われます。人はすぐに尋ねるでしょう:なぜこれで正確に不連続なのですか?特に密度推定では、これらの不連続点は主に実際のデータの非漸近的な性質によるものです。しかし、特定の有限サンプルについてではなく、根底にある自然の事実について知りたいのです。この性質がジャンプしないと思う場合は、スムーズな推定量が必要です。

厳密な数学的見地からは、その理由はほとんどありません。また、ライプニッツとニュートン以来、滑らかではない自然現象が知られるようになりました。あなたが働いている自然科学者と話してください。滑らかさ/不連続性に関する彼の見解に異議を唱え、次に彼の理解に最も役立つとあなたが決定したことを実行します。


2

実務上の問題には、さらに2つの理由があります。1つ目は、分析関数は数学的に操作するのがはるかに簡単であるため、アルゴリズムについての定理を証明し、より強力な基盤を提供することです。

2つ目は感度です。で出力が不連続になる機械学習器あるとします。そうすると、とで非常に異なる結果が得られますが、不連続にしたので問題ありません。あなたは(わずかに異なるデータを使用してモデルを訓練する場合さて、)、ランダムノイズだけの小さなビット異なる場合、不連続性は今になりますおそらく、非常に近いなく、かなり、そして今が、 、値によっては、値がと大きく異なるMx=x0x0ϵx0+ϵM~x~0x0ϵx0+ϵMM~


1

問題に応じて、多くの動機があります。しかし、考え方は同じです。より良い解決策を達成し、複雑さに対処するために、いくつかの問題に関するアプリオリな知識を追加します。言い換えると、モデルの選択です。ここにモデル選択の良い例があります。

それと深く関係しているもう1つのアイデアは、データサンプルの類似性測定値を見つけることです(そのアイデアに関連するさまざまな用語があります:地形マッピング、距離計量、多様体学習など)。

ここで、実用的な例である光学式文字認識について考えてみましょう。キャラクターの画像を取得する場合、分類子が不変性を処理することを期待します。画像を回転、変位、または拡大縮小すると、それを検出できるはずです。また、入力に1つの変更をわずかに適用すると、両方のサンプル(元のサンプルと変更後のサンプルは非常に似ている)であるため、分類子の回答/動作もわずかに異なると予想されます。これが、スムーズさの強制の出番です。

そここのアイデアを扱った論文の富があるが、この1(パターン認識、接線距離と接線伝播における変換不変性、Simardらは)非常に詳細にこれらのアイデアを示しています

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.