ベイジアンディープラーニングとは何ですか?


13

ベイジアンディープラーニングとは何ですか?また、従来のベイジアン統計および従来のディープラーニングとどのように関連していますか?

関係する主な概念と数学は何ですか?それは単なるノンパラメトリックベイジアン統計と言えますか?現在の主要な開発およびアプリケーションと同様に、その独創的な作品は何ですか?

PS:Bayesian Deep Learningは大きな注目を集めています。NIPSワークショップをご覧ください。

回答:


10

NIPSワークショップリンクを離れて、Yee Whye TehはNIPSでBayesian Deep Learningで基調講演を行いました(ビデオ:https ://www.youtube.com/watch?v=LVBvJsTr3rg、スライド:http://csml.stats。 ox.ac.uk/news/2017-12-08-ywteh-breiman-lecture/)。講演のある時点で、Tehはベイジアンのディープラーニングを、ベイジアンフレームワークをディープラーニングからのアイデアに適用すること(ニューラルネットワークの重みに対する事後学習など)、およびディープベイジアンラーニングをディープラーニングからのアイデアに適用することとして要約したと思いますベイジアンフレームワーク(深いガウス過程または深い指数関数族のような)。もちろん、バリエーションオートエンコーダーのように、2つの概念の境界線をまたぐアイデアがあります。ほとんどの人がベイジアンディープラーニングと言うとき、それらは通常2つのうちのいずれかを意味し、それはあなたがリンクしたワークショップ(昨年のワークショップとともに)で受け入れられた論文に反映されます。アイデアは、90年代のニューラルネットワークのベイジアン学習に関するNealの研究に戻ります(http://citeseerx.ist.psu.edu/viewdoc/download?doi=10.1.1.446.9306&rep=rep1&type=pdf)、そしてそれ以来長年にわたって研究が行われてきました。オリジナルの変分オートエンコーダーペーパー(https://arxiv.org/pdf/1312.6114.pdf)。


10

最初に、従来のベイジアンニューラルネットワークの基礎となる確率モデルとは何かをよく理解することをお勧めします。以下では、いくつかの用語を太字で記載します。これらの用語をグーグルで検索して、より詳細な情報を見つけてください。これは基本的な概要です。役に立てば幸いです。

のがの場合を考える回帰におけるフィードフォワードニューラルネットワークを、いくつかの表記法を確立します。

ましょうにおける予測子の値を示す入力層。値単位で内層はによって表記するのために、。最後に、出力レイヤーます。(Z (ℓ ) 1、... 、Z (ℓ )N ℓ) ℓ = 1 、... 、L − 1 (y 1、… 、y k)(バツ1、…、バツp)=:(z1(0)、…、zN0(0))(z1(ℓ)、…、zNℓ(ℓ))ℓ=1、…、L−1 (y1,…,yk)=:(z1(L),…,zNL(L))

レイヤーユニットiの重みとバイアスは、場合、それぞれとで示されます。、および。iℓwij(ℓ)bi(ℓ)ℓ=1,…,L私=1…、Nℓj=1、…、Nℓ−1

ましょうである活性化機能ユニットの層におけるため、と私は= 1 ... 、Nのℓを。 Iのℓのℓ = 1 、... 、Lg私(ℓ):RNℓ−1→R私ℓℓ=1、…、L私=1…、Nℓ

一般的に使用されるアクティベーション関数は、ロジスティック、ReLU(別名ポジティブパート)、およびtanhです。

今、のため、層の遷移関数を定義 G (ℓ ):R Nのℓ - 1 → R Nのℓ:(Z (ℓ - 1 ) 1、... 、Z (ℓ - 1 )Nのℓ - 1) ↦ (Z (ℓ ) 1、... 、Z (ℓ=1、…、L 中 Z(ℓ ) I=G(ℓ ) I

G(ℓ):RNℓ−1→RNℓ:(z1(ℓ−1)、…、zNℓ−1(ℓ−1))↦(z1(ℓ)、…、zNℓ(ℓ))、
のためのiは=1、...、 Nのℓ。
z私(ℓ)=g私(ℓ)(∑j=1Nℓ−1w私j(ℓ)zj(ℓ−1)+b私(ℓ))、
私=1、…、Nℓ

全ての層における全てのユニットの重みとバイアスのセットを示す、ある θ = { W (ℓ )I 、J、B (ℓ ) I:ℓ = 1 、... 、Lθ 我々のニューラルネットワークは、機能のファミリーである G θ:R P → R K層の遷移関数の組成によって得られる: G θ = G (L ) ∘ G (L - 1 ) ○は⋯ ○はG (1 )。

θ={w私j(ℓ)、b私(ℓ):ℓ=1、…、L;私=1…、Nℓ;j=1、…、Nℓ−1}、
Gθ:Rp→Rk
Gθ=G(L)∘G(L−1)∘⋯∘G(1)。

上記の説明に関係する確率はありません。元のニューラルネットワークビジネスの目的は、関数フィッティングです。

ディープラーニングの「深い」とは、検討中のニューラルネットワークに多くの内部層が存在することを意味します。

{(バツ私、y私)∈Rp×Rk:私=1、…、n}

∑私=1n‖y私−Gθ(バツ私)‖2、
θバツ∗Gθ^(バツ∗)θ^目的関数へのペナルティ、またはトレーニング中のドロップアウトの使用など。Geoffrey Hinton(別名Deep Learning Godfather)と共同研究者は、これらの多くを発明しました。ディープラーニングの成功事例はどこにでもあります。

Lバツ、y(θ、σ2)∝σ−nexp⁡(−12σ2∑私=1n‖y私−Gθ(バツ私)‖2)、
π(θ、σ2)∝exp⁡(−12σ02∑ℓ=1L∑私=1Nℓ((b私(ℓ))2+∑j=1Nℓ−1(w私j(ℓ))2))×π(σ2)。

σ02

ベイジアンディープラーニングは、対応する事後分布からのサンプリングという難しいタスクに直面しています。これが達成された後、事後予測分布で予測が自然に行われ、これらの予測に含まれる不確実性が完全に定量化されます。Bayesian Deep Learningの聖杯は、効率的でスケーラブルなソリューションの構築です。このクエストでは、Metropolis-Hastings and Gibbsサンプリング、ハミルトニアンモンテカルロ、さらに最近では変分推論など、多くの計算手法が使用されています。

いくつかのサクセスストーリーのためNIPS会議のビデオをチェックアウト:http://bayesiandeeplearning.org/

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.