タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

1
ロジスティック回帰:コース間で異なる式?
統計と機械学習の初心者、およびオンラインコースの受講。 私はロジスティック回帰をより詳細に理解しようとしていますが、Andrew NgコースとStanford統計学習コースの式の違いに気づきました。以下に、両方の数式へのリンク画像を投稿します。したがって、分子は異なります。私はこれが初心者なので、smthgが欠落している必要があります。 Hθ(X)=1p (X)= eβ0+ β1バツ1 + eβ0+ β1バツp(X)=eβ0+β1X1+eβ0+β1Xp(X)=\frac{e^{\beta_0+\beta_1X}}{1+e^{\beta_0+\beta_1X}} およびhttp://prntscr.com/dmyvx7hθ(x )= 11 + e- θ⊤バツ。hθ(x)=11+e−θ⊤x.h_\theta(x)=\frac{1}{1+e^{-\theta^\top x}}. http://prntscr.com/dmywgy

1
加重二乗和を行列形式に変換する手順は何ですか?
数式をマトリックス形式に変換するのは初めてです。しかし、これは効率的な機械学習コードに必要です。だから私は「正しい」方法を理解したいのですが、私がするカウボーイのものではありません。 さて、これで、重み付き二乗和を以下の形式から行列形式に変換しようとしています。私はよくマトリックス形式を以下のものと同等であると見なし、それがどのように導出されるかについての説明はありません。 J(w )= ∑i = 1メートルあなた私(wTバツ私− y私)2J(w)=∑i=1mui(wTxi−yi)2J(w)=\sum_{i=1}^m u_i (w^T x_i - y_i)^2 ここで、は各サンプル誤差重みです。また、、、、、。は、重みベクトルに特徴ベクトルを乗算した結果である予測値です。I X 、I ∈ R N W ∈ R N Y ∈ R U I ∈ R iは= 1 、。。。、m w T x iあなた私uiu_i私i_iバツ私∈ Rんxi∈Rnx_i \in \mathbb{R^n}W ∈ Rんw∈Rnw \in \mathbb{R^n}y∈ Ry∈Ry \in \mathbb{R}あなた私∈ Rui∈Ru_i \in \mathbb{R}私は= …

2
ガウス混合モデルの「混合」とは
機械学習とその応用において有用なモデルとして、ガウス混合モデルをよく研究します。 この「混合物」の物理的な意味は何ですか? ガウス混合モデルは、それぞれ独自の平均値を持つ多数の確率変数の確率をモデル化するために使用されますか?そうでない場合、この単語の正しい解釈は何ですか。

1
回帰の定義
ウィキペディアから: 統計モデリングでは、回帰分析は変数間の関係を推定するための統計プロセスです。従属変数と1つ以上の独立変数(または「予測子」)の間の関係に焦点が当てられている場合、いくつかの変数をモデル化および分析するための多くの手法が含まれます。 分類は同じではありませんか?結局、それは機械学習の目的ではないでしょうか?

1
機械学習へのカーネルヒルベルト空間アプローチの再現に関する教科書?
質問:再生カーネルヒルベルト空間アプローチを介して機械学習を(初めて)紹介するテキストを知っている人はいますか?つまり、機能分析を前提としていますが、機械学習の事前知識を前提としていますか? どんな調査記事も近い秒です。研究論文はありません-理論を実践する前に、まず理論を学びたいです。 背景:私の大学では、今学期に機能分析の方法を使用して機械学習、特にカーネルを再生するヒルベルト空間を導入することを約束するコースがあります。機能分析を知っていて、機械学習を知らず、初めて機械学習を学びたいので、これは私にとって本当に良いことです。 コースの説明(ドイツ語)-文献への言及なし コースのホームページ-再度、他の大学の同様のコースの文学への言及なし -参照はすべて研究論文です ただし、このコースを受講するためのスペースがスケジュールにあるかどうか、またはこの学期を受講する必要があるコースと競合するかどうかはわかりません。ですから、今学期はこの科目を履修できないのであれば、将来自由な時間に自分で勉強できるようになりたいと思っています。

1
ガウス過程の事後のシミュレーション
初めて(不正確/間違い)ガウシアンプロセスを確認しました。具体的には、ナンドデフレイタスによるこのビデオを見ました。メモはここからオンラインで入手できます。 ある時点で、ガウスカーネル(軸の距離の2乗の指数)に基づいて共分散行列を作成することにより生成された多変量法線から、ランダムなサンプルを抽出します。これらのランダムなサンプルは、データが利用可能になると分散が少なくなる以前の滑らかなプロットを形成します。最終的に、目的は、共分散行列を変更して予測し、対象の点での条件付きガウス分布を取得することです。倍101010xxx コード全体は、Katherine Baileyによる優れた要約でここから入手できます。これは、Nando de Freitasによるコードリポジトリのクレジットです。便宜上、ここにPythonコードを掲載しました。 (上記のではなく)事前関数から始まり、「調整パラメーター」を導入します。10333101010 プロットを含めて、コードをPythonおよび[R]に翻訳しました。 以下は、[R]の最初のコードチャンクと、テストセットの値の近接性に基づいてガウスカーネルを介して生成された3つのランダム曲線の結果のプロットです。xxx Rコードの2番目のチャンクはより毛羽立ち、トレーニングデータの4つのポイントをシミュレートすることから始まります。これは、これらのトレーニングデータポイントが存在する領域の周りの可能な(前の)曲線間の広がりを絞り込むのに役立ちます。これらのデータポイントの値のシミュレーションは、関数として行われます。「点の周りの曲線の引き締め」を見ることができます:罪()yyysin()sin()\text{sin}() Rコードの3番目のチャンクは、値(以下の計算を参照)に対応する平均推定値の曲線(回帰曲線に相当)とそれらの信頼区間のプロットを扱います。μ505050 μμ{\bf\mu} 質問: 前のGPから後のGPに至るまでの操作について教えてください。 具体的には、平均とsdを取得するために、Rコードのこの部分(2番目のチャンク内)を理解したいと思います。 # Apply the kernel function to our training points (5 points): K_train = kernel(Xtrain, Xtrain, param) #[5 x 5] matrix Ch_train = chol(K_train + 0.00005 * diag(length(Xtrain))) #[5 x 5] matrix # Compute the mean …

2
ニューラルネットワーク:SGDのエポックはミニバッチのエポックと同じですか?
SGDでは、エポックはトレーニングデータの完全なプレゼンテーションであり、エポックごとにN個の重み更新があります(トレーニングセットにN個のデータ例がある場合)。 代わりにミニバッチを実行する場合、たとえば20のバッチで実行します。1つのエポックはN / 20の重みの更新で構成されますか、それとも同じ数の重みの更新が含まれるように20ずつ「延長」されるエポックですか? いくつかの論文のように私はこれを尋ねます学習は述べられた時代の数に対して速すぎるようです。

2
学習率を低くすると、GBMのパフォーマンスがどのように低下​​しますか?
私は、gbm(勾配ブーストツリーモデル)の学習率を下げても、モデルのサンプルパフォーマンスを損なうことはないという民俗の知識に常に同意しています。今日は、よくわかりません。 私はモデルを二乗誤差の合計を最小化してボストンハウジングデータセットに適合させています。これは、20%ホールドアウトテストデータセットのツリー数によるエラーのプロットです。 最後に何が起こっているのかを理解するのは難しいので、ここに極端な拡大バージョンがあります 0.010.010.01 これはどのように最もよく説明されますか? これはボストンデータセットの小さなサイズのアーティファクトですか?数十万または数百万のデータポイントが存在する状況については、よりよく理解しています。 グリッド検索(または他のメタアルゴリズム)で学習率の調整を開始する必要がありますか?

2
バッチ正規化やReLuユニットを使用せずに、非線形性を飽和させるための消失勾配に対処する方法はありますか?
私は、消滅(または主に消滅しているが、勾配問題の爆発)に苦しむ非線形性を持つネットワークを訓練したかった。(現在の)標準的な方法は、バッチ正規化1 [BN] 1を使用するか、単に非線形性を放棄してReLu 整流器/ ReLuユニットを使用することです。 私は2つのことを望んでいました: 私の非直線性に固執するので、それを放棄してReLuを使用したくありません(つまり、ReLuは許可されません!)。非線形性の再パラメータ化は問題ありません。たとえば、ようにその前に乗法を置くとしましょう。θ (s )θ(s)\theta(s) 理想的には、あまりにも多くのバッチ正規化に依存したくなかった(または、少なくともそれが使用された場合、元の論文での使用方法以外の新しい方法で使用するか、多くの非直線性に一般化する必要がある)。バッチ正規化を避けたかった理由の1つは、特定の非線形性に対してのみ機能するように見えるためです。たとえば、シグモイドの場合、tanhですが、他の非線形性に対してどのように機能するかは不明です、とガウシアンは言います。 これらの制約がある理由は、特定の非線形性に対してのみ機能するソリューションをハッキングしたり、単に問題を回避することで問題を回避したりするのではなく、直接問題を数えることによって勾配を消失または爆発させる問題に対処したいためですReLu。 これらの2つの制約があるため、勾配の消失問題に対処するための代替方法は何ですか?(考慮される別の非線形性は、ユークリッドノルムの事前アクティブ化、シグモイド、tanhなどのRBFガウスカーネルです) 私が考えていた(漠然とした)考えられるアイデアは次のとおりです。 飽和状態の非線形性が既に飽和状態にならないように、適切な初期化を行ってください(飽和状態の非線形性により、勾配がゼロに近くなります)。 RBFの場合も同様に、ガウシアンは主に0に近い大きな値を持っているため(つまり、フィルターがそのアクティブ化またはデータに類似している場合)、適切な初期化が重要になる場合があります。したがって、大きすぎたり小さすぎたりすると、同様の勾配の問題が消えます。 これが制約が強すぎるかどうかは本当にわかりませんが、元の論文での従来の提案(またはおそらく、より大きな非線形性、現在のところ、ほとんどの研究は、私が知る限り、シグモイドで機能することを示すことです)。 もう1つのアイデアは、非線形性を使用する代わりにするです。場合以前のレイヤーで「消失」するのを避けるために、非線形性がレイヤーごとに逆方向に複数回乗算されないことを意味します。学習ルールが不安定になる可能性があるため、レギュラライザーを使用することをお勧めします。θ (Z )A ∈ R A &gt; 1θ (z)θ(z)\theta(z)θ (Z)aθ(z)a \theta(z) a∈Ra∈Ra \in \mathbb{R}a&gt;1a&gt;1a > 1 本質的に消滅勾配を処理する(または少なくとも各パラメーターを別々に更新する)オプティマイザー。たとえば、その層が入力に近い場合、学習ステップは大きくなるはずです。学習アルゴリズムがこれを単独で考慮に入れて、消失勾配に対処するのは良いことです。 バッチノルムまたはReLu以外の消失勾配に対処する方法について提案がある場合は、それらについてお聞かせください。 勾配の消失は主に非線形性がという特性を持っているために発生するようです であり、で、それを何度も掛けた後、爆発または消失します。問題を明示的に言って解決するのに役立つかもしれません。問題は、下位層が更新されないか、ネットワークを介した信号を妨害することです。順方向パスと逆方向パスの間(および初期化時だけでなくトレーニング中も)、この信号がネットワークを流れるように維持するとよいでしょう。| θ ′(s )| &lt; 1|a|&lt;1|a|&lt;1 |a| < 1|θ′(s)|&lt;1|θ′(s)|&lt;1 | \theta'(s) | < 1 1:Ioffe …

1
最適に設計されたニューラルネットワークには、トレーニングされたときに「死んだ」ReLUニューロンが含まれていませんか?
一般に、死んだReLUニューロンが少なくなるように、ニューロンを減らしてニューラルネットワークを再トレーニングする必要がありますか?死んだReLUについて対立する意見を読みました。死んだReLUはスパース性を促進するので良いと言う情報源もあります。他の人たちは、死んだReLUは永遠に死んでいて学習を妨げているので悪いと言います。幸せな媒体はありますか?

2
このガウス混合不等式を証明する方法は?(フィッティング/オーバーフィッティング)
f [x]をn項の均一な重みを持つガウス混合pdfとしと、対応する分散、を意味し:{μ1,...,μn}{μ1,...,μn}\{\mu_{1},...,\mu_{n}\}{σ1,...,σn}{σ1,...,σn}\{\sigma_{1},...,\sigma_{n}\} f(x)≡1n∑i=1n12πσ2i−−−−√e−(x−μi)22σ2if(x)≡1n∑i=1n12πσi2e−(x−μi)22σi2f(x)\equiv\frac{1}{n}\sum_{i=1}^{n}\frac{1}{\sqrt{2\pi\sigma_{i}^{2}}}e^{-\frac{(x-\mu_{i})^{2}}{2\sigma_{i}^{2}}} n個のガウス中心でサンプリングされた対数尤度が平均対数尤度よりも大きい(または等しい)ことは直感的に思えます。 1n∑j=1nln(f(μj))≥∫f(x)ln(f(x))dx1n∑j=1nln(f(μj))≥∫f(x)ln(f(x))dx\frac{1}{n}\sum_{j=1}^{n}ln(f(\mu_{j}))\geq\int f(x)ln(f(x))dx これは明らかに、小さい分散(各が狭いガウスの上にある)と非常に大きい分散(すべてのが1つの広いガウスの上にある)に当てはまり、それは当てはまりますとのすべてのセットを生成して最適化しましたが、それが常に真であることを証明する方法を理解できません。助けて? μ I μ I σ Iμiμi\mu_{i}μ私μi\mu_{i}μ私μi\mu_iσ私σi\sigma_i

2
Recurrent Neural Network(RNN)トポロジ:なぜ常に完全に接続されているのですか?
私は、リカレントニューラルネットワーク(RNN)と長期短期記憶(LSTM)について読み始めました... 取得できないことが1つあります。非表示層の各インスタンスのニューロンは、以前のself /自分自身(そしておそらく他のカップル)。 完全に接続されていることが本当に必要ですか?ストレージと実行時間を大幅に節約でき、必要がない場合はさらに「ルックバック」できるようです。 これが私の質問の図です... これは、反復する非表示レイヤー間の「シナプス」の「W ^ hh」行列に対角線(または対角線に近い)要素のみを保持してもよいかどうかを尋ねることに相当すると思います。私はこれを実行中のRNNコード(Andrew Traskの2進加算のデモに基づく)を使用して実行しました-つまり、すべての非対角項をゼロに設定しました-ひどく実行されましたが、対角線に近い項、つまりバンド線形システム3要素幅-完全に接続されたバージョンと同じように機能するように見えました。入力と非表示レイヤーのサイズを増やしたときでも...運が良かったのでしょうか? 私はLai Wan Chanの論文を見つけました。彼は、線形活性化関数の場合、ネットワークを「ヨルダンの標準形式」(つまり、対角要素と近くの要素)に縮小することが常に可能であることを示しています。しかし、そのような証明はシグモイドやその他の非線形活性化には利用できないようです。 また、「部分的に接続された」RNNへの参照は、2003年頃にほとんど姿を消しているように見え、過去数年間に読んだ処理はすべて完全に接続されていると想定しているようです。それで...それはなぜですか?

1
ニューラルネットワークの内部動作の幾何学的直観を理解するにはどうすればよいですか?
私は最近ANNの背後にある理論を研究しており、非線形マルチクラス分類の能力の背後にある「魔法」を理解したいと思いました。これにより、この近似がどのようにして達成されるかを幾何学的に説明するこのウェブサイトに私を導きました。 ここに私がそれを(3Dで)理解した方法があります。非表示のレイヤーは、次のような3Dステップ関数(またはタワー関数)を出力すると考えることができます。 著者は、そのような複数のタワーを使用して、任意の関数を近似することができると述べています。次に例を示します。 これは理にかなっているようですが、著者の構成は、概念の背後にある直感を提供するようにかなり工夫されています。 しかし、任意のANNが与えられた場合、これをどのように正確に検証できますか?これが私が知りたい/理解したいことです: 私の知る限り、近似は滑らかな近似ですが、この「直感」は離散近似を提供するようですが、それは正しいですか? 塔の数は隠れ層の数に基づいているようです-上記の塔は2つの隠れ層の結果として作成されています。これを(3Dの例で)1つの非表示レイヤーだけで確認するにはどうすればよいですか? タワーは、いくつかの重みがゼロに強制されて作成されますが、これまでに試してみた一部のANNがこれに該当することはありません。それは本当にタワー機能でしょうか?4から辺でほぼ円に近いものは何ですか?(著者はそれが事実であると言いますが、それを自己学習として残します)。んんn ANNを単一の非表示レイヤーで近似できる任意の3D関数の3Dでのこの近似機能を本当に理解したいと思います。この近似が多次元の直感を定式化するためにどのように見えるかを確認したいですか? これが私が助けることができると私が考えていることです: ような任意の3D関数を取ります。f(x1、x2)= x21+ x22+ 3f(バツ1、バツ2)=バツ12+バツ22+3f(x_1,x_2) = x^2_1 + x^2_2 + 3 のトレーニングセットを生成します。たとえば、1000データポイントの多くのポイントが、曲線の上と下のいくつかにあります。曲線上のものは「陽性クラス」としてマークされ(1)、「陰性クラス」としてマークされないもの(0)(x1、x2)(バツ1、バツ2)(x_1,x_2) このデータをANNに送り、1つの隠れ層(約2〜6個のニューロン)で近似を視覚化します。 この構成は正しいですか?これはうまくいくでしょうか?これを行うにはどうすればよいですか?私はこれを自分で実装するための逆伝播にまだ熟達しておらず、この点についてより明確で方向性を模索しています。これを示す既存の例が理想的です。

1
原因分析にLASSOを使用することの長所と短所は何ですか?
統計学習とその結果は現在、社会科学に広まっています。数か月前、グイド・インベンス氏は次のように述べています。 私は機械学習を少し勉強しましたが、その主な目標は予測であることを知っています。レオ・ブライマンの統計の2つの文化の違いにも同意します。したがって、私の見解では、因果関係はある程度予測に反対しています。 科学は通常因果関係を特定して理解しようとすることを考えると、機械学習はこの目標に役立ちますか?特に、因果分析におけるLASSOの利点は何ですか? これらの質問に対処する研究者(および論文)はいますか?

2
2DマトリックスをLSTMレイヤーにフィードするとどうなりますか
LSTMレイヤーへの入力として、形状(99,13)の2Dマトリックスをフィードしているとします。n個のファイルがあり、それぞれに(99,13)サイズのベクトルが含まれています。特徴の数として13を、タイムステップとして99を検討することにしました。 (Kerasを使用して実装するときに、LSTMレイヤーを最初のレイヤーとして追加しました。そして、レイヤーのoutput_dimを100に設定しました) しかし、上記のように入力すると、ネットワーク内で実際にどのように動作するかを理解できません。以下の質問がありますが、自分では答えられません。 LSTMセルへの入力としてどのような値を提供しますか?(xt、セルへの入力として使用されるht-1は常にベクトルです?私の場合、xtは[1,13]の形をしていますか?) モード lの最初のレイヤーとしてLSTMレイヤーがあるとすると、それは最初の入力ベクトルを指定されたレイヤーのすべてのセルに供給しますか?(例:最初のレイヤーのすべてのn LSTMセルに(99フレームから)サイズ13の最初のフレームをフィードしますか?)同様に、各タイムステップで入力行列のすべての行をフィードし続けますか? LSTMセルは各タイムステップでどのような値を出力しますか?(セルの状態をノードからの正しい出力と見なしますか?それは単一の値ですか、それともベクトルですか?それがベクトルの場合、次元は何ですか?次元を推測できる方法はありますか?htをベクター) 特定のレイヤーのoutput_dim(出力次元)とはどういう意味ですか?常に次のレイヤーのノード数である必要がありますか? これを保留にしたり、他のグループに誘導したりしないでください。これらの質問は機械学習とrnnに関連していると思います。私は研究論文を読みましたが、LSTMネットワーク内で実際にどのように機能するかについて明確なアイデアを得ることができませんでした。

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.