タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

2
ノンパラメトリック回帰の特徴選択の最良の方法
初心者向けの質問はこちら。私は現在、Rのnpパッケージを使用してノンパラメトリック回帰を実行しています。7つの機能と、ブルートフォースアプローチを使用して、ベスト3を特定しました。 私の質問は、ノンパラメトリック回帰の特徴選択の現在の最良の方法は何ですか?そして、パッケージがメソッドを実装している場合。ありがとうございました。

1
ガウス過程/ディリクレ過程などの確率過程には密度がありますか?そうでない場合、ベイズのルールをそれらにどのように適用できますか?
ディリクレポセスとガウス過程は、しばしば「関数の分布」または「分布の分布」と呼ばれます。その場合、GPの下での関数の密度について意味のある話をすることができますか?つまり、ガウス過程またはディリクレ過程は、確率密度の概念を持っていますか? そうでない場合、関数の事前確率の概念が明確に定義されていない場合、ベイズの規則を使用して事後から前に進むにはどうすればよいでしょうか。MAPやEAPの推定値などは、ベイジアンノンパラメトリックの世界に存在しますか?どうもありがとう。

3
大規模なデータセットのガウス過程回帰
私はオンラインビデオと講義ノートからガウシアンプロセス回帰について学んでいますが、ポイントのデータセットがある場合、データはn次元の多変量ガウシアンからサンプリングされると想定しています。だから私の質問は、nが数千万の場合で、ガウスプロセス回帰はまだ機能しますか?カーネルマトリックスは巨大ではなく、プロセスは完全に非効率的になりますか?もしそうなら、データセットから何度もサンプリングするような、これに対処するためのテクニックが用意されていますか?そのような場合に対処するためのいくつかの良い方法は何ですか? んnnんnnんnn

2
AlphaZeroペーパーにおけるディリクレノイズの目的
DeepMindのAlphaGo ZeroとAlphaZeroの論文では、モンテカルロツリー検索でルートノード(ボード状態)からのアクションの以前の確率にディリクレノイズを追加することについて説明しています。 追加の探査は、ルートノードに事前確率にノイズディリクレを添加することによって達成される、具体的にはP (S 、)= (1 - ε )P A + ε η A、ここでη 〜ディレクトリ(0.03 )およびε = 0.25 ; このノイズにより、すべての動きが試行される可能性がありますが、検索は依然として悪い動きを無効にする可能性があります。s0s0s_0P(s,a)=(1−ε)pa+εηaP(s,a)=(1−ε)pa+εηaP(s, a) = (1−\varepsilon)p_a+ \varepsilon \eta_aη∼Dir(0.03)η∼Dir(0.03)\eta \sim \text{Dir}(0.03)ε=0.25ε=0.25\varepsilon = 0.25 (AlphaGo Zero) そして: ディリクレノイズがルートノードの以前の確率に追加されました。これは、典型的な位置での法的な動きのおおよその数に反比例して、α = { 0.3の値にスケーリングされました。Dir(α)Dir(α)\text{Dir}(\alpha)チェス、将棋、囲碁はそれぞれ 0.03 }。α={0.3,0.15,0.03}α={0.3,0.15,0.03}\alpha = \{0.3, \; 0.15, \; 0.03\} (AlphaZero) 私が理解していない2つのこと: P(s, a)ある次元ベクトル。あるディレクトリ(α )とディリクレ分布のための速記Nパラメータ値と各αは?nnnDir(α)Dir(α)\text{Dir}(\alpha)nnnαα\alpha 私は多項分布の前の共役としてディリクレに出くわしました。なぜここで選ばれたのですか? …

1
ランダムフーリエの特徴が負ではないのはなぜですか?
ランダムフーリエ機能は、カーネル関数の近似を提供します。これらは、SVMやガウスプロセスなど、さまざまなカーネルメソッドに使用されます。 今日、TensorFlow実装を使用してみましたが、機能の半分で負の値が得られました。私の理解では、これは起こらないはずです。 それで、私は元の論文に戻りました。これは、期待したとおり、機能は[0,1]にあるはずだと述べています。しかし、その説明(以下で強調表示)は私には意味がありません。余弦関数は[-1,1]のどこでも値を生成でき、表示されるほとんどの点には負の余弦値があります。 私はおそらく明白なものを見落としているでしょうが、誰かがそれが何であるかを指摘することができればそれを感謝します。


1
サンプルRの2乗を計算する方法は?
これはおそらくどこかで議論されたと思いますが、明確な答えを見つけることができませんでした。式を使用して線形回帰モデルのサンプル外を計算しようとしていますは残差の2乗の合計で、は2乗の合計です。トレーニングセットについては、R2=1−SSR/SSTR2=1−SSR/SSTR^2 = 1 - SSR/SSTR2R2R^2SSRSSRSSRSSTSSTSST SST=Σ(y−y¯train)2SST=Σ(y−y¯train)2 SST = \Sigma (y - \bar{y}_{train})^2 テストセットはどうですか?サンプル外にを使い続けるべきですか、それともを使うべきですか?y¯trainy¯train\bar{y}_{train}yyyy¯testy¯test\bar{y}_{test} を使用すると、結果のが負になることがあります。これは、使用したsklearnの関数の説明と一致しています(サンプルをテストするためのlinear_modelの関数でも使用されます)。彼らは、「入力フィーチャを無視して、yの期待値を常に予測する定数モデルは、R ^ 2スコアが0.0になる」と述べています。y¯testy¯test\bar{y}_{test}R2R2R^2r2_score()y¯testy¯test\bar{y}_{test}score() ただし、他の場所では、ここやここ(dmi3knoによる2番目の回答)のようにを使用しています。だから私はどちらがもっと理にかなっているのだろうと思っていましたか?コメントは大歓迎です!y¯trainy¯train\bar{y}_{train}


1
SVMがまだ優れているアプリケーションはありますか?
SVMアルゴリズムはかなり古く、1960年代に開発されましたが、1990年代と2000年代には非常に人気がありました。これは、機械学習コースの古典的な(そして非常に美しい)部分です。 今日、メディア処理(画像、音声など)ではニューラルネットワークが完全に支配しているようですが、他の分野では、勾配ブースティングが非常に強力な位置を占めています。 また、最近のデータ競争では、SVMベースのソリューションは見られません。 SVMが最新の結果を出すアプリケーション例を探しています(2016年現在)。 更新: SVMを説明するときに、学生や同僚に例を挙げて、純粋に理論的または非推奨のアプローチのように見えないようにしたいと思います。

1
word2vecのクロスエントロピー損失の導関数
私はcs224dオンラインスタンフォードクラスのコース教材の最初の問題セットを処理しようとしていますが、問題3Aでいくつかの問題があります。ソフトマックス予測関数とクロスエントロピー損失関数でスキップグラムword2vecモデルを使用すると、予測された単語ベクトルに関して勾配を計算したい。したがって、softmax関数が与えられます: wi^=Pr(wordi∣r^,w)=exp(wTir^)∑|V|jexp(wTjr^)wi^=Pr(wordi∣r^,w)=exp⁡(wiTr^)∑j|V|exp(wjTr^) \hat{w_i} = \Pr(word_i\mid\hat{r}, w) = \frac{\exp(w_i^T \hat{r})}{\sum_{j}^{|V|}exp(w_j^T\hat{r})} そしてクロスエントロピー関数: CE(w,w^)=−∑kwklog(wk^)CE(w,w^)=−∑kwklog(wk^)CE(w, \hat{w}) = -\sum\nolimits_{k} w_klog(\hat{w_k}) \ frac {\ partial {CE}} {\ partial {\ hat {r}}}を計算する必要があり∂CE∂r^∂CE∂r^\frac{\partial{CE}}{\partial{\hat{r}}} 私の手順は次のとおりです。 CE(w,w^)=−∑|V|kwklog(exp(wTkr^)∑|V|jexp(wTjr^))CE(w,w^)=−∑k|V|wklog(exp⁡(wkTr^)∑j|V|exp(wjTr^))CE(w, \hat{w}) = -\sum_{k}^{|V|} w_klog(\frac{\exp(w_k^T \hat{r})}{\sum_{j}^{|V|}exp(w_j^T\hat{r})}) =−∑|V|kwklog(exp(wTkr^)−wklog(∑|V|jexp(wTjr^))=−∑k|V|wklog(exp⁡(wkTr^)−wklog(∑j|V|exp(wjTr^))= -\sum_{k}^{|V|} w_klog(\exp(w_k^T \hat{r}) - w_klog(\sum_{j}^{|V|}exp(w_j^T\hat{r})) ここでwkwkw_kは1つのホットベクトルで、iは正しいクラスです。 CE(w,w^)=−wTir^+log(∑|V|jexp(wTjr^))CE(w,w^)=−wiTr^+log(∑j|V|exp(wjTr^))CE(w, \hat{w}) = - w_i^T\hat{r} + log(\sum_{j}^{|V|}exp(w_j^T\hat{r})) ∂CE∂r^=−wi+1∑|V|jexp(wTjr^)∑|V|jexp(wTjr^)wj∂CE∂r^=−wi+1∑j|V|exp(wjTr^)∑j|V|exp(wjTr^)wj\frac{\partial{CE}}{\partial{\hat{r}}} = -w_i + …

2
バケット化とは何ですか?
私は、機械学習の「バケット化」について、運が悪ければ明確な説明を探して回りました。これまで私が理解しているのは、バケット化は、連続する値の範囲が1つの離散値に置き換えられるデジタル信号処理の量子化に似ているということです。これは正しいです? バケット化を適用することの長所と短所(情報を失うことによる明らかな影響以外)は何ですか?バケット化の適用方法に関する経験則はありますか?機械学習を適用する前にバケット化を適用するためのガイドライン/アルゴリズムはありますか?

2
入れ子の交差検証-トレーニングセットのkfold CVによるモデル選択とどう違うのですか?
5x2相互検証について、ネストされた相互検証の特別なケースとして話している人がよくいます。 最初の数(ここでは:5)は内側のループの折り目の数を指し、2番目の数(ここでは:2)は外側のループの折り目の数を指していると思いますか?では、これは「従来の」モデルの選択と評価のアプローチとどう違うのでしょうか。「伝統的」とは データセットを個別のトレーニング(80%など)とテストセットに分割する トレーニングセットでのハイパーパラメーター調整とモデル選択にk分割交差検証(たとえば、k = 10)を使用する テストセットを使用して、選択したモデルの汎化性能を評価する 5 = 2は、k = 2の場合にテストとトレーニングセットのサイズが等しいことを除いて、まったく同じではありませんか?

3
なぜ人々はスムーズなデータを好むのですか?
私は、Gaussian Process RegressionにSquared Exponentialカーネル(SE)を使用します。このカーネルの利点は次のとおりです。1)単純:3つのハイパーパラメータのみ。2)スムーズ:このカーネルはガウスです。 なぜ「なめらかさ」がとても好きなのですか?ガウスカーネルは無限に微分可能であることは知っていますが、それはそれほど重要ですか?(SEカーネルが非常に人気がある理由が他にあるかどうか教えてください。) PS:現実世界のほとんどの信号(ノイズなし)はスムーズであると言われました。誰かがこの概念を理解するのを手伝ってくれませんか?

2
PCAが投影の全体の分散を最大化するのはなぜですか?
Christopher Bishopは彼の著書「パターン認識と機械学習」に、以前に選択されたコンポーネントに対して直交空間にデータが投影された後、連続する各主成分が1次元への投影の分散を最大化するという証明を書いています。他は同様の証明を示します。 ただし、これは、分散を最大化することに関して、連続する各コンポーネントが1つの次元への最良の投影であることを証明するだけです。なぜこれが意味するのか、最初にそのようなコンポーネントを選択すると、5次元と言う投影の分散が最大化されますか?

2
Fメジャーは正確さと同義ですか?
fメジャー(精度と再現率に基づく)は、分類子の正確さの見積もりであることを理解しています。また、不均衡なデータセットがある場合、fメジャーは精度よりも優先されます。簡単な質問があります(これはテクノロジーよりも正しい用語を使用することについてです)。不均衡なデータセットがあり、実験でfメジャーを使用しています。機械学習/データマイニング会議用ではない論文を書こうとしています。したがって、このコンテキストでは、fメジャーを正確に同義で参照できますか。たとえば、f値が0.82の場合、分類子は82%の正確な予測を達成したと言えますか?

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.