タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

3
TensorFlowの計算モデルで、一般的な機械学習アルゴリズムを実装することは可能ですか?
https://www.tensorflow.org/ GitHubで見たTensorFlowのプロジェクトはすべて、ある種のニューラルネットワークモデルを実装しています。TensorFlowがDAGよりも改善されていることを考えると(これはもはや非循環ではありません)、いくつかの固有の欠点により一般的な機械学習モデルに適さなくなるのではないかと思っていましたか? TensorFlowの計算モデルで、一般的な機械学習アルゴリズムを実装することは可能ですか?

2
「統計学習の要素」の線形射影を理解する
第2章の「統計的学習の要素」(「線形モデルと最小二乗;ページ番号:12」)には、次のように書かれています。 (p + 1)次元の入出力空間では、(X、Y)は超平面を表します。定数がXに含まれている場合、超平面は原点を含み、部分空間です。そうでない場合は、Y軸を点(0、ββ\beta)。 「定数が...の場合、(0、ββ\beta) "。助けてください。超平面はY軸を(0、ββ\beta)どちらの場合でも、それは正しいですか? 以下の答えは多少は役に立ちましたが、もっと具体的な答えを探しています。私はそれが111 に含まれています XバツX、それは起源を含まないでしょう、しかしそれからどのように (X,Y)(バツ、Y)(X,Y)起源を含むでしょうか?それはの値に依存すべきではありませんββ\beta?傍受する場合β0β0\beta_0 ではありません 000、 (X,Y)(バツ、Y)(X,Y) 私の理解では、起源を含めるべきではありませんか?

2
漸近的エラーとは何ですか?
Ng、AY、およびJordan、MI(2001)。識別的分類と生成的分類の比較:ロジスティック回帰と単純ベイズの比較。神経情報処理システムの進歩、 14、841-8ページ、MIT Press。 上記の論文では、著者は「漸近的エラー」に言及しました。誰かがこれについて少し説明できますか? たとえば、論文の要約には次のものが含まれます。 弁別学習は漸近誤差が低く、生成分類器はその漸近誤差にはるかに速く近づく場合もあります。 「漸近的エラー」の正確な定義は何ですか?

1
CART:不純物減少の増加が等しい場合の分割に最適な予測子の選択?
私の質問は分類木を扱っています。Irisデータセットの次の例を考えてみます。 最初の分割に最適な予測子を手動で選択したい。CARTアルゴリズムによると、分割を行うための最良の機能は、パーティションの不純性の減少を最大化する機能であり、ジニゲインとも呼ばれます。 G i n i G a i n (N、X)= G i n i (N)− | N1|| N|G i n i (N1)− | N2|| N|G i n i (N1)G私ん私Ga私ん(N、バツ)=G私ん私(N)−|N1||N|G私ん私(N1)−|N2||N|G私ん私(N1)GiniGain(N,X)=Gini(N)-\frac{\lvert N_{1} \rvert }{\lvert N \rvert }Gini(N_{1})-\frac{\lvert N_{2} \rvert }{\lvert N \rvert }Gini(N_{1}) ここで、与えられた機能であり、分割がなされるべきでノードであり、と分割することによって作成された2つのつの子ノードである。は、ノードの要素数です。バツバツXNNNN1N1N_{1}N2N2N_{2}NNN| 。||。|\lvert . \rvert そして、。ここで、はノード内のカテゴリの数です KG i n …

1
グラフィカルモデルのポイントは何ですか?
私は1日をRでbnlearnパッケージについて学習するだけで、ベイジアンモデルが無向グラフでは機能しないことを発見しました。私はマルコフランダムフィールドネットワークについて学習しようとしていますが、これまでのところ、グラフィカルなLASSOを使用してグラフィカルな構造を作成することしかできません。 有向グラフでは、何らかの方法で「構造学習」を行った後、別の方法で「パラメータ学習」を行うという2段階のように見えます。私の考えでは、パラメーターの学習は、モデルに含まれる各変数(機能)間のエッジの重みについて教えてくれるということです。私の質問は...だから何ですか?エッジの重みが付いたグラフで何をしますか? 特徴による観測であるデータセットがあり、グラフのノードがこのデータセットからの特徴である場合(共分散行列の逆をエミュレートしようとするグラフィカルLASSOから収集)、これから何を学ぶことができますか?データのコホート(ターゲットクラス値で区切られた)を比較して、ノードにある種のp値分析を割り当てることはできますか?グラフィカルモデルの全体像について混乱していると思います。

2
勾配は、展開されたリカレントニューラルネットワークでどのように伝播しますか?
簡単な例を通して、rnnを使用してシーケンスを予測する方法を理解しようとしています。これは、1つの入力、1つの非表示のニューロン、1つの出力で構成される、私の単純なネットワークです。 隠れたニューロンはシグモイド関数であり、出力は単純な線形出力と見なされます。したがって、ネットワークは次のように機能すると思います:隠しユニットが状態sで始まり、長さシーケンスであるデータポイントを処理している場合、、それから:(x 1、x 2、x 3)333(x1、x2、x3)(バツ1、バツ2、バツ3)(x_1, x_2, x_3) 時間1で、予測値はp1p1p^1 p1= u × σ(w s + v x1)p1=あなた×σ(ws+vバツ1)p^1 = u \times \sigma(ws+vx^1) 時に2、私たちは持っています p2= u × σ( w × σ(w s + v x1)+ v x2)p2=あなた×σ(w×σ(ws+vバツ1)+vバツ2)p^2 = u \times \sigma\left(w \times \sigma(ws+vx^1)+vx^2\right) 時に3、私たちは持っています p3= u × σ( w × σ( w × …

1
Maxoutの正確な定義
ニューラルネットワークの "Maxout"アクティベーション機能が何を意味するのかを正確に理解しようとしています。あり、この質問、本論文では、とさえによって深い学習帳にBengioら。、ただし、ほんの少しの情報と、その隣に大きなTODOがある場合を除きます。 わかりやすくするために、ここで説明する表記を使用します。私はそれを再入力して質問を膨らませたくないだけです。簡単に言うと、aij=σ(zij)=σ(∑kai−1kwijk+bij)aji=σ(zji)=σ(∑kaki−1wjki+bji)a^i_j=\sigma(z^i_j)=\sigma(\sum\limits_k a^{i-1}_kw^i_{jk}+b^i_j)、言い換えると、ニューロンには単一のバイアス、各入力に対して単一の重み、次に、入力と重みの合計を合計し、バイアスを追加し、アクティブ化関数を適用して、出力(アクティブ化)値を取得します。 これまでのところ、Maxoutは「入力の最大値を出力する」アクティベーション関数であることを知っています。どういう意味ですか?これから私が解釈できるいくつかのアイデアがあります: aij=maxk(ai−1k)aji=maxk(aki−1)a^i_j=\max\limits_k (a^{i-1}_k) aij=maxk(ai−1kwijk)+bijaji=maxk(aki−1wjki)+bjia^i_j=\max\limits_k (a^{i-1}_kw^i_{jk})+b^i_jは、通常行われる合計を最大値で置き換えるだけです。 aij=maxk(ai−1kwijk+bijk)aji=maxk(aki−1wjki+bjki)a^i_j=\max\limits_k (a^{i-1}_kw^i_{jk}+b^i_{jk})、ここで各ニューロンは、適用された単一のバイアス値ではなく、各入力に対して1つのバイアス値を持ちますすべての入力を合計した後。これにより、バックプロパゲーションが異なりますが、それでも可能です。 各は通常どおりに計算され、各ニューロンには各入力に対して単一のバイアスと重みがあります。ただし、softmax(a ^ i_j = \ frac {\ exp(z ^ i_j)} {\ sum \ limits_k \ exp(z ^ i_k)})と同様に、現在のレイヤーのすべてのzの最大値を取ります。正式には、a ^ i_j = \ max \ limits_k z ^ i_kです。zijzjiz^i_jaij=exp(zij)∑kexp(zik)aji=exp⁡(zji)∑kexp⁡(zki)a^i_j = \frac{\exp(z^i_j)}{\sum\limits_k \exp(z^i_k)}zzzaij=maxkzikaji=maxkzkia^i_j=\max\limits_k z^i_k これらのいずれかが正しいですか?それとも何か違うのですか?

1
Rからの機械学習モデルの「エクスポート」
Rの従来のトレーニング/テストセットでクラシックMLモデルを構築して実装できますが、パートナーが自分の(あらゆる種類の)システムを実装するためにこのモデルを取得したい場合はどうなりますか?もちろん、Rモデル構造の保存と送信は役に立ちません。また、予測メカニズムを理解することは、多くの(ブラックボックス)ケースでも機能しません。では、モデルの学習したルールを一般化して利用するにはどうすればよいでしょうか。


3
分布を見つけて正規分布に変換する
1時間にイベントが発生する頻度(「1時間あたりの数」、nph)とイベントが持続する時間(「1秒あたりの秒数」、dph)を説明するデータがあります。 これは元のデータです: nph <- c(2.50000000003638, 3.78947368414551, 1.51456310682008, 5.84686774940732, 4.58823529414907, 5.59999999993481, 5.06666666666667, 11.6470588233699, 1.99999999998209, NA, 4.46153846149851, 18, 1.05882352939726, 9.21739130425452, 27.8399999994814, 15.3750000002237, NA, 6.00000000004109, 9.71428571436649, 12.4848484848485, 16.5034965037115, 20.6666666666667, 3.49999999997453, 4.65882352938624, 4.74999999996544, 3.99999999994522, 2.8, 14.2285714286188, 11.0000000000915, NA, 2.66666666666667, 3.76470588230138, 4.70588235287673, 13.2727272728677, 2.0000000000137, 18.4444444444444, 17.5555555555556, 14.2222222222222, 2.00000000001663, 4, 8.46153846146269, 19.2000000001788, 13.9024390245481, 13, 3.00000000004366, NA, …
8 normal-distribution  data-transformation  logistic  generalized-linear-model  ridge-regression  t-test  wilcoxon-signed-rank  paired-data  naive-bayes  distributions  logistic  goodness-of-fit  time-series  eviews  ecm  panel-data  reliability  psychometrics  validity  cronbachs-alpha  self-study  random-variable  expected-value  median  regression  self-study  multiple-regression  linear-model  forecasting  prediction-interval  normal-distribution  excel  bayesian  multivariate-analysis  modeling  predictive-models  canonical-correlation  rbm  time-series  machine-learning  neural-networks  fishers-exact  factorisation-theorem  svm  prediction  linear  reinforcement-learning  cdf  probability-inequalities  ecdf  time-series  kalman-filter  state-space-models  dynamic-regression  index-decomposition  sampling  stratification  cluster-sample  survey-sampling  distributions  maximum-likelihood  gamma-distribution 


1
PCAを前処理ステップとして使用するのが適切なのはいつですか?
PCAは、データセットを2Dまたは3Dでプロットできるように次元削減に使用されることを理解しています。しかし、PCAを分類シナリオの前処理ステップとして適用して特徴の数を減らし、新しい特徴としていくつかの主成分(共分散行列の固有ベクトル)を使用する人を見たこともあります。 私の質問: 分類のパフォーマンスにどのような影響がありますか? そのような前処理ステップをいつ適用するのですか? 実数として10個の特徴とカテゴリカル特徴を表す600個のバイナリ特徴を含むデータセットがあり、それらを表すために1対多のエンコーディングを使用しています。ここでPCAを適用すると意味があり、より良い結果が得られますか? 質問が広すぎる場合は、そのようにPCAを使用する方法の詳細をより詳しく説明するペーパーまたはチュートリアルを提供していただければありがたいです。 少し読んだ後、カテゴリ属性のバイナリ機能の数を減らすには、潜在セマンティック分析を使用する方が良いことがわかりましたか?したがって、私は実数値の特徴には触れず、バイナリ特徴を前処理して、実数値の特徴を新しい特徴と組み合わせ、分類器をトレーニングするだけです。どう思いますか?

2
連続変数の教師なし離散化の正当化は何ですか?
多くの出典は、統計分析の前に連続変数の離散化(分類)の多くの負の結果があることを示唆しています(以下の参考文献のサンプル[1]-[4])。 逆に[5]は、連続変数が離散化された場合に一部の機械学習手法がより良い結果を生成することが知られていることを示唆しています(教師付き離散化手法のパフォーマンスが高いことにも注意)。 統計的な観点から、この慣行に広く受け入れられているメリットや正当化があるかどうか知りたいのですが。 特に、GLM分析内の連続変数を離散化する正当な理由はありますか? [1] Royston P、Altman DG、Sauerbrei W.重回帰で連続予測子を二分する:悪い考え。Stat Med 2006; 25:127-41 [2] Brunner J、オースティンPC。独立変数がエラーで測定された場合の重回帰におけるタイプIエラー率のインフレ。カナダ統計ジャーナル2009; 37(1):33-46 [3]アーウィンJR、マクレランドGH。連続予測子変数を二分することの負の結果。ジャーナルオブマーケティングリサーチ2003; 40:366–371。 [4]ハレルJr FE。連続変数の分類によって引き起こされる問題。http://biostat.mc.vanderbilt.edu/twiki/bin/view/Main/CatContinuous、2004。2004年6.9。にアクセス [5] Kotsiantis、S。Kanellopoulos、D.「離散化手法:最近の調査」。GESTS International Transactions on Computer Science and Engineering 32(1):47–58。

3
Java / Scala用の完全な機械学習ライブラリ[終了]
閉まっている。この質問はトピックから外れています。現在、回答を受け付けていません。 この質問を改善してみませんか? 質問を更新することがありますので、話題のクロス検証済みのため。 4年前休業。 PythonにはMLライブラリがたくさんあります(すばらしいscikit-learnなど)。多くのアルゴ(回帰、分類、クラスタリング、相互検証、特徴処理)を含み、安定して維持され、大規模なデータセットを処理できるjava / scalaに何か良いものはありますか? 私は、Mahout、Breeze / Nak、Wekaを見つけたばかりですが、Pythonのものほど見栄えがよくありません。 さらに、同等のものがない場合、JavaコードをPythonに効率的に接続するにはどうすればよいですか?

1
ノンパラメトリック混合モデルとクラスター
ノンパラメトリック混合アプローチで処理しようと考えているクラスターについて質問があります(私はそう思います)。人間の関わりの説明に取り組んでいます。 私のデータベースの各行には以下が含まれます: 誰かのID 環境Xのいくつかのパラメータ(例:温度、風など) パラメータに対する人の反応を表すバイナリ変数Y(例:天候のために病気になるか、病気にならない)。 私の考え(データではなく直感に基づく)は、有限数のグループに人々を集めて、グループ内の人々が同じように温度に反応できるようにすることです(簡単に病気になる人もいれば、決して病気にならない人もいます...)。 。特定のグループでは、より正式には、パラメーターXを条件とするYの法則は同じです。 Xを条件とするYの法則を知りません。パラメータXについては、必要に応じていくつかの仮説を立てることができます。 パラメータに対する同じ反応を「多かれ少なかれ持っている」人々のクラスタを作成したいと思います。さらに、パラメーターの特定の値に対する特定の人の反応を予測したいと思います(このイベントがデータベースで発生したことがない場合でも)。 (Xi,Yi)(Xi,Yi)(X_i, Y_i)XiXiX_iYiYiY_iXiXiX_i XiXiX_i 私のアプローチは正しいですか? この問題について別の見方をお勧めしますか? 私はそれについてのどんな参考文献にも非常に興味があります。 問題の説明を再定式化するよう私に頼むことを躊躇しないでください。

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.