タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

6
hadoop / map-reduceを使用してスケーリングできる機械学習アルゴリズム
スケーラブルな機械学習アルゴリズムは最近流行しているようです。どの企業もビッグデータ以外の何も扱っていません。Map-Reduceのような並列アーキテクチャを使用してスケーリングできる機械学習アルゴリズムと、そうでないアルゴリズムについて説明した教科書はありますか?またはいくつかの関連論文?

1
R /キャレット:トレーニングおよびテストセットと交差検証?
これはおそらくばかげた質問かもしれませんが、キャレットを使用してモデルを生成し、LOOCVまたは(さらにLGOCV言えば)何かを使用する場合、これが本質的にクロス検証ステップである場合、データをトレーニングセットとテストセットに分割する利点は何ですか?とにかく? 私はいくつかの関連する質問を読みました、そして彼らはいくつかの交差検定方法(例えば、キャレットサイトでここで説明されているもの)が特徴選択の目的のためであると提案しました。しかし、私の場合、randomForest(method = "rf")とkernlab(method = svmRadial)を使用しています。これらは、予測子をパージしようとするグループにリストされていません。 したがって、私の質問は、のようなものを使用する場合cross_val <- trainControl(method = "LGOCV", p = 0.8)、私のデータの80%でトレーニングし、残りの20%で結果のモデルをテストし、それを何度も繰り返して、モデルは機能していますか? もしそうなら、私のデータをトレーニング/テストセットに分割する必要がありますか? PS私は、経験的に生成されたDOEプロトタイプでモデルを実行しているときに一部質問します(入力を微調整し、テストメソッドを使用してプロトタイプに関するさまざまな属性を測定するハードグッズを考えてください)。 そのため、モデル化する予測子レベルが重複している膨大なデータセットはありません。この場合、データ生成には費用がかかるため、関心のある各DOEポイントで1つの試行を実行することがよくあります。したがって、できる限り正確なモデルに使用できるデータを使用したいのですが、何かを明確に見逃していないこと、および分割しないことで質の悪いモデルを作成していないことをここで確認したいと思います。 編集: @topepoの質問に答えて、私は式の化学入力の調整に基づいて、化合物の物理的に測定された属性をモデリングしています。実際のアプリケーションについては説明できませんが、インテリアラテックスペイントの配合に基づいた例を作成します。私は、4〜5種類の化学物質をブレンドし、固形分(%)で遊んで、ポリマー溶液を加熱して重合度を調整する時間を計画した実験を行っています。 次に、レオロジー、分子量、塗料コーティングの硬度、耐水性などを測定します。 いくつかの変数のまともな複製がありますが、すべてのDOEレベルがまったく同じであるという意味で、真の複製はほとんどありません。合計データセットは〜80の観測値であり、おそらく4〜5は正確な繰り返しです。私たちは15の異なるテストを実施しましたが、おそらく5〜6回のテストがすべての観察で行われています。一部の応答は、データの25-50%に存在します。 ここから、7つの予測子が出力プロパティに与える影響をモデル化し、目的のプロパティを与える可能性が最も高い新しい設計空間をターゲットとするように最適化します。 (ここに私の質問があります。トレーニング済みのモデルができたら、「リバース」を実行し、必要な応答を入力して、可能な入力レベルでの最適な推測を得て、次に試すことをお勧めします)。

3
LDA対パーセプトロン
LDAが他の教師あり学習手法にどのように「適合する」かを感じ取ろうとしています。LDAに関するLDA風の投稿のいくつかをここで読みました。私はすでにパーセプトロンに精通していますが、今はLDAを学習しています。 LDAは教師あり学習アルゴリズムのファミリーにどのように「適合」しますか?これらの他の方法と比べてその欠点は何ですか?それは何のためによりよく使用されるでしょうか?たとえばパーセプトロンを使用するだけでよいのに、なぜLDAを使用するのでしょうか。

2
均一な事前分布は、最大尤度と事後モードから同じ推定にどのようにつながりますか?
私はさまざまなポイント推定方法を研究していて、MAPとMLの推定を使用する場合、「均一な事前分布」を使用する場合、推定は同一であることを読みました。誰かが「均一」事前分布とは何かを説明し、MAP推定値とML推定値が同じになる場合のいくつかの(単純な)例を示すことができますか?


1
計量経済学のためのテキストマイニング/自然言語処理ツールの使用
この質問がここで完全に適切かどうかはわかりませんが、適切でない場合は削除してください。 私は経済学の大学院生です。社会保険の問題を調査するプロジェクトの場合、適格性の評価を扱う多数の行政訴訟(> 20万件)にアクセスできます。これらのレポートは、個別の管理情報にリンクされている可能性があります。これらのレポートから、定量分析に使用できる情報を抽出したいと思います。理想的には、grep/ awkなどを使用した単純なキーワード/正規表現検索以上のものです。 このための自然言語処理はどの程度役に立ちますか?他の有用なテキストマイニングアプローチは何ですか?私が理解しているところによると、これは大きなフィールドであり、コーパスとして使用するにはレポートの一部を変換する必要があると考えられます。文献や方法に慣れるために、少し時間をかける価値はありますか?それは役に立ちますか?同様のことが以前に行われましたか?報酬の点でそれは価値がありますか?すなわち、経済学の実証的研究のためにNLPを使用して潜在的に有用な情報を抽出できますか? 一部のレポートを読んで準備するために誰かを雇うための資金が存在する可能性があります。これはより大きなプロジェクトであり、より多くの資金を申請する可能性があります。必要に応じて、トピックの詳細を提供できます。複雑になる可能性の1つは、言語が英語ではなくドイツ語であることです。 資格に関しては、私は主に計量経済学の訓練を受けており、Hastieらのレベルでの計算統計についてある程度の知識があります。本。私はPython、R、Stataを知っており、おそらくMatlabにすぐに慣れるでしょう。ライブラリを考えると、Pythonがこれに最適なツールであると思います。これに関連する場合、定性的な方法のトレーニングはまったくありませんが、私が連絡をとることができる人を知っています。 私はこれに関する任意の入力を喜んでいます。つまり、これが潜在的に有用かどうか、もしそうなら、どこから読み始めるべきか、そしてどのツールに特に焦点を当てるべきか、です。

2
レコードのリンクにEMアルゴリズムを使用する
2つのデータセットのレコードを名、姓、および誕生年でリンクすることに興味があります。これはEMアルゴリズムで実行できますか? 例として、1番目のレコードとして、Carl McCarthy、1967を考えます。2番目のデータセット内のすべてのレコードを検索し、名とカールの間のjaro-winkler距離と姓とマッカーシーの間のjaro-winkler距離を割り当てます。これらの距離は、誕生年の間の距離と同様に確率的です。これら3つの確率(乗算?平均?)を1に結合します。 次に、決定ルールの部分です。すべての確率を最高から最低にランク付けしましょう。まず、P(最初のヒットは一致)> =しきい値が必要です。次に、P(最初のヒットが一致)/ P(2番目のヒットが一致)> = P(2番目のヒットが一致)が存在する場合のしきい値も必要です。3つ目は、この2番目のデータセットの最初のヒットが、1番目のデータセットの19人のカールマッカーシーと1人以下で一致することです。 これらのしきい値はどのように決定されますか? 私はStataやPerlでのアプローチを好みます。 たとえば、次を参照してください。 http://www.ncbi.nlm.nih.gov/pmc/articles/PMC1479910/pdf/amia2003_0259.pdf (それでも、理由と方法、および入力と出力が何であるか、および仮定とそれらがどれほど制限的であるかについては、完全には理解していません)。


1
線形動的システムに関連する混乱
この本を読んでいたのは、ビショップのパターン認識と機械学習です。線形力学系の導出に関して混乱がありました。LDSでは、潜在変数が連続的であると想定しています。Zが潜在変数を示し、Xが観測変数を示す場合 p(zn|zn−1)=N(zn|Azn−1,τ)p(zn|zn−1)=N(zn|Azn−1,τ)p(z_n|z_{n-1}) = N(z_n|Az_{n-1},\tau) p(xn|zn)=N(xn,Czn,Σ)p(xn|zn)=N(xn,Czn,Σ)p(x_n|z_n) = N(x_n,Cz_n,\Sigma) p(z1)=N(z1|u0,V0)p(z1)=N(z1|u0,V0)p(z_1) = N(z_1|u_0,V_0) LDSでは、アルファベータ前方後方メッセージパッシングを使用して、事後潜在分布、つまりp (z n | X )が計算されます。p(zn|X)p(zn|X)p(z_n|X) α(zn)=p(x1...xn,zn)α(zn)=p(x1...xn,zn)\alpha(z_n)=p(x1...xn,z_n) α^(zn)=α(zn)/P(x1....xn)α^(zn)=α(zn)/P(x1....xn)\hat\alpha(z_n) = \alpha(z_n)/P(x1....xn) 私の最初の質問は、それが与えられている本の中にあります α^(zn)=N(zn|un,Vn)α^(zn)=N(zn|un,Vn)\hat\alpha(z_n) = N(z_n|u_n,V_n) α^(zn)α^(zn)\hat\alpha(z_n)N(zn|un,Vn))N(zn|un,Vn))N(z_n|u_n,V_n)) 添付されている本のページのスクリーンショットをたどることができるので、私の次の質問は派生に関連しています。ませんでしたKnKnK_n un=Aun−1+Kn(xn−CAun−1)un=Aun−1+Kn(xn−CAun−1)u_n = Au_{n-1} + K_n(x_n - CAu_{n-1}) Vn=I−KnC)P(n−1)Vn=I−KnC)P(n−1)V_n = I - K_nC)P_(n-1) cn=N(xn|CAun−1,CPn−1CT+Σcn=N(xn|CAun−1,CPn−1CT+Σc_n = N(x_n|CAu_{n-1},CP_{n-1}C^T + \Sigma KnKnK_nPn−1CT(CPn−1CT+Σ)−1Pn−1CT(CPn−1CT+Σ)−1P_{n-1}C^T(CP_{n-1}C^T + \Sigma) ^ {-1} 上記の方程式をどのように導き出したのか、つまり un=Aun−1+Kn(xn−CAun−1)un=Aun−1+Kn(xn−CAun−1)u_n …

2
ロジスティック損失関数を使用した行列分解による協調フィルタリング
協調フィルタリングの問題を検討してください。サイズ#users * #itemsの行列あります。ユーザーiがアイテムjを気に入った場合、ユーザーiがアイテムjを嫌い、(i、j)ペアに関するデータがない場合。私たちは予測したい将来のユーザー、アイテムのペアのために。MMMM私、j= 1Mi,j=1M_{i,j} = 1M私、j= 0Mi,j=0M_{i,j} = 0M私、j= ?Mi,j=?M_{i,j}=?M私、jMi,jM_{i,j} 標準の協調フィルタリングアプローチは、が最小になるような2つの行列積としてMを表すことです(たとえば、既知の要素の平均二乗誤差を最小化します)。U× VU×VU \times V| | M− U× V| |2||M−U×V||2||M - U \times V||_2MMM 私にとってロジスティック損失関数の方が適しているようですが、なぜすべてのアルゴリズムがMSEを使用しているのですか

2
リレーショナルデータからの学習
設定 多くのアルゴリズムは単一のリレーションまたはテーブルで動作しますが、実際のデータベースの多くは情報を複数のテーブルに格納します(Domingos、2003)。 質問 どのタイプのアルゴリズムが複数の(リレーショナル)テーブルからうまく学習しますか。特に、回帰と分類のタスクに適用可能なアルゴリズムに興味があります(リンク分析などのネットワーク分析指向のアルゴリズムではありません)。 以下にリストされているいくつかのアプローチを認識しています(しかし、いくつかのアプローチが欠けていることは確かです): マルチリレーショナルデータマイニング(MRDM)(Dzeroski、2002年) 帰納論理プログラミング(ILP)(Muggleton、1992) 統計的関係学習(SRL)(Getoor、2007年) Džeroski、S.(2003)。マルチリレーショナルデータマイニング:はじめに。ACM SIGKDD Explorationsニュースレター。 Getoor、Lise、およびBen Taskar編。統計的関係学習の紹介。MITプレス、2007年。 S.マグルトンとC.フェン 論理プログラムの効率的な導入。アルゴリズム学習理論に関する最初の会議の議事録、368–381ページ。オームシャ、東京、1990年。

1
LSAとpLSAの間の並列
pLSAの最初の論文では、著者のThomas Hoffmanが、pLSAとLSAのデータ構造の類似点を説明します。 バックグラウンド: 情報検索からインスピレーションを得て、ドキュメントのコレクション と用語の語彙NNND={d1,d2,....,dN}D={d1,d2,....,dN}D = \lbrace d_1, d_2, ...., d_N \rbraceMMMΩ={ω1,ω2,...,ωM}Ω={ω1,ω2,...,ωM}\Omega = \lbrace \omega_1, \omega_2, ..., \omega_M \rbrace コーパス で表すことができる cooccurencesのマトリックス。XXXN×MN×MN \times M 潜在的意味AnalisysによってSVD行列 3つの行列に因数分解される: ここでと特異値でありますとのランクである。XXXX=UΣVTX=UΣVTX = U \Sigma V^TΣ=diag{σ1,...,σs}Σ=diag{σ1,...,σs}\Sigma = diag \lbrace \sigma_1, ..., \sigma_s \rbraceσiσi\sigma_iXXXsssXXX 次に、図に示すように、のLSA近似が計算され、3つの行列がいくつかのレベルに切り捨てられます。X = U Σ ^ V T K < SXXX X^=U^Σ^VT^X^=U^Σ^VT^\hat{X} = …

5
事前クラスタリングは、より優れた予測モデルの構築に役立ちますか?
チャーンモデリングのタスクについて、私は検討していました: データのk個のクラスターを計算する 各クラスターのkモデルを個別に作成します。 その根拠は、サブスクライバの母集団が均一であることを証明するものは何もないため、データ生成プロセスが異なる「グループ」では異なる可能性があると仮定するのが妥当です 私の質問は、それは適切な方法ですか?それは何かに違反していますか、それとも何らかの理由で悪いと考えられていますか?もしそうなら、なぜですか? そうでない場合、その問題に関するいくつかのベストプラクティスを共有しますか?2つ目は、モデルツリーよりも事前クラスタリングを行う方が一般に良いか悪いかです(Witten、Frankで定義されているように、葉にモデルがある分類/回帰ツリー。 「通常の」クラスタリングよりも優れている場合はidk。

2
サポートベクターマシンでのガンマパラメーターの使用
を使用するlibsvm場合、パラメーターはカーネル関数のパラメーターです。デフォルト値はγ = 1に設定されていますγγ\gammaγ=1number of features.γ=1number of features.\gamma = \frac{1}{\text{number of features.}} グリッド検索などの既存の方法以外に、このパラメーターを設定するための理論的なガイダンスはありますか?

1
観測されたイベントと期待されたイベントを比較する方法は?
4つの可能なイベントの頻度の1つのサンプルがあるとします。 Event1 - 5 E2 - 1 E3 - 0 E4 - 12 そして、私は自分のイベントの発生が予想される確率を持っています: p1 - 0.2 p2 - 0.1 p3 - 0.1 p4 - 0.6 4つのイベントの観測頻度の合計(18)を使用して、イベントの予想頻度を計算できますか? expectedE1 - 18 * 0.2 = 3.6 expectedE2 - 18 * 0.1 = 1.8 expectedE1 - 18 * 0.1 = 1.8 expectedE1 - …
9 r  statistical-significance  chi-squared  multivariate-analysis  exponential  joint-distribution  statistical-significance  self-study  standard-deviation  probability  normal-distribution  spss  interpretation  assumptions  cox-model  reporting  cox-model  statistical-significance  reliability  method-comparison  classification  boosting  ensemble  adaboost  confidence-interval  cross-validation  prediction  prediction-interval  regression  machine-learning  svm  regularization  regression  sampling  survey  probit  matlab  feature-selection  information-theory  mutual-information  time-series  forecasting  simulation  classification  boosting  ensemble  adaboost  normal-distribution  multivariate-analysis  covariance  gini  clustering  text-mining  distance-functions  information-retrieval  similarities  regression  logistic  stata  group-differences  r  anova  confidence-interval  repeated-measures  r  logistic  lme4-nlme  inference  fiducial  kalman-filter  classification  discriminant-analysis  linear-algebra  computing  statistical-significance  time-series  panel-data  missing-data  uncertainty  probability  multivariate-analysis  r  classification  spss  k-means  discriminant-analysis  poisson-distribution  average  r  random-forest  importance  probability  conditional-probability  distributions  standard-deviation  time-series  machine-learning  online  forecasting  r  pca  dataset  data-visualization  bayes  distributions  mathematical-statistics  degrees-of-freedom 

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.