タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

3
Rの「bnlearn」パッケージを使用した連続変数の予測
Rでbnlearnパッケージを使用して、ベイジアンネットワークの構造とそのパラメーターを学習します。私がやりたいことは、証拠として他のノードの値を与えられたノードの値を「予測」することです(当然、予測している値のノードを除いて)。 連続変数があります。 library(bnlearn) # Load the package in R data(gaussian.test) training.set = gaussian.test[1:4000, ] # This is training set to learn the parameters test.set = gaussian.test[4001:4010, ] # This is test set to give as evidence res = hc(training.set) # learn BN structure on training set data fitted = bn.fit(res, …

1
正確な汎化エラーを与えたオラクルにアクセスできた場合、モデル選択の問題はありますか?
仮説が与えられた関数がその固定汎化誤差を返すとしましょう。E(h )E(h)\mathcal{E(h)}hhhhhh 私はモデルの選択と一般化エラーに関するいくつかのメモを読んでいて、それは言った: 「にアクセスできれば、モデル選択の問題も発生しません。ラージ選択して 、エラーを最小限に抑える分類器を見つけるだけです。」E(h )E(h)\mathcal{E(h)}HH\mathcal{H} その声明を十分に理解または理解したのか、それとも実際に声明に同意したのかはわかりませんでした。その理由は、たとえアクセスできたとしても(これは、を取り、その真の汎化エラーを言うオラクルを意味すると思います)、よく一般化する仮説があります。その理由は、モデルクラスが無限であることです(つまり、選択できるモデルのセットが無限にある)。すべてのをチェックしない限り、がいつ最小値に達したかは実際にはわかりませんE(h )E(h)\mathcal{E(h)}hhhHH\mathcal{H}E(h )E(h)\mathcal{E(h)}HH\mathcal{H}それは可能です。つまり、たとえそのようなことがあったとしても、(多項式時間で)本当に本当に最高のを本当に見つけたと確信できるので、問題はそれほど簡単に解消されないと思いますか?基本的に私は、一般化が最小になる時期を決定するためのオラクルがあることを前提としています。さらに、指摘したように、提案されたアルゴリズム/ターニングマシンは決定可能であり、Pではありません(つまり、永久に実行される可能性があります...)。HH\mathcal{H} 私がこの質問で抱えている主な問題/疑問は、そのようなOracleを使用しても、モデルの選択が単純化されているとは思えないことです。

2
厳密にバイナリデータの分類モデルを構築する
厳密にバイナリであるデータセットがあります。各変数の値のセットはドメイン内にあります:true、false。 このデータセットの「特別な」プロパティは、値の圧倒的多数が「false」であることです。 ベイジアンネットワーク学習アルゴリズムを使用して、データからネットワークを学習しました。ただし、ターゲットノードの1つ(最も重要なノードは死)の場合、AUCの結果はあまり良くありません。偶然より少し良いです。CVについて私に提案されているポジティブ予測値(PPV)でさえ、他のアプローチを使用した文献で報告されているものと競合しませんでした。AUC(ROC分析)は、臨床研究のこの領域で報告される典型的なベンチマークですが、他にアイデアがある場合は、分類モデルをより適切にベンチマークする方法についての提案も開かれています。 そのため、このプロパティを使用してこのタイプのデータセット(ほとんどの場合、偽の値)に対して他のどの分類モデルを試すことができるか考えていました。 ベクターマシンのヘルプをサポートしますか?私の知る限り、SVMは連続変数(予測子としての変数)のみを扱います(ただし、マルチクラスに適合されています)。しかし、私の変数はすべてバイナリです。 ランダムフォレストは役に立ちますか? ここでロジスティック回帰が適用されますか?私の知る限り、ロジスティック回帰の予測子も連続しています。予測子としてのバイナリ変数の一般化バージョンはありますか? 分類のパフォーマンスは別として、SVMとランダムフォレストはベイジアンネットワークよりも優れていると思いますが、問題はこれらのモデルの関係を説明する方法(特に臨床医)に移ります。

2
膨大なデータセットが与えられた場合、なぜ統計モデルは過剰適合しますか?
現在のプロジェクトでは、特定のグループの行動を予測するモデルを構築する必要があるかもしれません。トレーニングデータセットには6つの変数のみが含まれます(idは識別目的のみです)。 id, age, income, gender, job category, monthly spend その中で monthly spend応答変数です。ただし、トレーニングデータセットには約300万行が含まれid, age, income, gender, job category、予測されるデータセット(応答変数は含まれるが、含まれない)には100万行が含まれます。私の質問は、統計モデルにあまりにも多くの行(この場合は300万行)を投げた場合に潜在的な問題はありますか?計算コストが懸念事項の1つであることを理解していますが、他に懸念事項はありますか?データセットのサイズの問題を完全に説明している本/紙はありますか?
8 modeling  large-data  overfitting  clustering  algorithms  error  spatial  r  regression  predictive-models  linear-model  average  measurement-error  weighted-mean  error-propagation  python  standard-error  weighted-regression  hypothesis-testing  time-series  machine-learning  self-study  arima  regression  correlation  anova  statistical-significance  excel  r  regression  distributions  statistical-significance  contingency-tables  regression  optimization  measurement-error  loss-functions  image-processing  java  panel-data  probability  conditional-probability  r  lme4-nlme  model-comparison  time-series  probability  probability  conditional-probability  logistic  multiple-regression  model-selection  r  regression  model-based-clustering  svm  feature-selection  feature-construction  time-series  forecasting  stationarity  r  distributions  bootstrap  r  distributions  estimation  maximum-likelihood  garch  references  probability  conditional-probability  regression  logistic  regression-coefficients  model-comparison  confidence-interval  r  regression  r  generalized-linear-model  outliers  robust  regression  classification  categorical-data  r  association-rules  machine-learning  distributions  posterior  likelihood  r  hypothesis-testing  normality-assumption  missing-data  convergence  expectation-maximization  regression  self-study  categorical-data  regression  simulation  regression  self-study  self-study  gamma-distribution  modeling  microarray  synthetic-data 

1
分類のMLPが回帰のMLPとどのように、そしてなぜ異なるのですか?異なる逆伝播と伝達関数?
2つの3レイヤーフィードフォワードマルチレイヤーパーセプトロン(MLP)を使用しています。同じ入力データ(14個の入力ニューロン)を使用して、1つの分類(true / false)と1つの回帰(trueの場合は「どのくらい」)を行います¹。これまでは、Matlabsのpatternnetとfitnetをそれぞれ遅延して使用してきました。怠惰です。何が起こっているのかを本当に理解するのに時間をかけていなかったからです。さらに、OSSライブラリ(おそらくFANN)に移行する必要があります。これには、Matlab NN Toolboxよりも多くの手動設定が必要になる可能性があります。したがって、私は何が起こっているのかをより正確に理解しようとしています。 ネットワークにより作成されたpatternnetとfitnetほぼ同一である:14個の入力ニューロン、11個の隠されたニューロン、1個の標的ニューロン(2ためのfitnet情報のが、唯一1個)。しかし、それらは完全に同一ではありません。デフォルトの違いは次のとおりです。 Matlabは、分類ネットワークにスケーリングされた共役勾配逆伝播を使用し(patternnet)、回帰ネットワークにLevenberg-Marquardt逆伝播を使用します(fitnet)。 分類ネットワークは、入力層と非表示層の間、および非表示層と出力層の間で双曲線正接シグモイド伝達関数を使用します。回帰ネットワーク(fitnet)は、入力層と非表示層の間の双曲線正接シグモイド伝達関数と、非表示層と出力層の間の純粋な線形伝達関数を使用します。 それらの違いはありますか? 分類にはどのような逆伝播関数が最適で、回帰にはどのような種類の関数が最適ですか?なぜですか? 分類にはどのような伝達関数が最適で、回帰にはどのような種類の伝達関数が最適ですか?なぜですか? ¹ 分類が「曇り」または「クラウド・フリー」(2つの相補的ターゲット)のためである、回帰は、「どのくらいの雲」(1ターゲット)を定量化するためのものです。

4
カテゴリカル予測子(機能)のランダムフォレストの分割を選択するにはどうすればよいですか?
数値予測子(機能)のランダムフォレストに最適な分割がどのように選択されるかを理解しています。 数値予測子が並べ替えられ、すべての値についてジニ不純物またはエントロピーが計算され、最適な分割を行うしきい値が選択されます。しかし、特定の順序付けがないため、カテゴリカル予測子にはどのように最良の分割が選択されますか?

1
ディリクレ過程がベイズのノンパラメトリックのアプリケーションに適さないのはなぜですか?
DPの離散的な性質は、ベイジアンノンパラメトリックスの一般的なアプリケーションには適していませんが、混合モデリングで混合コンポーネントに優先順位を付ける問題に適しています。 この引用は、階層的ディリクレプロセス(Teh、et al、(2006)[ 1 ])からのものであり、それが何を意味するかについての説明を探していました。ベイジアンノンパラメトリックスは、著者が何を参照しているかを理解するのに私にはあいまいすぎる用語のようです。[ 1 ][1]^{[1]} Teh、YW、Jordan、MI、Beal、MJ、Blei、DM(2006):「階層的ディリクレプロセス」。Journal of the American Statistical Association、101、pp。1566–1581。[ 1 ][1]{[1]}

3
ブレイマンのコードを使用して教師なしランダムフォレスト分類を実行する方法
私はブレイマンのランダムフォレストコード(http://stat-www.berkeley.edu/users/breiman/RandomForests/cc_manual.htm#c2)を使用して、衛星データの分類(教師あり学習)を行っています。サンプルサイズが2000、変数サイズが10のトレーニングとテストのデータセットを使用しています。データは2つのクラスAとBに分類されます。教師あり学習モードでは、アルゴリズムは非常に低い分類エラー(<2%)で良好に実行されます。ここで、テストデータセットにクラスラベルのない教師なし分類を試し、アルゴリズムがクラスを予測する方法を確認します。ブレイマンのコードを使用して教師なし分類を実装する方法はありますか?この方法のエラーは、監視あり分類よりも高くなりますか?アルゴリズムのデータと実行パラメーターの設定を以下に示します。 DESCRIBE DATA 1 mdim = 10、ntrain = 2000、nclass = 2、maxcat = 1、1 ntest = 2000、labelts = 1、labeltr = 1、 SET RUN PARAMETERS 2 mtry0 = 3、ndsize = 1、jbt = 500、look = 100、lookcls = 1、2 jclasswt = 0、mdim2nd = 0、mselect = 0、


3
svmが同じデータのディシジョンツリーほど良くないのはなぜですか?
私は機械学習に慣れていないため、scikit-learn(sklearn)を使用して分類の問題に対処しようとしています。DecisionTreeとSVMはどちらも、この問題の分類子をトレーニングできます。 私はとを使用sklearn.ensemble.RandomForestClassifierしsklearn.svm.SVCて、同じトレーニングデータを適合させます(エントリあたり50個の機能を持つ約500,000エントリ)。RandomForestClassifierは約1分で分級して出てきます。SVCは、 24時間以上を使用し、まだ実行し続けます。 SVCのパフォーマンスが非効率的であるのはなぜですか?データセットはSVCに対して大きすぎますか?あるSVCは、このような問題のために不適切な?

1
2つのチーム間の以前の試合の結果のみに基づいて、サッカーの試合の勝者を予測する
私はフットボール(サッカー)の大ファンで、機械学習にも興味があります。私のMLコースのプロジェクトとして、ホームチームとアウェイチームの名前から、ホームチームの勝率を予測するモデルを構築しようとしています。(私は自分のデータセットをクエリし、それに応じて、これら2つのチーム間の以前の一致に基づいてデータポイントを作成します) 私はすべてのチームのいくつかのシーズンのデータを持っていますが、アドバイスが必要な次の問題があります。EPL(イングリッシュプレミアリーグ)には20のチームがあり、国内と海外でプレーしています(1シーズンで合計380ゲーム)。したがって、シーズンごとに、どの2つのチームも2度しかプレーしません。 過去10年以上のデータがあるため、2つのチームで2 * 10 = 20データポイントになります。ただし、チームは時間の経過とともにかなり変化し(ManCity、Liverpool)、システムにさらに多くのエラーが発生するだけなので、3年以上はやりたくないと思います。 したがって、これにより、チームの各ペアで約6〜8データポイントになります。ただし、私は両方のチームのフルタイムのゴール、ハーフタイムのゴール、パス、ショット、イエロー、レッドなどの各データポイントにいくつかの機能(最大20+)を持っているので、最近のフォーム、最近のような機能を含めることができますホームフォーム、最近のアウェイフォームなど ただし、トレーニングするデータポイントが6〜8個しかないという考えは、私には正しくないようです。この問題にどのように対抗できるかについての考えはありますか?(これが最初の問題である場合)

2
特徴の選択と分類において、3つのデータセット全体で2つのアルゴリズムを統計的に比較する方法は?
問題の背景:私の研究の一環として、データセット(がん患者の遺伝子発現データ)から特徴のセットを選択できる2つのアルゴリズムを作成しました。次に、これらの機能をテストして、見えないサンプルをどれだけ癌または非癌として分類できるかを確認します。アルゴリズムの実行ごとに、ソリューション(一連の機能)が生成され、Z個の非表示サンプルでテストされます。ソリューションのパーセンテージ精度は、次のように計算されます(correct classifications / Z) * 100。 アルゴリズムは2つあります:アルゴリズムXとアルゴリズムY データセットA、データセットB、データセットCの3つの別々の(異なる癌)データセットがあります。これらのデータセットは互いに非常に異なります。サンプルごとに同じ数のサンプルや同じ数の測定(機能)はありません。 各データセットで各アルゴリズムを10回実行しました。したがって、アルゴリズムXには、データセットAから10件、データセットBから10件、データセットCから10件の結果があります。全体として、アルゴリズムXには30件の結果があります。 私の問題: 3つすべてのデータセットにわたるアルゴリズムXの合計パフォーマンスが、アルゴリズムYの合計パフォーマンスと統計的に有意に異なるかどうかを確認したいと思います。 各データセットのアルゴリズムXの結果を単一の結果セットに結合することは可能ですか?このようにして、アルゴリズムXの30の標準化された結果とアルゴリズムYの30の標準化された結果を取得します。t検定を使用して、2つの方法の間に有意差があるかどうかを確認できます。 編集-これらは進化的アルゴリズムであるため、実行するたびに少し異なるソリューションを返します。ただし、存在する場合にサンプルを癌または非癌のいずれかに強く分類できるサンプルの機能がある場合、アルゴリズムが実行されるたびにその機能が選択されます。 私が得る少し以下の理由により10回ごとに異なる結果を: これらのアルゴリズムはランダムにシードされます。 私は繰り返しランダムサブサンプリング検証を使用します(10回の繰り返し)。 私が使用しているデータセット(DNAマイクロアレイとプロテオミクス)は、アルゴリズムが行き詰まる可能性のある多くの局所最適値があるという意味で操作するのが非常に困難です。 検出したい機能間およびサブセット間の相互作用がたくさんあります。 私は50の染色体を訓練し、それらは特定の長さに制限されていません。それらは自由に成長したり収縮したりします(ただし、選択圧によって長さが短くなります)。これはまた、最終結果にいくつかのバリエーションをもたらします。 そうは言っても、アルゴリズムはほとんど常に機能の特定のサブセットを選択します! これが私の結果のサンプルです(ここでは、アルゴリズムごとに10のうち4つだけが示されています)。 データセット/実行アルゴリズムXアルゴリズムY A 1 90.91 90.91 A 2 90.91 95.45 A 3 90.91 90.91 A 4 90.91 90.91 B 1 100 100 B 2 100 100 B 3 95.65 100 …

1
複数カーネル学習(MKL)メソッドの利点は何ですか?
複数のカーネル学習メソッドは、カーネルが固定ベースカーネルの線形結合であるカーネルモデルの構築を目的としています。カーネルの学習は、単一のカーネルのカーネルパラメータを最適化するのではなく、各基本カーネルの重み付け係数を学習することで構成されます。 複数のカーネル学習の欠点は、解釈が難しく、計算コストが高いことです(モデルの出力を評価するには、すべての基本カーネルを評価する必要があります)。では、単一のカーネルを最適化するだけで同様のパフォーマンスを達成できるとしたら、MKLの利点は何でしょうか。

2
Rのニューラルネットワークを使用した時系列予測の例
誰もnnetが予測のためにニューラルネットワーク(Rなど)を使用する簡単な短い教育例を持っていますか? これは時系列のRの例です T <- seq(0,20,length=200) Y <- 1 + 3*cos(4*T+2) +.2*T^2 + rnorm(200) plot(T,Y,type="l") これはほんの一例ですが、私が持っているのは、季節変動の激しいデータです。

2
時系列データをどのように変換すれば、故障予測に簡単な手法を使用できますか?
これは主に統計サイトであることを知っているので、トピックから外れている場合はリダイレクトしてください。 ポンプが故障して交換が必要になるシステムがあります。故障を予測して、ポンプを交換する人に早期に警​​告したい。流量、圧力、液体の高さなど、ポンププロセスの履歴データがあります。 私は機械学習技術を使用してデータを分類する経験が少ししかありません-基本的に、コースラでのAndrew Ngの機械学習コースとAndrew ConwayのStatistics Oneの演習を行い、実行しました-私は機械学習を使用したことがありません時系列を分類します。既存の知識を活用できるように問題を変革する方法を考えています。知識が限られているため、最適な予測は得られませんが、これから学びたいと思っています。この問題では、障害が発生するのを待つだけでなく、予測を少し改善するだけでも役に立ちます。 私が提案するアプローチは、時系列を通常の分類問題に変えることです。入力は、ウィンドウ内の各タイプのデータの平均値、標準偏差、最大値などを含む、時系列ウィンドウの要約になります。出力については、何が最適かわかりません。1つのアプローチは、出力がウィンドウの終わりから特定の期間内にポンプが故障したかどうかのバイナリ分類になるというものです。もう1つは、出力がポンプが故障するまでの残り時間であるため、分類ではなく、回帰(機械学習の意味)です。 このアプローチは結果を生む可能性が高いと思いますか?それは「ドメインと履歴データに依存する」という問題ですか。私が考慮していない(入力と出力の両方の)より優れた変換はありますか、または時系列データに基づく障害予測は、より標準的な障害予測とは異なり、時系列で機械学習を読むことに時間を費やすのに適していますか? ?

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.