タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

3
KNNが「モデルベース」ではないのはなぜですか?
ESL 2.4は、想定しているため、線形回帰を「モデルベース」として分類しているようですが、k最近傍に対して同様の近似は述べられていません。しかし、どちらの方法もについての仮定をしていませんか?F (X )f(X )≈ X ⋅ βf(x)≈x⋅βf(x) \approx x\cdot\betaf(x )f(x)f(x) 後で2.4でそれは言う: 最小二乗法は、がグローバルな線形関数によって十分に近似されていることを前提としています。f(x )f(x)f(x) k最近傍は、が局所定数関数によって十分に近似されていると想定しています。f(x )f(x)f(x) それはまた、正式にすることができようにKNNの仮定は(必ずそうする場合は考えていないが思わつながると仮定した方法でKNNアルゴリズムに線形回帰にリニアリードです)。fff それで、KNNが実際にモデルベースではないのなら、なぜですか?それともESLを誤解していますか?

2
1つのクラスのみの分類子
単純な分類では、クラス0とクラス1の2つのクラスがあります。一部のデータでは、クラス1の値しかないため、クラス0の値はありません。現在、クラス1のデータをモデル化するモデルを作成することを考えています。したがって、新しいデータが来ると、このモデルが新しいデータに適用され、新しいデータがこのモデルにどれだけ当てはまるかを示す確率がわかります。次に、しきい値と比較して、不適切なデータをフィルタリングできます。 私の質問は: これは、そのような問題を処理するための良い方法ですか? この場合、RandomForest分類器を使用できますか?分類子がノイズと見なすことを望んでいるクラス0の人工データを追加する必要がありますか? 他のアイデアがこの問題に役立つでしょうか?

1
カーネルメソッドの制限とカーネルメソッドをいつ使用するか。
カーネルメソッドは、多くの教師付き分類タスクで非常に効果的です。では、カーネルメソッドにはどのような制限があり、カーネルメソッドをいつ使用するのでしょうか。特に大規模データ時代において、カーネル手法の進歩は何ですか?カーネルメソッドと複数インスタンス学習の違いは何ですか?データが500x10000、500サンプル数、および10000各特徴の次元である場合、この状況でカーネルメソッドを使用できますか?


3
ランキングのための機械学習アルゴリズム
私は、特性に従って記述できる要素セットを持っています。したがって:XXXnnn xi:{ci1,ci2,…,cin}∣xi∈Xxi:{ci1,ci2,…,cin}∣xi∈Xx_i: \{c_{i1}, c_{i2}, \ldots, c_{in}\} \mid x_i \in X ここで、は、特性による要素(数値)評価です。だから私の要素は次元空間の点として見ることができます。 i j ncijcijc_{ij}iiijjjnnn 私のリーディングによると、いくつかの要素からなる「トレーニングセット」を使用した場合、「ベイズ分類子」のようなアルゴリズムがあり、私のセットの要素に「はい」または「いいえ」タイプの回答を提供できます。私のセットの要素、およびアルゴリズムの予想される結果。そのデータに基づいて、アルゴリズムはトレーニングセットの一部ではなく、他の要素を取り、トレーニングセットのおかげで学習した内容に基づいて「はい」または「いいえ」の回答を提供できる必要があります。これは、期待すること(トレーニングセット)について何らかの考えを持っているが、その結果をもたらす特定のルールがわからない場合に最適です。 私のデータでしたいことは、「はい」または「いいえ」のタイプの回答を得ることではありませんが、要素内のランキングを紹介したいと思います。それらのいくつかは他より「より良い」です。ベイズフィルターの場合と同様に、私は何を期待しているのかについての一般的な考えを持っています。このようにして、MLAにフィードする要素のサブセットから取得した「トレーニングランキング」を生成できます。そのトレーニングに基づいて、私のセット全体をランク付けすることができます。 それを行うために、私は2つのアプローチを見ます: 各要素にはMLAによってスコアが与えられ、スコアに従って要素をランク付けします。 MLAは、2つの要素とを取り、どちらが良いかを判断できます(ペアワイズ比較)。その比較演算を使用してクイックソートを使用します。x jバツ私xix_ixjxjx_j 注:スコアに基づいてペアワイズ関数を実装するのは簡単であり、ペアワイズ関数に基づいてスコアを生成するのは簡単です。したがって、これらは同じ結果をもたらす2つのアプローチにすぎません。 スコアリング関数またはペアワイズ比較関数を提供できるMLAの例はありますか? 編集:より多くのコンテキストを追加するために:現在、私のアイテムは、計算を行うことによって各アイテムのスコア(実数)を生成するアルゴリズムに従ってランク付けされています。生成されたランキングは非常に正確ですが、アルゴリズムを変更して、何らかの方法で調整しなければならないことがよくあります。これは、期待したとおりにランク付けされていないアイテムがはっきり見えるためです。cijcijc_{ij} 現在、私の設計プロセスは次のとおりです。 完璧なランキングがどうなるかを理解する そのような項目をランク付けするアルゴリズムを(手動で)導出しようとします 結果を観察する アルゴリズムを適合させる 私のプロセスの開始点はトレーニングデータとして使用できるものであるため、MLAについて考えました。私はおそらく現在のランクを取得することから始めて、私のニーズに応じてアイテムを交換し、それを養います。

2
高次元データセットのガウスプロセス回帰
高次元データセットにガウスプロセス回帰(GPR)を適用した経験があるかどうかを確認したいだけです。さまざまなスパースGPRメソッド(スパース疑似入力GPRなど)のいくつかを調べて、機能選択がパラメーター選択プロセスの一部である高次元データセットで何が機能するかを確認します。 論文/コード/またはさまざまな方法を試してみてください。 ありがとう。

1
R線形回帰のカテゴリ変数「非表示」の値
これは私が何度か遭遇した例にすぎないため、サンプルデータはありません。Rで線形回帰モデルを実行する: a.lm = lm(Y ~ x1 + x2) x1は連続変数です。x2カテゴリ型で、「低」、「中」、「高」の3つの値があります。ただし、Rによって与えられる出力は次のようになります。 summary(a.lm) Estimate Std. Error t value Pr(>|t|) (Intercept) 0.521 0.20 1.446 0.19 x1 -0.61 0.11 1.451 0.17 x2Low -0.78 0.22 -2.34 0.005 x2Medium -0.56 0.45 -2.34 0.005 私は、Rがそのような要因(要因x2であること)に何らかのダミーコーディングを導入していることを理解しています。私はただ疑問に思っていx2ます。「高」の値をどのように解釈しますか?たとえば、ここで示した例の「High」x2は応答変数にどのような影響を与えますか? これの例を他の場所(例:ここ)で見ましたが、理解できる説明は見つかりませんでした。
10 r  regression  categorical-data  regression-coefficients  categorical-encoding  machine-learning  random-forest  anova  spss  r  self-study  bootstrap  monte-carlo  r  multiple-regression  partitioning  neural-networks  normalization  machine-learning  svm  kernel-trick  self-study  survival  cox-model  repeated-measures  survey  likert  correlation  variance  sampling  meta-analysis  anova  independence  sample  assumptions  bayesian  covariance  r  regression  time-series  mathematical-statistics  graphical-model  machine-learning  linear-model  kernel-trick  linear-algebra  self-study  moments  function  correlation  spss  probability  confidence-interval  sampling  mean  population  r  generalized-linear-model  prediction  offset  data-visualization  clustering  sas  cart  binning  sas  logistic  causality  regression  self-study  standard-error  r  distributions  r  regression  time-series  multiple-regression  python  chi-squared  independence  sample  clustering  data-mining  rapidminer  probability  stochastic-processes  clustering  binary-data  dimensionality-reduction  svd  correspondence-analysis  data-visualization  excel  c#  hypothesis-testing  econometrics  survey  rating  composite  regression  least-squares  mcmc  markov-process  kullback-leibler  convergence  predictive-models  r  regression  anova  confidence-interval  survival  cox-model  hazard  normal-distribution  autoregressive  mixed-model  r  mixed-model  sas  hypothesis-testing  mediation  interaction 


1
確率的PCAの主要部分空間とは何ですか?
場合観測データの行列であり、Yは、次に潜在変数でありますバツXXYYY バツ= WY+ μ + εX=WY+μ+ϵX=WY+\mu+\epsilon ここで、は観測されたデータの平均であり、ϵはデータのガウス誤差/ノイズであり、Wは主部分空間と呼ばれます。μμ\muεϵ\epsilonWWW 私の質問は、通常のPCAが使用されると、以下が真である正規直交固有ベクトルセットを取得することです。EEE Y= EバツY=EXY=EX しかし、PPCAでは、は正規直交でも固有ベクトルでもありません。では、Wから主成分を取得するにはどうすればよいですか?WWWWWW 本能に従って、MATLABでppcaを検索しました。この行に出くわしました。 収束時、Wの列は部分空間に広がりますが、それらは正規直交ではありません。ppcaは、Wの直交化によって成分の正規直交係数coeffを取得します。 Wを取得するためにppcaコードを少し変更して実行し、直交化した後、WからPを取得しました。 なぜこの直交化によって固有ベクトルが得られ、それに沿ってほとんどの分散が見られるのでしょうか? 私は、直交化によって主部分空間にまたがる一連の直交/正規直交ベクトルが得られると仮定していますが、この直交化された結果の行列がeigenmatrixに等しいのはなぜですか(pcaの固有行列も正規直交であることを知っています)?主部分空間が正規直交ベクトルの一意のセットによってのみスパンされると仮定できますか?その場合、両方の結果は常に一致します。

3
高い再現率-不均衡なデータセットの精度が低い
現在、サポートベクターマシンでツイートデータセットを分析しているときに問題が発生しています。問題は、バランスの取れていないバイナリクラストレーニングセット(5:2)があることです。これは実際のクラス分布に比例すると予想されます。予測すると、検証セットの少数派クラスの精度が低くなります(0.47)。再現率は0.88です。実際のクラス分布を反映するために検証セットも不均衡であるため、精度を向上させなかった(トレーニングセットで実行される)いくつかのオーバーサンプリングおよびアンダーサンプリングメソッドを使用しようとしました。また、サポートベクターマシンにさまざまなコストを実装しました。もうパフォーマンスが上がらないようです。 私の想起を損なうことなく精度を向上させるために私ができることについて、何かアドバイスはありますか?さらに、なぜ私が偽陰性より陽性の方がはるかに多いのか誰かに手掛かりがありますか(陽性は少数派クラスです)?

2
回帰予測からの信頼区間のブートストラップ
宿題では、投げ縄回帰を使用する予測子を作成/トレーニングするためのデータが与えられました。予測子を作成し、scikit learnのlasso pythonライブラリを使用して予測子をトレーニングします。 だから今私は与えられた入力が出力を予測できるというこの予測因子を持っています。 2番目の質問は、「ブートストラップメソッドを使用して予測の信頼区間を報告するように予測子を拡張する」ことでした。 私は周りを見回して、平均や他のことのためにこれをしている人々の例を見つけました。 しかし、私は予測のためにそれを行うにはどうすればよいのか全くわからない。scikit-bootstrapライブラリを使用しようとしています。 コースのスタッフは非常に無反応なので、どんな助けでもありがたいです。ありがとうございました。

1
Rのトレーニングプロセスのステータスを確認する[終了]
閉まっている。この質問はトピックから外れています。現在、回答を受け付けていません。 この質問を改善してみませんか? 質問を更新することがありますので、話題のクロス検証済みのため。 4年前休業。 caretRでパッケージを使用してモデルをほぼ3日間トレーニングしています。計算は並列に実行されます(複数のプロセス)。残念ながら、Rコンソール(kernlabパッケージのSVMモデル)には出力がないため、10%と90%のどちらが完了したかはわかりません。 どういうわけか計算のプロセスを理解する方法はありますか? 私はOS Xを使用しているので、プロセススタックをダンプして、現在評価されているパラメーター値またはk倍の反復を見つけようとしている可能性があります。しかし、どうやって? 編集:トレーニング用のスクリプト: ctrl <- trainControl(method = "cv", number = 10, selectionFunction = "best", classProbs = TRUE, summaryFunction = twoClassSummary, verboseIter = TRUE) grid_svm <- expand.grid(.C = logseq(2^-15, 2^3, 10)) svm <- train(CLASS ~ ., data = dataset, method = "svmLinear", preProcess = c("center", …

2
バックプロパゲーションアルゴリズムを使用してニューラルネットワークのエラーを導出する方法
Andrew Ngによるこのビデオから5:00頃 とはどのように導出されますか?実際、はどういう意味ですか? はyと比較して取得されますが、非表示レイヤーの出力ではそのような比較はできませんよね?δ3δ3\delta_3δ2δ2\delta_2δ3δ3\delta_3δ4δ4\delta_4

1
多次元データのkNNの理解に役立つ
空間データのkNNアルゴリズムの前提を理解しています。そして、このアルゴリズムを拡張して、任意の連続データ変数(またはハミング距離をもつ公称データ)で使用できることを知っています。しかし、より高次元のデータを扱う場合、どの戦略が使用されますか? たとえば、データのテーブル(x [1]、x [2]、x [3]、...、x [n])があり、分類子のセットを作成してこれらの列の1つを予測するとします。 (x [n]と言います)。kNNアルゴリズムを使用して、トレーニングする残りの列(x [1] -x [n-1])から任意の2つの列を選択します。したがって、x [1]とx [2]を選択して、それらから分類子を構築できるとしましょう。または、x [1]とx [4]を選択したり、x [5]とx [8]を選択したりすることもできます。1つの列だけを選択して分類子を作成するか、3つの列を作成してその分類子。より高い次元(2D、3Dなど)を使用することには利点がありますか、それともx-1単一次元分類子を作成して、何らかの方法でそれらの予測を集計する必要がありますか? 変数のすべての潜在的な組み合わせからこれらの分類子をすべて構築すると、計算コストが高くなります。このセットを最適化して、そのセットから最高のkNN分類器を見つけるにはどうすればよいですか?そして、一連の分類子を見つけたら、それらの出力を単一の予測に組み合わせる最善の方法は何ですか?この質問に対する最も簡単な答えは投票です。または、各分類子のトレーニングデータからのエラー率で各投票に重みを付けます。 ほとんどの実装では、kNNをより一般化された学習にどのように適用しますか?

1
キャレットと比較したmlr
私は機械学習について学ぶためにmlrを少し使ってきましたが、最近キャレットについて知りました。 私が理解している方法は、どちらもさまざまなMLパッケージのラッパーですが、アプローチが少し異なるということです。mlrはキャレットの一部をラップするようにも見えますが、おそらくmlrをキャレットのスーパーセットと見なすことができます。 私はその理由のためにmlrを使い続けることを心がけています。両方を切り替える必要があるか、両方を学ぶ必要がないようにします。しかし、私はキャレットの作者が整頓された人々に加わっ​​たことも聞いた-おそらくこれは今や事実上の標準になるだろう。 私は明らかにmlrを使用し、キャレットについて少し読んでいましたが、MLの経験が比較的不足していることを考えると、私は2つの教育を受けた評価を行う資格があるとは特に思っていません。 2つのパッケージの長所/短所について、より多くのものをカバーし、より合理化されたアプローチを持ち、より柔軟で、他のコメントなどがあるかについての意見はありますか? 編集:代わりにこれをdatascienceに投稿しないことをお詫びします。これは、Pythonによって支配されているようです(mlrまたはcaretタグはありません)。たぶん、stackoverflowの方がいいかもしれませんが、私はそれらを使用する統計学者の見解にかなり興味があります。

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.