タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

2
NNアーキテクチャを動的に調整する:不要なものを発明しますか?
私は博士課程の旅を始めており、私が自分の前に設定した究極の目標は、彼らが働く環境を監視し、アーキテクチャを当面の問題に動的に調整するANNを開発することです。明らかな影響は、データの一時性です。データセットが連続的でなく、時間とともに変化しない場合、なぜ調整するのでしょうか。 大きな問題は、ディープラーニングの最近の台頭で、それはまだ関連するトピックですか?FFNNは、概念のドリフト問題のニッチを見つけるチャンスですか? スレッドに過大な質問を詰め込むのは怖いですが、これは完全にトピック外ではありません。RNNは知っていますが、私はそれらに限られた(OK、なし、または純粋に理論的な)経験を持っています。動的なアーキテクチャの適応は、RNNのコンテキストでは関連するトピックでなければならない、と私は思います。問題は、すでに回答されているか、そして車輪を再発明するかということです。 PSがメタオプティマイズにクロスポスト

2
混合モデルのパラメトリック、セミパラメトリック、ノンパラメトリックブートストラップ
以下の移植片は、この記事から引用したものです。私はブートストラップの初心者であり、R bootパッケージを使用した線形混合モデルのパラメトリック、セミパラメトリック、ノンパラメトリックのブートストラップブートストラップを実装しようとしています。 Rコード これが私のRコードです: library(SASmixed) library(lme4) library(boot) fm1Cult <- lmer(drywt ~ Inoc + Cult + (1|Block) + (1|Cult), data=Cultivation) fixef(fm1Cult) boot.fn <- function(data, indices){ data <- data[indices, ] mod <- lmer(drywt ~ Inoc + Cult + (1|Block) + (1|Cult), data=data) fixef(mod) } set.seed(12345) Out <- boot(data=Cultivation, statistic=boot.fn, R=99) Out ご質問 …
9 r  mixed-model  bootstrap  central-limit-theorem  stable-distribution  time-series  hypothesis-testing  markov-process  r  correlation  categorical-data  association-measure  meta-analysis  r  anova  confidence-interval  lm  r  bayesian  multilevel-analysis  logit  regression  logistic  least-squares  eda  regression  notation  distributions  random-variable  expected-value  distributions  markov-process  hidden-markov-model  r  variance  group-differences  microarray  r  descriptive-statistics  machine-learning  references  r  regression  r  categorical-data  random-forest  data-transformation  data-visualization  interactive-visualization  binomial  beta-distribution  time-series  forecasting  logistic  arima  beta-regression  r  time-series  seasonality  large-data  unevenly-spaced-time-series  correlation  statistical-significance  normalization  population  group-differences  demography 

3
データセットで予想される最高のパフォーマンス
分類のような単純な機械学習の問題があるとします。視覚または音声認識のいくつかのベンチマークで、私は人間として、非常に優れた分類子です。したがって、分類子がどの程度優れているかについて直感があります。 しかし、大量のデータを使用する場合の1つのポイントは、トレーニングした分類子がどの程度優れているかわからないということです。これは私が個人的にあまり良い分類器ではないデータです(たとえば、EEGデータから人の気分を分類します)。私の問題がどれほど難しいかを直感することは実際には不可能です。 さて、機械学習の問題が発生した場合は、自分がどれだけ優れているかを確認したいと思います。これに対する原則的なアプローチはありますか?どうしますか? データを視覚化しますか?単純なモデルから始めますか?非常に複雑なモデルから始めて、オーバーフィットできるかどうかを確認しますか?この質問に答えたい場合は何を探していますか?いつやめますか?

1
1つの主要な予測子による分類
(クラス)分類問題があり、100程度の実数値予測子があり、そのうちの1つは他のどれよりもはるかに説明力があるようです。他の変数の影響についてさらに詳しく説明したいと思います。ただし、標準の機械学習手法(ランダムフォレスト、SVMなど)は、1つの強力な予測子に圧倒され、他の興味深い情報はあまり得られないようです。kkk これが回帰問題である場合、私は単純に強力な予測子に対して回帰し、残差を他のアルゴリズムの入力として使用します。しかし、このアプローチがどのように分類コンテキストに変換されるのか、実際にはわかりません。 私の本能は、この問題はかなり一般的である必要があるということです。それを処理するための標準的な手法はありますか?

2
感情分析の理解と適用
私は、いくつかのドキュメントコレクションの感情分析を行うプロジェクトに割り当てられていたところです。グーグルによって、多くの感情関連の研究が浮上しています。 私の質問は: 機械学習と統計分析の分野における感情分析の主な方法/アルゴリズムは何ですか? 確立された結果はありますか? 感情分析を実行できる既存のオープンソースソフトウェアはありますか?

2
SVM入力変数のRで遺伝的アルゴリズム変数選択を実行する方法は?
Rでkernlabパッケージを使用して、データを分類するためのSVMを構築しています。 SVMは適切な精度の「予測」を提供するという点でうまく機能していますが、入力変数のリストは私が望むよりも大きく、さまざまな変数の相対的な重要性についてはわかりません。 遺伝的アルゴリズムを実装して、最適に訓練された/最適なSVMを生成する入力変数のサブセットを選択したいと思います。 このGA実装を試行するときに使用するRパッケージを選択する際にいくつかの助けが必要です(そしておそらく簡単な疑似例)。 私はそこにあるほとんどのR GA / Pパッケージ(RGP、genalg、subselect、GALGO)を見てきましたが、フィットネス関数の一部としてksvm関数を渡し、人口プールとしての可変配列...? 正しい方向への助け、考え、または微笑は感謝して受け取られました。 ありがとう 後の編集で以下に追加されたこれを解決するコード # Prediction function to be used for backtesting pred1pd = function(t) { print(t) ##add section to select the best variable set from those available using GA # evaluation function - selects the best indicators based on miminsied training error …

2
分類のためにトレーニングセットから重複を削除する
分類問題のための行がたくさんあるとしましょう: バツ1、。。。バツN、Yバツ1、。。。バツN、YX_1, ... X_N, Y どこ機能/予測因子であると、行の機能の組み合わせが属するクラスです。バツ1、。。。、XNバツ1、。。。、バツNX_1, ..., X_NYYY 多くの特徴の組み合わせとそれらのクラスがデータセットで繰り返されています。これは、分類器を適合させるために使用しています。重複を削除することは許容できるかどうか疑問に思っていgroup by X1 ... XN Yます(基本的にSQLでa を実行します)?ありがとう。 PS: これは、クラスの事前分布がかなり歪んでいるバイナリプレゼンスのみのデータセット用です。

1
既存の多入力最大エントロピー分類器から最大エントロピーマルコフモデルを作成する
私は最大エントロピーマルコフモデル(MEMM)の概念に興味をそそられ、品詞(POS)タガーにそれを使用することを考えています。現在、私は従来の最大エントロピー(ME)分類器を使用して、個々の単語にタグを付けています。これは、前の2つのタグを含む多くの機能を使用します。 MEMMは、ビタビアルゴリズムを使用してマルコフチェーンを通る最適なパスを見つけます(つまり、各単語の個々の最適値ではなく、文のタグの完全な最適セットを見つけます)。それについて読むと、これは素晴らしい優雅さとシンプルさを持っているようです。ただし、各ステージは前のステージの「結果」にのみ依存しています(つまり、マルコフチェーンに従って)。 ただし、私のMEモデルでは、前の2つの段階(つまり、前の2つの単語のタグ)を使用しています。私には2つの可能なアプローチがあるようです: 従来のビタビ実装と同様に、1つ(前の)ステージに従って保存されたパスのセットを使用します。私のME分類器は、これとその前の「凍結」ステージ(検討中のパスに凍結)を使用して伝達関数を生成します。 または、2つのステージを追跡するアルゴリズムを記述します。これはより複雑であり、各伝達関数(つまり、MEモデルからの)は1つのステージではなく、前の2つのステージに依存するため、真のマルコフモデルではなくなります。 2つ目はより複雑になりますが、2つ目はより正確になります。 私は、文献検索でこれの例をまだ見つけていません。試されましたか?2段階のアプローチにより、全体的な精度が向上しましたか?

1
PCAとLSA / LSIの比較
質問: PCAとLSA / LSIのどちらを適用するかを決定するために使用できる、入力データの特性に関する一般的なガイドラインはありますか? PCAとLSA / LSIの概要: 主成分分析(PCA)と潜在的意味分析(LSA)または潜在的意味索引付け(LSI)は、すべてが基本的に特異値分解(SVD)をマトリックスに適用することに依存しているという意味で類似しています。 LSAとLSIは、私の知る限り、同じものです。LSAはPCAと基本的に異なりませんが、SVDを適用する前にマトリックスエントリを前処理する方法が異なります。 LSAの前処理ステップでは、通常、列が「ドキュメント」に対応し、行が何らかの種類の単語に対応するカウントマトリックスを正規化します。エントリは、ある種の(正規化された)文書の単語出現回数と考えることができます。 PCAでは、前処理ステップでは、元の行列から共分散行列を計算します。元のマトリックスは、概念的にはLSAの場合よりも本質的に「一般的」です。PCAが関係する場合、列は通常、一般的なサンプルベクトルを指すと言われ、行は測定される個々の変数を指すと言われます。共分散行列は定義により正方対称であり、共分散行列は対角化によって分解できるため、実際にはSVDを適用する必要はありません。特に、PCAマトリックスはLSA / LSIバリアントよりもほぼ確実に密度が高くなります。ゼロエントリは、変数間の共分散がゼロの場合、つまり変数が独立している場合にのみ発生します。 最後に、2つを区別するためにかなり頻繁に行われるもう1つの説明的なポイントは、 LSAはフロベニウスノルムで最高の線形部分空間を求め、PCAは最高のアフィン線形部分空間を目指します。 いずれにせよ、これらの手法の違いと類似性はインターネット全体のさまざまなフォーラムで激しく議論されており、明らかにいくつかの顕著な違いがあり、明らかにこれらの2つの手法は異なる結果を生み出します。 したがって、私の質問を繰り返します。PCAとLSA / LSIのどちらを適用するかを決定するために使用できる、入力データの特性に関する一般的なガイドラインはありますか?用語ドキュメントマトリックスに似たものがある場合、LSA / LSIが常に最良の選択になりますか?LSA / LSIの用語/ドキュメントマトリックスを準備して、SVDを直接適用するのではなく、PCAを結果に適用することで、より良い結果が得られると期待できますか?

1
SVMで不均衡なマルチクラスデータセットを処理する最良の方法
かなり不均衡なデータにSVMを使用して予測モデルを構築しようとしています。私のラベル/出力には、ポジティブ、ニュートラル、ネガティブの3つのクラスがあります。ポジティブな例では、データの約10〜20%、ニュートラルでは約50〜60%、ネガティブでは約30〜40%になります。クラス間の誤った予測に関連するコストが同じではないため、クラスのバランスをとろうとしています。1つの方法は、トレーニングデータをリサンプリングし、元のデータセットよりも大きい、均等にバランスのとれたデータセットを作成することでした。興味深いことに、そうすると、他のクラスの予測が良くなる傾向があります(たとえば、データのバランスをとると、陽性クラスの例の数が増えましたが、サンプルの予測では、陰性クラスの方が優れていました)。誰もがこれが発生する理由を一般的に説明できますか?ネガティブクラスの例の数を増やすと、サンプルの予測外(たとえば、より良い予測)でポジティブクラスのようなものを取得できますか? また、誤った分類に異なるコストを課すか、LibSVMでクラスの重みを使用することによって、不均衡なデータに対処する方法に関する他の考えにも非常にオープンです(適切に選択/調整する方法はわかりません)。


3
非常に大きなデータセットから重要な変数をすばやく選択するにはどうすればよいですか?
約2,000のバイナリ変数/ 200,000行のデータセットがあり、単一のバイナリ従属変数を予測しようとしています。この段階での私の主な目標は、予測の正確さを得ることではなく、これらの変数のどれが重要な予測子であるかを識別することです。最終モデルの変数の数を約100に減らしたいのですが。 最も重要な変数を取得する比較的迅速な方法はありますか?randomForestに時間がかかっているようです。 200,000件すべてを使用する必要はないので、サンプリングはテーブルのオプションです。

6
時系列での安定性のテスト
特定の時系列が安定したときにテストするための標準(または最良)の方法はありますか? やる気 各タイムステップで値を出力する確率的動的システムがあります。このシステムは、タイムステップまでいくつかの一時的な動作をし、いくつかのエラーを伴っていくつかの平均値周りで安定します。、、またはエラーはどれも私にはわかりません。私はいくつかの仮定をしたいと思っています(周りのガウス誤差のように) T ∈ N T * X * T * X * X * X 0 0 X * X *バツtxtx_tT ∈ Nt∈Nt \in \mathbb{N}t∗t∗t^*バツ∗x∗x^*t∗t∗t^*バツ∗x∗x^*バツ∗x∗x^*たとえば)しかし、私が必要とするアプリオリな仮定が少ないほど、より良いです。私が確信している唯一のことは、システムが収束する安定点は1つだけであり、安定点の周りの変動は過渡期間中の変動よりもはるかに小さいことです。プロセスも単調で、は近くから始まり、向かって上昇していると想定でき(周りで安定する前に少しオーバーシュートする可能性があります)。バツ0x0x_0000バツ∗x∗x^*バツ∗x∗x^* データは、シミュレーションから来るということだ、と私は(私は唯一の過渡期に興味を持っていますので)私のシミュレーションの停止条件として、安定性試験を必要としています。バツtxtx_t 正確な質問 いくつかの有限の時間値へのアクセスのみが与えられた場合、確率的動的システムがある点周りで安定したと合理的な精度で言う方法はありますか?テストが、、および周りのエラーも返す場合のボーナスポイント。ただし、シミュレーションが完了した後でこれを理解する簡単な方法があるため、これは必須ではありません。 T x ∗ x ∗ t ∗ x ∗x0...xTx0...xTx_0 ... x_TTTTx∗x∗x^*x∗x∗x^*t∗t∗t^*x∗x∗x^* 素朴なアプローチ 最初に頭に浮かぶ素朴なアプローチ(たとえば、一部のニューラルネットワークのwin条件として使用されているのを見てきました)は、パラメーターとを選択し、最後のタイムステップの場合、2つの点とそのような次に、安定したと結論付けます。このアプローチは簡単ですが、厳密ではありません。また、と適切な値を推測する必要があります。E T x x ′ x ′ − …

1
最小角度回帰は、相関関係を単調に減少させ続けますか?
最小角度回帰(LAR)の問題を解決しようとしています。これが問題である3.23ページ上の97のHastieら、統計的学習、第二の要素。ed。(5回目の印刷)。 すべての変数と応答が平均ゼロと標準偏差1を持つ回帰問題を考えてみましょう。また、各変数が応答と同一の絶対相関を持つと仮定します。 1N|⟨xj,y⟩|=λ,j=1,...,p1N|⟨xj,y⟩|=λ,j=1,...,p \frac{1}{N} | \left \langle \bf{x}_j, \bf{y} \right \rangle | = \lambda, j = 1, ..., p ましょうβはの最小二乗係数であるYにXおよびlet U(α )= α X βのためのα ∈ [ 0 、1 ]。β^β^\hat{\beta}yy\mathbf{y}XX\mathbf{X}u(α)=αXβ^u(α)=αXβ^\mathbf{u}(\alpha)=\alpha \bf{X} \hat{\beta}α∈[0,1]α∈[0,1]\alpha\in[0,1] 私はそれを示すように求められます と私はそれに問題があります。これは基本的に、各xjと残差との相関がuに向かって進んでも大きさが等しいことを示していることに注意してください。1N|⟨xj,y−u(α)⟩|=(1−α)λ,j=1,...,p1N|⟨xj,y−u(α)⟩|=(1−α)λ,j=1,...,p \frac{1}{N} | \left \langle \bf{x}_j, \bf{y}-u(\alpha) \right \rangle | = (1 - \alpha) \lambda, j = …

2
データのROC曲線を計算する
そのため、ハミング距離を使用して生体認証特性から個人を認証しようとしている16のトライアルがあります。しきい値は3.5に設定されています。私のデータは以下であり、トライアル1のみが真陽性です。 Trial Hamming Distance 1 0.34 2 0.37 3 0.34 4 0.29 5 0.55 6 0.47 7 0.47 8 0.32 9 0.39 10 0.45 11 0.42 12 0.37 13 0.66 14 0.39 15 0.44 16 0.39 私の混乱のポイントは、このデータからROC曲線(FPR対TPR OR FAR対FRR)を作成する方法が本当にわからないということです。どちらでもかまいませんが、どうやって計算するのか混乱しています。任意の助けいただければ幸いです。
9 mathematical-statistics  roc  classification  cross-validation  pac-learning  r  anova  survival  hazard  machine-learning  data-mining  hypothesis-testing  regression  random-variable  non-independent  normal-distribution  approximation  central-limit-theorem  interpolation  splines  distributions  kernel-smoothing  r  data-visualization  ggplot2  distributions  binomial  random-variable  poisson-distribution  simulation  kalman-filter  regression  lasso  regularization  lme4-nlme  model-selection  aic  r  mcmc  dlm  particle-filter  r  panel-data  multilevel-analysis  model-selection  entropy  graphical-model  r  distributions  quantiles  qq-plot  svm  matlab  regression  lasso  regularization  entropy  inference  r  distributions  dataset  algorithms  matrix-decomposition  regression  modeling  interaction  regularization  expected-value  exponential  gamma-distribution  mcmc  gibbs  probability  self-study  normality-assumption  naive-bayes  bayes-optimal-classifier  standard-deviation  classification  optimization  control-chart  engineering-statistics  regression  lasso  regularization  regression  references  lasso  regularization  elastic-net  r  distributions  aggregation  clustering  algorithms  regression  correlation  modeling  distributions  time-series  standard-deviation  goodness-of-fit  hypothesis-testing  statistical-significance  sample  binary-data  estimation  random-variable  interpolation  distributions  probability  chi-squared  predictor  outliers  regression  modeling  interaction 

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.