タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

2
順序付けられたクラスによる分類?
たとえば、人の画像を若い、中年、または古いのいずれかに割り当てる分類子をトレーニングしたいとします。 簡単な方法は、クラスを独立したカテゴリとして扱い、分類子をトレーニングすることです。しかし、どうやらクラス間にいくつかの関係があります。どうすればこれを利用してより良くなることができますか? 私は多分私にできることを考えてい 予測の損失増加と言う、損失を変更)1を若者として古いまたは古いとして若いです。 2)それを回帰問題に変換します。若い、中年、古いは0、1、2と表現されます。

1
KNNでどのタイプのデータ正規化を使用する必要がありますか?
正規化には2種類以上あることを知っています。 例えば、 1- zスコアまたはtスコアを使用してデータを変換します。これは通常、標準化と呼ばれます。 2- 0と1の間の値を持つようにデータを再スケーリングします。 正規化が必要かどうかの質問 KNNでどのタイプのデータ正規化を使用する必要がありますか?なぜ?

1
私のニューラルネットワークはユークリッド距離も学習できません
だから私は自分自身にニューラルネットワークを教えようとしています(猫の写真を分類するのではなく、回帰アプリケーションのために)。 私の最初の実験は、FIRフィルターと離散フーリエ変換を実装するためのネットワークのトレーニング(「前」と「後」の信号でトレーニング)でした。これらはどちらも活性化機能のない単一のレイヤーで実装できる線形演算だからです。 どちらもうまくいきました。 それで、私はを追加してabs()、振幅スペクトルを学習させることができるかどうかを見たかったのです。最初に、非表示層に必要なノードの数を考え、3のReLUがの大まかな近似に十分であることを認識したabs(x+jy) = sqrt(x² + y²)ので、その操作を単独の複素数(2入力→3 ReLUノードの非表示層→1)で単独でテストしました出力)。時々それは動作します: しかし、私がそれを試すほとんどの場合、それは極小値で行き詰まり、正しい形を見つけることができません: KerasですべてのオプティマイザーとReLUバリアントを試してみましたが、それほど違いはありません。このような単純なネットワークを確実に収束させるために他に何かできることはありますか?それとも私は間違った態度でこれに近づいていますか、そしてあなたは問題で必要以上に多くのノードを投げるはずであり、それらの半分が死んだとしても大したこととは考えられませんか?

3
機械学習を使用した複数の期間の予測
私は最近、時系列の知識を要約しましたが、機械学習はほとんど一歩先の予測しか与えないことに気付きました。 一段先の予測我々は時間単位のデータを持っている場合は、午前12時などの予測午前11時と11時まで午前10時からのデータを使用して、例えば、I平均予測 機械学習の方法でh-steps-aheadの予測を作成できますか?h-step-ahead予測では、たとえば、毎時のデータを想定して、午前10時からのデータを使用して7-step-ahead予測を行い、11、12、13、14、15、16、17の推定値を取得します。 o時計。 写真の例: 私の主な質問に関連して私は思います: h-ahead-ahead予測を行うために機械学習を使用している人を見かけない理由は何ですか? 機械学習を使用する方法がある場合、それはARIMAよりも正確ですか?

2
ベイジアンがテストセットを必要としないのは本当ですか?
私は最近、Eric J. Maによるこの講演を見て、彼のブログエントリをチェックしました。彼はRadford Nealを引用しています。ベイジアンモデルはオーバーフィットしない(しかし、オーバーフィットすることができる)こと、およびそれらを使用する場合、検証するためのテストセット(私は引用符が検証セットを使用してパラメータを調整することについて話しているようです)。正直に言って、私には説得力がなく、本にアクセスすることもできないので、そのような声明に対して、または反対して、より詳細で厳密な議論をしてもらえますか? ちなみに、その間、エリック・マーは私に同じトピックに関するこの議論を指摘しました。

2
転移学習用の事前トレーニング済みモデルの場所[終了]
休業。この質問には、より焦点を当てる必要があります。現在、回答を受け付けていません。 この質問を改善してみませんか?質問を更新して、この投稿を編集するだけで1つの問題に焦点を当てます。 2年前休業。 私は機械学習の分野に不慣れですが、Kerasで簡単な分類アルゴリズムを試して実装したいと思っていました。残念ながら、私はデータのセットが非常に少ないので、問題に転移学習を適用しようと考えました。しかし、オンラインでこれを見つけることができなかったので、事前トレーニング済みのニューラルネットワークを探すのに最適な場所はどれなのかを理解する必要がありました。これに関して何か提案はありますか?機械学習プロジェクトの開始方法に関するアイデアを得るのに最適なWeb​​サイトはどれですか。

2
勾配降下法で固定ステップサイズを使用すると、ステップが小さくなるのはなぜですか?
一定のステップサイズα = 0.03を使用して、2次関数最小化して、勾配が適切なおもちゃの例を実行するとします。(A = [ 10 、2 、2 、3 ])バツTA xxTAxx^TAxα = 0.03α=0.03\alpha=0.03A = [ 10 、2 。2 、3 ]A=[10,2;2,3]A=[10, 2; 2, 3] 各反復でのトレースをプロットすると、次の図が得られます。固定ステップサイズを使用すると、ポイントが「非常に密」になるのはなぜですか。直感的には、固定ステップサイズではなく、減少ステップサイズのように見えます。バツxx PS:Rコードにはプロットが含まれます。 A=rbind(c(10,2),c(2,3)) f <-function(x){ v=t(x) %*% A %*% x as.numeric(v) } gr <-function(x){ v = 2* A %*% x as.numeric(v) } x1=seq(-2,2,0.02) x2=seq(-2,2,0.02) df=expand.grid(x1=x1,x2=x2) contour(x1,x2,matrix(apply(df, 1, …

1
高次元の相関データと上位の特徴/共変量が発見されました。複数の仮説検定?
約5,000の相関関係のある特徴/共変量とバイナリ応答のデータセットがあります。データは私に与えられました、私はそれを集めませんでした。ラッソとグラディエントブースティングを使用してモデルを構築しています。私は反復されたネストされた相互検証を使用しています。Lassoの最大(絶対)40係数と、勾配ブーストツリーの40の最も重要な機能を報告します(40について特別なことは何もありませんでした。これは、妥当な量の情報であるように思われました)。また、CVのフォールドと反復におけるこれらの量の分散についても報告します。 私は「重要な」機能について少し考え、p値や因果関係などについては何も述べていませんが、代わりにこのプロセスをある種の---不完全でランダムなものである-何らかの現象への洞察と見なしています。 私がこれをすべて正しく行ったと仮定すると(たとえば、相互検証を正しく実行し、投げ縄用にスケーリングした)、このアプローチは妥当ですか?たとえば、複数の仮説検定、事後分析、誤った発見などの問題はありますか?または他の問題? 目的 有害事象の確率を予測する まず、正確に確率を推定する よりマイナー-健全性チェックとしてだけでなく、さらに調査できるいくつかの新しい予測子を明らかにするために、上記のように係数と重要性を検査します。 消費者 このイベントの予測に関心のある研究者、およびイベントが発生した場合にイベントを修正する必要のある人々 彼らがそれから抜け出してほしいもの 説明されているように、独自のデータを使用してモデリングプロセスを繰り返したい場合は、イベントを予測する機能を提供します。 予想外の予測因子に光を当てる。たとえば、完全に予期しないことが最良の予測因子であることが判明する場合があります。したがって、他の場所のモデラーは、この予測子をより真剣に検討するかもしれません。


1
相互に排他的でないカテゴリを分類できる深層学習モデル
例:仕事の説明に「英国のJavaシニアエンジニア」という文があります。 私は2つのカテゴリとして、それを予測することは、深い学習モデルを使用したい:English とIT jobs。従来の分類モデルを使用する場合softmax、最後のレイヤーで機能を持つ1つのラベルのみを予測できます。したがって、2つのモデルのニューラルネットワークを使用して、両方のカテゴリで「はい」/「いいえ」を予測できますが、さらに多くのカテゴリがあると、コストがかかりすぎます。では、2つ以上のカテゴリを同時に予測するためのディープラーニングまたは機械学習モデルはありますか? 「編集」:従来のアプローチによる3つのラベルでは、[1,0,0]によってエンコードされますが、私の場合、[1,1,0]または[1,1,1]によってエンコードされます 例:3つのラベルがあり、文がこれらすべてのラベルに収まる場合。したがって、softmax関数からの出力が[0.45、0.35、0.2]である場合、3つのラベルまたは2つのラベルに分類する必要がありますか、それとも1つにすることができますか?それを行うときの主な問題は、1、2、または3つのラベルに分類するための適切なしきい値は何ですか?
9 machine-learning  deep-learning  natural-language  tensorflow  sampling  distance  non-independent  application  regression  machine-learning  logistic  mixed-model  control-group  crossover  r  multivariate-analysis  ecology  procrustes-analysis  vegan  regression  hypothesis-testing  interpretation  chi-squared  bootstrap  r  bioinformatics  bayesian  exponential  beta-distribution  bernoulli-distribution  conjugate-prior  distributions  bayesian  prior  beta-distribution  covariance  naive-bayes  smoothing  laplace-smoothing  distributions  data-visualization  regression  probit  penalized  estimation  unbiased-estimator  fisher-information  unbalanced-classes  bayesian  model-selection  aic  multiple-regression  cross-validation  regression-coefficients  nonlinear-regression  standardization  naive-bayes  trend  machine-learning  clustering  unsupervised-learning  wilcoxon-mann-whitney  z-score  econometrics  generalized-moments  method-of-moments  machine-learning  conv-neural-network  image-processing  ocr  machine-learning  neural-networks  conv-neural-network  tensorflow  r  logistic  scoring-rules  probability  self-study  pdf  cdf  classification  svm  resampling  forecasting  rms  volatility-forecasting  diebold-mariano  neural-networks  prediction-interval  uncertainty 

4
コックスハザードモデルの生存曲線を解釈するにはどうすればよいですか?
コックス比例ハザードモデルから生存曲線をどのように解釈しますか? このおもちゃの例ではage、kidneyデータの変数にcox比例ハザードモデルがあり、生存曲線を生成するとします。 library(survival) fit <- coxph(Surv(time, status)~age, data=kidney) plot(conf.int="none", survfit(fit)) grid() たとえば、時間、どのステートメントが正しいですか?または両方が間違っていますか?200200200 ステートメント1:被験者は20%残ります(たとえば、人がいる場合、200日目までに、およそ200人が残っているはずです)。 100010001000200200200200200200 ステートメント2:特定の人に対して、彼/彼女は200日目に生存する可能性がます。20%20%20\%200200200 βTxβTx\beta^Tx

1
SVM =テンプレートマッチングとは
私はSVMについて読み、それらが最適化問題を解決していて、最大マージンのアイデアが非常に合理的であることを学びました。 現在、カーネルを使用することで、非線形の分離境界でさえも見つけることができました。 これまでのところ、SVM(特別なカーネルマシン)とカーネルマシンがニューラルネットワークとどのように関連しているか、私にはまったくわかりません。 Yann Lecunのコメントを検討してください=> ここ: kernel methods were a form of glorified template matching そしてここも: たとえば、一部の人々は、それに伴うかわいい数学のために、カーネルメソッドに夢中です。しかし、以前に言ったように、結局のところ、カーネルマシンは「見栄えの良いテンプレートマッチング」を実行する浅いネットワークです。これには何の問題もありませんが(SVMは優れた方法です)、私たち全員が知っておくべき悲惨な制限があります。 だから私の質問は: SVMはニューラルネットワークとどのように関連していますか?浅いネットワークはどうですか? SVMは明確に定義された目的関数で最適化問題を解決しますが、テンプレートマッチングはどのように行われますか?ここで入力が照合されるテンプレートは何ですか? これらのコメントには、高次元空間、ニューラルネット、カーネルマシンの完全な理解が必要だと思いますが、これまでのところ、私は試みており、その背後にあるロジックを把握できませんでした。しかし、2つの非常に異なるmlテクニック間の関係に注目するのは確かに興味深いことです。 編集:ニューラルの観点からSVMを理解することは素晴らしいことだと思います。線形SVMとカーネルトリックを備えたSVMの両方の場合の、SVMとニューラルネット間のリンクを本当に理解するために、上記の2つの質問に対する完全な数学支援の答えを探しています。

4
ニューラルネットワークを回帰用にトレーニングすると、常に平均が予測されます
私は回帰のための単純な畳み込みニューラルネットワークをトレーニングしています。ここでのタスクは、画像内のボックスの(x、y)位置を予測することです。例: ネットワークの出力には、x用とy用の2つのノードがあります。ネットワークの残りの部分は、標準の畳み込みニューラルネットワークです。損失は​​、ボックスの予測位置とグラウンドトゥルースの位置との間の標準的な平均二乗誤差です。私はこれらの画像の10000でトレーニングをしており、2000で検証しています。 私が抱えている問題は、重要なトレーニングを行った後でも、損失が実際には減少しないことです。ネットワークの出力を観察すると、両方の出力ノードで、ネットワークがゼロに近い値を出力する傾向があることに気付きました。そのため、ボックスの位置の予測は常に画像の中心になります。予測には多少のずれがありますが、常にほぼゼロです。以下は損失を示しています: このグラフに示されているよりも多くのエポックでこれを実行しましたが、損失はまだ減少していません。ここで興味深いことに、実際にはある時点で損失が増加しています。 したがって、ネットワークは、適切な適合を学習するのではなく、トレーニングデータの平均を予測しているだけのようです。なぜこれがそうなのかについてのアイデアはありますか?Adamをオプティマイザとして使用しています。初期学習率は0.01で、relusをアクティベーションとして使用しています。 私のコード(Keras)の一部に興味がある場合は、以下に示します。 # Create the model model = Sequential() model.add(Convolution2D(32, 5, 5, border_mode='same', subsample=(2, 2), activation='relu', input_shape=(3, image_width, image_height))) model.add(Convolution2D(64, 5, 5, border_mode='same', subsample=(2, 2), activation='relu')) model.add(Convolution2D(128, 5, 5, border_mode='same', subsample=(2, 2), activation='relu')) model.add(Flatten()) model.add(Dense(100, activation='relu')) model.add(Dense(2, activation='linear')) # Compile the model adam = Adam(lr=0.01, beta_1=0.9, …

1
LSTMトポロジーについて
他の多くの人がそうであるように、私はこことここのリソースがLSTMセルを理解するのに非常に役立つことがわかりました。値がどのように流れて更新されるかを理解していると確信しており、前述の「のぞき穴の接続」なども追加できると確信しています。 私の例では、各時間ステップで長さの入力ベクトルと長さiの出力ベクトルがoありo < iます。 どちらのページでも実際にカバーされていないのは、これらがどのように配置およびトレーニングされるかです。 2つの質問があります。 私のトレーニングデータには、多くの時間単位に対応する多くの入力/出力ベクトルのペアがあります。すべてのデータを使用してLSTMをトレーニングするとします。その後、任意の長さの入力セットを実行できますか?たとえば、2015年と2016年全体のトレーニングデータがある場合、2017年のデータをネットワーク経由で実行できますか?それとも2017年から2020年か? 私が読んだことによると、時間単位ごとに1つのLSTMセルがあるように感じるので、多くの時間単位がある場合は、多くの連鎖LSTMセルがあります。チェーンの長さはネットワークを介して実行したいデータの長さに依存し、おそらく任意であるため、数を複製する単一のLSTMセルのみをトレーニングしない限り、これをトレーニングする方法がわかりません回。だから、私は単一のLSTMセルをトレーニングし、nそれらを長さの指定された入力ベクトルリストに対して一緒にチェーンするように思われnますか?単一のLSTMセルには多くの要素と機能が含まれていますが、それほど多くの情報を非常に小さなものにキャプチャするだけでは十分ではないように感じますか? ありがとう。実装の詳細を理解するのに役立つ、(比較的迅速に)消費できる他のリソースはありますか?上記の2つのリンクは、何が起こっているのかについてのすばらしい高レベルの画像を提供しましたが、これらの詳細をキャプチャできませんでした。

2
ガウス分布のベイズ混合への確率変分推論の適用
この論文に続いて、確率的変分推論で混合ガウスモデルを実装しようとしています。 これはガウス混合のpgmです。 論文によると、確率的変分推論の完全なアルゴリズムは次のとおりです。 そして、私はそれをGMMにスケーリングする方法にまだ非常に混乱しています。 まず、ローカル変分パラメーターはあり、その他はすべてグローバルパラメーターであると考えました。私が間違っていたら訂正してください。ステップ6はどういう意味ですか?これを達成するにはどうすればよいですか?qzqzq_zas though Xi is replicated by N times これで私を助けてくれませんか?前もって感謝します!

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.