タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

3
アンサンブル分類器で分類はどのようにマージされますか?
アンサンブル分類器は、構成要素である分類器の予測をどのようにマージしますか?明確な説明が見つからない。私が見つけたいくつかのコード例では、アンサンブルは予測を平均化するだけですが、これがどのようにして「より良い」全体的な精度を実現できるかはわかりません。 次のケースを考えてください。アンサンブル分類子は、10個の分類子で構成されています。1つの分類子の精度は、データサブセットXの時間の100%、それ以外の時間はすべて0%です。他のすべての分類子の精度は、データサブセットXでは0%、その他の場合はすべて100%です。 分類器の精度が無視される平均化式を使用すると、集団分類器の精度はせいぜい50%になります。これは正しいですか、それとも何か不足していますか?N個の潜在的に無知な分類子から平均予測を取得すると、特定のドメインの専門家である単一の分類子よりも優れた予測を作成できる可能性があります。

2
等しくないグループの単純ベイズ分類器
単純ベイズ分類器を使用して、2つのデータグループを分類しています。データの1つのグループが他のグループよりもはるかに大きい(4倍以上)。分類器の各グループの事前確率を使用しています。 問題は、私が得た結果の真陽性率が0%、偽陽性率が0%であるということです。以前の値を0.5と0.5に設定した場合も同じ結果が得られました。 しきい値をより良いものに設定して、よりバランスの取れた結果を得るにはどうすればよいですか? ロジスティック回帰分類器を使用すると、同様の問題が発生しました。バイアスから前期を差し引くことで解決しました。 このデータでフィッシャー線形判別を使用すると、中間に設定されたしきい値で良い結果が得られます。 この問題にはいくつかの一般的な解決策があると思いますが、見つけることができませんでした。 更新:私は分類器が過剰適合していることに気づきました。トレーニングセットのパフォーマンスは完璧です(100%正確)。 同じグループを使用すると、分類子は「小さな」グループにも分類を開始しますが、パフォーマンスはかなり低くなります(FLDまたはLRよりも悪い)。 UPDATE2:問題は、完全な共分散行列を使用していたことでした。対角共分散行列で実行すると、より「バランスの取れた」結果が得られました。

2
回帰分析で多項式の次数を見つける
私は機械学習プロジェクトに取り組んでおり、データの曲線を当てはめようとしています。残念ながら、日付の特徴ベクトルはやや高くなっています。そのため、2Dまたは3D空間に実際にプロットして、データの形状がどのように見えるかを推測することはできません。 したがって、ヒットとトライアル以外に、私のデータに最適な多項式の次数を見つけるための数学的な方法はありますか? つまり、各次数の最小二乗誤差を調べて、最小の誤差を持つ誤差を選択できることを知っていますが、最初の最適化ループは、データに適合する曲線、2番目のループは次数のチェックに使用されます。助言がありますか?

2
なぜトランスレーショナルバイオメディシンで機械学習技術をあまり使用しないのですか?
これは前の質問のフォローアップです。ここに : 治療結果を予測するニューラルネットワークモデル そして、この質問の別の側面を参照すると見なされるかもしれません: 少量サンプルの臨床研究における機械学習技術の応用 再投稿を提案したZachに感謝します。 CART、randomForest、ニューラルネットワーク、機械学習全般についてかなり真剣に読んだり、WEKAとRパッケージについて学習したり、スタンフォードエンジニアリングの講義http://www.ml-class.org/コース/クラス/インデックス、私はハスティーに3章います。臨床指向の研究で定期的に見られる種類のデータ-臨床パラメータの負荷+生化学的パラメータの負荷+ペンと紙のテストデータ+/-数値が小さい神経画像データを考えると、何かが足りないような気がします。私は、研究文献で適用されているML技術について定期的に読んでいません。私の質問は、私は疑わしい何かにとらわれて、それをよく知っている臨床医や生物統計学者を研究することによって正当化された疑いで見なされているのか、あるいはこれらの手法は「ビジネス分析」の外で本当に見落とされているか恐れられているのか?それを「ニッチ」に保つものは何ですか?

3
ロジスティック回帰で異なる分布の予測子変数をどのように処理しますか?
x1とx2を指定してyを予測するためにロジスティック回帰を使用しています。 z = B0 + B1 * x1 + B2 * x2 y = e^z / (e^z + 1) ロジスティック回帰は、変数のスケールが大きく異なる場合にどのように処理されるはずですか?変数の高次係数を使用してロジスティック回帰モデルを構築することはありますか?私はこのようなものを想像しています(2つの変数について): z = B0 + B1 * x1 + B2 * x1^2 + B3 * x2 + B4 * x2^2 または、ロジスティック回帰を使用する前に、x1とx2の値を単純に正規化、標準化、または再スケーリングする正しい答えは何ですか?

3
Rでの機能構築
Rに機能構築(既存の予測子から候補予測子を導出する)のためのアルゴリズム(おそらく遺伝的アルゴリズム)があるかどうか疑問に思っていますか?私は、既存の変数(sin、cos、atanなど)の高次のべき、相互作用、比率、線形結合、および非線形関数をテストするルーチンを考えています。 これは、フィルターまたはラッパールーチンである可能性があります(つまり、学習アルゴリズムを使用したり、機能の適合度を定義するために使用したりしません)。 私の目標は、既存の予測子の潜在的に意味のある比率などを「発見」することです。 ありがとう!

2
多くの人が、歪んだデータを機械学習アプリケーション用の通常の分散データに変換したいのはなぜですか?
画像および表形式のデータの場合、多くの人が、前処理中に歪んだデータを正規分布データに変換します。 機械学習における正規分布とはどういう意味ですか?それは機械学習アルゴリズムの本質的な仮定ですか? 画像データでさえ、画像のピクセル全体を正規分布または均一分布に従うように変換する分位変換を見てきました。 私は1つの理由を考えることができます:外れ値の影響を回避するため。しかし、これらの変換はデータの元の分布を歪めます。 なぜ正規分布が機械学習にとって非常に重要で、多くの前処理にこのステップが含まれているのですか?

1
回帰を伴う時系列データの相互検証
「通常の」相互検証に精通していますが、単純な線形回帰関数で相互検証を使用しながら時系列予測を行いたいと思います。2つの質問を明確にするために簡単な例を書き留めます。1つはトレーニング/テストの分割について、もう1つは目的が異なるnについて予測することである場合にモデルをトレーニング/テストする方法について1つの質問で、nの予測ステップで、前進。 (1)データ 次のように、タイムポイント1、...、10のデータがあるとします。 timeseries = [0.5,0.3,10,4,5,6,1,0.4,0.1,0.9] (2)教師あり学習に役立つ形式にデータを変換する 私が理解している限り、「ラグ」、つまりデータのシフトを使用して、教師あり学習に適したデータセットを作成できます。 input = [NaN,0.5,0.3,10,4,5,6,1,0.4,0.1] output/response = [0.5,0.3,10,4,5,6,1,0.4,0.1,0.9] ここでは、出力ベクトルを作成するために、時系列を1つずつシフトしています。私が理解している限り、線形回帰モデルの入力として入力を使用し、応答の出力を使用できます(NaNは、ランダムな値に置き換えて近似できます)。 (3)質問1:相互検証(「バックテスト」) 今2スプリットを実行したいのですが、テストセットだけでなく列車もシフトする必要がありますか? つまり次のようなものです: 列車セット: 独立変数:[NaN、0.5,0.3,10,4,5] 出力/応答変数:[0.5,0.3,10,4,5,6] テストセット: 独立変数:[1,0.4,0.1] 出力/応答変数:[0.4,0.1,0.9] (ii)質問2:異なるラグを事前に予測する: 明らかなように、従属変数への従属変数を1だけシフトしました。ここで、5つのタイムステップを事前に予測できるモデルをトレーニングしたいとします。このラグを1に保ちながら、モデルを使用してn + 1を予測できます。 、...、n + 5、...または、独立変数から従属変数へのシフトを5に変更しますか?違いは何ですか?

2
クラスター数の選択-クラスター検証の基準とドメインの理論的な考慮事項
クラスターの数を選択する必要があるという問題によく直面します。私が最終的に選択するパーティションは、多くの場合、品質基準ではなく視覚的および理論的な懸念に基づいています。 主な質問が2つあります。 1つ目は、クラスターの品質に関する一般的な考え方です。「エルボ」などの基準が理解できることから、コスト関数を参照して最適な値を提案しています。このフレームワークで私が抱えている問題は、最適な基準が理論的な検討に影響されないため、最終的なグループ/クラスターに常に必要となるある程度の複雑さ(研究分野に関連)があることです。 また、のように説明し、ここで最適値はまた、あなたがしているかを考慮して、(例えば経済的制約など)、「下流の目的」制約に関連している何をするつもりクラスタリング事項と。 明らかに、1つの面が意味のある/解釈可能なクラスターを見つけることであり、クラスターが多くなるほど、それらを解釈することが難しくなります。 しかし、常にそうであるとは限りません。8、10、または12個のクラスターが、分析で必要なクラスターの最小の「興味深い」数であることがよくあります。 ただし、肘などの基準では、クラスターがはるかに少ないことが示唆されることが多く、通常は2、3または4です。 Q1。私が知りたいのは、特定の基準(エルボなど)によって提案されたソリューションではなく、より多くのクラスターを選択することを決定した場合の最良の議論の行です。直観的には、制約がない場合(取得したグループの了解度や、非常に多額の場合のコースラの例など)は常に優れているはずです。これを科学雑誌の記事でどのように議論しますか? 別の言い方をすれば、(これらの基準を使用して)クラスターの最小数を特定したら、それよりも多くのクラスターを選択した理由を正当化する必要さえあるということです。意味のある最小限のクラスターを選択する場合にのみ、正当化が行われるべきではありませんか? Q2。これに関連して、クラスターの数が増えるにつれて、シルエットなどの特定の品質指標が実際にどのように減少するかはわかりません。シルエットにクラスター数のペナルティが表示されないので、どうすればよいですか?理論的には、クラスターが多いほど、クラスターの品質は高くなりますか? # R code library(factoextra) data("iris") ir = iris[,-5] # Hierarchical Clustering, Ward.D # 5 clusters ec5 = eclust(ir, FUNcluster = 'hclust', hc_metric = 'euclidean', hc_method = 'ward.D', graph = T, k = 5) # 20 clusters ec20 = eclust(ir, FUNcluster …

2
ニューラルネットワークの早期停止と、相互検証を使用する場合の意味の理解
早期停止の手法がどのように定義されているかという考えに、私は少し困惑して混乱しています。Wikipediaを見てみると、次のように定義されています。 トレーニングデータをトレーニングセットと検証セットに、たとえば2対1の比率で分割します。 トレーニングセットでのみトレーニングを行い、検証セットの例ごとのエラーを時々、たとえば5エポックごとに評価します。 検証セットのエラーが最後にチェックされたときよりも大きくなるとすぐにトレーニングを停止します。 トレーニング実行の結果として、ネットワークがその前のステップで持っていた重みを使用します。 私は自分の実験でメソッドを使用していました(10倍の交差検証を使用)。各エポックで検証エラーをチェックし(検証精度も計算)、忍耐パラメーターを2に設定しています。つまり、検証エラーが2エポックで連続して増加する場合は、トレーニングを停止します。次に、モデルが終了した最後のエポックの結果を使用しました。 Ian Goodfellowは、ディープラーニングの本で別の定義を使用しています。4番目のステップとして、最も効果的なモデルの重みを使用することを提案します(つまり、検証エラーがチェックされるたびにモデルを保存します)。 保存したモデルは必要ありません。自分の作業の結果だけが必要です。したがって、私にとってグッドフェローによる早期停止の提案は、最終結果で達成した最高の検証精度を採用することを意味しますか?どういうわけかこれは合法的ではないようです。開発セットがない実際の状況では、この情報はありません。しかし、その場合、そもそも早期停止を使用する理由は何でしょうか。たとえば、フォールドのエポック数を平均してエポック数を決定し、それを後で実行するテストに使用しますか?

2
計量経済学と機械学習の違いは何ですか?
私の理解では、計量経済学は、部分的(推定ceteris paribus主に推定する目的で)相関関係を因果関係を。そのため、通常は使用可能なデータセット全体を使用します。計量経済学は、パラメトリックとノンパラメトリックにすることができます。 一方、機械学習は因果関係には関心がなく、主に予測を生成することを目的とした「適合」に関心があります。そのため、通常はデータセットをトレーニングセットと予測セットに分割します。機械学習は、パラメトリックおよびノンパラメトリックにすることもできます。 これが私がこれらの2つの分野の中核を成すことができるものですが、私はそれにもっとたくさんあると確信しています。私は主にそれらの違いに興味があります。誰かがこれについての良いガイドを提供できますか?

3
Qラーニングがアクション値を過大評価するのはなぜですか?
標準のQ学習がq値を過大評価する傾向がある理由についての説明を見つけるのが困難です(二重Q学習を使用することで対処されます)。私が見つけた唯一の情報源は、この過大評価が発生する理由を正確に説明していません。 たとえば、Qラーニングに関するWikipediaの記事は次のように述べています。 概算された最大アクション値がQラーニングの更新で使用されるため、ノイズの多い環境では、Qラーニングがアクション値を過大評価し、学習を遅くすることがあります。 これは何を意味するのでしょうか?Qラーニングは理解できますが、上記は理解できません。最大q値の使用が過大評価を引き起こすのはなぜですか? ありがとう!

2
ガウス過程と相関
私はなぜ人々がガウス過程(GP)を使って未知の(時には決定論的)関数をモデル化するのか疑問に思っています。たとえば、未知の関数考えます。この関数から3つの独立した観測結果があります。 y=f(x)y=f(x)y=f(x)(x1,y1);(x2,y2);(x3,y3)(x1,y1);(x2,y2);(x3,y3)\big(x_1,y_1); \big(x_2,y_2); \big(x_3,y_3) 基になる関数を学ぶために、GPはすべての出力を共通の多変量正規分布として扱う一般的なノンパラメトリック手法です。特定の共分散関数 を想定し、以下を想定します。 GPは次の形式を取ります K(xi,yi)K(xi,yi)K(x_i,y_i)y=(y1,y2,y3);X=(x1,x2,x3)y=(y1,y2,y3);X=(x1,x2,x3)\mathbf{y}=(y_1,y_2,y_3);\mathbf{X}=(x_1,x_2,x_3)y|X∼N(0,⎡⎣⎢K(x1,x1)K(x1,x2)K(x1,x3)K(x1,x2)K(x2,x2)K(x2,x3)K(x1,x3)K(x2,x3)K(x3,x3) ⎤⎦⎥)y|X∼N(0,[K(x1,x1)K(x1,x2)K(x1,x3)K(x1,x2)K(x2,x2)K(x2,x3)K(x1,x3)K(x2,x3)K(x3,x3) ])\\ \bf{y}|X \sim N\Bigg(\mathbf{0},\begin{bmatrix} K(x_1,x_1) & K(x_1,x_2) & K(x_1,x_3) \\ K(x_1,x_2) & K(x_2,x_2) & K(x_2,x_3) \\ K(x_1,x_3) & K(x_2,x_3) & K(x_3,x_3) \ \end{bmatrix}\Bigg)\\ 観測は独立しています。それらの唯一の共通点は、それらが同じ基本的な機能に由来することです。 (xi,yi)(xi,yi)\big(x_i,y_i) 私の主な質問は次のとおりです。なぜとを相関させる必要があるのですか?それは間違ったモデルではありませんか?どのようなについても、良い予測結果が得られると想定できるのはなぜですか。(xi,yj)(xi,yj)\big(x_i,y_j)(xl,ym)(xl,ym)\big(x_{l},y_{m})y|xy|xy|x この問題で私が見逃している側面や、なぜ相関を強制することが役立つのかわかりません。

1
ディープラーニング:なぜbatch_sizeを増やすとオーバーフィッティングが発生し、どうやってそれを減らすのですか?
以前はローカルマシンでモデルをトレーニングしていましたが、メモリはバッチごとに10のサンプルで十分です。ただし、モデルをAWSに移行し、より大きなGPU(Tesla K80)を使用した場合、バッチサイズ32に対応できました。しかし、AWSモデルはすべて非常に不十分であり、過剰適合を示しています。なぜこれが起こるのですか? 私が現在使用しているモデルはinception-resnet-v2モデルであり、対象としている問題はコンピュータービジョンモデルです。私が考えることができる1つの説明は、それがおそらくバッチノルムプロセスであるため、バッチイメージにより慣れているということです。緩和策として、batch_normの減衰移動平均を減らしました。 また、dropoutをbatch_normと一緒に使用する必要がありますか?この習慣は一般的ですか? 私のトレーニング画像は約5000ですが、約60エポックでトレーニングしました。これはよく考慮されますか、それとも早くトレーニングを中止する必要がありますか?

1
完全畳み込みニューラルネットワークでのパッチごとのトレーニングと完全畳み込みトレーニング
完全畳み込みニューラルネットワークの論文では、著者はパッチワイズトレーニングと完全畳み込みトレーニングの両方に言及しています。 トレーニングセットの構築に関する私の理解は次のとおりです。 与えられたM*M画像、抽出サブ画像とN*N(、 N<M)を。選択したサブ画像は、他のサブ画像と重複しています。トレーニングプロセスのバッチごとに、特定の画像または複数の画像のすべてのサブ画像を含めることができます。 私の理解は正しいですか?それでは、パッチごとのトレーニングと完全なたたみ込みトレーニングの違いは何ですか?関連セクションを参照として含めます。

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.