タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

2
交差検証の前に、教師なしの機能選択を実行することは実際に問題ありませんか?
で統計的学習の要素、私は、次のステートメントを見つけました: 資格が1つあります。サンプルが除外される前に、教師なしの最初のスクリーニング手順を実行できます。たとえば、交差検証を開始する前に、50のサンプルすべてで最も分散が高い1000の予測子を選択できます。このフィルタリングはクラスラベルを含まないため、予測子に不当な利点を与えません。 これは実際に有効ですか?つまり、事前に属性をフィルタリングすることで、トレーニングデータや新しいデータ環境を模倣していません。つまり、実行しているフィルタリングが監視されていないということですか。相互検証プロセス内で実際にすべての前処理ステップを実行する方が良いのではないですか?そうでない場合は、機能の正規化/ PCAなど、すべての教師なし前処理を事前に実行できることを意味します。ただし、トレーニングセット全体でこれを行うことにより、実際に一部のデータをトレーニングセットにリークしています。比較的安定したデータセットを使用すると、これらの違いは非常に小さい可能性が高いことに同意できます。これについて考える正しい方法は何ですか?

2
私たちは常にCVをするべきですか?
私の質問:比較的大きなデータセットでもCVを実行する必要がありますか? 比較的大きなデータセットを持っているので、そのデータセットに機械学習アルゴリズムを適用します。 私のPCは高速ではないため、CV(およびグリッド検索)に時間がかかりすぎることがあります。特に、SVMは多くのチューニングパラメータのために終了することはありません。したがって、CVを実行する場合、比較的小さなデータを選択する必要があります。 一方、検証セットも大きくなければならないので、トレーニングセットと同じ(またはより大きい)サイズの検証セットを使用することをお勧めします。(つまり、CVの代わりに、パラメーター調整に大規模な検証セットを使用します。) ですから、少なくとも2つの選択肢があります。 小さなデータセットでCVを実行します。 CVなしで比較的大きなトレーニングセットと検証セットを使用します。 他のアイデア。 最高のアイデアは何ですか?理論的または実際的な意見はどちらも歓迎します。

1
HastieのESL Bookからこの問題について5歳のように誰かが説明できますか?
私はHastieのESLブックに取り組んでいますが、質問2.3で苦労しています。質問は次のとおりです。 原点での最近傍推定を検討しています。原点から最も近いデータポイントまでの距離の中央値は、この方程式で与えられます。これを導き出そうとする場合、どこから始めればよいのかわかりません。 ほとんどのデータポイントが他のデータポイント(次元の呪い)よりもサンプル空間の境界に近いことを知っていますが、これを線形代数/確率の意味に変換するのに問題があります。 ありがとう!

6
確率論、測度論、そして最後に機械学習について学びたいです。どこから始めますか?[閉まっている]
休業。この質問には、より焦点を当てる必要があります。現在、回答を受け付けていません。 この質問を改善してみませんか?質問を更新して、この投稿を編集するだけで1つの問題に焦点を当てます。 3年前休業。 確率論、測度論、そして最後に機械学習について学びたいです。私の最終的な目標は、ソフトウェアで機械学習を使用することです。 私は大学で微積分と非常に基本的な確率を勉強しましたが、それだけです。これらの科目について学ぶために使用できるオンラインコースや書籍を知っていますか。私はウェブ上で多くのリソースを見つけましたが、それらはすべて専門家の読者を対象にしているようです。時間がかかることはわかっていますが、最初から学びたい場合はどこから始めればよいですか。

1
線形基本学習器はブースティングでどのように機能しますか?そして、それはxgboostライブラリでどのように機能しますか?
XGBoostで線形目的関数と線形ブーストを実装する方法を知っています。私の具体的な質問は、アルゴリズムが残差(または負の勾配)に適合する場合、各ステップで1つの特徴(つまり、単変量モデル)またはすべての特徴(多変量モデル)を使用することですか? XGBoostのリニアブーストに関するドキュメントへの参照はすべて高く評価されます。 編集: 'booster'パラメーターを 'gblinear'に設定することにより、XGBoostで線形ブーストを実装できます。リニアブースティングに関する有用な情報については、http://www.ncbi.nlm.nih.gov/pmc/articles/PMC3885826/を参照してください。私は目的関数(線形であることもあります)についてではなく、それら自体のブーストについて話していることに注意してください。 ありがとう!

1
アクションごとに1つの出力ユニットがある場合、ニューラルネットワークでのQ学習はどの程度効率的ですか?
背景: 強化学習タスクでニューラルネットワークのQ値の近似を使用しています。アプローチは、この質問で説明したものとまったく同じですが、質問自体が異なります。 このアプローチでは、出力の数は、実行できるアクションの数です。簡単な言葉で言えば、アルゴリズムは次のとおりです。アクションAを実行し、報酬を調べ、NNにすべての可能なアクションのQ値を予測し、最大Q値を選択し、特定のアクションAのQをとして計算しR + max(new_state_Q)ます。予測されたQ値にモデルを近似し、そのうちの1つだけをに置き換えR + max(new_state_Q)ます。 質問:出力数が多い場合、このアプローチはどの程度効率的ですか? 試行:実行できるアクションが10あるとします。各ステップで、モデルに10個の値を予測するように依頼します。モデルの初期の年齢では、この予測は完全に混乱しています。次に、出力の1つの値を変更し、これらの値にモデルを適合させます。 私はこのアプローチがどのように良い/悪いかについて反対の考えを2つ持っており、どちらが正しいかを判断できません。 1つの観点から、ランダムデータで各ニューロンを9回トレーニングし、実際の値に近いデータで1回だけトレーニングします。NNが状態SのアクションAに対して5を予測したが、実際の値が-100の場合、NNを値5で9回、次に値-100で1回当てはめます。クレイジーですね。 他の観点から見ると、ニューラルネットワークの学習はエラーの逆伝播として実装されているため、モデルが5を予測して5でトレーニングしている場合、エラーは0であるため、新しい学習は行われません。重みは影響を受けません。そして、-100を計算してモデルに適合させる場合にのみ、重みの再計算を行います。 どのオプションが正しいですか?多分私が考慮していない他の何かがありますか? 更新: 「どれほど効率的」とは、1つの出力-予測報酬を伴うアプローチと比較することを意味します。もちろん、この場合、アクションは入力の一部になります。したがって、アプローチ#1はある状態に基づいてすべてのアクションの予測を行い、アプローチ#2はある状態で行われた特定のアクションの予測を行います。

4
勾配降下法が必要なのはなぜですか?
すべてのパラメーターについて偏微分によって得られた方程式を解くことによってコスト関数を微分し、パラメーターを見つけ、コスト関数が最小になる場所を見つけることができる場合。また、導関数がゼロである複数の場所を見つけることは可能であると思います。これにより、そのようなすべての場所をチェックして、グローバルな最小値を見つけることができます。 代わりに勾配降下法が実行されるのはなぜですか?

1
ディープラーニング用のデータ量はどれくらいですか?
ディープラーニング(特にCNN)について学習しています。これは、過剰適合を防ぐために通常は非常に多くのデータを必要とする方法です。ただし、モデルの容量やパラメータが多いほど、過剰適合を防ぐために必要なデータが増えることも知らされています。したがって、私の質問は次のとおりです。ディープニューラルネットワークのレイヤーあたりのレイヤー/ノードの数を減らし、より少ないデータ量で機能させることができないのはなぜですか?ニューラルネットワークが「キックイン」するまでに必要な基本的な「最小数のパラメータ」はありますか?特定の数のレイヤーの下では、ニューラルネットワークは、手作業でコーディングした機能ほど機能しないようです。

2
ニューラルネットワークの信頼度の予測
分類または回帰を実行するためにディープニューラルネットワークをトレーニングしたいとしますが、予測の信頼度を知りたいと考えています。どうすればこれを達成できますか? 私の考えは、上のニューラルメーターでの予測パフォーマンスに基づいて、すべてのトレーニングデータのクロスエントロピーを計算することです。次に、2つ目のニューラルネットワークを回帰用にトレーニングします。これは、各データを入力として受け取り、クロスエントロピーを出力(1つの出力ノード)として扱います。次に、実際には両方のネットワークを使用します。1つはラベル/値の予測用で、もう1つは最初のネットワークの信頼度の予測用です。(....しかし、2番目のネットワークの信頼度を予測するために3番目のネットワークが必要になる、など...?!) これは有効なアイデアですか?また、一般的に使用されている標準的なアイデアですか?そうでない場合、何を提案しますか?

1
ReLUニューロンの入力正規化
LeCun et al(1998)による「Efficient Backprop」によれば、すべての入力が0を中心とし、最大2次導関数の範囲内になるように正規化することをお勧めします。たとえば、「Tanh」関数には[-0.5,0.5]を使用します。これは、ヘッセ行列がより安定したときの逆伝播の進行を助けるためです。 しかし、max(0、x)である整流器ニューロンをどうするかわかりませんでした。(それ以降、ロジスティック関数でも[0.1,0.9]のようなものが必要になりますが、0を中心としていません)

2
ディープラーニングを実際に適用する際のボトルネック
たくさんのディープラーニングペーパーを読んだ後、ネットワークをトレーニングして通常よりも優れたパフォーマンスを得るには多くのトリックが存在するという一種の大まかな感じがあります。業界のアプリケーションの観点からすると、この種のトリックを開発することは、グーグルやフェイスブックなどの大手テクノロジー企業のエリート研究グループを除いて、非常に困難です。次に、ディープラーニングアルゴリズムを実際に適用するための最良の方法は何ですか。ご意見やご提案をいただければ幸いです。

1
コンターは、関数興味深い特徴を回帰によって得ていますか?
私は回帰の一般的なセットアップを想定しています。つまり、連続関数は、ファミリーから選択され、与えられたデータに適合します。(は立方体ような任意の空間、または実際には適切なトポロジー空間です)いくつかの自然な基準に従います。hθ:X→Rnhθ:X→Rnh_\theta:X\to \mathbb R^n{hθ}θ{hθ}θ\{h_\theta\}_\theta(xi,yi)∈X×Rn,i=1,…,k(xi,yi)∈X×Rn,i=1,…,k(x_i,y_i)\in X\times \mathbb R^n, i=1,\ldots, kXXX[0,1]m[0,1]m[0,1]^m 一つは輪郭に興味があり、回帰のアプリケーションが存在するの一部ポイントのため例えばゼロセット-?h−1(y)h−1(y)h^{-1}(y)hhhy∈Rny∈Rny\in \mathbb R^nh−1(0)h−1(0)h^{-1}(0) 私の興味の説明は以下の通りです:多くの状況で学んだに添付不確実性があるため(不正確またはデータの欠如)が、一つはゼロセットを分析することができます "しっかり」。つまり、すべての「摂動」に共通するゼロセットの特徴を調べます。最近、非常に一般的な設定において、摂動がノルムのに近い任意の連続写像になる可能性があることで、非常によく理解されています。または、基本的に同等に、は任意の連続であり、すべてのに対してが存在します。hθhθh_\thetah−1(0)h−1(0)h^{-1}(0)hhhfffhhhℓ∞ℓ∞\ell_\inftyfffx∈Xx∈Xx\in X|f(x)−h(x)|≤c(x)|f(x)−h(x)|≤c(x)|f(x)-h(x)|\le c(x)c:X→Rc:X→Rc:X\to\mathbb Rはごとに信頼値を提供します。xxx 理論とアルゴリズムを開発する主な動機は、背後にあるエキサイティングな数学です(本質的にすべての問題/質問がホモトピー理論に還元されます)。ただし、現在の段階では、アルゴリズムをさらに開発して実装するために、より具体的な設定と目標を選択する必要があります。


1
このオートエンコーダーネットワークを正しく機能させることができません(畳み込みレイヤーとmaxpoolレイヤーを使用)
オートエンコーダネットワークは、通常の分類子MLPネットワークよりも扱いにくいようです。ラザニアを数回使用した後、再構成された出力で得られるすべてのものが、入力桁が実際に何であるかを区別せずに、MNISTデータベースのすべての画像のぼやけた平均化に最もよく似ているものです。 私が選択したネットワーク構造は、次のカスケードレイヤーです。 入力レイヤー(28x28) 2Dたたみ込み層、フィルターサイズ7x7 最大プーリングレイヤー、サイズ3x3、ストライド2x2 高密度(完全に接続された)平坦化層、10ユニット(これがボトルネックです) 高密度(完全接続)レイヤー、121ユニット レイヤーを11x11に変形 2Dたたみ込み層、フィルターサイズ3x3 2Dアップスケーリングレイヤーファクター2 2Dたたみ込み層、フィルターサイズ3x3 2Dアップスケーリングレイヤーファクター2 2Dたたみ込み層、フィルターサイズ5x5 機能の最大プーリング(31x28x28から28x28へ) すべての2Dたたみ込み層には、バイアスが解除された、シグモイドアクティベーションと31のフィルターがあります。 完全に接続されたすべての層には、シグモイドアクティベーションがあります。 使用される損失関数は二乗誤差であり、更新関数はadagradです。学習用のチャンクの長さは100サンプルで、1000エポックに乗算されます。 以下は問題の説明です:上の行はネットワークの入力として設定されたいくつかのサンプルで、下の行は再構成です: 完全を期すために、私が使用したコードは次のとおりです。 import theano.tensor as T import theano import sys sys.path.insert(0,'./Lasagne') # local checkout of Lasagne import lasagne from theano import pp from theano import function import gzip import numpy as np from …

2
SVMを使用する場合、なぜ機能を拡張する必要があるのですか?
scikit-learn のStandardScalerオブジェクトのドキュメントによると: たとえば、学習アルゴリズムの目的関数で使用される多くの要素(サポートベクターマシンのRBFカーネル、線形モデルのL1およびL2正則化器など)は、すべての特徴が0を中心とし、同じ順序で分散があると仮定します。ある特徴の分散が他のものよりも桁違いに大きい場合、それは目的関数を支配し、推定量が期待どおりに他の特徴から正しく学習できなくなる可能性があります。 分類する前に機能をスケーリングする必要があります。なぜこれを行うべきなのかを示す簡単な方法はありますか?科学論文への参照はさらに良いでしょう。私はすでに見つかったものを他の多くのは、おそらくあります。

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.