タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

1
隆起回帰のL2正規化は切片を罰しますか?そうでない場合、その派生物をどのように解決しますか?
MLは初めてです。リッジ回帰のL2正規化は切片罰しないことが通知されました。コスト関数と同様: L2正規はからまでの合計のみで、からまでの合計ではありません。私もそれを読みました:θ0θ0\theta_{0}∇θJ(θ)=12∑i=1m(hθ⃗ (x(i))−y(i))2+λ∑j=1nθ2j∇θJ(θ)=12∑i=1m(hθ→(x(i))−y(i))2+λ∑j=1nθj2 \nabla_{\theta}J(\theta)=\frac{1}{2}\sum_{i=1}^{m}(h_{\vec \theta}(x^{(i)})-y^{(i)})^2+\lambda\sum_{j=1}^{n}{\theta_{j}^{2}} λ∑nj=1θ2jλ∑j=1nθj2\lambda\sum_{j=1}^{n}{\theta_{j}^{2}}j=1j=1j=1nnnj=0j=0j=0nnn ほとんどの場合(すべての場合?)、正則化しないほうがよいです。オーバーフィットを減らし、表現可能な関数のスペースを縮小する可能性が低いためです。θ0θ0\theta_{0} これは、user48956の最後の回答から来ています。 ため、コスト関数の導関数を解く方法について混乱しています。 ここで、および。∇θJ(θ)=12(Xθ−Y)T(Xθ−Y)+λ(θ′)Tθ′,∇θJ(θ)=12(Xθ−Y)T(Xθ−Y)+λ(θ′)Tθ′, \nabla_{\theta}J(\theta)=\frac{1}{2}(X\theta-Y)^{T}(X\theta-Y)+\lambda(\theta^{'})^{T}\theta^{'}, θ= [ θ 0 θ 1。。。θ N ] X= [ 1θ′=⎡⎣⎢⎢⎢θ1θ2...θn⎤⎦⎥⎥⎥θ′=[θ1θ2...θn]\theta^{'}=\left[ \begin{matrix} \theta_{1} \\ \theta_{2} \\ ...\\ \theta_{n} \end{matrix} \right]θ=⎡⎣⎢⎢⎢θ0θ1...θn⎤⎦⎥⎥⎥θ=[θ0θ1...θn]\theta=\left[ \begin{matrix} \theta_{0} \\ \theta_{1} \\ ...\\ \theta_{n} \end{matrix} \right]X=⎡⎣⎢⎢⎢⎢⎢11...1X(1)1X(2)1X(m)1X(1)2X(2)2X(m)2.........X(1)nX(2)nX(m)n⎤⎦⎥⎥⎥⎥⎥X=[1X1(1)X2(1)...Xn(1)1X1(2)X2(2)...Xn(2)...1X1(m)X2(m)...Xn(m)]X=\left[ \begin{matrix} 1 & X_{1}^{(1)} & X_{2}^{(1)} & ...& X_{n}^{(1)} \\ …

2
個々の予測に対する機能の重要性/影響
モデルレベルでは、予測子の貢献度/重要度を評価するために、次を使用できます。 モデル固有の手法–たとえば、ツリーベースモデルの純度(ジニインデックス)、該当する場合はモデル係数など。 モデルに依存しない手法–順列特徴の重要性、部分的な依存性など。 これが伝えていないのは、特定の予測(たとえば、クラス1のメンバーシップの92%の確率を提供するバイナリ分類)について、その予測の作成に最も影響力のあった予測子です。 この問題について少し考えたところ、いくつかのアプローチが取れるように思えます。 モデル固有の手法–たとえば、適用可能な線形モデルの係数、XGBoostについてここで説明されているような手法(https://medium.com/applied-data-science/new-r-package-the-xgboost-explainer-51dd7d1aa211) モデルに依存しない手法–たとえば、予測子を摂動してモデル化したときに予測がどのように変化するかを理解するための部分依存と同様の「摂動法」、またはこのホワイトペーパー(https://arxiv.org/)で説明されているLIMEのような手法pdf / 1602.04938.pdfおよびhttps://github.com/marcotcr/lime)、変更された順列重要度手法? 私にとって最も価値のあるアプローチは、多くのアルゴリズムのいくぶん「ブラックボックス」の性質を考慮してモデルに依存しない手法であり、新規で新しいアルゴリズムと手法を解釈する能力を提供することです。 ここ(http://amunategui.github.io/actionable-instights/index.html)で説明されている単純な方法の1つは、各予測子を取得し、「母集団」の平均を代入することによってその影響を「中和」し、予測を再度実行することです。元の予測と中立化されたバージョンとの違いを取得して、重要度を測定します。これは、上でほのめかされた一種の「摂動」法の特別な場合のようです。これに見られるいくつかの欠点は、1)各機能の「平均」(または同等のもの)を含む予測がおそらく「中間」予測であることを意味するように思われ、2)「手段」である機能」(または同等のもの)は、必ずしも影響を与えませんか? より一般的には、どの手法でも次のことを説明する必要があります。 さまざまなデータ型(数値、カテゴリなど)を処理する方法 欠損データを処理する方法 おそらく条件付きの重要性をどのように処理するか(つまり、予測子はペアでのみ重要になる場合があるなど) 計算効率(が予測子の数である場合に予測を回実行すること、またはが予測子あたりの予測数である摂動法場合などは実際に現実的です)ppppppk pkpkpkkk 問題についての緩やかでおそらく誤った考えが示されているので、人々が認識し、検討し、使用し、助言するなどの問題へのアプローチはどのようなものでしょうか。

1
シミュレーテッドアニーリングと複数の貪欲の違い
シミュレーテッドアニーリングと複数の貪欲な山登りアルゴリズムの実行の違いを理解しようとしています。 私の理解では、貪欲アルゴリズムはスコアを極大値にプッシュしますが、複数のランダム構成から始めて、それらすべてに貪欲を適用すると、複数の極大値になります。次に、それらの最大値を選択します。 これはシミュレーテッドアニーリングと同じように再現されますか?

1
回帰問題におけるピアソンの相関の代理としてのMSE
TL; DR(長すぎて読まなかった): 私は時系列予測問題に取り組んでいます。これは、ディープラーニング(ケラ)を使用して回帰問題として定式化します。私の予測と真のラベル間のピアソン相関を最適化したいと思います。MSEをプロキシとして使用すると、実際にはピアソンを損失関数として直接使用するよりも(相関の観点から)より良い結果が得られるという事実に戸惑っています。ディープラーニングの損失関数として相関メトリックを使用することは悪い習慣と考えられていますか?もしそうなら、なぜですか? 長いバージョン: 私には時系列予測タスクがあります連続するタイムステップの値を観察し、タイムステップ値を予測する必要があります。通常、値はであるため、これを回帰問題として扱い、ディープラーニング(keras)を使用して解決しています。T + 1 [ - 200 、200 ]TTTT+ 1T+1T+1[ - 200 、200 ][−200,200][-200,200] 私の質問は、損失と測定基準の選択に関するものです。 私のデータの真のラベルは、主に前後にあり、いくつかの極端な値があります。極端な値の多くは誤りであり、それらを正しくすることに集中するように学習をシフトしたくありません。言い換えれば、一般的な傾向を把握できるようになり(正の値と負の値の期間を正しく分類)、たとえば、200ではなく100を予測して「共存」できます。[ - 10 、10 ][−10,10][-10,10] このため、私の評価指標は、予測値と真の値の間のピアソン相関であるべきだと思います。 さて、損失関数について:理想的には、高いピアソン相関を最適化したい場合、それを損失関数として使用することは理にかなっているでしょう?私は「ベースラインモデル」であるシンプルなアーキテクチャを2回テストしました。1回はピアソン(ミニバッチで計算)を直接損失関数として使用し、もう1回は一般的なMSEをプロキシとして使用しました。どちらの場合も、MSEとピアソンの両方を異なるエポックについて追跡し、検証セットに基づいて「早期停止」を行います。 私の結果: 損失としてのMSE:MSE 160、ピアソン0.7 損失としてのピアソン:MSE 250、ピアソン0.6 ピアソン損失のより高いMSEは、相関の最適化にはスケールがないという事実の結果であると理解しています。そのため、すべての予測は、MSEを増加させる方法で要因によって「オフ」になる可能性があります。しかし、MSEをプロキシとして使用すると、ピアソン相関自体の点で実際にどのように改善されるのでしょうか。ピアソン相関を損失関数として使用してはならない理由について、最適化に関連する理由はありますか?実際、ほとんど使われていないようですが、その理由を知りたいと思います。

1
ベイジアンハイパーパラメーター最適化の不利な点は何ですか?
私は機械学習と統計にかなり慣れていませんが、アルゴリズムのハイパーパラメーターを最適化するために機械学習を学習するときに、ベイジアン最適化がオンラインで頻繁に参照されないのはなぜですか?たとえば、次のようなフレームワークを使用します。https://github.com/fmfn/BayesianOptimization ハイパーパラメーターのベイズ最適化には、グリッド検索やランダム検索などの手法に比べて、制限や大きな欠点がありますか?

1
グループエラスティックネット
なげなわとエラスティックネットは3つ以上のカテゴリを持つ変数を処理できないため、これらの方法を適用するには、カテゴリ変数をダミーに分割する必要があります。これにより、いくつかの問題が発生する可能性があるため、グループlassoまたはスパースグループlassoへのlassoの拡張が存在します。 ただし、このような拡張機能がエラスティックネットにも存在するかどうか疑問に思っています。残念ながら、このトピックに関する統計資料は見つかりませんでした。 質問:グループエラスティックネットは存在しますか?

4
SVMで線形分離可能性が望ましいのはなぜですか?
上の画像を参照してください。明らかに、円は2つのクラスを分けることができます(左の画像)。なぜそれを関数にマップして線形分離可能にするためにそれほど苦労するのですか(右の画像)? 誰か説明していただけますか?私は本当にウェブやYouTubeで講義を見つけることができませんでした

1
sqrt(6)を使用してニューラルネットワークのランダムな初期化のイプシロンを計算するのはなぜですか?
で週5講義ノートのためのアンドリュー・ウのコーセラ機械学習クラス、以下の式が値算出に与えられた初期化するために使用さΘをランダムな値で:εε\epsilonΘΘ\Theta では、運動、さらに明確化が与えられます。 を選択するための1つの効果的な戦略 は、ネットワーク内のユニット数に基づいて決定することです。ϵ i n i tの適切な選択 はϵ i n i t = √εI N I Tε私ん私t\epsilon_{init}εI N I Tε私ん私t\epsilon_{init}、ここでLin=slおよびLout=sl+1は、Θ(l)に隣接する層のユニット数です。εI N I T= 6√LI N− LO U T√ε私ん私t=6L私ん−Loあなたt\epsilon_{init} = \frac{\sqrt{6}}{\sqrt{L_{in} - L_{out}}}LI N= slL私ん=slL_{in} = s_lLO U T=sl + 1Loあなたt=sl+1L_{out} = s_{l+1}Θ( l )Θ(l)\Theta^{(l)} なぜ定数ですかここで 6個使用?なんで √6–√6\sqrt 6、 √5–√5\sqrt …

2
最大プーリングと平均プーリングで抽出された機能
ディープラーニングで、それをコンピュータービジョンに適用すると、これらの2種類のプーリング抽出の機能の種類を知ることができますか?たとえば、最大プールがエッジを抽出すると言うことは可能ですか?平均プーリングに関して同様のことが言えますか? PSは、stackoverflowの方が適している場合は、お気軽にお勧めします。

1
L1、L2およびドロップアウト一般化の代替
私の大学では、金融/機械学習の研究プロジェクトに次の設定を行っています。Keras/ Theanoで次の構造の(ディープ)ニューラルネットワーク(MLP)を適用して、パフォーマンスの高い株(ラベル1)とパフォーマンスの低い株(ラベル0)。そもそも私は、実際および歴史的な評価の倍数を使用します。これはストックデータであるため、非常にノイズの多いデータが予想されます。さらに、52%を超える安定したサンプル外精度は、すでにこのドメインで良好であると見なすことができます。 ネットワークの構造: 入力として30のフィーチャを備えた高密度レイヤー Relu-Activation バッチ正規化レイヤー(それがなければ、ネットワークは部分的に収束していません) オプションのドロップアウトレイヤー 密 レル バッチ 脱落 ・・・同じ構造の更なる層 シグモイドアクティベーションの高密度レイヤー オプティマイザ:RMSprop 損失関数:バイナリクロスエントロピー 前処理のために私が行う唯一のことは、機能を[0,1]範囲に再スケーリングすることです。 今、私は通常、ドロップアウトまたはL1およびL2カーネル正則化に取り組む、典型的な過剰適合/過適合問題に直面しています。ただし、この場合、次のグラフに示すように、ドロップアウトとL1およびL2の正規化の両方がパフォーマンスに悪影響を及ぼします。 私の基本的なセットアップは次のとおりです。5レイヤーNN(入力レイヤーと出力レイヤーを含む)、レイヤーあたり60ニューロン、0.02の学習率、L1 / L2なし、ドロップアウトなし、100エポック、バッチ正規化、バッチサイズ1000。 76000の入力サンプル(ほぼバランスの取れたクラス45%/ 55%)で、ほぼ同じ量のテストサンプルに適用されました。チャートでは、一度に1つのパラメーターのみを変更しました。「Perf-Diff」とは、1に分類された株式と0に分類された株式の平均株価パフォーマンス差を意味します。これは、基本的に、最終的なコアメトリックです。(高いほど良い) l1の場合、ネットワークは基本的にすべてのサンプルを1つのクラスに分類しています。ネットワークが再びこれを実行しているためスパイクが発生していますが、25個のサンプルをランダムに正しく分類しています。したがって、このスパイクは良い結果ではなく、異常値として解釈されるべきです。 他のパラメータには次の影響があります。 私の結果をどのように改善できるかについてのアイデアはありますか?私がしている明らかなエラーはありますか、それとも正則化の結果に対する簡単な答えはありますか?トレーニング(PCAなど)の前に、何らかの機能選択を行うことをお勧めしますか? 編集:その他のパラメータ:

2
ブースティング手法では、他のアンサンブル方法と同様に投票を使用しますか?
投票を使用して、すべてのアンサンブルメソッドを一般化できますか?ブースティングメソッドも投票を使用して、弱学習者を最終モデルに入れますか? テクニックについての私の理解: ブースティング:正しく分類されなかったデータポイントをブーストするために、弱学習器を継続的に追加します。 アンサンブル手法:複数の学習者を使用して、1人の学習者よりも優れた予測を取得します。これはウィキペディアで説明されています。

2
深層学習に対するベイズのノンパラメトリックな答えは?
私が理解しているように、ディープニューラルネットワークは、機能を重ねることによって「表現学習」を実行しています。これにより、フィーチャの非常に高次元の構造を学習できます。もちろん、これはパラメーターの数が固定されたパラメトリックモデルであるため、モデルの複雑さを調整するのが難しいという通常の制限があります。 モデルの複雑さがデータに適応できるように、特徴空間でそのような構造を学習するベイジアン(ノンパラメトリック)な方法はありますか?関連モデルは次のとおりです。 ディリクレは混合モデルを処理します。これにより、スペースを無制限のクラスターに分割し、データが有限数を選択できるようにします。 データを説明する潜在的な特徴(別名トピック)の潜在的に無限の数を見つけるインディアンビュッフェプロセス(IBP)のような要因モデル。 しかし、IBPは深い表現を学習していないようです。これらの方法は教師なし学習用に設計されており、通常、教師付きタスクにはディープラーニングを使用するという問題もあります。データの要求に応じて表現を拡大できるIBPまたは他のメソッドのバリアントはありますか?

1
ガウス過程の共分散
ガウシアンプロセスで共分散を計算するための式について少し混乱しています(分散が追加されていると、常に明示的に示されるとは限らないため、常に混乱します)。混乱の起源は、式はで与えられているということである司教によってパターン認識と機械学習とラスムッセンによる機械学習のためのガウス過程異なっています。 GPの平均は次の関係で与えられます: μ = K(X∗、X)[ K(X、X)+ σ2私]− 1yμ=K(X∗,X)[K(X,X)+σ2I]−1y\mu = K(X_*, X)[K(X,X)+\sigma^2\mathrm{I}]^{-1}y Bishopによる分散(ページ番号:308)は次のとおりです: Σ = [ K(X∗、X∗)+ σ2] − K(X∗、X)[ K(X、X)+ σ2私]− 1K(X、X∗)Σ=[K(X∗,X∗)+σ2]−K(X∗,X)[K(X,X)+σ2I]−1K(X,X∗)\Sigma = [K(X_*, X_*)+\sigma^2] - K(X_*, X)[K(X,X)+\sigma^2\mathrm{I}]^{-1}K(X, X_*) Rasmussenによる分散(ページ番号:16)は次のとおりです: Σ = K(X∗、X∗)− K(X∗、X)[ K(X、X)+ σ2私]− 1K(X、X∗)Σ=K(X∗,X∗)−K(X∗,X)[K(X,X)+σ2I]−1K(X,X∗)\Sigma = K(X_*, X_*) - K(X_*, X)[K(X,X)+\sigma^2\mathrm{I}]^{-1}K(X, X_*) 私の疑問は、共分散行列 RHSの最初の項に分散があるかどうかです。または私は物事を台無しにしていますか?ΣΣ\Sigma さらに情報が必要な場合はお知らせください。

4
オブジェクト検出の平均精度
APやmAPの値をどのように計算できるかについてはかなり混乱しています。特に、オブジェクト検出のためにAP / mAP値を取得したいと考えています。 私が確実に知っているのは、 リコール= TP /(TP + FN)、精度= TP /(TP + FP) たとえば、評価するクラスが1つだけで、500のテスト画像があるとします。各テスト画像には異なる数の予測(境界ボックス提案)が含まれる場合がありますが、各画像には1つのグラウンドトゥルース境界ボックスしかありません。 画像1:[クラス、確率、x1、y1、x2、y2]、[クラス、確率、x3、y3、x4、y4]、[クラス、確率、x5、y5、x6、y6]、[クラス、確率、 x7、y7、x8、y8]、... 画像2:[クラス、確率、x1、y1、x2、y2]、[クラス、確率、x3、y3、x4、y4]、... 。。。(等々) *ほんの一例で、私はこれを作りました TPを取得するには、各予測のIOUを見つけて、選択したしきい値(0.5など)を超えるものをカウントする必要があることを知っています(しきい値を超えるIOUを持つ複数の予測がある場合、1回だけカウントして他を処理しますか? FPとして?) これは私を困惑させるところです: TP + FP =各画像に対して行われた予測の数でしょうか? すべてのテスト画像にネガがないため、TP + FN = 500? 画像ごと、またはクラスごとに計算されますか? 私の例に基づいてAP / mAPを取得するためのステップバイステップガイドを誰かに教えてもらえますか?最も曖昧な部分は、画像ごとに行うのか、クラスごとに行うのか(つまり、一度に500枚の画像を処理する場合)です。 私が見つけたほとんどのガイド/論文は、情報検索を対象としています。これでいくつかの助けをいただければ幸いです。 *注:一部のカスタムデータセットでテストしています。PASCAL VOCにはそれを行うためのコードがいくつかあることは知っていますが、自分のデータに合わせてカスタマイズしたコードを自分で記述したいと思っています。

1
ネストされた相互検証後に最適なハイパーパラメーターを取得するにはどうすればよいですか?
一般的に、大きなデータセットがある場合は、(1)トレーニング、(2)検証、(3)テストに分割できます。検証を使用して相互検証(SVMのCなど)で最適なハイパーパラメーターを特定し、トレーニングセットで最適なハイパーパラメーターを使用してモデルをトレーニングし、トレーニングされたモデルをテストに適用してパフォーマンスを取得します。 データセットが小さい場合、トレーニングとテストセットを作成できません(サンプルが不十分)。したがって、モデルのパフォーマンスを評価するために、交差検証(k-fold、leave-one-outなど)を行います。 ネストされた交差検証(繰り返しまたは層別)が小さなデータセットの設定で使用されていることを確認しました。つまり、パラメーター選択を最適化しながら一般化モデルのパフォーマンスを生成します。私の質問は、ネストされた交差検証で最高のハイパーパラメーターを取得するにはどうすればよいですか(繰り返される/繰り返されない)? 可能であれば、scikit-learnでこれを行うことに興味があります。私はそれを行う方法について少し混乱しています。 私はいくつかのリソースを読みましたが、この質問に対する明確な答えはありませんでした。 モデル選択のためのネストされた相互検証 入れ子の交差検証と機能選択:機能選択を実行するタイミング?

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.