タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

1
SVMコスト関数:新旧の定義
ソフトマージンSVMコスト/損失関数のさまざまな定義を主形式で調整しようとしています。理解できない「max()」演算子があります。 SVMについては、Tan、Steinbach、およびKumarによる2006年の学部レベルの教科書「Introduction to Data Mining」で2006年に学びました。第5章のp。267-268。max()演算子については言及されていないことに注意してください。 これは、最適化問題の制約に正の値のスラック変数()を導入することで実行できます。...修正された目的関数は次の方程式で与えられます。ξξ\xi f(w)=∥w∥22+C(∑Ni=1ξ)kf(w)=‖w‖22+C(∑i=1Nξ)k f(\mathbf{w}) = \frac{\left \| \mathbf{w} \right \|^2}{2} + C(\sum_{i=1}^{N} \xi)^k ここで、CCCとkkkはユーザー指定のパラメーターであり、トレーニングインスタンスの誤分類のペナルティを表します。このセクションの残りの部分では、問題を簡単にするためにkkk = 1 と仮定します。パラメータCCCは、検証セットでのモデルのパフォーマンスに基づいて選択できます。 したがって、この制約付き最適化問題のラグランジアンは次のように書くことができます。 Lp=∥w∥22+C(∑Ni=1ξ)k−∑Ni=1λi(yi(w⋅xi+b)−1+ξi)−∑Ni=1μiξiLp=‖w‖22+C(∑i=1Nξ)k−∑i=1Nλi(yi(w⋅xi+b)−1+ξi)−∑i=1Nμiξi L_{p} = \frac{\left \| \mathbf{w} \right \|^2}{2} + C(\sum_{i=1}^{N} \xi)^k - \sum_{i=1}^{N} \lambda_i (y_i (\mathbf{w} \cdot \mathbf{x_i} + b) - 1 + \xi_i) - \sum_{i=1}^{N} \mu_i \xi_i …

2
機械学習では、クラス比率のバランスをとるか、母集団を代表するほうが良いですか?
機械学習のコンテキストで、実際の母集団のクラスのバランスが取れていないという問題があるとします。たとえば、クラスAは80%の確率で発生し、クラスBは20%の確率で発生します。 そのような場合、一般的に、特定のMLアルゴリズムが同じ80/20クラス比率のデータ、またはバランスのとれた(50/50)比率のデータに依存する方が良いですか?a)トレーニングデータに関してb)テストデータに関して フォローアップの質問:(a)または(b)の答えが偶然50/50の比率で起こっている場合、この設定は一般に、アクセスするデータが存在する実際のコンテキストでも永続しますか? 80/20比の?言い換えれば、トレーニングやテストにバランスのとれた比率を使用することの利点は、その比率を適用するコストを上回りますか(たとえば、多数派クラスからインスタンスを破棄するか、少数派クラスの新しい合成サンプルを生成することによって)?

1
xgboostの加法性バイアス(およびその修正?)
私は今コンテストに参加しています。私はそれをうまくやるのが私の仕事だと知っていますが、私の問題とその解決策について、他の人にとっても助けになるかもしれないので、誰かがここで私の問題とその解決策について話したいと思うかもしれません。 私はxgboostモデル(ツリーベースのモデルと線形モデルとその2つのアンサンブル)をトレーニングしました。既にここで説明したように、トレーニングセット(交差検証を行った場合)の平均絶対誤差(MAE)は小さく(約0.3)、保持されたテストセットでは誤差は約2.4でした。その後、競争が始まり、エラーは約8(!)でした。驚くべきことに、 予測は常に真の値よりも約8〜9高くなりました!! 画像の黄色で囲まれた領域を参照してください。 トレーニングデータの期間は2015年10月に終了し、コンテストは今すぐ始まりました(16年4月、テスト期間は3月に約2週間)。 今日、私は自分の予測から定数値9を差し引いただけで、エラーは2になり、リードボードで3を獲得しました(この1日分)。;)これは黄色の線の右側の部分です。 だから私が議論したいこと: xgboostは、切片項をモデル方程式に追加することに対してどのように反応しますか?システムの変更が多すぎる場合、これによりバイアスが発生する可能性がありますか(私の場合、10月15日から4月16日のように)。 インターセプトなしのxgboostモデルは、ターゲット値の平行シフトに対してより堅牢になるでしょうか? 私は9のバイアスを差し引いていきます。誰か興味があれば、結果を表示できます。ここでより多くの洞察を得ることはちょうどより興味深いでしょう。

1
畳み込みニューラルネットワークの過剰適合を特定する方法
ドロップアウトを使用してネットワークへの過剰な適合を減らすことを理解しています。これは一般化手法です。 畳み込みニューラルネットワークでは、どのようにして過剰適合を特定できますか? 私が考えることができる1つの状況は、テストまたは検証の精度と比較してトレーニングの精度が高すぎる場合です。その場合、モデルはトレーニングサンプルにオーバーフィットしようとし、テストサンプルには不十分なパフォーマンスを示します。 これは、ドロップアウトを適用するか、ドロップアウトをモデルに盲目的に追加する必要があるかどうかを示す唯一の方法ですか?

1
過剰適合はどのくらいですか?
概念的に、オーバーフィットモデルと適切にフィットしたモデルの間にどこで線を引きますか? モデルがテストセットよりもトレーニングセットで数パーセント優れている場合、過適合であることは明らかです。しかし、理論的には、トレーニングセットでモデルをトレーニングし、テストセットで検証したところ、トレーニングセットの精度がテストセットよりも0.2%高いことがわかりました。これは過度に適合していませんか?

1
ナイーブベイズとリカレントニューラルネットワーク(LSTM)の違い
テキストの感情分析を実行したい、いくつかの記事を通過した、それらのいくつかは「Naive Bayes」を使用しており、その他は「Recurrent Neural Network(LSTM)」ですが、一方で、感情分析用のpythonライブラリを見ましたnltkです。それは「ナイーブベイズ」を使用しています誰もが2つの使用の違いは何であるか説明できますか? 私もこの投稿を通過しましたが、両方については明確ではありません。 ベイズネットワーク、ニューラルネットワーク、決定木、ペトリネットの違い

3
決定木を使用する目的は何ですか?
ディシジョンツリーの目的がわかりません。私の見方では、if-elseのシリーズです。ディシジョンツリーを使用する代わりに、if-elseを使用しないのはなぜですか?それは私のコードの複雑さを減らすからです? エントロピーと情報ゲインの計算は、ルールをプラグインするだけの組み込みのアルゴリズムがあるので、まだ免れていますか?(ID3と同様) なぜ今、それを機械学習で使用するのですか?必要になる前にルールを考え出す必要さえないからですか?マシンはトレーニングデータから学習し、結果に基づいて予測できる属性に基づいていますか? コードにMLを実装すると、オーバーヘッドがさらに減少し、コードの複雑さが軽減され、効率が上がり、速度が向上しますか?

3
意図的な過剰適合
意図的にモデルをオーバーフィットすることは理にかなっていますか? データがトレーニングデータに対してそれほど変わらないことがわかっているユースケースがあるとします。 私はここで交通予測について考えています。交通状況は一定のパターンのセットに従います 朝の通勤 夜の活動 等々。 これらのパターンは、自動車ユーザーの急増や道路インフラの大きな変化がない限り、あまり変わりません。この場合、将来のパターンとデータが非常に類似すると想定して、モデルが現在のデータで学習したパターンにできるだけ偏るようにしたいと思います。

2
精度を結果指標として使用する場合の例は誤った結論につながる
予測モデルのさまざまなパフォーマンス指標を調べています。モデルのパフォーマンスを評価するためのより継続的なものではなく、精度の使用に関する問題について多くが書かれました。Frank Harrell http://www.fharrell.com/post/class-damage/は、モデルに有益な変数を追加すると、精度が低下し、明らかに直観に反し、誤った結論に至る場合の例を示しています。 ただし、この場合は、クラスの不均衡が原因であると考えられるため、代わりに((sens + spec)/ 2)のバランスの取れた精度を使用するだけで解決できます。バランスのとれたデータセットで精度を使用すると、明らかに間違った、または直観に反する結論につながる例はありますか? 編集する モデルが明らかに優れている場合でも精度が低下するもの、または精度を使用すると一部の機能が誤って選択される可能性があるものを探しています。2つのモデルの精度が同じで、他の基準を使用した方が明らかに優れている偽陰性の例を作成するのは簡単です。



2
ロングホライズン予測可能性の神話
私は最近、将来の株式市場のリターンの予測についての興味深い記事に出くわしました。著者は以下のグラフを提示し、0.913のR ^ 2を引用しています。これは著者の方法を私がこれまでにこの主題で見たことよりはるかに優れたものにするでしょう(ほとんどが株式市場は予測不可能であると主張します)。 著者は彼の方法を非常に詳細に説明し、結果を裏付けるための実質的な理論を提供します。次に、このホワイトペーパーを参照する2番目の批評的な記事「ロングホライズン予測可能性の神話」を読みました。どうやら人々は何十年もの間この幻想に陥っています。残念ながら、私はその論文を本当に理解していません。 これは私に次の質問を導きます: トレーニングとモデル検証の両方に同じデータセットを使用することにより、長期予測の誤った信頼が生じますか?トレーニングと検証のデータが別々の重複しない期間から取得された場合、問題は解消されますか? トレーニングセットの検証とは別に、なぜこの問題は長い期間にわたってより顕著になるのですか? 一般的に、長期予測を行う必要があるモデルをトレーニングする場合、この問題をどのようにして克服できますか?

2
機械学習の信頼上限
k武装バンディット問題の信頼限界の上限を求める式に出くわしました。 c ln N私ん私−−−−−√clnNinic\sqrt{\frac{\text{ln} N_i}{n_i}} ここで、はこの特定の盗賊のために持っているサンプルの量であり、はすべての盗賊から持っているサンプルの総量です。モンテカルロツリー検索でも同じアルゴリズムが使用され、信頼限界の上限が取得されます。N iん私nin_iN私NiN_i 私は信頼限界の上限が何であるかを非常に明確に理解していますが、私が理解していないのは、この公式がどこから来たかです。私はいくつかの場所でオンラインを調べてみましたが、この式がどのように導出されるかについての明確な説明は見つかりませんでした。誰かがこの式がどこから来たかを説明できますか?統計の背景がよくないと思います。

2
ベイジアン階層型一般化線形モデルでの特徴選択
私は階層的なGLMを推定しようとしていますが、どの共変量を母集団レベルで含めるかを決定するための機能を選択しています。 観測値と可能な共変量を持つグループがあるとします。つまり、共変量\ boldsymbol {x} _ {(N \ cdot G)\ times K}、結果\ boldsymbol {y} _ {(N \ cdot G)\ times 1}。これらの共変量の係数は\ beta_ {K \ times 1}です。GGGNNNKKKx(N⋅G)×Kx(N⋅G)×K\boldsymbol{x}_{(N\cdot G) \times K}y(N⋅G)×1y(N⋅G)×1\boldsymbol{y}_{(N\cdot G) \times 1}βK×1βK×1\beta_{K \times 1} 仮定YYY〜Bernoulli(p(x,β))Bernoulli(p(x,β))Bernoulli(p(x,\beta)) 以下は、ロジットサンプリングモデルと正規分布グループ係数を使用した標準的な階層型ベイジアンGLMです。 L(y|x,β1,...βG)∝∏g=1G∏t=1N(Pr{j=1|pt,βg})yg,t(1−Pr{j=1|pt,βg})1−yg,tL(y|x,β1,...βG)∝∏g=1G∏t=1N(Pr{j=1|pt,βg})yg,t(1−Pr{j=1|pt,βg})1−yg,t{\cal L}\left(\boldsymbol{y}|\boldsymbol{x},\beta_{1},...\beta_{G}\right)\propto\prod_{g=1}^{G}\prod_{t=1}^{N}\left(\Pr\{j=1|p_{t},\beta^{g}\}\right)^{y_{g,t}}\left(1-\Pr\{j=1|p_{t},\beta^{g}\}\right)^{1-y_{g,t}} β1,...βG|μ,Σ∼iidNd(μ,Σ)β1,...βG|μ,Σ∼iidNd(μ,Σ)\beta_{1},...\beta_{G}|\mu,\Sigma\sim^{iid}{\cal N}_{d}\left(\mu,\Sigma\right) μ|Σ∼N(μ0,a−1Σ)μ|Σ∼N(μ0,a−1Σ)\mu|\Sigma\sim{\cal N}\left(\mu_{0},a^{-1}\Sigma\right) Σ∼IW(v0,V−10)Σ∼IW(v0,V0−1)\Sigma\sim{\cal IW}\left(v_{0},V_{0}^{-1}\right) \ betaの次元数に(LASSOのように)鋭い特徴選択があるように、このモデルを変更(またはそれを実行するか、それを説明する作業を見つける)したいと思いββ\betaます。 (1)最も単純な最も直接的な方法は、母集団レベルでこれを正則化して、の次元数を本質的に制限し、すべてのが同じ次元になるようにすることです。μμ\muββ\beta (2)より微妙なモデルでは、グループレベルで収縮が発生し、次元は階層単位に依存します。ββ\beta 1と2を解くことに興味がありますが、もっと重要なのは1です。


弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.