タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

1
ブースト回帰ツリー(BRT)、一般化ブーストモデル(GBM)、および勾配ブースティングマシン(GBM)の調整
質問: ブースト回帰ツリー(BRT)と一般化ブーストモデル(GBM)の違いは何ですか?それらは交換可能に使用できますか?一方は他方の特定の形式ですか? RidgewayがFriedmanが以前に "Gradient Boosting Machine"(GBM)として提案していたものを説明するために "Generalized Boosted Regression Models"(GBM)というフレーズを使用したのはなぜですか?これらの2つの頭字語は同一であり、同じことを説明していますが、異なるフレーズに由来しています。 バックグラウンド: BRTとGBMの用語の違いを判断するのに苦労しています。私が理解していることから、両方とも、ある種のブースティング(たとえば、バギング、ブートストラップ、クロス検証)を通じて確率論が組み込まれた分類および回帰ツリーを説明する用語です。また、私が収集したものから、GBMという用語は、フリードマン(2001)の論文「グリーディ関数近似:勾配ブースティングマシン」で最初に作られたものです。Ridgewayは、2006年にパッケージ「Generalized Boosted Regression Models(GBM)」でFriedmanが説明した手順を実装しました。私の分野では(生態学)Elith et al。(2008)は、gbm種分布モデリングのためのリッジウェイのパッケージを最初に実証したものです。しかし、エリスらの著者。「ブースト回帰ツリー」(BRT)という用語を使用して、フリードマンとリッジウェイを説明します。 これらの用語を同じ意味で使用できるかどうか混乱していますか?ある著者が、前の著者が提案したのと同じ理論を説明するのに同じ頭字語を(別のフレーズから)使用することはやや混乱します。この理論を生態学的な用語で説明するときに、3人目の著者がまったく異なる用語を使用したことも混乱しています。 私が思いつくことができる最高のものは、BRTが分布が二項分布であるGBMの特定の形式であるということですが、私はこれについて確信が持てません。 エリス他 このようにブーストされた回帰ツリーを定義します... "ブーストされた回帰ツリーは、2つのアルゴリズムの強みを組み合わせたものです:回帰ツリー(再帰的なバイナリ分割によって予測子への応答を関連付けるモデル)とブースティング(多くの単純なモデルを組み合わせて予測パフォーマンスを向上させる適応手法) )最終的なBRTモデルは、個々の項が単純なツリーであり、順方向の段階的な方法で当てはめられた加法回帰モデルとして理解できます」(Elith et al。2008)。

2
ブースティングのout-of-bagエラー推定?
ランダムフォレストでは、各ツリーはデータの一意のブーストラップサンプルで並行して成長します。各ブーストラップサンプルには一意の観測値の約63%が含まれていると予想されるため、観測値の約37%が除外され、ツリーのテストに使用できます。 現在、確率的勾配ブースティングでは、RFと同様の推定値もあるようです。OOBerrorOOBerrorOOB_{error} bag.fractionが0(0.5を推奨)より大きい値に設定されている場合、gbmは予測パフォーマンスの改善のout-of-bag推定を計算します。次の回帰ツリーの選択に使用されていない観測値の逸脱の減少を評価します。 出典:Ridgeway(2007)、セクション3.3(8ページ)。 それがどのように機能するか/有効であるかを理解するのに問題があります。シーケンスにツリーを追加するとします。元のデータセットのランダムなサブサンプルでこのツリーを成長させています。私はそれを育てるために使用されなかった観察でこの単一の木をテストすることができました。同意した。しかし、ブースティングはシーケンシャルなので、これらの省略された観測の予測を提供するために、これまでに構築されたツリーのシーケンス全体を使用しています。そして、先行する木々の多くがこれらの観察をすでに見ている可能性が高いです。したがって、モデルは実際にはRFのような目に見えない観測について各ラウンドでテストされていませんね? では、なぜこれが「out-of-bag」エラー推定と呼ばれるのでしょうか。私には、観察がすでに見られているので、それはどのバッグからも「出ていない」ように見えますか?

1
どのように見つけ、と連続変数のための最適な離散化を評価するために、
連続変数とバイナリターゲット変数(0と1)を含むデータセットがあります。 (ロジスティック回帰の)連続変数をターゲット変数に関して離散化する必要があります。また、各区間での観測頻度のバランスをとるように制約されています。Chi Mergeのような機械学習アルゴリズム、決定木を試しました。Chiマージにより、各間隔で非常に不均衡な数の間隔が得られました(3つの観測値を持つ間隔と1000の別の間隔)。決定木は解釈が困難でした。 最適な離散化では、離散化された変数とターゲット変数の間の統計が最大化され、ほぼ同じ量の観測を含む間隔が必要であるという結論に達しました。χ2χ2\chi^2 これを解決するためのアルゴリズムはありますか? これはRでは次のようになります(defはターゲット変数、xは離散化される変数です)。私はTschuprowの計算ので、変換され、ターゲット変数間の「相関性」を評価するために、χ 2統計は間隔の数に伴って増加する傾向にあります。これが正しい方法かどうかはわかりません。TTTχ2χ2\chi^2 TTT chitest <- function(x){ interv <- cut(x, c(0, 1.6,1.9, 2.3, 2.9, max(x)), include.lowest = TRUE) X2 <- chisq.test(df.train$def,as.numeric(interv))$statistic #Tschuprow Tschup <- sqrt((X2)/(nrow(df.train)*sqrt((6-1)*(2-1)))) print(list(Chi2=X2,freq=table(interv),def=sum.def,Tschuprow=Tschup)) }

2
CARTツリーは予測子間の相互作用をキャプチャしますか?
この論文では、CARTでは各ステップで単一の共変量に対してバイナリ分割が実行されるため、すべての分割は直交し、したがって共変量間の相互作用は考慮されないと主張しています。 ただし、非常に深刻な参考文献の多くは、逆に、ツリーの階層構造が予測子間の相互作用を自動的にモデル化することを保証していると主張しています(たとえば、この論文、そしてもちろんHastie)。 誰が正しいのですか?CARTで生成されたツリーは、入力変数間の相互作用をキャプチャしますか?

1
オートエンコーダーと畳み込みニューラルネットワークで学習したフィルターの違いは何ですか?
CNNでは、フィルターを学習して、畳み込み層に特徴マップを作成します。 Autoencoderでは、各レイヤーの単一の非表示ユニットをフィルターと見なすことができます。 これら2つのネットワークで学習されたフィルターの違いは何ですか?


3
Pythonによる時系列異常検出
いくつかの時系列データセットに異常検出を実装する必要があります。私はこれまでにこれをやったことがなく、いくつかのアドバイスを期待していました。私はpythonに非常に慣れているので、ソリューションを実装することを好みます(私のコードのほとんどは、私の作業の他の部分ではpythonです)。 データの説明:過去2年間(つまり24-36期間のみ)に収集され始めたばかりの月次時系列データです。基本的に、複数のクライアントについて月ごとに監視されるいくつかのメトリックがあります。 time_period client metric score 01-2013 client1 metric1 100 02-2013 client1 metric1 119 01-2013 client2 metric1 50 02-2013 client2 metric2 500 ... これが私が考えていることです:データをデータフレーム(パンダ)に取り込み、各クライアント/メトリックのペアのローリング6か月の平均を計算します。現在の期間の値が6か月平均に基づくしきい値を超える場合は、フラグを立てます。問題はかなり単純なようです。しっかりとしたアプローチを取っていることを確認したいだけです。 このアイデアを少し具体化するためのアドバイスをいただければ幸いです。質問が少し抽象的であることを知っています。それをお詫びします。

2
多様体の仮定が正しいことを証明する方法は?
機械学習では、データセットが滑らかな低次元多様体(多様体の仮定)にあると想定されることがよくありますが、特定の条件が満たされていると仮定すると、データセットが実際に(ほぼ)生成されることを証明する方法はありません低次元の滑らかな多様体から? たとえば、データシーケンスが与えられた場合、(角度の異なる顔画像のシーケンスと言います)および対応するラベルシーケンスここで、 (フェイスシーケンスの角度など)。とが非常に近い場合、それらのラベルとも非常に近いと仮定すると、{X1…Xn}{X1…Xn}\{\mathbf{X}_1 \ldots \mathbf{X}_n\}Xi∈RdXi∈Rd\mathbf X_i \in \mathbb{R}^d{y1…yn}{y1…yn}\{ y_1 \ldots y_n\}y1⪯y2…⪯yny1⪯y2…⪯yny_1 \preceq y_2 \ldots \preceq y_nXiXiX_iXi+1Xi+1X_{i+1}yiyiy_iyi+1yi+1y_{i+1}{X1…Xn}{X1…Xn}\{\mathbf{X}_1 \ldots \mathbf{X}_n\}低次元の多様体にあります。これは本当ですか?もしそうなら、どうすればそれを証明できますか?または、多様体の仮定が真であると証明できるように、シーケンスはどのような条件を満たす必要がありますか?

2
ノイズの多いデータまたは異常値を使用したクラスタリング
このような2つの変数のノイズの多いデータがあります。 x1 <- rep(seq(0,1, 0.1), each = 3000) set.seed(123) y1 <- rep (c(0.2, 0.8, 0.3, 0.9, 0.65, 0.35,0.7,0.1,0.25, 0.3, 0.95), each = 3000) set.seed(1234) e1 = rnorm(length(x1), 0.07,0.07) set.seed(1223) e2 = rnorm(length(x1), 0.07,0.07) set.seed(1334) yn <- rnorm(20000, 0.5,0.9) set.seed(2344) xn <- rnorm(20000, 0.5,0.9) y <- c(y1 + e1,yn) x <- …

2
ブースティングツリーの調整パラメーターの最適値を見つける方法
ブースティングツリーモデルには3つの調整パラメーターがあることを理解しています。 ツリーの数(反復数) 収縮パラメータ 分割数(各構成ツリーのサイズ) 私の質問は、各調整パラメーターについて、その最適値をどのように見つければよいですか?そして、どのような方法ですか? 注意:収縮パラメータとツリー数パラメータは一緒に動作します。つまり、収縮パラメータの値が小さいほど、ツリー数の値が大きくなります。これも考慮に入れる必要があります。 分割数の最適値を見つける方法に特に興味があります。背後のモデルに関する相互検証またはドメイン知識に基づく必要がありますか? そして、これらgbmはR のパッケージでどのように実行されますか?

4
多変量機械学習を行う方法は?(複数の従属変数の予測)
私は誰かが購入するアイテムのグループを予測しようとしています...つまり、複数の同一直線上の従属変数があります。 7つほどの独立したモデルを構築して、7つのアイテムのそれぞれを購入する確率を予測して結果を組み合わせるのではなく、7つの関連する従属変数間の関係を説明する1つのモデルを作成するためにどのような方法を検討すればよいですか(彼らが購入できるもの)。 私はプログラミング言語としてRを使用しているので、R固有のアドバイスがあれば感謝します。

1
適切なスコアリングルールが分類設定における一般化のより良い推定になるのはいつですか?
分類問題を解決するための一般的なアプローチは、候補モデルのクラスを識別し、交差検証などの手順を使用してモデル選択を実行することです。通常、最も正確なモデル、またはなどの問題固有の情報をエンコードする関連関数を選択し。FβFβ\text{F}_\beta 最終目標が正確な分類子を作成することであると仮定すると(正確性の定義は再び問題に依存します)、どのような状況で、正確さ、精度、再現率などの不適切なものではなく、適切なスコアリングルールを使用してモデル選択を実行する方が良いでしょう。、など?さらに、モデルの複雑さの問題を無視して、すべてのモデルを等しく可能性があると見なすアプリオリと仮定します。 以前は私は決して言わなかっただろう。正式な意味では、分類は回帰[1]、[2]よりも簡単な問題であり、前者の方が後者よりも厳しい境界を導出できる()。さらに、確率を正確に一致させようとすると、誤った決定の境界や過剰適合が発生する場合があります。しかし、ここでの会話とそのような問題に関するコミュニティの投票パターンに基づいて、私はこの見解に疑問を投げかけています。∗∗* デブロイ、リュック。パターン認識の確率論。巻。31.スプリンガー、1996年、セクション6.7 カーンズ、マイケルJ.、ロバートE.シャピレ。確率論的概念の効率的な配布フリー学習。コンピュータサイエンスの基礎、1990年。IEEE、1990年。 (∗)(∗)(*)このステートメントは少しずさんになるかもしれません。私は、特にフォームの所与の標識されたデータを意味するとと、条件付き確率を正確に推定するよりも、決定境界を推定する方が簡単のようです。S={(x1,y1),…,(xn,yn)}S={(x1,y1),…,(xn,yn)}S = \{(x_1, y_1), \ldots, (x_n, y_n)\}xi∈Xxi∈Xx_i \in \mathcal{X}yi∈{1,…,K}yi∈{1,…,K}y_i \in \{1, \ldots, K\}

2
複数の空間解像度/スケールを持つソースからの時系列情報の結合
さまざまなセンサーから入手できる多くの衛星ラスター画像があります。これらから、より粗いものは非常に豊富な時間分解能を持っています。中解像度のラスターは取得日が少ない傾向がありますが、それでもある程度の情報は利用できます。より細かい解像度のものは、2年以内に観測された日付が2から6に及ぶ非常に低い時間解像度を持っています。誰かがこのタイプのマルチスケール時系列を何らかの方法で研究するための努力を知っているかどうか疑問に思っていましたか?より粗いものから得られる情報を使用して、より細かいスケールで将来の値を予測することに興味があります。データは関連している必要があります(画像が同じ領域をカバーしている)ことは私には理にかなっていますが、予測モデルでこの情報の結合を開始する方法がわかりません。

1
ランダムフォレストは、MNISTの2.8%テストエラーよりもはるかに優れていますか?
ランダムフォレストのMNIST、CIFAR、STL-10などへの適用に関する文献は見つかりませんでしたので、順列不変の MNISTを自分で試してみようと思いました。 ではR、私が試しました: randomForest(train$x, factor(train$y), test$x, factor(test$y), ntree=500) これは2時間実行され、2.8%のテストエラーが発生しました。 私はまた、scikit-learnを試しました RandomForestClassifier(n_estimators=2000, max_features="auto", max_depth=None) 70分後、2.9%のテストエラーが発生しましたが、代わりにn_estimators = 200を使用すると、わずか7分後に2.8%のテストエラーが発生しました。 OpenCVの、私が試しました rf.train(images.reshape(-1, 28**2), cv2.CV_ROW_SAMPLE, labels.astype('int')) これは6.5分間実行されrf、予測に使用すると15%のテストエラーが発生しました。params少なくともバージョン2.3.1では、ランダムフォレストへのPythonバインディングが引数を無視しているように見えるため、トレーニングしたツリーの数はわかりません。また、OpenCVに、回帰ではなく分類の問題を解決したいことを明確にする方法を理解できませんでした-に置き換えastype('int')てastype('float32')も同じ結果が得られるため、疑問があります。 ではニューラルネットワークのための順列不変のトレーニングは、おそらく一つのCPUに2時間以上かかるだろうが、MNISTベンチマーク、芸術の状態は、0.8%のテストエラーです。 ランダムフォレストを使用してMNISTで2.8%のテストエラーをはるかに上回ることは可能ですか?私は、一般的なコンセンサスは、ランダムフォレストは通常​​カーネルSVMと少なくとも同等であり、1.4%のテストエラーが発生する可能性があると考えていました。

1
イベント予測のための隠れマルコフモデル
質問:隠しマルコフモデルの賢明な実装の下の設定ですか? 108,000観測データセット(100日間で取得)と2000、観測期間全体にわたるおおよそのイベントがあります。観測された変数が3つの離散的な値とることができる場所下図のようなデータルックスと赤の列は、イベント時間を強調表示、すなわちトンEさん:[1,2,3][1,2,3][1,2,3]tEtEt_E tEtEt_EtE−5tE−5t_{E-5} HMMトレーニング:私がすることを計画し訓練 Pgの上で示唆したように、複数の観測系列の方法論を使用して、すべての「プレイベントの窓」に基づき、隠れマルコフモデル(HMM)を。ラビナーの論文の 273 。うまくいけば、これにより、イベントにつながるシーケンスパターンをキャプチャするHMMをトレーニングできます。 l o g[ P(O b s e r v a t i o n s | HMM)]log[P(Observations|HMM)]log[P(Observations|HMM)]O b s e r v a t i o n sObservationsObservationstttt − 5t−5t-5 l o g[ P(O b s e r v a t i o …

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.