タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

3
モデル間のキャリブレーションを比較するための統計的アプローチ
これは一般的な問題のようですが、解決策が見つかりません。 一連のバイナリ観測と2つの異なるモデルがあり、それぞれに各観測の予測があります。モデルのキャリブレーションを比較したい。 これらのモデルの差別を比較する方法はいくつかあります(RのpROCパッケージのroc.testを参照)が、キャリブレーションを比較する方法はありません。ほとんどの経験的論文は、各モデルのキャリブレーションがオフであるかどうかをテストしている2つの異なるキャリブレーションテスト(すなわち、Hosmer-Lemeshow、Brierスコア)からのp値のみをリストしています。 私が探しているのは、2つのモデル間のキャリブレーションの直接統計比較です。 これが極端なテストデータセットです。ブライア検定、シュピーゲルハルターZ検定などの値はすべて、p2がより適切に較正されていることを裏付けています。誰かがこれを正式な統計的検定にすることができますか? library("pROC") y <- rbinom(100,1,1:100/100) p1 <- 1:100/10001 p2 <- 1:100/101 val.prob(p1,y) val.prob(p2,y)

2
最近傍が無意味になる高次元データセットの生成
論文では、「「Nearest Neighbor」はいつ意味があるのですか?」 特定の広範な条件(データとクエリの分布、またはワークロードの観点から)の下で、次元が増加するにつれて、最近傍への距離が最遠距離への距離に近づくことを示します。言い換えれば、異なるデータポイントまでの距離のコントラストは存在しなくなります。これが発生するという私たちが特定した条件は、他の作業が想定している独立して同一に分散された(IID)ディメンションの想定よりもはるかに広いものです。 私の質問は、この効果を生成するデータセットをどのように生成する必要があるかです。 私は、各次元について0〜255の範囲の乱数で1000次元の3つのポイントを作成しましたが、ポイントは異なる距離を作成し、上記の内容を再現しません。寸法(10、100、1000など)と範囲([0,1]など)を変更しても、何も変更されないようです。私はまだ異なる距離を取得しますが、クラスタリングアルゴリズムなどでは問題になりません! 編集:私の実験に基づいて、より多くのサンプルを試してみましたが、ポイント間の距離が数値に収束していません。逆に、ポイント間の最大距離と最小距離がよりはっきりしています。これは、次元の呪いのためにもっと直感が必要という最初の投稿に書かれていることや、https://en.wikipedia.org/wiki/Clustering_high-dimensional_data#Problemsのように同じことを主張する他の多くの場所にも反しています。誰かがコードや実際のデータセットを使って、そのような効果が実際のシナリオに存在することを私に示すことができれば、私はそれでも感謝します。

1
非線形次元削減:幾何学的/トポロジーアルゴリズムと自動エンコーダ
私が理解しているように、非線形次元削減には3つの主要なアプローチがあります。 多様体学習(ISOMAP、LLE、LTSAなどの幾何学的/トポロジーアルゴリズム) オートエンコーダー 最初の2つのカテゴリに当てはまらないもの(確率に基づくt-SNE、カーネルPCAなど) 最初の2つのアプローチの利点と欠点は何ですか? オートエンコーダーが、ディープラーニングのようなマニホールドラーニングを完全に上回って、パフォーマンスの点でほとんどの機械学習アルゴリズムに影を落とすのではないでしょうか。

1
フィードフォワードネットワーク上でリカレントニューラルネットワークを使用するための数学的な正当化
シーケンシャルデータを処理するときに、フィードフォワードネットワークよりもRNNが優れていることの背後に数学的な理由があるかどうか疑問に思い、理解しようとしました。たとえば、時系列、HMMなどをモデル化する場合。シーケンスの長さは固定されているが、非常に大きいと仮定します。 直感的には、RNNが状態変数の現在の時刻までの関連情報を記憶し、それを使用して現在の入力基づいて状態をに更新できることは明らかです。たとえば、フィードフォワードネットワークを使用してをモデルする場合、ごとに入力ノードを用意し、それらを合計してを取得する必要がありが、RNNではは単一の入力ノードが必要であり、状態は合計ます。tttht−1ht−1h_{t-1}hthth_txtxtx_tYt=Xt+Xt−1+…+X0Yt=Xt+Xt−1+…+X0Y_t=X_t+X_{t-1}+\ldots+X_0XiXiX_iYtYtY_tXtXtX_tXt−1+…+X0Xt−1+…+X0X_{t-1}+\ldots+X_0 上記の例はかなり基本的なものですが、RNNの複雑さ(ノード数、深さ)は、フィードフォワードの場合に比べてはるかに少ないことを示しています。 フィードフォワードでは取得できないが、RNNで十分に近似できる関数のファミリの例を誰かが提供できますか?これに言及する参考文献もまた高く評価されます。


1
「カーネルメソッド」と「カーネルヒルベルト空間の再現」は関連していますか?
「カーネルメソッド」と「カーネルヒルベルト空間の再現」は関連していますか? 具体的には、「カーネルメソッド」という用語で使用されている「カーネル」は、「カーネルヒルベルト空間の再現」という用語で使用されている「カーネル」と同じ(タイプ)ですか? すでに2つのトピックについてWikipediaのページを確認しましたが、「カーネルヒルベルト空間を再現する」ためのページに「カーネルメソッド」についての言及はありませんでした。 カーネルヒルベルト空間の再現に関するテキスト(ここを参照)を見つけたいと思います。「カーネルメソッド」は機械学習のテキストで頻繁に取り上げられるトピックのようなので、2つの概念が本質的に同じであればこれははるかに簡単です。 。 一方、それらが異なる場合は、混乱を避けるために、2つの違いを理解できるように努力する必要があります。

1
アルゴリズムをカーネル化するとき、切片項を考慮する必要がありますか?
学習アルゴリズム(分類、回帰、クラスタリング、次元削減など)がデータポイント間のドット積のみを使用する場合カーネルトリックを介して、より高い次元のマッピングを暗黙的に使用できます。ドット積は、カーネルによって生じるすべてのインスタンス交換。xxTxxT\mathbf {x x^T}ϕ(x)ϕ(x)\phi(\mathbf x)K=ϕ(x)ϕ(x)TK=ϕ(x)ϕ(x)T\mathbf K = \phi(\mathbf x) \phi(\mathbf x) ^ \mathbf T SVMなどの線形モデルでは、データポイントに定数列を追加する切片を考慮することができます。線形カーネルを使用する場合、その列を一定に保つことは私にとって非常に理にかなっています。カーネル係数からまでの 列係数取得できます。と解は、カーネルを使用するかどうかにかかわらず、同一でなければなりません。K=xxTK=xxT\mathbf K = \mathbf {x x^T}ww\mathbf wuu\mathbf uw=xTuw=xTu\mathbf{w=x^T u} しかし、カーネルが線形でない場合、列係数がで表すことができないように無限次元でマッピングする場合はどうなりますか?インターセプト用語?w=ϕ(x)Tuw=ϕ(x)Tu\mathbf{w=\phi(\mathbf x)^T u}

3
ニューラルネットワークで分類する前に画像データセットでPCAを使用する
画像データマトリックスがあります バツ∈RN x p X∈ℜN x pX \in \Re^{N \ \text{x}\ p} どこ N= 50000N=50000N=50000 画像の例の数であり、 p = 3072p=3072p=3072 画像のピクセル数です。 p = 3072 = 32 × 32 × 3p=3072=32×32×3p = 3072 = 32 \times 32 \times 3、各画像は3チャンネルであるため 32 × 3232×3232 \times 32画像。さらに、50000の画像のそれぞれは、10の可能なクラスの1つに属しています。つまり、クラス ' car'の5000個の画像、クラス ' 'の5000個の画像birdなどがあり、合計10個のクラスがあります。これはCIFAR-10データセットの一部です。 ここでの最終的な目標は、このデータセットで分類を実行することです。この目的のために、教授はこれについてPCAを試し、それらの機能を分類子に配置することを述べました。私の分類子として、1つの非表示レイヤーとsoftmax出力を持つ完全に接続されたニューラルネットワークを使用しています。 私の問題は、私がPCAを正しい方法で実行したと信じていることですが、私の方法が誤って適用されている可能性があると思います。 これは私がやったことです: 私のデータのPCAを計算するために、これは私がこれまでに行ったことです: …

1
Tensorflowで実装されているような自動微分の使用例は何ですか?なぜそれが重要なのですか?
ニューラルネットワーク、バックプロパゲーション、チェーンルールを適切に理解していますが、自動微分を理解するのに苦労しています。 以下は、逆伝播のコンテキスト外の自動微分に言及しています。 自動微分は行列から勾配をどのように計算しますか? 勾配を計算するための要件は何ですか?関数を指定する必要がありますか? これの使用例は何ですか(それ以外の場合は逆伝播)? なぜそれが重要であり、代替案は何ですか? 何か不足していますか?

2
なぜすべてのパラメータを同じように正則化するのですか?
私の質問は、線形回帰とロジスティック回帰の正則化に関するものです。私は現在、Coursera でAndrew Ngの機械学習コースの第3週を行っています。過剰適合が一般的な問題になる可能性があることを理解しています。また、正規化によって過剰適合を減らす方法について直観があります。私の質問は、さまざまな方法でさまざまなパラメーターを正則化することによってモデルを改善できるかどうかです。 例: フィットしようとしているとしましょう w0+w1x1+w2x2+w3x3+w4x4w0+w1x1+w2x2+w3x3+w4x4w_0 + w_1 x_1 + w_2 x_2 + w_3 x_3 + w_4 x_4。この質問は、なぜ私たちが高w1w1w_1 高いと罰するのと同じ方法で値 w2w2w_2 値。 私たちの機能について何も知らない場合 (x1,x2,x3,x4)(x1,x2,x3,x4)(x_1,x_2,x_3,x_4) 構築された場合、正則化を行うときはすべて同じように扱うことが理にかなっています。 w1w1w_1 価値は、高値と同じくらいの「ペナルティ」 w3w3w_3 値。 しかし、追加情報があるとしましょう。最初は2つの機能しかなかったとします。 x1x1x_1 そして x2x2x_2。ラインがトレーニングセットに適合していなかったため、より波状の決定境界が必要だったため、x3=x21x3=x12x_3 = x_1^2 そして x4=x32x4=x23x_4 = x_2^3。これで、より複雑なモデルを使用できるようになりますが、モデルが複雑になるほど、モデルをトレーニングデータに過剰適合させるリスクが高まります。したがって、コスト関数の最小化とモデルの複雑さの最小化の間でバランスをとる必要があります。さて、より高い指数を表すパラメータ(x3x3x_3、 x4x4x_4)モデルの複雑さが大幅に増大しています。だから私たちは高額に対してもっとペナルティを課すべきではないw3w3w_3、 w4w4w_4 私たちが高いと罰するよりも価値 w1,w2w1,w2w_1,w_2 値?

1
不均衡なクラスでFスコアを平均化する最良の方法
不均衡なクラスのデータセットがあります。3つのクラスがデータの約60%を占めます。また、不均衡を引き起こすさまざまなテスト分割があります。たとえば: トレインセット:label_1 ... label_n テストセット:label_1、label_3、label_9 これは、テストセットにラベルが3つしかない場合でも、nラベルの1つとして予測される可能性があることを意味します。したがって、sklearn.metrics.precision_recall_fscore_supportを使用すると、ゼロが多い行列が得られます。 私の問題は、クラスごとの値ではなく、すべてのクラスにわたって平均Fスコアを取得する必要があることです。ただし、上記のsklearn関数から返された行列の平均を取るだけでは、非常に多くのゼロがあるため、常に非常に低い値になります。一方、潜在的な予測の総数はクラスの総数でなければならないため、ゼロ以外の値の平均を取ることも、私には意味がありません。 この場合、平均を取る良い方法はありますか?ミクロ、マクロ、加重平均のオプションを使用してみましたが、どちらが正しいかわかりません。 誰かこれを手伝ってくれませんか?

1
予測不確実性を伴うノンパラメトリック非線形回帰(ガウスプロセス以外)
トレーニングセットのサイズがバニラGPで禁止され始めたが、それでもそれほど大きくない場合、予測の不確実性を伴うノンパラメトリック非線形回帰のためのガウスプロセス(GP)の最新の代替手段は何ですか? 私の問題の詳細は: 入力空間は低次元です(、)X⊆RdX⊆Rd\mathcal{X} \subseteq \mathbb{R}^d2≤d≤202≤d≤202\le d \le 20 出力は実数値です()Y⊆RY⊆R\mathcal{Y} \subseteq \mathbb{R} トレーニングポイントは、標準のGP(近似なし)で処理できるものよりも1桁程度大きい103≲N≲104103≲N≲10410^3 \lesssim N \lesssim 10^4 近似する関数f:X→Yf:X→Yf: \mathcal{X} \rightarrow \mathcal{Y}はブラックボックスです。連続性と滑らかさの相対的な程度を仮定できます(たとえば、GPには\ nu = \ frac {5} {2}の Matérn共分散行列を使用しますν=52ν=52\nu = \frac{5}{2}) クエリされた各ポイントについて、近似は予測の平均と分散(または不確実性の類似の測定)を返す必要があります 1つまたはいくつかの新しいトレーニングポイントがトレーニングセットに追加されたときに、メソッドが比較的高速(数秒程度)で再トレーニング可能である必要があります どんな提案も歓迎します(メソッドへのポインタ/言及と、それがうまくいくと思う理由)。ありがとうございました!

2
バッチ正規化は、トレーニング後に人口統計をどのように計算しますか?
私はバッチ正規化(BN)ペーパー(1)を読んでいて、それは言った: このため、ネットワークがトレーニングされたら、正規化を使用します バツ^=x − E[ x ]Va r [ x ] + ϵ−−−−−−−−√x^=x−E[x]Var[x]+ϵ\hat{x} = \frac{x - E[x]}{ \sqrt{Var[x] + \epsilon}}ミニバッチではなく、人口統計を使用します。 私の質問は、どのようにしてこの人口統計をどのように計算し、どのトレーニングセット(テスト、検証、トレーニング)を超えているかです。私はそれが何を意味するのかは知っていたと思いましたが、しばらくして、これがどのように計算されるのかわかりません。私はそれがどのように行うかはわかりませんが、それは真の平均と分散を推定しようとしていると思います。おそらく、データセット全体に従って平均と分散を計算し、それらの瞬間を推論に使用します。 しかし、私が間違っているのではないかと疑ったのは、同じセクションの後半の不偏分散の推定についての彼らの議論です。 不偏分散推定を使用します Va r [ x ] =メートルm − 1⋅EB[σ2B]Var[x]=mm−1⋅EB[σB2]Var[x] = \frac{m}{m-1} \cdot E_{\mathcal{B}}[\sigma^2_{\mathcal{B}}] サイズのミニバッチのトレーニングに期待が集まっている場所 メートルmm そして σ2BσB2\sigma^2_{\mathcal{B}} それらは標本分散です。 私たちは人口統計について話しているので、この紙面上のコメントは、どこからともなく(私にとって)出てきたようなものであり、彼らが何について話しているのかわかりませんでした。彼らは(ランダムに)トレーニング中に不偏推定値を使用することを明確にしていますか、それとも不偏推定値を使用して人口統計を計算していますか? 1:Ioffe S.とSzegedy C.(2015)、 「バッチ正規化:内部共変量シフトの削減によるディープネットワークトレーニングの加速」、 第32回機械学習に関する国際会議の議事録、リール、フランス、2015。Journalof Machine Learning Research: W&CPボリューム37

1
外れ値の検出:精度再現率曲線の下の領域
外れ値検出アルゴリズムを比較したいと思います。rocの下の領域または精度再現率曲線の下の領域が、使用する尺度であるかどうかはわかりません。 matlabでのクイックテストで奇妙な結果が得られます。完璧な分類のためにROCとPRの値を取得しようとします。 % true labels outlier = 1; normal = 0; % 99% normal data 1% outlier label = normal*ones(1000,1); label(1:10) = outlier; % scores of the algorithm % assume the prediction is perfect score = label; [~,~,~,AUC] = perfcurve(label,score,outlier) % AUC = 1 [~,~,~,PR] = perfcurve(label,score,outlier, 'xCrit', 'reca', 'yCrit', …

2
機械学習におけるフーリエ変換
機械学習でフーリエ法が使用されている特定の領域を知りたい。特徴抽出とスペクトル分析以外に、フーリエ法に基づく学習アルゴリズムがあるかどうかを知りたいです。 また、確率的グラフィカルモデルにフーリエ法を使用する動機があるかどうかも知りたいです。

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.