タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

2
重みに関するSoftmaxの導関数
私はディープラーニングが初めてで、行列に関して次の関数の導関数を計算しようとしています:ww\mathbf w p(a)=ew⊤axΣdew⊤dxp(a)=ewa⊤xΣdewd⊤xp(a) = \frac{e^{w_a^\top x}}{\Sigma_{d} e^{w_d^\top x}} 商規則を使用すると、次のようになります: ∂p(a)∂w=xew⊤axΣdew⊤dx−ew⊤axΣdxew⊤dx[Σdew⊤dx]2=0∂p(a)∂w=xewa⊤xΣdewd⊤x−ewa⊤xΣdxewd⊤x[Σdewd⊤x]2=0\frac{\partial p(a)}{\partial w} = \frac{xe^{w_a^\top x}\Sigma_{d} e^{w_d^\top x} - e^{w_a^\top x}\Sigma_{d} xe^{w_d^\top x}}{[\Sigma_{d} e^{w_d^\top x}]^2} = 0 ソフトマックス関数は一般的にディープラーニングのアクティベーション関数として使用されているため、私は何か間違っていると思います(したがって、常に導関数を持つことはできません)。私は同様の質問をしましたが、計算のこの部分については光沢がないようです。000 私は正しい方向へのポインタをいただければ幸いです。

3
Deep Deterministic Policy Gradient(DDPG)アルゴリズムでのActor Gradient Updateの計算
この質問は、DDPGに関するディープマインドペーパー(https://arxiv.org/pdf/1509.02971v5.pdf)に関するものです。 私が見たほとんどの(すべて?)実装のDDPGアルゴリズムは、、ここではアクターネットワークのパラメーターを表し、はアクターネットワークを表し、は批評家ネットワークを表し、は状態を表します入力。これを式1と呼びます。∇ (J)=∇μ (s | θ )(Q (s 、μ (s | θ ))∇θ(μ (s | θ ))∇(J)=∇μ(s|θ)(Q(s,μ(s|θ))∇θ(μ(s|θ))\nabla(J)=\nabla_{\mu(s|\theta)}(Q(s,\mu(s|\theta))\nabla_{\theta}(\mu(s|\theta))θθ\thetaμμ\muQQQsss 論文に示されている式1は、チェーンルールをことで得られます。これにより、。∇ (J)=∇θ(Q (s 、μ (s | θ ))∇(J)=∇θ(Q(s,μ(s|θ))\nabla(J)=\nabla_{\theta}(Q(s,\mu(s|\theta))∇μ (s | θ )(Q (s 、μ (s | θ ))∇θ(μ (s | θ ))∇μ(s|θ)(Q(s,μ(s|θ))∇θ(μ(s|θ)) \nabla_{\mu(s|\theta)}(Q(s,\mu(s|\theta))\nabla_{\theta}(\mu(s|\theta)) 私の質問は、auto-gradソフトウェアパッケージ(Theano / Tensorflow / Torch / etc)を使用して、 wrt出力の勾配を直接計算できなかった理由があるのですか?何らかの理由で、すべての実装は、最初に wrtの出力の勾配を計算してから、チェーンルールに従って wrtからへ勾配を乗算します。彼らがこれを行う理由がわかりません- …

1
単調な機械学習
バイナリ分類(教師あり学習)の問題があり、すべての機能がブール値であり、次のような工夫があります。分類子を学習したい f:{ 0 、1}ん→ { 0 、1 }f:{0、1}ん→{0、1}f:\{0,1\}^n \to \{0,1\}それはモノトーンです。つまり、機能のサブセットを0から1に変更しても、分類子の出力が1から0に変更されることはありません。 どうすればモノトーン分類器を学習できますか?標準的な分類方法を何らかの方法で適合させて、単調性制約を強制できますか? 単調なモデルを確実に学習できるようにロジスティック回帰を適応させる方法を見ることができます。各特徴の係数が非負であることを要求してから、制約付き最適化アルゴリズムを適用してモデルの係数を推測できます。他の教師あり学習スキーム(ランダムフォレスト、勾配ブースティング、ニューラルネットワークなど)を適応させるための合理的な方法はありますか?または、この状況に適した専用アルゴリズムはありますか? 残念ながら、標準のランダムフォレスト分類器を適用するだけでは、トレーニングセットが単調であっても保証されません(単調設定に由来し、ノイズや単調性の違反はありません)。明示的な例、つまり、ランダムフォレストが非単調分類器を学習する可能性がある単調トレーニングセットの例については、https://cs.stackexchange.com/q/69220/755を参照してください。それも同様に良いことです。これは、単調分類器を学習したい場合、さらに高度な手法が必要になる可能性があることを示唆しています。

2
確率的推論とは何ですか?
クリスビショップのパターン認識と機械学習の教科書を読んでいます。確率的推論という用語に何度か出くわしました。いくつか質問があります。 確率論的推論はグラフィカルモデリングのコンテキストでのみ適用できますか? 従来の統計的推論(p値、信頼区間、ベイズ係数など)と確率論的推論の違いは何ですか? これはCSコミュニティに固有の用語ですか、それとも統計コミュニティでも広く使用されていますか?

2
テストセットを検証セットとして使用できない理由
テストセットを検証セットとして使用しないでください。どうして? 検証セットは、モデルパラメーターが修正されたときに実行され、学習はトレーニングバッチのバックプロップを介してのみ行われます。 では、なぜ検証データを検証データとして使用できないのでしょうか?

2
多変量時系列クラスタリング
多変量時系列のグループを収集しています。たとえば、2000の時系列があります。各時系列は12次元です。 多変量時系列をクラスター化できる体系的なモデル/アルゴリズムはありますか?たとえば、他とは非常に異なる時系列を特定したいと思います。 さらに、オンライン監視では、このアルゴリズムを時間どおりに実行する場合があります。たとえば、10分ごとに、この種のアルゴリズムを10分をカバーする時系列に対して実行します。これに関して効率的なアルゴリズムはありますか?

1
ニューラルネットワークと構造方程式モデリングの違いは何ですか?
私は初めて人工ニューラルネットワーク(ANN)について研究しており、ニューラルネットワークの概念が構造方程式モデリング(SEM)に似ているように見えることに感銘を受けました。例えば、 ANNの入力ノードはSEMのマニフェスト変数を思い出させます ANNの非表示ノードはSEMの潜在変数を思い出させる 観測されたすべての変数がSEMのマニフェスト変数を取得するため、ANNのすべての機能が入力ノードを取得します SEMがいくつかの最終的な従属変数を持つことができるのと同じように、ANNはいくつかの出力ノードを持つことができます どちらも説明と予測の目的に使用できます(私は思う) では、これら2つの形式の統計分析の違いを説明してください。

2
製品を分類するための機械学習アルゴリズムに関するアイデア
製品のリスト(領収書に記載されている製品名など)や、製品を購入した販売者などの変数が含まれています。 私はそれらの多くを手動でカテゴリの固定グループに分類しています(たとえば、アルコール飲料、野菜、肉など)。 データはいつものようにノイズが多いです。この場合、スキャンされた領収書から取得されるため特にノイズが多く、あまり良くないスキャンのOCRは通常非常にノイズが多くなります。 上記の2つの変数を使用して、新しいデータを分類するアルゴリズムを試してみたい。 ここには、いくつかの主要なバリエーションのソースがあります。 OCRは、製品(例:鶏肉)が多くの異なるが比較的類似したスペル(例:チキン、ヒッケン、チキンなど)で見つかることを意味します。 同じ商品でも、商品を販売した販売者によって名前が異なる場合があります。この場合、名前はマーチャント間で類似しているか完全に異なっている可能性がありますが、すべてのマーチャント内では類似しています。 同じ商品は、同じ商人の中で非常に異なる名前を持つことができます(たとえば、レシートの名前がブランド名であるブランド製品と一般名、ソフトドリンクとコカコーラ)。 (文字列間の距離(主に上記のバリエーションの最初の主要なソースに取り組む)など)を使用して、いくつかの(素朴な)分類器を試してみましたが、結果に満足していません。 そこで、私はこの問題に取り組む方法についてのアイデアを求めるために、ここに手を差し伸べたかったのです。多くの人がこの種の問題で私がしたよりも(数時間)「解決」したか、少なくともずっと長く働いたと思いますので、ここでのガイダンスを本当に感謝します。 ちなみに、私は主にRを使用しているので、Rベースのソリューションをいただければ幸いです。

3
不明/不明な機能変数がある回帰を実行することは可能ですか?
不明/不明な機能変数がある回帰を実行することは可能ですか? 私が持っていると言います yん=a0+a1バツ1+a2バツ2+a3バツ3yn=a0+a1x1+a2x2+a3x3y_n = a_0 + a_1 x_1 + a_2 x_2 + a_3 x_3 機能変数の値を測定できない/測定できない バツ3x3x_3。係数を確認するために回帰を実行できますかa私aia_i? どのように統計の知識がある場合はどうですか バツ3x3x_3配布されていますか?私が知っているならバツ3x3x_3 ガウス分布から引き出されます N(0 、σ2)N(0,σ2)\mathcal{N}(0, \sigma^2)、既知の σσ\sigma これにより、回帰を実行して、 a私aia_i?

1
機械学習手法を使用した時系列センサーデータのモデリング?
私は大気質センサーに取り組んでいます。そのうちのいくつかは電気化学ガスセンサーです。背景として、これらのセンサーは、バイアス電圧を印加し、センサーを流れる電流を測定するポテンシオスタット回路によって刺激されます(通常、ナノアンペアのオーダー)。センサーを流れる電流の量は、センサーがさらされたターゲットガスの濃度に関係します。電流はまた、圧力、相対湿度、温度、およびクロスセンシティブなガスへの曝露にも関連しており、私の存在の悩みの種です。 従来、データモデリングアプローチを使用して、センサーから測定された電流をセンサーメーカーの推奨に基づいてターゲットガスの濃度として解釈していました。これを行うには、清浄な空気に対する応答を温度範囲で測定し、その特性を使用して、特性評価されたベースライン応答からの偏差をターゲットガスへの暴露に起因すると解釈します。 参照機器も、制御された濃度のガスにセンサーをさらす手段もないため、そのモデルの品質を実際に評価する手段はありませんが、センサーを対象のガスに順番にさらすことができますターゲットガスにかなり反応していることを確認します。 私が経験している課題は、前述の特性化によってパラメータ化されたデータモデルが長期間(つまり1週間)にわたって、温度、相対湿度、および圧力の自然変動の下で清浄な空気にさらされると、不合理に大きい解釈された濃度の変動。うるさくはありませんが、ドリフトします。そのため、データモデルが非常に不足していると思います。 そのため、アルゴリズム(機械学習)アプローチがより良い結果をもたらす可能性があると私は思いました。清浄な空気条件下での温度、相対湿度、圧力、およびセンサー電流(すべて実数値)の1分の解像度データがある場合、センサー電流を温度、相対湿度の関数としてモデリングするのに最適なツールはどれですか。と圧力?私が最も心配しているのは、入力空間の妥当な断面を表す条件を実際に作成できないことです。 次に、従来のデータモデルを使用して、予測ベースラインからの偏差を解釈し、ガス濃度を推定します。 片側の注意点は、温度と相対湿度は物理的に相関しているということですが、絶対湿度を温度、相対湿度、および圧力から数学的に取り消すことができました。 更新/説明 これが上記から明らかでない場合、目標は、変化する圧力、湿度、および温度条件下の清浄な空気環境でセンサーによって生成されるベースライン電圧を推定できるようにすることです-その偏差を使用する手段としてターゲット種ガスの濃度を計算する際の対象信号として予測ベースライン。したがって、基本的には、計装ドメインで通常ゼロキャリブレーションと呼ばれるものに対する代替アプローチを調査しています。 対象種に関する真実のデータがあれば、予測ベースラインからの偏差に関するビジネスをスキップして、電圧、温度、湿度、および圧力の時間ベクトルから直接濃度を推定できる可能性があるようです。

1
最も重要な機能を推測する
インスタンスのセットが与えられます。インスタンスごとに、(数値)特徴(、、...、)、n >> mで構成される特徴ベクトルがあります。さらに、インスタンスごとに数値スコア(観測可能)があります。私はしたいと思います:んんnメートルメートルmバツ1バツ1x_1バツ2バツ2x_2バツメートルバツメートルx_myyy 特徴のどのサブセットまたはその線形結合がスコアを最もよく説明しているかを調べます。 このための素晴らしい視覚化を作成します。 主成分分析(PCA)を指摘されました。PCAの問題は、特徴ベクトルのみが考慮されることです。PCAは、特徴を数値スコア関連付けません。yyy 実用的なアプリケーション:多数の問題インスタンス(巡回セールスマンの問題など)と、問題を解決するためのいくつかのアルゴリズムがある場合。インスタンスを解決するたびに、インスタンスの解決にかかった合計時間(=スコア)を測定できます。さらに、インスタンスごとに、インスタンスのサイズ、グラフの直径など、いくつかの機能を取得できます。これらの機能のどれが計算時間を最もよく説明しますか?

2
予測を組み合わせて全体的な予測品質を向上させることは可能ですか?
これはバイナリ分類の問題です。最小化されているメトリックは、対数損失(またはクロスエントロピー)です。私の情報のためだけに、私は正確さの数値も持っています。非常にバランスの取れた大規模なデータセットです。非常に単純な予測手法では、約50%の精度と0.693の対数損失があります。私がかき集めることができた最高のものは、52.5%の精度と0.6915のログ損失です。ログの損失を最小限に抑えようとしているため、常に一連の確率(predict_probasklearnおよびkerasの関数)が得られます。それがすべての背景ですが、今は問題です。 2つの異なる手法を使用して、同等の精度とログ損失メトリックを持つ2つの異なる予測セットを作成できるとしましょう。たとえば、入力フィーチャの2つの異なるグループを使用して、2つのセットの予測を生成できます。どちらも約52%正確で、<0.692のログ損失です。重要なのは、どちらの予測セットも予測力があることを示しているということです。別の例は、ロジスティック回帰を使用して1つの予測セットを生成し、ニューラルネットを使用してもう1つの予測セットを生成することです。 たとえば、各セットの最初の10は次のとおりです。 p1 = [0.49121362 0.52067905 0.50230295 0.49511673 0.52009695 0.49394751 0.48676686 0.50084939 0.48693237 0.49564188 ...] p2 = [0.4833959 0.49700296 0.50484381 0.49122147 0.52754993 0.51766402 0.48326918 0.50432501 0.48721228 0.48949306 ...] 全体的な予測力を高めるために、2つの予測セットを1つに組み合わせる方法が必要だと考えています。ある? 私はいくつかのことを試し始めました。たとえば、予測の絶対値から0.5(abs( p - 0.5 ))を引いたものを信号と見なし、その間p1でp2信号が大きい場合は、その値を使用します。これは私が望んでいたことをわずかに達成しましたが、ほんのわずかなマージンでした。そして別の例では、それはまったく役に立たなかったようです。興味深いことに、予測力を破壊するようには見えませんでした。

1
マルチエージェントの俳優批評家のMADDPGアルゴリズムの混乱
私は、openAIからの論文「Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments」を理解しようとしています 論文では、サブポリシーからサンプリングすることにより、環境の非定常性の問題に対処していると述べています。 (1)サブサンプリングによって非定常性の問題がどのように解決されるのか、および(2)個々のエージェントに複数の可能な(サブ)ポリシーがある理由-各エージェントに単一の最適なポリシーがあるべきではないのですか?

2
モデリングでの出力変数の部分測定の使用
私の質問は次のとおりです。トレーニングセットで部分的に測定された出力データをどのように使用できますか?これは曖昧なので、風変わりな話で具体化します。 リスにはナッツがありますが、いくつですか? セットアップ 森にはリスのセットと木のセットがあります。リス はナットがあります。リスは、1本の木または森の中のさまざまな木にナッツを保管します。特定のリスがリスの重量と頬の容量などの入力機能から収集したナッツの数を予測したいと思います。SSSTTTsi∈Ssi∈Ss_i \in Sni∈Nni∈Nn_i \in N 研究フェーズ1: リスのサブセットを監視しました。彼らの測定値(体重と頬の容量)を取り、数えました 彼らが集めたナッツの数と 彼らがそれらを保管した何本の木 (例:リス#55は1つのツリーに5つのナッツ、別のツリーに10つのナッツ、別のツリーに500つのナッツ[3つのツリーは不明です]を保存しました) 研究フェーズ2: 木のサブセットを監視しました。リスが私たちの木の1つに到着したら、IDを付け(後で研究サブセットの別の木に行ったかどうかを知るため)、それらを測定し(体重と頬の容量)、落とした木の実の数を数えました。これにより、リスのサブセットの部分的なナットコレクションが測定されました。 (たとえば、ツリー#23では、リス#99から10個、リス#88から50個、ツリー#24では50個のナッツを収集しました...) (重要な注意:リスIDはフェーズ間で保持されません。) 質問 フェーズ2のリスのナットの総数をモデル化するとします。モデリングの結果を増やすために、それらの部分ナット測定をどのように使用できますか? さらに、部分的に測定された出力をトレーニングセットにどのように導入できますか?

2
逆伝播の背後にある直感の明確化
私は、日常生活で使用している機械学習アルゴリズムの計算とメカニズムを理解するために、少し時間をかけています。 CS231nコースのバックプロパゲーションに関する文献を研究しているので、研究を続ける前にチェーンルールを正しく理解していることを確認したいと思います。 私がシグモイド関数を持っているとしましょう: σ(x)=11+e−xσ(x)=11+e−x\sigma(x) = \frac{1}{1+e^{-x}} この場合、x=w0x0+w1x1+w2x=w0x0+w1x1+w2x=w0x0+w1x1+w2 この関数を計算グラフとして書くことができます(今のところ色付きの値は無視しています): 我々は、グループシグモイドの勾配を計算するためのモジュール化ノード缶単一の導出にその入力を:w.r.t.w.r.t.w.r.t. dσ(x)dx=(1−σ(x))σ(x)dσ(x)dx=(1−σ(x))σ(x)\frac{d\sigma(x)}{d x}=(1 - \sigma(x))\sigma(x) 最初に、前方伝搬を実行して、各ユニットの出力を取得します。 w = [2,-3,-3] x = [-1, -2] # Compute the forward pass product = [w[0]*x[0]+w[1]*x[1]+w[2]] activation = 1 / 1 + math.exp(-product) 活性化の勾配を計算するには、上記の式を使用できます。 grad_product = (1 - activation) * activation 私が混乱しているかもしれない、または少なくとも直感的ではないと感じる場所では、xおよびの勾配を計算していwます: grad_x = [w[0] * activation …

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.