タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

1
機械学習と欠落データ:インピュート、そうであればいつ?
私は通常、物事の効果推定/因果推論の側面に重点を置いています。そこでは、データが欠落している場合の複数の代入にかなり慣れていますが、今は機械学習の側面にあるプロジェクトに取り組んでいます。 我々は持っている期待しているいくつかのそれは現実世界の医療データ、常にいますので、データの欠落を。 一部の協力者の傾向は、完全なデータを持つ被験者のみが使用される完全なケースタイプ分析を使用することですが、これらの欠落したデータパターンが影響を与える可能性があると感じるため、これは少し緊張します。 機械学習タスクの「ベストプラクティス」は、何らかの形の代入を使用することですか?もしそうなら、これは特徴選択の前に行われるべきですか?

1
機械学習における線形回帰と統計モデルの違い
機械学習と統計モデルの主な違いは、後で特定のタイプのデータ分布を「想定」し、その異なるモデルパラダイムと取得した統計結果(p値、F統計など)に基づいていることを理解しました。 、t-statなど)。ただし、機械学習の場合は、データの分布を気にせず、予測に関心があります。 Mllibのドキュメントを調べていたところ、線形回帰では分布を指定していることがわかりました。しかし、MLLIBは機械学習パッケージです。それで、私は次の質問をします: 1)MLと統計的手法の理解が間違っていますか? 2)Sparkは線形回帰とGLMに統計モデリングを使用していますか? ありがとう! 注:機械学習と統計的手法の違いに関するすばらしい記事がたくさんあります。しかし、これはSpark MLLIBに関連しています。

2
オブジェクトクラスの数が増えると、オブジェクト検出の精度が向上または低下します
k個のオブジェクトクラスがラベル付けされたN個の画像を持つオブジェクト検出データセット(たとえば、MS COCOまたはPascal VOC)があるとします。ニューラルネットワーク(例:Faster-RCNNまたはYOLO)をトレーニングし、精度を測定します(例:IOU@0.5)。 ここで、x個の追加オブジェクトクラスを導入し、対応するラベルを元のデータセットに追加して、k + x個のオブジェクトクラスがラベル付けされたN個の画像を持つデータセットを提供します。 訓練されたネットワークの精度は増加または減少しますか? 具体的には、約20のオブジェクトクラスを持つ交通標識データセットがあります。現在、追加の交通標識クラスを追加することを考えています(新しいイメージを追加したり、ネットワークアーキテクチャを変更したりせずに、新しいクラスにラベルを付けます)。これにより、パフォーマンスが低下するか増加するか疑問に思っています。 一方では、オブジェクトクラスが増えると、クラス間の区別が難しくなると思います。さらに、ニューラルネットワークは限られた量の情報しか保持できません。つまり、クラスの数が非常に多くなると、すべてのクラスに対応するのに十分な重みがない可能性があります。 反対に、オブジェクトクラスが増えると、ニューラルネットワークに役立つラベルが増えることになります。さらに、クラス間で学習効果を伝達すると、ネットワークの精度が向上する場合があります。 私の意見では、各ネットワークアーキテクチャにはある種のスイートスポットがあるはずですが、このトピックに関する文献、研究、実験は見つかりませんでした。

2
なぜ治療コーディングはランダムな傾きと切片の間の相関をもたらすのですか?
実験的処理変数に2つのレベル(条件)がある被験者内および項目内の要因計画を考えます。をm1最大モデルとm2非ランダム相関モデルにします。 m1: y ~ condition + (condition|subject) + (condition|item) m2: y ~ condition + (1|subject) + (0 + condition|subject) + (1|item) + (0 + condition|item) Dale Barr はこの状況について次のように述べています。 編集(2018年4月20日):Jake Westfallが指摘したように、次のステートメントはこの Webサイトの図1および2に示されているデータセットのみを参照しているようです。ただし、基調講演は変わりません。 偏差コーディング表現(条件:-0.5 vs. 0.5)m2では、被験者のランダムな切片が被験者のランダムな傾きと無相関である分布が可能です。最大モデルのみm1が、2つが相関している分布を許可します。 治療コーディング表現(条件:0対1)では、被験者のランダム切片が被験者のランダムな傾きと無相関であるこれらの分布は、無作為相関モデルを使用してフィッティングできません。治療コード表現における勾配と切片。 なぜ治療コーディングは 常に ランダムな傾きと切片の間に相関関係が生じますか?

1
分類子を高いバイアスまたは高い分散であるとどのように決定しますか?
分類子のバイアスと分散により、分類子がデータをそれぞれ過小および過大に適合できる程度が決まります。高バイアスまたは高分散として特徴付けられる分類子をどのように決定できますか? バイアス分散のトレードオフとその分解とは何か、トレーニングデータとモデルにどのように依存する可能性があるかについては、かなり明確です。たとえば、データにターゲット関数に関連する十分な情報が含まれていない場合(単純に言えば、サンプルがないため)、分類子は誤った仮定を行う可能性があるため、高いバイアスを経験します。逆に、分類子が所定のトレーニングデータ(たとえば、複数のエポックを実行する多数のノードを含むANN、または深さが高い決定木)にぴったりと適合している場合、見えないものを予測するために一般化できないため、分散が大きくなります。サンプル。 ただし、高バイアス低分散分類器、または低バイアス高分散分類器の選択についての講義を見る場合があります。たとえば、ナイーブベイズは高バイアス低分散分類器と見なされます(条件付き独立性の仮定によるものと思われます)。これをどのように決定しますか?では、SVM、ID3、ランダムフォレスト、および NNをどのように特徴付けるのでしょうか。それらは高いバイアスまたは高い分散ですか? kkk

1
モンテカルロの相互検証手順は有効ですか?
K分割交差検証は次のステップで構成されると思いました。 データをランダムに分割 KKK チャンク。 に合う K− 1K−1K-1 チャンク。 残りのチャンクを予測します。予測を維持します。 すべての残りについて2〜3を繰り返します。 K− 1K−1K-1 の組み合わせ KKK 1つのチャンクを省略したチャンク。 すべての予測を真の値と比較する損失統計を評価します。 今私は(見てきたxbart中でdbartsパッケージは、次の手順): データをランダムに分割 KKK チャンク。 に合う K− 1K−1K-1 チャンク。 残りのチャンクを予測します。損失統計を評価して保持します。 1〜3を繰り返す NNN 回。 平均 NNN 他の方法での損失統計またはプール。 手順4と5の違いに注意してください。 最初の手順は標準であり、主要な教科書で推奨されています。2番目の手順は新しいようです。なぜやらないのかすぐにはわかりませんが、分散の観点からは最適ではないようです。2番目の手順に賛成または反対の議論はありますか? 2番目のアプローチは、上記のパッケージに実装されており、これが間違っているのではないかと思います。

2
機械学習を使用してテキストから特定の情報を抽出する方法は?
以下のようなテキストがあり、通常2/3の文と100〜200文字のテキストがあるとします。 ジョニーはウォルマートから50ドルの牛乳を買いました。今、彼はたったの20ドルしか残していない。 抽出したい 人名:ジョニー 使用済み:50ドル 残金:20ドル。 使用した場所:ウォルマート。 私はリカレントニューラルネットワークに関する多くの資料を調べてきました。RNNでcs231nビデオを見て、次のキャラクター予測を理解しました。これらのケースでは、確率を使用して次の文字を見つけるために出力クラスとして使用できる26文字のセットがあります。しかし、ここでは出力クラスがわからないため、問題はまったく異なるように見えます。出力は、テキスト内の単語や数字に依存します。ランダムな単語や数字を使用できます。 畳み込みニューラルネットワークでもテキストの特徴を抽出できることをQuoraで読みました。それもこの特定の問題を解決できるかどうか疑問に思いますか?

1
ベイジアンネットワークと相関ルール
Aprioriアルゴリズムは、いくつかの含意規則を見つけます。 同様の結果がベイジアンネットワークによって提供されます。 本質的な違いは何ですか?具体的な長所/短所は何ですか? 編集: Aprioriアルゴリズムは、次の図(このホワイトペーパーから取得)で視覚的に確認できるように、一種の影響としてアソシエーションルールを生成します。

4
機械学習コース:数学の説明
単純にアルゴリズムの適用方法を教えるのではなく、アルゴリズムの背後にある数学を提供する機械学習コースを探しています。Udacity Into to Machine LearningとAndrew NgのCourseraに関するコースを見てきましたが、どちらも私にはあまりにも適用されているようです。教科書の推奨事項も大歓迎です。

1
線形回帰に関してOLS推定器のバイアスがゼロに等しいのはなぜですか?
バイアス分散のトレードオフの概念を理解しています。私の理解に基づくバイアスは、単純な分類子(例:線形)を使用して複雑な非線形決定境界をキャプチャするため、エラーを表します。そのため、OLS推定器には高いバイアスと低い分散があると期待していました。 しかし、私にはOLS = 0のバイアスが意外であるというガウスマルコフ定理に出くわしました。OLSのバイアスが高いと予想していたため、OLSのバイアスがどのようにゼロであるかを説明してください。バイアスの理解が間違っているのはなぜですか?

2
ガウスプロセスのバイナリ分類で、なぜシグモイド関数がガウス関数よりも好ましいのですか?
私は現在「機械学習のためのガウス過程」を研究しており、第3章では後p(y∗|X,y,x∗)p(y∗|X,y,x∗)p(y_*|X,\mathbf{y},\mathbf{x}_*) (eq。3.10)と潜在変数事後 p(f∗|X,y,x∗)p(f∗|X,y,x∗)p(f_*|X,\mathbf{y},\mathbf{x}_*)(eq。3.9)(3.9)のシグモイド尤度と(3.10)のシグモイド関数により、一般に解析的に解くことができません。方程式を調べなくても済むように、次のようにします。 p(y∗=+1|X,y,x∗)p(f∗|X,y,x∗)=∫σ(f∗)p(f∗|X,y,x∗)df∗=∫p(f∗|X,x∗,f)p(f|X,y)df(3.10)(3.9)p(y∗=+1|X,y,x∗)=∫σ(f∗)p(f∗|X,y,x∗)df∗(3.10)p(f∗|X,y,x∗)=∫p(f∗|X,x∗,f)p(f|X,y)df(3.9) \begin{align} p(y_*=+1|X,\mathbf{y},\mathbf{x}_*) &= \int\sigma(f_*)\,p(f_*|X,\mathbf{y},\mathbf{x}_*)\,df_*\quad\quad&\mbox{(3.10)} \\ p(f_*|X,\mathbf{y},\mathbf{x}_*) &= \int p(f_*|X,\mathbf{x}_*,\mathbf{f})\,p(\mathbf{f}|X,\mathbf{y})\,d\mathbf{f}&\mbox{(3.9)} \end{align} 私の主な質問は次のとおりです: fff ガウス過程としてモデル化された、ガウス関数の代わりにシグモイド関数を(どちらの方程式でも)使用する理由 p(y=+1|f(x))=g(f(x))≜exp{−f2(x)2}?p(y=+1|f(x))=g(f(x))≜exp⁡{−f2(x)2}? p(y=+1\,|\,f(\mathbf{x}))=g(f(\mathbf{x}))\triangleq\exp\left\{-\frac{f^2(\mathbf{x})}{2}\right\} \enspace? これは、両方の積分に対する閉じた形のソリューションにつながります。ガウス関数はシグモイド関数のように単調ではありませんが、GPは複数のターニングポイントを持つ関数を生成できるため、単調性は不要のようです。がトレーニングデータから離れているときに(3.10)がに確実に収束するようにするには、おそらく前のに平均を与えることで十分でしょう。: ここで、はのベクトルであり、はトレーニングサンプルの数です。 1212\frac{1}{2}x∗x∗\mathbf{x_*}p(f|X)p(f|X)p(\mathbf{f}|X)E[f|X]ω=ω1n=−2ln12−−−−−−√,E[f|X]=ω1nω=−2ln⁡12, \begin{align} \mathbb{E}[\mathbf{f}|X] &= \omega\mathbf{1}_n \\ \omega&=\sqrt{-2\ln\frac{1}{2}} \enspace, \end{align} 1n1n\mathbf{1}_nnnn 111nnng(ω)=12.g(ω)=12. g\left(\omega\right)=\frac{1}{2}\enspace. シグモイド尤度の動作とは対照的に、ガウス尤度は、負のラベルの付いた入力ポイントに対して大きな(正または負の)エントリを優先し、正のラベルの付いたポイント小さなエントリを優先します。ff\mathbf{f}ff\mathbf{f} ガウス関数は、シグモイドでは発生しない問題を引き起こしますか?シグモイドの代わりにガウス関数がバイナリGP分類で使用された論文はありますか? 2017年5月25日更新 さらに考察すると、上記で提案されたゼロ以外の事前平均は、の符号がどうあるべきかについてのあいまいさを解決するのにも役立ちます(はどちらの符号も優先しません;)。以前の平均がゼロの場合、の平均がゼロであるため、このあいまいさを解決することは重要であると思われます事前確率と尤度はどちらも偶関数であるため、で定義された尤度の下でもゼロになります。すなわち: fffgggg(f(x))=g(−f(x))g(f(x))=g(−f(x))g(f(\mathbf{x}))=g(-f(\mathbf{x}))p(f|X)p(f|X)p(\mathbf{f}|X)p(f|X,y)p(f|X,y)p(\mathbf{f}|X,\mathbf{y})gggff\mathbf{f}p(y|f)p(yi|fi)∴E[f|X]=0→p(−f|X,y)=∏i=1np(yi|fi)={g(fi)1−g(fi),yi=+1,yi=−1=p(y|−f)p(−f|X))p(y|X)=p(y|f)p(f|X))p(y|X)=p(f|X,y).p(y|f)=∏i=1np(yi|fi)p(yi|fi)={g(fi),yi=+11−g(fi),yi=−1∴E[f|X]=0→p(−f|X,y)=p(y|−f)p(−f|X))p(y|X)=p(y|f)p(f|X))p(y|X)=p(f|X,y). \begin{align} p(\mathbf{y}|\mathbf{f})&=\prod_{i=1}^n p(\mathbf{y}_i|\mathbf{f}_i) \\ p(\mathbf{y}_i|\mathbf{f}_i) &= \begin{cases} g(\mathbf{f}_i) & ,\;\mathbf{y}_i=+1 \\ …

3
の勾配降下
新しい蒸留ジャーナルからの投稿、Why Momentum Really Worksを読んでいます。混乱を招く部分に至る主要な方程式を言い換えますが、この投稿では直感について詳しく説明しています。 勾配降下アルゴリズムは、次の反復プロセスによって与えられます wk+1=wk−α∇f(wk)wk+1=wk−α∇f(wk)w^{k+1} = w^k-\alpha \nabla f(w^k) どこ wkwkw^k 反復の値です kkk、学習率は αα\alpha そして ∇f(w)∇f(w)\nabla f(w) 関数の勾配です fff で評価された www。関数fff 最小化したい。 運動量を伴う勾配降下は、降下に「記憶」を追加することによって与えられます。これは、2つの方程式で表されます。 zk+1wk+1=βzk+∇f(wk)=wk−αzk+1zk+1=βzk+∇f(wk)wk+1=wk−αzk+1\begin{align} z^{k+1} &= \beta z^k + \nabla f(w^k) \\ w^{k+1} &= w^k - \alpha z^{k+1} \end{align} 次のセクション「最初のステップ:勾配降下」では、著者は凸2次関数を検討します。 f(w)=12wTAw−bTw,w∈Rn,A∈Rn,nf(w)=12wTAw−bTw,w∈Rn,A∈Rn,nf(w) = \frac12w^TAw-b^Tw, \quad w \in \mathbb{R}^n, A \in …

3
ハイパーパラメーターを最適化するためのグリッド検索を使用したK分割交差検証の段階的な説明
私は、k分割(および1つを残す)交差検証の利点、およびトレーニングセットを分割して3番目のホールドアウト「検証」セットを作成する利点をよく知っています。ハイパーパラメータの選択に基づいてパフォーマンスをモデル化するため、それらを最適化および調整し、実際のテストセットで最終的に評価するために最適なものを選択できます。これらの両方をさまざまなデータセットに個別に実装しました。 ただし、これらの2つのプロセスを統合する方法は正確にはわかりません。私はそれができることを確かに知っています(入れ子にされた相互検証、そうですか?)、私は人々がそれを説明するのを見ましたが、プロセスの詳細を実際に理解したほど十分に詳細ではありません。 分割とループの正確な実行が明確ではないが、このプロセス(このような)をほのめかしている興味深いグラフィックスのページがあります。ここで、4番目は明らかに私がやりたいことですが、プロセスは不明確です。 このサイトには以前の質問がありますが、それらは検証セットをテストセットから分離することの重要性を概説していますが、どれもこれを実行する正確な手順を指定していません。 それは次のようなものですか?k個のフォールドごとに、そのフォールドをテストセットとして扱い、別のフォールドを検証セットとして扱い、残りをトレーニングしますか?これは、データセット全体をk * k回繰り返す必要があるようです。そのため、各フォールドは、少なくとも1回はトレーニング、テスト、および検証として使用されます。入れ子の交差検証は、k分割のそれぞれの中でテスト/検証分割を行うことを意味するようですが、特にkが高い場合、これは効果的なパラメーター調整を可能にするのに十分なデータではありません。 (事前に指定しないように)パラメータ調整を実行しながら、k分割交差検証(最終的にすべてのデータポイントをテストケースとして扱うことができる)を可能にするループと分割の詳細な説明を提供して、誰かが私を助けてくれませんかモデルパラメータ、および代わりに別のホールドアウトセットで最高のパフォーマンスを発揮するパラメータを選択しますか?)

1
深い信念ネットワーク(DBN)がほとんど使用されないのはなぜですか?
私はイアンとアロンによる深層学習についてこの本を読んでいました。DBNの説明では、DBNは支持を失い、めったに使用されていません。 深い信念ネットワークは、MNISTデータセットでカーネル化されたサポートベクターマシンよりも優れたパフォーマンスを発揮することで、深いアーキテクチャが成功することを実証しました(Hinton et al。、2006)。今日、ディープビリーフネットワークは、他の教師なしまたは生成型学習アルゴリズムと比較しても、ほとんど支持されなくなっており、ほとんど使用されていませんが、ディープラーニングの歴史における重要な役割が認められています。 理由がわかりません。

2
障害が発生する前にその兆候を特定するための予測保守モデル
状況 センサーデータを使用して、障害が発生する前にマシンの障害を予測する問題に取り組んでいます。調査する方法についてアドバイスが必要です。 具体的には、実際に障害が発生する前に、差し迫った障害の兆候を特定したいと考えています。理想的には、これにより、障害が発生する前に何が起こっても修正できる十分なリードタイムが得られます。 問題 私がいる概念的なロードブロックは、さまざまな分類モデル(ロジスティック回帰、決定木、最近傍など)をデータに適合させて、その時点で特定のパラメーターが与えられた場合の失敗の確率を特定できることを知っています。ただし、実際に何かを行うのに十分な時間をかけて、次の障害の兆候を特定する方法を理解することはできません。 可能なアプローチ 私はサバイバル分析に精通していますが、複数のマシンからのデータがないため、修理後にマシンが100%に戻ったとは言えないので、必ずしも適切であるとは思いません。 また、障害が発生した時間を取り、それを1時間戻し、その点をどれだけ正確に予測できるかを考えました。可能な場合は、ターゲットをさらに1時間戻し、自信を持って予測できるリードタイムを確認します。しかし、これが適切かどうかはわかりません。 利用可能なデータ 私が持っているデータは、1台のマシンから1年間にわたって記録されています。2分ごとに記録される約60個のセンサーがあります。これらのセンサーは、マシンを構成するさまざまなコンポーネントの温度(サーモスタットの設定と実際の温度を含む)、マシンの動作速度、マシン全体の蒸気圧、ファン速度、マシンが動作しているかどうかなどの変数を測定します、など センサーの読み取り値に加えて、マシンが実行されていない理由(シフトの変更、予防保守、故障など)も含まれるようにデータセットを充実させました。この記事の最後に、データがどのように表示されるかについての例をまとめました。データセット全体でキャプチャされた多様性の一部をキャプチャするように例を変更しました。実際には、マシンが実行を停止すると、理由にもよりますが、2分から2日の間停止します。また、変数は以下の例のように必ずしもそれほど急速に変化するわけではありませんが、いくつかの種類を提供したいと思いました。 +-----------------+----------+-------------+------------+------------+-------+-------+-----+--------------------------+------------+ | Datetime | CircFan | CircFanAct | EntrySpeed | ExhaustFan | Speed | Temp1 | Run | Reason | TimeBtwRun | +-----------------+----------+-------------+------------+------------+-------+-------+-----+--------------------------+------------+ | 2009-10-19 0:00 | 100 | 600 | 461 | 40 | 45 | 1126 | …

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.