タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

3
巨大なデータセットから学ぶときのアプローチ?
基本的に、巨大なデータセットに対して学習するには、2つの一般的な方法があります(時間/スペースの制限に直面している場合)。 不正行為:)-「管理可能な」サブセットのみをトレーニングに使用します。リターンの減少の法則により、精度の損失は無視できる場合があります。モデルの予測パフォーマンスは、すべてのトレーニングデータがモデルに組み込まれる前に、通常はフラットになります。 並列計算-問題を小さな部分に分割し、それぞれを別々のマシン/プロセッサーで解決します。ただし、アルゴリズムの並列バージョンが必要ですが、よく知られたアルゴリズムの多くは自然に並列です:最近傍、決定木など。 他の方法はありますか?それぞれを使用するときの経験則はありますか?それぞれのアプローチの欠点は何ですか?

1
MFCCは、検索システムに音楽を表現する最適な方法ですか?
信号処理手法であるMel周波数Cepstrumは、機械学習タスクで使用するために楽曲から情報を抽出するためによく使用されます。この方法は短期間のパワースペクトルを与え、係数は入力として使用されます。 音楽検索システムの設計では、そのような係数は作品の特性と見なされます(明らかに一意である必要はありませんが、区別されます)。ネットワークでの学習により適した特性はありますか?エルマンネットワークのようなもので使用されている楽曲の低音進行のような時間的に変化する特性は、より効果的に機能しますか? どの特性が、分類が行われる可能性のある十分に広範なセットを形成するでしょうか?

8
過去の購入のデータから、どのアルゴリズムを使用して消耗品の使用を予測できますか?
おそらく単純だが興味深い問題について考えて、以前の購入の完全な履歴を踏まえて、近い将来に必要になる消耗品を予測するためのコードを書きたいと思います。この種の問題には、より一般的でよく研究された定義があるはずです(これがERPシステムなどのいくつかの概念に関連していると誰かが示唆しました)。 私が持っているデータは、以前の購入の完全な履歴です。私が紙の供給を見ているとしましょう、私のデータは(日付、シート)のようになります: 2007-05-10 500 2007-11-11 1000 2007-12-18 1000 2008-03-25 500 2008-05-28 2000 2008-10-31 1500 2009-03-20 1500 2009-06-30 1000 2009-09-29 500 2009-12-16 1500 2010-05-31 500 2010-06-30 500 2010-09-30 1500 2011-05-31 1000 定期的に「サンプリング」されないので、時系列データとしての資格はないと思います。 毎回の実際の在庫レベルに関するデータはありません。このシンプルで限られたデータを使用して、(たとえば)3、6、12か月で必要になる紙の量を予測します。 これまでのところ、私が探しているものは外挿と呼ばれ、それ以上ではないことがわかりました:) このような状況で使用できるアルゴリズムは何ですか? また、前のアルゴリズムと異なる場合、どのアルゴリズムが現在の供給レベルを示すいくつかのデータポイントを利用することもできますか(たとえば、日付XIにY枚の紙が残っていることがわかった場合)。 これについてより良い用語を知っている場合は、質問、タイトル、タグを自由に編集してください。 編集:それが価値があるもののために、私はこれをPythonでコーディングしようとしています。多かれ少なかれアルゴリズムを実装するライブラリがたくさんあることは知っています。この質問では、実際の実装は読者の練習問題として残して、使用できる概念と手法を探っていきたいと思います。

6
2つの異なるランダムフォレストモデルのR-2乗を比較する
RのrandomForestパッケージを使用してランダムフォレストモデルを開発し、サンプルよりも多くの予測子を持つ「広い」データセットで継続的な結果を説明しようとしています。 具体的には、1つのRFモデルをフィッティングして、重要と思われる75個までの予測変数のセットから手順を選択できるようにしています。 以前にここに投稿したアプローチを使用して、予約済みテストセットの実際の結果をモデルがどの程度予測できるかをテストしています。 ...またはR: 1 - sum((y-predicted)^2)/sum((y-mean(y))^2) しかし、これで追加できる〜25の予測変数が追加されました。〜100の予測子のセットを使用すると、R²が高くなります。これを統計的にテストしたいのですが、言い換えると、〜100の予測子のセットを使用した場合、モデルのテストは、〜75の予測子を使用したモデルの近似よりもデータのテストで大幅に優れています。つまり、RFモデルのテストから得られたR²は、完全なデータセットに適合し、削減されたデータセットでのRFモデルのテストから得られたR²よりも大幅に高くなります。 これはパイロットデータであり、追加の25の予測子を取得するのは高価であり、大規模な追跡調査でこれらの予測子を測定するために支払う必要があるかどうかを知る必要があるため、これは私にとってテストにとって重要です。 なんらかのリサンプリング/順列アプローチを考えているのですが、何も思い浮かびません。

2
AUCを使用する根拠は?
特に機械学習の文献のコンピューターサイエンス指向の側面では、AUC(レシーバーオペレーターの特性曲線の下の面積)が分類子を評価するための一般的な基準です。AUCを使用する理由は何ですか?たとえば、最適な決定が最良のAUCの分類器である特定の損失関数はありますか?

1
モデルの尤度がnullより有意に高くない場合の(GAM)回帰係数の有意性
私は、Rパッケージgamlssを使用して、データのゼロインフレベータ分布を想定して、GAMベースの回帰を実行しています。モデルには説明変数が1つしかないため、基本的には次のようになりますmymodel = gamlss(response ~ input, family=BEZI)。 アルゴリズムは、説明変数が平均(μ)に与える影響の係数と、k (input )= 0の関連するp値を次のように与えます。kkkμμ\muk (入力)= 0k(入力)=0k(\text{input})=0 Mu link function: logit Mu Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) -2.58051 0.03766 -68.521 0.000e+00 input -0.09134 0.01683 -5.428 6.118e-08 上記の例でわかるように、仮説は高い信頼度で棄却されます。k (入力)= 0k(入力)=0k(\text{input})=0 次にnullモデルを実行null = gamlss(response ~ 1, family=BEZI)し、尤度比検定を使用して尤度を比較します。 p=1-pchisq(-2*(logLik(null)[1]-logLik(mymodel)[1]), df(mymodel)-df(null)). (上記のように)入力の係数が非常に有意であると報告されていても、多くの場合、になります。私はこれを非常に珍しいと思います-少なくとも、線形またはロジスティック回帰の経験では決して発生しませんでした(実際、これは、gamlssでゼロ調整されたガンマを使用しているときも発生しませんでした)。p > 0.05p>0.05p>0.05 私の質問は、これが当てはまる場合でも、応答と入力の間の依存関係を信頼できるかどうかです。

1
計量経済学的手法の実際のアプリケーションの成功の文書化された/再現可能な例?
この質問は非常に広範に聞こえるかもしれませんが、ここで私が探しているものです。計量経済学的手法に関する優れた本や計量経済学的手法に関する優れた解説記事がたくさんあることは知っています。このCrossValidated 質問で説明されているように、計量経済学の再現可能な優れた例もあります。実際、この質問の例は、私が探しているものに非常に近いものです。これらの例で唯一欠けているのは、それらが調査レポートにすぎず、実際のアプリケーションでの調査結果の経緯についての言及がないことです。 私が探しているのは、理想的には次の特性を持つ計量経済理論の実際のアプリケーションの文書化された/再現可能な例です。 それらは再現可能である必要があります。つまり、データの詳細な説明(およびデータへのポインタ)、計量経済学的手法、およびコードが含まれている必要があります。コードはR言語であるのが理想的です。 十分に定量化された成功の測定基準に従って、技術が現実の世界で成功したことを示す詳細なドキュメントがあるはずです(たとえば、「この技術は需要の予測を改善することができ、ここに含まれる数があるため、収益の増加に役立ちました」)。 ここでは、計量経済学という用語をかなり広く使用しています。つまり、あらゆる種類のデータマイニング、統計データ分析、予測、予測、機械学習の手法を意味します。そのような例を見つける際の1つの差し迫った問題:計量経済学の多くの成功したアプリケーションは営利目的の設定で行われるため、独自のものであるため、手法がうまく機能した場合、おそらく公開されません(これは、独自の取引の場合に特に当てはまります)。ただし、(1)と(2)の両方ではないにしても、少なくとも上記(2)の特性を持つ例が公開されていることを期待しています。

4
Ross QuinlanのC5.0へのMATLABおよびRインターフェースの構築
私はMATLABおよびRインターフェイスを構築検討しているロス・クインランのC5.0(それに慣れていない方のために、C5.0は決定木アルゴリズムおよびソフトウェアパッケージである;の延長C4.5)、そして私がしようとしています作成する必要があるコンポーネントの感覚をつかんでください。 私がC5.0について見つけた唯一のドキュメントはこちらです。これはSee5(C5.0へのWindowsインターフェース?)のチュートリアルです。タールファイルはMakefileの、ないのReadmeファイルまたは任意の追加のドキュメントが付属しています。 上記のチュートリアルで読んだ内容から、C5.0はASCIIベースの表現を使用して入力と出力を処理します。また、MATLABまたはRとC5.0の間でバイナリデータを直接渡すインターフェイスの構築も検討しています。C5.0のデータ表現は他の機械学習/分類ソフトウェアで使用されていますか? 以前にID3、C4.5、またはC5.0へのMATLABまたはRインターフェイスを構築しようとした人はいますか? ありがとう

1
Beyerらの相対コントラスト定理です。論文:「高次元空間における距離計量の意外な振る舞いについて」誤解を招く?
これは、次元の呪いに言及するときに頻繁に引用され、 (相対コントラストと呼ばれる右手の式) limd→∞var(||Xd||kE[||Xd||k])=0,then:Dmaxkd−DminkdDminkd→0limd→∞var(||Xd||kE[||Xd||k])=0,then:Dmaxdk−DmindkDmindk→0 \lim_{d\rightarrow \infty} \text{var} \left(\frac{||X_d||_k}{E[||X_d||_k]} \right) = 0, \text{then}: \frac{D_{\max^{k}_{d}} - D_{\min^{k}_{d}}}{D_{\min^{k}_{d}}} \rightarrow 0 この定理の結果は、特定のクエリポイントまでの最大距離と最小距離の差が、高次元空間内の任意のポイントへの最も近い距離ほど速く増加しないことを示しています。これは、最も近いものと最も遠いものの区別が不十分であるため、近接クエリを無意味で不安定なものにします。 リンク しかし、サンプル値の相対コントラストを実際に計算してみると、非常に小さな値を含むベクトルを取得してゼロベクトルまでの距離を計算し、はるかに大きな値を含むベクトルについても同じことを行い、次に、次元が3で次元が10910910^9倍大きい場合、比率は減少しますが、変化は非常に小さいため、実際に使用されている次元の数とは無関係です(または誰かが働いていることを知っていますか?ディメンション付きのデータの場合、グラハムの数のサイズ-この論文で説明されている効果が実際に関連するために必要なサイズだと思います-私はそうではないと思います)。 前述したように、この定理は、ユークリッド空間に基づいて近接度を測定することが高次元空間では不十分な戦略であるという主張を支持するために非常に頻繁に引用されます。この定理が誤解を招くように使用されていると思います。 例:dディメンションあり a=np.ones((d,)) / 1e5 b=np.ones((d,)) * 1e5 dmin,dmax=norm(a), norm(b) (dmax-dmin)/dmin d = 3の 9999999999.0 場合d = 1e8の場合 9999999998.9996738 そして 、d = 1e8の d = 3 99.0に対して、1e5の代わりに1e1を使用します(データが正規化されているとしましょう)。 98.999999999989527

4
ニューラルネットワークとディープラーニングの違い
ニューラルネットワークとディープラーニングの違いに関しては、より多くのレイヤーが含まれている、大規模なデータセット、強力なコンピューターハードウェアなど、複雑なモデルのトレーニングを可能にするいくつかの項目をリストできます。 これらに加えて、NNとDLの違いに関する詳細な説明はありますか?

3
ニューラルネットワークをトレーニングして特定のスタイルで絵を描くことはできますか?
特定のスタイルで絵を描くようにニューラルネットワークをトレーニングすることは可能ですか?(つまり、画像を取得し、トレーニングされたスタイルで再描画します。) そのようなことについて承認された技術はありますか?DeepArtアルゴリズムについて知っています。メイン画像を特定のパターン(たとえば、vangoghify画像)で塗りつぶすのは良いことですが、たとえば、入力されたポートレートから特定のスタイルで漫画を作成するなど、別のものを探しています。

1
TF-IDF対数での対数の使用について
読んでいた: https://en.wikipedia.org/wiki/Tf%E2%80%93idf#Definition しかし、なぜこの式がそのように構築されたのか、正確には理解できないようです。 私が理解していること: iDFは、各文書に用語Sが出現する頻度をある程度のレベルで測定する必要があり、用語が出現する頻度が高くなるにつれて値が減少します。 その観点から iDF(S)=# of Documents# of Documents containing SiDF(S)=# of Documents# of Documents containing S iDF(S) = \frac{\# \text{ of Documents}}{\# \text{ of Documents containing S}} さらに、用語の頻度は、次のように正しく記述できます。 tf(S,D)=# of Occurrences of S in document D# maximum number of occurrences for any string Q in document Dtf(S,D)=# …

2
コンポーネントの数を選択するために、PCAフィットの品質を評価するための適切なメトリックは何ですか?
主成分分析(PCA)の品質を評価するための適切なメトリックは何ですか? このアルゴリズムをデータセットで実行しました。私の目的は、機能の数を減らすことでした(情報は非常に冗長でした)。保持される差異の割合は、保持する情報量の良い指標であることを知っています。冗長な情報を削除し、そのような情報を「失った」ことを確認するために使用できる他の情報メトリックはありますか?

4
ニューラルネットワークの重みの収束
500回繰り返してもニューラルネットワークの重みが収束しない状況になりました。ニューラルネットワークには、1つの入力レイヤー、1つの非表示レイヤー、および1つの出力レイヤーが含まれています。それらは、入力層に約230ノード、非表示層に9ノード、出力層に1出力ノードです。早期停止条件(たとえば、100回の反復後にニューラルネットワークのトレーニングを停止する)を実行する場合、これはモデルにどのような影響を与えますか? また、ニューラルネットワークの重みが収束していない場合の業界標準の作業標準について教えてください。

3
母集団のr二乗変化の信頼区間を取得する方法
簡単な例のために、2つの線形回帰モデルがあると仮定します モデル1は、3つの予測因子を持っているx1a、x2bと、x2c モデル2には、モデル1からの3つの予測子と2つの追加の予測子がx2aあり、x2b 母集団の分散が説明人口回帰式がある モデル1及びρ 2 (2 )増分分散がある集団におけるモデル2によって説明するモデル2についてΔは、ρ 2 = ρ 2 (2 ) - ρ 2 (1 )ρ2(1)ρ(1)2\rho^2_{(1)}ρ2(2)ρ(2)2\rho^2_{(2)}Δρ2=ρ2(2)−ρ2(1)Δρ2=ρ(2)2−ρ(1)2\Delta\rho^2 = \rho^2_{(2)} - \rho^2_{(1)} 私は、の推定のための標準誤差と信頼区間を得ることに興味を持ってい。例にはそれぞれ3および2の予測子が含まれていますが、私の研究対象は、さまざまな数の予測子(たとえば、5および30)に関係しています。私が最初に考えたのは使用していた Δ R 2 、A D J = R 2 のD J (2 ) - R 2 次元J (1 )推定量として、それをブートストラップが、私は確かに、これは適切であるかどうかではなかったです。Δρ2Δρ2\Delta\rho^2Δr2adj=r2adj(2)−r2adj(1)Δradj2=radj(2)2−radj(1)2\Delta r^2_{adj} = r^2_{adj(2)} - r^2_{adj(1)} ご質問 されたの合理的な推定量Δは、ρ …

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.