タグ付けされた質問 「machine-learning」

機械学習アルゴリズムは、トレーニングデータのモデルを構築します。「機械学習」という用語は漠然と定義されています。これには、統計学習、強化学習、教師なし学習などとも呼ばれるものが含まれます。常に、より具体的なタグを追加します。

1
カーネルを研究するための機能分析の学習
私はカーネルマシンの理論についてさらに学習しようとしていますが、多くのバックグラウンド計算を学ぶ必要があることを発見しました。そのため、このための優れたリソースを探しています。特に、SchölkopfとSmolaのLearning with Kernelsブックがあり、フーリエ変換、Greenの関数、演算子(たとえば、疑似微分演算子について聞いたことがありません)などについて説明しています。私はこれを使った経験はありませんが、本当に理解したいと思っています。私は確かに個々の例をググることはできますが、もっと包括的な扱いをしたいと思います。 これが曖昧または具体的である場合は申し訳ありませんが、私はカーネルとRKHS理論で快適に作業できるように、背景の数学を体系的に取得し始める方法を見つけるのに本当に苦労しています。どうもありがとう。 更新:私はこれが私に固有のものになるのではないかと心配していたので、私は自分のバックグラウンドを除外しましたが、それが尋ねられたためです:私は、標準の線形代数だけでなく、実際の分析と現代代数の1つのコースを受講しましたそして、多変量計算コース。私は微分方程式を研究していません。私はまた、数学的統計学のいくつかのコースを受講しました(メジャー理論を正式に研究したことはありませんが、メジャー理論のコースをいくつか含みます)。私はこれまでに調べた狭い範囲の統計(LLN、CLT、指数ファミリー、GLM、混合モデル、完全で十分な統計など)に満足していますが、純粋な数学はあまりありません私が感じる背景は私を傷つけ始めています。

2
ガウス分布の変分混合の前のパラメーターの選択
パターン認識と機械学習(Bishop、2007)の第10章に従って、多変量ガウス分布のバニラ変分混合を実装しています。 ベイジアン手法では、事前にガウス逆ウィシャートの(ハイパー)パラメーターを指定する必要があります。 α0α0\alpha_0 (事前のディリクレ濃度パラメーター); ν0ν0\nu_0 (逆ウィシャート分布の自由度); β0β0\beta_0 (ガウス逆Wishart分布の疑似観測); m0m0\mathbf{m}_0 (ガウス分布の平均)。 W0W0\mathbf{W}_0 (逆ウィシャートのスケール行列)。 一般的な選択肢は α0=1α0=1\alpha_0 = 1、 ν0=d+1ν0=d+1\nu_0 = d + 1、 β0=1β0=1\beta_0 = 1、 m0=0m0=0\textbf{m}_0 = \textbf{0}、 W0=IdW0=Id\textbf{W}_0 = \textbf{I}_d、 どこ ddd 空間の次元です。 当然のことながら、事後はパラメータの選択に強く依存する可能性があります(特に、 W0W0\textbf{W}_0 コンポーネントの数に大きな影響を与えます。 α0α0\alpha_0)。ためにメートル0m0\textbf{m}_0 そして W0W0\textbf{W}_0、上記の選択は、データがある程度正規化されている場合にのみ意味があります。 一種の経験的なベイズアプローチに従って、私は設定を考えていました メートル0m0\textbf{m}_0 そして W− 10W0−1\textbf{W}_0^{-1} データの経験的平均および経験的共分散行列に等しい(後者の場合、おそらく対角線のみを考慮することができます。また、サンプルの共分散行列を乗算する必要があります ν0ν0\nu_0)。これは賢明でしょうか?パラメータを設定する他の合理的な方法について何か提案はありますか?(完全に階層的なベイズとDPGMMを使用せずに) (ここにも同様の質問がありますが、私の質問に関連する回答はありません。)

6
数学の教育を受けずにニューラルネットワークを研究することは理にかなっていますか?
現代の機械学習テクノロジーとツール(例:TensorFlow、Theanoなど)を考えると、エントリのしきい値は最近低くなっているようで、Pythonなどでプログラミングして興味深いものを構築するのに十分です。この点をサポートするもう1つの情報源は、CourseraのMachine Learning Specializationであり、FAQに次のように記載されています。 どのような背景知識が必要ですか? コンピュータプログラミングの経験が必要です。この専門分野のほとんどの割り当ては、Pythonプログラミング言語を使用します。この専門分野認定は、スキルをデータサイエンスと機械学習に拡大したい科学者やソフトウェア開発者向けに特別に設計されていますが、基本的な数学とプログラミングのスキルを持ち、データからインテリジェンスを引き出すことに興味がある人に適しています。 一方、他にもたくさんのオンラインコース(たとえば、Costraでのスタンフォード機械学習や、UdacityでのGoogleのディープラーニング)や、数学が満載のS.ヘイキン、ニューラルネットワーク:包括的な財団などの古典的な本があります。。私は大学で数年間、統計、行列、積分などを含めて数学を勉強していましたが、あまりにも長い間使われていないので、これらの方程式を見ただけでは絶望感を覚えます。Knuthによる具象数学でさえ、非常に遅いペースで認識されているので、それを完了するのは不可能のようです。 したがって、次の質問が発生します。 数学の知識は浅いがプログラミングスキルのある人がニューラルネットワーク/機械学習の研究に飛び込むのは理にかなっていますか。 高レベルのツールのみを使用して、atariをプレイしているような、この分野で興味深いプロジェクトを構築することは可能ですか? それとも、時間がかかりすぎて、自分自身を奮闘させたり、他のことをしたりしない方が良いでしょうか?

2
SGDトレーニングでの小さいバッチサイズの処理
確率的勾配降下法(SGD)を使用して、大規模モデル(カフェを使用したディープネット)をトレーニングしようとしています。 問題は、私がGPUメモリ容量の制約を受けているため、各確率的勾配推定に対して大きなミニバッチを処理できないことです。 トレーニングでこの不安定さを克服するにはどうすればよいですか? 私が考えていたのは、モーメンタムを使用して、デフォルトの通常の設定よりも高い値に設定することでした。これは有効な戦略ですか? Caffeをたまたま使用している人にとって、Caffeがすでにミニバッチ全体の勾配の累積を実装していることを知るのは興味深いかもしれません(Indie Alによって提案されています)。あなたは、単に定義する必要がiter_sizeで'solver.prototxt'。 これはpytorchでも実行できます。たとえば、この投稿を参照してください。


1
畳み込みニューラルネットワークに関するいくつかの説明
完全に接続されたレイヤーのたたみ込みレイヤーへの変換について読むときは、http://cs231n.github.io/convolutional-networks/#convertに投稿されています。 次の2つのコメントについて混乱しているだけです。 この変換により、元のConvNetを大きな画像内の多くの空間位置にわたって単一の順方向パスで非常に効率的に「スライド」できることがわかります。 標準のConvNetは、任意のサイズの画像で機能する必要があります。たたみ込みフィルターは画像グリッドを横切ってスライドできるので、元のConvNetをより大きな画像の任意の空間位置でスライドする必要があるのはなぜですか? そして 32ピクセルのストライドで384x384画像の224x224クロップ全体で元のConvNet(FCレイヤー付き)を個別に評価すると、変換されたConvNetを1回転送するのと同じ結果が得られます。 ここで「32ピクセルのストライド」とはどういう意味ですか?それはフィルターサイズを指していますか?384 * 384画像の224 * 224作物について話すとき、それは224 * 224の受容野を使用することを意味しますか? 元のコンテキストでは、これら2つのコメントを赤でマークしました。
弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.