データセットで予想される最高のパフォーマンス


9

分類のような単純な機械学習の問題があるとします。視覚または音声認識のいくつかのベンチマークで、私は人間として、非常に優れた分類子です。したがって、分類子がどの程度優れているかについて直感があります。

しかし、大量のデータを使用する場合の1つのポイントは、トレーニングした分類子どの程度優れているわからないということです。これは私が個人的にあまり良い分類器ではないデータです(たとえば、EEGデータから人の気分を分類します)。私の問題がどれほど難しいかを直感することは実際には不可能です。

さて、機械学習の問題が発生した場合は、自分がどれだけ優れているかを確認したいと思います。これに対する原則的なアプローチはありますか?どうしますか?

データを視覚化しますか?単純なモデルから始めますか?非常に複雑なモデルから始めて、オーバーフィットできるかどうかを確認しますか?この質問に答えたい場合は何を探していますか?いつやめますか?

回答:


6

これが答えに数えるかどうかわかりません...

これは、夜に起き続ける問題の1つです。より良いモデルを構築できますか?Phd-comicsはそれをうまくまとめています(コミックをアップロードすることが許可されているかどうかわからないので、リンクしただけです)

機械学習のコンテストに参加して得た私の個人的な経験から、経験則を以下に示します。

あなたが分類タスクを与えられたと想像してください。座って、問題への取り組み方を1時間以内にブレインストーミングし、この分野の最新技術を確認してください。この研究に基づいてモデルを作成します。できれば、パラメータをあまり調整しなくても安定していることがわかっているモデルを作成します。結果のパフォーマンスは、達成可能な最大パフォーマンスの約80%になります。

このルールは、最適化にも適用される、いわゆるパレート原理に基づいています。問題があれば、妥当な速度で高速に実行できるソリューションを作成できますが、その時点から、改善と時間の労力の比率は急速に低下します。

いくつかの最後の言葉:新しい分類アルゴリズムに関する論文を読んだとき、著者は彼らの新しい品種をそのような「パレート最適化」アプローチと比較することを期待します。 (いくつかは多かれ少なかれパラメータの最適化を必要とします)。残念ながら、多くはそうしません。


0

従来の方法は、ROCとその領域(AUC)を考慮することです。このアプローチの背後にある理論的根拠は、特定の偽陽性率の真陽性率が高いほど、分類器が優れているということです。考えられるすべての偽陽性率を統合すると、全体的な測定値が得られます。


3
私がOPを理解している限り、彼の問題は分類子のパフォーマンスの測定ではありませんが(これは将来期待されるパフォーマンスの良い見積もりになると期待されます)、どれほどATALLになるか、つまり最大値は何ですか(絶対ではありません)。メトリックごと(AUCは最大で1またはそのようなものです)、ただし特定の問題に対して)
steffen

はい、そういう意味です。
bayerj

0

データを視覚化する方法がある場合、それが最良のシナリオですが、すべてのデータを同じ方法で視覚化できるわけではないため、データを理解するのに役立つ独自の方法でデータを投影する必要がある場合があります。より良い。

ただし、一般的に、私は通常、データの小さなサンプルを取り、それをARFFに変換して、WEKAのさまざまなクラスタリングアルゴリズムを試します。次に、どのアルゴリズムがより良い混同行列を与えるかを確認します。これにより、クラスがどの程度適切に分離されているかについてのヒントが得られ、この特定のアルゴリズムがこのデータに対してより優れている理由を調べることができます。また、クラスターの数を変更します(つまり、k = 2だけを使用するのではなく、k = 3、4などを使用します)。これにより、データに断片化があるかどうか、または1つのクラスが他のクラスよりも断片化されているかどうかがわかります。クラスター化のためにトレーニングポイントとテストポイントを混在させる場合、トレーニングポイントによって表されるクラスターを測定することもできます。一部のクラスターは過剰に表現され、一部のクラスターはあまり表現されない可能性があり、どちらも分類子を学習する問題を引き起こす可能性があります。

トレーニングの正確さを常に確認してください。トレーニングの精度が良くない場合は、誤って分類されたトレーニングポイントも大きなヒントになります。

弊社のサイトを使用することにより、あなたは弊社のクッキーポリシーおよびプライバシーポリシーを読み、理解したものとみなされます。
Licensed under cc by-sa 3.0 with attribution required.