分類のような単純な機械学習の問題があるとします。視覚または音声認識のいくつかのベンチマークで、私は人間として、非常に優れた分類子です。したがって、分類子がどの程度優れているかについて直感があります。
しかし、大量のデータを使用する場合の1つのポイントは、トレーニングした分類子がどの程度優れているかわからないということです。これは私が個人的にあまり良い分類器ではないデータです(たとえば、EEGデータから人の気分を分類します)。私の問題がどれほど難しいかを直感することは実際には不可能です。
さて、機械学習の問題が発生した場合は、自分がどれだけ優れているかを確認したいと思います。これに対する原則的なアプローチはありますか?どうしますか?
データを視覚化しますか?単純なモデルから始めますか?非常に複雑なモデルから始めて、オーバーフィットできるかどうかを確認しますか?この質問に答えたい場合は何を探していますか?いつやめますか?