Hadoop v1では、7つのマッパーとレデューサースロットをそれぞれ1GBのサイズで割り当てましたが、マッパーとレデューサーは正常に動作します。私のマシンには8Gメモリ、8プロセッサが搭載されています。YARNで、同じマシンで同じアプリケーションを実行すると、コンテナエラーが発生しました。デフォルトでは、次の設定があります。
<property>
<name>yarn.scheduler.minimum-allocation-mb</name>
<value>1024</value>
</property>
<property>
<name>yarn.scheduler.maximum-allocation-mb</name>
<value>8192</value>
</property>
<property>
<name>yarn.nodemanager.resource.memory-mb</name>
<value>8192</value>
</property>
それは私にエラーを与えました:
Container [pid=28920,containerID=container_1389136889967_0001_01_000121] is running beyond virtual memory limits. Current usage: 1.2 GB of 1 GB physical memory used; 2.2 GB of 2.1 GB virtual memory used. Killing container.
次に、mapred-site.xmlでメモリ制限を設定しようとしました。
<property>
<name>mapreduce.map.memory.mb</name>
<value>4096</value>
</property>
<property>
<name>mapreduce.reduce.memory.mb</name>
<value>4096</value>
</property>
しかし、それでもエラーが発生します:
Container [pid=26783,containerID=container_1389136889967_0009_01_000002] is running beyond physical memory limits. Current usage: 4.2 GB of 4 GB physical memory used; 5.2 GB of 8.4 GB virtual memory used. Killing container.
マップタスクにこれほど多くのメモリが必要な理由がわかりません。私の理解では、map / reduceタスクには1GBのメモリで十分です。コンテナにより多くのメモリを割り当てると、タスクがより多くを使用するのはなぜですか?各タスクがより多くの分割を取得するためですか?より多くのタスクが並行して実行されるように、コンテナーのサイズを少し小さくして、より多くのコンテナーを作成する方が効率的だと思います。問題は、各コンテナに処理できる以上の分割が割り当てられないようにするにはどうすればよいですか?