新機能重要度 中

Amazon SageMaker HyperPod が Slurm クラスター向け継続的プロビジョニングで詳細なヘルスチェックをサポート

Amazon SageMaker HyperPod は、継続的プロビジョニングを使用する Slurm オーケストレーションクラスターで、実行中のインスタンスの GPU アクセラレータのヘルスを常に確認できるようにする。インスタンスグループまたは個々のインスタンスを対象に、ハードウェアストレステストと接続性テストを実行し、ジョブにリソースをコミットする前に検証できる。

Amazon SageMaker HyperPod は、継続的プロビジョニングで作成された Slurm オーケストレーションクラスターで詳細なヘルスチェックをサポートする。これにより、実行中のインスタンスで GPU アクセラレータのヘルスをいつでも積極的に確認できる。継続的プロビジョニングでは、トレーニングを迅速に開始し、インスタンスグループを非同期にスケールできるが、すべてのインスタンスが同時に失敗する心配がない。詳細なヘルスチェックを組み合わせることで、インスタンスがオンラインになる前に包括的なハードウェア検証が可能になる。インスタンスグループまたは特定のインスタンスを対象に、包括的なハードウェアストレステストと接続性テストを実行し、ジョブにコンピュートリソースをコミットする前に検証できる。継続的プロビジョニングでは、キャパシティが利用可能になるにつれてワーカーノードが非同期に Slurm クラスターに追加されるため、新しいノードがオンラインになるたびに詳細なヘルスチェックを実行し、ジョブをスケジュールする前にハードウェアを検証でき、すでに実行中のヘルシーなノードのワークロードを中断しない。進捗状況と結果は、SageMaker コンソールと API を通じてインスタンスグループとインスタンスレベルで確認でき、GPU のヘルス、ネットワーク接続、マルチノード通信パフォーマンスの完全な可視性がある。チェックを受けているインスタンスは自動的にワークロードスケジューリングから分離され、合格したらサービスに戻される。HyperPod の自動ノードリカバリ機能と組み合わせると、失敗したインスタンスは自動的に再起動または交換され、クラスターのヘルスが確保される。この機能は、Amazon SageMaker HyperPod が利用可能なすべてのリージョンで利用できる。

AWS 公式の元記事を読む