Meta训练Llama 3遭遇频繁故障:16384块H100 GPU训练集群每3小时「罢工」一次

401次阅读  |  发布于3月以前

7月28日消息,Meta发布的一份研究报告显示,其用于训练4050亿参数模型Llama 3的16384个英伟达H100显卡集群在54天内出现了419次意外故障,平均每三小时就有一次。其中,一半以上的故障是由显卡或其搭载的高带宽内存(HBM3)引起的。

由于系统规模巨大且任务高度同步,单个显卡故障可能导致整个训练任务中断,需要重新开始。

尽管如此,Meta团队还是保持了90%以上的有效训练时间。
在为期54天的预训练中,共出现了466次工作中断,其中47次是计划中断,419次是意外中断。

计划内的中断是由于自动化维护造成的,而意外的中断则主要源于硬件问题。GPU问题是导致故障的主要原因,占意外中断的58.7%。其中只有三起事件需要大量人工干预,其余的由自动化管理。

Copyright© 2013-2019

京ICP备2023019179号-2