Meta训练Llama 3遭遇频繁故障：16384块H100 GPU训练集群每3小时「罢工」一次

533次阅读 | 发布于8月以前

7月28日消息，Meta发布的一份研究报告显示，其用于训练4050亿参数模型Llama 3的16384个英伟达H100显卡集群在54天内出现了419次意外故障，平均每三小时就有一次。其中，一半以上的故障是由显卡或其搭载的高带宽内存（HBM3）引起的。

由于系统规模巨大且任务高度同步，单个显卡故障可能导致整个训练任务中断，需要重新开始。

尽管如此，Meta团队还是保持了90%以上的有效训练时间。
在为期54天的预训练中，共出现了466次工作中断，其中47次是计划中断，419次是意外中断。

计划内的中断是由于自动化维护造成的，而意外的中断则主要源于硬件问题。GPU问题是导致故障的主要原因，占意外中断的58.7%。其中只有三起事件需要大量人工干预，其余的由自动化管理。