7月28日消息,Meta发布的一份研究报告显示,其用于训练4050亿参数模型Llama 3的16384个英伟达H100显卡集群在54天内出现了419次意外故障,平均每三小时就有一次。其中,一半以上的故障是由显卡或其搭载的高带宽内存(HBM3)引起的。
由于系统规模巨大且任务高度同步,单个显卡故障可能导致整个训练任务中断,需要重新开始。
尽管如此,Meta团队还是保持了90%以上的有效训练时间。 在为期54天的预训练中,共出现了466次工作中断,其中47次是计划中断,419次是意外中断。
计划内的中断是由于自动化维护造成的,而意外的中断则主要源于硬件问题。GPU问题是导致故障的主要原因,占意外中断的58.7%。其中只有三起事件需要大量人工干预,其余的由自动化管理。
扫一扫
在手机上阅读