分布式训练弹性需求日益突出 随着大规模AI模型训练对GPU资源的需求持续增长,分布式训练环境的稳定性成为关键挑战。据厂商测试,从检查点恢复最长可能需要90分钟,期间健康状态的GPU处于等待状态,且需要重新执行检查点之后已完成的工作。这对AI基础设施的运营效率构成显著影响。 多节点快照功能解决跨节点状态保存难题 Clockwork.io推出的TorchPass新增多节点平台快照功能,据称是训练领域的行业首创。该功能可在不修改训练代码的前提下,保存跨所有节点的完整运行任务状态并支持恢复。此外,快速异步应用检查点功能可在后台任务运行过程中拍摄检查点,厂商称这将加快强化学习场景的工作效率。 主流AI平台采用网络容错方案 据厂商披露,LinkedIn已在其AI基础设施集群上部署LinkPass网络容错方案,每月防止数万个GPU小时的停机时间。Together AI正在其GPU集群上将TorchPass作为服务推向市场。WhiteFiber作为既有客户,正在扩大Clockwork.io软件在其全球GPU即服务业务中的应用范围。 对存储选型与系统集成的启示 从存储采购角度看,A