小组研究成果被EuroSys 2027接收
EuroSys(European Conference on Computer Systems)是计算机系统领域的重要国际学术会议之一,长期关注操作系统、分布式系统、云计算以及人工智能系统等方向的前沿研究。2027 年,清华大学软件系统安全保障小组研究成果 “CaMFuzz: Testing Distributed Training Frameworks via Abundant Configuration–Model Interactions” 被 EuroSys 2027 接收。
该工作面向分布式训练框架的软件缺陷检测问题,提出了一套基于配置—模型交互探索的自动化测试框架 CaMFuzz。研究团队分析了 DeepSpeed、Accelerate、ColossalAI 和 Megatron-LM 中的 133 个真实分布式训练缺陷,发现 93% 的缺陷需要满足特定训练配置及显式配置—模型依赖关系,45% 的缺陷还依赖特定模型结构形成的隐式交互。基于这一发现,CaMFuzz 自动提取配置约束、模型特征以及二者之间的依赖关系,并利用训练逻辑覆盖率引导模型结构变异,从而系统探索复杂的配置—模型交互空间。
实验结果表明,CaMFuzz 在 4 个主流分布式训练框架中发现了 20 个此前未知的缺陷,其中 DeepSpeed 4 个、Accelerate 5 个、ColossalAI 9 个、Megatron-LM 2 个,。相比代表性测试方法,CaMFuzz 的训练逻辑覆盖率平均提升 75.5% 至 90.6%。该工作由清华大学颜臻、中国人民大学陈元亮、清华大学马福辰、闫明、喻泽弘、冼震声、姜宇等人共同完成,陈元亮和姜宇为通讯作者。

研究成果概要:
分布式训练框架需要同时处理数据并行、模型并行、混合精度、参数分片和梯度同步等复杂机制,其行为由训练配置和模型结构共同决定,因此许多缺陷只有在特定二者组合下才会被触发。现有方法通常只探索有限配置或固定模型,难以覆盖这类深层交互缺陷。
为此,CaMFuzz 包含两个核心阶段:Configuration Model Specification Construction 和 Configuration–Model Interaction Fuzzing。首先,系统通过静态分析构建 CMSpec,提取训练配置约束、模型特征以及显式配置—模型依赖关系,从而生成合法配置及与之匹配的模型要求;随后,系统在保持配置—模型兼容性的前提下,对模型层参数、层数量和参数冻结状态等进行变异,并利用训练逻辑覆盖率引导测试不断探索新的执行路径,从而发现隐藏的分布式训练缺陷。