面向 SRE Agent 的故障演练与诊断能力评测
内容简介:
本次分享聚焦值班排障与站点可靠性工程智能体(On-call/SRE Agent)的诊断能力评测。结合 OpenRCA、OpenRCA 2.0 及微服务故障传播研究,介绍如何在可控环境中构造贴近生产的故障场景,将日志、指标和调用链组织成可复现的诊断任务,并建立可核验的评测依据。重点讨论故障传播、监控盲区和动态负载如何影响任务难度,以及如何联合衡量根因定位、传播路径还原、证据质量与诊断成本。最后介绍基于变更历史构造复杂故障、利用评测反馈训练诊断智能体等近期探索,为企业开展模型选型、方案比较和持续回归评测提供思路。
演讲提纲:
1. 演练任务设计:将生产排障需求转化为评测任务从告警或业务异常出发,明确 Agent 的诊断目标、可用数据、工具接口和结果格式,形成可以重复执行的排障任务。
2. 故障场景构造:覆盖复杂传播与可观测性盲区通过故障注入与动态负载构造诊断场景,分析跨服务传播、遥测缺失等因素带来的挑战,以及简单测试集可能高估模型能力的原因。
3. 诊断结果验证:联合评估根因、传播路径与证据结合 OpenRCA 与 OpenRCA 2.0,介绍从根因定位到故障传播过程的评测方法,识别根因命中但证据不足、传播关系错误等问题。
4. 模型与 Agent 对比:建立可复现的评测流程对齐数据、工具和预算条件,分别衡量诊断质量、耗时与调用成本,通过失败案例分析定位能力短板,支持方案比较和版本回归。
5. 近期探索:利用评测反馈改进演练与训练介绍基于代码变更历史构造复杂故障、利用评测反馈训练诊断 Agent 的探索,讨论如何持续扩充场景并检验能力变化。
听众收益:
1.获得故障演练的设计框架,明确测试环境、故障场景、遥测数据和评测依据的准备要求。
2.掌握诊断能力的多维评估方法,识别根因误判、传播链缺失和证据不足等典型短板。
3.获得用于模型选型与 Agent 版本回归的评测思路,结合诊断效果、时间和成本判断改进是否有效。
香港中文大学(深圳)计算机科学博士生,研究方向为大模型智能体、软件可靠性与故障根因分析。主要关注 On-call/SRE Agent 的诊断能力评测与训练,是 OpenRCA 2.0 及故障传播感知评测论文的第一作者。研究成果发表于 FSE、ICSE、ASE、ISSTA 等软件工程会议,曾获 ASE 2023 工业挑战赛道杰出论文奖。曾在微软亚洲研究院、字节跳动从事研究实习,开展智能体诊断、可观测性与质量评估工作。