内容简介:
Why
2026 年初开始,我们开始在团队推广 SDD + Coding Agent 得最佳实践,但经过半年实践,比最初 Vibe Coding 和 古法编程 有一定好转,Bug 密度由 SDD 推广前的 0.7,降至推广后 0.47;线上 Bug 密度持平。在对反馈 Bug 做运行分析时,发现 SDD 把意图正向展开为可执行产物(why → what → how)的 Guides (feedforward controls),但 LLM 的概率性幻觉特性,正向链路易失真,单纯 TDD 中的 UT 又无法完全覆盖失真场景。缺少完整的 Sensors (feedback controls) 。所以构建完善的 feedback controls 能让 Agent 在交付 Loop 中能尽可能多闭环问题,提升交付质量。
具体发现数字:约 57% Bug 来自边界未覆盖,29% 来自 spec / plan / impl 各阶段偏移,14% 来自实现遗漏。
What
将测试 AGENT 能力进一步左移并重构 SDD 流程,将 Case Gen Agent + Automation Agent 集成进 SDD 提供反馈闭环能力(did / whether),同时通过 Impl-loop 打通 Implement -> verify 的自修复流程。让交付物进入人工 Review 之前,由 Agent 尽可能自行发现并纠正(Loop)。
测试即代码,与文档、功能代码一同交付并入库,作为测试资产上下文;相对单独的测试沉淀一次性 Browser Use,更稳且更省 Token。
设计测试策略,沉淀和构建Repo Test Harness,初始化仓库的自动化脚手架,打造专项测试 Agent/Skill。给 Agent 构建测试的可执行环境。
通过运营改进 + 评测的完善优化改进的闭环。
效果:
拦截效果:7 月运营中, Verify 拦截的问题 70% 都为有效的必须修复问题。
质量结果:线上 Bug 密度由 0.1 降低至 0.03。
过程质量:Bug 密度: SDD 推广前 0.7, SDD 推广后 0.47,集成 SDD + Verify 后 0.20,最近三个月在逐步完善 Harness 后 0.15。
演讲提纲:
1.一年演进:
测试团队质量工程从「独立 Test Agent」转向「嵌入研发流程的 Verify in SDD」——动因、阶段与踩坑。
2.问题与定位:
正向 SDD(why → what → how)的概率失真;用 Verify 闭环(did / whether)守住意图落地。
SDD 的流程变化
Test Case Agent:在 Spec & Plan 阶段后,基于确定好的需求 spec.md,设计 plan.md, 契约 contract 引入 Test Case Agent 确定验证能力锚点。
Verify Agent:在 Impl 后,集成 Inferential Verify (Clarify Agent, Code Review) + Computational Verify (Sonar, Linter , Build, UT, Contract, E2E Test 等其他专项验证) 能力,确保 Impl 按 质量锚点 完成全覆盖验证。
Impl-loop 通过 Workflow,衔接 Impl 和 Verify 的 Loop,完成 Coding Agent 发现问题后自修复的闭环
3.设计与落地:Verify + Test Harness——测试资产一等公民、Generator/Evaluator 对抗分离、Inferential / Computational 武器库与运营 / MetaHarness 的 feedback 反馈改进闭环。
测试资产沉淀的变化
测试即代码,与文档、功能代码一同交付并入库,作为测试资产上下文;相对单独的测试沉淀一次性 Browser Use,更稳且更省 Token。
测试的技巧,回归的策略沉淀到 Test Harness。在 AGENTS.md 明确 What(UT / E2E / API 策略)、Where(写哪里)、How(怎么写、怎么跑),使Coding Agent 在 SDD 流程真正能产出并执行合规高质量测试。
测试的职能变化
设计测试策略,沉淀和构建Repo Test Harness,初始化仓库的自动化脚手架,打造专项测试 Agent/Skill。给 Agent 构建测试的可执行环境。
运营改进 + 评测的闭环:
运营: 通过阿里云提供的 agent loop 基建,建设可观测能力,建设 harness feedback 能力对 tranjectory 中的积极信号和失败信号做迭代运营,基于迭代结果指导优化 Harness
评测:Deep-SWE Bench 还是通用的 Coding Agent 评测领域;但实际生产环境才是深水区,从业务中构建 instrument 完成符合业务特性的评测任务和能力。
4.下一步方向:
将需求和设计纳入体系,降低需求意图/设计问题;在多服务多端交互需求上进一步提升效果;完善测试分层结构,将更多人工
听众收益:
1.看清路径:理解测试团队如何从「独立 Test Agent」演进到「嵌入研发流程的 Verify in SDD」,以及如何建设 并 完善嵌入研发工作流的 Verify 改进闭环。
2.带走方法:掌握 Impl-loop + Test Harness 的设计要点(测试资产一等公民、Generator/Evaluator 对抗分离、Inferential / Computational 验证组合)及可落地的运营 + 评测的改进闭环。
3.组织变化:清晰岗位融合下测试同学的新价值——从手工测/写自动化,转向设计测试策略,为 Agent 构建执行环境。完善 CI 工作流、仓库 Harness、专项 Skill/Agent 与 Feedback 效果运营,评测改进的闭环。
曾任微软、360、百度、知乎积累十余年研发与质量工程行业经验,带领过上百人测试团队;现任职金融技术公司瓴岳科技,带领质量团队推进 Coding Agent 时代的质量工程与组织转型。