论坛主席:神秘嘉宾
敬请期待
敬请期待

SDD落地实践与规约工程

本论坛聚焦智能体时代的需求表达与规约设计,讨论如何把模糊自然语言转化为可执行、可验证、可追踪的工程输入。论坛将围绕需求结构化、各种层次的规约定义、闭环校验、业务规则约束、技术债治理等主题展开,探索从业务意图到软件交付的可靠路径。听众将掌握面向AI编码时代的规约工程与SDD实践方法。
SDD 驱动下的质量工程建设
徐 实
瓴岳科技 测试总监
内容简介:
Why
2026 年初开始,我们开始在团队推广 SDD + Coding Agent 得最佳实践,但经过半年实践,比最初 Vibe Coding 和 古法编程 有一定好转,Bug 密度由 SDD 推广前的 0.7,降至推广后 0.47;线上 Bug 密度持平。在对反馈 Bug 做运行分析时,发现 SDD 把意图正向展开为可执行产物(why → what → how)的 Guides (feedforward controls),但 LLM 的概率性幻觉特性,正向链路易失真,单纯 TDD 中的 UT 又无法完全覆盖失真场景。缺少完整的 Sensors (feedback controls) 。所以构建完善的 feedback controls 能让 Agent 在交付 Loop 中能尽可能多闭环问题,提升交付质量。
具体发现数字:约 57% Bug 来自边界未覆盖,29% 来自 spec / plan / impl 各阶段偏移,14% 来自实现遗漏。
What
将测试 AGENT 能力进一步左移并重构 SDD 流程,将 Case Gen Agent + Automation Agent 集成进 SDD 提供反馈闭环能力(did / whether),同时通过 Impl-loop 打通 Implement -> verify 的自修复流程。让交付物进入人工 Review 之前,由 Agent 尽可能自行发现并纠正(Loop)。
测试即代码,与文档、功能代码一同交付并入库,作为测试资产上下文;相对单独的测试沉淀一次性 Browser Use,更稳且更省 Token。
设计测试策略,沉淀和构建Repo Test Harness,初始化仓库的自动化脚手架,打造专项测试 Agent/Skill。给 Agent 构建测试的可执行环境。
通过运营改进 + 评测的完善优化改进的闭环。
效果:
拦截效果:7 月运营中, Verify 拦截的问题 70% 都为有效的必须修复问题。
质量结果:线上 Bug 密度由 0.1 降低至 0.03。
过程质量:Bug 密度: SDD 推广前 0.7, SDD 推广后 0.47,集成 SDD + Verify 后 0.20,最近三个月在逐步完善 Harness 后 0.15。

演讲提纲:
1.一年演进:
测试团队质量工程从「独立 Test Agent」转向「嵌入研发流程的 Verify in SDD」——动因、阶段与踩坑。
2.问题与定位:
正向 SDD(why → what → how)的概率失真;用 Verify 闭环(did / whether)守住意图落地。
SDD 的流程变化
Test Case Agent:在 Spec & Plan 阶段后,基于确定好的需求 spec.md,设计 plan.md, 契约 contract 引入 Test Case Agent 确定验证能力锚点。
Verify Agent:在 Impl 后,集成 Inferential Verify (Clarify Agent, Code Review) + Computational Verify (Sonar, Linter , Build, UT, Contract, E2E Test 等其他专项验证) 能力,确保 Impl 按 质量锚点 完成全覆盖验证。
Impl-loop 通过 Workflow,衔接 Impl 和 Verify 的 Loop,完成 Coding Agent 发现问题后自修复的闭环
3.设计与落地:Verify + Test Harness——测试资产一等公民、Generator/Evaluator 对抗分离、Inferential / Computational 武器库与运营 / MetaHarness 的 feedback 反馈改进闭环。
测试资产沉淀的变化
测试即代码,与文档、功能代码一同交付并入库,作为测试资产上下文;相对单独的测试沉淀一次性 Browser Use,更稳且更省 Token。
测试的技巧,回归的策略沉淀到 Test Harness。在 AGENTS.md 明确 What(UT / E2E / API 策略)、Where(写哪里)、How(怎么写、怎么跑),使Coding Agent 在 SDD 流程真正能产出并执行合规高质量测试。
测试的职能变化
设计测试策略,沉淀和构建Repo Test Harness,初始化仓库的自动化脚手架,打造专项测试 Agent/Skill。给 Agent 构建测试的可执行环境。
运营改进 + 评测的闭环:
运营: 通过阿里云提供的 agent loop 基建,建设可观测能力,建设 harness feedback 能力对 tranjectory 中的积极信号和失败信号做迭代运营,基于迭代结果指导优化 Harness
评测:Deep-SWE Bench 还是通用的 Coding Agent 评测领域;但实际生产环境才是深水区,从业务中构建 instrument 完成符合业务特性的评测任务和能力。
4.下一步方向:
将需求和设计纳入体系,降低需求意图/设计问题;在多服务多端交互需求上进一步提升效果;完善测试分层结构,将更多人工

听众收益:
1.看清路径:理解测试团队如何从「独立 Test Agent」演进到「嵌入研发流程的 Verify in SDD」,以及如何建设 并 完善嵌入研发工作流的 Verify 改进闭环。
2.带走方法:掌握 Impl-loop + Test Harness 的设计要点(测试资产一等公民、Generator/Evaluator 对抗分离、Inferential / Computational 验证组合)及可落地的运营 + 评测的改进闭环。
3.组织变化:清晰岗位融合下测试同学的新价值——从手工测/写自动化,转向设计测试策略,为 Agent 构建执行环境。完善 CI 工作流、仓库 Harness、专项 Skill/Agent 与 Feedback 效果运营,评测改进的闭环。

曾任微软、360、百度、知乎积累十余年研发与质量工程行业经验,带领过上百人测试团队;现任职金融技术公司瓴岳科技,带领质量团队推进 Coding Agent 时代的质量工程与组织转型。
SDD和CodeWave NASL融合重塑AI研发流程
姜天意
网易 CodeWave&CoreAgent技术负责人
内容简介:
2025年被称之为 Vibe Coding 元年,由于模型能力的增强,以 Claude Code 为代表,出现了大量低门槛的 Vibe Coding 工具,同时,低代码、可视化开发等技术也受到了很大的冲击。然而,Vibe Coding 带给企业的并非只有提效的优势,AI 生成发散,技术栈不受控,代码难以维护等问题严重影响了企业落地 AI Coding 。
本次分享会分析自然语言编程的问题,用 Spec Driven(规格驱动) 引入形式化约束来"降熵",同时将 CodeWave NASL 可视化底座与 SDD 结合,构建从需求标准化→技术设计→ NASL 代码生成的完整 AI 软件工厂。技术上通过马具工程、渐进式上下文披露、沙箱隔离等手段保障长程任务稳定性,并建立 Benchmark 体系驱动模型微调迭代。通过此套实践,重塑 AI 开发工作流,实现企业级大规模应用的 AI Coding 稳定落地。

演讲提纲:
1.为什么要用 SDD 来解决 Vibe Coding 的问题
低代码 + AIGC 的思路及目前存在的问题:低代码 + AIGC 效果不及预期,难以度量,Vibe Coding 方式缺少必要的约束,质量不可控。
48 年前的预言与分析问题本质:自然语言 + 软件工程局限性 → 引入 Spec 先行
介绍 Spec driven,通过 Spec driven 解决 Vibe coding 遇到的问题
两套形式化的发展和对比:从 AI Coding 到 AI + 可控底座,从低代码到拥有自研语言的低代码到 Spec Driven
结合低代码的规范和最佳实践,实现 Spec Driven 驱动的可视化开发模式,让 AI Coding 支撑大规模企业级应用的开发
2.产品介绍:围绕需求标准化(Spec First)的开发平台
基于 Spec-Driven 理念的企业级全栈开发平台,及 SDD 核心:需求工程(EARS 标准化、消除模糊词、量化非功能需求)的介绍。
老应用历久弥新:基于 SDD+Code2Sepc 的逆向工程
3.技术方案:大规模 SDD 任务的 Harness Engineering 实践
CodeWave平台架构介绍:AI 友好的平台底座
代码智能体底层:需要什么样的 Code Agent(开源 Wave-Agent 介绍)
围绕 NASL 生成的 SDD 全链路介绍
"马具工程"到底是什么
需求标准化:上百页需求如何塞进上下文窗口
技术设计:如何生成给架构师看的完整文档
NASL 代码生成:海量上下文下的任务稳定性保障
渐进式披露:私有知识如何避免上下文遗忘
Compound 复合工程:让 AI 越跑越精准
文档解析:RAG 知识工程能力复用
多模态支持:UI 理解与图片意图判断
沙箱技术:智能体运行时核心(Bubblewrap)
总结:马具工程设计原则 — 解决长程任务稳定性
4.Benchmark:数据驱动的产品与语言模型训练
核心痛点:提效难度量 / 产品能力难度量 / 效果达不到预期
No Data No BB — 建立 AI 功能的 Benchmark 体系
建立 AI 提效的量化标准
语言能力的瓶颈如何量化:行业 Benchmark(HumanEval)
选择模型基座的标准(代码生成/补全/推理能力)
微调自己的大语言模型(数据构造 → SFT → DPO 偏好对齐)
AI Infra:工程化平台支撑 AI 功能迭代与微调闭环
5.总结与展望
Spec Driven 的本质:通过形式化来"降熵"
CodeWave 可视化软件工厂 vs AI Coding IDE 对比
未来规划


目前负责网易智企智能开发平台CodeWave,及智能体平台CoreAgent的产品技术研发。研究方向为Code Agent AI编程、多智能体协作等领域,曾先后就职于阿里、腾讯,资深前端架构师,开源框架 Egg.js 的核心开发者之一。曾负责盒马数据可视化前端团队、腾讯云大数据平台前端团队、腾讯低代码开源项目逻辑编排方向等。
京ICP备2020039808号-4 京公网安备11011202100922号