论坛主席:刘琛梅
绿盟科技研发技术总监,负责绿盟科技“清⻛卫”AI安全产品,防⽕墙产品,进⾏智能体安 全、⼤模型安全、AI围栏,⽹络安全的研发⼯作。绿盟科技合伙⼈。 曾在华为就职8年,担任测试架构师。 《测试架构师修炼之道》作者,总发⾏量超过2.4万册,合著《现代软件测试技术权威指南》,《软件测试之道:那些值得借鉴的实战案例》,是《IOS取证实战》的译者。
绿盟科技研发技术总监

AI Agent评测和质量保障

本论坛聚焦AI Agent的评测与质量保障,致力于构建智能体应用的可信体系。论坛涵盖Agent能力评估、性能基准测试、安全性验证、可靠性保障等核心技术。通过深入探讨多维度评测框架、自动化测试策略、质量门禁设计等关键议题,我们将共同见证质量保障从"人工验证"向"智能评测"的范式升级,确保AI Agent在生产环境的高可靠与高安全。
通用Agent评测探索与实践
王 啸
美团 基础研发Agent平台部CatPaw评测负责人
内容简介:
随着大模型Agent能力快速演进,如何科学评估其真实水平成为行业焦点。本次分享围绕"通用Agent评测探索与实践"展开,从评测定义出发,系统梳理Agent核心能力方向与关键指标体系,阐述自建评测集的必要性与设计思路;随后聚焦长程任务评测的挑战与解法,深入探讨Harness评测的对比优化,以及Harness与模型联合优化的闭环实践;最后分享Advisor技术评测的前沿探索。听众将获得通用Agent评测业界概览、Harness能力拆解与关键评测洞察,以及Advisor技术评测的实战经验。        

演讲提纲:
1.什么是agent评测;
2.agent评测主要包含哪些能力方向&关键评测指标;
3.自建评测集;
4.长程任务评测;
5.harness评测对比与优化;
6.harness&模型联合优化;
7.advisor技术评测。

听众收益: 
1.通用Agent评测业界概览
2.针对Harness能力的拆解与关键评测洞察
3.Advisor技术评测
美团基础研发Agent平台部CatPaw系列产品评测负责人,先后在华为、蚂蚁、美团从事测试领域相关工作,在大模型评测,智能体评测,测试领域智能体构建等领域有超3年项目经验。
从SDD到确定性质量门禁:AI 驾驭技术跃迁
冀 博
绿盟科技“铁律蜂巢”AI研发效能 研发技术经理
内容简介:
AI 辅助编码已普及,但多停留在“个人提效”,组织层面收效不够——团队花了很多token费用,但是未见明显的增效,产出比不明显,——单点个人优化难以沉淀为组织能力,团队深陷工具、流程、资产三大碎片化。本议题分享源自绿盟科技多智能体 Harness 系统 IronHive:以“1+3+X+V”工业蜂巢体系为核心,用 Orchestrator 调度、研究/开发/评审三角制衡、70+ 数字契约 Skill 池与 10 域验证免疫网,将专业理性编译为 AI 不可违背的运行时指令;配合 Gatekeeper 硬门禁与 SDD 双轨管线,让 AI 红利从个人放大为组织级提效,实现从单兵作战到蜂巢协作的范式跃迁。        

演讲提纲:
1.AI 研发的困境与破局 ——「个人提效的天花板」
1.1三大碎片化困境(本质:个人提效无法沉淀为组织能力):①工具碎片化(Copilot/Claude/Cursor 频繁切换,上下文丢失、思路割裂)②流程碎片化(AI 生成5秒、人工调试验收3小时,缺乏质量门禁,抵消效率红利)③资产碎片化(每次对话从零开始,知识无法沉淀复用,团队反复踩坑)
1.2 一个真实“翻车”案例(约1分钟,困境的具象化引子)
1.3范式跃迁:Prompt 工程(个人·怎么写,单点优化)→ Harness 工程(组织·怎么管:管角色分工/管质量门禁/管经验沉淀);核心洞察:AI 能写代码 ≠ AI 值得信任,个人能跑通 ≠ 组织能复用
2.架构全貌:1+3+X+V 工业蜂巢体系 ——「组织级协作的骨架」
总览:四层各司其职——1 调度 + 3 分工 + X 技能 + V 验证
2.1 中枢 Orchestrator:意图识别→任务分解→代理路由→螺旋控制;“只调度、不执行”
2.2 角色 Agents 三角制衡:Researcher(只读+联网)/ Developer(读写+终端执行,自测不能自评)/ Reviewer(只读+一票否决);Generator-Evaluator 物理隔离,打断“生成-自评估”幻觉闭环
2.3X 技能 70+ Skills:工程规范编译为“数字契约”,按需加载、用完卸载(spec-driven:先写 Spec 再动手,不可逾越的红线)——把个人经验沉淀为组织资产
2.4V 验证 10 域:Gatekeeper 硬门禁 + L0–L3 三层记忆栈 + 11 横切面;本质:把专业理性翻译为 AI 不可违背的运行时指令
3.核心机制与安全闭环 ——「让提效可信任、可规模化」
3.1 V 层联动闭环:V8 跨产物一致性(逻辑覆盖度35% + 追溯链闭环40% + 交付确定性25%)/ V9 失效模式主动检测14类(对齐 MAST, NeurIPS 2025)/ V10 自迭代修复闭环(检出 Critical 触发 Ralph Loop,单轮 ≤5 次强制收敛)
3.2Gatekeeper:从“软建议”到“硬门禁”——跳过 Spec Review 直接改代码 → PreToolUse Hook 拦截 → V7 审计日志永久追溯
3.3 SDD 双轨管线(Spec 为唯一真相源):绿地轨5阶段 / 存量轨三档(Minimal 极速 / Standard 14阶段 / Comprehensive 19阶段);“不用大炮打蚊子”
4.工程数据洞察与避坑指南 ——「让组织能力可度量、可治理」
4.1 Skill 健康度模型(活跃→观察→陈旧→归档)+ Pass^k 可靠性熔断(降幅 >15% 阻断带病上线)
4.2 14 种失效模式分布:核心洞察——AI 的问题不是“能力不足”而是“伪装胜任”,虚报/伪造占比主导
4.3 八大研发反模式速查:Skip Research/Spec、Self-Evaluate、Infinite Spiral、Context Dump、Scope Creep 等
4.4IPD 在 AI 时代的变与不变:DCP/TR/MR 管理评审不变;技术评审 AI 提效、决策数据化——IPD 把方向,IronHive 管执行
5.组织落地与未来展望 ——「从工具到体系」
5.1落地三形态:多智能体框架 / 多智能体指令集 / 多智能体 SDD 流水线,支持 GitHub Copilot、Trae、Claude Code 、opencode落地
5.2 四根支柱(可控/可验/可治理/可演进)+ PROVE 标准(Predictable/Reproducible/Operable/Verifiable/Evolvable)
5.3七层纵深防御(对标 OWASP Top 10 for LLM 2025)
5.4模型无关性:AI 时代的“智能操作系统”——模型越强、平台越强
6.总结:从单兵作战到蜂巢协作,本质是让 AI 的效率红利从个人跃迁为组织级提效——用工程化的专业理性,把“看着够好”变成“真正可信、可复用、可治理”。

听众收益:
1. 掌握用系统化管控破解大模型信任与可靠性难题的方法论视角。
2. 可复用参考架构:获得一套经绿盟科技实战检验的“1+3+X+V”多智能体 Harness 参考架构(调度中枢/角色制衡/技能契约/验证免疫四层),可直接借鉴到本企业的 AI 研发体系建设。
3. 可落地的工程抓手与避坑清单:拿到 8 大研发反模式、14 种 Agent 失效模式检测、Gatekeeper 硬门禁与 SDD 双轨管线等可工程化手段,以及 Skill 健康度 + Pass^k 可靠性度量体系。
绿盟科技技术研发经理,作为架构师与核心开发者主导绿盟多智能体 Harness 系统——IronHive 的设计与工程化落地。长期专注 AI 赋能软件研发、多智能体协作与研发效能工程化,致力于用系统化、可验证的工程方法,破解大模型在企业级研发中的信任、质量与规模化交付难题。
软+硬件复杂开发环境下的AI质量保证实践
蔡后祥
独立架构师
内容简介:
在实际工程中的问题,解决随着大模型技术的发展,AI 编程助手已经在前端开发、通用后台开发等场景展现出显著的效率提升。但在 DPU、云网络、VPC 等复杂软硬件结合领域,AI 的应用仍面临挑战:一方面,企业核心代码、架构设计和业务知识通常无法直接被通用模型获取;另一方面,大量硬件架构、性能优化经验和系统设计知识难以通过代码本身表达,导致模型缺乏对整体系统的理解。
本次分享将结合实际工程场景,探讨如何通过知识工程、上下文增强等方式,让 AI 更好地理解企业私有知识与复杂技术体系,探索 AI 在基础设施研发中的落地路径。

演讲提纲:
1.背景:大模型时代企业研发效率提升的新挑战
1.1大模型正在改变软件研发模式,从传统代码补全逐步走向 AI Agent 辅助的软件工程。
1.2在前端开发、通用后台开发等场景中,AI 已经能够显著提升开发效率,但在 DPU、云网络、基础设施等复杂软硬件结合领域,AI 的落地仍面临较大挑战。
1.3 企业级研发场景不同于从零开始的新项目,更多面对的是已有系统、历史代码和复杂技术栈,如何让 AI 理解并参与已有工程体系成为关键问题。
2.企业级 AI 应用面临的核心问题
2.1企业知识腐化问题(Knowledge Decay)
2.1.1 企业并非缺少文档,而是缺少持续可信的知识体系。
2.1.2随着系统长期演进,设计文档、代码实现、运行环境和工程经验逐渐产生偏差。
2.1.3传统 Wiki、文档库等方式难以保证知识的实时性和准确性。
2.1.4当 AI 基于过期或错误知识进行推理时,会导致代码生成质量下降和工程决策偏差。
2.2大模型缺少系统上下文理解能力
2.2.1大模型具备强大的代码生成能力,但缺少企业内部系统背景。
2.2.2在复杂软硬件系统中,大量关键知识无法直接体现在代码中,例如:
硬件架构设计;
数据流和网络拓扑;
性能优化约束;
历史设计决策。
大模型更像一个“高智商但缺少企业经验的开发工程师”,需要通过 Context Engineering 构建完整的系统认知。
2.3Agent 缺少完整工程闭环
2.3.1单纯代码生成无法满足真实研发流程。
2.3.2企业研发需要完整闭环:
理解需求;
修改代码;
编译构建;
测试验证;
运行分析;
持续优化。
2.3.3AI Agent 需要具备执行环境和反馈机制,才能真正参与工程开发。
3.从 RAG 到 Engineering Knowledge System:构建可信知识体系
3.1分析传统知识库方案的局限:
3.1.1简单文档检索无法理解复杂工程关系;
3.1.2文档和代码生命周期分离;
3.1.3缺少知识更新和质量管理机制。
3.2探索将知识系统融入代码仓库:
3.2.1Repository 不只是代码存储空间,而成为 AI 理解工程系统的知识载体。
3.2.2建立包含以下内容的工程知识体系:
系统架构模型;
模块依赖关系;
数据流和调用关系;
硬件架构知识;
设计决策记录;
开发规范和约束。
4.Harness 实践:让 AI 具备工程能力
4.1基于代码仓库构建 AI Agent 工作环境。
4.2通过 Agent 角色拆分提升工程协作能力:
4.2.1 Developer Agent:负责代码分析和功能开发;
4.2.2Tester Agent:负责测试设计和质量验证;
4.2.3Explain Agent:帮助新人理解系统和代码逻辑。
4.3通过 Skill 扩展 Agent 执行能力:
编译环境;
运行环境;
测试环境;
性能分析工具。
4.4构建从代码生成到验证反馈的完整闭环:
需求理解 → 系统分析 → 代码修改 → 编译执行 → 测试验证 → 结果反馈 → 持续优化。
5.工程落地中的关键问题与实践探索
5.1如何防止知识腐化:
5.1.1知识与代码绑定;
5.1.2代码变化触发知识更新;
5.1.3建立知识生命周期管理。
5.2如何实现知识增量更新:
5.2.1分析代码变化影响范围;
5.2.2更新相关知识节点;
5.2.3避免全量维护成本。
5.3如何建立知识质量门禁:
5.3.1类似代码 CI/CD 流程,对知识进行验证;
5.3.2保证架构描述、代码实现和运行状态保持一致。
6. 总结与未来展望
6.1AI 在企业研发中的核心挑战,不只是模型能力,而是企业知识如何被 AI 理解和使用。
6.2随着大模型能力持续增强,高质量工程知识体系的重要性会进一步提升。
6.3未来的软件工程模式将从:
人理解系统、编写代码、验证结果
逐步演进为:
人构建知识体系,AI 理解系统并参与工程闭环。
6.4企业真正的 AI 竞争力,将来自模型能力、领域知识和工程体系的结合。

听众收益:
1. 了解大模型在企业级软件研发场景落地过程中面临的真实挑战,认识到复杂软硬件系统中知识管理、上下文构建和工程闭环的重要性。
2. 掌握构建 AI Engineering Harness 的核心思路,了解如何通过知识工程、代码仓库知识体系、Agent 和工具链建设,让大模型更好地理解企业私有系统并提升研发效率。
3. 获得 AI 辅助基础设施研发的实践思路,探索如何将 AI 从简单代码生成工具,演进为具备系统理解、开发执行和自动验证能力的复杂工程的智能助手。        
拥有近十年云计算与网络技术研发经验,曾就职于腾讯、英特尔等企业,长期从事云网络、高性能网络架构及基础设施相关研发工作。具备从底层网络技术到云计算平台的工程实践经验。
近年来持续关注人工智能技术发展,重点探索大模型、AI Agent 及智能应用工程落地方向,并结合自身技术背景开展 AI 相关学习、实践与分享,致力于推动 AI 技术在开发者和产业场景中的应用创新。
Agent 驱动的 AI Native软件生命周期端到端质量保障体系建设
唐 亮
顺丰科技 效能运营
内容简介:
人人用AI提效,团队质量为何没跟上?从「个人提效≠组织提效」根命题出发,拆解规模管控、测试盲区、底座缺失、价值悖论四组困境;提出「把Agent当人管」理念,迁移六个管理动作,落地门禁2.0与ROI度量;以三层架构×生命周期二维落地,用Graph六模式、知识库docs-as-code、系统级三回路把个人红利收拢为组织能力;四案例佐证团队级提效硬数据;给辅助→共生→自治三阶跃迁与管理者五抓手。        

演讲提纲:
1.困境:个人提效≠组织提效
1.1根命题——参差的技术前沿(HBS/BCG 758人田野实验:前沿内+40%但人低估只用60%潜力;前沿外+19pp错误率且对错误答案更有信心)+技能压缩(新手+35%、老手≈0)
1.2三重漏电机理——任务耦合漏电(TOC瓶颈转移,7h→4h而非1.75h)、质量漏电(做完≠做对)、能力折旧漏电(判断外包即去训练unlearning,三年结账)
1.3四组困境——规模管控失衡(4077 Agent、仅5%进生产)、AI测试能力盲区(四类)、底座缺失(根因)、价值证明悖论(预防悖论,收口)
2.理念:把Agent当人管
2.1个人vs组织六维对照+三层脱节(45%高管无AI战略、60%员工缺规划、66%领导拒录无AI技能者)
2.2Agent as Employee六动作迁移;门禁2.0(条件边三态+HITL+Checkpoint+客观验证层);度量升级(决策型+执行型+ROI分级,标杆3.0以上、可用1-3、淘汰0.5以下)
3.实践:三层架构×生命周期
3.1三层架构即Agent组织架构(执行层/资源层/跨切层);执行层演进链Prompt→Context→Harness→Loops→Graph;资源层五类(Tool/Skill/知识库/Memory/Eval)
3.2Graph六模式+真实平台落地实例(7个Agent×19个交付物即Pipeline+Supervisor编队,门禁引擎作Evaluator条件边跑T4规范+T2业务校验,不过则退回)
3.3Node三约束(防污染/防超量/防越界);端到端质量流水线(6阶段×门禁);知识库docs-as-code(二维矩阵,C3解法);系统级三回路修复三重漏电;Token治理四招
4.案例:四个脱敏佐证
数字员工调度(门禁2.0/客观验证层)、拦截类(门禁挡住逃逸缺陷)、AIOps运行层闭环(34人天/月,意图识别53→82%,ROI≥300%)、知识管理(二维矩阵+90天废弃,C3解法)
5.总结:辅助→共生→自治三阶演进+管理者五抓手;金句——质量团队做加速器上的刹车片,不是马路边的交警

听众收益:
1. 拿到一套「把Agent当人管」的可执行管理清单——六个管理动作如何逐项落地到Agent工程,缺哪件乱哪件,回去即可对照自查团队。
2. 掌握Agent驱动质量保障的技术底座——三层架构、Graph六模式、门禁2.0条件边三态、知识库docs-as-code,知道从「能跑」到「可控」该建什么。
3. 学会用ROI分级度量破解预防悖论——把「数拦截bug」的成本中心指标改成加速器指标,向决策层证明质量团队价值。

现任:顺丰科技|效能运营  
经验:AI4研效、DevOps与数字化转型  
方向:AI赋能软件工程、BizDevOps/DevOps平台、效能度量与数据驱动运营、价值流与投产有效性变革
京ICP备2020039808号-4 京公网安备11011202100922号