论坛主席:刘名威
博士生导师,“逸仙学者计划”新锐学者。他于2022年在复旦大学获得博士学位,并在2024年完成了复旦大学的博士后研究。他的研究领域聚焦于软件工程(SE)与人工智能(AI)的交叉领域,尤其在AI4SE和SE4AI方面。他的主要研究兴趣在于利用先进的AI技术,如大规模语言模型(LLM)和知识图谱(KG),来解决软件工程中的挑战,并应对AI应用和场景中常见的软件工程和系统工程问题。具体的研究方向包括基于大模型的智能化开发与维护、可信代码大模型、软件开发知识图谱等。在过去的五年中,他在软件工程领域的顶级国际期刊和会议上(如TSE、TOSEM、ICSE、FSE、ASE等)发表了20余篇论文,并荣获了多项奖项,包括IEEE TCSE杰出论文奖(ICSME 2018,CCF-B)和ACM SIGSOFT杰出论文奖(FSE 2023,CCF-A)。
中山大学 副教授

智能体评测与进化

本论坛聚焦AI Agent在真实任务中的能力评测,讨论如何建立更可信、更多维度、更可比较的评测体系。论坛将围绕基准集构建、指标设计、对比测试、结果解释、鲁棒性分析、可解释性验证等主题展开,进一步探索在迭代中如何基于评测结果持续改进AI Agent。听众将获得评估智能体能力、判断模型优劣、支撑选型优化的系统方法。

面向可观测、可落地的工程手段 ——Agent 持续迭代优化体系
拆解
张元剑
科大讯飞 教育测试公共技术组负责人
内容简介:
围绕可观测、可落地的工程手段拆解 Agent 迭代逻辑,对比传统模型评测与智能体实测差异,梳理落地痛点;搭建离线 + 线上联动的自闭环评估体系,打通数据回流链路;构建场景化自动化测试工具,逐步减少人工打分,降低评测成本、提速迭代。结合落地实践总结经验,并展望 Agent 持续进化的工程建设方向。

演讲提纲:
1.从基础模型测评到 Agent 智能体测评:转型核心差异与落地挑战
1.1传统大模型评测 vs Agent 端到端实测的本质差异
1.2Agent 工程落地中遇到的典型现实难题
2.构建离线 + 线上联动的 Agent 自进化评估闭环体系
2.1离线测评底座建设:可控样本、基准集、场景用例验证
2.2线上可观测能力建设:链路埋点、指标采集、异常捕获
2.3闭环飞轮:问题发现→根因归因→样本回流→回归测评,持续迭代
3.从人工打分到自动化 Agent 测试平台建设
3.1人工评估经验沉淀:业务标准、评判规则、案例库资产化
3.2AI 自动评估四大核心支撑能力,降低人工评测依赖
4.落地实践总结与 Agent 持续进化的工程建设展望

听众收益:
1. 如何从0到1开展agent模型测评,agent测评维度。
2. 测评平台的构建。
3. 如何驱动AI自进化
有10多年软件开发及测试经验,2015年加入讯飞教育质量团队,当前主要负责教育BG Agent平台测试以及负责公共技术组,对软硬一体、中台、AI等方向测试有一定的了解研究,并且在研发体系流程建设以及工程效能提升也有一定经验。
GUI Agent评测实践
罗军
支付宝 AI多模态评测负责人
内容简介:
随着多模态大模型的发展,GUI Agent 已经从“看懂界面、执行单步操作”走向“在真实 App 中完成复杂长链路任务”。但现有评测体系仍有明显不足:静态 benchmark 能评原子能力,却很难映射到真实任务表现;动态 benchmark 能看端到端成功率,却难以解释失败到底来自视觉定位、组件理解、动作规划,还是本应主动向用户澄清却没有澄清。与此同时,动态评测普遍依赖人工验收、任务步数偏短、对 Ask/Call User 等协作能力覆盖不足。
本次分享将结合我们在移动端 GUI Agent benchmark 构建中的实践,介绍如何通过“动态任务先构造、静态能力后拆解”的方式,把端到端评测、细粒度诊断和自动化评测真正打通。

演讲提纲:
1.GUI Agent 评测的核心难点
1.1静态 benchmark 与动态 benchmark 各自解决什么问题
1.2为什么只看成功率不够,为什么只做静态能力题也不够
1.3GUI Agent 在真实场景下面临的长链路、动态页面与模糊意图挑战
2.动态-静态一体化评测体系怎么设计
2.1如何从动态任务和 golden trajectory 出发,反推静态诊断任务
2.2Grounding、Perception、Navigation 三类静态能力如何拆解
2.3为什么把 Ask / Call User 纳入正式动作空间
3.工程落地中的关键实践与踩坑
3.1如何设计高保真 sandbox,而不是依赖真实手机和大量人工回放
3.2为什么 final-state-only 不够,如何做 trajectory-based judge
3.3数据构建和评测中的典型问题:不可执行 query、答案泄漏、多路径评测、Ask 机制失真等
4.效果与启发
4.1构建 300 条动态任务、15000 条静态任务、18 个高频场景
4.2动态自动评测与人工一致率达到 85%
4.3静态诊断指标对动态成功率建立高相关,帮助更好地定位模型瓶颈
4.4从结果评估走向过程评估与能力归因,是 GUI Agent 评测的重要方向

听众收益:
1.理解 GUI Agent 评测为什么不能只停留在“任务成功率”或“静态能力题”,建立动态执行、静态诊断和失败归因的一体化视角。
2.获得一套可借鉴的 benchmark 设计方法,包括 top-down 数据构建、trajectory-based judge、Ask 能力评测等关键思路。
3.了解 GUI Agent 自动化评测落地中的工程实践和典型踩坑,为团队构建可规模化的 Agent 评测体系提供参考。

有10多年软件开发及测试经验,2015年加入讯飞教育质量团队,当前主要负责教育BG Agent平台测试以及负责公共技术组,对软硬一体、中台、AI等方向测试有一定的了解研究,并且在研发体系流程建设以及工程效能提升也有一定经验。
京ICP备2020039808号-4 京公网安备11011202100922号