内容简介:
随着多模态大模型的发展,GUI Agent 已经从“看懂界面、执行单步操作”走向“在真实 App 中完成复杂长链路任务”。但现有评测体系仍有明显不足:静态 benchmark 能评原子能力,却很难映射到真实任务表现;动态 benchmark 能看端到端成功率,却难以解释失败到底来自视觉定位、组件理解、动作规划,还是本应主动向用户澄清却没有澄清。与此同时,动态评测普遍依赖人工验收、任务步数偏短、对 Ask/Call User 等协作能力覆盖不足。
本次分享将结合我们在移动端 GUI Agent benchmark 构建中的实践,介绍如何通过“动态任务先构造、静态能力后拆解”的方式,把端到端评测、细粒度诊断和自动化评测真正打通。
演讲提纲:
1.GUI Agent 评测的核心难点
1.1静态 benchmark 与动态 benchmark 各自解决什么问题
1.2为什么只看成功率不够,为什么只做静态能力题也不够
1.3GUI Agent 在真实场景下面临的长链路、动态页面与模糊意图挑战
2.动态-静态一体化评测体系怎么设计
2.1如何从动态任务和 golden trajectory 出发,反推静态诊断任务
2.2Grounding、Perception、Navigation 三类静态能力如何拆解
2.3为什么把 Ask / Call User 纳入正式动作空间
3.工程落地中的关键实践与踩坑
3.1如何设计高保真 sandbox,而不是依赖真实手机和大量人工回放
3.2为什么 final-state-only 不够,如何做 trajectory-based judge
3.3数据构建和评测中的典型问题:不可执行 query、答案泄漏、多路径评测、Ask 机制失真等
4.效果与启发
4.1构建 300 条动态任务、15000 条静态任务、18 个高频场景
4.2动态自动评测与人工一致率达到 85%
4.3静态诊断指标对动态成功率建立高相关,帮助更好地定位模型瓶颈
4.4从结果评估走向过程评估与能力归因,是 GUI Agent 评测的重要方向
听众收益:
1.理解 GUI Agent 评测为什么不能只停留在“任务成功率”或“静态能力题”,建立动态执行、静态诊断和失败归因的一体化视角。
2.获得一套可借鉴的 benchmark 设计方法,包括 top-down 数据构建、trajectory-based judge、Ask 能力评测等关键思路。
3.了解 GUI Agent 自动化评测落地中的工程实践和典型踩坑,为团队构建可规模化的 Agent 评测体系提供参考。
有10多年软件开发及测试经验,2015年加入讯飞教育质量团队,当前主要负责教育BG Agent平台测试以及负责公共技术组,对软硬一体、中台、AI等方向测试有一定的了解研究,并且在研发体系流程建设以及工程效能提升也有一定经验。