内容简介:
AI 生成内容的评测体系业界已建了不少,但产出大多是一份报告:跑完出分、人看一眼,产物照常交付。我们把评测接进了在线交付路径——内容生成 Agent 每产出一份内容都先过质量门禁:确定性规则做硬拦截,LLM 判官做软评分;判不通过就定位问题、自动修复,复检通过才交付。
真正的难点不在判得准不准,而在四个在线约束:结论必须在用户等得起的时间内返回;评测器不可用时必须放行,门禁会悄悄失效;误拦比漏放代价更高;判词描述失真,可能造成人工复核误判。本次分享 Agent 评测如何从”出报告”走到“拦交付”。
演讲提纲:
1. 评测报告为什么挡不住问题
离线评测与在线门禁是两套问题:后者必须在放行前、每一次都按时给出结论
拦不住的红线比没有红线更糟——它让人以为已经拦住了
2. 门禁怎么搭:从只记录到真拦截
分工判据:能给出可复核证据的才做硬拦截,其余交给 LLM 判官软评分
渐进上线:仅记录 → 灰度 → 真拦,先量出"如果真拦会拦多少"
拦下要有出口:定位 → 自动修复 → 复检 → 交付
3. 时延:在线窗口废掉了三种常规做法
多判官投票、重复采样、人工抽检都会成倍拉长时延
先定可接受的超窗率,再从实测长尾反推等待窗口
4. 另外三个坑
会自己消失的门禁:放行必须单独留痕,否则失效与正常通过无法区分
误拦代价不对称:给不出结论不等于有问题,应判"存疑"而非拦截
判词描述失真:问题判对了,复核时却被当成误判放过
5. 让门禁本身可信
尺子要有版本号:判据和判官模型一变,分数漂移可追溯
评测器自己也要被测,指标靠数据做减法
听众收益:
1. 一条可落地的在线质量门禁路径:规则硬拦截 + LLM 判官软评分,拦下即定位、修复、复检再交付。
2. 在线门禁特有的四个坑及应对:时延预算、门禁静默失效、误拦代价、判词失真。
3. 一套让门禁本身可信的做法:判据与判官模型版本化、评测器自测,以及用数据给指标做减法。
网龙网络 AI Native Engineer,深耕测试与质量保障领域 13 年。近年负责公司 AI Testing 技术探索与落地,搭建 TestCortex 智能测试平台,打通 AI 生成测试用例、AI 接口测试、AI UI 测试等核心场景。当前聚焦 AI Agent 产品评测体系建设,主导离线评测与在线评测双轨机制,同时探索评测体系的自进化。2025 年带队获得首届微软 AI 开发者挑战赛冠军。