内容简介:
AI 生成内容的质量怎么保障,这两年业界建了不少评测体系,但它们的产出大多是一份报告——跑完出分、人看一眼,产物该交付还是交付。行业自己也承认:评估做了不少,上线门禁大多没做。
我们把评测结论接进了在线交付路径。一款内容生成 Agent,每产出一份内容都走一次质量门禁:确定性规则做硬拦截,LLM 判官做多维软评分;判不通过不是记一笔日志,而是定位到出问题的地方自动修复,复检通过才交付给用户。
难点不在判得准不准。一是时延——结论必须在用户可接受的等待时间内返回,否则回来时产物早已发出,门禁形同虚设;而多 Judge 投票、重复采样、人工抽检这些常用手段,在这个预算里一个都用不了。二是评测器不可用时必须放行,门禁会悄悄失效,且失效记录与正常通过看起来一模一样。三是误拦比漏放更伤用户。四是判词直接呈现给用户,写砸了用户当场就不再信任这道门禁。门禁最终从"只记录不拦截"走到真的拦得住。
演讲提纲:
1. 为什么评测报告挡不住问题
开场钩子:两个举手问题——「在座的团队,LLM/Agent 产物上线前有自动或人工质检的请举手?」「质检结论是在放行之前回来、还是之后回来的请举手?」第二个问题直接引出本场主题:门禁「在跑」不等于门禁「拦得住」。
现状:评测体系与方法论并不缺,产出大多是一份报告——跑完出分、人看一眼,产物该交付还是交付。行业自己也承认:评估做了不少,上线门禁大多没做。
划界:离线评测与在线门禁是两套问题。报告可以跑一夜、可以重跑、可以人工复核;在线门禁必须在用户等得起的窗口内、每一次都给出结论,还要扛得住评测器自己挂掉。本场讲的就是放行前那道必须按时给结论的门。同一张图建立全场术语地图:回流 → 规则/判官 → 拦/放 → 派修 → 复检,后续各节均指回此图。
开场断言:拦不住的红线比没有红线更糟——它会让人以为已经拦住了。真实形态:门禁「在跑」,但结论总在产物放行之后才回来;这类记录与「正常过检」在数据里逐列相同,不留专门的痕根本分不出来。
2. 门禁是怎么搭起来的:从只记录到真拦截
评测集:人工维护的黄金评测集,加上线上真实失败的持续回流(判失败/未达标 → 候选池 → 人工采纳 → 不可变数据集版本)。回流口径的坑:只收「判失败」不收「分数未达标」,一半坏例会静默消失。
规则与判官的分工判据:能给出可复核证据的才配做硬拦截(确定性规则),其余只做多维软评分(LLM 判官加权)。红线判词必须带证据原文——「此处空白」与「此处图片透明通道未正常渲染(附证据原文)」是两个系统。
两个正交开关:判不判死(mode)与判死了拦不拦得住(block 开关);上线走「仅记录 → 灰度 → 真拦」,标定期靠 would_block 列积累「如果真拦会拦多少」。
拦下之后必须有出口:定位到出错位置 → 派修(分批派发、单批限额——预算中断时已完成的批次保得住;最多两轮,仍不通的记下卡在哪)→ 复检 → 交付。还要认得「不能修」:有些「错」是产物里刻意摆放的反例(供读者辨错),派修反而毁掉它——判定器要能按行弃权,不判对错。
证据采集决定判官上限:交互式产物只采初始画面,判官看不到操作后才出现的内容;补采终态证据后,判官可见内容多出约三分之一。「判官只能判它看得见的东西」。
3. 第一个坑,时延:它废掉了三种标准做法
等待窗口怎么定:先定「可接受的超窗率」,再从实测时延分布反推窗口值,不能反着来。教训:样本量小的时候,中位数看着够用;样本量上来之后,长尾比中位数长出数倍——按均值(或中位数)定窗口,等于放任长尾全部超窗。
业界三手段——多判官投票、重复采样取均值、人工抽检——在这个预算里全都用不了:每一样都把时延乘一个系数。只能靠「规则与判官分工」换精度:确定性规则扛硬拦截,判官退到软评分。
一个反直觉的调优:视觉判官一次送 4 张图,延迟是送 2 张的 6.7 倍(超线性),而这个参数原本是为准确率定的。调优顺序:先动单请求的批大小,再动并发。
4. 另外三个坑:会自己消失的门禁、误拦的代价、判词即文案
会自己消失的门禁,两种真实形态:其一,fail-open 的自我消解——评测器不可用时必须放行,但放行必须单独分桶留痕,否则「超窗放行」与「正常过检」在数据里逐列相同,门禁悄悄失效且看不出来;其二,新产物形态上线,随行开关把门禁整段跳过,多份产物未经质检交付,直到看板上「未覆盖」一列才暴露——由此立的哨兵:新形态上线,盯第一份产物有没有对应的门禁记录。
误拦的代价不对称:误拦一次等于拒付一次交付,而「给不出结论」不能当成「有问题」——判官不可用、报错、观测不到,一律进第三种状态「存疑」,而不是拦(我们曾因此单日连续误拦、判词完全相同);语境信息只能用于放宽、不得用于加严,放宽必须有人签字。应对是高危项「两次一致才拦」+ 人工复核闭环,误杀率靠逐条人工标注量出来,再按根因一个个修下去。
判词即文案:门禁报「此处空白」,读判词的人打开产物一看内容都在——实际判的是图片渲染缺陷,判对了却像判错了。无论判词的读者是内部处理人还是终端用户,判词失真,门禁的公信力就丢了。
5. 做减法,以及最后拿到了什么
尺子要有版本号:判据、阈值、判官模型都要进指纹。真实教训:线上判官比测试环境悄悄旧了一代,分数漂移却没有任何记录暴露——模型不钉住,「同一把尺子」只是错觉。
评测器自己也要被测:同一份产物重复自评,看两两一致性;一致率本身有多个口径(按对/按次/按产物),只报一个数会误导。「没评完」的评测必须单列——「稳定地评不出来」会在一致率口径下冒充完全一致。
指标做减法的三数判据:触发次数长期为 0=无区分度;不可判定占比高=先修评测器、别急着上红线;误报率的分母必须是已复核数而不是触发数。够不上判据的维度,就下线。
收口——门禁从「只记录」走到「真拦得住」。带走一份清单:分工判据、两个开关、四坑各自的应对、三数减法判据、版本化的尺子。
听众收益:
1.在线质量门禁路径:黄金评测集加线上失败回流攒题目,确定性规则做硬拦截、LLM 判官做软评分,拦下即定位、派修、复检再交付。
2.在线门禁独有的四条硬约束及应对——时延预算(为什么多判官投票、重复采样、人工抽检在在线窗口里全部失效)、fail-open 的自我消解、误拦的不对称代价、判词即文案;这些约束在离线评测资料里找不到。
3.一套给评测指标做减法的量化判据(触发数、不可判定占比、误报率分母口径),以及把判据与判官模型钉进指纹的版本化做法。
13 年测试与质量保障经验。现负责公司 AI Agent 产品的评测体系与 AI Testing 技术探索。
2025 年带队参加微软 AI 开发者挑战赛,最终夺冠。