内容简介:
在数据敏感、机器资源有限且精度要求高的私域生产环境中,智能体落地不能只依赖单一大模型。本分享结合金融复杂文档解析项目,介绍如何与业务共同定义交付指标、建设可脱敏评测集;如何以大小模型、专用能力和存量模型构成模型矩阵,通过智能路由、结果仲裁和规则校验协同处理多页文书、印章、手写和表格等难题;以及如何通过旁路回测、人工复核、问题归因和回归评测,形成可控、可审计、可持续迭代的质量闭环。
演讲提纲:
1. 项目背景与私域落地约束
1.1 结合金融复杂文档解析项目,介绍多页文档中正文、表格、印章、手写和附件并存的实际问题。
1.2 面对数据不能出域、算力资源有限、关键字段精度要求高等约束,单一大模型难以覆盖全部场景。
1.3 项目目标是建设可私有化部署、可评测、可回测、可持续迭代的端到端系统。
2. 需求指标与脱敏数据建设
2.1 在需求阶段与业务共同明确文档范围、字段要求、风险等级、自动化边界和验收指标。
2.2 从历史样本中构建脱敏数据集,保留版式结构和典型问题,覆盖标准、长尾、专项和回归场景。
2.3 以端到端业务结果为准,综合关注准确性、字段完整性、时延、失败率和人工复核率。
3. 系统架构与模型矩阵|7分钟
3.1 介绍“任务接入—预处理—版面理解—智能路由—能力执行—结果融合—业务校验—审计输出—质量运营”的系统链路。
3.2 根据任务特点划分大模型、轻量模型、专项模型、规则组件和存量业务模型的职责。
3.3 统一封装存量模型的接口、能力标签、适用边界和质量指标,形成可组合、可替换的模型矩阵。
4. 智能路由与大小模型协同
4.1 根据业务任务、文档版式、局部图像质量、字段风险和资源状态动态选择处理路径。
4.2 先识别正文、表格、印章、手写和附件等区域,再按区域调用合适的模型或业务能力。
4.3 通过多模型协同兼顾复杂场景效果、资源消耗和处理时延,避免固定单模型或单一路径的局限。
5. 结果融合与质量保证
5.1 针对印章遮挡、手写、扫描模糊、跨栏文本和复杂表格等问题,对多路结果进行统一融合与校验。
5.2 综合文本语义、空间位置、版面结构、置信度和规则约束,避免简单采用最高置信度结果。
5.3 输出字段结果的同时保留原文位置、处理路径、校验状态和复核记录,确保结果可解释、可追溯。
6. 从离线评测到生产质量闭环
6.1 结合项目实践,介绍复杂文档的端到端验证、字段级评测和标准、长尾、专项及回归数据集建设。
6.2 通过模型常驻、并行调度、流式处理和缓存等工程手段,平衡系统准确性、响应速度和并发能力。
6.3 持续采集脱敏生产样本、人工修正、异常日志和业务反馈,沉淀专项数据集与回归测试集。
6.4 区分识别、结构、路由、仲裁、规则和工程问题,建立问题归因、专项修复和版本回归机制。
6.5 形成“问题发现—原因定位—离线回归—生产旁路—灰度观测—持续迭代”的质量闭环。
7. 方法论总结
7.1 需求阶段明确业务指标和自动化边界,数据阶段建设可脱敏、可复用的评测基线。
7.2 架构阶段通过模型矩阵和智能路由实现大小模型、专项能力及存量模型协同。
7.3 运营阶段通过生产回测、人工复核和持续回归,让智能体在私域环境中做到可用、可控、可评估、可审计和可迭代
听众收益:
1. 获得私域智能体从需求指标、脱敏数据集到端到端验收的落地方法,明确高精度、高敏感场景下的交付边界。
2. 掌握大小模型、专项能力、规则组件和存量模型协同的模型矩阵设计,以及按任务和文档区域进行智能路由的实践思路。
3. 建立从离线评测、生产旁路到回归测试、问题归因和持续迭代的质量闭环,提升智能体系统的可控性与可运营性。
微众银行武汉研发中心算法工程师,2023年开始从事多模态大模型方向研究。主导金融业务场景的端到端文档解析与信息提取系统、ai-native数字员工“纪要君”等多项智能体项目,具有大模型算法全生命周期落地应用经验。并在这三年中,发布五项国家发明创新专利,一篇CCF-A会议论文。