Case Study
rag
RAG 故障诊断 Agent
在飞书中诊断 AI 应用报错;知识库未命中时读取源码分析,并把新知识送入人工审核候选池。
背景与问题
生成平台使用者遇到报错时,通常只能复制英文错误或发送截图。通用模型不了解项目实现,维护者重复回答相同问题,知识也难以持续积累。
我的职责
我独立完成知识库结构、索引管道、飞书机器人、多模态查询、检索与回答流程、自学习分支、测试和部署。
系统架构
飞书消息先经过文本与图片预处理,再查询当前激活的向量集合。命中时基于知识片段回答;未命中时进入受控源码分析,并把候选知识写入独立审核池。
接收飞书文本、截图或混合问题并形成检索查询。
- 输入
- 用户报错文本与图片
- 输出
- 脱敏、归一化的查询
- 失败策略
- 无法读取附件时明确提示,不生成虚假视觉描述
从当前激活的向量集合检索相关错误条目。
- 输入
- 归一化查询
- 输出
- 带来源标题的相关知识片段
- 失败策略
- 索引不可用时停止回答并返回服务状态
基于知识片段生成原因、解决步骤与覆盖度。
- 输入
- 查询、图片与检索结果
- 输出
- 带引用和覆盖度的飞书卡片
- 失败策略
- 知识不足时标记未命中,不猜测确定结论
未命中时读取白名单源码,分析原因并生成候选知识。
- 输入
- 未命中问题与应用源码
- 输出
- 分级置信度答案和候选条目
- 失败策略
- 低置信度或模型失败时引导联系维护者
候选条目写入独立文档,人工修订后再进入主知识库。
- 输入
- 带指纹的候选知识
- 输出
- 经人工确认的知识库更新
- 失败策略
- 候选重复时跳过;Agent 永不直接写主知识库
关键决策
- 主知识库只接收人工审核后的内容。
- 索引重建采用新集合写入后再切换的方式,避免半成品覆盖在线知识。
- 未命中回答必须展示置信度和来源边界。
可靠性
同步器拒绝空文档和空切分结果。源码分析按置信度分支处理,候选条目用查询指纹去重;模型或飞书接口失败时保留旧知识库并返回明确状态。
产品证据
公开截图展示脱敏后的报错、诊断结构、解决步骤和知识覆盖度,不展示真实员工、业务内容或私有源码。
复盘
早期网页 RAG 项目验证了索引与检索路径,后续版本转向飞书原生交互和人工审核闭环。进一步提升应优先建立真实问题评测集,而不是继续增加未经验证的检索组件。
Sanitized product evidence