Skip to content

速成总览:一天过完四个项目

这套速成稿是什么

01-04 号是深挖答辩底稿(几天量),10 号是拿来背的口述稿。 20 系列(本页 + 21/22/23/24)是「只剩一天」的压缩版:每个项目一份技术方案速成,架构能画、每条简历 bullet 能展开、简历上每个数字有口径和讲法。 深度追问接不住时,回对应 01-04 号稿查——每份速成稿都标了对应关系。

数字的一句话说明

下面所有数值来自当前简历成稿(resume-filled.md,示例填充版)。口径和讲法现在就练熟:投递前换成真实数据时,逻辑不变只换数值;能核实到日志和评测记录的真实值,统一回填 11 号文件 并同步改简历。口径说不清的数字,宁可当场降级成定性表述,不要硬撑。

一、一天时刻表(净投入约 7 小时)

时段时长做什么过关标准
09:0010 min10 号口述稿 §0-§1:主线 + 30 秒/1 分钟自我介绍跟读两遍自我介绍不看稿
09:10-10:401.5 h21 号稿·知识库 RAG:通读 → 合书白纸画两条故事线 → 数字卡第一遍白纸画出入库线+问答线,五张表能默写
10:55-12:101.25 h22 号稿·BI Agent:同上画出状态图两个回路;三存储一句话版和 SQL 安全五条能背
午休
14:00-15:151.25 h23 号稿·智能客服:同上画出退款会话旅程;幂等键构造和错误四分类能背
15:30-16:451.25 h24 号稿·政务助手:同上画出双路检索链路;「代码清单/模型清单」两个清单能背
17:00-18:001 h本页第二节四项目对照表横向自测 + 第三节易混点辨析 + 10 号 四个 2 分钟版各录音一遍不看稿讲满 2 分钟,四个项目不串台
20:00-21:001 h本页第三节数字总表第二遍 + 找人(或自演)只问「这个数怎么算的」「为什么不用 X」每个数 30 秒内说出口径第一句

只剩半天:四份速成稿只读「架构故事线 + 数字卡 + 速记卡」三节,其余砍掉。 只剩 2 小时:10 号稿自我介绍 + 四个 2 分钟版口述 + 本页第三节数字总表。数字站不住和讲不利索是唯二直接挂掉的项;原理短板顶多答不全,不至于崩。

二、四项目一页对照(防串台)

① 知识库 RAG② BI 问数③ 客服 Multi-Agent④ 政务助手
公司/时间亿达 2026.04-06亿达 2025.11-2026.04亿达 2025.04-11掌奇 2024.11-2025.03
一句话业务资料散、无出处 → 可溯源问答取数慢、口径乱 → 中文问数入口散、写操作险 → 可审计闭环不出网、不能答错 → 政务 RAG
编排固定 pipeline(不是 Agent)LangGraph 六节点状态图主 Agent + 五领域子图主图 + 三领域子图
核心机制异步入库四阶段 + 引用编号校验Schema Linking + SQL 安全三层风险分级 + 幂等 + HITL双路召回 + 规则归代码
检索pgvector 单路(坦诚)元数据三路检索(MySQL/Qdrant/ES)复用知识库 RAG 服务ES BM25 + pgvector + RRF + Rerank
存储PG(pgvector)+Redis+MinIOMySQL+Qdrant+ES+Checkpoint 关系库PG(Checkpoint/审批/审计)+RedisPG(pgvector)+ES+Redis
记忆锚点状态与边界笼子闸门确定性归代码
数字组6 库/3,200 份/2.8 万块/120 条/86%/91%/10→2min200 条/89%/3 部门/15s/60%→20%94%/86%/1,500 次/天/35%→18%180 条/91%/93%/小时→分钟

三、20 个数字总表(口径关键词 + 必配动作)

万能五步框架(任何数字被追问都套):①先说口径(分子/分母)→ ②再说样本与时间(多少条、什么时候、谁判定)→ ③主动给对比(哪一版 vs 哪一版)→ ④说不准就降级(区间/定性)→ ⑤兜底句「具体值我回去核记录,口径我可以完整讲」。

项目数字口径关键词必配动作 / 坑
6 个知识库在用、剔测试库
3,200 份文档成功且未删、当前有效会被拿去和分块数互查
28,000 分块≈9 块/文档,条款级切分主动解释切分粒度
120 条评测QA+标准 chunk,含负样本测拒答主动说样本小只看退步
Recall@5 86%hit-rate、chunk 级、某版配置下主动讲「改了 X 从 A 到 B」的对比
引用完整性 91%编号程序校验+相关性抽检;拒答不进分母区分「有引用/能定位/能支撑」三层
10→2 分钟同批任务人工计时、量级口径别当精确均值报
200 条评测按结构分层,含澄清/拒绝两组各层条数自己定死并记住
89% 准确率结果集等价,非文本比对、非跑通主动说 JOIN 低于总分
3 个部门运营/销售/产品,有活跃用户
15 秒端到端,慢在串行多次模型调用主动拆时间去向 + 靠 SSE 压感知
60%→20%取数工单前后窗口对比最难自证:统计周期+数据来源必须说得出
94% 工具成功率最终结果口径、重试合并、读写分开主动说失败 6% 的去向(无静默失败)
86% 完成率有任务意图的会话;规则判定+抽检中途放弃单列
1,500 次/天稳定期日均、会话切分口径、剔测试
35%→18% 转人工拆主动/被动转;35%=老系统基线必配反向指标(纠正率/二次来访),HITL 不参与优化
180 条评测三类分层+应拒答用例、业务方确认答案别临时编大数
91% 准确率关键字段逐项全对、漏项即错判定细则就是亮点,主动讲
93% 引用完整率文件+条款齐全且在有效期内废止政策算不完整
小时→分钟量级对比、基线=人工翻文件拟稿别精确到「X 分钟」

四、易混点辨析(跨项目追问最密集的地方)

  1. pgvector 在 ①④,Qdrant 只在 ②——为什么? 判断标准是「向量要不要和关系数据做强一致联合查询」:①要和文档状态/软删/权限 JOIN 出引用;④政务运维偏好组件少、走已有 PG 体系。②的元数据量小、结构独立、不需 JOIN,专用向量库更干净。
  2. ①是纯向量,④是双路——矛盾吗? 不矛盾,主动讲:①首版优先保入库可靠性和权限正确性(事故 vs 体验),并明确短板是文号类;④查询形态一半是精确串,双路是刚需,且我有四组对比数据的调参方法。
  3. LangGraph 用在 ②③④,①为什么不用? ①是固定流程的 RAG pipeline,节点顺序定死、模型只在「证据是否充足」上判断,不需要图;把 pipeline 说成 Agent 会被戳破,要主动区分。
  4. Checkpoint / 挂起态存哪? ②关系库(澄清跨时长+轨迹要审计,只存关键节点);③PostgreSQL Checkpoint + 独立审批单表(多实例无状态恢复);①没有图,对应物是文档状态表(可重放);④Redis 管会话,检索生成轨迹入日志。
  5. 四个项目「拒答/转人工」的触发条件各是什么? ①召回为空/证据分低;②信息缺失走澄清(不是拒答)、校验执行失败超限转人工取数;③证据不足/路由不确定/多次调用失败;④引用不足/低置信/权限不足。别背串。
  6. SSE 在四个项目里的角色:①入库进度+问答流式;②节点级进度+结果;③阶段事件(含待审批卡片);④节点事件+先推证据。共同坑:网关缓冲、心跳、多副本共享通道。
  7. 两个 86% 不是同一个东西:①没有 86(①是 Recall@5 86%)——②是 89% 准确率,③ 86% 是任务完成率。报数时先说口径再报值,天然防混。

五、与其它文件的关系

  • 深度追问接不住 → 对应 01 02 03 04 的「追到底会问」和「挑战」节。
  • 口语表达和录音自测 → 10 号口述稿
  • 数字要核实真实值 → 11 号数字口径(主表填「真实值」列)。
  • 八股与原理(asyncio/Pydantic/SSE/LangGraph 机制)→ 12 号高频问答 + 公开知识站的 guide 页。
  • 故障故事必须换成你真实经历(各速成稿第六节只给了模板)。