高途 02 · 题库 AI 提质
千万级题库 AI 提质
AI 产品经理 · 教研中台产品部门 · 2026.04 — 2026.07
01背景与问题
竞品调研的结论之一,是优先建设预生产的可复用内容库,从组织层面保证教研的效率基线。题库是其中最大的一块资产,这个项目就是那条方向的落地。
- 公司背景:2025 年公司围绕 AI 战略建设了千万级 K12 结构化题库,但短时间内堆出来的题库题源杂、质量低——题目有错、知识标签不准、公式符号不规范,教研没法直接用;
- 用户价值:老师有可信的内部题库,不用再跨外部平台找题,效率最高;
- 业务价值:业务部门不用再花钱买其他题库会员,也不用再出人力导题、录题;
- 平台价值:AI 组卷、AI 推题等功能缺高质量题库底座,提质是题库价值兑现的前置条件。
而人工质检一道题约 1.5 元,靠人工把千万级题库提上去不现实——提质必须走 AI 路线才有规模杠杆。
02我的角色
我主导题库提质的业务侧全链路:
- 业务全链路:取数 SQL、预清洗规则包、质检提示词迭代、跑批脚本、结果回写、漏报/误报分析,均由我负责;
- 接口契约:接口的输入输出字段与契约由我定义,与技术同学共同定接口;服务化实现由技术同学完成,脚本和提示词由产品侧维护;
- 标准分层:“基础题 → 精品题 → 精校题”的分层共识由 mentor 牵头,我参与推动,并负责把共识后的标准转译成可执行的判定规则和生产 Pipeline。
03关键动作
3.1 标准构建:把教研的隐性判断变成显性标准
项目起步先建标准:从既有录入规范和精品题/普通题的对比提炼中,把教研“题目能用”的判断拆成七个维度——文本准确性、符号规范性、内容完整性、知识点标签、图文一致性、正确性,外加独立产出的难度——写进质检提示词和脚本规则。
但按这套标准跑了两轮 prompt 迭代,正确率始终触顶。以初中数学为例,与教研做了三轮、每轮 200 题的逐题标注对齐,才发现问题在口径混层:里面混着给教研用的 B 端标准和给学生用的 C 端标准,而 C 端多出来的是教学判断——解析要完整到学生能独立自学、跳步不行,干扰项要对应典型错因,难度标定要准——这类判断 AI 判不稳,按它质检题基本全被拦死,没有规模价值。于是在 mentor 牵头下推动分层共识:基础题是原始池;精品题教研可直接选用,量大、AI 负责;精校题学生可用,量小、人工兜底。B 端要量、C 端要质,AI 只对齐精品层。
3.2 生产 Pipeline:规则预清洗 + AI 质检 + 人工卡点
| 环节 | 做什么 | 设计动机 |
|---|---|---|
| 取数 | 从数仓按学科/学段/题型/知识点 SQL 捞题,每轮按知识点抽 1.5 万题 | 分批可控,badcase 可回流 |
| 规则预清洗 | 乱码硬伤、LaTeX 符号/公式包裹、呈现层录排参数,用确定性规则直接拦掉或原地修复,修复留底可回滚 | 规则能确定的不花 token,零成本拦截 |
| 人工预览卡点 | 自动修复过的题做修复前后双栏对比,肉眼确认没改坏才放行 | 全流程唯一人工卡点,守住“自动化不引入新错” |
| AI 质检 | 10 题一批调用,“批内独立”铁律 + 输出条目数强校验防批量锚定;含图题必须真读图 | 批量是最大降本杠杆,用约束把锚定风险堵死 |
跑完强制校验题数覆盖率,有缺失走补跑循环直到 100%;结果合并成交付表回写多维表格,配漏报/误报/分歧仲裁三张标注表,教研标注驱动下一轮迭代。
3.3 评测闭环:500 题金标抽检
每轮教研从 AI 判精品的题中抽 500 题人工标注作金标,确认率即正确率口径。迭代原则:优先降漏报——缺陷题误升精品,污染的是整个精品库的信誉;降误报不得引入新漏报。提示词立场“宁严勿宽”:错升一道缺陷题的代价远高于漏升一道好题。
04量化结果
| 指标 | 结果 | 口径 |
|---|---|---|
| 精品题产出 | 400 万数学题 → 150 万精品题 | 题库总库千万级,本项目范围为其中 400 万数学题,全部跑完,整体约 37.5% 升入精品 |
| 质检正确率 | 95%+ | 每轮教研从 AI 判精品的题中抽 500 题人工标注作金标,确认率即正确率 |
| 单题质检成本 | 1.5 元 → 0.015 元 | 约 100 倍降本 |
成本靠三个杠杆压下来:规则预清洗零成本拦截硬伤题——不进模型的题一分 token 不花;10 题一批调用——近 700 行的系统 prompt 每批只计一次输入,摊薄到单题;简化输出——只输出题号、是否精品、难度、知识点四个判定字段,不生成理由文字。
数学先行是因为它的判定最客观(可独立验算),方案对数理化同构可扩展。
05方法沉淀
- 标准先于模型:质检上限首先由标准定义决定——标准没和验收方对齐,模型再强也是在错误的靶子上拿高分。评测对齐先于规模跑批,标准稳了才配放量;
- 确定性优先:能用确定性代码解决的问题,不用概率性模型解决——规则零成本、零幻觉、可回滚,模型只干规则干不了的语义判断;代码也不敢判死的,降级成标记;
- 评估驱动迭代:金标抽检定口径(分母明确)、badcase 分类回流、迭代原则清晰(先降漏报、降误报不引入新漏报)——没有回流机制的质检系统跑三轮就会停滞。