← 返回实习经历
高途 04 · 选题 Skill
选题 Skill
AI 产品经理 · 教研中台产品部门 · 2026.05
选题 1-2 小时/份 → 10-15 分钟题库选题率 57% → 70%五维筛选标准灰度上线
01背景与问题
这个项目是竞品调研结论的直接落地:转向教研细分场景的模块化提效,AI 做检索筛选的零件,选题判断权留在教研手里。选题 Skill 是这个结论的第一个落地验证。
- 用户价值:教研 80% 以上的工作量在讲义、课件、学科物料,讲义制作和组卷都绕不开选题,选题是其中最耗时的环节——原来教研要在第三方平台搜题、筛选、下载,再手动录入系统,一份讲义的选题要 1-2 小时;往年用过什么题全凭记忆排除,难度和题型把控靠个人经验。Skill 把“找题”变成自然语言描述需求加最终判断;
- 平台价值:刚建成的千万级题库只是个存题仓库,使用率很低,而选题是题库最大的消费场景。做成选题,题库从闲置资产盘活成生产工具——选题率(教研产出的讲义和试卷中来自题库的题目占比)就是题库渗透的直接证据;
- 和题库提质的关系:供给侧和消费侧——提质解决“题库里的题能不能用”,选题解决“教研用不用题库”;提质的产出是选题的弹药,选题率是检验提质价值的指标之一。
02我的角色
- 主导选题 Skill 的产品设计:PRD、设计文档、SKILL.md、prompts、五维筛选标准、Demo 搭建、教研验证与评测,均由我与 mentor 共同完成——mentor 把控方向和评审,我负责具体产出与落地执行;Demo 由我通过 Claude Code 自行搭建;
- 协作模式设计:研发侧交付 CLI 工具层,把题库检索、知识树、试卷、题包等平台能力封装成约十个原子命令,契约层不绑定任何步骤语义;SKILL.md、对话流 SOP、prompts、意图识别规则全部归产品侧维护——产品对效果的迭代不依赖研发排期。
03关键动作
3.1 两个场景,一条 Pipeline
选题覆盖教研的两个真实工作流:
- 场景 A · 大班课讲义选题:输入往年讲义和今年教学大纲,AI 归纳往年的知识板块、题型、难度结构和已用题,给出选题策略建议;教研确认后从题库检索筛选,生成带入选理由的选题初稿,教研对话式修改,确认后直接写入目标讲义;
- 场景 B · 教研组卷:输入学科、年级、卷型,AI 先出考情分析和卷子结构草案——难度 7:2:1、题型分布、压轴题安排都有学科默认值;确认后按结构分区段找题,优先选“常考”题,压轴题单独把控,最后做全卷一致性校验,生成题包存入内部平台。
两个场景的触发方式和策略生成逻辑不同,但底层检索筛选 Pipeline 共用——一套引擎、两种对话流。
3.2 检索筛选 Pipeline:每一跳防一个问题
| 环节 | 机制 | 防什么问题 |
|---|---|---|
| 查询转换 | 把“一元二次方程”这类教研话术语义映射到知识树节点,LLM 只能在真实知识树里选,不能编造 ID | 用检索约束生成,把幻觉关在字典里;映射结果在策略确认环节暴露给教研,错了在检索前被拦下 |
| 候选池 | 按目标数量三倍冗余取候选;候选只带 ID、摘要、难度、来源、知识点,不带全文 | 冗余给筛选留取舍空间;不带全文控制 token,防止上下文撑爆、筛选质量下降 |
| 五维筛选 | LLM 按大纲契合度、与往年差异度、难度分布达标、题型多样性、来源偏好五个维度筛选,输出精选题和每题一句入选理由 | 五维从教研真实选题动作里抽出——把隐性经验显式化成 AI 可执行的标准 |
| 草稿修改 | 换题、增题、调难度都在内存草稿里改,确认后才统一写入 | 写入是全量覆盖接口,草稿态支持无成本反悔;确认动作是人和 AI 的责任分界 |
3.3 信任设计:每题一句入选理由
教研对 AI 选题天然不信任,初期反馈“AI 选的题我不敢用”。所以每道题强制输出入选理由,教研的判断成本从“重新筛一遍”降为“读理由抽查”;换题行为埋点回流,换题率高的维度就是筛选标准要迭代的维度。半自动是刻意选择:选题是教学设计的核心判断,教研不会放权给没建立信任的 AI——AI 不挑战他的判断,只替他跑腿。
3.4 评测:badcase 按维度回流
建覆盖两个场景的测试集,每个任务有教研确认过的预期结果;跑 Skill 出选题初稿后逐题对照五维标准打标,统计各维度达标率;badcase 按维度归类——映射错、召回不足、筛选误判,分别回流到语义映射 prompt、查询计划、筛选 prompt 去修。评测和调优由产品侧同一拨人完成,badcase 到 prompt 修改没有传递损耗。
04量化结果
选题 Skill 已灰度上线,两个核心指标均为灰度期间实测:
| 指标 | 结果 | 口径 |
|---|---|---|
| 选题效率 | 1-2 小时/份 → 10-15 分钟 | 原流程是第三方平台搜题、筛选、下载、录入、逐题嵌入;现在从描述需求到确认选题列表 10-15 分钟,剩下的时间是教研做最终判断——这部分本来也不该省 |
| 题库选题率 | 57% → 70% | 教研产出的讲义/试卷中来自题库的题目占比,灰度上线后按此口径实测统计,对比上线前基线 57% |
选题率没到 100% 是正常的:剩下的主要是教研自编题和题库尚未覆盖的新考法——这反过来给题库建设提了需求清单。
05方法沉淀
- 流程骨架 + 可替换配置:检索筛选 Pipeline 的骨架在两个场景间共用,差异收敛在策略生成层——难度比、题型分布、筛选维度权重这类教研标准做成可替换配置,工程参数写死;同一骨架从选题复用到组卷;
- 标准先于模型:先把教研选题的隐性判断显式化成五维标准,再谈 prompt 和模型——顺序反了就是拿 AI 试错撞运气;
- 编排层和能力层分离:产品持有对话流和 prompts,研发持有稳定的工具契约——Skill 的迭代不依赖研发排期,迭代速度是分工设计出来的。