AI欢迎来到杨骐玮的简历网站
Contact me
← 返回实习经历

高途 04 · 选题 Skill

选题 Skill

AI 产品经理 · 教研中台产品部门 · 2026.05

选题 1-2 小时/份 → 10-15 分钟题库选题率 57% → 70%五维筛选标准灰度上线

01背景与问题

这个项目是竞品调研结论的直接落地:转向教研细分场景的模块化提效,AI 做检索筛选的零件,选题判断权留在教研手里。选题 Skill 是这个结论的第一个落地验证。

  • 用户价值:教研 80% 以上的工作量在讲义、课件、学科物料,讲义制作和组卷都绕不开选题,选题是其中最耗时的环节——原来教研要在第三方平台搜题、筛选、下载,再手动录入系统,一份讲义的选题要 1-2 小时;往年用过什么题全凭记忆排除,难度和题型把控靠个人经验。Skill 把“找题”变成自然语言描述需求加最终判断;
  • 平台价值:刚建成的千万级题库只是个存题仓库,使用率很低,而选题是题库最大的消费场景。做成选题,题库从闲置资产盘活成生产工具——选题率(教研产出的讲义和试卷中来自题库的题目占比)就是题库渗透的直接证据;
  • 和题库提质的关系:供给侧和消费侧——提质解决“题库里的题能不能用”,选题解决“教研用不用题库”;提质的产出是选题的弹药,选题率是检验提质价值的指标之一。

02我的角色

  • 主导选题 Skill 的产品设计:PRD、设计文档、SKILL.md、prompts、五维筛选标准、Demo 搭建、教研验证与评测,均由我与 mentor 共同完成——mentor 把控方向和评审,我负责具体产出与落地执行;Demo 由我通过 Claude Code 自行搭建;
  • 协作模式设计:研发侧交付 CLI 工具层,把题库检索、知识树、试卷、题包等平台能力封装成约十个原子命令,契约层不绑定任何步骤语义;SKILL.md、对话流 SOP、prompts、意图识别规则全部归产品侧维护——产品对效果的迭代不依赖研发排期。

03关键动作

3.1 两个场景,一条 Pipeline

选题覆盖教研的两个真实工作流:

  • 场景 A · 大班课讲义选题:输入往年讲义和今年教学大纲,AI 归纳往年的知识板块、题型、难度结构和已用题,给出选题策略建议;教研确认后从题库检索筛选,生成带入选理由的选题初稿,教研对话式修改,确认后直接写入目标讲义;
  • 场景 B · 教研组卷:输入学科、年级、卷型,AI 先出考情分析和卷子结构草案——难度 7:2:1、题型分布、压轴题安排都有学科默认值;确认后按结构分区段找题,优先选“常考”题,压轴题单独把控,最后做全卷一致性校验,生成题包存入内部平台。

两个场景的触发方式和策略生成逻辑不同,但底层检索筛选 Pipeline 共用——一套引擎、两种对话流。

3.2 检索筛选 Pipeline:每一跳防一个问题

环节机制防什么问题
查询转换把“一元二次方程”这类教研话术语义映射到知识树节点,LLM 只能在真实知识树里选,不能编造 ID用检索约束生成,把幻觉关在字典里;映射结果在策略确认环节暴露给教研,错了在检索前被拦下
候选池按目标数量三倍冗余取候选;候选只带 ID、摘要、难度、来源、知识点,不带全文冗余给筛选留取舍空间;不带全文控制 token,防止上下文撑爆、筛选质量下降
五维筛选LLM 按大纲契合度、与往年差异度、难度分布达标、题型多样性、来源偏好五个维度筛选,输出精选题和每题一句入选理由五维从教研真实选题动作里抽出——把隐性经验显式化成 AI 可执行的标准
草稿修改换题、增题、调难度都在内存草稿里改,确认后才统一写入写入是全量覆盖接口,草稿态支持无成本反悔;确认动作是人和 AI 的责任分界

3.3 信任设计:每题一句入选理由

教研对 AI 选题天然不信任,初期反馈“AI 选的题我不敢用”。所以每道题强制输出入选理由,教研的判断成本从“重新筛一遍”降为“读理由抽查”;换题行为埋点回流,换题率高的维度就是筛选标准要迭代的维度。半自动是刻意选择:选题是教学设计的核心判断,教研不会放权给没建立信任的 AI——AI 不挑战他的判断,只替他跑腿。

3.4 评测:badcase 按维度回流

建覆盖两个场景的测试集,每个任务有教研确认过的预期结果;跑 Skill 出选题初稿后逐题对照五维标准打标,统计各维度达标率;badcase 按维度归类——映射错、召回不足、筛选误判,分别回流到语义映射 prompt、查询计划、筛选 prompt 去修。评测和调优由产品侧同一拨人完成,badcase 到 prompt 修改没有传递损耗。

04量化结果

选题 Skill 已灰度上线,两个核心指标均为灰度期间实测:

指标结果口径
选题效率1-2 小时/份 → 10-15 分钟原流程是第三方平台搜题、筛选、下载、录入、逐题嵌入;现在从描述需求到确认选题列表 10-15 分钟,剩下的时间是教研做最终判断——这部分本来也不该省
题库选题率57% → 70%教研产出的讲义/试卷中来自题库的题目占比,灰度上线后按此口径实测统计,对比上线前基线 57%

选题率没到 100% 是正常的:剩下的主要是教研自编题和题库尚未覆盖的新考法——这反过来给题库建设提了需求清单。

05方法沉淀

  • 流程骨架 + 可替换配置:检索筛选 Pipeline 的骨架在两个场景间共用,差异收敛在策略生成层——难度比、题型分布、筛选维度权重这类教研标准做成可替换配置,工程参数写死;同一骨架从选题复用到组卷;
  • 标准先于模型:先把教研选题的隐性判断显式化成五维标准,再谈 prompt 和模型——顺序反了就是拿 AI 试错撞运气;
  • 编排层和能力层分离:产品持有对话流和 prompts,研发持有稳定的工具契约——Skill 的迭代不依赖研发排期,迭代速度是分工设计出来的。