构建自动化产题链路与人工金标基准
动态训练集:基于上游回流的线上负反馈 Trace 持续构建 Bad Case 训练题,并利用阶段性人审结果迭代校准产题 Skill;在人审通过率超过 70% 后转为自动化产题,使训练集能够随线上问题持续更新,支撑后续轨迹归因与 Skill 优化。
人工金标基准:从 40 万 + 真实线上 Query 中完成场景标注、覆盖采样、去重清洗与人工标注,构建并冻结 211 题人工金标基准;通过多模型交叉评测与重复执行检验题目的正确性、稳定性与区分度,作为候选 Skill 评估和版本准出的统一尺度。