数据冻结
原始数据、固定评测题隔离;记录来源与校验指纹
强模型生产可靠轨迹,通过评测识别能力缺口,以答案改写、提示重执行与定向补数持续迭代 SFT。保留最佳检查点,控制数据规模和迭代预算。
当前阶段:等待启动。已完成 0 次新流程检查点评测。固定开发验证集为 1000 题:医学 589、体验 411;用药 151 为医学子集。
新项目独立维护;尚未运行的训练不展示为完成。
原始数据、固定评测题隔离;记录来源与校验指纹
gpt-6-astra + 真 MCP;训练候选经 gpt-5.6-sol 审核
总量 ≤ 5000;旧/新约 70% / 30%;不足不补齐
无 Hint 独立 rollout;verify2 Judge gpt-5.6-sol;并发 16
gpt-6-astra:答案改写 → Hint 重执行 → 能力补数;新策略先做提案
原始增益 ≥ 0.5 pp 且子项不回退;连续 3 次无有效增益则停止
实点/虚线为原始分数,实线为 EMA 平滑曲线(α=0.4)。晋升与停止只使用原始值。自建验证集并非人工金标或正式 Bench。
以下来自既有 exp_1003 的实测记录,单独呈现,不计入新流程迭代与停止判断。
| 检查点 | 整体 | 医学 | 体验 | 用药子集 |
|---|---|---|---|---|
| 首次 SFT | 78.30% | 80.48% | 75.18% | 75.50% |
| 历史轮次 01 | 83.20% | 84.89% | 80.78% | 78.15% |
| 历史轮次 02 | 85.80% | 85.91% | 85.64% | 84.77% |