数据飞轮

强模型生产可靠轨迹,通过评测识别能力缺口,以答案改写、提示重执行与定向补数持续迭代 SFT。保留最佳检查点,控制数据规模和迭代预算。

当前推进

流程已就绪,等待启动

当前阶段:等待启动。已完成 0 次新流程检查点评测。固定开发验证集为 1000 题:医学 589、体验 411;用药 151 为医学子集。

新项目独立维护;尚未运行的训练不展示为完成。

主链路

01

数据冻结

原始数据、固定评测题隔离;记录来源与校验指纹

02

强模型生成与验证

gpt-6-astra + 真 MCP;训练候选经 gpt-5.6-sol 审核

03

配比与 SFT

总量 ≤ 5000;旧/新约 70% / 30%;不足不补齐

04

固定集评测

无 Hint 独立 rollout;verify2 Judge gpt-5.6-sol;并发 16

05

能力诊断与修复

gpt-6-astra:答案改写 → Hint 重执行 → 能力补数;新策略先做提案

06

晋升与继续

原始增益 ≥ 0.5 pp 且子项不回退;连续 3 次无有效增益则停止

每次 SFT 后的性能变化

尚未开始新流程训练。每轮完整评测后自动追加性能曲线。

实点/虚线为原始分数,实线为 EMA 平滑曲线(α=0.4)。晋升与停止只使用原始值。自建验证集并非人工金标或正式 Bench。

时间线

已有实验的历史参考

以下来自既有 exp_1003 的实测记录,单独呈现,不计入新流程迭代与停止判断。

70.2%75.4%80.5%85.7%90.9%首次 SFT 整体 78.30%历史轮次 01 整体 83.20%历史轮次 02 整体 85.80%首次 SFT 医学 80.48%历史轮次 01 医学 84.89%历史轮次 02 医学 85.91%首次 SFT 体验 75.18%历史轮次 01 体验 80.78%历史轮次 02 体验 85.64%首次 SFT 用药子集 75.50%历史轮次 01 用药子集 78.15%历史轮次 02 用药子集 84.77%首次 SFT历史轮次 01历史轮次 02
● 整体 ● 医学 ● 体验 ● 用药子集
检查点整体医学体验用药子集
首次 SFT78.30%80.48%75.18%75.50%
历史轮次 0183.20%84.89%80.78%78.15%
历史轮次 0285.80%85.91%85.64%84.77%