MODEL IMPROVEMENT / ITERATIVE SFT

数据飞轮

正在推进

让每一轮训练,都有结果可比较、有策略可追溯。

强模型生成可靠轨迹,固定集衡量能力变化;Astra 分析缺口、探索修复策略,重配数据后继续 SFT。

当前阶段 强模型生成与验证固定评测 743 题 / 三项指标动态轨迹 ≤ 5k固定数据 8,352 条原样加入
医学188 题
—

等待完整评测

体验287 题
—

等待完整评测

用药268 题
—

等待完整评测

已完成 SFT上限 8 轮
0 轮

当前保留 · 待评测

i只发布同一冻结口径下的完整评测结果。 三项分数均为真实评测值,不混入不同口径历史结果。
PERFORMANCE

每一轮,能力如何变化

纵轴:通过率 % · 横轴:训练轮次
↗
等待第一组真实分数

起始模型与每轮 SFT 评测完成后,自动形成三条曲线。

实点为原始分数,虚线连接原始值;实线为 EMA 平滑趋势。晋升与停止只依据原始值,不依据平滑值。

TRAINING RESULTS

逐轮训练对比

对比基线 · 看三项指标 · 留最佳模型
模型轮次训练数据量训练阶段耗时医学 ↑体验 ↑用药 ↑模型选择
尚无新框架实跑记录。每轮完整评测后自动追加,不填充示例分数。

医学 / 用药:逐题 Rubric 通过率。体验:UX Judge 达标率(overallRating ≥ 3,且无协议泄漏)。Judge:gpt-5.6-sol · 最大工作线程 128,实际按 API × 模型自适应升降。评测统一使用 1011 修订输入;维护者补充触发边界 19 条。

ANALYSIS & NEXT ACTION

这一轮,发现什么、改变什么

训练完成后,展示能力短板、诊断分层、策略产出与下一轮数据配比。
答案改写Hint 重执行定向补数探索 Skill 1探索 Skill 2

分析来自独立训练池,不回灌评测题。策略图统计 Verify 合格产出,不等同于训练因果收益;末轮只保留分析与规划。

EXECUTION TIMELINE

完整推进过程

逐阶段完成时间与实际耗时
强模型生成→Verify→配比 + SFT→固定集评测→Astra 分析↺
新框架已就绪,尚无执行记录。

训练耗时包含提交、排队与等待模型 Ready;诊断采样包含在分析阶段耗时中,不重复计入轮次累计。