医学188 题
—等待完整评测
让每一轮训练,都有结果可比较、有策略可追溯。
强模型生成可靠轨迹,固定集衡量能力变化;Astra 分析缺口、探索修复策略,重配数据后继续 SFT。
等待完整评测
等待完整评测
等待完整评测
当前保留 · 待评测
起始模型与每轮 SFT 评测完成后,自动形成三条曲线。
实点为原始分数,虚线连接原始值;实线为 EMA 平滑趋势。晋升与停止只依据原始值,不依据平滑值。
| 模型轮次 | 训练数据量 | 训练阶段耗时 | 医学 ↑ | 体验 ↑ | 用药 ↑ | 模型选择 |
|---|---|---|---|---|---|---|
| 尚无新框架实跑记录。每轮完整评测后自动追加,不填充示例分数。 | ||||||
医学 / 用药:逐题 Rubric 通过率。体验:UX Judge 达标率(overallRating ≥ 3,且无协议泄漏)。Judge:gpt-5.6-sol · 最大工作线程 128,实际按 API × 模型自适应升降。评测统一使用 1011 修订输入;维护者补充触发边界 19 条。
分析来自独立训练池,不回灌评测题。策略图统计 Verify 合格产出,不等同于训练因果收益;末轮只保留分析与规划。
训练耗时包含提交、排队与等待模型 Ready;诊断采样包含在分析阶段耗时中,不重复计入轮次累计。