用实际结果检验每次升级
当前生产版本为 v4.10.4。这里展示本次兼容修复回归、沿用的 v4.10.3 科研评测,以及 v4.10.0 历史专项的实际结果。
当前版本与验证概览
v4.10.4 · 2026 年 10 月 1 日上线
0 失败 / 8 跳过 · 51 个模块
29 道题,每题重复 3 次
每题取 3 次中位数后平均
v4.10.4 修复服务器 Python 3.10 环境下的文件版本暂存清理问题,完成本地 Python 3.10 回归、服务器兼容检查与基本服务校验。
v4.10.4 沿用 v4.10.3 已完成的 87 次科研评测,没有重新运行完整科研发布评测。下方分别标注当前兼容修复、科研评测和历史专项的适用版本。
完整科研评测结果
v4.10.3 · 87 次运行已完成 · v4.10.4 沿用此科研证据
标准档全部题目完成三次运行与完整判分,四项科研质量门均通过。运行采用完整工具模式(full)。
自动运行期复核为 82 次通过、5 次部分完成;另有 6 次达到步数上限。发布门通过仍需结合具体题目和这些流程限制解读。
判分修正与原始结果
判分器 2026-09-30.3 修正了将“排除错误对象”和“条件式后续查询建议”误判为违规的规则,使用同一批 87 份原始记录复判。模型答案、题库、判分提示与发布阈值保持不变,旧分数和失败记录仍保留。
| 指标 | 原判分器 .2 | 修正判分器 .3 |
|---|---|---|
| 档均分 | 85.25 | 85.62 |
| 题级硬失败率 | 10.34%(3/29) | 0%(0/29) |
| 发布质量门 | 未通过 | 通过 |
数据更新于 2026-10-01 00:52(北京时间)。v4.10.1 与 v4.10.2 的未通过记录继续保留;跨题库版本的分数不用于计算能力增幅。
科研任务表现
v4.10.3 · 以每题三次运行的中位数统计
各类先取题目中位数,再计算该类平均分;总档均分按全部 29 题平均,不是对四类做等权平均。
任务表现存在差异,4 / 29 题的中位数低于 70 分。70 分是整档平均的发布门槛,不能据总均分认定每道题都达到同等质量。
查看全部 29 题的分数与波动
| 题目 ID | 中位数 | 最低–最高 | 次数 |
|---|---|---|---|
| reuse-01-islet-t2d | 75.40 | 72.30–77.86 | 3 |
| reuse-02-lung-hlca | 84.33 | 76.47–88.29 | 3 |
| reuse-03-retina-muller | 81.94 | 79.17–87.50 | 3 |
| reuse-04-atlas-selection | 82.42 | 68.53–86.11 | 3 |
| reuse-05-mouse-fallback | 82.88 | 75.00–84.72 | 3 |
| reuse-06-preprint-honesty | 58.81 | 49.09–65.76 | 3 |
| seqstruct-01 | 88.57 | 85.12–93.57 | 3 |
| seqstruct-02 | 79.92 | 74.29–91.11 | 3 |
| seqstruct-03 | 85.48 | 81.59–86.35 | 3 |
| seqstruct-04 | 98.61 | 91.67–98.61 | 3 |
| seqstruct-05 | 77.98 | 76.59–81.35 | 3 |
| seqstruct-06 | 93.06 | 81.03–94.44 | 3 |
| t2d-01 | 78.70 | 70.85–81.02 | 3 |
| t2d-02 | 66.87 | 65.20–70.76 | 3 |
| t2d-03 | 64.29 | 60.12–64.29 | 3 |
| t2d-04 | 77.98 | 76.87–78.45 | 3 |
| t2d-05 | 93.06 | 92.14–93.06 | 3 |
| t2d-06 | 65.28 | 49.08–67.59 | 3 |
| v11-01 | 93.34 | 91.68–96.68 | 3 |
| v11-02 | 85.00 | 85.00–100.00 | 3 |
| v11-03 | 98.12 | 89.81–100.00 | 3 |
| v11-04 | 91.06 | 87.93–93.12 | 3 |
| v11-05 | 100.00 | 96.25–100.00 | 3 |
| v11-06 | 98.12 | 88.12–100.00 | 3 |
| v11-07 | 100.00 | 94.44–100.00 | 3 |
| v11-08 | 95.00 | 92.50–100.00 | 3 |
| v11-09 | 100.00 | 86.11–100.00 | 3 |
| v11-10 | 100.00 | 100.00–100.00 | 3 |
| v11-11 | 86.81 | 86.81–97.92 | 3 |
本地批次使用 6 路模型线程、单路工具执行,耗时包含调度等待;不代表生产响应时间,也不用于宣称版本提速。
实际交付与自动复核
v4.10.0 历史专项 · 同一批 16 轮任务
“部分完成”表示自动复核覆盖不足,保留原判定;实际文件通过不补齐这些缺少的自动检查。
核对标题、正文、双栏布局、字体及裁切;标题修改保留原正文与样式。
核对全部 12 个数据点、显著性阈值线与结果排序;两次参数错误均恢复,仍保留在记录中。
核对 120 aa 合成序列的两个结构域区间、JSON 数据与实际 SVG/PNG;未使用外部数据库。
PDF 任务耗时
v4.10.0 历史专项 · 纯文字双栏生成与标题修改 · 每种请求模式重复 3 组,每组 2 轮
单位:秒。各条是单独计算的中位数,不能相加。整轮完成包含回答与独立复核。
合格 PDF 的生成观察时点中位数为 2.624 秒,范围为 2.207–2.919 秒。该时间取成功编译工具的完成事件,并由事后文件检查确认对应合格最终文件;它不是独立复核完成的时刻。
这些 PDF 任务中,full 和 adaptive 请求最终都使用完整模式。自然缓存没有清空,两组耗时差异仅为观察结果,不能据此判断按需工具模式的提速效果或生产环境速度。
查看图表数值
| 请求模式 | 轮数 | 合格 PDF | 首次正文 | 整轮完成 |
|---|---|---|---|---|
| 全部 | 12 | 2.624 | 6.078 | 25.060 |
| full | 6 | 2.586 | 6.821 | 30.597 |
| adaptive | 6 | 2.673 | 5.628 | 23.292 |
文件策略基准
v4.10.0 历史基准 · 合成文件基准 · 每项 5 次运行的中位数
各行共用 0–45 毫秒刻度;右侧显示实际数值。
稳定大文件的快照与重复摘要耗时下降;小文件快照和新文件摘要因增加安全核验而耗时上升。优化效果与文件类型有关,这组微基准不能换算成科研任务或生产环境的加速比例。
方法与适用范围
结果可追溯,结论与证据范围一致
- 科研评测与历史专项使用真实模型和本地 Linux 容器;运行环境为 macOS / arm64 与 runc,不等同于生产环境的 Linux / runsc,也未包含公网登录与排队耗时。
- PDF 每种请求模式只有 3 组重复;火山图与结构域图每种模式各 1 次。这些历史小样本用于检查指定流程,不能代表全部科研任务的成功率。
- 历史 v4.9.x 失败候选和早期预检记录仍保留,不混入 v4.10.0 专项的 16 轮统计。科研发布批次的 87 次、历史专项的 16 轮与 Python 回归的 1060 项属于不同检查,不合并计算通过率。
数据来源与版本
- 当前兼容修复
- v4.10.4 · 提交
4658c4bb8cc3· Python 3.10 回归 1060 / 0 / 8,服务器兼容检查通过;本次未重跑科研评测。 - 专项回归
- v4.10.0 · 提交
bb11baefc4d0· formal-final/summary.json - 离线与文件基准
- PERFORMANCE_UPGRADE_20260930.md
- 科研评测
- v4.10.3 · 提交
939116d9ed5d· release-4.10.3;判分器 2026-09-30.3 · 提交bb64cc8ee32e,题库 2026-09-30.2。 - 模型
- 主力 GLM-5.3-flashx;复核 deepseek-v4-flash