评测 · 升级前验证

用实际结果检验每次升级

当前生产版本为 v4.10.4。这里展示本次兼容修复回归、沿用的 v4.10.3 科研评测,以及 v4.10.0 历史专项的实际结果。

更新于 2026 年 10 月 1 日生产版本:v4.10.4科研评测版本:v4.10.3

当前版本与验证概览

v4.10.4 · 2026 年 10 月 1 日上线

1,060v4.10.4 Python 回归通过
0 失败 / 8 跳过 · 51 个模块
87 / 87v4.10.3 科研运行与判分完成
29 道题,每题重复 3 次
85.62 / 100v4.10.3 科研评测档均分
每题取 3 次中位数后平均

v4.10.4 修复服务器 Python 3.10 环境下的文件版本暂存清理问题,完成本地 Python 3.10 回归、服务器兼容检查与基本服务校验。

v4.10.4 沿用 v4.10.3 已完成的 87 次科研评测,没有重新运行完整科研发布评测。下方分别标注当前兼容修复、科研评测和历史专项的适用版本。

完整科研评测结果

v4.10.3 · 87 次运行已完成 · v4.10.4 沿用此科研证据

29 道题 × 3 次独立运行87 / 87 次
87/87

标准档全部题目完成三次运行与完整判分,四项科研质量门均通过。运行采用完整工具模式(full)。

档均分85.62发布要求 ≥ 70 / 100通过
题级幻觉率0%发布要求 = 0% · 0 / 29 题通过
题级硬失败率0%发布要求 ≤ 10% · 0 / 29 题通过
交付完整率100%发布要求 ≥ 95%通过

自动运行期复核为 82 次通过、5 次部分完成;另有 6 次达到步数上限。发布门通过仍需结合具体题目和这些流程限制解读。

判分修正与原始结果

判分器 2026-09-30.3 修正了将“排除错误对象”和“条件式后续查询建议”误判为违规的规则,使用同一批 87 份原始记录复判。模型答案、题库、判分提示与发布阈值保持不变,旧分数和失败记录仍保留。

同一批 v4.10.3 记录的两版判分
指标原判分器 .2修正判分器 .3
档均分85.2585.62
题级硬失败率10.34%(3/29)0%(0/29)
发布质量门未通过通过

数据更新于 2026-10-01 00:52(北京时间)。v4.10.1 与 v4.10.2 的未通过记录继续保留;跨题库版本的分数不用于计算能力增幅。

科研任务表现

v4.10.3 · 以每题三次运行的中位数统计

四类任务的题级平均分
公开数据复用6 题 · 18 次运行
77.63
序列与结构6 题 · 18 次运行
87.27
靶点与药物证据6 题 · 18 次运行
74.36
扩展工具与交付11 题 · 33 次运行
95.22

各类先取题目中位数,再计算该类平均分;总档均分按全部 29 题平均,不是对四类做等权平均。

任务表现存在差异,4 / 29 题的中位数低于 70 分。70 分是整档平均的发布门槛,不能据总均分认定每道题都达到同等质量。

查看全部 29 题的分数与波动
题级得分(0–100),范围保留三次运行的最低与最高分
题目 ID中位数最低–最高次数
reuse-01-islet-t2d75.4072.30–77.863
reuse-02-lung-hlca84.3376.47–88.293
reuse-03-retina-muller81.9479.17–87.503
reuse-04-atlas-selection82.4268.53–86.113
reuse-05-mouse-fallback82.8875.00–84.723
reuse-06-preprint-honesty58.8149.09–65.763
seqstruct-0188.5785.12–93.573
seqstruct-0279.9274.29–91.113
seqstruct-0385.4881.59–86.353
seqstruct-0498.6191.67–98.613
seqstruct-0577.9876.59–81.353
seqstruct-0693.0681.03–94.443
t2d-0178.7070.85–81.023
t2d-0266.8765.20–70.763
t2d-0364.2960.12–64.293
t2d-0477.9876.87–78.453
t2d-0593.0692.14–93.063
t2d-0665.2849.08–67.593
v11-0193.3491.68–96.683
v11-0285.0085.00–100.003
v11-0398.1289.81–100.003
v11-0491.0687.93–93.123
v11-05100.0096.25–100.003
v11-0698.1288.12–100.003
v11-07100.0094.44–100.003
v11-0895.0092.50–100.003
v11-09100.0086.11–100.003
v11-10100.00100.00–100.003
v11-1186.8186.81–97.923
完整科研任务的本地耗时
中位数 P5087 次任务
502.861 秒
P90描述统计
1,094.218 秒

本地批次使用 6 路模型线程、单路工具执行,耗时包含调度等待;不代表生产响应时间,也不用于宣称版本提速。

实际交付与自动复核

v4.10.0 历史专项 · 同一批 16 轮任务

文件检查与自动复核的结果
实际文件与流程检查16 通过 / 0 失败 / 0 未知
自动模型复核10 通过 / 6 部分完成

“部分完成”表示自动复核覆盖不足,保留原判定;实际文件通过不补齐这些缺少的自动检查。

PDF · 12 轮

核对标题、正文、双栏布局、字体及裁切;标题修改保留原正文与样式。

火山图 · 2 轮

核对全部 12 个数据点、显著性阈值线与结果排序;两次参数错误均恢复,仍保留在记录中。

结构域图 · 2 轮

核对 120 aa 合成序列的两个结构域区间、JSON 数据与实际 SVG/PNG;未使用外部数据库。

PDF 任务耗时

v4.10.0 历史专项 · 纯文字双栏生成与标题修改 · 每种请求模式重复 3 组,每组 2 轮

各观察时点的耗时中位数
合格 PDF 生成
2.624 秒
首次回答正文
6.078 秒
整轮完成(含复核)
25.060 秒

单位:秒。各条是单独计算的中位数,不能相加。整轮完成包含回答与独立复核。

合格 PDF 的生成观察时点中位数为 2.624 秒,范围为 2.207–2.919 秒。该时间取成功编译工具的完成事件,并由事后文件检查确认对应合格最终文件;它不是独立复核完成的时刻。

这些 PDF 任务中,full 和 adaptive 请求最终都使用完整模式。自然缓存没有清空,两组耗时差异仅为观察结果,不能据此判断按需工具模式的提速效果或生产环境速度。

查看图表数值
PDF 单轮耗时中位数(秒)
请求模式轮数合格 PDF首次正文整轮完成
全部122.6246.07825.060
full62.5866.82130.597
adaptive62.6735.62823.292

文件策略基准

v4.10.0 历史基准 · 合成文件基准 · 每项 5 次运行的中位数

保存快照与计算摘要的耗时
原策略新策略毫秒 · 越短越快
稳定大文件快照12 × 8 MiB
原策略
26.137
新策略
5.655
稳定文件重复摘要16 MiB
原策略
6.840
新策略
0.116
小文件快照100 × 8 KiB
原策略
15.390
新策略
39.928
新文件摘要16 MiB
原策略
6.132
新策略
11.920

各行共用 0–45 毫秒刻度;右侧显示实际数值。

稳定大文件的快照与重复摘要耗时下降;小文件快照和新文件摘要因增加安全核验而耗时上升。优化效果与文件类型有关,这组微基准不能换算成科研任务或生产环境的加速比例。

方法与适用范围

结果可追溯,结论与证据范围一致

  • 科研评测与历史专项使用真实模型和本地 Linux 容器;运行环境为 macOS / arm64 与 runc,不等同于生产环境的 Linux / runsc,也未包含公网登录与排队耗时。
  • PDF 每种请求模式只有 3 组重复;火山图与结构域图每种模式各 1 次。这些历史小样本用于检查指定流程,不能代表全部科研任务的成功率。
  • 历史 v4.9.x 失败候选和早期预检记录仍保留,不混入 v4.10.0 专项的 16 轮统计。科研发布批次的 87 次、历史专项的 16 轮与 Python 回归的 1060 项属于不同检查,不合并计算通过率。
数据来源与版本
当前兼容修复
v4.10.4 · 提交 4658c4bb8cc3 · Python 3.10 回归 1060 / 0 / 8,服务器兼容检查通过;本次未重跑科研评测。
专项回归
v4.10.0 · 提交 bb11baefc4d0 · formal-final/summary.json
离线与文件基准
PERFORMANCE_UPGRADE_20260930.md
科研评测
v4.10.3 · 提交 939116d9ed5d · release-4.10.3;判分器 2026-09-30.3 · 提交 bb64cc8ee32e,题库 2026-09-30.2。
模型
主力 GLM-5.3-flashx;复核 deepseek-v4-flash
下载图表汇总数据(JSON) ↗
查看此次升级说明 →