运行对比
本页内容
比较已完成的运行,前提是负载版本、评分模型和配置文件相同。变化百分比描述的是数值差异,但其本身并不能证明某项调整的效果。
在比较数值之前,请先根据结果文件检查两次运行的兼容性:每个结果文件都记录了负载版本——其组成的固定标识符——以及评分模型,还有统计版本。请成对比较这些字段:如果负载或评分模型不一致,则这些运行属于不同的协议,其分数无法直接比较。这些标识符的构成方式在方法说明中有所描述。
- 记录处理器和显卡型号、Windows 与驱动版本。测试之间不要更改电源模式和散热条件。使用同一组后台程序。
- 先在不更改设置的情况下至少执行三次测试。这样你就能看到正常的结果波动范围。若要得出关于微小差异的结论,可能需要更多次重复。
- 更改一项设置并重复测试。如果需要重启,在原始设置的那一组测试之前也要执行重启。每次运行前等待相同的时间。
- 如有可能,先检查原始设置,再检查更改后的设置,然后再回到原始设置:A → B → A。这样的顺序有助于将设置的效果与预热和后台负载区分开来。
- 保存所有结果。事先确定哪些故障会使测试不适合比较,例如运行中断。如果排除某次测试,请说明原因。评分低本身并不是删除它的理由。
保持屏幕分辨率以及窗口或全屏模式一致。如果要检查分辨率的影响,请在每一个选定的分辨率下重复测试多次。
Δ score, % = 100 × (mean_after / mean_before − 1)CV, % = 100 × sample_standard_deviation / mean比较各次运行之间的平均值和波动范围。不仅要检查最终得分,还要检查各项单独评分、以毫秒计的延迟以及负载的执行速度(throughput)。对于延迟,负差异通常意味着改善;对于得分,正差异意味着评分提高。
要检查可重复性,请统计完整运行。一次测试中的数千帧并不能替代重复测试:它们都来自同一会话,并受共同条件影响。
可以得出什么结论
Section titled “可以得出什么结论”相对于正常波动而言较小的变化需要更多次重复。不能仅凭一组数据就设定诸如“所有大于 1% 的变化都显著”这样的通用阈值。即使差异在统计上可区分,也可能小到没有实际效果。
分块诊断已经内置于结果中:对于每个负载,都会保存各块执行速度的波动范围、“首-末”偏移以及逐步趋势。这使你能够在进行新的重复之前,判断两次运行之间的差异是否超过其内部观察到的噪声。将各块汇总为得分的公式在得分计算中公开。
在八次运行的系列中,比较了优化后系统上的重复运行和分辨率。它不包含未优化状态,因此不能证明 BoosterX 带来的收益。
合成测试有助于研究系统运行中的变化。要验证对特定游戏是否有益,请在其可复现的游戏场景中重复比较。
已验证:2026-09-20。
