跳到內容

基準測試可重現性驗證

本頁內容

在六次以 1920×1080 進行的執行中,PC Score 的變異係數為 0.256%。兩次較低解析度的執行相對這六次平均值的偏差為 +0.392% 與 −0.070%。在同一台 PC 上離散程度不大,但根據這些資料無法評估其他組態上的雜訊。

這裡收錄了 2026-09-04 全部八次執行的分析。沒有任何一次執行被排除在表格之外。計算已於 2026-09-07 重新核算。

參數 系列資料
CPU AMD Ryzen 7 7800X3D,8 個實體核心 / 16 個邏輯處理器
GPU NVIDIA GeForce RTX 5070
Windows 組建 26200;結果中的版本字串為 Windows 10.0.26200
引擎 PCBenchmarkX 0.5.2
設定檔 Candidate,相同的持續時間與測試組成
評分模型 score-model-1.2-candidate-1
內部解析度 全部八次執行均為 1920×1080
輸出 無邊框全螢幕視窗
環境狀態 所有結果中均標記偵測到 Hypervisor

根據作者的資料,使用的是經過 BoosterX 最佳化的 Windows。該系列的完整設定清單並未公布。封存檔中也沒有與未最佳化 Windows 的比較。標記的 Hypervisor 並不能證明是在客體 VM 內執行。

摘要中沒有圖形驅動程式版本,而封存檔也無法確定測試期間的元件溫度與完整設定清單。

前三次執行是在同一次 Windows 開機中完成,接下來三次則各自在獨立重新開機之後進行。這可從系統連續運作時間(uptime)看出:推算的開機時刻在 №1-3 相同,而在 №4、№5 與 №6 各不相同。最後兩次解析度測試是在 №6 之後、未再重新開機的情況下完成。

№ Windows 開機 測試前系統運作時間,分 輸出解析度 PC Score
1 A 4.94 1920×1080 14 198.58
2 A 7.56 1920×1080 14 229.16
3 A 10.23 1920×1080 14 186.01
4 B 0.67 1920×1080 14 239.20
5 C 3.52 1920×1080 14 224.65
6 D 7.80 1920×1080 14 141.08
7 D 10.62 1280×768 14 258.79
8 D 13.48 800×600 14 193.24

執行 №4 在開機後不到一分鐘便開始。測試前的等待時間各不相同,因此在此無法單獨分離出「僅重新開機的效果」:其中疊加了系統啟動後軟體的行為。

此處 CV 是在完整執行之間計算,透過除數為 n − 1 的樣本標準差:

mean = sum(x) / n
s = sqrt(sum((x − mean)^2) / (n − 1))
CV, % = 100 × s / mean
range, % = 100 × (max(x) − min(x)) / mean
PC Score 系列 n 平均 CV 全距 / 平均
同一次開機,№1–3 3 14 204.58 0.156% 0.304%
不同開機,№4–6 3 14 201.65 0.373% 0.691%
全部 1920×1080,№1–6 6 14 203.12 0.256% 0.691%

比較第一組與第二組三次執行得到差異 −0.021%。不同開機之間的離散程度高於同一次開機之內,但在這個系列中仍然不大。每組三次執行不足以對極限誤差作出嚴格結論。

元件,№1–6 平均 執行間 CV 全距 / 平均
Performance 11 437.74 0.121% 0.330%
Core Latency Score 21 750.66 0.392% 1.129%
Consistency 12 878.65 0.832% 2.156%

在三個元件中,Performance 展現出最高的穩定性。使用延遲分布尾部的區塊波動較明顯。因此,外觀相同的總分並不保證畫面時間分布呈現相同的樣貌。

解析度 PC Score Δ PC 相對 №1–6 平均 Δ Performance Δ Core Latency Score Δ Consistency
1280×768,№7 14 258.79 +0.392% −0.054% +0.633% +1.149%
800×600,№8 14 193.24 −0.070% −0.089% −0.099% +0.022%

降低輸出解析度並未導致 Performance 系統性上升。這符合固定內部負載 1920×1080的邏輯。

如果只與同一次 Windows 開機中最近的 1920×1080 執行 №6 比較,PC Score 的變化為 +0.832% 與 +0.369%。差異取決於我們是與單次執行比較,還是與多次執行的平均比較,因此這裡同時列出兩種方式。

每個低解析度都只有一次執行。順序並未交替,且在變更解析度之後也沒有再次執行 1920×1080。結果符合固定內部負載的假設,但並不排除解析度對個別元件的影響。要驗證這一點,需要在多台 PC 上以交替順序重複測試。

全部八次執行均已完成:在公布的 CSV 中,每次執行都填有全部四項評分與輸入彙總值。執行的適用性由執行品質模型(Run Quality)評估,該模型描述於方法論中:它會考量背景 CPU 負載、Hypervisor、電池供電與遠端工作階段。即便如此,外部干擾仍可能影響測量:依此模型判定執行適用,並不能證明這些干擾不存在。

對於所有執行,Performance、Core Latency Score、Consistency 與 PC Score 都已從保存的 throughput 與百分位數重新計算。與公布值的最大差異小於 0.000001 分。這是對彙總值進行公式檢查;本分析並未從原始畫面重新完整建構百分位數。

將兩個檔案保存在同一處並執行:

Окно терминала
python analyze_repeatability.py

CSV 包含評分與輸入彙總值、解析度、系統運作時間以及開機的標記。含識別碼與輔助資料的完整原始封存檔不予公布。

若要在其他電腦上檢查重現性,請將您的系列寄至 admin@boosterx.org,主旨為「PCBenchmarkX: повторяемость」。

請在相同條件下寄送多份完整結果,並註明 CPU、GPU、RAM、Windows 與驅動程式版本、設定檔、解析度、重新開機次數以及測試之間的變更。如果您要檢查解析度的影響,請在每次執行之間交替解析度,並在每個值上進行多次執行。最好寄送整個系列,包括「不良」或罕見的情況。

寄送前請檢查封存檔是否含有個人資料。請註明是否可以在不包含您個人資料的情況下公布結果與電腦規格。經過檢查後,我們便能將該系列連同條件、計算與限制一併加入此處。也請寄送離散程度較大的系列:它們有助於了解在哪些條件下結果較不穩定。

本分析由 BoosterX 團隊根據所提供的系列撰寫。它並非獨立認證,也不證明 BoosterX 最佳化所帶來的效能提升。獨立重現將另行標註。