啟動比較
本頁內容
比較已完成的執行,需使用相同版本的負載、評分模型與設定檔。變化百分比描述的是數值差異,但本身並不能證明調整的效果。
在比較數字之前,請先透過結果檔案檢查兩次執行的相容性:每個檔案都記錄了負載版本——其組成的固定識別碼——以及評分模型,還有統計版本。請成對比較這些欄位:如果負載或評分模型不一致,這些執行就屬於不同的協定,其分數無法直接比較。這些識別碼的運作方式說明於方法論。
- 記錄處理器與顯示卡的型號、Windows 與驅動程式的版本。測試之間不要變更電源模式與散熱。使用同一組背景程式。
- 先在不變更設定的情況下至少執行三次測試。這樣你就能看到正常的結果離散程度。若要對微小差異下結論,可能需要更多次重複。
- 變更一項設定並重複測試。如果需要重新開機,請在原始設定的系列之前也執行一次。每次執行前等待相同的時間。
- 盡可能依序檢查原始設定、變更後的設定,然後再回到原始設定:A → B → A。這樣的順序有助於將調整效果與預熱及背景負載區分開來。
- 保留所有結果。事先確定哪些失敗會使測試不適合比較,例如執行中斷。如果你排除某次測試,請註明原因。分數偏低本身並不是刪除它的理由。
保持螢幕解析度以及視窗或全螢幕模式一致。如果你要檢查解析度的影響,請在每個選定的解析度下重複測試數次。
Δ score, % = 100 × (mean_after / mean_before − 1)CV, % = 100 × sample_standard_deviation / mean比較各次執行之間的平均值與離散程度。不要只檢查最終分數,也要檢查個別評分、以毫秒計的延遲,以及負載的執行速度(throughput)。對延遲而言,負的差異通常代表改善;對分數而言,正的差異代表評分上升。
若要檢查重現性,請計算完整的執行。單一測試內的數千個畫格不能取代重複測試:它們全都來自同一個工作階段,並受共同條件影響。
可以得出什麼結論
Section titled “可以得出什麼結論”相對於正常離散程度的微小變化需要更多次重複。不能只憑一個系列就訂出像「所有大於 1% 的都顯著」這樣的通用門檻。即使是統計上可區分的差異,對實際效果而言也可能太小。
逐區塊診斷已經內建在結果中:每個負載都會保存各區塊的執行速度離散程度、「第一與最後」的位移,以及逐步趨勢。這讓你能在進行新的重複之前,判斷兩次執行之間的差異是否超過其內部觀察到的雜訊。區塊如何彙總成分數的公式公開於分數計算。
在八次執行的系列中,比較了最佳化系統上的重複次數與解析度。它不包含未最佳化的狀態,因此不能證明 BoosterX 帶來的效益。
合成測試有助於研究系統運作的變化。若要驗證對特定遊戲的效益,請在其可重現的遊戲情境中重複比較。
已驗證:2026-09-20。
