基準測試方法
本頁內容
PCBenchmarkX 測量指定 CPU/GPU 情境的執行情況,以及對軟體訊號的反應延遲。工作量固定,評分公式公開。重複執行可驗證結果的穩定性。
本文件適用於引擎 0.5.2、負載 phase4.6-dev-1、統計 stats-phase4.6-v1 與模型 score-model-1.2-candidate-1。模型名稱中使用了 Candidate。其正規化數值為初步值:不能將其視為所有電腦的平均指標。關於基準的詳細說明請見分數計算。
BoosterX 負責啟動獨立的原生引擎、顯示測試進度並儲存結果。在測量期間,它會暫停自身的硬體與記憶體監控並最小化自己的視窗,之後再還原其狀態。這能減少 BoosterX 介面本身的影響;外部程式仍可能造成負載。
請以相同版本的引擎與驅動程式、相同的電源、超頻與散熱設定重複測試。關閉多餘的背景程式。如果您使用的是筆記型電腦,請在所有測試中連接電源供應器。在比較變更前後時,請記錄您究竟更改了哪一項設定。
Candidate 順序
Section titled “Candidate 順序”| 執行部分 | 指定時長 | 用途 |
|---|---|---|
| 預熱 | 15 秒 | 讓負載進入正式測量前的狀態 |
| CPU | 總計 20 秒 | 三個區塊,各約 6.67 秒 |
| GPU | 總計 30 秒 | Geometry、Shader 與 Compute 各 10 秒,每個分為三個區塊 |
| Combined | 總計 30 秒 | 三個區塊,各 10 秒 |
| 校準 | 10 秒 | 調整 Loaded Latency 的複雜度 |
| 延遲預熱 | 2 秒 | 讓獨立的延遲測量路徑進入狀態 |
| Baseline Latency | 5 秒 | 在基礎負載下測量延遲 |
| Loaded Latency | 20 秒 | 在校準後的負載下測量延遲 |
轉場、資源準備、預備 CPU 影格與收尾都會增加時間。因此總執行時間大於各測量階段之和:在已驗證的批次中,同一次開機中相鄰兩次執行開始之間的間隔約為 157–172 秒——已計入執行之間的暫停;僅憑已公布的資料無法確定單次執行的確切時長。
效能測試區塊在三個回合中交替進行。CPU 在每個正式區塊前都有固定的初始狀態與 512 個預備影格。如果運作速度逐區塊逐漸變化,這會反映在診斷中。此時取得的結果不會被修正。
執行設定檔與時長
Section titled “執行設定檔與時長”引擎支援四種設定檔:candidate、quick、extended 與 custom。各階段的確切時長:
| 設定檔 | 任務 | 轉場 | 預熱 | CPU | GPU | Combined | 校準 | 延遲預熱 | Baseline | Loaded |
|---|---|---|---|---|---|---|---|---|---|---|
| Candidate | 標準 | 0.5 秒 | 15 秒 | 20 秒 | 30 秒 | 30 秒 | 10 秒 | 2 秒 | 5 秒 | 20 秒 |
| Quick | 診斷 | 0.25 秒 | 7.5 秒 | 10 秒 | 15 秒 | 15 秒 | 5 秒 | 1 秒 | 2.5 秒 | 10 秒 |
| Extended | 診斷 | 1 秒 | 30 秒 | 40 秒 | 60 秒 | 60 秒 | 20 秒 | 4 秒 | 10 秒 | 40 秒 |
| Custom | 使用者自訂 | 由使用者在允許範圍內選擇 |
Candidate 是預設設定檔,且只有它的執行會列入排名。Quick、Extended 與 Custom 一律視為診斷:不能將它們與 Candidate 混在同一次比較中,也不能發布到排行榜。在 Custom 中可以只保留部分測試並指定自己的時長:正式區塊接受 1–180 秒,轉場為 0.1–180 秒,延遲預熱為 0.5–180 秒。任何時長覆寫都會使該次執行成為診斷。
每個影格都不寫入磁碟的收集
Section titled “每個影格都不寫入磁碟的收集”測量資料會儲存到預先配置的記憶體區塊中。在收集每個影格時,程式不會格式化 JSON、不會擴充向量,也不會寫入檔案。緩衝區大小會依測試時長與預期的最大寫入頻率預先計算,並保留餘量。此實作中有 768 MiB 的限制。
GPU 工作結束後,資料會合併並處理。這能減少資料收集對測試的影響,儘管收集本身也會消耗資源。若要測量其影響,必須另行比較有收集測量資料與沒有收集的執行。
結果包含彙總指標。獨立的原始測量檔案可讓您在不重新執行負載的情況下重複進行統計處理。這種重新計算驗證的是運算;若要在硬體上驗證重現性,則需要新的執行。
執行品質與結果不適用
Section titled “執行品質與結果不適用”在每個區塊期間,引擎會評估執行品質——Run Quality。主要指標是 CPU 背景負載,也就是除了基準測試本身之外所有對系統造成負載的部分。它按區塊計算,方式是同一組時間計數器所測得的整個系統負載與基準測試程序負載之間的差值。Candidate 設定檔的閾值:高於 20% 為警告,高於 50% 則該次執行被判定為不適用。
Run Quality 也會記錄伴隨條件:已連接的偵錯工具、遠端工作階段、電池供電與省電模式、Hypervisor 的存在、視窗失去焦點以及顯示器切換。Hypervisor、電池與遠端工作階段會以警告形式呈現:它們本身不會使結果被否決,但能解釋為何數值可能與「乾淨」的測試平台不同。在正式區塊期間切換顯示器會使該次執行不適用。
適用的正式結果還需要:
- Loaded Latency 校準成功——若無法將複雜度調整到目標時間,該次執行不適用;
- 通過 GPU 負載輸出檢查——控制簽章不符會使該次執行不適用;
- 沒有收集器遺失記錄——任何遺失都會使該次執行不適用。
品質分類會儲存在結果檔案中,因此「不良」條件在事後仍可看見,而不只是在執行期間。
如何解讀結果
Section titled “如何解讀結果”| 指標 | 含義 |
|---|---|
| Performance | 固定負載的相對速度 |
| Core Latency Score | 內部延遲的相對評分;分數越高越好 |
| Consistency | 單次執行內慢速尾端的明顯程度 |
| PC Score | 三個組成部分以 50/30/20 權重進行的幾何合併 |
實際延遲以毫秒顯示,且對它們而言數值越小越好。Consistency 不能與 PC Score 在多次執行之間的重現性混為一談。公式與正規化常數公開於分數計算。
- 合成情境有助於發現系統變化,但不能取代特定遊戲的測試。
- 低的跨次執行離散度尚不能證明每個時間戳記的準確性或不存在系統性誤差。
- 同一台 PC 的八次執行無法確立所有 CPU、GPU 與 Windows 版本的結果分布。
- 請比較相容的負載版本與相同的設定檔。加速、擴充與使用者自訂設定檔不能無條件地與 Candidate 混用。
- 已取消或不完整的執行請勿用來代替已完成的測量。
接下來:負載、延遲與 PresentMon、公式、重現性、執行比較、排行榜。
已驗證:2026-09-20。
