Перейти к содержимому

Методика бенчмарка

На этой странице

PCBenchmarkX измеряет выполнение заданных CPU/GPU-сценариев и задержку реакции на программный сигнал. Объём работы фиксирован, формулы оценки открыты. Повторные запуски позволяют проверить устойчивость результата.

Эта документация относится к движку 0.5.2, нагрузке phase4.6-dev-1, статистике stats-phase4.6-v1 и модели score-model-1.2-candidate-1. В названии модели используется Candidate. Её нормировочные значения предварительные: их нельзя считать средними показателями всех компьютеров. Подробнее об эталоне рассказано в расчёте баллов.

BoosterX управляет запуском отдельного нативного движка, показывает ход теста и сохраняет результат. На время измерения он приостанавливает собственный мониторинг оборудования и памяти и сворачивает свои окна, затем восстанавливает их состояние. Это уменьшает влияние самого интерфейса BoosterX; внешние программы всё равно могут создавать нагрузку.

Повторяйте тесты с одной версией движка и драйвера, одинаковыми настройками питания, разгона и охлаждения. Закройте лишние фоновые программы. Если у вас ноутбук, выполняйте все тесты с подключённым зарядным устройством. При сравнении до и после изменения запишите, какую именно настройку вы поменяли.

Часть запуска Заданная длительность Назначение
Прогрев 15 с Подготовить нагрузку до зачётных измерений
CPU 20 с суммарно Три блока примерно по 6,67 с
GPU 30 с суммарно По 10 с на Geometry, Shader и Compute, каждый в трёх блоках
Combined 30 с суммарно Три блока по 10 с
Калибровка 10 с Подобрать сложность Loaded Latency
Прогрев задержки 2 с Подготовить отдельный путь измерения задержки
Baseline Latency 5 с Измерить задержку при базовой нагрузке
Loaded Latency 20 с Измерить задержку при калиброванной нагрузке

Переходы, подготовка ресурсов, предварительные CPU-кадры и завершение добавляют время. Поэтому общее время запуска больше суммы измеряемых этапов: в проверенной серии интервалы между началами соседних запусков в одной загрузке составляли примерно 157–172 секунды — с учётом паузы между запусками; точную длительность одного запуска из опубликованных данных определить нельзя.

Блоки тестов производительности чередуются в трёх раундах. У CPU перед каждым зачётным блоком фиксированное начальное состояние и 512 подготовительных кадров. Если скорость работы постепенно меняется от блока к блоку, это отражается в диагностике. Полученные результаты при этом не корректируются.

Движок поддерживает четыре профиля: candidate, quick, extended и custom. Точные длительности этапов:

Профиль Задача Переход Прогрев CPU GPU Combined Калибровка Прогрев задержки Baseline Loaded
Candidate канонический 0,5 с 15 с 20 с 30 с 30 с 10 с 2 с 5 с 20 с
Quick диагностический 0,25 с 7,5 с 10 с 15 с 15 с 5 с 1 с 2,5 с 10 с
Extended диагностический 1 с 30 с 40 с 60 с 60 с 20 с 4 с 10 с 40 с
Custom пользовательский по выбору пользователя в допустимых границах

Candidate — профиль по умолчанию, и только его запуски ранжируются. Quick, Extended и Custom всегда считаются диагностическими: их нельзя смешивать с Candidate в одном сравнении и нельзя публиковать в рейтинг. В Custom можно оставить часть тестов и задать свои длительности: зачётные блоки принимают 1–180 с, переходы — 0,1–180 с, прогрев задержки — 0,5–180 с. Любое переопределение длительности делает запуск диагностическим.

Измерения сохраняются в заранее выделенные блоки памяти. При сборе каждого кадра программа не форматирует JSON, не расширяет вектор и не пишет в файл. Размер буферов рассчитывается заранее по длительности теста и ожидаемой максимальной частоте записей, с запасом. В этой реализации действует ограничение 768 МиБ.

После завершения GPU-работы данные объединяются и обрабатываются. Это уменьшает влияние сбора данных на тест, хотя сам сбор тоже расходует ресурсы. Чтобы измерить его влияние, нужно отдельно сравнить запуски со сбором измерений и без него.

Результат содержит сводные метрики. Отдельный файл исходных измерений позволяет повторить статистическую обработку без нового выполнения нагрузки. Такой пересчёт проверяет вычисления; для проверки повторяемости на оборудовании нужен новый запуск.

Качество запуска и непригодность результата

Заголовок раздела «Качество запуска и непригодность результата»

Во время каждого блока движок оценивает качество запуска — Run Quality. Основной показатель — фоновая загрузка CPU, то есть всё, что нагружает систему помимо самого бенчмарка. Она вычисляется за блок как разница между загрузкой всей системы и загрузкой процесса бенчмарка, измеренными по одним и тем же счётчикам времени. Пороговые значения для профиля Candidate: выше 20% — предупреждение, выше 50% — запуск признаётся непригодным.

Run Quality также фиксирует сопутствующие условия: подключённый отладчик, удалённую сессию, питание от батареи и режим экономии заряда, наличие гипервизора, потерю фокуса окна и смену дисплея. Гипервизор, батарея и удалённая сессия раскрываются как предупреждения: сами по себе они результат не отклоняют, но объясняют, почему числа могут отличаться от «чистого» стенда. Смена дисплея во время зачётного блока делает запуск непригодным.

Пригодный зачётный результат дополнительно требует:

  • успешной калибровки Loaded Latency — если подобрать сложность под целевое время не удалось, запуск непригоден;
  • пройденной проверки выхода GPU-нагрузок — несовпадение контрольной сигнатуры делает запуск непригодным;
  • отсутствия потерянных записей коллектора — любая потеря делает запуск непригодным.

Классификация качества сохраняется в файле результата, поэтому «плохие» условия видны постфактум, а не только во время запуска.

Показатель Смысл
Performance Относительная скорость фиксированных нагрузок
Core Latency Score Относительная оценка внутренней задержки; больше баллов лучше
Consistency Выраженность медленного хвоста внутри запуска
PC Score Геометрическое объединение трёх компонентов с весами 50/30/20

Реальные задержки показываются в миллисекундах, и для них меньше лучше. Consistency нельзя смешивать с повторяемостью PC Score между запусками. Формулы и нормировочные константы открыты в расчёте баллов.

  • Синтетический сценарий помогает обнаруживать изменения системы, но не заменяет тест конкретной игры.
  • Низкий межзапусковый разброс ещё не доказывает точность каждой временной отметки или отсутствие систематической ошибки.
  • Восемь запусков одного ПК не устанавливают распределение результатов для всех CPU, GPU и версий Windows.
  • Сравнивайте совместимые версии нагрузок и одинаковые профили. Ускоренный, расширенный и пользовательский профили нельзя безусловно смешивать с Candidate.
  • Отменённый или неполный запуск не используйте вместо завершённого измерения.

Дальше: нагрузки, задержки и PresentMon, формулы, повторяемость, сравнение запусков, рейтинг.

Проверено: 2026-09-20.