벤치마크 방법론
목차
PCBenchmarkX는 지정된 CPU/GPU 시나리오의 실행과 소프트웨어 신호에 대한 반응 지연을 측정합니다. 작업량은 고정되어 있고 평가 공식은 공개되어 있습니다. 반복 실행을 통해 결과의 안정성을 확인할 수 있습니다.
이 문서는 엔진 0.5.2, 부하 phase4.6-dev-1, 통계 stats-phase4.6-v1 및 모델 score-model-1.2-candidate-1에 관한 것입니다. 모델 이름에는 Candidate가 사용됩니다. 이 모델의 정규화 값은 잠정적입니다. 이를 모든 컴퓨터의 평균 지표로 간주해서는 안 됩니다. 기준에 대한 자세한 내용은 점수 계산에 설명되어 있습니다.
BoosterX는 별도의 네이티브 엔진 실행을 관리하고, 테스트 진행 상황을 표시하며, 결과를 저장합니다. 측정하는 동안 자체적인 하드웨어 및 메모리 모니터링을 일시 중지하고 자체 창을 최소화한 다음 상태를 복원합니다. 이는 BoosterX 인터페이스 자체의 영향을 줄입니다. 외부 프로그램은 여전히 부하를 생성할 수 있습니다.
동일한 엔진 및 드라이버 버전, 동일한 전원, 오버클럭 및 냉각 설정으로 테스트를 반복하십시오. 불필요한 백그라운드 프로그램을 닫으십시오. 노트북을 사용하는 경우 모든 테스트를 전원 어댑터를 연결한 상태에서 수행하십시오. 변경 전후를 비교할 때 어떤 설정을 변경했는지 정확히 기록하십시오.
Candidate 시퀀스
섹션 제목: “Candidate 시퀀스”| 실행 부분 | 지정된 지속 시간 | 목적 |
|---|---|---|
| 워밍업 | 15초 | 채점 측정 전에 부하를 준비 |
| CPU | 총 20초 | 약 6.67초씩 세 블록 |
| GPU | 총 30초 | Geometry, Shader, Compute에 각 10초, 각각 세 블록 |
| Combined | 총 30초 | 10초씩 세 블록 |
| 캘리브레이션 | 10초 | Loaded Latency의 복잡도 조정 |
| 지연 워밍업 | 2초 | 별도의 지연 측정 경로 준비 |
| Baseline Latency | 5초 | 기본 부하에서 지연 측정 |
| Loaded Latency | 20초 | 캘리브레이션된 부하에서 지연 측정 |
전환, 리소스 준비, 사전 CPU 프레임 및 종료는 시간을 추가합니다. 따라서 총 실행 시간은 측정 가능한 단계의 합보다 큽니다. 검증된 시리즈에서 한 부하 내 인접 실행 시작 사이의 간격은 실행 사이의 일시 중지를 포함하여 약 157–172초였습니다. 공개된 데이터만으로는 한 번의 실행의 정확한 지속 시간을 확인할 수 없습니다.
성능 테스트 블록은 세 라운드에서 교대로 진행됩니다. CPU의 경우 각 채점 블록 전에 고정된 초기 상태와 512개의 준비 프레임이 있습니다. 블록마다 작업 속도가 점진적으로 변하면 진단에 반영됩니다. 이때 얻은 결과는 보정되지 않습니다.
실행 프로필 및 지속 시간
섹션 제목: “실행 프로필 및 지속 시간”엔진은 네 가지 프로필을 지원합니다: candidate, quick, extended 및 custom. 단계의 정확한 지속 시간:
| 프로필 | 작업 | 전환 | 워밍업 | CPU | GPU | Combined | 캘리브레이션 | 지연 워밍업 | Baseline | Loaded |
|---|---|---|---|---|---|---|---|---|---|---|
| Candidate | 표준 | 0.5초 | 15초 | 20초 | 30초 | 30초 | 10초 | 2초 | 5초 | 20초 |
| Quick | 진단용 | 0.25초 | 7.5초 | 10초 | 15초 | 15초 | 5초 | 1초 | 2.5초 | 10초 |
| Extended | 진단용 | 1초 | 30초 | 40초 | 60초 | 60초 | 20초 | 4초 | 10초 | 40초 |
| Custom | 사용자 지정 | 허용 범위 내에서 사용자 선택 |
Candidate는 기본 프로필이며, 그 실행만 순위에 포함됩니다. Quick, Extended 및 Custom은 항상 진단용으로 간주됩니다. 이들을 하나의 비교에서 Candidate와 혼합할 수 없으며 순위에 게시할 수 없습니다. Custom에서는 일부 테스트를 남기고 자체 지속 시간을 지정할 수 있습니다. 채점 블록은 1–180초, 전환은 0.1–180초, 지연 워밍업은 0.5–180초를 허용합니다. 지속 시간을 재정의하면 실행이 진단용이 됩니다.
각 프레임에서 디스크에 기록하지 않는 수집
섹션 제목: “각 프레임에서 디스크에 기록하지 않는 수집”측정값은 미리 할당된 메모리 블록에 저장됩니다. 각 프레임을 수집할 때 프로그램은 JSON을 포맷하지 않고, 벡터를 확장하지 않으며, 파일에 쓰지 않습니다. 버퍼 크기는 테스트 지속 시간과 예상 최대 기록 빈도를 기준으로 여유 있게 미리 계산됩니다. 이 구현에서는 768 MiB 제한이 적용됩니다.
GPU 작업이 완료된 후 데이터가 병합되고 처리됩니다. 이는 데이터 수집이 테스트에 미치는 영향을 줄입니다. 다만 수집 자체도 리소스를 소비합니다. 그 영향을 측정하려면 측정값 수집이 있는 실행과 없는 실행을 별도로 비교해야 합니다.
결과에는 요약 지표가 포함됩니다. 별도의 원시 측정 파일을 사용하면 부하를 다시 실행하지 않고도 통계 처리를 반복할 수 있습니다. 이러한 재계산은 계산을 검증합니다. 하드웨어에서 반복성을 확인하려면 새로운 실행이 필요합니다.
실행 품질 및 결과 부적합
섹션 제목: “실행 품질 및 결과 부적합”각 블록 동안 엔진은 실행 품질(Run Quality)을 평가합니다. 주요 지표는 백그라운드 CPU 부하, 즉 벤치마크 자체 외에 시스템에 부하를 주는 모든 것입니다. 이는 블록 동안 동일한 시간 카운터로 측정된 전체 시스템 부하와 벤치마크 프로세스 부하의 차이로 계산됩니다. Candidate 프로필의 임계값: 20% 초과는 경고, 50% 초과는 실행이 부적합으로 간주됩니다.
Run Quality는 또한 부수적 조건을 기록합니다: 연결된 디버거, 원격 세션, 배터리 전원 및 절전 모드, 하이퍼바이저 존재, 창 포커스 상실 및 디스플레이 변경. 하이퍼바이저, 배터리 및 원격 세션은 경고로 표시됩니다. 이들 자체만으로는 결과를 거부하지 않지만, 수치가 “깨끗한” 스탠드와 다를 수 있는 이유를 설명합니다. 채점 블록 중 디스플레이 변경은 실행을 부적합하게 만듭니다.
적합한 채점 결과는 추가로 다음을 요구합니다:
- Loaded Latency 캘리브레이션 성공 — 목표 시간에 맞게 복잡도를 조정하지 못하면 실행이 부적합합니다;
- GPU 부하 출력 검사 통과 — 제어 시그니처 불일치는 실행을 부적합하게 만듭니다;
- 수집기 기록 손실 없음 — 손실이 있으면 실행이 부적합합니다.
품질 분류는 결과 파일에 저장되므로 “나쁜” 조건은 실행 중에만이 아니라 사후에도 확인할 수 있습니다.
결과를 읽는 방법
섹션 제목: “결과를 읽는 방법”| 지표 | 의미 |
|---|---|
| Performance | 고정 부하의 상대적 속도 |
| Core Latency Score | 내부 지연의 상대적 평가; 점수가 높을수록 좋음 |
| Consistency | 실행 내 느린 꼬리의 정도 |
| PC Score | 가중치 50/30/20으로 세 구성 요소를 기하학적으로 결합 |
실제 지연은 밀리초로 표시되며, 이는 낮을수록 좋습니다. Consistency를 실행 간 PC Score의 반복성과 혼동해서는 안 됩니다. 공식과 정규화 상수는 점수 계산에 공개되어 있습니다.
결과의 한계
섹션 제목: “결과의 한계”- 합성 시나리오는 시스템 변경을 감지하는 데 도움이 되지만 특정 게임의 테스트를 대체하지는 않습니다.
- 낮은 실행 간 편차가 각 타임스탬프의 정확성이나 체계적 오류의 부재를 증명하지는 않습니다.
- 한 PC의 여덟 번 실행이 모든 CPU, GPU 및 Windows 버전에 대한 결과 분포를 확립하지는 않습니다.
- 호환되는 부하 버전과 동일한 프로필을 비교하십시오. 단축, 확장 및 사용자 지정 프로필을 Candidate와 무조건 혼합할 수 없습니다.
- 취소되었거나 불완전한 실행을 완료된 측정 대신 사용하지 마십시오.
다음: 부하, 지연 및 PresentMon, 공식, 반복성, 실행 비교, 순위.
검증됨: 2026-09-20.
