ベンチマークの再現性検証
目次
1920×1080 での六回の実行では、PC Score の変動係数は 0,256% です。より低い解像度での二回の実行は、これら六回の平均から +0,392% と −0,070% ずれました。一台の PC ではばらつきは小さかったものの、このデータだけで他の構成におけるノイズを評価することはできません。
ここには 2026-09-04 の八回の実行すべての分析があります。どの実行も表から除外されていません。計算は 2026-09-07 に再計算されています。
| パラメータ | シリーズのデータ |
|---|---|
| CPU | AMD Ryzen 7 7800X3D、8 物理コア / 16 論理プロセッサ |
| GPU | NVIDIA GeForce RTX 5070 |
| Windows | ビルド 26200、結果内のバージョン文字列は Windows 10.0.26200 |
| エンジン | PCBenchmarkX 0.5.2 |
| プロファイル | Candidate、テストの長さと構成は同一 |
| 評価モデル | score-model-1.2-candidate-1 |
| 内部解像度 | 八回の実行すべてで 1920×1080 |
| 出力 | 枠なしの全画面ウィンドウ |
| 環境の状態 | すべての結果で検出されたハイパーバイザーが記録されている |
作者のデータによると、BoosterX で最適化された Windows が使用されていました。シリーズの設定の完全なリストは公開されていません。アーカイブには最適化されていない Windows との比較もありません。記録されたハイパーバイザーは、ゲスト VM 内で実行された事実を証明するものではありません。
概要にはグラフィックスドライバーのバージョンがなく、アーカイブからはテスト中のコンポーネントの温度と設定の完全なリストを特定できません。
実行の分割方法
Section titled “実行の分割方法”最初の三回の実行は同じ Windows の起動で行われ、次の三回はそれぞれ個別の再起動後に行われました。これはシステムの連続稼働時間 (uptime) からわかります。計算された起動時刻は №1-3 で一致し、№4、№5、№6 では異なります。最後の二回の解像度テストは №6 の後、新たな再起動なしで行われました。
| № | Windows の起動 | テスト前のシステム稼働時間、分 | 出力解像度 | PC Score |
|---|---|---|---|---|
| 1 | A | 4,94 | 1920×1080 | 14 198,58 |
| 2 | A | 7,56 | 1920×1080 | 14 229,16 |
| 3 | A | 10,23 | 1920×1080 | 14 186,01 |
| 4 | B | 0,67 | 1920×1080 | 14 239,20 |
| 5 | C | 3,52 | 1920×1080 | 14 224,65 |
| 6 | D | 7,80 | 1920×1080 | 14 141,08 |
| 7 | D | 10,62 | 1280×768 | 14 258,79 |
| 8 | D | 13,48 | 800×600 | 14 193,24 |
実行 №4 は起動から一分未満で開始されました。テストまでの待機時間は異なるため、ここで「再起動のみの効果」を個別に切り出すことはできません。システム起動後のソフトウェアの挙動が重なります。
1920×1080 での再現性
Section titled “1920×1080 での再現性”ここでの CV は完全な実行間で、除数 n − 1 の標本標準偏差を用いて計算されます。
mean = sum(x) / ns = sqrt(sum((x − mean)^2) / (n − 1))CV, % = 100 × s / meanrange, % = 100 × (max(x) − min(x)) / mean| PC Score のシリーズ | n | 平均 | CV | 範囲 / 平均 |
|---|---|---|---|---|
| 同一起動、№1–3 | 3 | 14 204,58 | 0,156% | 0,304% |
| 異なる起動、№4–6 | 3 | 14 201,65 | 0,373% | 0,691% |
| すべての 1920×1080、№1–6 | 6 | 14 203,12 | 0,256% | 0,691% |
最初の三回と二番目の三回の比較では差は −0,021% です。起動間のばらつきは同一起動内より大きいものの、このシリーズでは依然として小さいです。グループあたり三回の実行では、限界誤差について厳密な結論を下すには不十分です。
| コンポーネント、№1–6 | 平均 | 実行間の CV | 範囲 / 平均 |
|---|---|---|---|
| Performance | 11 437,74 | 0,121% | 0,330% |
| Core Latency Score | 21 750,66 | 0,392% | 1,129% |
| Consistency | 12 878,65 | 0,832% | 2,156% |
三つのコンポーネントのうち、最も高い安定性を示したのは Performance でした。遅延分布の裾を使用するブロックはより顕著に変動しました。したがって、見た目が同じ最終スコアは、フレーム分布について同じ状況を保証するものではありません。
解像度の検証
Section titled “解像度の検証”| 解像度 | PC Score | №1–6 の平均に対する Δ PC | Δ Performance | Δ Core Latency Score | Δ Consistency |
|---|---|---|---|---|---|
| 1280×768、№7 | 14 258,79 | +0,392% | −0,054% | +0,633% | +1,149% |
| 800×600、№8 | 14 193,24 | −0,070% | −0,089% | −0,099% | +0,022% |
出力解像度の低下は Performance の体系的な上昇をもたらしませんでした。これは固定された内部負荷 1920×1080の論理と一致します。
同じ Windows の起動における直近の 1920×1080 実行 №6 とのみ比較する場合、PC Score の変化は +0,832% と +0,369% です。差は、一回の実行と比較するか複数の平均と比較するかによって異なるため、ここでは両方の選択肢を示しています。
各低解像度では実行は一回のみでした。順序は交互にされておらず、解像度変更後の 1920×1080 の再実行もありませんでした。この状況は固定された内部負荷の仮説と一致しますが、解像度が個々のコンポーネントに与える影響を排除するものではありません。検証には、順序を交互にした複数の PC での繰り返しが必要です。
計算の検証と利用可能なデータ
Section titled “計算の検証と利用可能なデータ”八回の実行はすべて完了しました。公開された CSV では、各実行の四つの評価すべてと入力集計値が埋められています。実行の適合性は、方法論で説明されている実行品質モデル (Run Quality) によって評価されます。これは CPU のバックグラウンド負荷、ハイパーバイザー、バッテリー駆動、リモートセッションを考慮します。ただし、外部の干渉は依然として測定に影響を与えた可能性があります。このモデルによる実行の適合性は、それらの不在を証明するものではありません。
すべての実行について、Performance、Core Latency Score、Consistency、PC Score は保存された throughput とパーセンタイルから再計算されました。公開値との最大の乖離は 0,000001 ポイント未満です。これは集計値による数式の検証です。生のフレームからのパーセンタイルの完全な再構築は、この分析では行われていません。
- 八回の実行のクリーンなデータ、CSV。
- 計算検証スクリプト、Python 3。標準ライブラリのみが必要です。
両方のファイルを同じ場所に保存して実行してください。
python analyze_repeatability.pyCSV には評価と入力集計値、解像度、システム稼働時間、起動の識別子が含まれています。識別子とサービスデータを含む完全なソースアーカイブは公開されていません。
独立した結果
Section titled “独立した結果”他のコンピューターでの再現性を検証するには、あなたのシリーズを admin@boosterx.org に件名「PCBenchmarkX: 再現性」で送信してください。
同じ条件での複数の完全な結果を送信し、CPU、GPU、RAM、Windows とドライバーのバージョン、プロファイル、解像度、再起動、テスト間の変更を記載してください。解像度の影響を検証する場合は、実行間で解像度を交互にし、各値で複数回の実行を行ってください。シリーズ全体を、「悪い」またはまれなケースも含めて送信することをお勧めします。
送信前にアーカイブに個人データがないか確認してください。あなたの個人データなしで結果とコンピューターの特性を公開できるかどうかを記載してください。検証後、条件、計算、制限とともにシリーズをここに追加できます。ばらつきの大きいシリーズも送信してください。それらは、どのような条件で結果がより不安定になるかを解明するのに役立ちます。
この分析は、提供されたシリーズに基づいて BoosterX チームが作成しました。これは独立した認証ではなく、BoosterX の最適化による向上を証明するものではありません。独立した再現は別途記録されます。
