Benchmark-Vergleich
Auf dieser Seite
Vergleichen Sie abgeschlossene Läufe mit derselben Lastversion, demselben Bewertungsmodell und demselben Profil. Die prozentuale Änderung beschreibt den Unterschied der Zahlen, beweist aber für sich genommen keinen Effekt einer Optimierung.
Prüfen Sie vor dem Vergleich der Zahlen die Kompatibilität eines Laufpaares anhand der Ergebnisdateien: In jeder von ihnen sind die Lastversion — eine konstante Kennung ihrer Zusammensetzung — und das Scoring-Modell sowie die Version der Statistik festgehalten. Vergleichen Sie diese Felder paarweise: Wenn die Last oder das Scoring-Modell nicht übereinstimmen, gehören die Läufe zu unterschiedlichen Protokollen und ihre Punkte sind direkt nicht vergleichbar. Wie diese Identitäten aufgebaut sind, ist in der Methodik beschrieben.
Versuchsplan
Abschnitt betitelt „Versuchsplan“- Notieren Sie das Prozessor- und Grafikkartenmodell, die Windows- und Treiberversionen. Ändern Sie zwischen den Tests nicht den Energiemodus und die Kühlung. Verwenden Sie denselben Satz an Hintergrundprogrammen.
- Führen Sie zunächst mindestens drei Tests ohne Änderung der Einstellungen durch. So sehen Sie die übliche Streuung der Ergebnisse. Für eine Aussage über kleine Unterschiede kann es mehr Wiederholungen brauchen.
- Ändern Sie eine Einstellung und wiederholen Sie die Tests. Wenn ein Neustart nötig ist, führen Sie ihn auch vor der Serie mit den Ausgangseinstellungen durch. Warten Sie vor jedem Lauf dieselbe Zeit ab.
- Prüfen Sie nach Möglichkeit die Ausgangseinstellungen, dann die geänderten und danach erneut die Ausgangseinstellungen: A → B → A. Eine solche Reihenfolge hilft, den Effekt der Einstellung von Aufwärmung und Hintergrundlast zu trennen.
- Bewahren Sie alle Ergebnisse auf. Legen Sie vorab fest, welche Fehler einen Test für den Vergleich unbrauchbar machen, zum Beispiel ein Abbruch des Laufs. Wenn Sie einen Test ausschließen, geben Sie den Grund an. Eine niedrige Bewertung ist für sich genommen kein Grund, ihn zu löschen.
Halten Sie die Bildschirmauflösung und den Fenster- oder Vollbildmodus gleich. Wenn Sie den Einfluss der Auflösung prüfen, wiederholen Sie den Test mehrmals bei jeder gewählten Auflösung.
Was zu zählen ist
Abschnitt betitelt „Was zu zählen ist“Δ score, % = 100 × (mean_after / mean_before − 1)CV, % = 100 × sample_standard_deviation / meanVergleichen Sie die Mittelwerte und die Streuung zwischen den Läufen. Prüfen Sie nicht nur den Gesamtpunktwert, sondern auch einzelne Bewertungen, Latenzen in Millisekunden und die Geschwindigkeit der Lastausführung (throughput). Bei Latenzen bedeutet eine negative Differenz meist eine Verbesserung; bei Punkten bedeutet eine positive Differenz einen Anstieg der Bewertung.
Für die Prüfung der Wiederholbarkeit zählen Sie vollständige Läufe. Tausende Frames innerhalb eines Tests ersetzen keine wiederholten Tests: Sie alle stammen aus einer Sitzung und hängen von gemeinsamen Bedingungen ab.
Was sich schlussfolgern lässt
Abschnitt betitelt „Was sich schlussfolgern lässt“Eine kleine Änderung relativ zur üblichen Streuung erfordert zusätzliche Wiederholungen. Eine universelle Schwelle wie „alles über 1% ist signifikant“ lässt sich anhand einer einzigen Serie nicht festlegen. Selbst ein statistisch unterscheidbarer Unterschied kann für einen praktischen Effekt zu klein sein.
Die blockweise Diagnose ist bereits in den Ergebnissen enthalten: Für jede Last werden die Streuung der Ausführungsgeschwindigkeit über die Blöcke, die Verschiebung „erster-letzter“ und der Trend über die Schritte gespeichert. Das erlaubt zu beurteilen, ob der Unterschied zweier Läufe das in ihnen beobachtete Rauschen übersteigt, noch bevor neue Wiederholungen nötig sind. Die Formeln, nach denen Blöcke zu Punkten aggregiert werden, sind in der Punkteberechnung offengelegt.
In der Serie aus acht Läufen wurden Wiederholungen und Auflösungen auf einem optimierten System verglichen. Sie enthält keinen unoptimierten Zustand und beweist deshalb keinen Gewinn durch BoosterX.
Ein synthetischer Test hilft, Änderungen in der Arbeit des Systems zu untersuchen. Um den Nutzen für ein konkretes Spiel zu prüfen, wiederholen Sie den Vergleich in dessen reproduzierbarem Spielszenario.
Geprüft: 2026-09-20.
