Zum Hauptinhalt wechseln

Anleitung für einen aussagekräftigen Computer-Benchmark-Test zur Produktivitätsmessung

Hier lernst du, wie du dich von der Benchmark-Werbung löst und echte Ergebnisse erhältst, um ein klares Bild von dem zu bekommen, was du kaufen möchtest.

Aussagekräftiger Computer-Benchmark-Prozess

Hintergrund

Benchmark-Programme versuchen, die „Leistung“ eines Computers anhand einer genau definierten Testumgebung zu analysieren (die normalerweise nicht einmal annähernd der endgültigen Konfiguration des Computers entspricht). Der Benchmark-Anwender kann die zu testenden Grenzen ausnutzen, wie z. B. Systemressourcen, virtuelle Softwareumgebungen, Anwendungen, Verarbeitungslastsimulation, Benutzerlastsimulation und Systemnutzungssimulation, und alles Notwendige tun, um diese Grenzen zu überschreiten und ein fragwürdiges Ergebnis zu liefern. Nun: „Einen Industriestandard-Benchmark zu haben, ist immer eine gute Sache, wenn die Benchmarks nicht manipuliert werden. Leider werden viele Industriebenchmarks manipuliert. [...] Dennoch scheinen viele Unternehmen Hardware auf der Grundlage von Benchmarks zu kaufen, anstatt ihre Arbeitslasten zu verstehen und Hardware auf der Grundlage ihrer Anforderungen und natürlich ihres Budgets zu kaufen.“ (Newman, 2015) Dies erklärt, warum der Kunde genau wissen muss, was gemessen werden soll. Ein Benchmark-Programm wird niemals in der Lage sein, die sogenannte reale Erfahrung widerzuspiegeln; es wird nur widerspiegeln, wie gut ein solches Programm auf dem vorgesehenen Computer läuft. Es liegt also in der Verantwortung des Kunden, zu bestimmen, wie das Ergebnis in seiner produktiven Umgebung angewendet wird.

Überraschenderweise ist die korrekte Durchführung von Benchmarks sehr schwierig, da es viele Möglichkeiten gibt, schlechte oder irreführende Ergebnisse zu erzielen und Dinge auszulassen. Das Whitepaper „A Nine Year Study of File System and Storage Benchmarking“ fasst dies zusammen:

In diesem Artikel untersuchen wir 415 Datei-System- und Speicher-Benchmarks aus 106 aktuellen Arbeiten. Wir fanden heraus, dass die meisten populären Benchmarks fehlerhaft sind und viele Forschungsarbeiten keinen klaren Hinweis auf die tatsächliche Leistung liefern. (Traeger, Zadok, Joukov, & Wright, 2008)

In einem solchen Whitepaper können Aussagen darüber gefunden werden, dass Benchmarks erklären sollten, was getestet werden soll und warum, und sie sollten auch eine Art Analyse der erwarteten Systemleistung durchführen (oder erleichtern).

Im Artikel „Performance Anti-Patterns“ gibt es einige hervorgehobene Punkte, um zu bestimmen, wofür und wie Benchmarks in diesem Fall ausgeführt werden sollten. Daher sollte ein guter Benchmark folgende Eigenschaften haben:

  • Wiederholbar, damit Vergleichsexperimente relativ einfach und mit einem angemessenen Grad an Präzision durchgeführt werden können.
  • Beobachtbar, damit der Entwickler einen Ansatzpunkt hat, wenn eine schlechte Leistung festgestellt wird. Nichts ist frustrierender als ein komplexer Benchmark, der eine einzige Zahl liefert und den Entwickler ohne zusätzliche Informationen darüber zurücklässt, wo das Problem liegen könnte.
  • Portabel, damit Vergleiche mit deinen Hauptkonkurrenten möglich sind (selbst wenn es deine eigenen vorherigen Veröffentlichungen sind). Das Führen einer Historie der Leistung früherer Veröffentlichungen ist eine wertvolle Hilfe, um deinen eigenen Entwicklungsprozess zu verstehen.
  • Einfach darstellbar, damit jeder die Vergleiche in einer kurzen Präsentation verstehen kann.
  • Realistisch, damit die Messungen den vom Kunden erlebten Realitäten entsprechen.
  • Ausführbar, damit alle Entwickler die Auswirkungen ihrer Änderungen schnell feststellen können. Wenn es Tage dauert, Leistungsergebnisse zu erhalten, wird dies nicht sehr oft geschehen.

Nicht alle ausgewählten Benchmarks werden alle diese Kriterien erfüllen, aber es ist wichtig, dass einige von ihnen dies tun. Smaalders lädt dazu ein, Benchmarks zu wählen, die wirklich die Kundenbedürfnisse repräsentieren, da sonst alle Bemühungen darauf hinauslaufen, für das falsche Verhalten zu optimieren. Er ermutigt auch dazu, der Versuchung zu widerstehen, für den Benchmark mit dem Ziel zu optimieren, den Wettbewerb um jeden Preis zu gewinnen. Ein solches Verhalten führt zu gefälschten Ergebnissen, die das Vertrauen in die Marke oder den Anbieter schwächen könnten. Im Allgemeinen hebt ein Benchmark den Aspekt hervor, der optimiert wurde, auf Kosten anderer Aspekte, die nicht gemessen werden (und für den Kunden wichtig sein könnten). (Smaalders, 2006)

Es gibt noch einen weiteren Punkt beim Vergleich verschiedener Systeme mit der Absicht, diese zu kaufen: das Preis-Leistungs-Verhältnis. Dieses Verhältnis kann unter Einbeziehung der 5-jährigen Kapitalkosten der Ausrüstung quantifiziert werden. (Anon & Gray, 1985)

Benchmark-Ergebnisse und -Analyse

Einfache Tests mit Benchmark-Software umfassen keine vollständige Leistungsanalyse. Benchmark-Programme arbeiten normalerweise in einer kontrollierten Umgebung, sodass sie manipuliert werden können, um eine gewünschte Rate zu erzielen—die höchstmögliche. Dennoch wird eine solche Rate NIEMALS eine richtige Korrelation zur tatsächlichen Kundenerfahrung ergeben. Vielmehr liefern die bereitgestellten Metriken nur eine Punktzahl, die repräsentativ dafür ist, wie gut es bei einem bestimmten Benchmark läuft. Ein großes Problem ist, dass der Benutzer nie wirklich weiß, was getestet wird, wie Aspekte einer Benchmark-Punktzahl gemessen werden, welche Flags im Compiler gesetzt wurden, welcher Code oder welche Bibliotheken dem Programm zugrunde liegen und, was noch wichtiger ist, ob das, was das Programm testet, den tatsächlichen Verwendungszweck des Computers widerspiegelt. Es gibt daher einige Punkte, die angemerkt werden sollten:

  • Ein Benchmark wird niemals die reale Nutzung widerspiegeln. Da es sich um ein vollautomatisiertes Programm handelt, wird es auf vollautomatisierte Weise öffnen, schreiben, setzen, lesen, speichern, anzeigen, suchen, navigieren, verschieben, berechnen, zuweisen und viele andere Aufgaben ausführen. Eine solche Art und Weise wird niemals das Tempo widerspiegeln, mit dem ein Mensch seine Arbeit erledigt. Daher lügt jedes Benchmark-Programm, das Ergebnisse verspricht, die auf der realen Nutzung basieren.
  • Nicht alle Benchmarks bewerten die Multitasking-Leistung. Die überwiegende Mehrheit der Benchmarks bewertet nur seriell ausgeführte Aufgaben. Sie testen eine Sache und dann die nächste. Sie werden niemals eine Anwendung dazu bringen, etwas zu tun, während eine andere Anwendung etwas anderes tut (und wenn doch, versuchen sie normalerweise zwei oder höchstens drei Instanzen). Im wirklichen Leben führen Benutzer mehrere Anwendungen gleichzeitig aus. Die meisten Benutzer öffnen viele Anwendungen gleichzeitig (das Betriebssystem führt auch viele Aufgaben aus, während wir unsere täglichen Aufgaben erledigen). Es ist erwähnenswert, dass ein Benchmark, der nur einen Prozess/eine Anwendung widerspiegelt, nicht linear mit dem zweiten, dritten und den restlichen Prozessen/Anwendungen skaliert. Daher ist es bei moderner Multicore-Technologie wichtig, die Ergebnisse eines Benchmark-Programms mit Vorsicht zu genießen.
  • „Rate“ ist nicht dasselbe wie „Leistung“. Die Rate ist nur eine vom Programm angegebene Zahl. Leistung ist etwas Komplizierteres. Die Ratenzahl hängt vom Benchmark-Programm und der von seinen Entwicklern festgelegten Skala ab. Leistung ist die Erfüllung einer bestimmten Aufgabe, gemessen an voreingestellten bekannten Standards für Genauigkeit, Vollständigkeit, Kosten und Geschwindigkeit (The Business Dictionary, 2017). Daher spiegelt keine Benchmark-Programmrate einen Leistungsindex wider.
  • Benchmarks sind ungenau. Die Variation in einer Rate eines Benchmark-Programms kann bis zu 10 % (manchmal mehr) betragen. Diese Benchmark-Raten sind immer subjektiv, was den objektiven Prinzipien von Wissenschaft und Technologie widerspricht. Deshalb sollte ein Benchmark-Programm mindestens dreimal ausgeführt werden, um einen Mittelwert der angegebenen Rate zu berechnen. Nach der Bestimmung des Mittelwerts wird eine Variation von mindestens +/- 3 % des Ergebnisses erwartet (eine solche Variation kann auf der Grundlage der gesammelten Ergebnisse berechnet werden).
  • Benchmark-Ergebnisse können manipuliert werden. Es gibt Möglichkeiten, die Ergebnisse eines Benchmark-Programms zu manipulieren und künstlich hohe Raten anzubieten, nur um den Benutzer zu beeindrucken. Dies kann durch viele Techniken geschehen, wie exzessives Tuning, Einstellungen im BIOS, Hardware-Manipulation, Verwendung spezieller Treiber, Code-Manipulation und andere. Benchmark-Raten könnten mit unrealistischen Einstellungen im Vergleich dazu erzielt werden, wie der Computer in der Praxis verwendet wird: Das System muss frei von Programmen und Prozessen sein und spezifische Werte haben, die vom jeweiligen Benchmark abhängen, und dies spiegelt nicht die Art und Weise wider, wie der Computer in der Produktivität verwendet wird. Wie Henry Newman feststellte: „Was uns ein Benchmark sagt, ist: 1) Wie viel Hardware ein Anbieter in eine Kiste stopfen kann, 2) Wie gut das Team des Anbieters Software [für den Benchmark] optimieren kann, und 3) Wie sehr der Anbieter den Deal will.“ (Olds & OrionX, 2011) Wenn es kein vom Kunden klar festgelegtes Benchmark-Protokoll gibt, ist die Tür für jeden Trick offen, den der Benchmark-Anwender anwenden kann, um die gewünschten Ergebnisse zu erreichen (oder zu übertreffen) und den Kunden zu beeindrucken.

Letztendlich ist ein Benchmark-Programm kein präzises Werkzeug und sollte mit Vorsicht verwendet werden. Wie Henry Newman in einer persönlichen Mitteilung zitierte: „Systemleistungstools [...] mit [...] Benchmarks zu vergleichen, ist wie der Vergleich von Äpfeln mit fliegenden Schweinen.“ (Carrier, 2012)

Die von einem Benchmark bereitgestellten Ergebnisse sollten in Verbindung mit anderen Benchmarks und zusätzlichen Details verwendet werden, um ein umfassendes Verständnis der gesamten Systemleistung zu erhalten. Der Benchmark „misst“ im besten Fall nur die „Geschwindigkeit“ eines Computers, aber es gibt viele andere Aspekte, die berücksichtigt werden müssen: kommerzielle Standards, militärische Standards, Funktionalität, Merkmale, Zertifizierungen, Preis, unter anderem.

Vorgesehene Anwendungsfälle

Wenn der Computer, der für den Kauf bewertet wird, eine Vielzahl unterschiedlicher Benutzeranforderungen erfüllen muss, ist es am besten, die vorgesehenen Anwendungsfälle im Voraus zu bestimmen, damit eine detaillierte Reihe geeigneter Qualifikationskriterien festgelegt werden kann. In den meisten Fällen wird der Computer wahrscheinlich in einem oder mehreren der folgenden Kontexte verwendet:

  • Wird mit aktuellen grafischen Betriebsumgebungen verwendet (mindestens Windows 10 oder GNU/Linux-Distributionen)
    • Oder wenn er mit früheren Versionen von Betriebssystemen, wie Windows 7 oder Windows 8.1, oder einer früheren GNU/Linux-Distribution verwendet wird.
  • Grundlegende Produktivität (Nicht mehr als 5 Anwendungen laufen gleichzeitig, einschließlich):
    • Antivirus
    • Textverarbeitung
    • E-Mail
    • Leichte Nutzung von Tabellenkalkulationen
    • Webbasierte Anwendungen
    • Web-Browsing mit nicht mehr als 6 geöffneten Tabs.
  • Standard-Produktivität (5 bis 10 Anwendungen laufen gleichzeitig, einschließlich):
    • Dasselbe wie grundlegende Produktivität, und auch…
    • Büroanwendungen (Textverarbeitung mit Bildbearbeitung, Tabellenkalkulationen mit Formeln und einigen Skripten, Präsentationen, grundlegende Datenbankverwaltung)
    • Web-Browsing mit bis zu 15 Tabs
    • Webkonferenzen
    • Anzeigen und einfache Bearbeitung von Bildern und Videos
    • Bildung
    • Kann von umfangreicher Nutzung von Videos, Bildern, Animationen, Webzugriff und Anwendungen ausgegangen werden, die derzeit beschleunigtes Rechnen verwenden.
  • Power User (Mehr als 10 Anwendungen laufen gleichzeitig, einschließlich):
    • Dasselbe wie Standard-Produktivität, und auch…
    • Anwendungsentwicklung
      • Verwendung von Programmiersprachen und Umgebungen
      • Erstellen, Verwalten und Testen von Datenbanken
      • Testumgebung mit virtueller Maschine
      • Kontrollierte Testumgebungen
    • Programme für wissenschaftliche Forschung
      • Spezialisierte Anwendungen
      • Ingenieurwissenschaftliche und wissenschaftliche Anwendungen
      • Virtuelle Realität
  • Nur zur allgemeinen Information: Spiele werden derzeit als Hochleistungsrechnen betrachtet (Stevenson, Le Du, & El Afrit, 2011)
  • Andere Kriterien
    • Ist ein niedriger Stromverbrauch erforderlich?
    • Ist der vom Computer belegte Platz wichtig oder begrenzt?
    • Ist Mobilität erforderlich?
    • Ist die Akkulaufzeit wichtig?
    • Ist das Gewicht wichtig?
    • Bestimmte andere Verwendungen, die den tragbaren Einsatz in rauen, staubigen oder lauten Umgebungen implizieren

Der Wahrnehmungs-Benchmark

Der Begriff im Titel dieses Abschnitts mag seltsam erscheinen, aber tatsächlich handelt es sich um ein Thema, das im Allgemeinen ignoriert oder vernachlässigt wird. Er bezieht sich auf die folgende Frage: Welche Reaktionszeit ist für den Benutzer wirklich wichtig? Geschwindigkeit und Leistung sind eigentlich relative Begriffe. Ilya Grigorik schlägt ein interessantes Konzept dessen vor, was das Wort „Leistung“ bedeutet.

„Leistung besteht nicht nur aus Millisekunden, Bildern und Megabytes. Es geht auch darum, wie diese Millisekunden, Bilder und Megabytes in die Wahrnehmung des Benutzers von der Anwendung übersetzt werden.“ (Grigorik, 2014)

Jede Anwendung schreibt ihre eigenen Anforderungen gemäß geschäftlichen Kriterien, Kontext, Benutzererwartungen und wahrnehmungsbezogenen Zeitkonstanten vor, die vollständig auf den Benutzer ausgerichtet sind. Auch hier haben Benutzererwartungen eine Beziehung zu Maisters erstem Gesetz: „Zufriedenheit entspricht Wahrnehmung minus Erwartung.“ (Maister, 1985) Egal, wie sehr sich das Leben beschleunigt oder zumindest wahrgenommen wird, sich zu beschleunigen (1 Bild alle 66 ms), unsere Reaktionszeiten bleiben konstant. Wenn wir bedenken, dass ein Benutzer laut traditionellen Studien etwa 15 Bilder pro Sekunde sehen kann (Thorpe, Fize, & Marlot, 1996), gibt die folgende Tabelle (basierend auf dem Militärstandard 1472G) eine klare Vorstellung von der Reaktionszeit, die ein Benutzer normalerweise erwartet. Dies gilt unabhängig von der Art der Anwendung (auf dem Computer installiert oder online) oder dem Medium (Laptop, Desktop oder mobiles Gerät).

Tatsächliche Zeit und Benutzerwahrnehmung (Seow, 2008)

  • 0 – 100 ms: Sofort
  • 100 – 500 ms: Unmittelbar
  • 500 – 1000 ms: Schnell
  • 1 – 10 s: Eine Verzögerung wird wahrgenommen, aber der Benutzer verliert nicht den Fokus.
  • +10 s: Der Computer ist zu langsam, um die Aufmerksamkeit des Benutzers zu halten.

Damit die Reaktion auf eine Benutzeranfrage als schnell wahrgenommen wird, muss sie in unter einer Sekunde eintreffen. Wenn es eine Sekunde oder länger dauert, nimmt der Benutzer möglicherweise eine gewisse Verzögerung wahr, aber seine Aufmerksamkeit wird nicht von der Aufgabe abgelenkt. Nach 10 Sekunden—es sei denn, das Programm liefert dem Benutzer eine Art Information—wird die Aufgabe normalerweise abgebrochen und der Benutzer wird sich ärgern. Wenn der bewertete Computer Antworten in vergleichbarer Zeit oder in unter 10 Sekunden liefern kann, wird der Benutzer mehr aus dem Computer herausholen. Diese Schwellenwerte sind in der realen Welt viel nützlicher als die Ergebnisse von Benchmark-Programmen, die keine klare Anleitung zu ihrer Bedeutung bieten.

Das heißt, bei einem effektiven Benchmark sollte der Kunde wissen: wie er angewendet wird, die Analyse und die Schlussfolgerungen, die daraus gezogen werden. Für die Analyse ist es wichtig, Folgendes zu verstehen oder mitzubringen:

  • Einen Schwellenwert oder eine Referenz des minimal erwarteten Ergebnisses
  • Was getestet werden soll
  • Was die limitierenden Faktoren sind
  • Jede Störung, die die Ergebnisse beeinflussen könnte
  • Die Details des getesteten Systems
  • Den Preis (zumindest den Durchschnitt) des getesteten Systems
  • Welche Schlussfolgerungen mit den Ergebnissen erreicht werden sollen

Der Schwellenwert kann von öffentlichen Websites (wie Futuremark) bezogen oder lokal von einem derzeit verwendeten Computer mit einer guten Konfiguration erstellt werden, um die Basislinie für jeden Benchmark von den Computern festzulegen, die angeboten werden sollen. Notiere die Details der Konfiguration dieses Computers, der als Basislinie verwendet wird (Prozessor, Speicher [Menge, Geschwindigkeit, Konfiguration, Timings], Speicher, Grafik und Monitor), um eine klare Vorstellung davon zu haben.

Die Analyse von Benchmarks erfordert Zeit und Erfahrung, um korrekt durchgeführt zu werden. Wie gesagt, der wichtigste Teil ist zu bestimmen, was gemessen werden soll und ob die erhaltenen Ergebnisse für den beabsichtigten Gebrauch der Computer aussagekräftig sind.

Benchmarking-Protokoll

Das Folgende ist ein vorgeschlagenes Benchmarking-Protokoll, um—soweit wie möglich—faire und realistische Ergebnisse der ausgewählten oder angewendeten Benchmarks sicherzustellen.

Festlegen, wer den Benchmarking-Prozess durchführt und wer ihn beobachtet

Es wird empfohlen, den Benchmarker während der Konfigurations- und Benchmarking-Prozesse nicht allein zu lassen, insbesondere wenn es sich beim Benchmarker um einen Dritten handelt. Der Kunde muss einen Zeugen ernennen, der alles notiert, was der Benchmarker mit dem Gerät tut, um es für den Benchmark-Prozess zu konfigurieren. Außerdem sollte der Zeuge auch alle Änderungen oder Modifikationen notieren, die der Benchmarker nach jeder Art von Benchmark-Test vornimmt. Wenn du als Kunde ein klar definiertes Protokoll hast, darf der Benchmarker dagegen nicht verstoßen, nur um den Benchmark-Prozess zu gewinnen. Der Benchmarker und der Zeuge sollten nicht dieselbe Person sein, wieder besonders, wenn es sich um einen Dritten handelt.

Festlegen gemeinsamer Konfigurationen

Unabhängig von der Marke oder der angebotenen Hardware sollten alle Computer die Konfigurationskriterien erfüllen:

  • Wenn du nach physischen Quad-Core-Prozessoren gefragt hast, sollten alle vier physische Kerne haben.
  • Wenn du nach einer bestimmten Menge, Geschwindigkeit und Konfiguration von RAM gefragt hast, prüfe, ob alle Computer dieselbe Konfiguration haben. Notiere alle Unterschiede:
    • Größe
    • Geschwindigkeit (MT/s)
    • Timings und Latenzen (CAS, RAS, tRAS, tRC, Frequenz)
    • Single-Channel vs. Dual-Channel
  • Wenn du nach einer bestimmten Art von Speicher gefragt hast, prüfe, ob alle Computer diese Art von Speicher enthalten. Notiere alle gefundenen Unterschiede (Durchsatz, Suchzeiten und Schreibzeiten):
    • Standard rotierende Festplatte (5400 U/min, 7200 U/min, 10000 U/min, SSHD)
    • SSD
  • Die Grafikkarte sollte Shader Model 6.1 (DirectX 12.1) für Windows 10 oder Shader Model 5 (DirectX 11) für frühere Versionen von Windows erfüllen.
  • Der Monitor sollte bei jedem Computer dieselben Merkmale aufweisen:
    • Bildwiederholrate
    • Reaktionszeiten (ms)
    • Auflösung (höhere Auflösungen könnten zu niedrigeren Benchmark-Zahlen führen)
    • Farbtiefe
  • Das Betriebssystem sollte dieselbe Version und Kompilierung haben.
    • Unter Windows kannst du die Version und Kompilierung sehen, indem du „winver“ und die Eingabetaste im Cortana-Feld eingibst oder nachdem du Windows+R gedrückt hast, um das Ausführen-Fenster zu öffnen.
  • Jeder Computer sollte nur die aktuellen, vom Computerhersteller zugelassenen Treiber installiert haben. Hinweis: Erlaube nicht die Verwendung spezieller Treiber oder modifizierter Treiber, die von einem Komponentenhersteller geliefert wurden, da sie gefälschte Ergebnisse liefern könnten. Vermeide die Verwendung anderer Treiber als derjenigen, die validiert und öffentlich auf der Website oder dem Setup-Tool des Computerherstellers verfügbar sind.
  • Konfiguriere den Computer im Modus „Ausbalanciert“. Dies ist die Art und Weise, wie die Computer vom Kunden verwendet werden sollen, und es ist der treueste Weg, Ergebnisse von den Benchmarks zu erhalten.
  • Installiere die vom Kunden häufig verwendeten Anwendungen. Auch wenn sie im Test nicht verwendet werden, ist es die Art und Weise, wie die Computer verwendet werden.
  • Installiere jede andere Software (wie Antivirus und Tools), die vom Kunden benötigt wird. Dies setzt die Konfiguration so nah wie möglich an diejenige, die der Endbenutzer verwenden wird.
  • Installiere die Benchmark-Programme.

Die Benchmarks ausführen

Sobald die Computer installiert sind, wird empfohlen, ein „Hot Benchmarking“ durchzuführen. Ein „Hot Benchmarking“ erfordert einen Ingenieur (Ingenieur, keinen Techniker), der alles notiert, was während des Benchmark-Prozesses passiert (übersprungene Teile des Tests, fehlende Schritte, Fehlverhalten des Bildschirms, schlecht gezeichnete Figuren oder Bilder usw.). Solche Anomalien sollten notiert und gemeldet werden. Es ist ratsam, ein „Cold Benchmarking“ zu vermeiden (den Benchmark einfach ausführen, sich vom Computer entfernen und dann nur zurückkehren, um das Ergebnis zu notieren), da keine Anzeichen für ein seltsames Verhalten während des Benchmarks notiert werden. Wie bereits erwähnt, gibt es Möglichkeiten, die Benchmark-Raten zu manipulieren, und ein „Cold Benchmarking“ ist der beste Weg, diese Praktiken zu übersehen.

Da Benchmark-Raten zu Variationen von 5 bis 15 % führen können, wird empfohlen, jeden Test mindestens dreimal auszuführen. Jedes Mal ist ein Neustart des Computers erforderlich, etwa 5 Minuten zu warten, nachdem der Desktop erscheint, und dann den Benchmark erneut auszuführen. Nach jedem Benchmark-Durchlauf wird empfohlen, eine Bildschirmaufnahme des Ergebnisses zu machen, um den Nachweis zu speichern. Dies sollte in jedem ausgewählten Benchmark-Programm erfolgen.

Ergebnisse normalisieren und analysieren

Es liegt am Kunden zu entscheiden, ob die verschiedenen Raten, die bei jedem Durchlauf jedes Benchmarks erzielt wurden, gemittelt oder der höchste oder niedrigste Wert genommen wird. Welche Entscheidung der Kunde auch immer trifft, es wird empfohlen, sie auf alle verwendeten verschiedenen Benchmarks anzuwenden. Als Vorschlag: Wähle den Durchschnitt.

Nachdem diese Ergebnisse vorliegen, können sie normalisiert (wie im Text dieses Dokuments) und dann linear in Zeiten umgerechnet werden. Mit dem Preis der Computer kann der Kunde auch bewerten, welches der Systeme das beste Preis-Leistungs-Verhältnis bietet.

Abschließende Hinweise

Ein Benchmarking-Prozess erfordert Zeit, Erfahrung und Geduld. Wenn sie gut durchgeführt werden, können Benchmark-Programme eine gute Vorstellung von der erwarteten Leistung des Computers vermitteln. Alles, was vom Zeugen notiert wurde, wird nützlich sein, um zu bestimmen, was der Teilnehmer bereitstellen muss, falls er ausgewählt wird. Die Konfiguration (Prozessor, RAM [Menge, Geschwindigkeit, Timings, Kanalmodus], Speicher [Typ, Durchsatz, Kapazität], Monitor, Formfaktor usw.), die während des Benchmarking-Prozesses notiert wurde, ist nützlich, um sicherzustellen, dass der gelieferte Computer genau so konfiguriert ist, wie er getestet wurde. Dies ist wichtig, da einige missbräuchliche Anbieter einen speziell konfigurierten Computer nur für den Testprozess liefern und am Ende einen ganz anderen. Daher wird dies dem Kunden helfen, genau das zu erhalten, was getestet wurde.

Aus all den vorangegangenen Diskussionen kann Folgendes geschlossen werden:

  • Die Anschaffungen, die der Kunde tätigt, sind für Computer, nicht nur für einen Prozessor oder eine bestimmte Komponente. Es ist daher notwendig, das Gesamtsystem (holistisch) bei einer Kaufentscheidung zu berücksichtigen.
  • Die Leistung eines Computers leitet sich von all seinen Elementen ab. Dies umfasst Hardware und Software. Die Gesamtleistung des Computers entspricht immer der Leistung seines langsamsten Elements.
  • Es ist notwendig, Energiesparmaßnahmen, Wärmeerzeugung, die Stabilität des Computers, seine Zertifizierungen für den geschäftlichen Gebrauch und die von ihm angebotenen Sicherheitsdienste zu berücksichtigen. Mehr als nur geschwindigkeitsbasierte Benchmarks erfordert aktuelle Technologie einen reduzierten Energieverbrauch und die Bereitstellung von Sicherheitsdiensten.
  • Es ist wichtig, sich bewusst zu sein, dass die neuen Technologien, die in Anwendungen und Betriebssysteme integriert sind, weit mehr als nur den Prozessor nutzen. Vielmehr konzentrieren sie sich stärker auf andere Komponenten wie CPU, GPGPU, Busse, RAM-Geschwindigkeit und Festplattenübertragungsrate.

Ein wahres Maß für Rechenleistung erhält man, wenn der Computer ganzheitlich gemessen wird, nicht nur im Bereich der seriellen Verarbeitung oder der CPU. Der Kunde, der Büro-Tools, Webbrowser, Dateikomprimierung, Videoplayer, Telekonferenz-Tools, webbasierte Anwendungen und dergleichen verwendet, wird alle Funktionen dieser neuen Technologien mit heterogener Architektur nutzen.

Ein letzter Hinweis dazu ist, dass immer ein Schwellenwert oder eine Referenz benötigt wird, um eine bessere Vorstellung von den Leistungsverbesserungen zu erhalten, die man erhält. Wenn du die von FutureMark für einen „Reference Office PC“ zum aktuellen Zeitpunkt angebotene Basismessung nicht verwenden möchtest, kannst du deinen Basis-Computer in deinem Büro nach deinen eigenen Kriterien messen (vielleicht ein Computer, bei dem du dich mit seiner Standardleistung wohl fühlst). Sobald du den Benchmark ausführst, um seine Ergebnisse zu erhalten, kannst du diese Ergebnisse dann als Schwellenwert verwenden, um minimale erwartete Raten der angebotenen Lösungen zu haben. Nur eine weitere Sache, die man beachten sollte, ist, dass „Raten“ nicht dasselbe ist wie „Leistung“. Eine „Rate“ gibt nur eine Qualifizierung der vom Benchmark-Programm ausgeführten Prozesse. „Leistung“ ist das wirkliche Ergebnis, das du erhältst, wenn du einen solchen Computer für deine eigenen Aufgaben verwendest.

Referenzen

Anon, E. A., & Gray, J. (Februar 1985). A Measure of Transaction Processing Power. Abgerufen am 22. März 2015, von Internet Archive: https://archive.org/details/bitsavers_ta...

Carrier, J. (24. April 2012). HPCS I/O Scenarios. Abgerufen von OpenSFS: http://cdn.opensfs.org/wp-content/upload...

Computerhope. (15. März 2015). Thrashing. Abgerufen von Computer hope: http://www.computerhope.com/jargon/t/thr...

Gregg, B. (2014). Systems Performance Enterprise and the Cloud (1. Aufl.). USA: Pearson Education.

Grigorik, I. (12. März 2014). Speed, Performance, and Human Perception. (Fluent, Hrsg.) San Francisco, CA, USA. Abgerufen am 22. März 2015, von https://www.youtube.com/watch?v=7ubJzEi3...

Hoff. (30. Dezember 2006). Multicore, SMP and SMT Processors. Abgerufen am 22. März 2015, von HoffmanLabs: http://labs.hoffmanlabs.com/node/13

Maister, D. (1985). The Psychology of Waiting Lines. (T. S. Encounter, Hrsg.) Abgerufen am 22. März 2015, von David Maister: Professional Business, Professional Life: http://davidmaister.com/wp-content/theme...

Mallik, A. (2007). Hollistic Computer Architectures based on Application, User, and Process Characteristics. Evanston, Illinois, USA: UMI.

Newman, H. (2015). Data Storage Issues: Big Data Benchmarking. Abgerufen von InfoStor: http://www.infostor.com/index/blogs_new/...

Olds, D., & OrionX. (19. Dezember 2011). Benchmarks are $%#&@!! Abgerufen von The Register: http://www.theregister.co.uk/2011/12/19/...

Osterhage, W. (2013). Computer Performance Optimization (1. Aufl.). (Springer-Verlag, Übers.) Niederbachem, Deutschland: Springer-Verlag Berlin Heidelberg.

Seow, S. (2008). Designing and Engineering Time. Boston, USA: Prentice Hall.

Smaalders, B. (23. Februar 2006). Performance Anti-Patterns. doi:1542-7790/06/0200

Stevenson, A., Le Du, Y., & El Afrit, M. (März 2011). High Performance Computing on Gamer PCs. Abgerufen von ArsTechnica: http://arstechnica.com/science/2011/03/h...

The Business Dictionary. (2017). Performance. Abgerufen von The Business Dictionary: http://www.businessdictionary.com/defini...

Thorpe, S., Fize, D., & Marlot, C. (6. Juni 1996). Speed of processing in the human visual system. Nature, 381, 520-522. Abgerufen von Quora: http://cns.bu.edu/Profiles/Mingolla.html...

Traeger, A., Zadok, E., Joukov, N., & Wright, C. (Mai 2008). A Nine Year Study of File System and Storage Benchmarking. Abgerufen am 22. März 2015, von File systems and Storage Lab (FSL): http://www.fsl.cs.sunysb.edu/docs/fsbenc...

Vieira, L. (3. Oktober 2011). The Perception of Performance. Abgerufen am 22. März 2015, von Sitepoint: http://www.sitepoint.com/the-perception-...

Encom

Mitglied seit: 05/04/17

1 Reputation

0 Anleitungen geschrieben

0 Kommentare

Kommentar hinzufügen

Seitenaufrufe:

Letzte 24 Stunden: 1

Letzte 7 Tage: 3

Letzte 30 Tage: 22

Insgesamt: 1,814