Token-Kostenberechnung
Info
Die untenstehenden GPU-Raten und Token-Preise sind die Werte, die für die Berechnung der hier gezeigten Beispiele verwendet werden. Die autoritativen und aktuellsten Preise für jedes Modell finden Sie in unserer aktuellen Preisliste.
Wie hoch sind unsere Kosten?
Alles, was Sie nutzen, wird tokengenau abgerechnet: Die Eingabe- und Ausgabetokens jeder Anfrage werden gezählt und entsprechend dem Modell, das sie verarbeitet hat, berechnet.
| Externe Modelle | Interne Modelle | |
|---|---|---|
| Wo das Modell läuft | auf den eigenen Servern des Cloud-Anbieters, z. B. OpenAI- und Anthropic-Modelle über Microsoft Azure | auf unseren eigenen HPC-Clustern in Göttingen |
| Was Ihnen berechnet wird | die Standard-Token-Raten, die der Anbieter für dieses Modell zum Zeitpunkt jeder Anfrage veröffentlicht | ein Preis, den wir selbst aus den Kosten berechnen, die für den Betrieb dieses Modells auf unseren Clustern entstehen, wie unten detailliert |
Was in den Preis interner Modelle eingeht
| Kostenfaktor | Enthält |
|---|---|
| Infrastruktur | Hardware-Investitionen, Wartung, Energiekosten einschließlich Kühlung |
| Personal | Entwickler, Systemadministratoren und Support; etwa ein Vollzeitmitarbeiter pro 400.000 Nutzer, geschätzt auf etwa 15 % der Hardware-Investition |
| Allgemeine Kosten | Allgemeine Kosten von GWDG |
| Stillstandszeiten | GPUs sind nicht ständig beschäftigt, und die Stunden, in denen sie stillstehen, müssen durch die Stunden, in denen sie arbeiten, finanziert werden |
Die Basisgröße: eine GPU-Sekunde
Alle oben genannten Faktoren werden in eine einzige Zahl zusammengefasst: Was eine Sekunde einer GPU kostet. Die Kosten werden in eine-Sekunde-Intervallen berechnet.
| GPU | Kosten pro Sekunde |
|---|---|
| A100 | 0,0005991 € |
| H100 | 0,0007408 € |
| H200 | 0,0008847 € |
| B200 | 0,0013898 € |
Neuere und schnellere GPUs kosten pro Sekunde mehr (ein B200 kostet etwa 2,3-mal so viel wie ein A100), und ein Modell, das auf einer solchen GPU läuft, wird entsprechend teurer berechnet.
Von GPU-Sekunden zu Token-Preisen
Für jedes Modell definieren wir, auf welcher GPU-Art es läuft, wie viele GPUs es verwendet und wie viele Anfragen es gleichzeitig verarbeiten kann. Leistungsprüfungen messen dann für dieses Modell die Zeit pro Eingabetoken und die Zeit pro Ausgabetoken. Der Preis eines Tokens ergibt sich aus der Multiplikation dieser beiden Zahlen:
Im Beispiel eines Modells:
| Eingabeparameter | Wert |
|---|---|
| Modell | qwen3.6-35b-a3b |
| GPU | 1 × H100 95 GB, zu 0,0007408 € pro Sekunde |
| Parallelität | 16 Anfragen gleichzeitig |
| Zeit pro Eingabetoken | 0,000162604 s |
| Zeit pro Ausgabetoken | 0,001648210 s |
| Ergebnis | Berechnung | Preis |
|---|---|---|
| 1 Million Eingabetoken | 0,0007408 × 1.000.000 × 0,000162604 | 0,11 € |
| 1 Million Ausgabetoken | 0,0007408 × 1.000.000 × 0,001648210 | 1,11 € |
Die Parallelität macht dies erschwinglich. Die GPU verarbeitet 16 Anfragen gleichzeitig, sodass die Kosten pro Sekunde effektiv auf sie verteilt werden. Dies ist bereits in den gemessenen Token-Zeiten enthalten.
Warum Ausgabetokens etwa zehnmal teurer sind als Eingabetokens
Im obigen Beispiel kosten Ausgabetokens etwa zehnmal mehr als Eingabetokens: 1,11 € gegenüber 0,11 € pro Million. Dies ist keine Preisentscheidung, sondern eine Eigenschaft, wie die Modelle funktionieren: Eingabetokens werden parallel in einem Durchlauf verarbeitet, während Ausgabetokens nacheinander generiert werden müssen, wobei jedes Token einen vollständigen Durchlauf durch das Modell erfordert. Das gleiche Verhältnis findet sich auch in den Preislisten der kommerziellen Anbieter.
Die praktische Konsequenz für Sie: Ein langer Prompt ist billig, eine lange Antwort dagegen nicht. Die Begrenzung der Ausgabelänge Ihrer Anfragen ist die wirksamste Möglichkeit, Ihre Ausgaben zu senken.
Externe Modelle
Kommerzielle Modelle (OpenAI, Anthropic und andere) werden von Microsoft auf Azure gehostet, nicht in Göttingen, daher sind ihre Kosten die Token-Preise des Anbieters, nicht eine Berechnung von GWDG. Sie werden nach Token-Nutzung abgerechnet und ziehen aus den Budgets für externe Modelle. Da sie in der Regel teurer pro Token sind als quelloffene Modelle, sind sie die Modelle, bei denen ein Kostenlimit am häufigsten angewendet wird.