Token-Kostenberechnung

Info

Die untenstehenden GPU-Raten und Token-Preise sind die Werte, die für die Berechnung der hier gezeigten Beispiele verwendet werden. Die autoritativen und aktuellsten Preise für jedes Modell finden Sie in unserer aktuellen Preisliste.

Wie hoch sind unsere Kosten?

Alles, was Sie nutzen, wird tokengenau abgerechnet: Die Eingabe- und Ausgabetokens jeder Anfrage werden gezählt und entsprechend dem Modell, das sie verarbeitet hat, berechnet.

Externe ModelleInterne Modelle
Wo das Modell läuftauf den eigenen Servern des Cloud-Anbieters, z. B. OpenAI- und Anthropic-Modelle über Microsoft Azure in Schwedenauf unseren eigenen HPC-Clustern in Göttingen
Was Ihnen berechnet wirddie Standard-Token-Raten, die der Anbieter für dieses Modell zum Zeitpunkt jeder Anfrage veröffentlichtein Preis, den wir selbst aus den Kosten berechnen, die für den Betrieb dieses Modells auf unseren Clustern entstehen, wie unten detailliert

Was in den Preis interner Modelle eingeht

KostenfaktorEnthält
InfrastrukturHardware-Investitionen, Wartung, Energiekosten einschließlich Kühlung
PersonalEntwickler, Systemadministratoren und Support; etwa ein Vollzeitmitarbeiter pro 400.000 Nutzer, geschätzt auf etwa 15 % der Hardware-Investition
Allgemeine KostenAllgemeine Kosten von GWDG
StillstandszeitenGPUs sind nicht ständig beschäftigt, und die Stunden, in denen sie stillstehen, müssen durch die Stunden, in denen sie arbeiten, finanziert werden

Die Basisgröße: eine GPU-Sekunde

Alle oben genannten Faktoren werden in eine einzige Zahl zusammengefasst: Was eine Sekunde einer GPU kostet. Die Kosten werden in eine-Sekunde-Intervallen berechnet.

GPUKosten pro Sekunde
A1000,0005991 €
H1000,0007408 €
H2000,0008847 €
B2000,0013898 €

Neuere und schnellere GPUs kosten pro Sekunde mehr (ein B200 kostet etwa 2,3-mal so viel wie ein A100), und ein Modell, das auf einer solchen GPU läuft, wird entsprechend teurer berechnet.

Von GPU-Sekunden zu Token-Preisen

Für jedes Modell definieren wir, auf welcher GPU-Art es läuft, wie viele GPUs es verwendet und wie viele Anfragen es gleichzeitig verarbeiten kann. Leistungsprüfungen messen dann für dieses Modell die Zeit pro Eingabetoken und die Zeit pro Ausgabetoken. Der Preis eines Tokens ergibt sich aus der Multiplikation dieser beiden Zahlen:

Kosten pro Token = Kosten pro GPU-Sekunde × Sekunden GPU-Zeit, die dieses Token verbraucht

Im Beispiel eines Modells:

EingabeparameterWert
Modellqwen3.6-35b-a3b
GPU1 × H100 95 GB, zu 0,0007408 € pro Sekunde
Parallelität16 Anfragen gleichzeitig
Zeit pro Eingabetoken0,000162604 s
Zeit pro Ausgabetoken0,001648210 s
ErgebnisBerechnungPreis
1 Million Eingabetoken0,0007408 × 1.000.000 × 0,0001626040,11 €
1 Million Ausgabetoken0,0007408 × 1.000.000 × 0,0016482101,11 €

Die Parallelität macht dies erschwinglich. Die GPU verarbeitet 16 Anfragen gleichzeitig, sodass die Kosten pro Sekunde effektiv auf sie verteilt werden. Dies ist bereits in den gemessenen Token-Zeiten enthalten.

Warum Ausgabetokens etwa zehnmal teurer sind als Eingabetokens

Im obigen Beispiel kosten Ausgabetokens etwa zehnmal mehr als Eingabetokens: 1,11 € gegenüber 0,11 € pro Million. Dies ist keine Preisentscheidung, sondern eine Eigenschaft, wie die Modelle funktionieren: Eingabetokens werden parallel in einem Durchlauf verarbeitet, während Ausgabetokens nacheinander generiert werden müssen, wobei jedes Token einen vollständigen Durchlauf durch das Modell erfordert. Das gleiche Verhältnis findet sich auch in den Preislisten der kommerziellen Anbieter.

Die praktische Konsequenz für Sie: Ein langer Prompt ist billig, eine lange Antwort dagegen nicht. Die Begrenzung der Ausgabelänge Ihrer Anfragen ist die wirksamste Möglichkeit, Ihre Ausgaben zu senken.

Externe Modelle

Kommerzielle Modelle (OpenAI, Anthropic und andere) werden von Microsoft auf Azure gehostet, nicht in Göttingen, daher sind ihre Kosten die Token-Preise des Anbieters, nicht eine Berechnung von GWDG. Sie werden nach Token-Nutzung abgerechnet und ziehen aus den Budgets für externe Modelle. Da sie in der Regel teurer pro Token sind als quelloffene Modelle, sind sie die Modelle, bei denen ein Kostenlimit am häufigsten angewendet wird.