Rate Limits

Wie haben wir Rate- und Budgetlimits für jede Organisation berechnet?

Zwei separate Fragen mit unterschiedlichen Antworten. Die Limits einer Organisation leiten sich aus ihrem Vertrag ab, sodass das, was sie gekauft hat, und das, was sie pro Tag ausgeben darf, übereinstimmen.

Die Einheit, die Euro mit Anfragen verbindet

Ein Budget wird in Euro gemessen und ein Rate-Limit in Anfragen, daher benötigt die Übersetzung des einen in das andere einen Umrechnungsfaktor. Abgeleitet aus echten Nutzungsstatistiken bei der GWDG: Eine durchschnittliche Anfrage besteht aus ungefähr 10.000 Token, was bei etwa 1 € pro Million Token etwa 0,01 € pro Anfrage entspricht.

1 Anfrage ≈ 10.000 Token ≈ 0,01 €   (bei etwa 1 € pro Million Token)

Dies ist ein statistischer Durchschnittswert, der für die Rate-Limitierung verwendet wird, keine Abrechnungsregel. Ihnen wird immer die token-genaue Kosten des tatsächlich verwendeten Modells in Rechnung gestellt. Seine einzige Aufgabe ist es, ein Budget als Anzahl von Anfragen ausdrückbar zu machen.

Vom Tagesbudget zum Anfrage-Rate-Limit

Das Anfrage-Limit schützt den Dienst vor Überlastung. Es wird aus dem Tagesbudget (siehe Budgets) durch die durchschnittliche Anfrage oben abgeleitet:

Anfragen pro 10 s  =  Tagesbudget ÷ 0,01 € ÷ 3.600 s ×  10 s

Durchgerechnet für ein Tagesbudget von 400 €:

SchrittBerechnungErgebnis
Wert des Tagesbudgets in Anfragen400 € ÷ 0,01 €40.000 Anfragen
Verteilt über eine Stunde40.000 ÷ 3.600 s11,1 Anfragen pro Sekunde
Pro 10-Sekunden-Fenster× 10111 Anfragen / 10 s

Der erklärungsbedürftige Schritt ist die Division durch 3.600 Sekunden (eine Stunde) statt durch 86.400 (einen Tag). Ein Tagesbudget gleichmäßig über einen Tag zu verteilen, würde etwa 4,6 Anfragen pro 10 Sekunden ergeben. Es stattdessen über eine Stunde zu verteilen, ergibt 111, was 24-mal großzügiger ist, und das ist die Absicht: Das Rate-Limit ist nicht dazu da, das Budget durchzusetzen. Das Budget setzt sich selbst durch, token-genau, während Sie es ausgeben. Das Rate-Limit existiert nur, um zu verhindern, dass eine einzelne Organisation die gemeinsame Infrastruktur überfordert, daher ist es so dimensioniert, dass Bursts durchgelassen werden und nur anhaltender Missbrauch gedrosselt wird.

Dimensionierung stattdessen nach Kopfzahl

Wenn eine Organisation ein pauschales Kontingent für eine Anzahl von Benutzern hat statt eines Euro-Budgets, wird das Limit nach der Kopfzahl dimensioniert:

Anfragen pro 10 s  =  Anzahl der Benutzer ÷ 1.000

Eine Organisation mit 60.000 Benutzern erhält daher 60 Anfragen pro 10 Sekunden. Der Divisor geht davon aus, dass nur ein kleiner Bruchteil einer Institution jemals in denselben zehn Sekunden eine Anfrage stellt, was der tatsächlichen Nutzung entspricht.

Limits werden überprüft

Für die Nutzung im Free-Tier werden die genauen Limits regelmäßig entsprechend der tatsächlich verfügbaren Kapazität angepasst. Der freie Zugang läuft auf Fair-Share-Knoten, was definitionsgemäß freie Kapazität ist. Limits werden auch im Verhältnis zur Pay-per-Token-Preisgestaltung sinnvoll gehalten, sodass ein Rate-Limit einen Vertrag nie teurer in der Nutzung macht, als es die Zahlung pro Token gewesen wäre.