<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>SAIA Plattform :: Dokumentation für die AI Services</title><link>https://docs.ai.gwdg.de/technical/saia-platform/index.html</link><description>SAIA ist der skalierbare KI-Accelerator (AI), der unsere KI-Dienste hostet.
Zu diesen Diensten gehören Chat AI und CoCo AI, weitere werden in Kürze hinzukommen.
API-Schlüssel für die SAIA-API (Application Programming Interface) können beantragt und innerhalb Ihres Codes zur Nutzung der Dienste verwendet werden.
API-Schlüssel sind nicht erforderlich, um die Web-Oberfläche von Chat AI zu nutzen Web-Oberfläche.
Die SAIA-API eignet sich für interaktive Inferenz-Szenarien.
Falls Sie eine große Anzahl (z. B. Tausende von LLM-Anfragen) asynchron verarbeiten können, ist das Batch-Verfahren unseres HPC-Clusters die bessere Wahl.
Ihre Batch-Aufgabe wird zuverlässiger, schneller und kostengünstiger abgeschlossen.
Informieren Sie sich über die Einrichtung Ihres HPC-Clusters und die Nutzung von LLMs, um zu erfahren, wie Sie eine Batch-Inferenz-Aufgabe auf dem Cluster einrichten können.
vLLM ist eine weitere beliebte Wahl für LLM-Inferenz.</description><generator>Hugo</generator><language>de</language><atom:link href="https://docs.ai.gwdg.de/technical/saia-platform/index.xml" rel="self" type="application/rss+xml"/><item><title>Budget Limits</title><link>https://docs.ai.gwdg.de/technical/saia-platform/limits_budget/index.html</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://docs.ai.gwdg.de/technical/saia-platform/limits_budget/index.html</guid><description>Vom Vertrag zum Budget Die Budgets einer Organisation ergeben sich aus dem, was sie gekauft hat:
Schritt Berechnung Beispiel Jahresbudget nach Vertrag 72.000 € Monatsbudget Jahr ÷ 12 6.000 € Tagesbudget Monat ÷ 15 400 € Der Tageswert wird durch 15 geteilt, nicht durch 30, und das ist absichtlich. Bei ÷ 30 könnten Sie nie mehr als den gleichmäßigen Tagesanteil nutzen, und eine Frist oder eine Lehrwoche würde an die Grenze stoßen. Die Division durch 15 ergibt etwa das Doppelte des gleichmäßigen Tagessatzes als Burst-Zulage: lastintensive Tage sind möglich, aber dieses Tempo den ganzen Monat aufrechtzuerhalten nicht.</description></item><item><title>Rate Limits</title><link>https://docs.ai.gwdg.de/technical/saia-platform/limits_rate/index.html</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://docs.ai.gwdg.de/technical/saia-platform/limits_rate/index.html</guid><description>Wie haben wir Rate- und Budgetlimits für jede Organisation berechnet? Zwei separate Fragen mit unterschiedlichen Antworten. Die Limits einer Organisation leiten sich aus ihrem Vertrag ab, sodass das, was sie gekauft hat, und das, was sie pro Tag ausgeben darf, übereinstimmen.
Die Einheit, die Euro mit Anfragen verbindet Ein Budget wird in Euro gemessen und ein Rate-Limit in Anfragen, daher benötigt die Übersetzung des einen in das andere einen Umrechnungsfaktor. Abgeleitet aus echten Nutzungsstatistiken bei der GWDG: Eine durchschnittliche Anfrage besteht aus ungefähr 10.000 Token, was bei etwa 1 € pro Million Token etwa 0,01 € pro Anfrage entspricht.</description></item><item><title>Token-Kostenberechnung</title><link>https://docs.ai.gwdg.de/technical/saia-platform/token_cost_cal/index.html</link><pubDate>Mon, 01 Jan 0001 00:00:00 +0000</pubDate><guid>https://docs.ai.gwdg.de/technical/saia-platform/token_cost_cal/index.html</guid><description>Info Die untenstehenden GPU-Raten und Token-Preise sind die Werte, die für die Berechnung der hier gezeigten Beispiele verwendet werden. Die autoritativen und aktuellsten Preise für jedes Modell finden Sie in unserer aktuellen Preisliste.
Wie hoch sind unsere Kosten? Alles, was Sie nutzen, wird tokengenau abgerechnet: Die Eingabe- und Ausgabetokens jeder Anfrage werden gezählt und entsprechend dem Modell, das sie verarbeitet hat, berechnet.</description></item></channel></rss>