Inferenz
Inferenz ist der Vorgang, bei dem ein bereits trainiertes KI-Modell eine Eingabe verarbeitet und eine Ausgabe erzeugt, im Unterschied zum Training, bei dem das Modell selbst angepasst wird.
Inferenz ist die Verarbeitung einer Eingabe durch ein bereits trainiertes Modell. Das Ergebnis kann etwa eine Textausgabe, Klassifikation oder numerische Vorhersage sein.
Die Modellparameter werden dabei üblicherweise nicht verändert. Darin unterscheidet sich Inferenz vom Training oder Fine-Tuning, bei dem Parameter angepasst werden.
Kosten von Inferenz
Inferenzkosten entstehen bei jeder Nutzung und können im laufenden Betrieb einen wesentlichen Anteil der Gesamtkosten ausmachen.
Wichtige Faktoren sind Modell und Hardware, Länge von Ein- und Ausgabe, Anzahl sowie Gleichzeitigkeit der Anfragen und die Anforderungen an Antwortzeit und Verfügbarkeit.
Ein größeres Modell ist nicht automatisch die wirtschaftlichste Wahl. Maßgeblich ist, welches Modell die benötigte Qualität unter den gegebenen Betriebsbedingungen erreicht.
Cloud-API versus selbst betriebene Inferenz
Inferenz kann über einen verwalteten API-Dienst, eine dedizierte Cloud-Umgebung oder selbst betriebene Hardware erfolgen.
APIs bieten variable Kosten und wenig eigene Betriebsarbeit. Private Infrastruktur schafft feste Kapazität und mehr Kontrolle, erfordert aber Investition, Auslastungsplanung, Wartung und verantwortliches Personal.
Welche Variante wirtschaftlich ist, lässt sich nur anhand des konkreten Lastprofils und vollständiger Betriebskosten beurteilen.
Latenz und Kontextlänge als zusätzliche Stellschrauben
Die Antwortzeit hängt unter anderem von Modell, Hardware, Auslastung, Netzwerk, Länge des Eingabekontexts und Umfang der erzeugten Ausgabe ab.
Bei interaktiven oder zeitkritischen Anwendungen sollte deshalb nur der erforderliche Kontext übertragen werden. Reale Lasttests zeigen, ob die gewählte Architektur die Zielwerte einhält.
Verwandte Begriffe
Verwandte Begriffe
Large Language Model (LLM)
Ein Large Language Model ist ein auf großen Textmengen trainiertes KI-Modell, das sprachliche Muster verarbeitet und damit Texte erzeugen, zusammenfassen und bearbeiten kann.
Begriff ansehen
Kontextfenster
Das Kontextfenster ist die maximale Menge an Text, gemessen in Token, die ein Sprachmodell bei einer einzelnen Anfrage gleichzeitig verarbeiten kann.
Begriff ansehen
Passende Themen
Passende Themen
Private AI Infrastructure
Wir klären, ob private KI-Infrastruktur für Ihren Anwendungsfall sinnvoll ist und welche Fragen zu Daten, Sicherheit und Betrieb vorab beantwortet werden müssen.
Übersicht ansehen
Passende Leistungen
Passende Leistungen
Infrastruktur
Für KI-, Automatisierungs- und Softwaresysteme, deren Daten, Verfügbarkeit und Betrieb klare technische Anforderungen stellen.
Übersicht ansehen
Was möchten Sie technisch klären oder umsetzen?
Schildern Sie kurz die Ausgangslage, Ihr Ziel und die beteiligten Systeme. Wir melden uns mit einer fachlichen Einschätzung und einem Vorschlag für den nächsten sinnvollen Schritt.