Guide

On-Prem Ticket-KI: Welche GPU Sie brauchen und was sie wirklich kostet

Wie viel GPU-VRAM On-Prem-Ticket-KI braucht, wie Hardware- und API-Kosten vergleichen — und was Open Ticket AI lokal leistet: Klassifikation, Zusammenfassungen, Full On-Prem.

#on-premise #gpu #ticket-ki #datensouveraenitaet #dsgvo #helpdesk
On-Prem Ticket-KI: Welche GPU Sie brauchen und was sie wirklich kostet

On-Prem Ticket-KI: Welche GPU Sie brauchen und was sie wirklich kostet

📖 8 Minuten Lesezeit • Aktualisiert am 28. Juli 2026

Serverraum mit professionellem GPU-Workstation-Gehäuse — die Hardware-Basis für Ticket-KI auf der eigenen Infrastruktur.

IT- und Service-Desk-Verantwortliche stellen immer wieder dieselben drei Fragen: Was macht die Software konkret? Welche GPU brauchen wir? Und ist gekaufte Hardware günstiger als eine KI-API jeden Monat?

Dieser Leitfaden beantwortet alle drei für On-Prem-Ticket-KI — Modelle, die Tickets neben Ihrem Helpdesk klassifizieren und zusammenfassen, auf Infrastruktur unter Ihrer Kontrolle. Er richtet sich an Entscheider und Admins, die Open Ticket AI Full On-Prem prüfen, und an alle, die einen selbst gehosteten Stack für OTOBO, Znuny oder Zammad dimensionieren.

Zuerst das Produkt testen? Starten Sie mit dem Free Cloud Trial, um Routing, Priorität, Mehrfeld-Klassifikation und Zusammenfassungen online zu bewerten — und wechseln Sie zu Full On-Prem, sobald Tickets im eigenen Netz bleiben müssen.

Warum On-Prem-Ticket-KI eine Hardware-Entscheidung ist

Cloud-KI-APIs sind bequem — bis Compliance, Betriebsrat oder Security-Review fragen, wohin Tickettexte gehen. Ticketinhalte enthalten oft personenbezogene Daten, Kundennamen, versehentlich eingefügte Passwörter und interne Vorfalldetails. Verlassen diese Inhalte Ihr Netz, entstehen Aufbewahrungs-, Unterauftrags- und Transferfragen, die viele DACH-Organisationen lieber nicht öffnen.

On-Prem dreht das Modell um: Die GPU wird zur Kapazitätseinheit, nicht Tokens. Sie zahlen einmal für die Hardware (oder leasen sie), betreiben Inferenz lokal und halten Ticketinhalte dort, wo das Helpdesk bereits läuft. Das ist der Kern von Full On-Prem: Training und Betrieb auf Ihrer GPU, vollständig isoliert — es verlässt nichts, nicht einmal Setup-Daten.

Der Trade-off ist real. Sie brauchen eine Karte mit genug Videospeicher (VRAM), Strom und Kühlung — und ein klares Bild davon, was die Software auf dieser Karte tun soll.

Was Open Ticket AI auf dieser GPU macht

Weg mit der Feature-Broschüre. Für Produktionskäufer zählen heute diese ausgelieferten Aufgaben:

FähigkeitWas sie im Helpdesk tutStatus
Attribut-KlassifikationSetzt Routing-Ziel (Queue / Gruppe), Priorität und andere Single-Select-FelderVerfügbar
Ticket-ZusammenfassungSchreibt eine knappe Summary, ohne den gesamten Thread zu öffnenVerfügbar
ChatbotKundenantworten aus Ihrem WissenDemnächst
Antwortentwürfe für AgentenVorgeschlagene AntwortenDemnächst

Die Klassifikation ist auf die Organisation Ihres Helpdesks abgestimmt — Teamnamen, Prioritäten, Kategorien und Feldstruktur — kein generischer Chatbot-Prompt. Runtime-Connectoren für Systeme wie Zammad, OTOBO und Znuny lesen neue Tickets lokal und schreiben Ergebnisse zurück. Für den laufenden Betrieb ist kein Ticketexport nötig.

Autonomes „jedes Ticket lösen und schließen“ ist nicht das Produkt. Menschen bleiben in Kontrolle; die KI füllt strukturierte Felder und Zusammenfassungen, damit Agenten jedes Ticket weiter vorne starten.

Wie viel GPU brauchen Sie wirklich?

VRAM ist die entscheidende Grenze. Modellgewichte, Kontext und Parallelität teilen sich denselben Speicher. Open Ticket AI Full On-Prem erfordert eine GPU mit mindestens 24 GB VRAM, damit Training und Inferenz vollständig auf Ihrer Infrastruktur bleiben (Deployment-Hinweis auf der Produktseite).

Nutzen Sie diese Leiter als praxisnahen Start — nicht als Bestellschein:

StufeTypisches VRAMBeispiel-KartenklassePasst, wenn …
Einstieg Produktion24 GBNVIDIA RTX PRO 4000 Blackwell (oder vergleichbare 24-GB-Workstation-/Server-GPU)Klassifikation + Summaries für ein Helpdesk; gängige lokale Modelle der ~24–35B-Klasse
Reserve48 GBNVIDIA RTX PRO 5000 Blackwell (oder vergleichbar)Größere Modelle, mehr parallele Jobs oder Platz für Chatbot-/Antwortentwurf-Last später
Scale-out2× / 4× 48 GBMehrere professionelle GPUs (getrennte Karten, kein magischer gemeinsamer Pool)Höheres Ticketvolumen, Redundanz oder getrennte Umgebungen

Einige Dimensionierungsregeln, die teure Fehler vermeiden:

  1. Starten Sie bei 24 GB, wenn Sie unsicher sind. Das ist die veröffentlichte Full-On-Prem-Untergrenze und der Sweet Spot, den viele Teams bereits für lokale Helpdesk-LLMs nutzen (siehe unseren Ollama-Modell-Guide für Zammad AI für angrenzende VRAM-Intuition).
  2. Mehrere GPUs verschmelzen nicht automatisch zu einem größeren VRAM-Pool. Planen Sie getrennte Modelle, Replicas oder Nodes — nicht „96 GB als eine Karte“.
  3. Reserve schlägt maximale Modellgröße. Ein Modell, das gerade so passt, lagert aus, hängt oder läuft unter echtem Ticketverkehr in Timeouts.
  4. Workstation vs. Rack ist eine Betriebsfrage. Ein leiser Tower mit 24-GB-Profi-GPU kann ein Team pilotieren, ohne RZ-Umbau; Rack-Server mit redundanter Stromversorgung passen zu Dauerbetrieb.

Offizielle GPU-Specs ändern sich je Generation; prüfen Sie VRAM und Treiberunterstützung immer am Hersteller-Datenblatt, bevor Sie bestellen (beispielsweise das NVIDIA RTX PRO 4000 Blackwell Datasheet).

Die wirtschaftliche Seite: CapEx-GPU vs. OpEx-APIs

Käufer vergleichen oft „eine GPU-Rechnung“ mit „ein paar Cent pro Request“ und hören auf. Der sinnvolle Vergleich ist die Gesamtkosten über 24–36 Monate — plus Risiko.

Was On-Prem kostet

KostenblockWas abgedeckt istWie Sie denken sollten
GPU-/Server-CapExKarte + Host (oder kleiner dedizierter Node)Über 3 Jahre abschreiben; Straßenpreise für 24-GB-Profi-GPUs liegen in der EU typisch bei wenigen Tausend Euro, 48-GB-Karten höher
Strom & KühlungDauerverbrauch des GPU-NodesOft niedrige zweistellige Eurobeträge pro Monat für eine Workstation-Klasse — nicht null, aber planbar
SoftwareOpen Ticket AI Full On-PremAuf der Produktseite On Request — am Helpdesk bemessen, nicht als öffentlicher €/Agent-Aufkleber
BetriebsaufwandUpdates, Monitoring, Backup von Studio-/Runtime-KonfigurationMeist leichter als ein zweiter SaaS-Vendor-Review-Zyklus

Illustrative europäische Straßenpreis-Bänder nur für die Karte (Marktchecks Mitte 2026; Händler schwanken): grob 2.000–2.500 € für viele 24-GB-Profi-Blackwell-Karten und 5.000–6.500 € für viele 48-GB-Klassen. Das sind Hardware-Marktspannen, keine Open-Ticket-AI-Listenpreise. Ein kompletter Node (Gehäuse, CPU, RAM, Netzteil) kostet mehr; viele Kunden haben bereits einen passenden Host und ergänzen nur die GPU.

Was gehostete KI-APIs kosten

KostenblockWas abgedeckt istVersteckte Reibung
Tokens / RequestsJeder Summary- und KlassifikationsaufrufKosten skalieren mit Ticketvolumen und Promptlänge; volle Monate überraschen das Controlling
Egress & AufbewahrungDaten verlassen Ihr NetzRechtsprüfung, AVV, Unterauftragsverarbeiter, Löschnachweise
QualitätstunungPrompt-Engineering pro FeldDrift bei Modell- oder Promptwechseln; schwer auditierbar

API-Preise wirken bei geringem Volumen günstig. Bei stabilem Helpdesk-Verkehr — Hunderten oder Tausenden Tickets pro Tag, oft mit mehrstufiger Historie — nähert sich der monatliche Token-Spend oft den amortisierten Kosten eines dedizierten 24-GB-Nodes an oder übertrifft sie — ohne Datenresidenz zu lösen.

Eine einfache Planungsskizze (nur illustrative Zahlen):

SzenarioGrobe monatliche variable KI-KostenHinweise
Gehostete API, 5.000 Tickets/Monat, Summary + KlassifikationSteigt mit Tokens; leicht im dreistelligen €/Monat-BereichSpikes bei langen Tickets
On-Prem 24-GB-Node, amortisiertes CapExGPU-CapEx ÷ 36 Monate + StromFlach nach Dimensionierung; kein Aufpreis pro Ticket
On-Prem + Full-On-Prem-SoftwareHardware-OpEx + Software (On Request)Planbare Budgetzeile für die IT

Nutzen Sie den ROI-Rechner für Agentenzeit-Einsparungen; dieser Artikel deckt die Infrastruktur-Hälfte des Business Case ab.

Wann APIs trotzdem gewinnen

  • Kurze Proof-of-Concepts mit synthetischen oder stark redigierten Tickets
  • Sehr geringe Volumina, bei denen eine GPU den Großteil des Tages idle wäre
  • Teams, die bereits einen bestimmten Cloud-KI-Vendor für alle Workloads freigegeben haben

Für Produktions-Helpdesks unter DSGVO-Druck ist das GPU-Gespräch meist kürzer als das API-Rechtsgespräch.

Zusammengeführt: ein sinnvoller Beschaffungspfad

  1. Evaluieren mit dem Free Cloud Trial — prüfen, ob Klassifikation und Summaries zu Ihrer Arbeitsweise passen.
  2. Messen Ticketvolumen und welche Felder automatisiert werden sollen (Routing, Priorität, weitere).
  3. Dimensionieren mit ≥24 GB VRAM für Full On-Prem; auf 48 GB gehen, wenn bald Parallelität oder größere Modelle anstehen.
  4. Deployen Studio + Runtime per Docker neben Ihrem Ticket-System; Ticketinhalte im eigenen Netz belassen.
  5. Erweitern später um Chatbot und Antwortentwürfe (demnächst) auf derselben Hardware-Leiter, sobald diese Fähigkeiten verfügbar sind.

Wenn Sie bereits lokale Modelle für native Helpdesk-KI betreiben (zum Beispiel Zammad 7 + Ollama), lesen Sie den Guide Bestes Ollama-Modell für Zammad AI zur Modellwahl — und sehen Sie Open Ticket AI als steuerbare Klassifikations- und Summary-Schicht mit Governance für Produktion, nicht nur als Chatbox in der Agenten-Oberfläche.

Fazit

On-Prem-Ticket-KI heißt nicht „größte GPU kaufen und hoffen“. Es ist ein klarer Stack: die Jobs kennen (Attribute klassifizieren, Tickets zusammenfassen), die VRAM-Untergrenze erfüllen (24 GB für Full On-Prem) und Drei-Jahres-Kosten und Risiko gegen APIs abwägen, die pro Token abrechnen und Tickettexte woanders verarbeiten.

Hardware-Spannen bewegen sich; Produktfähigkeiten entwickeln sich. Stabil bleibt die Käuferfrage dieses Artikels: Können wir nützliche Ticket-KI selbst betreiben, auf Hardware, die wir verstehen, ohne das Helpdesk in die Cloud zu schicken?

Bereit, die Dimensionierung für Ihr Helpdesk zu besprechen? Kontakt Sales für Full On-Prem — oder starten Sie online mit dem Free Cloud Trial.

Quellen