On-Prem Ticket-KI: Welche GPU Sie brauchen und was sie wirklich kostet
Wie viel GPU-VRAM On-Prem-Ticket-KI braucht, wie Hardware- und API-Kosten vergleichen — und was Open Ticket AI lokal leistet: Klassifikation, Zusammenfassungen, Full On-Prem.
On-Prem Ticket-KI: Welche GPU Sie brauchen und was sie wirklich kostet
📖 8 Minuten Lesezeit • Aktualisiert am 28. Juli 2026

IT- und Service-Desk-Verantwortliche stellen immer wieder dieselben drei Fragen: Was macht die Software konkret? Welche GPU brauchen wir? Und ist gekaufte Hardware günstiger als eine KI-API jeden Monat?
Dieser Leitfaden beantwortet alle drei für On-Prem-Ticket-KI — Modelle, die Tickets neben Ihrem Helpdesk klassifizieren und zusammenfassen, auf Infrastruktur unter Ihrer Kontrolle. Er richtet sich an Entscheider und Admins, die Open Ticket AI Full On-Prem prüfen, und an alle, die einen selbst gehosteten Stack für OTOBO, Znuny oder Zammad dimensionieren.
Zuerst das Produkt testen? Starten Sie mit dem Free Cloud Trial, um Routing, Priorität, Mehrfeld-Klassifikation und Zusammenfassungen online zu bewerten — und wechseln Sie zu Full On-Prem, sobald Tickets im eigenen Netz bleiben müssen.
Warum On-Prem-Ticket-KI eine Hardware-Entscheidung ist
Cloud-KI-APIs sind bequem — bis Compliance, Betriebsrat oder Security-Review fragen, wohin Tickettexte gehen. Ticketinhalte enthalten oft personenbezogene Daten, Kundennamen, versehentlich eingefügte Passwörter und interne Vorfalldetails. Verlassen diese Inhalte Ihr Netz, entstehen Aufbewahrungs-, Unterauftrags- und Transferfragen, die viele DACH-Organisationen lieber nicht öffnen.
On-Prem dreht das Modell um: Die GPU wird zur Kapazitätseinheit, nicht Tokens. Sie zahlen einmal für die Hardware (oder leasen sie), betreiben Inferenz lokal und halten Ticketinhalte dort, wo das Helpdesk bereits läuft. Das ist der Kern von Full On-Prem: Training und Betrieb auf Ihrer GPU, vollständig isoliert — es verlässt nichts, nicht einmal Setup-Daten.
Der Trade-off ist real. Sie brauchen eine Karte mit genug Videospeicher (VRAM), Strom und Kühlung — und ein klares Bild davon, was die Software auf dieser Karte tun soll.
Was Open Ticket AI auf dieser GPU macht
Weg mit der Feature-Broschüre. Für Produktionskäufer zählen heute diese ausgelieferten Aufgaben:
| Fähigkeit | Was sie im Helpdesk tut | Status |
|---|---|---|
| Attribut-Klassifikation | Setzt Routing-Ziel (Queue / Gruppe), Priorität und andere Single-Select-Felder | Verfügbar |
| Ticket-Zusammenfassung | Schreibt eine knappe Summary, ohne den gesamten Thread zu öffnen | Verfügbar |
| Chatbot | Kundenantworten aus Ihrem Wissen | Demnächst |
| Antwortentwürfe für Agenten | Vorgeschlagene Antworten | Demnächst |
Die Klassifikation ist auf die Organisation Ihres Helpdesks abgestimmt — Teamnamen, Prioritäten, Kategorien und Feldstruktur — kein generischer Chatbot-Prompt. Runtime-Connectoren für Systeme wie Zammad, OTOBO und Znuny lesen neue Tickets lokal und schreiben Ergebnisse zurück. Für den laufenden Betrieb ist kein Ticketexport nötig.
Autonomes „jedes Ticket lösen und schließen“ ist nicht das Produkt. Menschen bleiben in Kontrolle; die KI füllt strukturierte Felder und Zusammenfassungen, damit Agenten jedes Ticket weiter vorne starten.
Wie viel GPU brauchen Sie wirklich?
VRAM ist die entscheidende Grenze. Modellgewichte, Kontext und Parallelität teilen sich denselben Speicher. Open Ticket AI Full On-Prem erfordert eine GPU mit mindestens 24 GB VRAM, damit Training und Inferenz vollständig auf Ihrer Infrastruktur bleiben (Deployment-Hinweis auf der Produktseite).
Nutzen Sie diese Leiter als praxisnahen Start — nicht als Bestellschein:
| Stufe | Typisches VRAM | Beispiel-Kartenklasse | Passt, wenn … |
|---|---|---|---|
| Einstieg Produktion | 24 GB | NVIDIA RTX PRO 4000 Blackwell (oder vergleichbare 24-GB-Workstation-/Server-GPU) | Klassifikation + Summaries für ein Helpdesk; gängige lokale Modelle der ~24–35B-Klasse |
| Reserve | 48 GB | NVIDIA RTX PRO 5000 Blackwell (oder vergleichbar) | Größere Modelle, mehr parallele Jobs oder Platz für Chatbot-/Antwortentwurf-Last später |
| Scale-out | 2× / 4× 48 GB | Mehrere professionelle GPUs (getrennte Karten, kein magischer gemeinsamer Pool) | Höheres Ticketvolumen, Redundanz oder getrennte Umgebungen |
Einige Dimensionierungsregeln, die teure Fehler vermeiden:
- Starten Sie bei 24 GB, wenn Sie unsicher sind. Das ist die veröffentlichte Full-On-Prem-Untergrenze und der Sweet Spot, den viele Teams bereits für lokale Helpdesk-LLMs nutzen (siehe unseren Ollama-Modell-Guide für Zammad AI für angrenzende VRAM-Intuition).
- Mehrere GPUs verschmelzen nicht automatisch zu einem größeren VRAM-Pool. Planen Sie getrennte Modelle, Replicas oder Nodes — nicht „96 GB als eine Karte“.
- Reserve schlägt maximale Modellgröße. Ein Modell, das gerade so passt, lagert aus, hängt oder läuft unter echtem Ticketverkehr in Timeouts.
- Workstation vs. Rack ist eine Betriebsfrage. Ein leiser Tower mit 24-GB-Profi-GPU kann ein Team pilotieren, ohne RZ-Umbau; Rack-Server mit redundanter Stromversorgung passen zu Dauerbetrieb.
Offizielle GPU-Specs ändern sich je Generation; prüfen Sie VRAM und Treiberunterstützung immer am Hersteller-Datenblatt, bevor Sie bestellen (beispielsweise das NVIDIA RTX PRO 4000 Blackwell Datasheet).
Die wirtschaftliche Seite: CapEx-GPU vs. OpEx-APIs
Käufer vergleichen oft „eine GPU-Rechnung“ mit „ein paar Cent pro Request“ und hören auf. Der sinnvolle Vergleich ist die Gesamtkosten über 24–36 Monate — plus Risiko.
Was On-Prem kostet
| Kostenblock | Was abgedeckt ist | Wie Sie denken sollten |
|---|---|---|
| GPU-/Server-CapEx | Karte + Host (oder kleiner dedizierter Node) | Über 3 Jahre abschreiben; Straßenpreise für 24-GB-Profi-GPUs liegen in der EU typisch bei wenigen Tausend Euro, 48-GB-Karten höher |
| Strom & Kühlung | Dauerverbrauch des GPU-Nodes | Oft niedrige zweistellige Eurobeträge pro Monat für eine Workstation-Klasse — nicht null, aber planbar |
| Software | Open Ticket AI Full On-Prem | Auf der Produktseite On Request — am Helpdesk bemessen, nicht als öffentlicher €/Agent-Aufkleber |
| Betriebsaufwand | Updates, Monitoring, Backup von Studio-/Runtime-Konfiguration | Meist leichter als ein zweiter SaaS-Vendor-Review-Zyklus |
Illustrative europäische Straßenpreis-Bänder nur für die Karte (Marktchecks Mitte 2026; Händler schwanken): grob 2.000–2.500 € für viele 24-GB-Profi-Blackwell-Karten und 5.000–6.500 € für viele 48-GB-Klassen. Das sind Hardware-Marktspannen, keine Open-Ticket-AI-Listenpreise. Ein kompletter Node (Gehäuse, CPU, RAM, Netzteil) kostet mehr; viele Kunden haben bereits einen passenden Host und ergänzen nur die GPU.
Was gehostete KI-APIs kosten
| Kostenblock | Was abgedeckt ist | Versteckte Reibung |
|---|---|---|
| Tokens / Requests | Jeder Summary- und Klassifikationsaufruf | Kosten skalieren mit Ticketvolumen und Promptlänge; volle Monate überraschen das Controlling |
| Egress & Aufbewahrung | Daten verlassen Ihr Netz | Rechtsprüfung, AVV, Unterauftragsverarbeiter, Löschnachweise |
| Qualitätstunung | Prompt-Engineering pro Feld | Drift bei Modell- oder Promptwechseln; schwer auditierbar |
API-Preise wirken bei geringem Volumen günstig. Bei stabilem Helpdesk-Verkehr — Hunderten oder Tausenden Tickets pro Tag, oft mit mehrstufiger Historie — nähert sich der monatliche Token-Spend oft den amortisierten Kosten eines dedizierten 24-GB-Nodes an oder übertrifft sie — ohne Datenresidenz zu lösen.
Eine einfache Planungsskizze (nur illustrative Zahlen):
| Szenario | Grobe monatliche variable KI-Kosten | Hinweise |
|---|---|---|
| Gehostete API, 5.000 Tickets/Monat, Summary + Klassifikation | Steigt mit Tokens; leicht im dreistelligen €/Monat-Bereich | Spikes bei langen Tickets |
| On-Prem 24-GB-Node, amortisiertes CapEx | GPU-CapEx ÷ 36 Monate + Strom | Flach nach Dimensionierung; kein Aufpreis pro Ticket |
| On-Prem + Full-On-Prem-Software | Hardware-OpEx + Software (On Request) | Planbare Budgetzeile für die IT |
Nutzen Sie den ROI-Rechner für Agentenzeit-Einsparungen; dieser Artikel deckt die Infrastruktur-Hälfte des Business Case ab.
Wann APIs trotzdem gewinnen
- Kurze Proof-of-Concepts mit synthetischen oder stark redigierten Tickets
- Sehr geringe Volumina, bei denen eine GPU den Großteil des Tages idle wäre
- Teams, die bereits einen bestimmten Cloud-KI-Vendor für alle Workloads freigegeben haben
Für Produktions-Helpdesks unter DSGVO-Druck ist das GPU-Gespräch meist kürzer als das API-Rechtsgespräch.
Zusammengeführt: ein sinnvoller Beschaffungspfad
- Evaluieren mit dem Free Cloud Trial — prüfen, ob Klassifikation und Summaries zu Ihrer Arbeitsweise passen.
- Messen Ticketvolumen und welche Felder automatisiert werden sollen (Routing, Priorität, weitere).
- Dimensionieren mit ≥24 GB VRAM für Full On-Prem; auf 48 GB gehen, wenn bald Parallelität oder größere Modelle anstehen.
- Deployen Studio + Runtime per Docker neben Ihrem Ticket-System; Ticketinhalte im eigenen Netz belassen.
- Erweitern später um Chatbot und Antwortentwürfe (demnächst) auf derselben Hardware-Leiter, sobald diese Fähigkeiten verfügbar sind.
Wenn Sie bereits lokale Modelle für native Helpdesk-KI betreiben (zum Beispiel Zammad 7 + Ollama), lesen Sie den Guide Bestes Ollama-Modell für Zammad AI zur Modellwahl — und sehen Sie Open Ticket AI als steuerbare Klassifikations- und Summary-Schicht mit Governance für Produktion, nicht nur als Chatbox in der Agenten-Oberfläche.
Fazit
On-Prem-Ticket-KI heißt nicht „größte GPU kaufen und hoffen“. Es ist ein klarer Stack: die Jobs kennen (Attribute klassifizieren, Tickets zusammenfassen), die VRAM-Untergrenze erfüllen (24 GB für Full On-Prem) und Drei-Jahres-Kosten und Risiko gegen APIs abwägen, die pro Token abrechnen und Tickettexte woanders verarbeiten.
Hardware-Spannen bewegen sich; Produktfähigkeiten entwickeln sich. Stabil bleibt die Käuferfrage dieses Artikels: Können wir nützliche Ticket-KI selbst betreiben, auf Hardware, die wir verstehen, ohne das Helpdesk in die Cloud zu schicken?
Bereit, die Dimensionierung für Ihr Helpdesk zu besprechen? Kontakt Sales für Full On-Prem — oder starten Sie online mit dem Free Cloud Trial.
