Model Router Gateway — pro Schritt das kleinste Modell, das den Test besteht
Ein modell-agnostisches Gateway, das jede Aufgabe an das günstigste Modell routet, das deinen Eval besteht — SLM für Routine, Frontier nur für den harten Schritt. Plus Kosten-Dashboard und 1-Klick-Anbietertausch. Demo-Referenzarchitektur.
- das den Test besteht
- kleinstes Modell
- Branche
- Branchenübergreifend / KI-Betrieb
- Umsetzung
- 3–5 Wochen
Auf einen Blick
- Es beginnt mit
- Aufgabe kommt rein
- Die Maschine übernimmt
- 8 von 8 Schritten
- Beim Menschen bleibt
- Nichts — der Ablauf läuft durch
- Unterm Strich
- kleinstes Modelldas den Test besteht
Das Problem
Die meisten Automatisierungen schicken jeden Schritt an dasselbe teure Großmodell — auch das simple „ist das eine Rechnung? ja/nein". Das ist ein LKW für den Brötchenholdienst.
Diese Demo zeigt das Gegenteil: ein Gateway, das pro Schritt entscheidet, welches Modell reicht — und die Frontier nur dann ruft, wenn die Aufgabe sie wirklich braucht.
Die Branche verschiebt sich von „mehr Parameter" zu „Intelligenz pro Euro". Ein 7B-SLM ist grob 10–30× günstiger als ein 70–175B-Modell (NVIDIA, 2025) und reicht für die repetitiven Routine-Aufgaben, die Agenten zum Großteil ausmachen — klassifizieren, extrahieren, routen, formatieren. Gleichzeitig fällt der Preis für ein festes Fähigkeitsniveau dramatisch (LLMflation: grob 10×/Jahr).
Nur: Die meisten Mittelständler nutzen das nicht. Sie haben (a) ein Modell fest verdrahtet — Lock-in, kein Wechsel wenn Preise fallen, (b) keinen Eval, um zu wissen, ob ein kleineres Modell reicht, und (c) keine Sicht auf die Kosten pro Schritt. Ergebnis: Sie zahlen Frontier-Preise für SLM-Arbeit.
Ehrliche Grenze: Für harte, breite Aufgaben (offenes Reasoning) bleibt das große Modell überlegen — Inference-Compute substituiert Parameter nur teilweise. Das Routing muss diese Grenze respektieren, nicht ignorieren.
So läuft der Prozess — Schritt für Schritt
Scrollen Sie durch. Das Diagramm bleibt stehen und markiert den Schritt, bei dem Sie gerade sind.
- 01
Aufgabe kommt rein
Schritt im Workflow
Ein Schritt in deinem Workflow braucht ein Modell — klassifizieren, extrahieren, zusammenfassen oder eine schwierige Synthese. Statt blind das Großmodell zu rufen, geht die Aufgabe an den Router.
- 02
Klassifizieren & Eval
Typ · Schwierigkeit
Der Router bestimmt Typ und Schwierigkeit der Aufgabe und prüft sie gegen den hinterlegten Eval — den kleinen, ehrlichen Test pro Aufgabentyp.
- 03
Modell-Router
OpenRouter · LiteLLM
Das modell-agnostische Gateway (OpenRouter / LiteLLM) abstrahiert über 400+ Modelle. Der Anbieter ist Konfiguration, kein fest verdrahteter Code — du wechselst, wenn Preise fallen.
- 04Verzweigung
SLM reicht?
Die Entscheidung: Reicht ein kleines Modell (SLM) für diese Aufgabe — besteht es den Eval — oder braucht es die Frontier?
- 05
SLM ausführen
günstig · schnell
Routine-Aufgaben (der Großteil) laufen auf einem günstigen, schnellen SLM. Grob 10–30× billiger als ein Großmodell und für klassifizieren, extrahieren, routen völlig ausreichend.
- 06
Frontier-Modell
Eskalation · harte Aufgabe
Nur die nachweislich harten Fälle eskalieren auf ein Frontier-Modell. Den Spitzenpreis zahlst du gezielt — nicht pauschal für jeden Aufruf.
- 07
Kosten & Eval loggen
pro Schritt
Jeder Aufruf wird mit Modell, Kosten und Eval-Ergebnis geloggt. Du siehst Ausgaben pro Schritt, pro Modell, pro Tag — keine Überraschung auf der Monatsrechnung.
- 08
Ergebnis + Kostensicht
zurück in den Workflow
Das Ergebnis geht zurück in den Workflow — erzeugt vom kleinsten Modell, das die Aufgabe besteht, bei voller Kostensicht.
Unsere Lösung
Ein Gateway, das pro Aufgabe routet statt pauschal das Großmodell zu rufen — self-hosted, modell-agnostisch (OpenRouter/LiteLLM als Abstraktion über 400+ Modelle). Drei Bausteine:
1. Eval-getriebenes Routing. Pro Aufgabentyp gibt es einen kleinen, ehrlichen Test. Das Gateway nimmt das kleinste Modell, das diesen Test besteht — SLM für Routine, Frontier nur für den nachweislich harten Schritt. „Besteht meinen Test" statt „fühlt sich sicher an".
2. Frontier auf Abruf mit Eskalation. Unsichere oder schwierige Fälle eskalieren automatisch eine Stufe nach oben. So zahlst du den Spitzenpreis nur für die Fälle, die ihn brauchen.
3. Kosten- & Wechsel-Schicht. Ein Dashboard zeigt Kosten pro Schritt, Modell und Tag. Weil das Modell hinter einer Abstraktion liegt, ist der Anbieterwechsel Konfiguration, kein Umbau — du profitierst vom Preisverfall, statt ihm ausgeliefert zu sein.
Ehrliche Einordnung: Das Gateway ist keine Garantie für Qualität — es ist nur so gut wie deine Evals. Und „unsichtbar" heißt nicht „ohne Abhängigkeit": Ein Router, der dir nicht gehört, ist ein neuer Lock-in. Deshalb self-hosted und mit dokumentierten Evals.
- Eval-getriebenes Routing
- Pro Aufgabentyp ein kleiner, ehrlicher Test. Das Gateway nimmt das kleinste Modell, das ihn besteht — Entscheidung per Messung, nicht per Bauchgefühl.
- Automatische Eskalation
- Unsichere oder schwierige Fälle steigen Stufe für Stufe bis zur Frontier. Den Spitzenpreis zahlst du nur für die Aufgaben, die ihn wirklich brauchen.
- Modell-Abstraktion
- 400+ Modelle hinter einer API (OpenRouter / LiteLLM). Der Anbieterwechsel ist Konfiguration statt Code-Umbau — du folgst dem Preisverfall, statt im Lock-in zu sitzen.
- Kosten-Dashboard
- Ausgaben pro Schritt, Modell und Tag — live. Keine Überraschung auf der Monatsrechnung, sondern eine Kostenkurve, die du steuern kannst.
Was dabei herauskommt
Möglicher Aufbau, kein fertiges Produkt
Die dargestellten Zahlen sind Zielwerte und Erwartungswerte für einen möglichen Aufbau – basierend auf Branchen-Benchmarks, öffentlichen Studien zu vergleichbaren Setups und unseren eigenen Tests mit echtem Stack. Es handelt sich nicht um gemessene Ergebnisse aus einem konkreten Kundenprojekt; tatsächliche Werte hängen von Unternehmensgröße, Prozessreife und Integrationstiefe ab. Wir bieten diesen Aufbau nicht als fertiges Produkt an. Wir helfen Teams, Prozesse zu konzipieren, zu automatisieren und intern zu betreiben – über Architektur-Beratung, Workshops und Implementierungs-Unterstützung mit n8n. Für regulierte Drittsysteme mit Zertifizierungs- oder Lizenzanforderungen (z. B. KIS, gematik, DATEV-zertifiziert) ergänzen wir uns mit spezialisierten Partnern.
- auf SLM
- Routine-Schritte
- nur harte Fälle
- Frontier-Aufrufe
- Konfiguration
- Anbieterwechsel
- sichtbar
- Kosten pro Schritt
Aus „alles ans teure Großmodell" wird „pro Schritt das kleinste Modell, das den Test besteht, Frontier nur auf Abruf" — bei voller Kostensicht und 1-Klick-Anbietertausch. Demo-Werte, illustrativ.
Vorher vs. Nachher
| Aspekt | Vorher | Nachher |
|---|---|---|
| Modellwahl | ein Großmodell für alles | pro Schritt passend geroutet |
| Routine-Aufgaben | Frontier-Preis | SLM-Preis |
| Harte Aufgaben | gleiches Modell wie Routine | gezielte Frontier-Eskalation |
| Anbieterwechsel | Code-Umbau | Konfiguration |
| Kostensicht | Sammelrechnung am Monatsende | Kosten pro Schritt live |
Technische Eckdaten
Technologie-Stack
Integrationen
Nahtlose Anbindung an Ihre bestehende Infrastruktur
n8n (self-hosted)
OrchestrierungZentrale Engine: Klassifikation, Routing-Regeln, Eskalation und Logging
OpenRouter / LiteLLM
Modell-AbstraktionEine API über 400+ Modelle; Anbieterwechsel per Konfiguration
SLM + Frontier-Modelle
InferenzKleine Modelle für Routine, Frontier auf Abruf für harte Aufgaben
Eval-Suite
QualitätskontrolleAufgabenspezifische Tests entscheiden, welches Modell durchgereicht wird
PostgreSQL
Kosten-/Eval-LogProtokoll aller Aufrufe mit Modell, Kosten und Testergebnis
Grafana
Kosten-DashboardAusgaben pro Schritt, Modell und Tag — live sichtbar
Sicherheit & Compliance
Enterprise-ready mit höchsten Sicherheitsstandards
Datensouveränität durch Self-Hosting
Gateway, Evals und Logs laufen self-hosted. Mit LiteLLM bleibt sogar die Modell-Abstraktion im eigenen Haus — kein Zwang, Prompts über einen fremden Router zu schicken.
Kein Lock-in by Design
Modelle und Anbieter liegen hinter einer Abstraktion und sind per Konfiguration austauschbar. Der teuerste Lock-in ist der, den man sich in den Code schreibt — den vermeidet dieses Setup bewusst.
Kosten- & Eval-Log auditierbar
Jeder Aufruf wird mit Modell, Kosten und Eval-Ergebnis protokolliert — nachvollziehbar, welches Modell welche Aufgabe mit welchem Resultat bearbeitet hat.
Kein Qualitätsversprechen ohne Evals
Das Routing ist nur so gut wie die hinterlegten Tests. Ehrlich gerahmt: Die Evals sind der Kern — ohne sie ist „kleineres Modell" ein Glücksspiel, mit ihnen eine Messung.
Häufige Fragen
Ähnlich gelagert bei Ihnen?
Wenn dieser Ablauf Ihrem ähnelt, schauen wir ihn uns gemeinsam an — und sagen ehrlich, ob sich Automatisierung dafür lohnt.
Ähnliche Showcases
Agent Permission Gateway — KI-Agenten mit Least-Privilege absichern
Ein self-hosted Kontrolllayer zwischen KI-Agenten und ihren Werkzeugen: enge Rechte pro Tool, kurzlebige Just-in-Time-Tokens, Autorisierung pro Schritt, ein Human-in-the-Loop-Gate vor irreversiblen Aktionen und ein manipulationssicheres Audit-Log. Demo-Referenzarchitektur, kein zertifiziertes Produkt.
EU AI Act Compliance Cockpit – Pflichten automatisiert nachweisen
EU AI Act und DSGVO selbst automatisieren: zentrales KI-Register, unveränderlicher Audit-Trail, Human-in-the-Loop-Gate für automatisierte Entscheidungen und automatische Art.-50-Transparenzhinweise. Fristen-sicher statt Excel-Liste.