On-Prem & Air-Gapped-Betrieb
Wir bringen offene LLMs mit vLLM in Ihre eigene Infrastruktur - auch in Umgebungen, die vollständig vom Internet getrennt sind und keinen externen Dienst erreichen können.

Souveräne KI bedeutet, dass Ihre Daten bei Ihnen bleiben. Wir hosten offene Sprach-, Vision- und Embedding-Modelle selbst, dort wo sie laufen müssen.
On-Premises, in einer souveränen Cloud oder vollständig air-gapped. Sie erhalten leistungsfähige KI, ohne dass Ihre Daten jemals Ihre Kontrolle verlassen.
VERTRAUT VON ENGINEERING-TEAMS BEI:
Für viele Organisationen ist die entscheidende Frage nicht, welches Modell das beste ist, sondern wo es läuft und wohin die Daten fließen. Souveräne KI bedeutet, dass Sie die Kontrolle über Ihre Daten behalten. Wir betreiben offene Modelle mit vLLM auf Ihrer eigenen Infrastruktur, sei es On-Premises, in einer souveränen Cloud oder in einer vollständig abgeschotteten, air-gapped Umgebung.
Datenschutz und Informationssicherheit sind dann Teil der Architektur und nicht erst eine nachträgliche Ergänzung, und leistungsfähige KI lässt sich auch in sensiblen Bereichen einsetzen.
Wir bringen offene LLMs mit vLLM in Ihre eigene Infrastruktur - auch in Umgebungen, die vollständig vom Internet getrennt sind und keinen externen Dienst erreichen können.

Betrieb auf souveräner Cloud-Infrastruktur mit Standort in Deutschland oder der EU, wenn eigene Rechenzentren keine Option sind.

Datenschutz und Informationssicherheit sind von Anfang an im Design verankert – inklusive Zugriffskontrolle, Logging und klarer Datenflüsse ab dem ersten Tag.

Kaum eine Organisation kann alles selbst betreiben, und kaum eine muss das. Die entscheidende Frage ist, welchen Teil man souverän hält und für welche Daten.
LEVEL 01
Sie kaufen Token bei einem Anbieter mit einem Rechenzentrum in der EU und einer Datenverarbeitungsvereinbarung. Schneller Einstieg bei geringem betrieblichen Aufwand und der Anbieter bleibt Teil der Blockchain.
LEVEL 02
Ein Open-Weights-Modell läuft auf deutscher oder europäischer Cloud-Infrastruktur, betrieben von uns oder von Ihnen. Kein US-Anbieter im Datenpfad, keine eigene Hardware erforderlich.
LEVEL 03
Gewichte und Inferenz liegen auf Ihrer Hardware. Sie entscheiden über Version, Zeitpunkt und Zugriff und tragen Beschaffung und Betrieb.
LEVEL 04
Kein Netzwerkausgang. Modell-Updates gelangen über einen kontrollierten physischen Medienpfad ins System. Für Umgebungen, in denen dies die einzig zulässige Betriebsform ist.
Breite ohne Nacharbeit — Ein Frontier-Modell ist für viele Aufgaben ohne Anpassung nutzbar. Ein offenes Modell erfordert häufiger sorgfältiges Prompt-Design, gezieltes Fine-Tuning oder ein Retrieval-Setup, um dieselbe Qualität zu erreichen.
Multimodalität aus einem einzigen Modell — Bild, Audio und Text in einem Modell ist im Open-Source-Bereich seltener. In der Praxis lösen wir das mit mehreren spezialisierten Modellen, was oft günstiger und einfacher zu auditieren ist.
Wie wir es messen, anstatt es nur zu behaupten — Wir stellen anhand Ihrer realen Fälle einen Testdatensatz zusammen und lassen die Kandidaten daran ihre Fähigkeiten unter Beweis stellen. Es gibt keinen pauschalen Prozentsatz - das hängt von Ihrem Anwendungsfall ab.
Was Sie nicht aufgeben — Versionsstabilität, Kontrolle über Ihre Daten, planbare Kosten und die Möglichkeit, den Anbieter zu wechseln, ohne die Anwendung neu zu bauen.
GPU-Stunden statt Token. Die Kalkulation hängt von der Auslastung ab: Konstante Last macht eigene Hardware günstig, sporadische Nutzung macht sie teuer.
Inferenz, die Sie selbst betreiben, kostet Geld, auch dann wenn niemand sie nutzt. Token-Kauf kostet dann nichts. Das ist die häufigste Fehlkalkulation.
Ein zweiter Knoten für Failover verdoppelt die Hardware. Sub-Sekunden-Antwortzeiten erfordern Kapazitätspuffer, der im Durchschnitt ungenutzt bleibt.
Überwachung, Modellaktualisierung, Sicherheitspatches, Kapazitätsplanung. Das ist Personalaufwand, keine Lizenzzeile, und dieser Aspekt fehlt in fast jedem Vergleich.
Was kostet es, das Modell in zwei Jahren auszutauschen? Ein Setup mit einem OpenAI-kompatiblen Interface hält diese Zeile klein.
Wenn Ihre Verträge, Protokolle und Postfächer bereits bei einem US-Anbieter liegen, kann ein souveränes Sprachmodell überflüssig erscheinen. Dieser Einwand ist berechtigt, der Unterschied bleibt dennoch relevant: Ein Dokument in SharePoint liegt dort auf Basis eines Vertrags, mit definierten Zugriffsrechten. Wird dasselbe Dokument in einen Chatbot eingespeist, entsteht ein zweiter, unkontrollierter Datenpfad.
Deshalb beginnen wir nicht mit der Plattform, sondern mit den Daten: Welche Kategorien dürfen wohin? Oft reicht es aus, einen klar abgegrenzten Bereich souverän zu verarbeiten, etwa HR, Recht oder Patientenakten und den Rest dort zu belassen, wo er ist. Das ist günstiger als eine Migration und schneller als eine grundsätzliche Prinzipiendebatte.
Und falls Sie später wechseln wollen, entwickeln wir auf Basis einer OpenAI-kompatiblen Schnittstelle und halten Prompts, Tool-Definitionen und Bewertungsdatensätze vom Anbieter getrennt, wobei wir den Funktionsaufruf und die strukturierte Ausgabe auf beiden Seiten testen. Der Wechsel bleibt somit eine Frage der Konfiguration und kein großes Projekt.
Den Geltungsbereich des Zertifikats lesen — Fragen Sie jeden Anbieter nach dem Scope der Attestierung und ob der KI-Dienst, den Sie nutzen möchten, darin enthalten ist. Eine Attestierung deckt oft die klassische Cloud-Plattform ab, nicht aber den neuen KI-Dienst darüber.
Der EU AI Act ohne Drama — Für die meisten Systeme läuft es auf solides MLOps hinaus: Risikoklassifizierung, technische Dokumentation, Logging, menschliche Aufsicht und Change Management. Wir würden es auch ohne die Regulierung so umsetzen.
Den Betreiber-Stack offenlegen — Wer ist für die Hardware zuständig, wer für die Plattform, wer für das Modell und wer hat im Falle eines Vorfalls Zugriff auf die Daten? Diese vier Antworten gehören in Ihre Dokumentation - wir stellen sie Ihnen schriftlich zur Verfügung.
Nachweise, die Sie weitergeben können — Ein Datenflussdiagramm, ein Rollen-und-Berechtigungskonzept, ein Logging-Konzept, Modell- und Versionsstand sowie Testergebnisse. Am Ende des Projekts ist das ein Paket, das Sie übergeben können und kein Stapel Screenshots.
Wir wenden das auf uns selbst an: Homeport, unser KI-Produkt für B2B-Vertrieb, läuft in Deutschland auf T Cloud Public.
Homeport ansehenWir klären, welche Daten verarbeitet werden und ob On-Premises, Sovereign Cloud oder eine Air-Gapped-Umgebung der richtige Ort dafür ist.
Zugriffskontrolle, Logging und Datenflüsse sind von Anfang an Teil des Designs, statt nachträglich aufgesetzt zu werden.
Wir wählen offene Modelle passend zu Ihrem Anwendungsfall aus und bringen sie mit vLLM auf Ihre Infrastruktur.
Wir betreiben die Inferenz auf Ihrer Infrastruktur und halten Zugriffskontrolle und Logging nachvollziehbar.
Softwareentwicklung
SoftwareentwicklungDer Stack, auf dem diese Systeme bei uns laufen.
Starten Sie mit einer unverbindlichen Projektanfrage und lassen Sie sich von unserem Expertenteam für agile Entwicklung und Architektur umfassend zu Ihrem Projekt beraten.