Dedizierte KI. Sie behalten die Kontrolle.

Ihre Arbeit.
Ihre Modelle.
Ihre Bedingungen.

Kostengünstige physische Hardware, die ausschließlich Ihrer Organisation vorbehalten ist. Niemals mit anderen Kunden geteilt.

Besprechen Sie Ihre Anforderungen

Wir verbinden dedizierte Hardware, sorgfältig ausgewählte Modelle und die Expertise, sie zum Laufen zu bringen. Sie entscheiden, wo alles läuft, wie Ihre Daten behandelt werden und welche Fähigkeiten Ihr Team benötigt.

  • Vertrauliche oder unternehmenseigene Daten analysieren und verarbeiten
  • Souveräne agentische Workflows bereitstellen
  • Medien erstellen und bearbeiten, die klassifizierte oder noch nicht veröffentlichte Produkte zeigen
Kontrolle, die etwas bedeutet

Behalten Sie die Entscheidungen, die zählen.

Vereinbaren Sie die Betriebsregelungen, die für Ihr Team wichtig sind: Datenrichtlinien, Modellfähigkeiten und kontrollierte Änderungen.

Ihre Daten und Richtlinien

Sie besitzen Ihre Daten und entscheiden über Audit-Protokolle, Aufbewahrung und Nutzungsrichtlinien. Ihre Daten verlassen niemals Ihre dedizierten Hosts, so dass Kalufs Ihre Daten nicht einsehen kann, außer Sie gewähren uns Zugriff.
Warum europäischer Boden keine Garantie dagegen ist, dass ausländische Interessen Ihre Daten erlangen →
Warum Datenschutz nicht die ganze Vertraulichkeitsfrage ist →

Modelle, die Ihre Arbeit erledigen können

Legitime Arbeit kann sensibles Material umfassen. Wir helfen Ihnen, Modelle auszuwählen und zu validieren, einschließlich Varianten mit reduzierter Verweigerungsrate oder abliterierter Modelle, wenn Ihre Workflows sie benötigen. Die Nutzungsrichtlinien legen Sie fest.
Wenn Sicherheitsvorkehrungen legitime Arbeit blockieren →

Gezielte Änderungen

Modelländerungen stimmen wir mit Ihnen ab und validieren sie gegen Ihre Workloads. Kalufs konfiguriert und optimiert die vereinbarten Modelle, damit die Hardware effektiv genutzt wird.
Warum der Modelllebenszyklus Teil des Dienstes ist →

Ein Gateway. Ihre Konfiguration.

Verschiedene Fähigkeiten.
Ein gemeinsamer Zugang.

Ihre Anwendungen fordern ein vereinbartes Modell oder einen Rollen-Alias an. Was bereitsteht und was bei Bedarf geladen wird, konfigurieren wir gemeinsam mit Ihnen.

Betreiben Sie Modelle aus Familien wie DeepSeek, Gemma, GLM, Ideogram, Kimi, Krea, LTX, MiMo, Minimax, Mistral, Muse, Qwen und YuE zu Ihren eigenen Bedingungen.

Beispiel A

Ein Technikteam

Ein dedizierter Node · acht GCDs · 512 GB VRAM
  1. GCD 0Reasoning-Modell · Shard
  2. GCD 1Reasoning-Modell · Shard
  3. GCD 2Reasoning-Modell · Shard
  4. GCD 3Reasoning-Modell · Shard
  5. GCD 4Textmodell · Shard
  6. GCD 5Textmodell · Shard
  7. GCD 6
    Bildmodell XBildmodell Y
  8. GCD 7
    3D-Asset-GenerierungsmodellOCR-Modell
1 TB Systemspeicher

Modellinladung, Host-Workloads und optionales KV-Cache-Offloading teilen sich diese Kapazität.

Reasoning-Modell, Textmodell, 3D-Asset-Generierung und OCR bleiben in diesem Beispiel resident. Bildmodell X und Bildmodell Y werden als separate Modell-Endpunkte bereitgestellt; das ausgewählte Bildmodell wird bei Bedarf in GCD 6 getauscht.

Beispiel B

Ein Forschungs- und Kreativstudio

Ein dedizierter Node · acht GCDs · 512 GB VRAM
  1. GCD 0Textmodell · Shard
  2. GCD 1Textmodell · Shard
  3. GCD 2Textmodell · Shard
  4. GCD 3Textmodell · Shard
  5. GCD 4Videogenerierungsmodell · Shard
  6. GCD 5Musikgenerierungsmodell
  7. GCD 6
    Bildmodell XBildmodell Y
  8. GCD 7
    Text-to-Speech-Modell3D-Asset-Generierungsmodell
1 TB Systemspeicher

Modellinladung, Host-Workloads und optionales KV-Cache-Offloading teilen sich diese Kapazität.

Textmodell, Videogenerierungsmodell, Musikgenerierungsmodell, Text-to-Speech-Modell und 3D-Asset-Generierungsmodell bleiben in diesem Beispiel resident. Bildmodell X und Bildmodell Y werden als separate Modell-Endpunkte bereitgestellt; das ausgewählte Bildmodell wird bei Bedarf in GCD 6 getauscht.

Beispiel C

Ein Rechtsteam

Ein dedizierter Node · acht GCDs · 512 GB VRAM
  1. GCD 0Textmodell · Shard
  2. GCD 1Textmodell · Shard
  3. GCD 2Textmodell · Shard
  4. GCD 3Textmodell · Shard
  5. GCD 4
    BildanalysemodellVideoanalysemodell
  6. GCD 5Modell für juristische Recherche + Zitate
  7. GCD 6
    OCR-ModellSprachtranskriptionsmodell
  8. GCD 7
    ÜbersetzungsmodellModell für strukturierte Extraktion
1 TB Systemspeicher

Modellinladung, Host-Workloads und optionales KV-Cache-Offloading teilen sich diese Kapazität.

Textmodell, Modell für juristische Recherche + Zitate, OCR-Modell, Sprachtranskriptionsmodell, Übersetzungsmodell und Modell für strukturierte Extraktion bleiben in diesem Beispiel resident. Bildanalysemodell und Videoanalysemodell werden als separate Modell-Endpunkte bereitgestellt; das ausgewählte Analysemodell wird bei Bedarf in GCD 4 getauscht.

Jede Kachel ist ein GPU-Rechen-Chip (GCD), keine ganze Grafikkarte und keine virtuelle Sicherheitsgrenze. Wiederholte Farben zeigen ein Modell, das über mehrere GCDs verteilt ist. Belegte Kacheln kennzeichnen Zuordnungen. Modellnamen und Beschriftungen sind illustrativ.

Diffusionsmodelle können sich einen GCD teilen, wenn ihre kombinierten Gewichte und ihr Ausführungspeicher hineinpassen. Typische Diffusionsgenerierung benötigt nicht den wachsenden autoregressiven KV-Cache einer LLM, aber Aktivierungen, Attention-Puffer und Bild-/Video-Decodierung brauchen weiterhin Speicher.

Unterstützte Serving-Stacks können den LLM-KV-Cache in den Systemspeicher auslagern. Der Arbeitsspeicher bleibt auf demselben dedizierten Host.

Exakte Modelle, Speichernutzung und Ladevorkehrungen werden gemeinsam mit Ihnen vereinbart.

Ein stabiler Name. Eine vereinbarte Aktualisierung.

Ihre Anwendung: „reasoning“ → Aktuelles vereinbartes Modell → Validiertes Ersatzmodell

Sobald neue, bessere Modelle erscheinen oder sich Ihre Anforderungen ändern, ersetzen wir Modelle auf Ihre Anfrage. Wir sorgen dafür, dass sie auf Ihrer dedizierten Hardware effizient laufen, und können Basismodelle an Ihre Bedürfnisse anpassen, verfeinern und feinjustieren. In jedem Fall bieten wir einen stabilen, vereinbarten Weg für Aktualisierungen.

Raum zum Wachsen

Beginnen Sie mit einem Node.
Wachsen Sie mit Ihrer Arbeit.

Jeder Node verfügt über ConnectX-6 mit 200GbE-Anbindung. Fügen Sie dedizierte Nodes hinzu, wenn der Bedarf steigt: um mehr Arbeit parallel zu bewältigen oder um ein größeres Modell mit einem kompatiblen Inferenz-Stack über mehrere Nodes zu verteilen.

Mehr Arbeit auf einmal

Betreiben Sie Modellrepliken oder verschiedene Workloads auf zusätzlichen Nodes.

Node A · Modellreplik
Node B · zusätzliche Replik
ConnectX-6 · 200GbE-Netzwerkanbindung

Verteilen Sie Anfragen über die vereinbarten Bereitstellungen. Zusätzliche Kapazität kann mehr gleichzeitige Benutzer und Aufträge unterstützen.

Ein größeres Modell über mehrere Nodes

Verteilen Sie ein größeres Modell über mehrere Nodes.

Node A · Modell-Shards
Node B · übrige Modell-Shards
ConnectX-6 · 200GbE-Netzwerkanbindung

Verwenden Sie eine unterstützte verteilte Inferenzkonfiguration, wenn ein Node nicht ausreicht.

Anzahl der Nodes, Modellpartitionierung, Netzwerktopologie und Leistung für Ihren Workload werden gemeinsam festgelegt und validiert. Zusätzliche Nodes unterliegen denselben vereinbarten Betriebsvereinbarungen.

Den Standort wählen Sie selbst

Nah an Ihrer Arbeit.
Innerhalb Ihrer Grenzen.

Bereitstellung wählen

Wählen Sie eine Bereitstellung in Ihren Räumlichkeiten oder Hosting in Östersund (Schweden). Hosting in Imperia (Italien) ist demnächst verfügbar! Der Standort ist eine separate Entscheidung von der Frage, welche Modelle geladen bleiben.

In Ihren Räumlichkeiten

Die dedizierte Hardware wird physisch in Ihren Räumlichkeiten installiert. Für zusätzliche Isolierung können Sie eine vollständig netzwerkgetrennte Bereitstellung wählen.

Aktualisierungen und Änderungen erfordern physischen Zugriff auf den Host. Das kann Support-Reaktions- und Lösungszeiten verlängern. Wartungsvereinbarungen und Support-Erwartungen werden als Teil der Bereitstellung festgelegt.

Ein dedizierter Server-Rack in einem stilisierten Büroraum.

Östersund

In der Mitte Schwedens, nicht weit von Trondheim in Norwegen und nahe den Bergen, liegt Östersund — „Vinterstaden“ — „die Winterstadt“. Das Rechenzentrum unseres Partners wird mit fossilfreier Wasserkraft versorgt.

Eine schneebedeckte Stadt am Wasser, eingerahmt von Bergsilhouetten.

Imperia

Demnächst verfügbar! Das Rechenzentrum unseres Partners in Imperia befindet sich im Bau und wird bald in Betrieb gehen.

An der ligurischen Küste am Fuße der Ligurischen Alpen, weniger als eine Stunde vom Großraum Nizza in Frankreich entfernt, trägt Imperia seinen Slogan „il miglior clima d’Italia“ — „Italiens bestes Klima“ zu Recht. Freikühlung reduziert den Energiebedarf für die Kühlung, während reichlich Sonnenschein eine fossilfreie Solarstromerzeugung unterstützt.

Eine sonnige ligurische Küstenstadt zwischen Bergen und Meer.
Von der Bereitstellung bis zur Lieferung

Mehr als ein Host.
Ein verlässlicher Partner.

Wir helfen Ihnen, die Hardware zum Arbeiten zu bringen — von der Bereitstellung und Integration bis zum laufenden Support.

Kalufs bietet Beratung in Softwareentwicklung, agentischen Workflows, Systemintegration, Datenlabeling, Trainingsbetrieb, MLOps, Red Teaming, Penetrationstests, Sicherheitsmonitoring, Incident Response und verwaltetem Fine-Tuning an.

Beginnen Sie mit der Arbeit, die Sie erledigen müssen.

Ein nützliches erstes Gespräch umfasst:

  • Ihr Geschäftsbereich, Ihre Herausforderungen und Möglichkeiten im Bereich Datensouveränität.
  • Ihre Workflows und die benötigten Modellfähigkeiten.
  • Wo die Verarbeitung stattfinden soll und wer auf die Daten zugreifen darf.
  • Die Integrationen, Bewertungen und den Support, die Ihr Team benötigt.

Interessiert? Schreiben Sie uns eine E-Mail an info@kalufs.se für ein unverbindliches Gespräch über Ihre Anforderungen.

Lesen Sie, bevor Sie sich entscheiden

Verschiedene Gründe
die Kontrolle zu übernehmen.

Artikel zu bleibenden Fragen, die laufend aktualisiert werden, wenn sich die Themen weiterentwickeln.

Ihre Privatsphäre

Wir respektieren Ihre Privatsphäre. Wir verwenden keine Analyse-Cookies und verfolgen Sie nicht über Websites hinweg. Wir nutzen Plausible Analytics ausschließlich, um aggregierten Website-Traffic zu verstehen, etwa Besucherzahlen und ungefähre geografische Standorte. Wir respektieren Do Not Track und Global Privacy Control.