02 / 08 — Leistungen

Lokale KI-Modelle

Kurz erklärt

Lokale KI bedeutet: Das Sprachmodell läuft auf Ihrem Server, Ihrer Workstation oder in Ihrem Rechenzentrum — nicht bei einem Cloud-Anbieter. Wir wählen passende Open-Source-Modelle aus, dimensionieren Hardware und Quantisierung, richten Inferenzserver ein und binden das Modell an Ihre Dokumente und Anwendungen an.

01

So funktioniert’s.

Der typische Datenfluss — von der Eingabe bis zum Ergebnis. Jede Station ist austauschbar und wird an Ihre Systeme angepasst.

  1. 01Ihre Dokumente
  2. 02Vektorindex
  3. 03Lokales LLM (GPU)
  4. 04Interne API
  5. 05Chat & Tools
Prozessor mit orange leuchtenden Leiterbahnen
Netzwerk-Switch mit angeschlossenen Kabeln

02

Was wir liefern

Sprachmodelle auf Ihrer eigenen Hardware — datensouverän, ohne Cloud-Abhängigkeit.

  1. 01Beratung zu Modellauswahl, Hardware (GPU/CPU/RAM) und realistischer Geschwindigkeit
  2. 02Installation von Inferenzservern mit OpenAI-kompatibler, abgesicherter API
  3. 03Quantisierung und Tuning für Ihre Hardware
  4. 04RAG über interne Dokumente, vollständig offline
  5. 05Interne Chat-Oberfläche mit Benutzer- und Rechteverwaltung
  6. 06Monitoring, Updates und Modellwechsel im laufenden Betrieb

03

Ein Blick in den Code.

So sieht ein Ausschnitt aus einem typischen Projekt aus — lesbar, kommentiert und ohne Magie. Genau so übergeben wir Code an Ihr Team.

llama.cppOllamaGGUFCUDAMetalPython
setup.shBeispiel
# Inferenzserver auf eigener Hardware — kein Byte verlässt das Haus
$ nvidia-smi --query-gpu=name,memory.total --format=csv
$ llama-server -m modelle/instruct-q4_k_m.gguf \
    --ctx-size 16384 --n-gpu-layers 99 --host 127.0.0.1 --port 8080
$ curl -s localhost:8080/v1/chat/completions \
    -d '{"messages":[{"role":"user","content":"Fasse Vertrag 17 zusammen"}]}'
# → OpenAI-kompatible API, abgesichert hinter Reverse Proxy + SSO

04

Was Sie davon haben.

01

Volle Datenhoheit

Verarbeitung ausschließlich in Ihrer Infrastruktur.

02

Planbare Kosten

Hardware statt Token-Abrechnung.

03

Offline-fähig

Funktioniert auch ohne Internetverbindung.

04

Ehrlich dimensioniert

Wir messen vorab, statt Geschwindigkeit zu versprechen.

05

Typische Einsatzszenarien

llama.cppOllamaGGUFCUDAMetalPythonLinuxDockerVector DBRAG

02.1

Kanzlei & Praxis

Vertrauliche Dokumente durchsuchen und zusammenfassen, ohne dass Daten das Haus verlassen.

02.2

Produktion

Assistent für Maschinenhandbücher und Wartungsprotokolle direkt in der Werkshalle — auch ohne Internet.

02.3

Entwicklungsteams

Code-Assistent auf eigener GPU, damit Quellcode nicht in fremde Clouds wandert.

02.4

Behörden & Verbände

KI-Nutzung mit vollständiger Kontrolle über Speicherort, Protokollierung und Zugriffe.

07

Häufige Fragen

Welche Hardware braucht ein lokales Sprachmodell?

Das hängt von Modellgröße und gewünschter Geschwindigkeit ab. Kleinere Modelle laufen bereits auf einer Workstation mit moderner Grafikkarte oder einem Apple-Silicon-Rechner; größere Modelle benötigen mehr Grafikspeicher. Wir messen vorab auf vergleichbarer Hardware, statt zu schätzen.

Sind lokale Modelle so gut wie ChatGPT?

Für viele konkrete Aufgaben — Zusammenfassen, Extrahieren, Beantworten aus eigenen Dokumenten — liefern aktuelle offene Modelle sehr gute Ergebnisse. Für breites Allgemeinwissen sind große Cloud-Modelle oft stärker. Wir testen mit Ihren echten Aufgaben und empfehlen ehrlich.

Ist lokale KI DSGVO-konform?

Lokaler Betrieb vereinfacht den Datenschutz erheblich, weil keine Daten an Dritte übermittelt werden. Zugriffsrechte, Protokollierung und Löschkonzepte setzen wir gemeinsam mit Ihnen um.

Bereit, wenn Sie es sind

Lassen Sie uns reden.

Beschreiben Sie Ihr Vorhaben in wenigen Sätzen — Sie erhalten eine ehrliche Einschätzung zu Machbarkeit, Aufwand und Weg.

E-Mail
info@quell-code.com
Telefon
Rückruf auf Anfrage
Antwortzeit
in der Regel 2 Werktage
Sprachen
Deutsch · English · Türkçe