Wie ein Unternehmen zu seiner eigenen KI kommt

Was hinter einem internen Assistenten steckt: welche Modelle zusammenarbeiten, wie sie an Ihre Datenbanken kommen, und wie das System mit jeder gestellten Frage besser wird — ohne dass Ihre Daten das Unternehmen verlassen.

Warum überhaupt im eigenen Haus

Ein Sprachmodell über eine öffentliche Schnittstelle anzusprechen ist einfach und für viele Zwecke völlig ausreichend. Sobald aber interne Unterlagen ins Spiel kommen — Kreditakten, Schadensmeldungen, Netzbetriebshandbücher, Personalvorgänge — verschiebt sich die Frage. Sie lautet dann nicht mehr, ob das Modell gut ist, sondern wo die Daten liegen, wer sie sieht und wer im Zweifel dafür geradesteht.

Vier Gründe führen Unternehmen in regulierten Branchen typischerweise zu einer eigenen Lösung:

  • Vertraulichkeit. Bestimmte Bestände dürfen den eigenen Verantwortungsbereich schlicht nicht verlassen — unabhängig davon, was ein Anbietervertrag zusichert.
  • Nachweispflicht. Aufsicht und Revision fragen, welche Daten in eine Antwort eingeflossen sind und wer wann was abgefragt hat. Das muss protokollierbar sein.
  • Verfügbarkeit über Jahre. Wenn ein Anbieter ein Modell abkündigt, ändert sich das Verhalten Ihrer Anwendung. Bei selbst betriebenen Modellen entscheiden Sie, wann Sie wechseln.
  • Kosten bei Dauerbetrieb. Bei hohem, gleichmäßigem Aufkommen kann eigene Hardware günstiger sein als Abrechnung pro Anfrage. Bei sporadischer Nutzung ist meist das Gegenteil der Fall.

„Im eigenen Haus“ heißt nicht zwingend „im eigenen Keller“. Zwischen dem öffentlichen Dienst und dem eigenen Serverraum liegt ein breites Feld: ein Modell im eigenen Cloud-Mandanten, in einer europäischen Region, oder bei einem Anbieter mit vertraglich zugesicherter Datenhaltung. Welche Stufe genügt, ist eine Frage der Schutzbedarfsfeststellung — nicht des Bauchgefühls.

Der Aufbau im Überblick

Das Verfahren dahinter heißt RAG, retrieval-augmented generation: Statt dem Modell beizubringen, was in Ihren Dokumenten steht, sucht das System zu jeder Frage die passenden Stellen heraus und legt sie dem Modell zusammen mit der Frage vor. Das Modell formuliert nur noch die Antwort — aus Material, das es vor sich hat.

Der entscheidende Vorteil: Ändert sich ein Handbuch, ändert sich am nächsten Tag die Antwort. Niemand muss ein Modell neu trainieren. Und weil jede Antwort auf konkrete Fundstellen zurückgeht, lässt sie sich belegen.

Aufbau eines RAG-Systems Eine Frage wird umformuliert, dann werden parallel Dokumente und Kennzahlen beschafft, die Treffer bewertet, daraus eine belegte Antwort formuliert und protokolliert. Die Auswertung der Protokolle verbessert die Suche. 1 · ANFRAGE Frage aus dem Fach „Welche Frist gilt bei …?“ Frage aufbereiten kleines Modell 2 · BESCHAFFUNG Dokumente suchen Bedeutung + Stichwort gegen den Vektorindex Kennzahlen abfragen geprüfte SQL-Abfrage gegen das Warehouse Treffer bewerten Reranker 3 · ANTWORT Antwort formulieren Sprachmodell Antwort mit Quelle Kapitel, Seite, Stand oder: nichts gefunden Protokoll Frage, Quellen, Urteil 4 · VERBESSERUNG Auswertung: schlechte Treffer, Lücken, neue Begriffe verbessert Suche, Zerlegung und Testfragen — nicht das Modell

Der Weg einer Frage. Kräftige Umrisse: Schritte, in denen ein Modell arbeitet. Gestrichelt: die Rückkopplung aus dem Betrieb.

Nicht ein Modell, sondern fünf

Die verbreitetste Fehlvorstellung ist, dass „eine KI einführen“ bedeutet, ein großes Sprachmodell hinzustellen. Tatsächlich arbeiten in einem brauchbaren System mehrere Modelle unterschiedlicher Größe zusammen, jedes mit einer engen Aufgabe. Das große Sprachmodell ist davon nur eines — und oft nicht das, an dem die Qualität hängt.

AufgabeWas das Modell tut
Einbettung

Wandelt Text in Zahlenvektoren um, sodass sich Bedeutungsnähe berechnen lässt. Muss die Sprache und das Fachvokabular beherrschen — für deutsche Fachtexte ist ein mehrsprachiges Modell Pflicht. Klein, schnell, läuft auch ohne Grafikkarte.

Nachbewertung

Sortiert die gefundenen Textstellen danach, wie gut sie die konkrete Frage beantworten. Dieser Schritt hebt die Qualität meist stärker als ein größeres Sprachmodell — und wird am häufigsten weggelassen.

Dokumentenlesen

Erkennt Struktur in PDF und Scans: Überschriften, Tabellen, Fußnoten. Bei Altbeständen entscheidet dieser Schritt darüber, ob der Rest überhaupt funktioniert.

Vorverarbeitung

Ein kleines Sprachmodell formuliert unklare Fragen um, zerlegt Mehrfachfragen und entscheidet, ob Dokumente, Kennzahlen oder beides gebraucht werden.

Antwortformulierung

Das eigentliche Sprachmodell. Es soll aus vorgelegtem Material formulieren, nicht aus dem Gedächtnis — dafür genügen oft mittelgroße offene Modelle, die auf einer einzelnen Serverkarte laufen.

Prüfung

Ein weiteres Modell bewertet Stichproben: Ist die Antwort durch die genannten Quellen gedeckt? Das ist die Grundlage jeder ernsthaften Messung.

Zu Modellnamen. Wir nennen hier bewusst keine. Die Rangliste offener Modelle ändert sich im Quartalstakt, und ein Name in einem Beratungstext ist nach einem halben Jahr ein Argument gegen den Berater. Was bleibt, sind die Auswahlkriterien: Beherrschung des Deutschen im Fachkontext, Lizenz für kommerzielle Nutzung, Hardwarebedarf, und die Frage, ob jemand das Modell in zwei Jahren noch pflegt. Welches Modell für Ihren Fall geeignet ist, entscheidet eine Messung an Ihren eigenen Fragen — nicht eine öffentliche Bestenliste.

Das Zusammenspiel mit Ihren Datenbanken

Hier trennen sich zwei Welten, die oft vermischt werden — und die technisch unterschiedlich behandelt werden müssen.

Unstrukturiertes: Dokumente

Handbücher, Verträge, Protokolle, Wikis. Diese Bestände werden einmalig gelesen, in sinnvolle Abschnitte zerlegt und in einem Index abgelegt, der zu jedem Abschnitt den Bedeutungsvektor speichert. Dazu kommen Metadaten: Herkunft, Fassung, Gültigkeit, Vertraulichkeitsstufe.

Als Speicher genügt oft die Datenbank, die Sie ohnehin betreiben — eine PostgreSQL mit Vektorerweiterung reicht für Bestände im Millionenbereich und erspart Ihnen ein zusätzliches System im Betrieb. Spezialisierte Vektordatenbanken lohnen sich bei sehr großen Beständen oder hoher Abfragelast.

Gesucht wird immer zweigleisig: über Bedeutung und über Wortgleichheit. Der Grund ist praktisch — Aktenzeichen, Paragrafen und Produktnummern findet die Bedeutungssuche schlecht, die Stichwortsuche dagegen zuverlässig. Beide Ergebnislisten werden zusammengeführt und dann nachbewertet.

Strukturiertes: Kennzahlen aus dem Warehouse

Fragen nach Zahlen — Umsatz, Bestände, Fallzahlen — dürfen nicht aus Dokumenten beantwortet werden. Dafür erzeugt das System eine Datenbankabfrage gegen Ihr Warehouse und rechnet nicht selbst.

Damit das im regulierten Umfeld tragfähig ist, gelten drei Regeln, die wir konsequent anwenden: Das System arbeitet ausschließlich mit Lesezugriff auf einer definierten Auswahl von Sichten, nicht auf den Rohtabellen. Es greift auf eine fachlich definierte Kennzahlenschicht zu, damit „Umsatz“ dasselbe bedeutet wie im offiziellen Bericht. Und die erzeugte Abfrage wird mit ausgegeben, sodass ein Fachkundiger nachvollziehen kann, wie die Zahl zustande kam.

Eine Zahl ohne die Abfrage, die sie erzeugt hat, ist im Aufsichtsgespräch wertlos.

Berechtigungen, die wirklich greifen

Der häufigste schwere Fehler in solchen Projekten: Berechtigungen werden erst bei der Anzeige geprüft. Dann hat die Suche bereits vertrauliches Material gelesen, und im Zweifel taucht es in einer zusammengefassten Antwort auf, obwohl das Ausgangsdokument gesperrt war.

Richtig ist, die Rechte beim Suchen wirken zu lassen. Jeder Abschnitt trägt im Index die Berechtigungsinformation seines Ursprungsdokuments, und jede Suche läuft im Namen des fragenden Menschen. Wer ein Dokument nicht öffnen darf, bekommt daraus keine Antwort — und erfährt auch nicht, dass es existiert. Ändert sich eine Berechtigung, muss sie zeitnah im Index nachgezogen werden; das ist Betriebsaufwand, den man einplanen muss.

Wie das System aus Anfragen lernt

Hier räumen wir mit einer verbreiteten Vorstellung auf: Ein gut gebautes System lernt nicht, indem das Sprachmodell sich die Gespräche merkt. Das wäre technisch aufwendig, datenschutzrechtlich heikel und fachlich riskant, weil auch falsche Antworten mitgelernt würden. Besser wird es an anderer Stelle — und dort deutlich.

Was protokolliert wird

Zu jeder Anfrage: die Frage, welche Abschnitte gefunden und wie sie bewertet wurden, welche davon in die Antwort eingingen, und ob der Mensch die Antwort brauchbar fand. Letzteres über eine einfache Rückmeldung — zwei Klicks, nicht ein Formular.

Woraus Verbesserung entsteht

  • Fragen ohne gute Quelle. Häufen sich Fragen, zu denen nichts Passendes gefunden wird, ist das meistens keine Suchschwäche, sondern eine Lücke in der Dokumentation. Diese Auswertung ist oft der unterschätzte Nutzen des ganzen Vorhabens.
  • Begriffe, die im Haus anders heißen. Aus echten Fragen entsteht ein Wörterbuch der internen Sprache, das die Suche unmittelbar verbessert.
  • Schlecht geschnittene Abschnitte. Wenn Treffer regelmäßig knapp neben der Antwort liegen, stimmt die Zerlegung der Dokumente nicht. Das lässt sich gezielt ändern.
  • Wachsende Prüfmenge. Jede gemeldete Fehlantwort wird zur Testfrage. Nach einem Jahr Betrieb existiert eine Sammlung, gegen die sich jede Änderung prüfen lässt — auch ein Modellwechsel.

Wann tatsächlich trainiert wird

Wenn genug echte Rückmeldungen vorliegen, lohnt es sich am ehesten, das Einbettungs- oder das Nachbewertungsmodell auf Ihre Fachsprache nachzutrainieren. Das ist vergleichsweise günstig und wirkt direkt auf die Trefferqualität. Ein Nachtrainieren des großen Sprachmodells kommt fast nur für Ton und Format infrage, selten für Wissen — Wissen gehört in die Dokumente, nicht in die Gewichte, sonst ist jede Aktualisierung wieder ein Trainingslauf.

Zwei Dinge, die in Deutschland früh zu klären sind. Protokolle, die einzelnen Beschäftigten zuzuordnen sind, berühren die Mitbestimmung — der Betriebsrat gehört an den Tisch, bevor das System läuft, nicht danach. Und Rückmeldungen von Nutzenden dürfen nie ungeprüft in die Wissensbasis zurückfließen: Sonst genügt eine falsch bestätigte Antwort, um das System dauerhaft in die Irre zu führen.

Was der Betrieb kostet und braucht

Für einen internen Assistenten mit einigen hundert Nutzenden genügt in der Regel ein Server mit ein bis zwei aktuellen Rechenkarten. Das Einbettungsmodell läuft nebenher, das Sprachmodell braucht den Löwenanteil. Für Ausfallsicherheit rechnet man das doppelt.

Der größere Posten ist selten die Hardware, sondern der Betrieb: Wer aktualisiert die Dokumente, wer prüft die Messungen, wer entscheidet über Modellwechsel. Diese Rollen sollten benannt sein, bevor das System produktiv geht. Ein Assistent, für den sich niemand zuständig fühlt, verliert innerhalb eines Jahres das Vertrauen der Fachbereiche — und dann wird er nicht mehr benutzt, unabhängig von seiner Qualität.

Und was ist mit Agenten?

Der Assistent, den wir bisher beschrieben haben, antwortet. Ein Agent geht weiter: Er plant mehrere Schritte, ruft dabei selbst Systeme auf und arbeitet auf ein Ziel hin, statt auf eine Frage. Das ist kein besserer Assistent, sondern eine andere Risikoklasse — und der Unterschied wird im Verkaufsgespräch oft verwischt.

Beim Assistenten ist die schlimmste Folge eines Fehlers eine falsche Antwort, die ein Mensch prüft. Sobald ein System Schritte verkettet, pflanzen sich Fehler fort: Fünf Schritte mit je fünfundneunzig Prozent Zuverlässigkeit ergeben für die gesamte Kette rund siebenundsiebzig Prozent. Und am Ende einer solchen Kette steht irgendwann ein Schreibvorgang in ein produktives System.

Vier Stufen, drei davon tragfähig

  • Antworten. Das System liest und formuliert. Alles, was oben beschrieben ist.
  • Nachschlagen. Es ruft Systeme lesend ab — Vertragsdaten, Kennzahlen, Fallakten — und trägt zusammen. Kein Schreibzugriff, keine Nebenwirkung.
  • Vorbereiten. Es erarbeitet einen Vorschlag: einen Antwortentwurf, eine ausgefüllte Maske, eine Einschätzung mit Begründung. Ein Mensch gibt frei, und erst diese Freigabe löst etwas aus.
  • Selbst handeln. Das System schreibt eigenständig zurück. Hier haftet niemand mehr für den einzelnen Vorgang — und genau an dieser Stelle wird es in aufsichtsrelevanten Prozessen schwierig.

Die ersten drei Stufen sind heute belastbar umsetzbar und decken den größten Teil des tatsächlichen Nutzens ab. Die vierte halten wir in regulierten Prozessen für selten tragfähig — nicht aus technischen Gründen, sondern weil sich die Verantwortung nicht auflösen lässt.

Der Sprung liegt nicht zwischen Assistent und Agent. Er liegt zwischen Vorbereiten und Handeln.

Wo sich der Aufwand lohnt

Sinnvolle Anwendungen sind fast immer solche, in denen heute jemand Informationen aus mehreren Systemen zusammensucht, bevor er entscheidet. Eine Rechnungsreklamation, für die Vertrag, Ablesungen, Belege und Zahlungshistorie zusammengetragen werden müssen. Eine Unterlagenprüfung gegen eine Checkliste. Die Aufbereitung einer Beschwerde. In diesen Fällen übernimmt der Agent das Zusammentragen und Vorschlagen — die Entscheidung bleibt beim Menschen, und die Zeitersparnis ist trotzdem erheblich.

Drei Bedingungen, ohne die wir davon abraten

  • Rechte wandern mit. Ein Agent darf nie mehr sehen oder tun als der Mensch, in dessen Auftrag er läuft. Ein Dienstkonto mit Vollzugriff ist der schnellste Weg zu einer Prüfungsfeststellung.
  • Jeder Schritt ist protokolliert. Nicht nur das Ergebnis, sondern auch, welche Systeme in welcher Reihenfolge abgefragt wurden. Ohne das ist im Nachhinein nicht rekonstruierbar, wie ein Vorschlag zustande kam.
  • Kurze Ketten mit klarem Abschluss. Drei nachvollziehbare Schritte mit anschließender Freigabe schlagen zehn selbstständige. Auch, weil sich nur kurze Ketten sinnvoll messen lassen.

Denn das ist die unterschätzte Schwierigkeit: Beim Assistenten bewertet man Antworten, beim Agenten jeden Zwischenschritt. Ein Ergebnis kann richtig sein, obwohl der Weg dorthin falsch war — und dann wiederholt es sich beim nächsten Fall nicht.

Der Weg dorthin

Wir empfehlen, klein und echt anzufangen: ein abgegrenzter Dokumentenbestand, eine Nutzergruppe, ein messbarer Nutzen. Nicht, weil größere Vorhaben zu schwer wären, sondern weil man an einem echten Bestand mehr über die eigene Datenlage lernt als in jeder Konzeptphase.

Der Aufbau, den Sie dabei schaffen — Erschließung, Suche, Rechte, Messung, Protokoll — trägt anschließend jeden weiteren Anwendungsfall. Das zweite Vorhaben ist deshalb regelmäßig deutlich schneller als das erste.

So sieht das als Projekt bei uns aus →