Eine Suche über eigene Dokumente kostet dauerhaft Pflege
Die Vorführung dauert zehn Minuten und überzeugt jeden im Raum. Eine Frage in ein Eingabefeld, und heraus kommt eine Antwort aus den eigenen Handbüchern, mit Quellenangabe, formuliert wie von einem Kollegen. Danach folgt die Frage nach dem Preis, und die Antwort darauf klingt überschaubar.
Was in dieser Rechnung fehlt, ist der Teil danach. Eine Suche über eigene Dokumente ist keine Anschaffung, sondern ein Betrieb. Sie wird schlechter, wenn niemand sie pflegt, und zwar nicht auffällig schlecht, sondern langsam und unbemerkt, bis irgendwann Antworten auf Basis von Ständen entstehen, die vor zwei Jahren zurückgezogen wurden.
Der folgende Text beschreibt, was nötig ist, damit so ein System brauchbare Antworten liefert, und was der laufende Betrieb an Aufwand verlangt. Ohne Kaufempfehlung und ohne Zahlen aus fremden Angeboten, sondern anhand der Posten, die in jedem Fall anfallen.
Der Aufwand in Kurzform
- Bedingung eins: Es gibt einen definierten Bestand an Dokumenten mit klarer Zuständigkeit.
- Bedingung zwei: Zugriffsrechte sind sauber gepflegt und lassen sich technisch auslesen.
- Bedingung drei: Es gibt einen Prozess, der veraltete Stände aus dem Bestand entfernt.
- Aufbau: der kleinere Teil, meist Wochen, nicht Monate.
- Betrieb: der größere Teil, dauerhaft, mit einer benannten Person.
- Abbruchkriterium: Wenn die Ablage nicht gepflegt wird, hilft keine Suche darüber.
Was die Leute erwarten, und was ankommt
Die Erwartung nach der Vorführung lautet: Das System weiß alles, was im Unternehmen geschrieben wurde. Tatsächlich weiß es genau das, was im Bestand liegt, den jemand ausgewählt hat, und es kennt weder den Kontext, in dem ein Dokument entstanden ist, noch die mündliche Absprache, die es später überholt hat.
Daraus entsteht die typische Enttäuschung im dritten Monat. Nicht, weil die Antworten falsch klingen, sondern weil sie plausibel klingen und trotzdem auf einer alten Fassung beruhen. Ein System, das offensichtlich danebenliegt, wird korrigiert. Eines, das knapp danebenliegt, wird geglaubt.
Wer den Nutzen realistisch ansetzt, formuliert ihn eng: schnelleres Wiederfinden von Wissen, das ohnehin existiert, für Fragen, deren Antwort in einem Dokument steht. Nicht Entscheidungen, nicht Bewertungen, nicht Auskünfte über Sachverhalte, die nirgends aufgeschrieben sind.
Diese Eingrenzung lohnt sich schon deshalb, weil sie eine Erfolgsmessung ermöglicht. Wer sagt, das System solle den Zugriff auf Handbücher und Arbeitsanweisungen beschleunigen, kann nach drei Monaten prüfen, ob genau diese Fragen seltener im Team herumgereicht werden. Wer stattdessen ankündigt, das Wissen des Unternehmens verfügbar zu machen, hat kein Kriterium, an dem sich das Ergebnis messen ließe, und wird die Enttäuschung nicht erklären können.
Wie eine Suche über eigene Dokumente technisch abläuft
Der Ablauf besteht aus vier Schritten und ist unabhängig vom Anbieter im Kern derselbe. Zuerst werden Dokumente eingelesen und in kleinere Abschnitte zerlegt. Dann wird jeder Abschnitt in eine Zahlenrepräsentation überführt und gespeichert.
Bei einer Frage wird dieselbe Umwandlung auf die Frage angewendet, und das System sucht die Abschnitte, die ihr am nächsten liegen. Diese Abschnitte werden zusammen mit der Frage an ein Sprachmodell übergeben, das daraus eine Antwort formuliert.
Zwei Folgerungen ergeben sich daraus unmittelbar. Erstens: Das Modell erfindet die Antwort nicht aus dem Nichts, aber es erfindet den Zusammenhang zwischen den gefundenen Abschnitten. Zweitens: Wenn die Suche die falschen Abschnitte liefert, hilft kein besseres Modell. Die Qualität entsteht vor dem Modell, nicht in ihm. Eine begriffliche Einordnung bietet der Überblick zum Wissensmanagement.
Interne Wissensdatenbank: die drei Voraussetzungen
Die erste ist ein abgegrenzter Bestand. Nicht alle Laufwerke, nicht die gesamte Ablage aus fünfzehn Jahren, sondern eine Auswahl mit einem Verantwortlichen je Bereich. Wer alles einliest, liest auch jeden alten Entwurf mit ein.
Die zweite ist ein technisch auslesbares Rechtesystem. Wenn Zugriffsrechte nur als Absprache existieren oder in Ordnernamen stecken, kann kein System sie durchsetzen, und dann beantwortet es Fragen zu Gehältern für alle, die fragen.
Die dritte ist eine Aktualisierungsregel. Es muss festliegen, wer wann prüft, ob ein Dokument noch gilt, und wie ein zurückgezogenes Dokument aus dem Bestand verschwindet. Eine interne Wissensdatenbank ohne diese Regel liefert im ersten Jahr gute und im dritten Jahr gefährliche Antworten.
Datenqualität ist der Punkt, an dem es scheitert

Die meisten Bestände sind schlechter, als ihre Besitzer glauben. Typisch sind mehrere Fassungen desselben Dokuments mit Namenszusätzen, Entwürfe neben freigegebenen Ständen, eingescannte Seiten ohne Texterkennung, Tabellen mit verbundenen Zellen und Präsentationen, deren Aussage in der Grafik steckt und nicht im Text.
Für die Suche bedeutet das jeweils etwas Bestimmtes. Mehrere Fassungen erzeugen widersprüchliche Antworten. Scans ohne Texterkennung sind unsichtbar. Tabellen werden beim Zerlegen zerrissen, sodass Zahlen ohne Spaltenüberschrift ankommen. Und Inhalte aus Grafiken fehlen vollständig.
Der erste Arbeitsschritt ist deshalb keine technische, sondern eine redaktionelle Aufgabe: sichten, aussortieren, eine gültige Fassung je Thema festlegen. Dieser Schritt kostet Zeit und wird in Angeboten fast nie eingepreist, weil er nicht vom Anbieter erbracht werden kann. Wie sich solche Vorarbeit ordnen lässt, beschreibt der Text über das Dokumentieren von Prozessen.
Was mit doppelten und veralteten Ständen passiert
Ein System kann nicht wissen, welche von zwei widersprüchlichen Aussagen die aktuelle ist, wenn beide im Bestand liegen. Es wählt danach aus, welcher Abschnitt der Frage sprachlich näher liegt, und das ist häufig die ältere Fassung, weil sie ausführlicher formuliert war.
Der übliche Reflex, Datumsangaben in die Bewertung einzubeziehen, hilft nur begrenzt. Das Änderungsdatum einer Datei sagt oft nichts über die Gültigkeit des Inhalts aus, weil ein Dokument beim Kopieren ein neues Datum bekommt und ein gültiges Dokument jahrelang unverändert bleiben kann.
Was hilft, ist eine Kennzeichnung am Dokument selbst: Status, Gültigkeitsende und verantwortliche Rolle, im Dokument und in den Eigenschaften. Damit lassen sich abgelaufene Stände automatisch ausschließen. Diese Kennzeichnung nachträglich anzubringen, ist der aufwendigste Teil des ganzen Vorhabens.
Zugriffsrechte müssen die Antwort mitfiltern

Die gefährlichste Fehlkonfiguration ist ein Bestand, der für alle gleich durchsuchbar ist. Personalunterlagen, Gehaltsdaten, Verträge, Krankmeldungen, Bewerbungen und Protokolle der Geschäftsführung liegen in fast jedem Unternehmen in denselben Systemen wie die Handbücher.
Technisch gibt es zwei Wege. Entweder werden die Rechte bei jeder Anfrage geprüft, sodass nur zugelassene Abschnitte in die Antwort einfließen, oder es werden getrennte Bestände je Berechtigungsgruppe geführt. Der erste Weg ist sauberer und aufwendiger, der zweite einfacher und schwerer aktuell zu halten.
In beiden Fällen bleibt eine Restfrage: Was passiert, wenn sich Rechte ändern. Ein ausgeschiedener Mitarbeiter verliert den Zugang, aber seine Dokumente bleiben im Bestand. Wer die Zuordnung nicht regelmäßig abgleicht, hat nach zwei Jahren ein System, dessen Rechte niemand mehr nachvollziehen kann. Die datenschutzrechtliche Seite dieser Frage behandelt der Text über künstliche Intelligenz im Startup-Alltag.
Wie Dokumente zerlegt werden, und warum das alles bestimmt
Die Zerlegung in Abschnitte ist die unscheinbarste und wirksamste Stellschraube. Zu kleine Abschnitte verlieren den Zusammenhang, sodass eine Zahl ohne ihre Bedingung ankommt. Zu große Abschnitte verwässern die Suche, weil ein langer Text zu vielen Fragen ungefähr passt.
Besser als jede feste Länge ist eine Zerlegung entlang der Struktur des Dokuments: nach Überschriften, nach Abschnitten, nach Vertragsklauseln. Dafür müssen die Dokumente Struktur haben, was bei gewachsenen Beständen selten der Fall ist.
Ein weiterer Punkt betrifft Tabellen und Listen. Sie brauchen eine gesonderte Behandlung, weil sonst die Überschriften der Spalten verloren gehen. Wer viele Zahlen im Bestand hat, sollte diesen Fall vor der Einführung testen, und zwar mit echten Dokumenten, nicht mit Beispielen des Anbieters.
Ebenfalls unterschätzt wird die Behandlung von Verweisen. Viele interne Dokumente sind ohne ihren Anhang oder ohne das Dokument, auf das sie verweisen, nicht verständlich. Wird ein Abschnitt isoliert gefunden, fehlt dieser Bezug, und die Antwort wirkt vollständig, obwohl die entscheidende Bedingung in einer anderen Datei steht. Wer solche Ketten im Bestand hat, sollte sie vor dem Einlesen auflösen oder die betroffenen Dokumente zusammenführen.
Aktualisierung: der Teil, den niemand einplant
Ein Bestand ist nach dem ersten Einlesen aktuell und danach nie wieder von allein. Es braucht einen Weg, wie Änderungen ankommen: entweder automatisch beim Speichern, in festen Abständen, oder ausgelöst durch eine Freigabe.
Jeder dieser Wege hat einen Preis. Automatisch bedeutet, dass auch Entwürfe sofort im Bestand landen. Feste Abstände bedeuten eine Verzögerung, die den Nutzern bekannt sein muss. Freigabegesteuert ist die sauberste Variante und verlangt einen Prozess, den jemand ausführt.
Dazu kommt das Löschen. Ein zurückgezogenes Dokument muss aus dem Bestand verschwinden, und zwar vollständig, nicht nur aus der Ablage. Wer diesen Schritt nicht baut, hat nach einem Jahr ein System, das Auskünfte zu Regelungen gibt, die es nicht mehr gibt.
Quellenangabe als Bedingung, nicht als Zusatz
Eine Antwort ohne Quelle ist im Unternehmenskontext nicht verwendbar. Wer eine Auskunft weitergibt, muss nachsehen können, worauf sie beruht, und zwar bis zum Absatz, nicht nur bis zur Datei.
Das ist keine Bequemlichkeit, sondern die einzige praktikable Kontrolle. Systeme dieser Art formulieren flüssig, auch wenn die Grundlage dünn ist, und der einzige verlässliche Test ist der Blick in die zitierte Stelle.
Als Anforderung an einen Anbieter formuliert: Jede Antwort nennt die verwendeten Abschnitte, verlinkt auf die Fundstelle und gibt an, wenn keine passende Stelle gefunden wurde. Der letzte Punkt ist der wichtigste und in vielen Umsetzungen der schwächste, weil ein System, das gelegentlich keine Antwort gibt, in Vorführungen schlechter aussieht.
Die Aufwandsrechnung für Aufbau und Betrieb
Die folgende Übersicht listet die Posten, die in jedem Vorhaben dieser Art auftreten. Beträge stehen bewusst nicht darin, weil sie an Bestandsgröße, Anbieter und internem Stundensatz hängen; die Posten selbst sind übertragbar.
| Posten | einmalig | laufend | wer macht es |
|---|---|---|---|
| Sichtung und Bereinigung des Bestands | hoch | gering, aber regelmäßig | Fachbereich |
| Kennzeichnung von Status und Gültigkeit | hoch | bei jeder Änderung | Fachbereich |
| Einlesen und Zerlegen | mittel | bei jeder Aktualisierung | Technik oder Anbieter |
| Abgleich der Zugriffsrechte | mittel | monatlich | Verwaltung der Systeme |
| Abfragen an das Modell | keiner | mit der Nutzung steigend | Anbieter |
| Prüfung der Antwortqualität | mittel | quartalsweise | benannte Person |
| Schulung und Erklärung der Grenzen | gering | bei jeder Einstellung | Führungskraft |
Die Zeile, die am häufigsten fehlt, ist die vorletzte. Ohne regelmäßige Prüfung der Antwortqualität merkt niemand, dass ein System schlechter geworden ist, weil jede einzelne Antwort weiterhin überzeugend aussieht. Wie sich die verbrauchsabhängigen Kosten der Abfragen zusammensetzen, steht im Text zur Rolle von Technologie in der Produktentwicklung.
Wie man merkt, dass die Antworten schlechter werden
Nicht an Beschwerden. Wer eine falsche Antwort bekommt und es nicht merkt, beschwert sich nicht. Deshalb braucht es eine aktive Prüfung mit einem festen Satz von Fragen, deren richtige Antwort bekannt ist.
Zwanzig bis dreißig solcher Fragen reichen. Sie decken die häufigsten Themen ab, werden quartalsweise gestellt, und die Antworten werden mit dem Vorquartal verglichen. Verändert sich eine Antwort, ohne dass sich das zugrunde liegende Dokument geändert hat, ist etwas im Bestand passiert.
Ein zweiter Indikator ist die Nutzung selbst. Sinkt sie nach den ersten Wochen deutlich, liegt das selten an mangelnder Gewöhnung. Meistens haben die Nutzer festgestellt, dass die Antwort für ihre konkreten Fragen nicht reicht, und sind zur alten Vorgehensweise zurückgekehrt.
Wo eine gepflegte Ablage die bessere Antwort ist
Bei kleinen Beständen mit klarer Struktur ist die Suche über Dokumente ein Werkzeug mit ungünstigem Verhältnis. Wenn dreißig Dokumente in einer sinnvollen Ordnerstruktur liegen und alle im Team wissen, wo was steht, löst ein System dieser Art kein vorhandenes Problem.
Der Nutzen entsteht ab einer Menge, die niemand mehr überblickt, und bei Fragen, die sich wiederholen: Auskünfte an neue Mitarbeitende, Standardfragen im Kundenkontakt, Nachschlagen in umfangreichen technischen Unterlagen. Wo diese Muster fehlen, fehlt auch der Ertrag.
Ein ehrlicher Zwischenschritt ist die Verbesserung der Ablage selbst, mit Namenskonventionen, einer gültigen Fassung je Thema und einer Suchfunktion, die es meist schon gibt. Diese Arbeit ist ohnehin Voraussetzung, und in einem Teil der Fälle stellt sich danach heraus, dass der weitere Schritt nicht mehr nötig ist. Ähnlich gelagert ist die Abwägung im Text über Werkzeuge ohne Programmierkenntnisse.
Die Fragen an einen Anbieter
Sieben Fragen trennen brauchbare Angebote von Vorführungen. Wo werden die Daten verarbeitet und gespeichert. Werden Eingaben zum Training verwendet, und lässt sich das vertraglich ausschließen. Wie werden Zugriffsrechte durchgesetzt, bei jeder Anfrage oder über getrennte Bestände.
Weiter: Wie erfolgt die Aktualisierung, und was passiert mit gelöschten Dokumenten. Wie sieht die Quellenangabe aus, bis auf welche Ebene. Was kostet der Betrieb bei einer bestimmten Zahl von Abfragen im Monat. Und schließlich: Wie kommt man wieder heraus, also welche Daten lassen sich in welchem Format mitnehmen.
Die letzte Frage wird am seltensten gestellt und entscheidet über die Abhängigkeit. Wenn die aufbereiteten Dokumente nur im System des Anbieters existieren, beginnt jeder Wechsel wieder bei der Sichtung des Bestands.
Häufige Fragen
Wie lange dauert der Aufbau?
Der technische Teil ist bei überschaubaren Beständen in Wochen erledigt. Die Sichtung und Kennzeichnung der Dokumente dauert deutlich länger und lässt sich nicht abkürzen, weil sie fachliches Urteil verlangt.
Können wir einfach unser gesamtes Laufwerk einlesen?
Technisch ja, praktisch nein. Ein ungefilterter Bestand enthält Entwürfe, private Ablagen, alte Fassungen und personenbezogene Unterlagen. Das Ergebnis sind widersprüchliche Antworten und ein Datenschutzproblem.
Braucht es dafür eine eigene Stelle?
In kleinen Unternehmen keine volle Stelle, aber eine benannte Person mit fester Zeit im Monat. Ohne Zuständigkeit verfällt der Bestand, und mit ihm die Qualität der Antworten.
Was ist mit vertraulichen Unterlagen?
Sie gehören entweder ausgeschlossen oder in einen getrennten Bestand mit eigener Berechtigung. Vor der Einführung ist zu klären, welche Kategorien überhaupt verarbeitet werden dürfen, und diese Prüfung gehört zur Datenschutzorganisation.
Wie erkennt man, ob eine Antwort erfunden ist?
Über die Quellenangabe. Wenn die genannte Fundstelle die Aussage nicht enthält, stammt sie aus der Formulierung und nicht aus dem Bestand. Stichproben dieser Art gehören zur laufenden Prüfung.
Lohnt sich ein eigenes Modell im Haus?
Nur bei besonderen Anforderungen an den Verarbeitungsort oder bei sehr hohem Volumen. Für die meisten kleinen Unternehmen liegt der Aufwand für Betrieb und Aktualisierung über dem Nutzen.
Wer dieses Vorhaben angeht, entscheidet sich nicht für ein Werkzeug, sondern für eine dauerhafte Aufgabe. Der Test dafür ist einfach: Wenn niemand bereit ist, monatlich Zeit für die Pflege des Bestands einzuplanen, wird das Ergebnis in zwei Jahren schlechter sein als die Ablage, die es ersetzen sollte.




