KI im eigenen Haus, in einer Definition.
Ein KI-System läuft im eigenen Haus, wenn Modell, Daten und Betrieb innerhalb der eigenen Infrastruktur oder einer benannten Zone liegen und keine Anfrage an einen fremden Dienst geht. Alles andere ist eine Schnittstelle.
Was Modelldrift ist
Ihr KI System war beim Start gut. Einige Monate später beschweren sich die ersten Nutzer. Am Code hat niemand etwas geändert. Das Phänomen hat einen Namen: Modelldrift.
Ein KI Modell lernt aus Daten eines bestimmten Zeitraums. Es bildet die Zusammenhänge ab, die in diesen Daten stecken. Sobald sich die Welt verändert, in der das Modell arbeitet, passen diese Zusammenhänge nicht mehr vollständig. Das Modell bleibt gleich, die Daten nicht.
In der Fachliteratur werden zwei Formen unterschieden:
Bei Sprachmodellen, die über eine Cloud Schnittstelle genutzt werden, kommt ein verwandter Effekt hinzu: Der Anbieter tauscht die Modellversion aus, und das Verhalten ändert sich, ohne dass Sie etwas getan haben. Streng genommen ist das keine Drift, die Wirkung ist für Ihre Nutzer jedoch dieselbe.
Wie sich Drift im Alltag zeigt
Drift kommt selten auf einen Schlag. Sie ist ein langsamer Verlust, den niemand bemerkt, bis das Vertrauen weg ist. Gerade das macht sie tückisch: Einzelne falsche Ergebnisse gelten zunächst als Ausreißer, bis sich die Fachabteilung angewöhnt hat, jedes Ergebnis selbst nachzuprüfen. Ab diesem Punkt ist der Nutzen des Systems weitgehend verloren, obwohl es technisch einwandfrei läuft.
Bei einer Bedarfsprognose zeigt sich Drift als wachsende Abweichung zwischen Prognose und tatsächlichem Absatz. Der wirtschaftliche Effekt ist erheblich: Gut eingestellte Bedarfsprognosen senken Bestände typischerweise um 10 bis 50 %. Schneider Electric hat den Bestand um 10 % gesenkt, Unilever hat am Standort Hefei die Prognosegüte um 39 % verbessert. Diese Effekte halten nur, solange das Modell zur aktuellen Lage passt. Driftet es, steigen Sicherheitsbestände und gebundenes Kapital schleichend wieder an.
Bei einem Sprachmodell mit Wissensbasis zeigt sich Drift in Antworten, die zunehmend an der Realität vorbeigehen: veraltete Preise, abgelöste Prozessbeschreibungen, Produkte, die es nicht mehr gibt.
Bei KI Agenten zeigt sie sich in Abläufen, die an Schnittstellen scheitern, weil sich Felder oder Statuswerte in ERP oder CRM geändert haben.
Ursachen und Gegenmaßnahmen
| Ursache | Woran Sie es erkennen | Gegenmaßnahme |
|---|---|---|
| Neue Produkte, Preise oder Prozesse | Antworten oder Prognosen beziehen sich auf veraltete Stände | Wissensbasis laufend aktualisieren, Änderungen im Stammdatenprozess als Auslöser für eine Prüfung definieren |
| Verändertes Kundenverhalten, etwa durch Saison oder Krise | Systematische Abweichung in eine Richtung, nicht nur Streuung | Saisonalität im Modell abbilden, Nachtraining nach festen Intervallen und nach Sonderereignissen |
| Neue Fachbegriffe, Formulare oder Dokumentvorlagen | Steigende Quote nicht erkannter oder falsch zugeordneter Dokumente | Testfälle um neue Vorlagen ergänzen, Fachabteilung meldet neue Formate aktiv |
| Änderungen in vorgelagerten Systemen wie ERP oder CRM | Fehlende oder anders befüllte Felder, Abbrüche in Abläufen | Schnittstellen überwachen, Änderungen an Quellsystemen mit dem KI Betrieb abstimmen |
| Versionswechsel des Modells beim Anbieter | Verhalten ändert sich ohne eigene Änderung | Modellversion festschreiben, neue Versionen vor dem Einspielen gegen den Referenzwert testen |
Die häufigsten Ursachen lassen sich gut eingrenzen. Für jede gibt es eine passende Gegenmaßnahme.
Drift messen: Referenzwert, Schwellen, Alarm
Drift lässt sich nur erkennen, wenn klar ist, wie gut das System am Anfang war. Deshalb steht am Beginn jedes Projekts ein Referenzwert: eine Zielgröße, die das Geschäft versteht, gemessen über einen sinnvollen Zeitraum. Bei einer Bedarfsprognose ist das die Abweichung zwischen Prognose und Absatz bei gleichem Servicegrad, bei einem Sprachmodell die Trefferquote auf einem festen Satz von Testfragen.
Auf dieser Basis wird die Qualität laufend gemessen. Drei Messwege ergänzen sich:
Für jede Messgröße definieren Sie Schwellen. Eine Warnschwelle löst eine Prüfung aus, eine Alarmschwelle eine Entscheidung. Wo diese Schwellen liegen, hängt vom Anwendungsfall ab und wird gemeinsam mit der Fachabteilung festgelegt.
Wichtig ist, dass die Ergebnisse der Messung bei den richtigen Personen ankommen. Ein Bericht, den nur das Entwicklungsteam versteht, hilft der Fachabteilung nicht. Gute Berichte zeigen die Entwicklung der Qualität über die Zeit, markieren Abweichungen vom Referenzwert und benennen, welche Maßnahme ergriffen wurde. So bleibt nachvollziehbar, warum ein System weiterläuft oder angepasst wird.
Nachtraining als Prozess, nicht als Notfall
Nachtraining sollte ein geplanter Vorgang sein und nicht die hektische Reaktion auf eine Beschwerde. Je nach System bedeutet Nachtraining Unterschiedliches: die Wissensbasis aktualisieren, Prompts und Regeln anpassen, ein Feintuning mit neuen Beispielen wiederholen oder ein Prognosemodell auf aktuellen Daten neu trainieren.
Vier Regeln machen den Prozess verlässlich. Nachtraining wird nach festen Intervallen und zusätzlich bei Überschreiten einer Schwelle ausgelöst. Jede neue Version wird vor dem Einspielen gegen den Referenzwert getestet. Es gibt immer einen Weg zurück zur letzten funktionierenden Version. Eine benannte Person entscheidet, ob ein Modell weiterläuft, nachtrainiert oder abgeschaltet wird.
Auch Datenschutz und Dokumentation gehören dazu. Wer mit neuen Daten nachtrainiert, sollte festhalten, welche Daten verwendet wurden, auf welcher Rechtsgrundlage und mit welcher Freigabe. Diese Dokumentation macht Änderungen am Modell prüfbar, für Ihre IT ebenso wie für Ihren Datenschutz.
Warum Überwachung zum Betrieb gehört
Viele KI Projekte enden mit einer Übergabe. Die Überwachung der Qualität fällt dabei oft zwischen die Stühle: Das Projektteam ist weitergezogen, die IT überwacht Server, nicht Antworten. Für den Betrieb setzen wir 99,9 % Verfügbarkeit als Ziel. Verfügbarkeit allein sagt jedoch nichts über Qualität. Ein System kann erreichbar sein und trotzdem falsche Ergebnisse liefern.
Deshalb gehört die Überwachung von Qualität bei uns zum Betrieb und nicht zum Projekt. Wie Qualität, Nachtraining und Zuständigkeiten vertraglich geregelt werden, beschreiben wir unter Service Level.
Ein KI Modell altert nicht. Die Welt um es herum schon.
Häufige Fragen
Quellen
- NexPatch AI: Glossar Bedarfsprognose, nexpatch.ai/de/blog/bedarfsprognose (Bestandssenkung typisch 10 bis 50 %, Schneider Electric minus 10 % Bestand, Unilever Hefei plus 39 % Prognosegüte).