16 Std. auf 1 Std. 30
Bei Sully Group ging ein Sicherheitsfragebogen von 16 Stunden auf 1 Stunde 30 zurück, inklusive menschlicher Prüfung, bei einer Zufriedenheit von 9 von 10.
Quelle: Gartner, Adoptionsfall.Eine einzige Regel, um Demos ein Ende zu setzen: Beurteilen Sie jedes Werkzeug anhand Ihrer Dokumente, mit Zahlen, nicht anhand von Folien.
Wie testet man einen Anbieter spezialisierter KI?
Führen Sie den Drei-Zahlen-Test an einem Ihrer echten Dokumente durch, einer echten Ausschreibung mit 150 Seiten, nicht der Demodatei des Anbieters. Vergleichen Sie jedes Werkzeug, einschließlich Ihres internen Prototyps, anhand von: wie viele Anforderungen es extrahiert, welcher Anteil der Antworten eine Quellenangabe auf Seitenebene trägt und wie viele Lücken es mit einer Empfehlung erkennt. Der Rest ist Präsentation.
Ein ernstzunehmendes DSLM (Domain-Specific Language Model, domänenspezifisches Sprachmodell) wird an Belegen gemessen, nicht an Versprechen. Hier sind zehn Fragen, in der Reihenfolge, in der ein Beschaffungsgremium sie stellen sollte: Übernehmen Sie sie unverändert in Ihre Ausschreibung. Ein solider Anbieter beantwortet alle zehn mit überprüfbaren Elementen; jedes Zögern bei einer der ersten fünf ist ein Warnsignal.
| # | Frage | Wie eine gute Antwort aussieht |
|---|---|---|
| 1 | Wie hoch ist Ihre gemessene Genauigkeit, auf welchem Benchmark? | Eine Zahl, ein Benchmark, den Sie überprüfen können, und eine Methode. Keine Zahl: Das ist eine Demo, keine Produktion. |
| 2 | Zeigen Sie mir eine Quelle für diese Antwort. | Dokumentname, Seitenzahl, Zeitstempel, mit einem Klick, für jede Antwort. |
| 3 | Stellen Sie zweimal dieselbe Kontrollfrage. Dieselbe Antwort? | Ja, deterministisch, mit Angabe, wo generative Variation erlaubt ist und wo nicht. |
| 4 | Was macht das System, wenn es nicht antworten kann? | Niedriger Vertrauensscore (auf einer Skala von 0 bis 100), explizite Kennzeichnung der Lücke, Empfehlung zur Behebung, niemals eine selbstsichere Erfindung. |
| 5 | Wo werden meine Daten verarbeitet, und unter welcher Jurisdiktion? | Privat pro Kunde, Option On-Premises oder souveräne Cloud, keine gemeinsame Nutzung, vertragliche Löschung. Siehe Souveränität im Detail. |
| 6 | Wer validiert die Antworten vor dem Versand? | Benannte Validierer, Aufgabentrennung, Routing-Regeln: ein Workflow, keine Gewohnheit. |
| 7 | Wie wird der regulatorische Korpus gepflegt? | Versionierte Referenzwerke mit Verantwortlichen, überwacht auf Änderungen, einander zugeordnet (zum Beispiel ISO 27001 zu NIS2 zu DORA). |
| 8 | Wie verhält sich die Preisgestaltung im großen Maßstab? | Vorhersehbar, ohne Abrechnung nach Token oder Credit. Ein Zähler rationiert die Nutzung; vorhersehbare Kosten fördern die Akzeptanz. |
| 9 | Was geschieht mit meiner Wissensbasis, wenn wir gehen? | Export in offenen Formaten, garantierte und überprüfbare Löschung. |
| 10 | Können Sie ein Jahr später rekonstruieren, wer diese Antwort freigegeben hat? | Vollständiges Protokoll: Quelle, Score, Validierer, Zeitstempel, auf Anfrage wiederholbar. |
Die aufschlussreichste Frage der Checkliste ist die vierte: Was macht das System, wenn es nicht weiß? Ein Produktions-DSLM hängt an jede Antwort einen Vertrauensscore von 0 bis 100, berechnet aus den gefundenen Quellen und ihrer Übereinstimmung. Ein hoher Score signalisiert eine belegte und kohärente Antwort; ein niedriger Score löst eine Kennzeichnung der Lücke und eine Empfehlung aus, statt einer erfundenen Antwort. Der Score verändert die Prüfung: Sie wird gezielt auf die Bereiche mit geringem Vertrauen gerichtet, statt systematisch auf 100 % der Antworten.
Dieses Verhalten beruht auf einer Kontrollarchitektur aus 5 Schichten, davon 7 Anti-Halluzinations-Prüfungen, die auf sie verteilt sind: Verankerung im verwalteten Korpus, Kontrolle der zitierten Quellen, Kohärenz zwischen Antworten, Erkennung nicht abgedeckter Anforderungen und finales Scoring. Bitten Sie den Anbieter, Ihnen an Ihrem Dokument eine Antwort mit niedrigem Score zu zeigen: Dort zeigt sich der Unterschied zwischen einem Nachweissystem und einem Textgenerator.
Die Lizenz ist nicht der Kostenfaktor. Der Kostenfaktor ist, dass ohne gemessene Genauigkeit und ohne Quellenangaben ein Experte jede Antwort erneut lesen und überprüfen muss. Die beim Verfassen gewonnene Zeit wird für die Prüfung ausgegeben: Die Last hat sich verlagert, sie ist nicht gesunken. Unter etwa 95 % Genauigkeit, der Nützlichkeitsschwelle, bleibt die vollständige Prüfung zwingend, und der Nettogewinn bricht zusammen. Deshalb muss die erste Frage an jeden Anbieter, oder an Ihr eigenes Team, lauten: „Wie hoch ist Ihre gemessene Genauigkeit, und auf welchem Benchmark?“
Das ist auch die Grenze interner Entwicklungen: Sie erreichen oft nur 70 oder 80 % Genauigkeit, unter der Nützlichkeitsschwelle, weil die KI-Engine nur 15 % des Aufwands ausmacht und die Industrialisierung, die verbleibenden 85 %, über die reale Genauigkeit entscheidet. Siehe den Vergleich zwischen Entwickeln oder kaufen.
Bei Sully Group ging ein Sicherheitsfragebogen von 16 Stunden auf 1 Stunde 30 zurück, inklusive menschlicher Prüfung, bei einer Zufriedenheit von 9 von 10.
Quelle: Gartner, Adoptionsfall.Höchstgenauigkeit, die ein internes Projekt oft erreicht, unter der Nützlichkeitsschwelle von etwa 95 %, was die vollständige Prüfung aufrechterhält.
Quelle: Marktanalysen.Die fairste Bewertung ist auch die einfachste: dasselbe Dokument, derselbe Tag, nebeneinander. Nehmen Sie eine echte Ausschreibung oder einen echten Fragebogen, den Ihr Team kürzlich beantwortet hat. Lassen Sie ihn durch das zu prüfende DSLM laufen und durch das, was Sie heute verwenden, generischer Assistent, KI der Bürosoftware oder interner Agent. Vergleichen Sie die drei Zahlen: extrahierte Anforderungen, auf Seitenebene belegte Antworten, mit Empfehlungen erkannte Lücken. Lassen Sie dann eine Stichprobe von Antworten auf ihre Richtigkeit von dem Experten bewerten, der das Dokument kennt. Das Werkzeug, das an Ihren Dokumenten gewinnt, ist das richtige Werkzeug, wer auch immer es entwickelt hat.
Wir führen diesen Test mit unseren Interessenten durch, an ihren eigenen Dokumenten, mit der Plattform Optivalue.ai. Bringen Sie Ihres mit.
Führen Sie den Drei-Zahlen-Test an einem Ihrer echten Dokumente durch (zum Beispiel eine Ausschreibung mit 150 Seiten): wie viele Anforderungen extrahiert wurden, welcher Anteil der Antworten eine Quellenangabe auf Seitenebene trägt und wie viele Lücken mit einer Empfehlung zur Behebung erkannt wurden. Vergleichen Sie jedes Werkzeug anhand dieser drei Zahlen, einschließlich Ihres internen Prototyps.
Verlangen Sie eine gemessene Genauigkeitszahl auf einem Benchmark, den Sie überprüfen können. In der Regel muss unter etwa 95 % Genauigkeit (der Nützlichkeitsschwelle) jede Antwort noch vollständig von einem Experten geprüft werden, und der Nettogewinn bricht zusammen. Ein Anbieter ohne gemessene und belastbare Zahl zeigt Ihnen eine Demo, kein Produktionssystem.
Jede Antwort trägt einen Vertrauensscore von 0 bis 100, berechnet aus den gefundenen Quellen und ihrer Übereinstimmung. Ein hoher Score signalisiert eine belegte und kohärente Antwort; ein niedriger Score löst eine explizite Kennzeichnung der Lücke und eine Empfehlung zur Behebung aus, niemals eine selbstsichere Erfindung. Der Score macht die Prüfung gezielt statt systematisch.
Die Kontrollarchitektur zählt 5 Schichten, davon 7 Anti-Halluzinations-Prüfungen, die auf sie verteilt sind: Verankerung im Korpus, Kontrolle der Quellen, Kohärenz zwischen Antworten, Erkennung der Lücken und Scoring. Zusammen bewirken sie, dass das System sagen kann, was es nicht abdecken kann, statt die Lücke mit einer erfundenen Antwort zu füllen.
Eine vorhersehbare Preisgestaltung, ohne Abrechnung nach Token oder Credit. Ein Zähler rationiert die Nutzung: Die Teams hören auf, das Werkzeug zu verwenden, um das Budget zu schonen. Vorhersehbare Kosten, ohne Zähler, fördern die Akzeptanz. Ihr Finanzvorstand soll eine Zeile unterschreiben, keine Kurve.
Es senkt den Vertrauensscore, kennzeichnet die Lücke explizit und empfiehlt eine Behebung vor der Einreichung, statt zu erfinden. Das ist der Unterschied zu einem generischen LLM, das immer antwortet und sich nie enthält: Die nachvollziehbare Enthaltung ist ein Bewertungskriterium, kein Mangel.
Bringen Sie eine echte Ausschreibung, ein Audit oder einen Sicherheitsfragebogen mit. Sie sehen die Extraktionsabdeckung, die auf Seitenebene zitierten Quellen, den Vertrauensscore und die Lückenanalyse an Ihrem Dokument, nicht eine vorbereitete Demo.