// SCINEXX — SPAZIO & SCIENZA
Quantenmathematik hilft KI, eigenes Nichtwissen besser zu erkennen
Selbstbewusst falsch: Große Sprachmodelle können überzeugende Antworten liefern, obwohl sie halluzinieren. Eine neue Methode bewertet deshalb nicht nur, wie stark sich mehrere Antworten inhaltlich unterscheiden, sondern auch, wie stabil die zugrunde liegenden Token-Wahrscheinlichkeiten sind. In 116 Tests trennte das Verfahren richtige und falsche Antworten zuverlässiger als mehrere Vergleichsmethoden, wurde bislang aber nur an kleineren offenen Modellen erprobt.
Coral Gables (U.S.A.). Sprachmodelle formulieren auch dann flüssige Antworten, wenn ihnen verlässliches Wissen fehlt. Solche Halluzinationen sind besonders tückisch, weil sprachliche Sicherheit und faktische Richtigkeit auseinanderfallen können. Für sensible Anwendungen reicht es deshalb nicht, nur die wahrscheinlichste Antwort zu kennen: Entscheidend wäre zusätzlich ein Warnsignal dafür, wann ein Modell seiner eigenen Ausgabe misstrauen sollte.
Ein verbreiteter Ansatz lässt ein Sprachmodell dieselbe Frage mehrfach beantworten und vergleicht anschließend die Bedeutung der Antworten. Weichen die erzeugten Aussagen stark voneinander ab, steigt die sogenannte semantische Entropie und damit der Verdacht auf eine Halluzination. Allerdings kann diese Kennzahl übersehen, wie instabil bereits die Wahrscheinlichkeiten sind, mit denen das Modell einzelne Wortfolgen erzeugt.
Forscher der University of Miami haben deshalb ein Verfahren entwickelt, das diese zweite Ebene einbezieht. Sie behandeln die Wahrscheinlichkeiten kompletter Token-Folgen mathematisch wie eine Wellenfunktion in einem Quantentensornetzwerk, also einem mathematischen Modell aus der Quantenphysik. Mit Störungstheorie prüfen sie, wie stark sich diese Wahrscheinlichkeiten bei kleinen Veränderungen verschieben. Große Änderungen stehen dabei für eine lokal instabile und damit unsicherere Modellentscheidung.
Mit einem Quantencomputer hat das nichts zu tun, denn das Team überträgt lediglich mathematische Werkzeuge der Quantenphysik auf die Unsicherheitsmessung. Anschließend werden semantisch gleichbedeutende Antworten zusammengefasst und ihre Wahrscheinlichkeiten so angepasst, dass die ermittelte Instabilität in die Entropiebewertung einfließt. Das resultierende Verfahren nennen die Forscher Semantic Rényi Entropy with UQ Maximization, kurz SRE-UQ.
Getestet wurde SRE-UQ auf vier Frage-Antwort-Datensätzen: TriviaQA, SQuAD 1.1, NQ-Open und SVAMP. Dabei kamen acht Varianten offener Sprachmodelle aus den Familien Mistral, Falcon und LLaMA zum Einsatz. Insgesamt wertete das Team 116 Versuchsszenarien aus und verglich seine Methode unter anderem mit naiver Entropie, klassischer semantischer Entropie, einem überwachten Regressionsverfahren und einer Methode, die das Modell selbst nach der Wahrscheinlichkeit einer richtigen Antwort fragt.
Über diese Szenarien hinweg erzielte SRE-UQ konsistente Verbesserungen bei zwei zentralen Kennzahlen. Die AUROC misst, wie gut sich richtige von falschen Antworten anhand eines Vertrauenswerts trennen lassen. Die AURAC bewertet, wie stark die Antwortgenauigkeit steigt, wenn besonders unsichere Ausgaben schrittweise verworfen werden. Bei beiden Maßen schnitt die neue Methode gegenüber den Vergleichsverfahren insgesamt besser ab und kam dabei ohne ein Nachtraining mit markierten richtigen und falschen Antworten aus.
Auch bei stärker komprimierten Modellen blieb die Rangfolge weitgehend stabil, als die Forscher 16-Bit-, 8-Bit- und 4-Bit-Versionen für speicher- und rechenarme Anwendungen testeten. Zwar sanken die absoluten AUROC-Werte bei stärkerer Quantisierung etwas, doch SRE-UQ übertraf oder erreichte die Vergleichsmethoden weiterhin über die untersuchten Präzisionsstufen hinweg.
Die Methode zeigt damit einen Weg, Unsicherheit genauer zu erfassen, verhindert Halluzinationen aber nicht selbst. Sie soll vielmehr erkennen, welche Antworten besonders prüfbedürftig sind. Zudem benötigt SRE-UQ Zugriff auf Wahrscheinlichkeiten einzelner Token-Folgen und lässt sich daher bei geschlossenen Spr