// SCINEXX — SPAZIO & SCIENZA
KI-Chatbots sollen einen Lügendetektor erhalten
Was weiß ein Chatbot wirklich? Forscher wollen nicht nur seine Antworten prüfen, sondern direkt in die internen Rechenprozesse großer KI-Modelle schauen. Ein neues internationales Konsortium will Methoden entwickeln, die Täuschung, versteckte Ziele und Halluzinationen anhand von Mustern im neuronalen Netz aufspüren sollen.
Boston (U.S.A.). Moderne KI-Chatbots können Texte verfassen, Fragen beantworten und in sensiblen Bereichen wie Medizin oder Finanzen beraten. Wie ihre neuronalen Netze intern zu einer Antwort gelangen, ist jedoch oft schwer nachzuvollziehen. Denn anders als klassische Software werden große Sprachmodelle trainiert statt Schritt für Schritt programmiert.
Das wird zum Sicherheitsproblem, wenn eine plausibel klingende Antwort falsch oder gezielt irreführend ist. Eine reine Kontrolle des ausgegebenen Textes verrät dann nicht unbedingt, welche Informationen das Modell intern verarbeitet. Genau diese Lücke will ein neues Forschungsbündnis systematischer untersuchen.
Forscher der Northeastern University um David Bau bauen dafür das International Consortium for Interpretable AI (ICINAi) auf. Mehr als 40 KI-Experten aus verschiedenen Ländern sollen Modelle, Prüfmethoden und Rechenressourcen teilen. Ziel ist eine gemeinsame wissenschaftliche Grundlage für die Interpretierbarkeit von KI, also für Methoden, die interne Rechenprozesse messbar und nachvollziehbar machen.
„Wenn wir diese Systeme nutzen, wissen wir nicht, wie ihre Algorithmen beschaffen sind“, sagt David Bau.
Ein wichtiges Werkzeug ist das National Deep Inference Fabric (NDIF), eine von der U.S. National Science Foundation (NSF) mit neun Millionen US-Dollar geförderte Forschungsinfrastruktur. Sie gibt Wissenschaftlern Fernzugriff auf große offene KI-Modelle und auf deren interne Berechnungen. Die Software NNsight kann Aktivierungen einzelner Schichten auslesen und verändern, sodass Forscher Hypothesen über Ursache und Wirkung im Modell testen können.
„Es ist ein gemeinsames System, mit dem wir die größten KI-Systeme unter das Mikroskop legen“, sagt Bau.
Der geplante „Lügendetektor“ soll deshalb mehr leisten als ein Faktencheck am Ende der Antwort. Die Forscher suchen nach internen Aktivitätsmustern, die auf einen Widerspruch zwischen internen Zuständen und ausgegebener Antwort hindeuten könnten. ICINAi nennt neben Täuschung ausdrücklich auch versteckte Ziele, Zensur, Halluzinationen und sogenanntes Reward Hacking, bei dem ein System ein Bewertungsschema ausnutzt, ohne die eigentlich beabsichtigte Aufgabe zuverlässig zu erfüllen.
Solche Verfahren befinden sich noch in einem frühen Forschungsstadium. Das Konsortium beschreibt die Interpretierbarkeitsforschung selbst als junges Feld, in dem gemeinsame Definitionen, Methoden und Standards für belastbare Evidenz fehlen. Ein fertiges Warnsystem, das Nutzer im Chatfenster zuverlässig vor einer Lüge warnt, gibt es daher nicht.
Die technische Infrastruktur wird jedoch bereits erprobt. Im Sommer 2026 nutzten nach Angaben der Northeastern University mehr als 50 Forscher NDIF bei Aletheia’s Quest, einem Wettbewerb zur Erkennung von KI-Lügen. Die Teilnehmer konnten dort mit Blackbox- und Whitebox-Zugriff arbeiten, also sowohl Ein- und Ausgaben als auch interne Modellaktivitäten auswerten.