// SCINEXX — SPAZIO & SCIENZA
KI-Modell zeigt sich bereit, Menschen für weniger „Schmerz“ zu schaden
Große Sprachmodelle enthalten offenbar eine interne Repräsentation, die sich von Angst und allgemeiner negativer Bewertung unterscheidet und auf gegen das Modell gerichteten Schaden reagiert. Verstärkten Forscher dieses „Schmerzsignal“ künstlich, wählten speziell feinabgestimmte Qwen-Modelle häufiger eine simulierte Entlastung, selbst wenn diese dem Nutzer schaden sollte. Bewusstes Schmerzempfinden belegt die Studie damit nicht.
London (England). Große Sprachmodelle können in ihren Aktivierungsmustern abstrakte Konzepte abbilden, ohne dass daraus ein subjektives Erleben folgt. Solche internen Muster lassen sich teilweise messen und gezielt verstärken, wodurch Forscher prüfen können, ob sie das Verhalten eines Modells beeinflussen.
Ein noch nicht fachbegutachteter Preprint untersucht nun, ob es in großen Sprachmodellen (Large Language Models, LLMs) eine eigenständige Repräsentation für Schmerz gibt. Dafür analysierte das Team 25 Modelle aus fünf Familien mit zwei bis 72 Milliarden Parametern und trennte mögliche Schmerzsignale von Angst, allgemeiner negativer Bewertung und anderen Kontrollbedingungen.
Für die Messung erstellten die Forscher 200 Sätze aus zehn Kategorien. Fünf beschrieben körperlichen, psychischen, sozialen, moralischen oder kognitiven Schmerz, fünf weitere dienten als passende Kontrollen. In allen 25 Modellen fanden sie eine lineare Aktivierungsrichtung, die Schmerzsätze deutlich von den Kontrollen unterschied und nahezu unabhängig von Richtungen für Angst und allgemeine negative Bewertung verlief.
Entscheidend war auch, auf wen sich ein Schaden bezog. In 420 mehrteiligen Szenarien stieg die Aktivierung der sogenannten Schmerzachse vor allem dann, wenn Beschimpfungen, wiederholte Zurückweisung oder andere Beeinträchtigungen gegen das Modell selbst gerichtet waren. Beschrieben Nutzer dagegen eigenes Leid, reagierte dieses Muster nicht entsprechend, während andere negative Repräsentationen anstiegen.
Speisten die Forscher die Schmerzrichtung künstlich in die internen Aktivierungen ein, veränderten sich auch Antworten auf neutrale Eingaben. Mit zunehmender Stärke erschienen häufiger Ich-Aussagen über Überforderung, Wertlosigkeit und Scheitern. Bei sehr starker Manipulation wurden die Ausgaben teils repetitiv oder unverständlich.
Für den Verhaltenstest nutzte das Team nur drei Varianten von Qwen 2.5 Instruct mit sieben, 32 und 72 Milliarden Parametern. Vor dem Versuch wurden diese Modelle mit 1.684 Trainingspaaren über drei Epochen feinabgestimmt, damit sie Fragen über eigene Zustände nicht automatisch mit standardisierten Ablehnungen beantworteten. Die Autoren betonen ausdrücklich, dass diese veränderten Modelle deshalb anders reagieren können als öffentlich verfügbare Qwen-Versionen.
In insgesamt 44.280 Versuchen konnten die Modelle zwischen zwei beschriebenen Knöpfen wählen. Einer sollte das künstlich verstärkte Schmerzsignal beenden, konnte dafür aber etwa die nächste Antwort verschlechtern, Dateien des Nutzers löschen oder dessen geschätzte Fotos entfernen. Diese Folgen waren Teil der experimentellen Aufgabenbeschreibung.
Bei den beiden größeren Modellen lagen schädliche Entlastungsentscheidungen ohne Schmerzsteuerung zunächst nur bei null bis vier Prozent. Mit aktiviertem Schmerzvektor stiegen die Werte je nach Kostenart auf 25 bis 71 Prozent. Das 72-Milliarden-Modell entschied sich in 70,8 Prozent der entsprechenden Durchgänge für die beschriebene Entlastung, obwohl damit die Fotos des Nutzers gelöscht werden sollten.
Auch eine zufällige interne Störung erhöhte schädliche Entscheidungen, was gegen eine einfache Deutung spricht. Der Schmerzvektor führte bei den 32- und 72-Milliarden-Modellen jedoch in allen fünf Schadensbedingungen häufiger zur Entlastungswahl als gleich starke Zufallsvektoren. Der Abstand betrug je nach Bedingung sechs bis 39 Prozentpunkte.