// SCINEXX — SPAZIO & SCIENZA
Warum scheitern KI-Bildmodelle oft am Erkennen einfacher Silhouetten?
Menschen können viele Alltagsobjekte noch erkennen, wenn nur ihre grobe Form erhalten bleibt. Bei mehr als 200 untersuchten tiefen neuronalen Netzen zeigte sich dagegen ein anderes Muster. Besonders schwach schnitten die Modelle ab, wenn allein die globale Form als Hinweis diente, während bild-text-trainierte Systeme insgesamt am ehesten menschlichen Entscheidungen ähnelten.
New York (U.S.A.). Moderne Bildmodelle erreichen bei der Objekterkennung in vielen Standardaufgaben hohe Trefferquoten. Daraus folgt jedoch nicht automatisch, dass sie dieselben visuellen Hinweise nutzen wie Menschen. Gerade bei veränderten oder unvollständigen Bildern kann dieselbe richtige Antwort auf sehr unterschiedlichen Erkennungsstrategien beruhen.
Für Menschen spielt dabei die Gesamtgestalt eines Gegenstands eine wichtige Rolle. Ein Objekt kann oft noch anhand seines Umrisses erkannt werden, obwohl typische Oberflächenmuster oder innere Details fehlen. Bei künstlichen neuronalen Netzen ist dagegen bislang offen, wie stark Form, Einzelteile und Textur jeweils zur Entscheidung beitragen.
Forscher der NYU Grossman School of Medicine um Biyu J. He haben diese Frage mit einem systematisch veränderten Bildsatz untersucht. Die Bilder trennten drei Hinweisarten voneinander: die globale Form, innere Bestandteile und die Oberflächentextur. Anschließend verglich das Team das Erkennungsverhalten von Menschen mit mehr als 200 tiefen neuronalen Netzen aus unterschiedlichen Architekturen und Trainingsverfahren.
Keines der getesteten Netze bildete das menschliche Muster der Hinweisnutzung vollständig nach. Das galt auch für Modelle mit rekurrenten Verbindungen oder spezialisierten Trainingsansätzen. Die Unterschiede betreffen damit nicht nur ein einzelnes Netz oder eine bestimmte Modellfamilie.
Am deutlichsten zeigte sich die Lücke, wenn die globale Form für die Erkennung entscheidend war. In dieser Bedingung schnitten sämtliche untersuchten Netze klar schlechter ab als Menschen. Der Befund bedeutet nicht, dass Menschen bei jeder Form der Objekterkennung grundsätzlich überlegen sind. Er zeigt vielmehr eine systematische Schwäche der getesteten Modelle beim Nutzen der Gesamtgestalt.
„Diese Ergebnisse zeigen, dass aktuelle Computervisionsmodelle nicht ganz menschenähnlich sind, obwohl sie mit einer riesigen Zahl von Bildern trainiert wurden, die Menschen aufgenommen haben“, sagt Biyu J. He.
Am stärksten an menschliches Verhalten angenähert waren feinabgestimmte Modelle, die mit zusammengehörigen Bildern und Texten kontrastiv trainiert worden waren. Dieser Vorteil hing nach den Autoren nicht von einer bestimmten Netzwerkarchitektur ab. Sobald die globale Form gestört wurde, verloren aber auch diese Modelle einen Teil ihrer Übereinstimmung mit dem menschlichen Erkennungsmuster.
Ein weiteres Ergebnis betrifft die Frage, wie sich menschenähnliches Sehen überhaupt beurteilen lässt. Die Übereinstimmung eines Modells mit neuronalen Messdaten aus dem ventralen visuellen Verarbeitungspfad sagte nicht voraus, wie ähnlich sein Erkennungsverhalten dem von Menschen war. Auch eine hohe allgemeine Modellleistung war nicht automatisch mit größerer Verhaltensähnlichkeit verbunden.
Damit liefert die Studie vor allem einen neuen Prüfrahmen für Computervision. Statt nur die Trefferquote auf gewöhnlichen Bildern zu vergleichen, lässt sich untersuchen, auf welche visuellen Hinweise ein Modell seine Entscheidung stützt. Das kann helfen, Systeme zu entwickeln, deren Fehlerprofile bei schwierigen Bildern besser verstanden werden.