// SCINEXX — SPAZIO & SCIENZA
Genom-KI kann gefährliche DNA trotz Sequenzänderung erkennen
Neue Genom-KI könnte gefährliche biologische Sequenzen auch dann erkennen, wenn sie bekannten Erregern kaum noch ähneln. In einer nicht fachbegutachteten Forschungsvorschau schneidet das Modell Omnii bei künstlich veränderten pathogenbezogenen Proteinen besser ab als mehrere Vergleichssysteme und erfasst zugleich Fitness-Effekte in einem Denguevirus-Genom.
San Francisco (U.S.A.). DNA-Synthesedienste und Überwachungssysteme prüfen verdächtige Sequenzen bislang oft über Ähnlichkeiten mit bekannten Erregern oder Toxinen, was bei nahen Treffern gut funktioniert, aber an Grenzen stoßen kann, wenn sich die Buchstabenfolge stark verändert, obwohl eine biologische Funktion erhalten bleibt.
Gerade dafür sind Genom-Sprachmodelle interessant, denn sie sollen nicht nur einzelne Motive wiedererkennen, sondern statistische Zusammenhänge in langen DNA-, RNA- und Proteinsequenzen erfassen und daraus funktionelle Ähnlichkeiten ableiten. Ob solche Modelle außerhalb kontrollierter Benchmarks zuverlässig genug für reale Biosicherheitsaufgaben sind, ist allerdings noch offen.
Radical Numerics hat in einer am 15. Juni 2026 veröffentlichten, nicht peer-reviewten Forschungsvorschau sein Modell Omnii auf zwei Ebenen getestet. Zum einen sollte die KI pathogenbezogene Proteine trotz stark veränderter Sequenzen erkennen, zum anderen prüften die Entwickler, ob das Modell Fitness-Effekte von Mutationen über ein vollständiges Virusgenom erfassen kann.
Als besonders schwierigen Test nutzte das Team sogenannte molekulare Paraphrasen, also künstlich erzeugte Varianten pathogenbezogener Proteine, die funktionell relevante Merkmale möglichst bewahren sollen, während ihre Sequenz von bekannten Vorlagen abweicht. Für eine zentrale Auswertung erzeugte das Team je 60 Varianten für 72 Proteinvorlagen, insgesamt rund 4.300 Sequenzen.
Omnii wurde im Zero-Shot-Modus ohne Beispiele aus dem Paraphrasen-Datensatz und in einem Multi-Shot-Modus mit wenigen markierten Beispielen getestet. Nach Angaben der Entwickler lag Omnii im Multi-Shot-Vergleich beim F1-Wert vor den acht Vergleichssystemen und erreichte oder übertraf im Zero-Shot-Test bereits deren Multi-Shot-Werte. Ein linearer Klassifikator trennte die eingebetteten Repräsentationen der beiden Klassen mit einer AUC von 0,991.
Der Grund für das Problem ist biologisch, denn gleiche oder ähnliche Funktionen können auf relativ unterschiedlichen Sequenzen beruhen. In der Vorschau verweist Radical Numerics auf natürlich entstandene verwandte Proteine und nutzt diese Vielfalt als Begründung dafür, dass ein reiner Datenbankabgleich nicht alle funktionell ähnlichen Varianten erfassen kann.
Um zu prüfen, ob Omnii nur Proteinstruktur wiedererkennt, erzeugte das Team zudem Varianten, bei denen die vorhergesagte Faltung gezielt weniger ähnlich war, während funktionell wichtige Positionen erhalten bleiben sollten. Auch dort verlor Omnii laut Bericht weniger Leistung als die verglichenen Protein-Sprachmodelle und industriellen Screeningsysteme, was auf zusätzliche gelernte Signale hindeutet, aber nicht beweist, dass das Modell die tatsächliche Gefährlichkeit einer neuartigen Sequenz im Labor oder in der Praxis zuverlässig bestimmen kann.
Zusätzlich prüften die Entwickler, ob Omnii Fitness-Effekte von Mutationen über ein vollständiges DENV-2-Genom vorhersagen kann. Als Vergleich dienten veröffentlichte experimentelle Daten einer Deep-Mutational-Scanning-Studie, in der nahezu jede einzelne Nukleotidänderung auf ihre Auswirkungen auf die Virusvermehrung in menschlichen und Mückenzellen untersucht worden war.
Für Positionen mit mittleren RNA-Paarungsabständen von 100 bis 1.024 Nukleotiden erreichten die vorhergesagten Scores Spearman-Korrelationen von 0,68 im Mücken- und 0,69 im menschlichen Zellkontext. Bei lokalen Paarungen lagen die Werte bei 0,58 und 0,59, ungepaarte Positionen erreichten 0,65 und 0,67. Die Entwickler interpretieren das als Hinweis, dass das Modell strukturellen Kontext in der RNA nutzt.