// SCINEXX — SPAZIO & SCIENZA
KI rekonstruiert Lücken in jahrtausendealten griechischen Texten
Beschädigte Papyri und Inschriften lassen oft offen, wie viele Zeichen in einer Textlücke fehlen. Das neue Sprachmodell Apollo Restore ergänzt solche Passagen ohne vorgegebene Lückenlänge und übertraf in Tests frühere Systeme deutlich. Eine Blindstudie mit 20 Fachleuten zeigt zudem viele wissenschaftlich plausible Alternativen, allerdings liegen die Ergebnisse bisher nur als nicht begutachteter Preprint vor.
Wien (Österreich). In antiken Papyri und Inschriften fehlen häufig Buchstaben, Wörter oder ganze Passagen, weil das Schreibmaterial beschädigt ist. Fachleute rekonstruieren solche Lücken aus Grammatik, Wortschatz, Textgattung und historischem Kontext, doch gerade bei Papyri ist oft nicht einmal bekannt, wie lang die verlorene Passage war.
Genau diese Unsicherheit erschwert den Einsatz älterer Restaurationsmodelle, weil viele von ihnen die Zahl der fehlenden Zeichen als Vorgabe benötigen. Apollo Restore soll die Länge dagegen aus dem erhaltenen Text ableiten und anschließend mehrere mögliche Ergänzungen erzeugen, die Fachleute prüfen können.
Forscher von Mistral AI um Hope McGovern haben Apollo Restore aus einem Sprachmodell mit 24 Milliarden Parametern entwickelt und mit einem sogenannten Fill-in-the-Middle-Verfahren auf historischem Griechisch weitertrainiert. Dabei erhält das Modell den Text vor und nach einer Lücke und erzeugt den fehlenden Mittelteil. Die Untersuchung liegt bislang als nicht fachbegutachteter Preprint vor.
Das Training umfasste dokumentarische und literarische Papyri, Inschriften sowie ein großes Korpus gedruckter griechischer Texte, sodass insgesamt rund 600 Millionen Wörter zur Verfügung standen. Anders als frühere Systeme kann Apollo Restore ohne exakte Längenangabe arbeiten und bleibt laut den Tests auch dann vergleichsweise stabil, wenn eine vorgegebene Längenschätzung falsch ist.
Die Papyrologin Anna Dolganov vom Österreichischen Archäologischen Institut (ÖAI) fasst einen der Kurzlückentests so zusammen.
„Bei einem vorhandenen Originaltext auf Papyrus erreicht das Modell bei maskierten, also bewusst versteckten Passagen eine Trefferquote von rund 80 Prozent“, erklärt Anna Dolganov.
Hinter dieser gerundeten Zahl steht ein Test, bei dem die korrekte Ergänzung unter den 20 bestbewerteten Vorschlägen gesucht wurde. Bei Lücken von höchstens zehn Zeichen lag sie bei dokumentarischen Papyri in 80,6 Prozent, bei literarischen Papyri in 54,6 Prozent und bei Inschriften in 61,0 Prozent der Fälle unter diesen Vorschlägen.
Die Autoren weisen jedoch darauf hin, dass solche klassischen Tests stark von sehr kurzen und damit leichteren Lücken geprägt sind. Gewichten sie Längen von einem bis 20 Zeichen gleich, wächst der Vorsprung von Apollo Restore gegenüber den jeweils stärksten veröffentlichten Vergleichsmodellen. Bei dokumentarischen Papyri steigt der relative Abstand bei der Top-20-Metrik auf das 2,3-Fache, bei literarischen Papyri auf das 3,5-Fache und bei Inschriften auf das 1,6-Fache.
Für die praktische Arbeit ist besonders wichtig, dass das Modell nicht auf eine Zeichenanzahl angewiesen ist. Bei dokumentarischen Papyri erreichte Apollo Restore in der längengewichteten Top-1-Metrik ohne jeden Längenhinweis noch einen Wert von 0,332, während das stärkste Vergleichsmodell selbst mit exakter Längenangabe auf 0,155 kam.