// SMARTWORLD — INTELLIGENZA ARTIFICIALE
I documenti segreti di OpenAI e Microsoft: sapevano di distruggere il web e sono andati avanti
Ci sono momenti in cui i documenti interni di un'azienda tech dicono tutto quello che i comunicati stampa si guardano bene dal dire. È esattamente quello che sta succedendo con il caso legale del New York Times contro OpenAI e Microsoft: alcuni atti processuali da poco desecretati rivelano che entrambe le aziende erano perfettamente consapevoli dei danni che stavano causando al web e all'industria editoriale, e hanno deciso di andare avanti lo stesso.
Quello che emerge non è una semplice questione di copyright: è la storia di chi ha costruito un prodotto sapendo che avrebbe danneggiato i suoi stessi fornitori di contenuti.
Preferisci ascoltare il riassunto audio? Abbiamo scelto una voce realizzata con strumenti avanzati IA per rendere rendere i nostri testi subito accessibili a tutti
Partiamo dalla citazione più pesante. Un documento interno di Microsoft descriveva la strategia sui contenuti AI come l'avvio di un "doom loop", un circolo vizioso: "La nostra strategia sui contenuti AI ha avviato un 'doom loop' che danneggerà le prestazioni dei nostri modelli e dell'intero web allo stesso tempo: è altamente insolito che un prodotto finale minacci le fondamenta economiche dei suoi fornitori essenziali, ma questa è la situazione che abbiamo creato per il nostro business LLM rispetto alla sua 'catena di approvvigionamento di contenuti'." In pratica: stiamo costruendo qualcosa che distrugge la fonte da cui dipende per funzionare.
Microsoft ha cercato di prendere le distanze da queste parole, attribuendole a Brent Hecht, Direttore della Scienza Applicata, descritto come qualcuno con "punti di vista divergenti, accademici e futuristici" che non rappresenta la posizione ufficiale dell'azienda. Comodo, no? Peccato che il documento fosse interno e che il "doom loop" descritto si stia verificando esattamente come previsto: Google AI Overview ha già iniziato da tempo a spingere i link sempre più in basso, e il traffico di referral verso i siti editoriali è in caduta libera.
Lo stesso Hecht aveva definito la raccolta di dati per addestrare i modelli come il "più grande furto di lavoro nella storia dell'umanità", aggiungendo che la difesa di Microsoft faceva "una parodia completa dell'idea di fair use". Parole durissime, scritte da qualcuno che lavorava dentro quella stessa azienda.
Sul fronte OpenAI, le ammissioni non sono meno imbarazzanti. Il responsabile di ChatGPT Nick Turley è citato come convinto che, una volta ottenuta una risposta dal chatbot, non ci sia "nessun buon motivo per cliccare" sul link alla fonte originale.
OpenAI sapeva che il suo prodotto sostituiva il traffico verso i siti da cui aveva preso i contenuti per addestrarlo. Lo stesso Policy Director dell'azienda, Jack Clark, ammetteva di stare "creando sistemi che sostituiscono il lavoro delle persone che definiscono la 'cultura' della società".
Internamente, OpenAI era anche consapevole che GPT-4 riproduceva testi protetti da copyright quasi alla lettera. I dipendenti ammettevano che il modello "aveva memorizzato una tonnellata di dati e quindi sarebbe stato follemente bravo a rigurgitarli", pur riconoscendo che prevenire questa "memorizzazione" era importante per minimizzare le violazioni del copyright. Il documento del New York Times cita poi diversi esempi di ChatGPT che riproduce lunghi estratti di articoli da testate come Mercury News, Denver Post, LifeHacker ed Eurogamer.
Satya Nadella, CEO di Microsoft, aveva dichiarato pubblicamente che "qualsiasi contenuto dietro paywall dovrebbe essere concesso in licenza". Eppure un rappresentante di OpenAI ha ammesso in sede processuale di essere "all'oscuro" di qualsiasi sforzo per rilevare o rimuovere contenuti a pagamento dai dati di addestramento.