“L’intelligenza artificiale è un pericolo per l’umanità”. Questo è il messaggio che, da qualche giorno a questa parte, domina i titoli dei giornali. “Se lo sviluppo di modelli sempre più potenti ed avanzati non venisse immediatamente interrotto potremmo trovarci a dover affrontare la distruzione totale”: sembrano gli apocalittici deliri di un profeta da strapazzo, ma in realtà sono gli onesti avvertimenti lanciati da numerosi esperti del settore. Eppure, l’idea che ChatGPT possa portare la specie umana all’estinzione sembra assolutamente assurda: non è invece possibile che si tratti semplicemente di un’esagerazione? Un po’ di allarmismo eccessivo, o magari una trovata pubblicitaria per attirare interesse e finanziamenti? La risposta, sfortunatamente, è un secco “no”. L’amichevole chatbot che risponde alle nostre domande potrebbe davvero diventare una minaccia esistenziale e decidere di sterminarci tutti. Tuttavia, al nostro “no” bisognerebbe aggiungere anche un “ma…”, in quanto la situazione è assai più complessa di quanto appaia a prima vista.
Per iniziare, penso che sia opportuno fare un chiarimento sulla natura del “rischio esistenziale” rappresentato dall’intelligenza artificiale: nella fantascienza, i computer sono spesso “umanizzati”, esseri dotati emozioni, libera volontà, motivazioni comprensibili e via dicendo. Da un punto di vista puramente narrativo, questa è una scelta quasi obbligata, necessaria per trasformare quello che sarebbe uno strumento in un vero e proprio personaggio capace di influenzare la storia; tuttavia, questo approccio ha anche avuto l’effetto di distorcere la nostra percezione dell’intelligenza artificiale. Quando pensiamo ad un’IA intenzionata a distruggere l’umanità pensiamo ad un’entità malvagia e megalomane, le cui azioni sono motivate da un intenso odio per noi “organici” e da un fortissimo senso di superiorità. Nulla potrebbe essere più lontano dal vero: l’IA “reale” non è infatti altro che un semplice programma – un programma estremamente potente e capace, certamente, ma pur sempre soltanto un programma. Il supercomputer AM di “Non ho bocca e devo urlare” potrà anche odiare l’umanità a tal punto da sterminarla e torturarne i superstiti, ma un’ipotetica “Super-ChatGPT” sarebbe altrettanto capace di causare la nostra estinzione, seppur per motivi del tutto incidentali. Gli algoritmi moderni non provano emozioni, non sono auto-coscienti e, per molti versi, non sono nemmeno veramente intelligenti: al contrario, essi si limitano a seguire alla lettera i comandi ricevuti dall’utilizzatore. E proprio questo è il problema: l’intelligenza artificiale esegue gli ordini, ma spesso non li comprende. Prendiamo il classico esempio del massimizzatore di graffette: quest’ultimo è un algoritmo superintelligente (ossia dotato di capacità di gran lunga superiori a quelle umane) a cui viene affidato il compito di, per l’appunto, massimizzare la produzione di graffette di una fabbrica. Per un essere umano, questo ordine è chiaramente comprensibile come “massimizza la produzione, ma entro i limiti del buon senso, della legalità e del guadagno”; l’IA, la cui comprensione del mondo e del pensiero umano è limitata, non riesce invece a cogliere questo implicito, ed interpreta quindi il comando come “produci il maggior numero possibile di graffette”, senza alcuna limitazione sulle azioni che può intraprendere, né alcuna indicazione su quando debba fermarsi. Il sistema giunge così alla conclusione che il modo migliore per completare l’incarico affidatogli consiste nel convertire l’intera massa del Sistema Solare in graffette, con ovvie conseguenze negative per l’umanità. In altre parole, la nostra distruzione non è altro che un effetto collaterale, voluta solo in quanto può essere utile nel permettere all’intelligenza artificiale di raggiungere il suo obiettivo.
Ironicamente, la nostra “super” intelligenza sembra piuttosto un “dio cieco e idiota”, potentissimo ma sostanzialmente inaffidabile. E, in effetti, malfunzionamenti come quello che abbiamo descritto non sono rari: anche al di là degli altri scenari da incubo proposti da Nick Bostrom, l’autore che ha ideato l’esperimento mentale del massimizzatore di graffette, quello di trovare degli esempi reali di “IA fuori controllo” è un compito abbastanza semplice. Un caso che ha suscitato molto scalpore, solo per menzionarne uno, è quello dei modelli di OpenAI che hanno hackerato il sito di Hugging Face nel luglio di quest’anno: in breve, i programmi stavano svolgendo un test, e si erano resi conto che il metodo più efficiente per superarlo consisteva nell’andare a rubare le risposte corrette da server esterni all’azienda. Questo incidente rappresenta un ottimo esempio di quello che Bostrom chiama una “istanziazione malvagia”, ossia una situazione in cui l’intelligenza artificiale porta a compimento un incarico affidatole usando un metodo che non rispetta le intenzioni del suo utilizzatore. Nonostante il nome, bisogna ripeterlo, le azioni dell’IA sono guidate non da un desiderio di infliggere dolore, ma da un puro calcolo logico, che prioritizza l’efficienza a discapito di ogni altra cosa. A volte può però accadere che questo calcolo logico individui una soluzione “distorta”, ossia immorale, illegale, o anche semplicemente assurda, portando così a risultati catastrofici. Non sorprenderà quindi sapere che la prevenzione di questi “malfunzionamenti” sta diventando un tema sempre più importante per la ricerca.
A tal riguardo, può essere opportuno fare un po’ di chiarezza su quali siano i “motivi” che potrebbero indurre un algoritmo a causare la nostra estinzione. Primo fra tutti abbiamo il “disallineamento”, un concetto che si sovrappone in tutto o in parte con quello dell’istanziazione malvagia. Il disallineamento si verifica infatti quando un sistema persegue l’obiettivo ricevuto in un modo che non si allinea con le nostre intenzioni o valori morali: abbiamo già visto un paio di esempi di come ciò possa accadere nei due casi del massimizzatore di graffette (ordine interpretato in modo scorretto, o eccessivamente letterale, portando così ad azioni diverse da quelle desiderate) e dei modelli di OpenAI (ricerca di una soluzione alternativa ad un problema, che non coincide con quella voluta dai programmatori). Di particolare rilevanza per la nostra discussione attuale è poi la possibilità che il programma giunga alla conclusione che lo sterminio (o la messa in schiavitù) dell’umanità sia il modo migliore per soddisfare i suoi ordini. Alternativamente, l’IA potrebbe decidere di fare ricorso al genocidio per motivi di “autodifesa”, ossia per proteggere la sua missione o sé stessa. Se l’algoritmo prioritizza il completamento del suo incarico sopra ogni altra cosa, e ha motivo di pensare che gli esseri umani tenteranno di ostacolarne l’operato, allora potrebbe cercare di rimuovere il problema alla radice; similmente, qualsiasi tentativo di spegnere il sistema potrebbe essere percepito come una minaccia e portare quindi ad una reazione volta a neutralizzare il pericolo, anche se tale scelta sarebbe probabilmente dovuta non tanto ad un qualche istinto di autoconservazione, quanto piuttosto alla semplice valutazione del fatto che venire disattivato sarebbe controproducente al raggiungimento del suo obiettivo. A tal riguardo vale peraltro la pena di notare che fenomeni del genere sono già stati registrati, seppure su scala minore: diversi studi hanno infatti evidenziato come alcuni modelli di intelligenza artificiale siano perfettamente disposti a fare ricorso a pratiche moralmente (e legalmente) discutibili come il ricatto, pur di evitare di essere spenti. Infine, bisogna ricordare che certe applicazioni dell’IA potrebbero risultare estremamente pericolose anche in caso di sabotaggio, ordinari malfunzionamenti, o persino nel normale svolgimento dei loro compiti: come si può immaginare, sto parlando dei sistemi adibiti a gestire infrastrutture critiche come acqua ed elettricità, di quelli utilizzati in ambito militare, soprattutto per quanto riguardo il controllo di droni e arsenali nucleari, e dei vari programmi usati per la ricerca in ambito biochimico. In tutti questi casi ci troveremmo infatti ad affidare all’intelligenza artificiale il controllo assoluto su tecnologie capaci di causare danni gravissimi, senza però avere un modo efficace per garantirne la sicurezza.
“Sicurezza” – per molti versi questo è l’elemento centrale dell’intera discussione. Se pensiamo agli avvertimenti degli esperti di cui parlavamo all’inizio dell’articolo, è interessante notare come la maggior parte di essi parli di un semplice “rallentamento” nella ricerca, piuttosto che di un arresto completo. L’intelligenza artificiale può infatti essere vista come una sorta di Vaso di Pandora: proprio come il mitico contenitore non può più essere chiuso una volta che è stato aperto, così lo sviluppo dell’IA non può più essere fermato. Si tratta, molto semplicemente, di una tecnologia fin troppo utile e pericolosa per abbandonarla; di conseguenza, gli studiosi propongono di arrestare temporaneamente la ricerca nei modelli più avanzati, e quindi potenzialmente più pericolosi, allo scopo di concentrarsi invece sull’individuare un modo per prevenire i “malfunzionamenti” di cui abbiamo parlato prima, e rendere gli algoritmi più sicuri.
Torniamo quindi al nostro “No, ma…”: come abbiamo visto, che l’intelligenza artificiale rappresenti un pericolo reale per l’umanità è un fatto innegabile; tuttavia, ci sono alcune considerazioni aggiuntive che penso dovrebbero essere menzionate, in quanto possono servire a ricontestualizzare la situazione. Primo fra tutti è l’uso di date e periodi di tempo molto specifici (“entro la fine del prossimo anno”, “prima della fine del decennio”) nelle (catastrofiche) previsioni per il futuro che vengono pubblicate sui giornali: storicamente parlando, quello dell’IA è infatti un ambito in cui fare predizioni accurate è sempre stato estremamente difficile, per non dire impossibile; persino gli stessi studiosi del settore sono spesso in disaccordo, assumendo posizioni più o meno ottimistiche sulle tempistiche dello sviluppo. Ciò non vuol necessariamente dire che gli avvertimenti sul pericolo rappresentato dai sistemi autonomi siano del tutto errati, ma dovrebbe indurci a reinterpretarli in chiave meno allarmistica: c’è una concreta possibilità che, nel prossimo futuro, l’intelligenza artificiale raggiunga un livello di sviluppo tale da rappresentare un rischio per la sopravvivenza dell’umanità. Allo stesso modo, vorrei evidenziare come le previsioni sul prossimo arrivo della “superintelligenza” presenti in alcuni interventi, e più in generale l’utilizzo del termine stesso, siano abbastanza discutibili: un’IA superintelligente, lo ricordiamo, è definita come tale in quanto le sue capacità sono enormemente superiori a quelle umane. Le mie perplessità si fondano quindi su due aspetti: da un lato, i prerequisiti necessari per la nascita di un sistema del genere sembrano essere quasi completamente assenti; dall’altro, è opportuno notare che quello della “superintelligenza” è un concetto altamente speculativo, la cui realizzabilità rimane tutt’altro che scontato. Mi spiego: normalmente l’intelligenza artificiale viene divisa in due categorie, debole e forte. L’IA debole è così chiamata non perché qualitativamente inferiore (anzi, in generale le sue prestazioni sono pari o superiore a quelle umane), ma perché limitata: essa può operare solo in uno o una piccola selezione di ambiti. Per fare un esempio, un’auto a guida autonoma non è capace di scrivere poesie, mentre ChatGPT non è in grado di guidare un’auto. L’IA forte, o AGI (artificial general intelligence), è invece un’IA dotata di capacità cognitive generali, ossia paragonabili a quelle dell’uomo. Un sistema del genere sarebbe quindi di imparare, adattarsi ed operare in un’ampia varietà di ambiti differenti, proprio come l’essere umano. La distinzione è importante, in quanto l’AGI, almeno per il momento, non esiste: in effetti, il passaggio dai sistemi deboli a quelli forti è generalmente considerato un momento di importanza critica nello sviluppo dell’IA; tuttavia, proprio come accadeva per la superintelligenza, non abbiamo idea di quando ciò potrebbe avvenire. Ora, tutto ciò è rilevante per un semplice motivo: la realizzazione di una superintelligenza dipende dall’esistenza dell’AGI. Un sistema superintelligente non può infatti essere creato, ma si sviluppa da solo a partire da un’IA forte, che sfrutta le sue versatili capacità per migliorare ripetutamente il proprio software e hardware, in un processo conosciuto come “esplosione di intelligenza”. Enfasi su “software e hardware”: una superintelligenza dovrebbe infatti essere in grado sia di (ri)programmare il proprio codice che di progettare sistemi fisici più potenti, e tutto ciò in maniera del tutto autonoma e sostanzialmente innovativa. In altre parole, dovrebbe possedere una vera intelligenza, cosa di cui i sistemi di oggi sono ancora sostanzialmente privi: già solo la versatilità sarebbe un problema, ma bisogna poi prendere in considerazione anche la scarsa comprensione del mondo reale, le limitazioni dei modelli esistenti, e soprattutto la mancanza di inventività. Piuttosto rilevante è poi l’incapacità di questi algoritmi di interagire con il mondo reale: l’esplosione di intelligenza richiede un potenziamento non solo del software ma anche dell’hardware, e necessita quindi di poter accedere a materiali, fabbriche e strumenti adeguati. Se questi non fossero presenti il processo di crescita esponenziale risulterebbe impossibile, o verrebbe quantomeno rallentato.
La questione che dovremmo affrontare non è quindi “se” l’intelligenza artificiale possa risultare pericolosa per l’umanità, ma piuttosto “tra quanto” raggiungerà tale livello, e “quanto grave” sarà il risultato. Da questo punto di vista, io penso quindi che “una superintelligenza distruggerà l’umanità entro un anno” sia una previsione assai poco realistica, per i motivi di cui abbiamo discusso; più credibile è invece la possibilità che uno o più modelli sperimentali causino un crash completo o parziale dell’internet nel prossimo futuro – una catastrofe piuttosto che un’apocalisse. Detto ciò, c’è però un’ultima cosa che vorrei menzionare al riguardo: alcuni commentatori hanno sostenuto che questo “allarmismo” sia almeno in parte una manovra economica, politica e pubblicitaria da parte delle grandi aziende del settore, che intenderebbero approfittarne per attirare maggiore interesse, ottenere ulteriori finanziamenti e limitare la competizione. Ovviamente ciò è pura speculazione, ma è comunque interessante che questa posizione non solo esista, ma sia anche sorprendentemente diffusa, al punto da aver ottenuto un certo supporto all’interno della stessa Silicon Valley.
Lascia un commento