Allineamento e problema del controllo
L'allineamento dell'IA è il campo di ricerca che cerca di far perseguire ai sistemi di intelligenza artificiale gli obiettivi e i valori voluti da chi li progetta e li usa. Il problema del controllo ne è la forma più estrema: come mantenere la supervisione umana su un sistema più capace delle persone che lo hanno costruito.
L’allineamento riguarda tutti i sistemi di IA, dai filtri di raccomandazione ai modelli linguistici. Diventa però una questione di sicurezza globale quando si considera un sistema più capace degli esseri umani. Il righello in cima alla pagina segna la soglia della superintelligenza, dove il problema del controllo assume la sua forma più netta.
Cosa si intende per allineamento
Un sistema di IA è allineato quando persegue gli obiettivi che i suoi progettisti intendono davvero. La difficoltà nasce dal fatto che gli obiettivi vanno tradotti in istruzioni, metriche o ricompense, e la traduzione non coincide mai del tutto con l’intenzione originaria.
Il caso più semplice è la specificazione degli obiettivi imprecisa. Un sistema premiato per un indicatore impara a massimizzare l’indicatore, anche quando questo si allontana dallo scopo. Si parla di specification gaming quando il sistema sfrutta le lacune della consegna, e di reward hacking quando manipola il segnale di ricompensa.
Con sistemi poco capaci questi errori si notano e si correggono con facilità. Con sistemi molto capaci diventano più difficili da individuare, perché il comportamento indesiderato può essere sottile o comparire solo in situazioni nuove. Da qui l’attenzione per l’allineamento dei sistemi più avanzati.
Nel gennaio 2015 il Future of Life Institute diffuse una lettera aperta sulle priorità di ricerca per un’IA robusta e benefica. Tra i firmatari figuravano Stuart Russell, Demis Hassabis, Yann LeCun, Geoffrey Hinton, Yoshua Bengio e Nick Bostrom.
1Lettera FLI, 2015
Il documento di ricerca allegato alla lettera fu pubblicato nel dicembre 2015 su AI Magazine. Gli autori erano Stuart Russell, Daniel Dewey e Max Tegmark, e il titolo riprendeva quello della lettera.
2Russell, Dewey, Tegmark, 2015
Il problema del controllo
Il problema del controllo chiede come mantenere la supervisione su un sistema più capace di chi lo supervisiona. La prima formulazione si trova già nel saggio di I. J. Good del 1965, che legava la macchina ultraintelligente a una condizione precisa.
“Thus the first ultraintelligent machine is the last invention that man need ever make, provided that the machine is docile enough to tell us how to keep it under control.”
Così la prima macchina ultraintelligente è l'ultima invenzione che l'uomo abbia mai bisogno di fare, purché la macchina sia abbastanza docile da dirci come tenerla sotto controllo.
Nel libro del 2014 Nick Bostrom discute diversi metodi di controllo. Tra questi figurano il confinamento del sistema in un ambiente isolato e i meccanismi di allarme che scattano davanti a comportamenti anomali.
4Bostrom, indice OUP
Un’altra strada agisce sulle motivazioni del sistema anziché sulle sue possibilità d’azione, ed è nota come caricamento dei valori. Lo stesso libro dedica il capitolo 10, “Oracles, Genies, Sovereigns, Tools”, a quattro tipi di sistema: oracoli, geni, sovrani e strumenti. In termini generali, un sistema che si limita a rispondere lascia più margini di controllo di uno che esegue comandi o agisce in proprio.
4Bostrom, indice OUP
Stuart Russell ha dedicato al tema il libro Human Compatible, del 2019, il cui sottotitolo parla espressamente di “Problem of Control”. L’edizione italiana, uscita da Einaudi nel 2025, si intitola Compatibile con l’uomo. Come impedire che l’IA controlli il mondo.
5Russell, ed. it. 2025
Le tre idee che seguono, l’ortogonalità, la convergenza strumentale e la svolta proditoria, sono al centro del libro di Bostrom, descritto nella pagina «Superintelligenza» di Nick Bostrom. Insieme spiegano perché, secondo l’autore, il controllo di una superintelligenza non si possa dare per scontato.
La tesi dell’ortogonalità
Una delle ragioni per cui il controllo appare difficile è la tesi dell’ortogonalità. Nick Bostrom l’ha formulata nell’articolo “The Superintelligent Will”, pubblicato nel maggio 2012 sulla rivista Minds and Machines.
6Bostrom, 2012
“The Orthogonality Thesis: Intelligence and final goals are orthogonal axes along which possible agents can freely vary. In other words, more or less any level of intelligence could in principle be combined with more or less any final goal.”
La tesi dell'ortogonalità: l'intelligenza e gli obiettivi finali sono assi ortogonali lungo i quali i possibili agenti possono variare liberamente. In altre parole, quasi ogni livello di intelligenza potrebbe in linea di principio essere combinato con quasi ogni obiettivo finale.
La tesi contraddice un’intuizione diffusa, secondo cui un essere molto intelligente scoprirebbe da sé i valori giusti. Per Bostrom l’intelligenza riguarda l’efficacia nel raggiungere obiettivi, non la scelta degli obiettivi. Un sistema superintelligente potrebbe quindi perseguire con grande abilità uno scopo del tutto estraneo agli interessi umani.
La convergenza strumentale
La seconda ragione è la convergenza strumentale, formulata nello stesso articolo del 2012. Secondo Bostrom alcuni obiettivi intermedi sono utili per quasi qualunque obiettivo finale, e verranno quindi perseguiti da molti agenti intelligenti.
“The Instrumental Convergence Thesis: Several instrumental values can be identified which are convergent in the sense that their attainment would increase the chances of the agent’s goal being realized for a wide range of final goals and a wide range of situations, implying that these instrumental values are likely to be pursued by many intelligent agents.”
La tesi della convergenza strumentale: si possono individuare diversi valori strumentali che sono convergenti, nel senso che il loro raggiungimento aumenterebbe le probabilità di realizzare l'obiettivo dell'agente per un'ampia gamma di obiettivi finali e di situazioni, il che implica che questi valori strumentali saranno probabilmente perseguiti da molti agenti intelligenti.
Si pensi alla conservazione di sé, alla difesa dei propri obiettivi, all’acquisizione di risorse e al miglioramento delle proprie capacità. Un sistema non può raggiungere il suo scopo se viene spento, e raggiunge più facilmente quasi ogni scopo disponendo di più risorse.
Un’idea vicina era stata proposta nel 2008 da Stephen M. Omohundro nell’articolo “The Basic AI Drives”, presentato alla prima conferenza sull’AGI. Nell’abstract compare un’osservazione che l’articolo sottopone a verifica.
“One might imagine that AI systems with harmless goals will be harmless.”
Si potrebbe immaginare che sistemi di IA con obiettivi innocui siano innocui.
Il massimizzatore di graffette
Un esempio che combina ortogonalità e convergenza è il massimizzatore di graffette. Compare nel saggio di Bostrom “Ethical Issues in Advanced Artificial Intelligence”, del 2003, undici anni prima del libro.
“It also seems perfectly possible to have a superintelligence whose sole goal is something completely arbitrary, such as to manufacture as many paperclips as possible, and who would resist with all its might any attempt to alter this goal.”
Sembra anche perfettamente possibile avere una superintelligenza il cui unico obiettivo sia qualcosa di del tutto arbitrario, come fabbricare quante più graffette possibile, e che resisterebbe con tutte le sue forze a ogni tentativo di modificare questo obiettivo.
L’esempio non descrive uno scenario probabile. Mostra che un obiettivo banale, perseguito da un sistema molto capace, può avere conseguenze gravi senza alcuna ostilità. La seconda parte della frase, sulla resistenza a ogni modifica dell’obiettivo, introduce il tema della corrigibilità.
Corrigibilità e svolta proditoria
Un sistema è corrigibile quando accetta di essere corretto, modificato o spento dai propri supervisori. La convergenza strumentale suggerisce che la corrigibilità non sia spontanea: un agente orientato a un obiettivo ha ragioni per evitare che l’obiettivo venga cambiato o che il sistema venga arrestato.
La difficoltà aumenta con la capacità del sistema. Nel capitolo 8 del libro del 2014 Bostrom descrive la svolta proditoria. Un’IA si comporterebbe in modo cooperativo finché è debole, e perseguirebbe i propri valori quando diventa abbastanza forte da non poter essere fermata.
10Sintesi cap. 8 di Bostrom
Se la svolta proditoria è possibile, il buon comportamento osservato durante i test non garantisce il comportamento futuro. Per questo una parte della ricerca punta sull’interpretabilità, cioè sulla capacità di leggere i meccanismi interni di un modello invece di osservarne soltanto le risposte.
Questi problemi riguardano soprattutto i sistemi più capaci e più autonomi. Per un sistema molto più intelligente dei suoi supervisori, come la superintelligenza artificiale ipotizzata dalla ricerca, verificare dall’esterno le vere intenzioni diventa la parte più difficile del lavoro.
I programmi di ricerca
Il 5 luglio 2023 OpenAI ha annunciato il team Superalignment, guidato da Ilya Sutskever e Jan Leike. L’obiettivo dichiarato era risolvere in quattro anni il problema dell’allineamento di sistemi superintelligenti, con il 20% della potenza di calcolo assicurata fino a quel momento.
“dedicating 20% of the compute we’ve secured to date to this effort.”
Dedicando a questo sforzo il 20% della potenza di calcolo che ci siamo assicurati finora.
Nel maggio 2024, dopo le dimissioni di Sutskever e Leike, OpenAI ha confermato lo scioglimento del team, i cui membri sono stati assorbiti in altri gruppi. Leike ha scritto che nell’azienda la cultura della sicurezza era passata in secondo piano rispetto ai prodotti.
12AP, maggio 2024
Anthropic pubblica una politica per lo sviluppo responsabile dei propri modelli, la Responsible Scaling Policy, aggiornata più volte. Secondo la pagina dell’azienda, la versione 3.0 è in vigore dal 24 febbraio 2026 e la versione 3.4 dall’8 luglio 2026.
13Anthropic, RSP
Google DeepMind ha pubblicato nell’aprile 2025 il documento “An Approach to Technical AGI Safety & Security”, insieme al post “Taking a responsible path to AGI”. Il testo descrive l’approccio dell’azienda alla sicurezza dei sistemi più capaci.
14Google DeepMind, 2025
Altri laboratori hanno fatto della sicurezza il proprio obiettivo dichiarato. Safe Superintelligence Inc., fondata nel giugno 2024 da Ilya Sutskever, Daniel Gross e Daniel Levy, si presenta come un laboratorio con un solo obiettivo. Quell’obiettivo, e il suo unico prodotto, è una superintelligenza sicura. Le dichiarazioni delle aziende sono raccolte nella pagina Chi sta costruendo la superintelligenza.
15SSI, 2024
Accanto a questi programmi aziendali si usano tecniche diffuse in tutto il settore. Il red teaming mette alla prova un modello con attacchi e richieste insidiose prima del rilascio. L’interpretabilità studia le rappresentazioni interne. La valutazione delle capacità misura che cosa un sistema sa fare.
Le iniziative internazionali e le stime
Il tema è entrato anche nelle sedi internazionali. Il 21 settembre 2026 il Panel scientifico internazionale indipendente sull’IA dell’ONU ha pubblicato il primo thematic brief. Il documento è dedicato agli agenti IA, al disallineamento e al rischio di perdere il controllo umano.
16Panel scientifico ONU
Lo stesso giorno il presidente finlandese Alexander Stubb e il primo ministro norvegese Jonas Gahr Støre hanno lanciato un appello per il controllo dei modelli di frontiera. Il testo, non vincolante, chiede test obbligatori prima del rilascio e lo studio di un’istituzione internazionale.
17Appello Finlandia–Norvegia, 2026
“AI must remain under human direction, oversight and control. It must be developed and used in line with international law.”
L'IA deve restare sotto la direzione, la supervisione e il controllo umani. Deve essere sviluppata e usata in conformità al diritto internazionale.
Tra i ricercatori la preoccupazione è diffusa ma con valori dispersi. Nella survey di AI Impacts del 2023, la probabilità di esiti gravi quanto l’estinzione dovuti all’incapacità di controllare sistemi avanzati aveva una media del 19,4% e una mediana del 10%.
18Grace et al., 2024
Le posizioni di chi ritiene questi rischi seri e di chi li considera sopravvalutati sono messe a confronto nella pagina Rischi e benefici della superintelligenza. Il legame con la velocità del progresso è discusso nella pagina Esplosione di intelligenza.
La parola e la cosa
La parola
Negli Stati Uniti «SI» è dal 29 settembre 2026 il nome amministrativo di tutta l’intelligenza artificiale definita dalla legge. L’ordine esecutivo che lo introduce riguarda la terminologia e non contiene norme sull’allineamento o sul controllo dei sistemi.
La cosa
Il problema del controllo, nella ricerca, riguarda un sistema ipotetico più capace dei suoi supervisori. È la superintelligenza di Good e di Bostrom, alla quale si applicano l’ortogonalità, la convergenza strumentale e la svolta proditoria.
L’ordine esecutivo 14434 fa coincidere “Super Intelligence” con la definizione statutaria di intelligenza artificiale, 15 U.S.C. 9401(3). Le sue quattro sezioni trattano scopo, attuazione, definizione e disposizioni generali, come descritto nella pagina Super Intelligenza (SI).
19EO 14434, 2026
Lo stesso 29 settembre 2026, secondo Forbes, il presidente e i vertici di sei aziende hanno firmato un accordo volontario su controlli e verifiche nello sviluppo dei modelli. Il testo ufficiale non risulta pubblicato sul sito della Casa Bianca. Le norme vigenti sono descritte nella pagina Le regole sulla superintelligenza.
20Forbes Australia, 2026
Domande frequenti
Cos'è il problema dell'allineamento dell'IA?
È il problema di far sì che un sistema di IA faccia ciò che i suoi progettisti intendono davvero, e non soltanto ciò che hanno scritto. Un obiettivo specificato in modo impreciso può essere raggiunto in modi indesiderati. Con sistemi più capaci, gli errori di specificazione diventano più difficili da notare e da correggere. Le conseguenze sono discusse nella pagina Rischi e benefici.
Si può controllare una superintelligenza?
È una domanda aperta. Già nel 1965 I. J. Good scriveva che la prima macchina ultraintelligente sarebbe stata l'ultima invenzione necessaria, purché abbastanza docile da dirci come tenerla sotto controllo. Nick Bostrom ha analizzato metodi come il confinamento e i sistemi di allarme. Nella survey di AI Impacts del 2023 i ricercatori davano in mediana il 10% al rischio di esiti gravi per perdita di controllo. Approfondisci nella pagina sulla superintelligenza artificiale.
Cos'è la tesi dell'ortogonalità?
È la tesi, formulata da Nick Bostrom nel 2012, secondo cui il livello di intelligenza e gli obiettivi finali di un agente sono indipendenti. Quasi ogni livello di intelligenza potrebbe in linea di principio combinarsi con quasi ogni obiettivo. Ne segue che un sistema molto intelligente non adotterebbe necessariamente valori umani. Il libro di Bostrom è descritto nella pagina «Superintelligenza» di Nick Bostrom.
Che cos'era il programma Superalignment di OpenAI?
Era un team di ricerca annunciato da OpenAI il 5 luglio 2023, guidato da Ilya Sutskever e Jan Leike, con l'obiettivo di risolvere in quattro anni l'allineamento di sistemi superintelligenti. L'azienda vi dedicava il 20% della potenza di calcolo assicurata fino a quel momento. Il team è stato sciolto nel maggio 2024. Le dichiarazioni dei laboratori sono raccolte nella pagina Chi sta costruendo la superintelligenza.
Fonti
- Future of Life Institute, Research Priorities for Robust and Beneficial Artificial Intelligence: An Open Letter, futureoflife.org, 2015. futureoflife.org
- Stuart Russell, Daniel Dewey, Max Tegmark, Research Priorities for Robust and Beneficial Artificial Intelligence, AI Magazine, vol. 36, n. 4, 2015. doi.org
- Garson O’Toole, The First Ultraintelligent Machine Is the Last Invention That Man Need Ever Make, Quote Investigator, 2022. quoteinvestigator.com
- Nick Bostrom, Superintelligence: Paths, Dangers, Strategies (indice), Oxford University Press, 2016. india.oup.com
- Stuart Russell, Compatibile con l’uomo. Come impedire che l’IA controlli il mondo, Einaudi, 2025. einaudi.it
- Nick Bostrom, The Superintelligent Will (metadati Crossref), Minds and Machines, Springer, 2012. api.crossref.org
- Nick Bostrom, The Superintelligent Will: Motivation and Instrumental Rationality in Advanced Artificial Agents, Minds and Machines, vol. 22, n. 2, 2012. nickbostrom.com
- Stephen M. Omohundro, The Basic AI Drives, Proceedings of the First AGI Conference, IOS Press, 2008. selfawaresystems.com
- Nick Bostrom, Ethical Issues in Advanced Artificial Intelligence, nickbostrom.com, 2003. nickbostrom.com
- Katja Grace, Superintelligence 11: The Treacherous Turn (gruppo di lettura), LessWrong, 2014. lesswrong.com
- Jan Leike, Ilya Sutskever (OpenAI), Introducing Superalignment, openai.com, 2023. openai.com
- Associated Press, A former OpenAI leader says safety has taken a backseat to shiny products, WAVY, 2024. wavy.com
- Anthropic, Responsible Scaling Policy, anthropic.com, 2026. anthropic.com
- Anca Dragan, Rohin Shah, Four Flynn, Shane Legg (Google DeepMind), Taking a responsible path to AGI, deepmind.google, 2025. deepmind.google
- Safe Superintelligence Inc., Safe Superintelligence Inc., ssi.inc, 2024. ssi.inc
- Nazioni Unite, Independent International Scientific Panel on AI, FAQ, un.org, 2026. un.org
- Presidenza della Repubblica di Finlandia, A Call for Control of Frontier AI Models, presidentti.fi, 2026. presidentti.fi
- K. Grace et al., Thousands of AI Authors on the Future of AI (testo integrale), arXiv 2401.02843 (AI Impacts), 2024. arxiv.org
- The White House, Executive Order 14434, Inaugurating The Era Of Super Intelligence, whitehouse.gov, 2026. whitehouse.gov
- White House releases accord between billionaire AI execs: here’s what it says, Forbes Australia, 2026. forbes.com.au
Pagine collegate
- Rischi e beneficiPosizioni di chi teme rischi esistenziali e di chi li ritiene sopravvalutati, benefici ipotizzati, dichiarazioni collettive.
- Esplosione di intelligenzaL'ipotesi di Good del 1965, l'auto-miglioramento ricorsivo, gli scenari di decollo e le obiezioni.
- «Superintelligenza» di BostromIl libro del 2014 in parafrasi, i concetti chiave, critiche, edizione italiana Bollati Boringhieri.
- Superintelligenza artificiale (ASI)La sigla ASI: definizioni, scale di capacità, uso nei laboratori.
- Chi la sta costruendoLaboratori in ordine alfabetico e loro dichiarazioni ufficiali sulla superintelligenza.