Skip to content Skip to footer

La progettazione delle AI affidata all’AI: risultati e implicazioni del progetto ASI-ARCH

Contenuto sviluppato con intelligenza artificiale, ideato e revisionato da redattori umani.
···

La ricerca sull’intelligenza artificiale si è naturalmente fondata, fino a oggi, sulle capacità cognitive umane, che con il tempo potrebbero mostrare difficoltà a seguire il ritmo imposto dall’evoluzione computazionale. Per superare questo ostacolo, un recente studio dal titolo “AlphaGo Moment for Model Architecture Discovery”, realizzato da un team di ricercatori della Shanghai Jiao Tong University e pubblicato il 24 luglio 2025, ha introdotto ASI-ARCH, una piattaforma innovativa progettata per affidare a un sistema superintelligente l’intera gestione del ciclo di scoperta delle architetture neurali, dalla fase iniziale di concettualizzazione fino alla validazione sperimentale completa.

Questa ricerca è un notevole passo avanti rispetto ai tradizionali metodi di Neural Architecture Search, che erano limitati dalla necessità di una preliminare definizione umana degli spazi esplorabili. ASI-ARCH non si limita semplicemente a ottimizzare e adattare architetture neurali già esistenti; piuttosto, genera autonomamente nuovi concetti architetturali, sviluppa il codice necessario per implementare questi modelli, li sottopone a fasi di addestramento e ne valuta iterativamente i risultati attraverso un ciclo operativo interamente automatizzato. Al cuore di questo sistema vi sono tre agenti specifici – Researcher, Engineer e Analyst – ciascuno dotato di compiti ben definiti e supportati da un ampio archivio di conoscenze derivanti dalla letteratura scientifica esistente, oltre a un database che registra e consente il riutilizzo sistematico di tutti gli esperimenti svolti. Va chiarito che, nonostante gli autori parlino di “sistema superintelligente”, il termine è impiegato in senso lato. Non si tratta di un’intelligenza artificiale generale superiore all’uomo, ma di un insieme ben organizzato di agenti basati su modelli linguistici avanzati e strumenti automatizzati che lavorano in sinergia per generare, valutare e ottimizzare architetture neurali in modo autonomo. – Researcher, Engineer e Analyst – ciascuno dotato di compiti ben definiti e supportati da un ampio archivio di conoscenze derivanti dalla letteratura scientifica esistente, oltre a un database che registra e consente il riutilizzo sistematico di tutti gli esperimenti svolti.

La valutazione delle nuove architetture proposte avviene attraverso una sofisticata funzione di fitness che integra criteri quantitativi, quali la perdita misurata e il rendimento sui benchmark di riferimento, con valutazioni qualitative assegnate da un modello linguistico specifico, che considera aspetti come l’originalità, l’efficienza computazionale e la correttezza tecnica del codice prodotto. Ogni architettura subisce rigorosi controlli di novità e complessità, ed è soggetta a un dettagliato ciclo di auto-debugging che entra in azione nel caso di insuccessi durante l’addestramento. Quando ciò accade, l’agente analizza in automatico i log di errore, identificando e correggendo autonomamente i problemi finché non si ottiene un addestramento completato con successo.

Per assicurare un uso razionale ed efficiente delle risorse computazionali, gli autori dello studio hanno adottato una strategia in due fasi. Nella prima fase esplorativa, ASI-ARCH valuta modelli più semplici, composti da circa venti milioni di parametri e addestrati su dataset di dimensioni moderate (circa un miliardo di token), selezionando i più promettenti sulla base dei risultati preliminari ottenuti. Successivamente, nella fase di verifica approfondita, questi modelli vengono ampliati significativamente fino a raggiungere circa 340 milioni di parametri e, per i candidati che dimostrano maggiore potenziale, sono ulteriormente sottoposti a un addestramento intensivo su dataset estesi fino a quindici miliardi di token. In totale, ASI-ARCH ha realizzato ben 1.773 esperimenti indipendenti, utilizzando oltre 20.000 ore-GPU di calcolo, arrivando a identificare ben 106 nuove architetture innovative capaci di superare le migliori proposte umane su un’ampia varietà di benchmark linguistici.

I risultati ottenuti dimostrano chiaramente una correlazione quasi lineare tra le risorse computazionali investite e il numero di innovazioni scientifiche generate, delineando una vera e propria legge empirica di scala per la scoperta scientifica nel campo dell’intelligenza artificiale. Questo implica che l’accesso a maggiori risorse di calcolo porta inevitabilmente a un incremento delle innovazioni tecnologiche, aggirando così il tradizionale collo di bottiglia rappresentato dalla limitata creatività umana. Tra le architetture emergenti più promettenti spiccano PathGateFusionNet, ContentSharpRouter, FusionGatedFIRNet, HierGateNet e AdaMultiPathGateNet, tutte in grado di superare modelli di riferimento consolidati come DeltaNet, Gated DeltaNet e Mamba 2 su dieci differenti test di benchmark, senza tuttavia incrementare eccessivamente le dimensioni e la complessità strutturale.

L’analisi dettagliata dei risultati ha mostrato che le architetture più efficaci non puntano necessariamente a innovazioni radicali, ma piuttosto ottimizzano elementi già ben consolidati, come i meccanismi di gating e le operazioni di convoluzione, ricombinandoli in modo innovativo grazie a strategie emerse internamente dal sistema. Infatti, nella galleria delle 106 soluzioni considerate eccellenti, è emerso chiaramente che la maggior parte delle idee più significative proviene dall’esperienza accumulata autonomamente dalla piattaforma stessa, piuttosto che dal patrimonio di conoscenze già disponibili nella letteratura scientifica pregressa. Ulteriormente degno di nota è il fatto che la dimensione media dei modelli rimanga costantemente compresa tra i 400 e i 600 milioni di parametri, indicando che i miglioramenti delle prestazioni ottenute non derivano esclusivamente da aumenti di dimensioni dei modelli, ma piuttosto da innovazioni nella struttura e nella composizione architetturale.

Gli autori dello studio suggeriscono diverse prospettive future per espandere ulteriormente il potenziale di ASI-ARCH, includendo la possibilità di iniziare le ricerche con un maggior numero di architetture iniziali, condurre studi approfonditi di ablazione per identificare con precisione i contributi specifici di ciascun modulo implementato e ottimizzare ulteriormente le architetture mediante kernel personalizzati per hardware dedicato, consentendo valutazioni ancora più precise ed efficienti.

ASI-ARCH dimostra che la progettazione e la scoperta architetturale possono essere affidate con successo a sistemi superintelligenti capaci di autoapprendimento, promettendo di inaugurare una nuova era di ricerca continua, autonoma e significativamente più veloce.