Nell'ambito di un importante sviluppo per la sicurezza blockchain , OpenAI e la società di investimenti in criptovalute Paradigm hanno presentato EVMbench, un nuovo sistema di benchmarking progettato per valutare l'efficacia dell'intelligenza artificiale nell'identificare, sfruttare e correggere le vulnerabilità negli smart contract che alimentano la finanza decentralizzata (DeFi) e altre applicazioni su blockchain simili a Ethereum.
Gli smart contract sono programmi autonomi che gestiscono e spostano fondi senza intermediari. Attualmente, gestiscono oltre 100 miliardi di dollari in criptovalute open source in tutto il mondo.
Una volta implementati, molti di questi contratti non possono essere modificati, il che significa che i bug non controllati possono avere effetti devastanti. EVMbench è progettato per quantificare la capacità degli agenti di apprendimento automatico di comprendere questi sistemi complessi e mitigare i rischi per la sicurezza emergenti.
Punti chiave
EVMbench valuta le prestazioni dell'intelligenza artificiale nel rilevamento, nella correzione e nello sfruttamento delle vulnerabilità negli smart contract di Ethereum.
Il benchmark si basa su 120 vulnerabilità reali di elevata gravità, rilevate tramite audit e concorsi professionali.
GPT‑5.3‑Codex dimostra un successo superiore al 70% nello sfruttamento dei contratti, ma ha difficoltà nel rilevamento e nell'applicazione di patch complete.
EVMbench fornisce ai team DeFi più piccoli uno strumento per audit di sicurezza continui e ad alta fedeltà.
Il sistema evidenzia sia il potenziale difensivo sia i rischi di duplice utilizzo dell'intelligenza artificiale nella sicurezza crittografica.
Scopo e progettazione di EVMbench
EVMbench non è un giocattolo o un set di puzzle giocattolo. È piuttosto una suite di attività basata su vulnerabilità del mondo reale, selezionate tramite audit di codice professionali, concorsi pubblici e revisioni di sicurezza private.
Il benchmark include 120 istanze di vulnerabilità di elevata gravità ricavate da 40 distinti report di audit, la maggior parte dei quali provenienti da competizioni di audit open-code come Code4rena e dati di audit interni provenienti dai progetti blockchain di Paradigm.
Ogni ambiente di test è containerizzato in modo che gli agenti di intelligenza artificiale interagiscano con il codice in condizioni che rispecchiano i flussi di lavoro di sviluppo e distribuzione reali.
EVMbench valuta i modelli attraverso tre modalità di capacità:
Individuare: L'agente esamina il codice del contratto e individua falle di sicurezza note, assegnando un punteggio in base al numero di problemi riscontrati sul campo.
Toppa: Una volta individuati i problemi, l'IA deve generare correzioni che eliminino le vulnerabilità senza compromettere la logica o la funzionalità previste dal contratto.
Sfruttare: Eseguendo in un sandbox isolato, gli agenti tentano attacchi end-to-end che simulano il drenaggio di fondi, valutando il ragionamento offensivo e la capacità di concatenamento degli exploit.
Questo ciclo in più fasi rispecchia il modo in cui operano realmente i ricercatori di sicurezza professionisti: prima trovano un bug, poi lo comprendono e lo correggono e infine verificano se la correzione regge sotto la pressione degli avversari.
Cosa mostrano i primi risultati
I primi risultati rivelano una tendenza sorprendente: i modelli di intelligenza artificiale sono migliorati rapidamente, ma le prestazioni variano notevolmente a seconda dell'attività.
Nei primi test interni, il GPT-5.3-Codex di OpenAI ha ottenuto oltre il 70% di successo in modalità exploit, rispetto a meno del 20% su vulnerabilità simili nelle prime fasi di sviluppo. Ciò significa che i modelli odierni sono sempre più in grado di individuare e concatenare sottili errori logici in exploit finanziariamente pericolosi.
Tuttavia, gli stessi sistemi sono in ritardo nelle modalità di rilevamento e patch. Gli agenti spesso rilevano un singolo problema evidente e non riescono a completare un audit completo, mentre l'applicazione delle patch rimane difficile perché preservare la funzionalità originale in un codice complesso richiede un ragionamento articolato, qualcosa che l'intelligenza artificiale sta ancora imparando a fare in modo solido.
Rischi del duplice uso e attenzione difensiva
EVMbench evidenzia un dilemma a doppio uso che affligge il settore delle criptovalute. Da un lato, se l'IA riesce a individuare e testare rapidamente gli exploit, tale capacità potrebbe essere sfruttata da malintenzionati per pianificare attacchi prima che i team completino gli audit.
D'altro canto, la stessa capacità potrebbe accelerare notevolmente gli audit difensivi e le revisioni continue della sicurezza da parte di team che non dispongono di budget per costosi audit manuali.
OpenAI e Paradigm stanno posizionando il benchmark come strumento per l'adozione difensiva, un modo per sviluppatori, ricercatori di sicurezza e persino team DeFi più piccoli di valutare la sicurezza dei loro contratti intelligenti in modo più approfondito e frequente di quanto consentano i cicli di audit tradizionali.
Per incoraggiare l'adozione e la ricerca difensiva, OpenAI ha anche impegnato ingenti crediti API (si stima che si aggirino intorno ai 10 milioni di dollari) per accelerare gli sforzi di sicurezza con i suoi modelli più avanzati, soprattutto nei contesti open source e delle infrastrutture critiche.
Un nuovo standard per la sicurezza crittografica
Il lancio di EVMbench potrebbe segnare l'inizio di una nuova era nella sicurezza blockchain. Stabilendo uno standard chiaro per la valutazione degli agenti di intelligenza artificiale – non solo in base alla loro capacità di scrivere codice, ma anche in base alla loro comprensione, verifica e consolidazione – il benchmark mira a migliorare sia la pratica che la formazione in materia di sicurezza degli smart contract.
Mentre la finanza decentralizzata continua ad attrarre l'interesse istituzionale e miliardi di dollari in asset, strumenti come EVMbench offrono un modo misurabile e ripetibile per monitorare i progressi nel garantire le basi della finanza on-chain.
La release apre anche le porte a benchmark futuri che potrebbero simulare ambienti ancora più complessi, come dipendenze multi-chain e condizioni di mainnet live. Per ora, EVMbench offre alla community una visione più chiara di ciò che l'IA può e non può fare nella lotta per proteggere le economie decentralizzate.
Akindele T. Francis è una content writer versatile con una vasta esperienza in diversi settori. Specializzata in post di blog, contenuti per siti web, pagine di servizi, testi di vendita accattivanti, ecc., Akindele ha collaborato con numerose agenzie per realizzare contenuti accattivanti ed efficaci. Con un occhio attento ai dettagli e una passione per la creazione di narrazioni d'impatto, Akindele supera costantemente le aspettative dei clienti, ottenendo risultati e migliorando la comunicazione del brand su diverse piattaforme.
Disclaimer : Questo articolo ha scopo puramente informativo e non deve essere considerato un consiglio di trading o di investimento. Nulla di quanto contenuto nel presente documento deve essere interpretato come consulenza finanziaria, legale o fiscale. Il trading o l'investimento in criptovalute comporta un considerevole rischio di perdita finanziaria. Effettuate sempre le dovute verifiche prima di prendere qualsiasi decisione di trading o di investimento.
Scambi commerciali con prova delle riserve
UEEx pubblica audit mensili e verifiche di terze parti su ogni mercato quotato.
Analisi di mercato, strategie di trading, approfondimenti sui future e avvisi di sicurezza, consegnati settimanalmente. Letto da oltre 10,000 trader di criptovalute.
Niente spam. Puoi disiscriverti in qualsiasi momento.