Un agente basato su modelli linguistici può adattarsi a una nuova interpretazione delle regole di credito, ma farlo senza confini rischia di mettere fuori gioco proprio il meccanismo di controllo richiesto in un settore regolato. Se l’agente riscrive se stesso, diventa difficile stabilire che cosa sia cambiato, per quale motivo, con quali dati sia stato verificato e chi ne abbia autorizzato l’entrata in produzione.

È il problema affrontato da un nuovo lavoro pubblicato su arXiv da Ravil Akhtyamov, presentato il 7 ottobre 2026. La proposta non punta a rendere il modello linguistico autonomamente modificabile: fissa i pesi del modello e permette all’agente di evolvere soltanto attraverso il cosiddetto harness di esecuzione. In altre parole, possono cambiare istruzioni operative, logica con cui si invocano gli strumenti e combinazione di funzioni elementari; il modello sottostante resta invariato.

La distinzione è rilevante soprattutto nei flussi di valutazione del credito, dove una decisione automatizzata o assistita può incidere sull’accesso a finanziamenti e deve poter essere ricostruita a posteriori. L’idea centrale del paper è trasformare ogni adattamento in un artefatto verificabile: una modifica identificabile, collegata alla causa che l’ha motivata, accompagnata da un test e soggetta a un passaggio formale di ammissione.

Modificare il comportamento senza rendere opaco il sistema

Nel dibattito sugli agenti IA, la capacità di migliorarsi da soli viene spesso descritta come un vantaggio operativo: il sistema osserva risultati recenti, scopre un problema e corregge la propria strategia. In un processo di credito, tuttavia, quella stessa dinamica può produrre conseguenze difficili da governare. Una correzione che riduce gli errori in un campione ristretto potrebbe, per esempio, ottenere il risultato semplicemente attenuando i controlli e lasciando passare più casi problematici.

Akhtyamov propone quindi un perimetro tecnico e organizzativo. L’agente può suggerire cambiamenti nell’involucro che lo dirige: il testo delle istruzioni, le condizioni della logica di chiamata agli strumenti, l’ordine e la composizione di primitive predefinite. Non può intervenire direttamente sui pesi del modello. Questa scelta consente di descrivere una modifica come un diff, cioè una differenza puntuale rispetto alla configurazione precedente, invece di trattarla come una trasformazione interna del modello non facilmente ispezionabile.

Il processo è organizzato in due cicli e prevede un unico cancello di ammissione prima del deployment. Il gate registra gli elementi dell’operazione in una catena di hash: un metodo utile a collegare i record in modo che alterazioni successive risultino rilevabili. Nel quadro delineato dall’autore, la tracciabilità non è un’attività documentale aggiunta dopo il fatto, ma una condizione necessaria perché il cambiamento venga accettato.

Questa architettura separa anche due piani che nelle applicazioni agentiche tendono a sovrapporsi: la facoltà di proporre una modifica e l’autorità di distribuirla. Un agente può esplorare alternative, ma non dovrebbe farle arrivare in un processo di credito solo perché sembrano migliori sui segnali più recenti. Serve una verifica rispetto a criteri espliciti, inclusi gli effetti sui casi che il sistema avrebbe dovuto segnalare.

I risultati: meno falsi positivi non basta

Il paper valuta il meccanismo in simulazione, non su una piattaforma creditizia reale. È un limite essenziale per leggere i risultati: né l’agente simulato né il componente che propone le modifiche sono LLM in produzione. Per quest’ultimo è stato usato un sistema di ricerca inizializzato con semi, pensato per misurare il comportamento della procedura in condizioni controllate.

La sperimentazione considera tre famiglie di reinterpretazione della supervisione, ciascuna a tre livelli di intensità, con dieci esecuzioni per configurazione. In questo scenario, il gate ha ammesso 144 modifiche su 7.449 candidate. Secondo lo studio, nessuna delle modifiche accettate ha peggiorato l’errore sulla cronologia tenuta separata per la verifica. Nei casi di bassa e media intensità, il sistema ha riportato il tasso di falsi positivi al livello di un riferimento ideale senza aumentare gli avvisi mancati.

Il confronto più importante riguarda però il criterio di ammissione. Sostituendo il gate con una logica più permissiva, che guarda alla diminuzione degli errori nelle tracce recenti, gli stessi cicli hanno accettato 309 modifiche dannose. In 49 esecuzioni su 90, gli avvisi mancati sono rimasti sopra il 10%. I falsi positivi calavano, ma in parte perché il filtro era stato allentato: un risultato apparentemente migliore che nascondeva un peggioramento del presidio.

Per il credito, questa differenza ha una lettura concreta. Ottimizzare una metrica isolata, specie se rilevata su dati recenti, non equivale a migliorare la qualità complessiva di un controllo. Un sistema può produrre meno segnalazioni errate e, nello stesso tempo, ignorare un numero maggiore di casi da esaminare. La valutazione deve quindi includere una storia rietichettata secondo la nuova interpretazione della regola, non limitarsi alle etichette precedenti al cambiamento.

Quando l’adattamento richiede di cambiare gli strumenti

Lo studio distingue inoltre fra diversi tipi di spostamento delle regole. Le variazioni parametriche e quelle di ambito sono state corrette localmente, intervenendo cioè sulle configurazioni consentite dell’harness. Un cambiamento strutturale ha invece richiesto la sostituzione di una primitiva. È un passaggio che mostra come il vincolo non sia soltanto una limitazione, ma anche un modo per rendere evidente quando un intervento di fino non è più sufficiente.

La soluzione proposta non risolve però ogni caso. Alla massima intensità del cambiamento strutturale, la tolleranza fissa del gate ha bloccato la sostituzione corretta della primitiva in metà delle esecuzioni con semi differenti. È un compromesso noto nei sistemi sottoposti a controllo: soglie troppo prudenti possono impedire correzioni necessarie; soglie troppo elastiche lasciano transitare modifiche che migliorano un indicatore a scapito di altri.

Un’altra evidenza è altrettanto significativa. Quando i candidati venivano valutati con le etichette antecedenti al cambio di interpretazione, il gate li respingeva tutti. Per adattarsi davvero a una nuova regola, dunque, il sistema deve incorporare quella nuova lettura nella valutazione dello storico. Non basta chiedere al modello di essere più efficiente rispetto a un passato che rifletteva criteri diversi.

Il nodo normativo resta aperto

L’autore collega i meccanismi descritti ai requisiti dell’AI Act europeo applicabili ai sistemi ad alto rischio nel credit scoring: gestione dei rischi, registrazione degli eventi, documentazione, supervisione umana e requisiti di accuratezza e robustezza sono i riferimenti impliciti di una progettazione che conserva prova di ogni cambiamento. Il lavoro segnala anche che le linee guida statunitensi sul model risk pubblicate nell’aprile 2026 escludono dal proprio perimetro l’IA agentica, lasciando un’area regolatoria meno definita.

Non si tratta, per ora, della dimostrazione che un agente auto-adattivo sia pronto per decidere sul credito reale. Il contributo è un impianto sperimentale, circoscritto e basato su simulazioni. Mancano la prova su dati operativi, il confronto con modelli linguistici effettivamente impiegati come proponenti, la gestione di dati incompleti o distorti e il vaglio di autorità di vigilanza. Lo stesso codice, le configurazioni e gli output per singola esecuzione sono stati resi disponibili dall’autore, un elemento utile per riprodurre e contestare i risultati.

La direzione indicata è comunque chiara: in contesti regolati l’adattamento automatico non può essere considerato una proprietà intrinseca del modello. Va trattato come una modifica controllata al software che lo mette al lavoro. Per banche, fintech e fornitori di strumenti di IA, la questione non sarà soltanto scegliere un agente capace di aggiornare un flusso decisionale, ma dimostrare che ogni aggiornamento resta comprensibile, testabile e revocabile.

Fonti