Computer use per i contratti: cosa insegna il test OpenAI–Ironclad sugli agenti
Gli agenti che usano il computer come farebbe una persona, cliccando, compilando moduli e seguendo procedure, sono la promessa più concreta per l'automazione d'ufficio. Ma funzionano davvero sui processi aziendali? Un lavoro congiunto tra OpenAI e Ironclad, software di gestione dei contratti, offre una risposta con numeri, e con limiti dichiarati.
## Cosa hanno misurato
I ricercatori hanno scelto 11 attività reali di contrattualistica, definite insieme a Ironclad: per esempio impostare un accordo di riservatezza (NDA) o costruire un flusso di approvazione. Per un utente esperto, ciascuna richiede orientativamente 30-40 minuti. Non sono quiz: sono procedure a più passaggi dentro un software vero, con regole di business da rispettare.
Per addestrare i modelli sono stati creati compiti sintetici a partire da contratti pubblici (documenti SEC, ripuliti dai dati personali), con ambienti Ironclad ospitati dove il modello poteva "fare pratica" tramite apprendimento per rinforzo. La valutazione usava griglie di criteri, da 8 a 50 per attività a seconda della complessità.
## I risultati
GPT-6 Astra ha ottenuto un punteggio medio del 55%, contro il 41,6% di GPT-5.6 Sol: circa il 32% in più. Anche il tempo stimato per tentativo è sceso, da circa 37 a 19,2 minuti. Un modello interno in sviluppo è arrivato al 63,7%.
Va letto con attenzione. Un 55% medio significa che metà dei criteri, in media, non viene soddisfatta: siamo ben lontani da un processo che si può lasciare incustodito. Inoltre i tempi sono stime basate su velocità ipotizzate, non risparmi misurati sul campo, e i risultati valgono solo per quelle 11 attività, non per tutti i flussi di un prodotto.
## Cosa ne ricavo per chi implementa agenti
La lezione più utile non è il punteggio, ma il metodo. Tre elementi si trasferiscono a qualunque progetto di automazione con agenti.
Primo: **ambienti di prova realistici**. Il miglioramento nasce dal far esercitare il modello su un'istanza del software reale, non da prompt più furbi. Per una PMI significa avere un ambiente di test del gestionale o del CRM, con dati fittizi.
Secondo: **criteri di valutazione espliciti**. Dividere un compito in decine di controlli verificabili permette di capire dove l'agente sbaglia, invece di giudicare "a sensazione".
Terzo: **supervisione umana come parte del processo**. La stessa fonte sottolinea che per contratti complessi serve ancora la revisione di una persona. Considerare l'agente un esecutore di bozze, con approvazione finale umana, è l'impostazione più sensata per ora.
## Dove l'agente inciampa ancora
I compiti più delicati sono quelli in cui un passaggio sbagliato si propaga: un campo compilato male all'inizio di un flusso di approvazione può produrre un errore che si scopre solo alla fine. Gli agenti con computer use hanno poi due fragilità tipiche: interfacce che cambiano dopo un aggiornamento del software e regole di business implicite, che una persona conosce per abitudine ma che nessuno ha scritto. Per questo la fonte invita altre aziende software a collaborare proprio sui compiti in cui gli agenti oggi falliscono con costanza: è lì che si impara di più.
Per una PMI il messaggio è pragmatico: iniziare da processi stabili, con interfacce che non cambiano ogni settimana, e documentare le regole implicite prima di affidarle a un agente. Spesso questo esercizio di documentazione porta valore da solo, a prescindere dall'IA.
## In pratica
- **Scegli un processo ripetitivo e circoscritto** (per esempio la creazione di un documento standard o l'inserimento di anagrafiche) e scrivilo come lista di controlli verificabili, prima di pensare a qualsiasi agente.
- **Prepara un ambiente di test** con dati fittizi e permessi minimi, e fai girare l'agente almeno qualche decina di volte misurando quanti controlli supera, non solo se "sembra andare".
- **Definisci il punto di approvazione umana**: decidi in anticipo quali azioni (invio, firma, cancellazione) l'agente non può compiere da solo e registra ogni passaggio per poterlo ricostruire.
Hai già provato agenti con computer use sui tuoi processi? Racconta nei commenti cosa ha funzionato e cosa no, condividi l'articolo con chi gestisce l'automazione in azienda e iscriviti per i prossimi approfondimenti.
*Fonte: OpenAI, "Advancing computer use with Ironclad", 6 ottobre 2026 — https://openai.com/index/advancing-computer-use-with-ironclad*
## Cosa hanno misurato
I ricercatori hanno scelto 11 attività reali di contrattualistica, definite insieme a Ironclad: per esempio impostare un accordo di riservatezza (NDA) o costruire un flusso di approvazione. Per un utente esperto, ciascuna richiede orientativamente 30-40 minuti. Non sono quiz: sono procedure a più passaggi dentro un software vero, con regole di business da rispettare.
Per addestrare i modelli sono stati creati compiti sintetici a partire da contratti pubblici (documenti SEC, ripuliti dai dati personali), con ambienti Ironclad ospitati dove il modello poteva "fare pratica" tramite apprendimento per rinforzo. La valutazione usava griglie di criteri, da 8 a 50 per attività a seconda della complessità.
## I risultati
GPT-6 Astra ha ottenuto un punteggio medio del 55%, contro il 41,6% di GPT-5.6 Sol: circa il 32% in più. Anche il tempo stimato per tentativo è sceso, da circa 37 a 19,2 minuti. Un modello interno in sviluppo è arrivato al 63,7%.
Va letto con attenzione. Un 55% medio significa che metà dei criteri, in media, non viene soddisfatta: siamo ben lontani da un processo che si può lasciare incustodito. Inoltre i tempi sono stime basate su velocità ipotizzate, non risparmi misurati sul campo, e i risultati valgono solo per quelle 11 attività, non per tutti i flussi di un prodotto.
## Cosa ne ricavo per chi implementa agenti
La lezione più utile non è il punteggio, ma il metodo. Tre elementi si trasferiscono a qualunque progetto di automazione con agenti.
Primo: **ambienti di prova realistici**. Il miglioramento nasce dal far esercitare il modello su un'istanza del software reale, non da prompt più furbi. Per una PMI significa avere un ambiente di test del gestionale o del CRM, con dati fittizi.
Secondo: **criteri di valutazione espliciti**. Dividere un compito in decine di controlli verificabili permette di capire dove l'agente sbaglia, invece di giudicare "a sensazione".
Terzo: **supervisione umana come parte del processo**. La stessa fonte sottolinea che per contratti complessi serve ancora la revisione di una persona. Considerare l'agente un esecutore di bozze, con approvazione finale umana, è l'impostazione più sensata per ora.
## Dove l'agente inciampa ancora
I compiti più delicati sono quelli in cui un passaggio sbagliato si propaga: un campo compilato male all'inizio di un flusso di approvazione può produrre un errore che si scopre solo alla fine. Gli agenti con computer use hanno poi due fragilità tipiche: interfacce che cambiano dopo un aggiornamento del software e regole di business implicite, che una persona conosce per abitudine ma che nessuno ha scritto. Per questo la fonte invita altre aziende software a collaborare proprio sui compiti in cui gli agenti oggi falliscono con costanza: è lì che si impara di più.
Per una PMI il messaggio è pragmatico: iniziare da processi stabili, con interfacce che non cambiano ogni settimana, e documentare le regole implicite prima di affidarle a un agente. Spesso questo esercizio di documentazione porta valore da solo, a prescindere dall'IA.
## In pratica
- **Scegli un processo ripetitivo e circoscritto** (per esempio la creazione di un documento standard o l'inserimento di anagrafiche) e scrivilo come lista di controlli verificabili, prima di pensare a qualsiasi agente.
- **Prepara un ambiente di test** con dati fittizi e permessi minimi, e fai girare l'agente almeno qualche decina di volte misurando quanti controlli supera, non solo se "sembra andare".
- **Definisci il punto di approvazione umana**: decidi in anticipo quali azioni (invio, firma, cancellazione) l'agente non può compiere da solo e registra ogni passaggio per poterlo ricostruire.
Hai già provato agenti con computer use sui tuoi processi? Racconta nei commenti cosa ha funzionato e cosa no, condividi l'articolo con chi gestisce l'automazione in azienda e iscriviti per i prossimi approfondimenti.
*Fonte: OpenAI, "Advancing computer use with Ironclad", 6 ottobre 2026 — https://openai.com/index/advancing-computer-use-with-ironclad*
openai, agenti ai, computer use, automazione, contratti