Fonti
Resta al passo con l’arte IA
Ricevi nella tua casella le storie migliori della settimana su IA e arte con IA: selezionate, sintetiche, gratis.

Elias spiega la ricerca dietro i titoli con un linguaggio chiaro.
Ricevi nella tua casella le storie migliori della settimana su IA e arte con IA: selezionate, sintetiche, gratis.
Gratis. Disattiva quando vuoi.
Scegli un compagno e scopri cosa ne pensa di questa storia
Inherent, un laboratorio britannico di AI fondato da ex dipendenti di DeepMind, afferma che il suo agente Faraday ha superato i modelli di Anthropic e OpenAI in un benchmark che misura la replicazione autonoma di articoli scientifici — ovvero la capacità di leggere uno studio e riprodurne i risultati in modo indipendente.
Replicare un articolo scientifico non equivale a riassumerlo. Un modello in grado di replicare uno studio deve analizzare la metodologia, identificare le variabili, eseguire o simulare il processo descritto e produrre risultati che corrispondano all'originale entro un margine accettabile. È come la differenza tra leggere una ricetta e cucinare il piatto correttamente. Questa distinzione è importante per chiunque utilizzi l'AI per assistere in flussi di lavoro creativi o tecnici strutturati e articolati in più fasi — la stessa profondità di ragionamento che consente a un agente di riprodurre un esperimento è ciò che gli permetterebbe di seguire in modo affidabile una catena di prompt complessa o eseguire una pipeline di produzione senza deviazioni.
Per i creatori di arte AI, il parallelo immediato è quello dei flussi di lavoro agentici: sistemi che eseguono sequenze di generazione, valutazione e perfezionamento senza una supervisione costante. Più un agente è capace di mantenere un compito strutturato in mente attraverso molti passaggi, più gestisce in modo affidabile attività come il matching iterativo degli stili, l'esecuzione di prompt in batch o il perfezionamento delle immagini in più passaggi.
Secondo TechCrunch, Inherent posiziona Faraday come un «compagno di squadra» AI piuttosto che uno strumento — presentandolo come qualcosa che lavora fianco a fianco con i ricercatori anziché limitarsi a elaborare le loro richieste. I risultati del benchmark che mostrano Faraday in vantaggio rispetto alle offerte di Anthropic e OpenAI sono, a questo stadio, numeri interni di Inherent. Non è stata pubblicata alcuna valutazione indipendente da terze parti, il che rappresenta una riserva standard da tenere a mente ogni volta che una startup annuncia di aver battuto concorrenti più affermati.
Detto questo, il pedigree degli ex dipendenti di DeepMind non è puramente decorativo. Il team ha esperienza diretta nella costruzione del tipo di sistemi di apprendimento per rinforzo e pianificazione che sono alla base degli agenti capaci, e la replicazione della ricerca è un obiettivo più difficile della maggior parte dei compiti nei leaderboard perché penalizza duramente le allucinazioni — un modello che inventa un risultato invece di riprodurlo fallisce immediatamente.
La scelta di Inherent della parola «compagno di squadra» al posto di «assistente» o «strumento» è deliberata. Implica un sistema che prende iniziativa sui sottocompiti, verifica il proprio lavoro e segnala l'incertezza invece di ignorarla. Quel profilo comportamentale — se regge sotto test indipendenti — sarebbe genuinamente utile in contesti creativi dove la modalità di fallimento degli agenti attuali è la sicurezza nell'errore: un modello che genera un output dall'aspetto plausibile ma che manca silenziosamente l'obiettivo.
Il framing della replicazione della ricerca posiziona inoltre Faraday direttamente nello spazio AI agentico in cui laboratori come Anthropic (con le funzionalità di utilizzo del computer di Claude) e OpenAI competono intensamente. Un laboratorio più piccolo che rivendica un vantaggio nel benchmark in questa specifica capacità è un segnale che il livello agentico dell'AI sta diventando genuinamente conteso, non una gara a due cavalli.
Per i creatori che esplorano strumenti AI oltre la generazione di immagini — utilizzando agenti per automatizzare la raccolta di riferimenti, l'analisi degli stili o l'iterazione dei prompt — l'annuncio di Faraday merita attenzione. La domanda pratica è se Inherent aprirà l'accesso in modo ampio o manterrà Faraday in un modello riservato ai partner di ricerca. Non è stata annunciata alcuna data di rilascio pubblico né alcun prezzo. Fino a quando non apparirà una replicazione indipendente del benchmark di replicazione, il numero in prima pagina è un'affermazione, non un verdetto — ma è un'affermazione specifica e falsificabile, il che è più di quanto offra la maggior parte dei benchmark delle startup.
I creatori che già sperimentano flussi di lavoro assistiti dall'AI possono esplorare ciò che gli strumenti di generazione attuale supportano nelle guide di Charmloop mentre il livello agentico dei modelli continua a svilupparsi.