|
Il risultato è notevole: 54,9% su HLE - Verified , 61,4% su Vals Finance Agent v2 e circa 73,8% su DeepSWE v1.1 . Ma c'è un asterisco: The Verge sottolinea che, pur mantenendo il prezzo nominale di 0,...
Sole24ore - Infodata
-
6 ore fa
|
|
|
|
La stessa tabella mostra però quanto pesi l'impalcatura con cui si misura un agente: su DeepSWE v1.1 il modello segna 74,2 con mini - SWE, 69,8 con quella di Claude Code, cioè sotto entrambi i rivali ...
Hardware Upgrade
-
11-9-2026
|
|
|
|
Per gli sviluppatori, il modello registra prestazioni sul benchmark DeepSWE v1.1 con una riduzione dei costi stimati per le API di circa il 57% rispetto alle configurazioni precedenti, introducendo ...
Key4biz
-
9-9-2026
|
|
|
|
Il risultato è notevole: 54,9% su HLE - Verified , 61,4% su Vals Finance Agent v2 e circa 73,8% su DeepSWE v1.1 . Ma c'è un asterisco: The Verge sottolinea che, pur mantenendo il prezzo nominale di 0,...
Sole24ore - Infodata
-
8-9-2026
|
|
|
|
Sullo sviluppo software OpenAI colloca Astra come il proprio miglior modello di ingegneria del codice, con il 74,1% su DeepSWE v1.1 contro il 72,7% di Sol e progressi più netti su Terminal - Bench 4.
Digitalic
-
5-9-2026
|
|
|
|
Su FrontierCode 1.1 Astra è dietro Claude Opus 5 sia nella versione estesa (64,5% contro 64,9%) sia in quella principale (53,3% contro 53,5%), e su DeepSWE v1.1 Gemini 3.8 Flash, un modello di fascia ...
Digital Day
-
4-9-2026
|
|
|
|
Nel benchmark DeepSWE v1.1, Astra supera le prestazioni di GPT - 5.6 Sol e, considerando la configurazione ottimale, abbassa i costi API stimati di circa il 57% . Tra le novità, una funzione ...
Il Messaggero
-
4-9-2026
|
|
|
|
Sul fronte dei benchmark, Muse Spark 1.3 ha ottenuto un punteggio di 75,4 nel test DeepSWE v1.1 , secondo i dati diffusi dalla stessa Meta , superando i risultati indicati per GPT - 5.6 Sol e per ...
Hardware Upgrade
-
3-9-2026
|
|
|
|
Guadagni sul codice, più token consumati Il guadagno più netto è sul codice: su DeepSWE v1.1 , la prova che misura la risoluzione autonoma di problemi di ingegneria del software su orizzonte lungo, 3.
Hardware Upgrade
-
3-9-2026
|
|
|
|
... mentre le sue cifre danno la variante multimodale in vantaggio su sei dei sette benchmark testuali: 5,6 punti in più su Toolathlon - Verified, 4,9 su DeepSWE, 4,0 su DSBench - Hard. L'unica ...
Hardware Upgrade
-
24-8-2026
|
|
|
|