deepswe

Ordina per:Più recentePiù letto
Fonte della foto: Sole24ore - Infodata
Il risultato è notevole: 54,9% su HLE - Verified , 61,4% su Vals Finance Agent v2 e circa 73,8% su DeepSWE v1.1 . Ma c'è un asterisco: The Verge sottolinea che, pur mantenendo il prezzo nominale di 0,...
Sole24ore - Infodata  -  2 ore fa
Fonte della foto: Hardware Upgrade
La stessa tabella mostra però quanto pesi l'impalcatura con cui si misura un agente: su DeepSWE v1.1 il modello segna 74,2 con mini - SWE, 69,8 con quella di Claude Code, cioè sotto entrambi i rivali ...
Hardware Upgrade  -  11-9-2026
Per gli sviluppatori, il modello registra prestazioni sul benchmark DeepSWE v1.1 con una riduzione dei costi stimati per le API di circa il 57% rispetto alle configurazioni precedenti, introducendo ...
Key4biz  -  9-9-2026
Fonte della foto: Sole24ore - Infodata
Il risultato è notevole: 54,9% su HLE - Verified , 61,4% su Vals Finance Agent v2 e circa 73,8% su DeepSWE v1.1 . Ma c'è un asterisco: The Verge sottolinea che, pur mantenendo il prezzo nominale di 0,...
Sole24ore - Infodata  -  8-9-2026
Fonte della foto: Digitalic
Sullo sviluppo software OpenAI colloca Astra come il proprio miglior modello di ingegneria del codice, con il 74,1% su DeepSWE v1.1 contro il 72,7% di Sol e progressi più netti su Terminal - Bench 4.
Digitalic  -  5-9-2026
Fonte della foto: Digital Day
Su FrontierCode 1.1 Astra è dietro Claude Opus 5 sia nella versione estesa (64,5% contro 64,9%) sia in quella principale (53,3% contro 53,5%), e su DeepSWE v1.1 Gemini 3.8 Flash, un modello di fascia ...
Digital Day  -  4-9-2026
Fonte della foto: Il Messaggero
Nel benchmark DeepSWE v1.1, Astra supera le prestazioni di GPT - 5.6 Sol e, considerando la configurazione ottimale, abbassa i costi API stimati di circa il 57% . Tra le novità, una funzione ...
Il Messaggero  -  4-9-2026
Fonte della foto: Hardware Upgrade
Sul fronte dei benchmark, Muse Spark 1.3 ha ottenuto un punteggio di 75,4 nel test DeepSWE v1.1 , secondo i dati diffusi dalla stessa Meta , superando i risultati indicati per GPT - 5.6 Sol e per ...
Hardware Upgrade  -  3-9-2026
Fonte della foto: Hardware Upgrade
Guadagni sul codice, più token consumati Il guadagno più netto è sul codice: su DeepSWE v1.1 , la prova che misura la risoluzione autonoma di problemi di ingegneria del software su orizzonte lungo, 3.
Hardware Upgrade  -  3-9-2026
Fonte della foto: Hardware Upgrade
... mentre le sue cifre danno la variante multimodale in vantaggio su sei dei sette benchmark testuali: 5,6 punti in più su Toolathlon - Verified, 4,9 su DeepSWE, 4,0 su DSBench - Hard. L'unica ...
Hardware Upgrade  -  24-8-2026
Gli articoli sono stati selezionati e posizionati in questa pagina in modo automatico. L'ora o la data visualizzate si riferiscono al momento in cui l'articolo è stato aggiunto o aggiornato in Libero 24x7