|
Benchmark e prezzi delle API Insieme al modello, Google ha anche presentato diversi benchmark a supporto delle proprie affermazioni: nel test DeepSWE v1.1 dedicato all'ingegneria del software, Gemini ...
everyeye.it - Tech & Scienza
-
11 ore fa
|
|
|
|
Nelle valutazioni interne di Google , raggiunge il 77,9% su DeepSWE v1.1, contro il 74,2% di Claude Opus 5.5 . La classifica Vals conferma invece il 68,9% sul Vals Index, davanti al 67,04% di Claude ...
La Mia Finanza
-
1-10-2026
|
|
|
|
Argon ottiene il 77,9% su DeepSWE v1.1, il 51,3% su AutomationBench, dove è indicato al primo posto, e il 91,7% su LVBench, che valuta la comprensione di video lunghi. Su CWE - bench v1, che misura ...
La Stampa
-
1-10-2026
|
|
|
|
Sul fronte dello sviluppo software la rivendicazione è chiarissima: 77,9% su DeepSWE v1.1 , benchmark che misura compiti di ingegneria del software reali e di lunga durata. Dietro, secondo i numeri ...
Hardware Upgrade
-
1-10-2026
|
|
|
|
I numeri di DeepSWE v1.1 , che misura interventi di ingegneria del software su codebase reali, danno ragione al comunicato: 75,2% con reasoning su high, contro il 74,8% di Astra e il 68,8% di GPT - 6 ...
Hardware Upgrade
-
30-9-2026
|
|
|
|
È disponibile in ChatGPT Work, Codex e API, ancora non nella Chat Cosa dicono i benchmark Nei test pubblicati da OpenAI, rispetto a Sol precedente guadagna 6,4 punti percentuali su DeepSWE , per l'...
Sole24ore - Infodata
-
30-9-2026
|
|
|
|
Su DeepSWE v1.1, con impostazione ad alto sforzo computazionale, Grok 4.7 tocca il 71% , mentre su EEBench, il benchmark dedicato all'ingegneria elettrica, si ferma al 64% . Sul fronte del lavoro d'...
Hardware Upgrade
-
22-9-2026
|
|
|
|
Il risultato è notevole: 54,9% su HLE - Verified , 61,4% su Vals Finance Agent v2 e circa 73,8% su DeepSWE v1.1 . Ma c'è un asterisco: The Verge sottolinea che, pur mantenendo il prezzo nominale di 0,...
Sole24ore - Infodata
-
12-9-2026
|
|
|
|
La stessa tabella mostra però quanto pesi l'impalcatura con cui si misura un agente: su DeepSWE v1.1 il modello segna 74,2 con mini - SWE, 69,8 con quella di Claude Code, cioè sotto entrambi i rivali ...
Hardware Upgrade
-
11-9-2026
|
|
|
|
Per gli sviluppatori, il modello registra prestazioni sul benchmark DeepSWE v1.1 con una riduzione dei costi stimati per le API di circa il 57% rispetto alle configurazioni precedenti, introducendo ...
Key4biz
-
9-9-2026
|
|
|
|