deepswe

Ordina per:Più recentePiù letto
Fonte della foto: everyeye.it - Tech & Scienza
Benchmark e prezzi delle API Insieme al modello, Google ha anche presentato diversi benchmark a supporto delle proprie affermazioni: nel test DeepSWE v1.1 dedicato all'ingegneria del software, Gemini ...
everyeye.it - Tech & Scienza  -  11 ore fa
Fonte della foto: La Mia Finanza
Nelle valutazioni interne di Google , raggiunge il 77,9% su DeepSWE v1.1, contro il 74,2% di Claude Opus 5.5 . La classifica Vals conferma invece il 68,9% sul Vals Index, davanti al 67,04% di Claude ...
La Mia Finanza  -  1-10-2026
Fonte della foto: La Stampa
Argon ottiene il 77,9% su DeepSWE v1.1, il 51,3% su AutomationBench, dove è indicato al primo posto, e il 91,7% su LVBench, che valuta la comprensione di video lunghi. Su CWE - bench v1, che misura ...
La Stampa  -  1-10-2026
Fonte della foto: Hardware Upgrade
Sul fronte dello sviluppo software la rivendicazione è chiarissima: 77,9% su DeepSWE v1.1 , benchmark che misura compiti di ingegneria del software reali e di lunga durata. Dietro, secondo i numeri ...
Hardware Upgrade  -  1-10-2026
Persone:atmoswiz
Organizzazioni:googleastra
Fonte della foto: Hardware Upgrade
I numeri di DeepSWE v1.1 , che misura interventi di ingegneria del software su codebase reali, danno ragione al comunicato: 75,2% con reasoning su high, contro il 74,8% di Astra e il 68,8% di GPT - 6 ...
Hardware Upgrade  -  30-9-2026
Persone:atmosmax
Organizzazioni:astraopenai
Prodotti:ad astraapi
Tags:gptprezzo
Fonte della foto: Sole24ore - Infodata
È disponibile in ChatGPT Work, Codex e API, ancora non nella Chat Cosa dicono i benchmark Nei test pubblicati da OpenAI, rispetto a Sol precedente guadagna 6,4 punti percentuali su DeepSWE , per l'...
Sole24ore - Infodata  -  30-9-2026
Fonte della foto: Hardware Upgrade
Su DeepSWE v1.1, con impostazione ad alto sforzo computazionale, Grok 4.7 tocca il 71% , mentre su EEBench, il benchmark dedicato all'ingegneria elettrica, si ferma al 64% . Sul fronte del lavoro d'...
Hardware Upgrade  -  22-9-2026
Persone:atmoslatchbio
Organizzazioni:spacexaiamazon
Prodotti:smart tvdolby
Luoghi:elo
Fonte della foto: Sole24ore - Infodata
Il risultato è notevole: 54,9% su HLE - Verified , 61,4% su Vals Finance Agent v2 e circa 73,8% su DeepSWE v1.1 . Ma c'è un asterisco: The Verge sottolinea che, pur mantenendo il prezzo nominale di 0,...
Sole24ore - Infodata  -  12-9-2026
Fonte della foto: Hardware Upgrade
La stessa tabella mostra però quanto pesi l'impalcatura con cui si misura un agente: su DeepSWE v1.1 il modello segna 74,2 con mini - SWE, 69,8 con quella di Claude Code, cioè sotto entrambi i rivali ...
Hardware Upgrade  -  11-9-2026
Per gli sviluppatori, il modello registra prestazioni sul benchmark DeepSWE v1.1 con una riduzione dei costi stimati per le API di circa il 57% rispetto alle configurazioni precedenti, introducendo ...
Key4biz  -  9-9-2026
FOTO
1 di 3
2 di 3
3 di 3
Gli articoli sono stati selezionati e posizionati in questa pagina in modo automatico. L'ora o la data visualizzate si riferiscono al momento in cui l'articolo è stato aggiunto o aggiornato in Libero 24x7