<?xml version="1.0" encoding="ISO-8859-1"?>
<rss xmlns:blogChannel="http://backend.userland.com/blogChannelModule" version="2.0">
  <channel>
    <title>Libero 24x7 - "deepswe"</title>
    <link>http://247.libero.it/</link>
    <description>Libero Ricerca 24x7 Nazionali</description>
    <image>
      <title>Libero 247x7 RSS</title>
      <url>http://ms0.iol.it/images/logo122x50.gif</url>
      <link>http://247.libero.it/</link>
      <width>150</width>
      <height>68</height>
      <description>Libero 24x7</description>
    </image>
    <item>
      <title>Come è fatto Gemini 3.8 Flash?</title>
      <link>https://www.infodata.ilsole24ore.com/2026/09/12/come-e-fatto-gemini-3-8-flash/</link>
      <description> Il risultato è notevole: 54,9% su HLE - Verified , 61,4% su Vals Finance Agent v2 e circa 73,8% su &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 . Ma c'è un asterisco: The Verge sottolinea che, pur mantenendo il prezzo nominale di 0,...</description>
      <pubDate>Sat 12 Sep 2026 17:32:46 GMT</pubDate>
    </item>
    <item>
      <title>DeepSeek V4.1 - Flash sostituisce il modello di punta: più piccolo, più economico e sfida i modelli di frontiera</title>
      <link>https://www.hwupgrade.it/news/scienza-tecnologia/deepseek-v41-flash-sostituisce-il-modello-di-punta-piu-piccolo-piu-economico-e-sfida-i-modelli-di-frontiera_159010.html</link>
      <description> La stessa tabella mostra però quanto pesi l'impalcatura con cui si misura un agente: su &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 il modello segna 74,2 con mini - SWE, 69,8 con quella di Claude Code, cioè sotto entrambi i rivali ...</description>
      <pubDate>Fri 11 Sep 2026 09:33:18 GMT</pubDate>
    </item>
    <item>
      <title>OpenAI presenta il nuovo modello GPT - 6 Astra - Key4biz</title>
      <link>https://www.key4biz.it/openai-presenta-il-nuovo-modello-gpt-6-astra/586774/</link>
      <description> Per gli sviluppatori, il modello registra prestazioni sul benchmark &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 con una riduzione dei costi stimati per le API di circa il 57% rispetto alle configurazioni precedenti, introducendo ...</description>
      <pubDate>Wed 09 Sep 2026 11:03:48 GMT</pubDate>
    </item>
    <item>
      <title>Gemini 3.8 Flash contro GPT - 6 e Claude: la battaglia si sposta sul costo per task? In cinque punti</title>
      <link>https://www.infodata.ilsole24ore.com/2026/09/08/gemini-3-8/</link>
      <description> Il risultato è notevole: 54,9% su HLE - Verified , 61,4% su Vals Finance Agent v2 e circa 73,8% su &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 . Ma c'è un asterisco: The Verge sottolinea che, pur mantenendo il prezzo nominale di 0,...</description>
      <pubDate>Tue 08 Sep 2026 05:37:49 GMT</pubDate>
    </item>
    <item>
      <title>GPT - 6 Astra: cosa cambia davvero nel nuovo modello di OpenAI</title>
      <link>https://www.digitalic.it/intelligenza-artificiale/gpt-6-astra-cosa-cambia</link>
      <description> Sullo sviluppo software OpenAI colloca Astra come il proprio miglior modello di ingegneria del codice, con il 74,1% su &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 contro il 72,7% di Sol e progressi più netti su Terminal - Bench 4.</description>
      <pubDate>Sat 05 Sep 2026 08:04:17 GMT</pubDate>
    </item>
    <item>
      <title>GPT - 6 Astra è talmente forte che OpenAI parla di AGI. Ma i numeri raccontano una storia più complicata</title>
      <link>https://www.dday.it/redazione/58612/gpt-6-astra-e-talmente-forte-che-openai-parla-di-agi-ma-i-numeri-raccontano-una-storia-piu-complicata</link>
      <description> Su FrontierCode 1.1 Astra è dietro Claude Opus 5 sia nella versione estesa (64,5% contro 64,9%) sia in quella principale (53,3% contro 53,5%), e su &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 Gemini 3.8 Flash, un modello di fascia ...</description>
      <pubDate>Fri 04 Sep 2026 08:45:13 GMT</pubDate>
    </item>
    <item>
      <title>OpenAI lancia GPT - 6 Astra: cosa sa fare la nuova AI e perché segna un salto rispetto a GPT - 5.6</title>
      <link>https://www.ilmessaggero.it/tecnologia/news/chat_gpt_6_astra_cosa_sa_fare-9743043.html</link>
      <description> Nel benchmark &lt;b&gt;DeepSWE&lt;/b&gt; v1.1, Astra supera le prestazioni di GPT - 5.6 Sol e, considerando la configurazione ottimale, abbassa i costi API stimati di circa il 57% . Tra le novità, una funzione ...</description>
      <pubDate>Fri 04 Sep 2026 07:53:56 GMT</pubDate>
    </item>
    <item>
      <title>Muse Spark 1.3: Meta aggiorna il modello per coding con meno token e meno chiamate</title>
      <link>https://www.hwupgrade.it/news/web/muse-spark-13-meta-aggiorna-il-modello-per-coding-con-meno-token-e-meno-chiamate_158607.html</link>
      <description> Sul fronte dei benchmark, Muse Spark 1.3 ha ottenuto un punteggio di 75,4 nel test &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 , secondo i dati diffusi dalla stessa Meta , superando i risultati indicati per GPT - 5.6 Sol e per ...</description>
      <pubDate>Thu 03 Sep 2026 07:42:07 GMT</pubDate>
    </item>
    <item>
      <title>Gemini 3.8 Flash: nei benchmark sul codice supera modelli di frontiera più grandi e più cari</title>
      <link>https://www.hwupgrade.it/news/scienza-tecnologia/gemini-38-flash-nei-benchmark-sul-codice-supera-modelli-di-frontiera-piu-grandi-e-piu-cari_158592.html</link>
      <description> Guadagni sul codice, più token consumati Il guadagno più netto è sul codice: su &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 , la prova che misura la risoluzione autonoma di problemi di ingegneria del software su orizzonte lungo, 3.</description>
      <pubDate>Thu 03 Sep 2026 06:43:08 GMT</pubDate>
    </item>
    <item>
      <title>DeepSeek lancia un nuovo modello multimodale che sfida Anthropic sui costi</title>
      <link>https://www.hwupgrade.it/news/scienza-tecnologia/deepseek-lancia-un-nuovo-modello-multimodale-che-sfida-anthropic-sui-costi_158121.html</link>
      <description>... mentre le sue cifre danno la variante multimodale in vantaggio su sei dei sette benchmark testuali: 5,6 punti in più su Toolathlon - Verified, 4,9 su &lt;b&gt;DeepSWE&lt;/b&gt;, 4,0 su DSBench - Hard. L'unica ...</description>
      <pubDate>Mon 24 Aug 2026 09:33:11 GMT</pubDate>
    </item>
    <item>
      <title>Come è fatto Gemini 3.8 Flash?</title>
      <link>https://www.infodata.ilsole24ore.com/2026/09/12/come-e-fatto-gemini-3-8-flash/</link>
      <description> Il risultato è notevole: 54,9% su HLE - Verified , 61,4% su Vals Finance Agent v2 e circa 73,8% su &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 . Ma c'è un asterisco: The Verge sottolinea che, pur mantenendo il prezzo nominale di 0,...</description>
      <pubDate>Sat 12 Sep 2026 17:32:46 GMT</pubDate>
    </item>
    <item>
      <title>DeepSeek V4.1 - Flash sostituisce il modello di punta: più piccolo, più economico e sfida i modelli di frontiera</title>
      <link>https://www.hwupgrade.it/news/scienza-tecnologia/deepseek-v41-flash-sostituisce-il-modello-di-punta-piu-piccolo-piu-economico-e-sfida-i-modelli-di-frontiera_159010.html</link>
      <description> La stessa tabella mostra però quanto pesi l'impalcatura con cui si misura un agente: su &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 il modello segna 74,2 con mini - SWE, 69,8 con quella di Claude Code, cioè sotto entrambi i rivali ...</description>
      <pubDate>Fri 11 Sep 2026 09:33:18 GMT</pubDate>
    </item>
    <item>
      <title>GPT - 6 Astra: cosa cambia davvero nel nuovo modello di OpenAI</title>
      <link>https://www.digitalic.it/intelligenza-artificiale/gpt-6-astra-cosa-cambia</link>
      <description> Sullo sviluppo software OpenAI colloca Astra come il proprio miglior modello di ingegneria del codice, con il 74,1% su &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 contro il 72,7% di Sol e progressi più netti su Terminal - Bench 4.</description>
      <pubDate>Sat 05 Sep 2026 08:04:17 GMT</pubDate>
    </item>
    <item>
      <title>GPT - 6 Astra è talmente forte che OpenAI parla di AGI. Ma i numeri raccontano una storia più complicata</title>
      <link>https://www.dday.it/redazione/58612/gpt-6-astra-e-talmente-forte-che-openai-parla-di-agi-ma-i-numeri-raccontano-una-storia-piu-complicata</link>
      <description> Su FrontierCode 1.1 Astra è dietro Claude Opus 5 sia nella versione estesa (64,5% contro 64,9%) sia in quella principale (53,3% contro 53,5%), e su &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 Gemini 3.8 Flash, un modello di fascia ...</description>
      <pubDate>Fri 04 Sep 2026 08:45:13 GMT</pubDate>
    </item>
    <item>
      <title>Muse Spark 1.3: Meta aggiorna il modello per coding con meno token e meno chiamate</title>
      <link>https://www.hwupgrade.it/news/web/muse-spark-13-meta-aggiorna-il-modello-per-coding-con-meno-token-e-meno-chiamate_158607.html</link>
      <description> Sul fronte dei benchmark, Muse Spark 1.3 ha ottenuto un punteggio di 75,4 nel test &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 , secondo i dati diffusi dalla stessa Meta , superando i risultati indicati per GPT - 5.6 Sol e per ...</description>
      <pubDate>Thu 03 Sep 2026 07:42:07 GMT</pubDate>
    </item>
    <item>
      <title>Gemini 3.8 Flash: nei benchmark sul codice supera modelli di frontiera più grandi e più cari</title>
      <link>https://www.hwupgrade.it/news/scienza-tecnologia/gemini-38-flash-nei-benchmark-sul-codice-supera-modelli-di-frontiera-piu-grandi-e-piu-cari_158592.html</link>
      <description> Guadagni sul codice, più token consumati Il guadagno più netto è sul codice: su &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 , la prova che misura la risoluzione autonoma di problemi di ingegneria del software su orizzonte lungo, 3.</description>
      <pubDate>Thu 03 Sep 2026 06:43:08 GMT</pubDate>
    </item>
    <item>
      <title>Google lancia Gemini 3.7 Flash a meno di un mese dalla 3.6: più veloce e costa meno</title>
      <link>https://www.hwupgrade.it/news/web/google-lancia-gemini-37-flash-a-meno-di-un-mese-dalla-36-piu-veloce-e-costa-meno_157783.html</link>
      <description> Sui benchmark dedicati all'ingegneria del software, Gemini 3.7 Flash mostra un incremento prestazionale netto rispetto al predecessore 3.6 Flash: nel test &lt;b&gt;DeepSWE&lt;/b&gt; v1.1 la percentuale di risoluzione ...</description>
      <pubDate>Fri 14 Aug 2026 06:43:11 GMT</pubDate>
    </item>
  </channel>
</rss>

