Google ha appena rilasciato il suo modello audio più avanzato, ecco come si posiziona

  • Il nuovo modello vocale di Google guida l’indice del parlato di Artificial Analysis con un punteggio di 82,6.
  • Gemini 3.8 Live costa 84 centesimi all’ora, la versione audio più economica dell’indice.
  • I tester umani nei test vocali alla cieca preferiscono ancora la precedente Gemini 3.1 Flash Live.
Promo

Google ha rilasciato Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking il 15 settembre, definendoli i suoi modelli audio più avanzati di sempre.

I due modelli parlano, ragionano e gestiscono compiti. Ma come vengono valutati dagli analisti indipendenti? La versione Extended Thinking ha conquistato il primo posto nell’Indice Speech-to-Speech di Artificial Analysis con un punteggio di 82,6, superando GPT-Live-1 e Grok Voice.

Seguici su X per ricevere le ultime notizie in tempo reale

Come i benchmark valutano il nuovo modello di intelligenza artificiale conversazionale di Google

L’Indice di Artificial Analysis fa una media tra ragionamento sul parlato, performance agentica, preferenza nell’arena e tasso di successo nei compiti.

Contenuto sponsorizzato
Contenuto sponsorizzato

Gemini 3.8 Live Extended Thinking, testato anche in condizioni di ragionamento intenso, ha debuttato al primo posto. A seguire GPT-Live-1 Astra con 81,5 e Grok Voice Think Fast 2.0 High con 81,3.

Come si è classificato Gemini 3.8 Live nell'Indice Speech-to-Speech
Come si è classificato Gemini 3.8 Live nell’Indice Speech-to-Speech. Fonte: Artificial Analysis

Il Gemini 3.8 Live standard si è posizionato al quinto posto con un punteggio di 76,0. Entrambe le varianti hanno superato Gemini 3.1 Flash Live High, fermo a 71,5.

Il divario agentico è ancora maggiore. Extended Thinking ha raggiunto il 68,6% nel benchmark Tau Voice, contro il 37,7% della generazione precedente.

Nel benchmark di ragionamento vocale, Extended Thinking ha ottenuto il 97,7%, superando di poco Grok Voice con il 97,2%. Tuttavia, è rimasto dietro a Qwen Audio 3.0 Realtime Plus, che ha raggiunto il 99,2%.

I tester umani continuano a preferire il vecchio modello Gemini

È sul prezzo che le differenze aumentano. Il modello standard costa $0,84 all’ora per l’audio in ingresso. È circa la metà rispetto ai $1,75 del predecessore ed è la tariffa più bassa dell’Indice.

La versione Extended Thinking costa $3,50 all’ora. Un prezzo inferiore rispetto ai $4,47 di GPT-Live-1 Sol e ai $4,80 di Grok Voice Think Fast 2.0 High.

Anche la latenza è diminuita. Il tempo medio per la prima risposta audio è sceso a 1,18 secondi, rispetto ai 2,99 secondi del vecchio modello Gemini.

Tuttavia, gli ascoltatori non sono del tutto convinti. Gemini 3.1 Flash Live resta il preferito nelle conversazioni blind Speech Agent Arena, con un Elo di 1.096.

Gemini 3.8 Live si posiziona al secondo posto con 1.083. La variante Extended Thinking è dietro a 990, pur avendo completato l’89,1% dei suoi compiti.

Le AI vocali sono ora valutate su due scale che portano a risultati differenti. I benchmark premiano il modello con la capacità di ragionare maggiormente. Le preferenze premiano quello che parla meglio. Al momento, Google è in testa su entrambi i fronti, ma con modelli diversi.

Iscriviti al nostro canale YouTube per seguire leader e giornalisti che offrono analisi esperte

Disclaimer

BeInCrypto si impegna a garantire un'informazione imparziale e trasparente. Questo articolo di notizie si propone di fornire informazioni accurate e tempestive. Tuttavia, si consiglia ai lettori di verificare i fatti in modo indipendente e di consultare un professionista prima di prendere qualsiasi decisione basata su questo contenuto. Si prega di notare che i nostri Termini e Condizioni, la nostra Informativa sulla Privacy e i nostri Disclaimer sono stati aggiornati.

Contenuto sponsorizzato
Contenuto sponsorizzato