Google ha rilasciato Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking il 15 settembre, definendoli i suoi modelli audio più avanzati di sempre.
I due modelli parlano, ragionano e gestiscono compiti. Ma come vengono valutati dagli analisti indipendenti? La versione Extended Thinking ha conquistato il primo posto nell’Indice Speech-to-Speech di Artificial Analysis con un punteggio di 82,6, superando GPT-Live-1 e Grok Voice.
Seguici su X per ricevere le ultime notizie in tempo reale
Come i benchmark valutano il nuovo modello di intelligenza artificiale conversazionale di Google
L’Indice di Artificial Analysis fa una media tra ragionamento sul parlato, performance agentica, preferenza nell’arena e tasso di successo nei compiti.
Gemini 3.8 Live Extended Thinking, testato anche in condizioni di ragionamento intenso, ha debuttato al primo posto. A seguire GPT-Live-1 Astra con 81,5 e Grok Voice Think Fast 2.0 High con 81,3.
Il Gemini 3.8 Live standard si è posizionato al quinto posto con un punteggio di 76,0. Entrambe le varianti hanno superato Gemini 3.1 Flash Live High, fermo a 71,5.
Il divario agentico è ancora maggiore. Extended Thinking ha raggiunto il 68,6% nel benchmark Tau Voice, contro il 37,7% della generazione precedente.
Nel benchmark di ragionamento vocale, Extended Thinking ha ottenuto il 97,7%, superando di poco Grok Voice con il 97,2%. Tuttavia, è rimasto dietro a Qwen Audio 3.0 Realtime Plus, che ha raggiunto il 99,2%.
I tester umani continuano a preferire il vecchio modello Gemini
È sul prezzo che le differenze aumentano. Il modello standard costa $0,84 all’ora per l’audio in ingresso. È circa la metà rispetto ai $1,75 del predecessore ed è la tariffa più bassa dell’Indice.
La versione Extended Thinking costa $3,50 all’ora. Un prezzo inferiore rispetto ai $4,47 di GPT-Live-1 Sol e ai $4,80 di Grok Voice Think Fast 2.0 High.
Anche la latenza è diminuita. Il tempo medio per la prima risposta audio è sceso a 1,18 secondi, rispetto ai 2,99 secondi del vecchio modello Gemini.
Tuttavia, gli ascoltatori non sono del tutto convinti. Gemini 3.1 Flash Live resta il preferito nelle conversazioni blind Speech Agent Arena, con un Elo di 1.096.
Gemini 3.8 Live si posiziona al secondo posto con 1.083. La variante Extended Thinking è dietro a 990, pur avendo completato l’89,1% dei suoi compiti.
Le AI vocali sono ora valutate su due scale che portano a risultati differenti. I benchmark premiano il modello con la capacità di ragionare maggiormente. Le preferenze premiano quello che parla meglio. Al momento, Google è in testa su entrambi i fronti, ma con modelli diversi.
Iscriviti al nostro canale YouTube per seguire leader e giornalisti che offrono analisi esperte









