Correlato a questo argomentoConsiglio Tecnologia del Futuro e IA

Il nuovo modello Sonnet di Anthropic si avvicina alle prestazioni di Opus ma utilizza più token

  • Anthropic ha annunciato il rilascio di Claude Sonnet 5.5, affermando che è oltre il 30% più veloce rispetto a Sonnet 5.
  • Artificial Analysis la classifica al secondo posto nel suo Intelligence Index, dietro solo a Opus 5.5.
  • Al massimo sforzo, Sonnet 5.5 ha utilizzato circa il 60% di token in uscita in più rispetto a Opus 5.5.
Promo

Anthropic ha rilasciato Claude Sonnet 5.5 il 28 settembre allo stesso prezzo di listino di Sonnet 5. L’azienda afferma che il modello funziona oltre il 30% più velocemente e costa fino al 30% in meno per task.

Un’azienda indipendente di benchmarking è arrivata a una conclusione diversa sui costi dopo aver spinto il modello al limite.

Seguici su X per ricevere le ultime notizie in tempo reale

Contenuto sponsorizzato
Contenuto sponsorizzato

Il secondo modello 5.5 di Anthropic arriva pochi giorni dopo Opus

Sonnet 5.5 è il secondo modello della famiglia Claude 5.5. Anthropic ha lanciato Opus 5.5 il 22 settembre. Lo stesso giorno, anche OpenAI ha rilasciato GPT-6 Sol e Luna.

Il nuovo modello mantiene i prezzi di Sonnet 5: $2 per milione di token in input e $10 per milione di token in output. Anthropic ha riportato un punteggio del 70,6% su Terminal-Bench 4.0, un test agentico di codifica. Sonnet 5 si era fermato al 10,3%, mentre Opus 5.5 ha raggiunto il 66,4%.

“Mentre Opus 5.5 è progettato per lavori complessi che richiedono un’attenta valutazione, Sonnet 5.5 è più efficace nei compiti quotidiani ben definiti, nella correzione dei bug e nella creazione di documenti, presentazioni e fogli di calcolo di qualità,” ha spiegato in dettaglio il team.

Contenuto sponsorizzato
Contenuto sponsorizzato

Anthropic ha dichiarato che Sonnet 5.5 non espande l’orizzonte delle sue capacità. Pertanto, la revisione dell’allineamento si è concentrata sui rischi come l’indurre in errore gli utenti e l’agevolare un uso improprio di alto livello.

Sonnet 5.5 introduce anche protezioni informatiche e classificatori anti-distillazione. Questi strumenti bloccano i tentativi di estrarre il ragionamento del modello per addestrare sistemi concorrenti. Nei prossimi settimane è previsto anche Claude Haiku 5.5.

Nel frattempo, OpenAI ha accantonato un modello in arrivo, GPT-6.1 Astra, per motivi di sicurezza. CNBC ha confermato lunedì che il modello non ha soddisfatto gli standard dell’azienda.

Artificial Analysis rileva un utilizzo maggiore di token alla massima intensità

Artificial Analysis, l’azienda di benchmarking che ha classificato Grok 4.7 al quarto posto, ha attribuito a Sonnet 5.5 un punteggio di 56 nel suo Intelligence Index. Questo lo colloca al secondo posto assoluto, 2 punti dietro Opus 5.5 alla massima intensità.

Contenuto sponsorizzato
Contenuto sponsorizzato

L’azienda ha registrato un 64% per Sonnet 5.5 su Terminal-Bench 4.0, contro il 60% di Opus 5.5 e GPT-6 Astra. Nei test di knowledge work come GDPval-AA, ha rilevato che Sonnet 5.5 si equipara praticamente a Opus 5.5.

L’azienda ha spiegato che Sonnet 5.5 ha utilizzato un numero significativamente superiore di token per ottenere questi risultati.

“Alla massima intensità, dove raggiunge prestazioni vicine a quelle di Opus 5.5, Claude Sonnet 5.5 ha utilizzato circa 193.000 token in output per ogni task dell’Intelligence Index,” si legge nel post.

Questo volume è circa il 60% superiore rispetto a Opus 5.5 e Sonnet 5 alla massima intensità. È anche circa 7 volte superiore rispetto a GPT-6 Astra nello stesso scenario.

I clienti early-access citati da Anthropic hanno riportato la tendenza opposta rispetto a Sonnet 5, sebbene in altre tipologie di task. Balyasny Asset Management ha riscontrato un utilizzo decisamente più basso di token nelle operazioni finanziarie.

“Nel nostro pacchetto privato di 2.441 task finanziari tra cui Q&A, estrazione, analisi e previsioni, Claude Sonnet 5.5 ha superato Sonnet 5 e ha utilizzato circa 121.000 token per risposta, mentre Sonnet 5 ne utilizzava 497.000,” ha dichiarato Joe Poirier, Senior AI Engineer di Balyasny Asset Management.

Artificial Analysis ha testato una versione pre-release affetta da un bug di output strutturato che Anthropic ha poi risolto. L’azienda intende ripetere presto le valutazioni rilevanti.

Iscriviti al nostro canale YouTube per vedere leader e giornalisti condividere analisi e approfondimenti

Disclaimer

BeInCrypto si impegna a garantire un'informazione imparziale e trasparente. Questo articolo di notizie si propone di fornire informazioni accurate e tempestive. Tuttavia, si consiglia ai lettori di verificare i fatti in modo indipendente e di consultare un professionista prima di prendere qualsiasi decisione basata su questo contenuto. Si prega di notare che i nostri Termini e Condizioni, la nostra Informativa sulla Privacy e i nostri Disclaimer sono stati aggiornati.

Contenuto sponsorizzato
Contenuto sponsorizzato