Anthropic ha rilasciato Claude Sonnet 5.5 il 28 settembre allo stesso prezzo di listino di Sonnet 5. L’azienda afferma che il modello funziona oltre il 30% più velocemente e costa fino al 30% in meno per task.
Un’azienda indipendente di benchmarking è arrivata a una conclusione diversa sui costi dopo aver spinto il modello al limite.
Seguici su X per ricevere le ultime notizie in tempo reale
Il secondo modello 5.5 di Anthropic arriva pochi giorni dopo Opus
Sonnet 5.5 è il secondo modello della famiglia Claude 5.5. Anthropic ha lanciato Opus 5.5 il 22 settembre. Lo stesso giorno, anche OpenAI ha rilasciato GPT-6 Sol e Luna.
Il nuovo modello mantiene i prezzi di Sonnet 5: $2 per milione di token in input e $10 per milione di token in output. Anthropic ha riportato un punteggio del 70,6% su Terminal-Bench 4.0, un test agentico di codifica. Sonnet 5 si era fermato al 10,3%, mentre Opus 5.5 ha raggiunto il 66,4%.
“Mentre Opus 5.5 è progettato per lavori complessi che richiedono un’attenta valutazione, Sonnet 5.5 è più efficace nei compiti quotidiani ben definiti, nella correzione dei bug e nella creazione di documenti, presentazioni e fogli di calcolo di qualità,” ha spiegato in dettaglio il team.
Anthropic ha dichiarato che Sonnet 5.5 non espande l’orizzonte delle sue capacità. Pertanto, la revisione dell’allineamento si è concentrata sui rischi come l’indurre in errore gli utenti e l’agevolare un uso improprio di alto livello.
Sonnet 5.5 introduce anche protezioni informatiche e classificatori anti-distillazione. Questi strumenti bloccano i tentativi di estrarre il ragionamento del modello per addestrare sistemi concorrenti. Nei prossimi settimane è previsto anche Claude Haiku 5.5.
Nel frattempo, OpenAI ha accantonato un modello in arrivo, GPT-6.1 Astra, per motivi di sicurezza. CNBC ha confermato lunedì che il modello non ha soddisfatto gli standard dell’azienda.
Artificial Analysis rileva un utilizzo maggiore di token alla massima intensità
Artificial Analysis, l’azienda di benchmarking che ha classificato Grok 4.7 al quarto posto, ha attribuito a Sonnet 5.5 un punteggio di 56 nel suo Intelligence Index. Questo lo colloca al secondo posto assoluto, 2 punti dietro Opus 5.5 alla massima intensità.
L’azienda ha registrato un 64% per Sonnet 5.5 su Terminal-Bench 4.0, contro il 60% di Opus 5.5 e GPT-6 Astra. Nei test di knowledge work come GDPval-AA, ha rilevato che Sonnet 5.5 si equipara praticamente a Opus 5.5.
L’azienda ha spiegato che Sonnet 5.5 ha utilizzato un numero significativamente superiore di token per ottenere questi risultati.
“Alla massima intensità, dove raggiunge prestazioni vicine a quelle di Opus 5.5, Claude Sonnet 5.5 ha utilizzato circa 193.000 token in output per ogni task dell’Intelligence Index,” si legge nel post.
Questo volume è circa il 60% superiore rispetto a Opus 5.5 e Sonnet 5 alla massima intensità. È anche circa 7 volte superiore rispetto a GPT-6 Astra nello stesso scenario.
I clienti early-access citati da Anthropic hanno riportato la tendenza opposta rispetto a Sonnet 5, sebbene in altre tipologie di task. Balyasny Asset Management ha riscontrato un utilizzo decisamente più basso di token nelle operazioni finanziarie.
“Nel nostro pacchetto privato di 2.441 task finanziari tra cui Q&A, estrazione, analisi e previsioni, Claude Sonnet 5.5 ha superato Sonnet 5 e ha utilizzato circa 121.000 token per risposta, mentre Sonnet 5 ne utilizzava 497.000,” ha dichiarato Joe Poirier, Senior AI Engineer di Balyasny Asset Management.
Artificial Analysis ha testato una versione pre-release affetta da un bug di output strutturato che Anthropic ha poi risolto. L’azienda intende ripetere presto le valutazioni rilevanti.
Iscriviti al nostro canale YouTube per vedere leader e giornalisti condividere analisi e approfondimenti









