Il Muse Code di Zuckerberg perde contro Anthropic sulle stesse classifiche di benchmark di Meta

  • Zuckerberg ha lanciato Muse Code, e le classifiche interne di Meta mettono Claude Opus 5 al primo posto.
  • Meta ha escluso il modello di programmazione più avanzato di OpenAI dai suoi confronti nei benchmark.
  • Test indipendenti mostrano che il vero leader ottiene il 89,5%, al di sopra di ogni valore registrato da Meta.
Promo

Mark Zuckerberg ha lanciato in versione beta Muse Code mercoledì, il primo agente di coding basato su intelligenza artificiale (AI) di Meta. Claude Opus 5 di Anthropic lo supera in tutti e quattro i confronti pubblicati da Meta al lancio.

Meta ha comunque pubblicato quei grafici. L’azienda sta offrendo un tool più economico piuttosto che uno migliore. Dati di test indipendenti suggeriscono che la differenza sia ancora più ampia rispetto a quanto mostrato da Meta.

Contenuto sponsorizzato
Contenuto sponsorizzato

Seguici su X per ricevere le ultime notizie in tempo reale

I grafici di Meta danno sempre la vittoria ad Anthropic

Muse Spark 1.2 è il modello alla base di Muse Code. Ha ottenuto un punteggio dell’82,9% su Terminal-Bench 2.1.

Claude Opus 5 ha ottenuto l’86,7% nello stesso test. Terminal-Bench è stato sviluppato dal Laude Institute e da ricercatori di Stanford. Prevede 89 task reali, che spaziano dalla riparazione di sistemi, ai lavori sui dati, fino alla sicurezza informatica.

Il secondo posto è comunque rispettabile. Muse Code ha battuto Codex di OpenAI, fermo all’81,8%, e Grok Build all’81,6%.

Grafico di confronto dei benchmark per Muse Spark 1.2
Grafico di confronto dei benchmark per Muse Spark 1.2. Fonte: Zuckerberg

Il grafico successivo è stato più severo. DeepSWE 1.1 prevede 113 task di programmazione con internet disattivato durante la valutazione. Muse Spark 1.2 scende al terzo posto con il 59,3%.

Meta ha poi pubblicato un test progettato internamente, basato su 440 reali pull request dei suoi ingegneri. Muse Spark 1.2 ha ottenuto il 70,6%, circa nove punti in meno rispetto a Opus 5.

Contenuto sponsorizzato
Contenuto sponsorizzato
Muse Spark 1.2 ha eseguito per 24 ore un task di ottimizzazione kernel su NVIDIA Hopper — oltre mille chiamate agli strumenti — continuando a trovare reali miglioramenti di velocità anche dopo la prima fase di esplorazione.
Muse Spark 1.2 ha eseguito per 24 ore un task di ottimizzazione kernel su NVIDIA Hopper — oltre mille chiamate agli strumenti — continuando a trovare reali miglioramenti di velocità anche dopo la prima fase di esplorazione.

Quel risultato è superiore solo di 2,3 punti rispetto a Muse Spark 1.1, il modello che Meta aveva lanciato a luglio.

Il modello che Meta ha escluso dai suoi grafici di coding

Meta si è confrontata con GPT-5.6 Terra. OpenAI propone però un modello più potente chiamato Sol, che Meta ha escluso da tutti e tre i suoi grafici di coding.

Sol guida la classifica indipendente di Terminal-Bench 2.1 con l’89,5%. Opus 5 segue con l’89,1%.

Entrambi i valori battono l’86,7% riportato da Meta per Opus 5. Meta ha scelto una versione meno potente del suo rivale più forte, arrivando comunque dietro.

Contenuto sponsorizzato
Contenuto sponsorizzato

Rispetto a Sol, il vero leader, Muse Spark 1.2 dista 6,6 punti percentuali anziché 3,8.

Meta ha incluso Sol solo in un caso. Su un task di ottimizzazione kernel tramite GPU, superate le mille chiamate agli strumenti, Sol ha superato la baseline del 71,2%. Muse Spark 1.2 ha raggiunto il 68,7%, posizionandosi quarta su sei partecipanti.

C’è una nota da considerare nel senso opposto. Muse Spark 1.2 non compare ancora in quella classifica pubblica, dove solo 26 su 183 modelli valutati sono stati testati. Il risultato dell’82,9% resta una cifra fornita da Meta.

“Muse Spark 1.2 rappresenta il nostro prossimo passo mentre puntiamo al frontier, con modelli sempre più grandi e avanzati in arrivo”, ha spiegato in dettaglio Zuckerberg in un post.

Presto Zuckerberg potrebbe ospitare il modello che supera il suo

Secondo alcune indiscrezioni, Meta sarebbe in trattative per affittare potenza di calcolo ad Anthropic. L’accordo potrebbe raggiungere i 10 miliardi di dollari in due anni. I data center di Meta contribuirebbero così a far funzionare i modelli Claude a cui Muse Code cerca di togliere il primato.

La leadership che ha portato alla nascita di Muse Code è costata cara. A giugno 2025 Zuckerberg ha speso 14,3 miliardi di dollari per acquisire Scale AI e il suo fondatore Alexandr Wang, ora a capo dei Meta Superintelligence Labs.

Il prezzo è la leva rimasta a Wang. Le tariffe sono in linea con il lancio di luglio della prima API a pagamento di Meta, pari a $1,25 per milione di token input e $4,25 per milione di token output.

Il tier destinato ai contributor costa oltre dieci volte meno. Gli sviluppatori possono accedere se consentono a Meta di utilizzare il proprio lavoro per addestrare i suoi modelli. Wang non ha fornito dettagli sul numero di adesioni alla linea Muse Spark.

I dati contabili di Meta spiegano lo sconto. I ricavi sono saliti del 28% a 60,8 miliardi di dollari nell’ultimo trimestre, ma l’utile operativo è sceso dell’8% a 18,8 miliardi di dollari.

Il margine operativo è sceso al 31% contro il 43% di un anno fa. Solo nel trimestre Meta ha speso 31,08 miliardi di dollari in progetti strutturali, prevedendo un massimo di 145 miliardi di dollari su base annua.

Muse Code offre alcune funzionalità ingegneristiche oggi assenti in Claude Code. Agenti di sfondo mantengono il contesto dell’intera sessione. Sottoagenti lavorano in copie isolate di un repository.

Meta ha creato un solido secondo posto nel coding AI, e lo ha proposto come opzione economica. La beta mostrerà se gli sviluppatori sceglieranno di sacrificare qualche punto di precisione in cambio di una spesa pari a circa un decimo.


Per leggere le ultime analisi di mercato sulle criptovalute di BeInCrypto, clicca qui.

Disclaimer

Tutte le informazioni contenute nel nostro sito web sono pubblicate in buona fede e solo a scopo informativo generale. Qualsiasi azione intrapresa dal lettore in base alle informazioni contenute nel nostro sito web è strettamente a suo rischio e pericolo.

Contenuto sponsorizzato
Contenuto sponsorizzato