Muse Spark 1.3: «xhigh» raggiunge il livello GPT-5.6-Sol
Nel coding agent Muse Code, che funziona su macOS e Linux, Muse Spark 1.3 è ora disponibile al pubblico; tramite la Model API può essere utilizzato indipendentemente dalla piattaforma. La piattaforma indipendente di benchmark Artificial Analysis assegna al livello di reasoning disponibile «xhigh» 61 punti nell’Intelligence Index: si colloca così allo stesso livello di GPT-5.6 Sol «max».
Meta orienta la nuova versione allo sviluppo software e ai compiti agentici in generale. Rispetto a Muse Spark 1.2, Spark 1.3 dovrebbe seguire con maggiore affidabilità le istruzioni complesse, gestire meglio più compiti contemporaneamente e migliorare la collaborazione con gli utenti. Il modello elabora testo, immagini e video; la sua finestra di contesto resta invariata a un milione di token.
Anche i benchmark interni di Meta mostrano progressi. Allo stesso livello di reasoning «xhigh», Spark 1.3 supera nettamente il predecessore in GDPVal-AA v2 e Terminal-Bench 2.1. In GDPVal-AA v2 è praticamente alla pari con GPT-5.6 Sol «max», ma resta dietro a Claude Opus 5 «max»; in Terminal-Bench 2.1 è di poco avanti rispetto a entrambi. Il grafico comparativo del post sul blog di Meta mette però sistematicamente a confronto Spark 1.3 «max» con Spark 1.2 «xhigh»: a parità di livello, alcuni progressi risultano più contenuti.
Artificial Analysis conferma il passaggio da 57 a 61 punti e vede i progressi maggiori nel lavoro agentico della conoscenza. Il livello superiore «max» raggiunge 62 punti, ma al lancio non è ancora disponibile per tutti. Per il punto aggiuntivo, secondo Artificial Analysis, nei test GDPVal-AA richiede circa il 62% in più di token di reasoning rispetto a «xhigh»; Meta renderà disponibile «max» dopo ulteriori test di sicurezza.
In concreto, per gli sviluppatori cambia questo: possono già utilizzare un modello più potente per le attività di coding tramite Muse Code o l’API, senza dover attendere la pubblicazione annunciata dei pesi del modello aperti. Il prezzo standard resta di 1,25 dollari USA per ogni milione di token di input e 4,25 dollari USA per ogni milione di token di output. Il piano Contributor costa 0,10 dollari per l’input, 0,20 dollari per l’output e 0,002 dollari per gli input memorizzati nella cache, con il chiaro compromesso che Meta può utilizzare prompt e risposte per addestrare i modelli futuri.
Commenti
Caricamento della discussione…
Accedi per scrivere un commento. Accedi