GPT-6 Astra costa 2,5x Sol per token. Parla come una persona
GPT-6 Astra consuma crediti a 2,5 volte la tariffa di Sol e in chat sembra più umano. Ho verificato i limiti di utilizzo, i benchmark e le prime reazioni.
Argomento
Tutti gli articoli con il tag benchmarks, dal più recente.
GPT-6 Astra consuma crediti a 2,5 volte la tariffa di Sol e in chat sembra più umano. Ho verificato i limiti di utilizzo, i benchmark e le prime reazioni.
Muse Spark 1.3 ha segnato 62 su Artificial Analysis, sopra GPT-6 Astra, poi è finito nono. Ho ricostruito da dove veniva il punteggio e quanto costa.
Fable 5.1 supera Fable 5 nei compiti lunghi svolti da agenti, ma Opus 5 resta vicino e ha tariffe base dimezzate. Ho verificato benchmark e primi report.
V4 Flash costa 0,14 $ in ingresso e 0,28 $ in uscita per milione di token. Ho verificato se lo sconto dal 97 al 99% compensa le sconfitte nei benchmark.
DeepSWE mette Luna Max 2,2 punti dietro Sol High a circa un sesto del costo per tentativo. Spiego perché nei repository i due modelli restano molto diversi.
Ho confrontato Sol, Terra, Opus 5 e Fable 5 nei benchmark di coding. Il vincitore cambia a seconda del task, dell'effort, dell'agente e del budget.
Kimi K3 pareggia GPT-5.6 medium, ma richiede 4,6 volte il tempo. GLM-5.2 costa poco per token e molto per task. Verifico dove entrambi hanno ancora senso.
Opus 5 eguaglia Fable 5 nei benchmark e costa la metà per token, ma supervisionarlo è frustrante. Ecco perché Fable merita ancora il ruolo di capo.