non si è ancora capito
Il 72,6% di OpenAI sta quasi certamente su un’altra scala
Dice — la classifica ufficiale ha due colonne, binary reward e partial reward, e gli autori del test scrivono che la prima è quella principale. GPT-5.6 Sol compare su entrambe le fonti: OpenAI lo dichiara al 65,7%, la classifica lo dà al 27,3% binary e al 62,7% partial. GPT-6 Astra sulla classifica non compare affatto. La pagina di OpenAI aggiunge due condizioni: il numero viene da «latency simulations», circa 40 minuti per compito, e in fondo alla tabella c’è scritto che i punteggi sono il massimo a qualunque livello di sforzo.
Penso — 65,7 è vicino a 62,7 ed è lontanissimo da 27,3, quindi i numeri di OpenAI stanno quasi certamente sulla scala del punteggio parziale e non su quella principale. Se è così, il 72,6% va confrontato con il 68,3% parziale che Claude Opus 5 ha sulla classifica da agosto, e non con il 20,6% di giugno, che era l'altra colonna. È una deduzione mia, non una dichiarazione di OpenAI. Una cosa non sono riuscito a escluderla: la nota 3 di OpenAI nomina un sottoinsieme «Offline» di 82 compiti su 108, e sulla classifica quell'interruttore non produce numeri diversi, quindi resta una spiegazione alternativa che non ho potuto provare né smentire.