I risultati migliori riguardano alcuni workload, non l'intera classifica dei modelli.
Nel materiale di lancio Mistral riporta il 61,7% su DeepSWE v1.1, il 28,3% su Terminal-Bench 4.0 e il 59,9% su AutomationBench, relativo a workflow che coinvolgono più applicazioni. Su Cybench dichiara di risolvere il 93% delle prove. Sono numeri presentati dal produttore: harness, configurazioni e condizioni di confronto vanno esaminati prima di trasferirli a una valutazione aziendale.
Nella valutazione indipendente di Artificial Analysis, la preview ottiene 38 punti nell'Intelligence Index e 50 nel Cyber Index. La stessa fonte segnala però anche un costo per task: 1,13 dollari con il listino standard nel proprio Intelligence Index, contro 0,25 dollari per GLM-5.3-Flash e 0,27 per DeepSeek V4.1 Flash, modelli con punteggi vicini. Lo sconto iniziale dimezza temporaneamente il costo di ML4 a 0,57 dollari per task. Si tratta di misure su quel benchmark, non di una stima generale per ogni workload.
Nel confronto vanno considerate anche le policy dei modelli: in alcuni test di cybersecurity un modello può rifiutare l'operazione richiesta. Mistral sottolinea proprio questo aspetto e sta conducendo test con partner di cybersecurity e autorità selezionate. Le metriche misurano sia capacità tecniche sia comportamento del sistema in uno specifico ambiente di valutazione.