EMPVResearch NotesEN
EMPV / RESEARCH NOTESNOTE / 010

NEWS NOTE / OPEN MODELS

Mistral Large 4: il modello europeo da un trilione di parametri

Mistral presenta un modello multimodale Mixture-of-Experts addestrato su infrastruttura europea. La preview API è disponibile, ma i pesi sono previsti per fine ottobre. I test indipendenti mostrano punti di forza nel cyber e costi da valutare.

Pubblicata2026-10-09 · 6 min
Mistral Large 4Open-weight AIMixture-of-ExpertsSovranità AI
01 / L'annuncio

Per ora è una preview via API. I pesi non sono ancora scaricabili.

Il 6 ottobre 2026 Mistral ha presentato Mistral Large 4 (ML4), nome informale «Le Chonk», aprendo l'accesso pubblico in anteprima tramite Mistral Studio. È il modello più grande dell'azienda francese, pensato per coding, workflow agentici e analisi multimodale.

La distinzione sulla disponibilità conta: al 9 ottobre si può usare la preview API, mentre Mistral annuncia i pesi per la fine del mese. Non è quindi corretto descrivere ML4 come un modello già scaricabile e installabile in produzione.

02 / Architettura

Un trilione di parametri totali non significa usarli tutti per ogni token.

La documentazione tecnica descrive un modello multimodale con architettura granular Mixture-of-Experts (MoE) da circa 1,05 trilioni di parametri e un encoder visivo da 1,6 miliardi. La pagina tecnica di Mistral indica 52 miliardi di parametri attivi, mentre Artificial Analysis ne riporta 49 miliardi. Le due cifre circolano nei materiali pubblici; senza dettagli finali dell'architettura, è prudente non usarle come se fossero direttamente intercambiabili.

Il routing MoE attiva soltanto un sottoinsieme degli esperti per generare ciascun token. L'infrastruttura deve comunque gestire un modello complessivo nell'ordine del trilione di parametri: il dato sugli esperti attivi non equivale al footprint di un modello denso da 49 o 52 miliardi.

Mistral dichiara supporto multilingue su oltre 160 lingue. La model card indica una finestra di contesto fino a 1 milione di token, mentre Artificial Analysis rileva circa 524.000 token per la configurazione API valutata. La dimensione effettivamente disponibile dipende dall'endpoint e va controllata prima di progettare applicazioni a contesto lungo.

03 / Prestazioni

I risultati migliori riguardano alcuni workload, non l'intera classifica dei modelli.

Nel materiale di lancio Mistral riporta il 61,7% su DeepSWE v1.1, il 28,3% su Terminal-Bench 4.0 e il 59,9% su AutomationBench, relativo a workflow che coinvolgono più applicazioni. Su Cybench dichiara di risolvere il 93% delle prove. Sono numeri presentati dal produttore: harness, configurazioni e condizioni di confronto vanno esaminati prima di trasferirli a una valutazione aziendale.

Nella valutazione indipendente di Artificial Analysis, la preview ottiene 38 punti nell'Intelligence Index e 50 nel Cyber Index. La stessa fonte segnala però anche un costo per task: 1,13 dollari con il listino standard nel proprio Intelligence Index, contro 0,25 dollari per GLM-5.3-Flash e 0,27 per DeepSeek V4.1 Flash, modelli con punteggi vicini. Lo sconto iniziale dimezza temporaneamente il costo di ML4 a 0,57 dollari per task. Si tratta di misure su quel benchmark, non di una stima generale per ogni workload.

Nel confronto vanno considerate anche le policy dei modelli: in alcuni test di cybersecurity un modello può rifiutare l'operazione richiesta. Mistral sottolinea proprio questo aspetto e sta conducendo test con partner di cybersecurity e autorità selezionate. Le metriche misurano sia capacità tecniche sia comportamento del sistema in uno specifico ambiente di valutazione.

04 / Infrastruttura europea

L'addestramento europeo è documentato; l'autonomia operativa dipenderà anche dai pesi e dal deployment.

Secondo Mistral, ML4 è stato addestrato da zero usando 3.800 GPU NVIDIA Grace Blackwell nei data center europei dell'azienda. Anche la preview è servita dalla stessa infrastruttura. Si tratta di una scelta industriale concreta: training e inferenza non dipendono, per questa versione, dall'accesso a un servizio API statunitense.

Per un'impresa, però, «sovranità AI» può indicare cose diverse: dove transitano i dati, chi gestisce l'inferenza, chi controlla i log, chi può interrompere il servizio, e se sia possibile spostare il modello. L'arrivo dei pesi aggiungerebbe un'opzione di deployment autonomo, ma non renderebbe automaticamente semplice eseguire un MoE di queste dimensioni su hardware aziendale.

Abbiamo affrontato lo stesso confine operativo nella nota su AI on-premise e cloud: il luogo di esecuzione è una scelta che discende dai dati, dai vincoli di integrazione e dalla capacità di gestire il sistema.

05 / Adozione aziendale

Il test più utile riguarda un processo intero, non una risposta isolata.

Le capacità dichiarate per documenti, immagini, uso di strumenti e ragionamento possono essere interessanti in workflow come analisi di documentazione tecnica, supporto a incident response o preparazione di dossier a partire da fonti eterogenee. Ma il modello è solo uno dei componenti: permessi, ricerca delle fonti, API, revisione umana e controllo delle azioni restano fuori dal checkpoint.

Un test riproducibile dovrebbe usare documenti e task del proprio dominio, definire in anticipo che cosa significa completare il lavoro, registrare errori e interventi umani, e misurare costo e latenza end-to-end. È il criterio già descritto nella nostra nota su come valutare un LLM locale prima della produzione.

Per esempio, in un flusso di analisi di documenti industriali non basta che ML4 descriva correttamente un disegno. Bisogna controllare se identifica la revisione giusta, cita il documento di origine, evita informazioni non autorizzate e segnala quando un dettaglio non è leggibile.

06 / Le verifiche aperte

La versione scaricabile dovrà chiarire licenza, requisiti e riproducibilità dei test.

Mistral ha annunciato che pubblicherà insieme ai pesi ulteriori informazioni su architettura, benchmark e post-training. Alla data di questa nota, i dettagli definitivi della licenza e il comportamento di una configurazione self-hosted non possono ancora essere valutati sul checkpoint pubblico, perché quel checkpoint non è stato rilasciato.

Il prossimo passaggio utile è quindi verificare il rilascio effettivo, i requisiti di memoria e acceleratori, il supporto dei runtime, le condizioni di licenza e la distanza fra prestazioni della preview API e deployment autonomo. La valutazione preliminare di Artificial Analysis è un riferimento per l'API di oggi, non una garanzia per qualunque implementazione futura.

ML4 mostra che un laboratorio europeo può progettare, addestrare e servire un modello di questa scala sulla propria infrastruttura. Quanto di questo controllo possa essere trasferito alle aziende diventerà più chiaro solo dopo il rilascio dei pesi.

EMPV / TAKEAWAY

Mistral Large 4 è un risultato industriale europeo significativo, oggi accessibile in preview API. Le prove mostrano punti di forza nel cyber, ma costi, requisiti e autonomia di un deployment privato andranno verificati dopo il rilascio dei pesi.

EMPV / CONDIVIDI

Condividi questa Research Note.

Research Notes