Un embedding model per testo, codice, immagini, video e audio.
Google DeepMind ha pubblicato EmbeddingGemma 2 il 6 ottobre 2026. La model card ufficiale descrive un modello da 740 milioni di parametri che mappa testo e codice, immagini, video e audio — anche combinati nello stesso input — in uno spazio vettoriale condiviso da 768 dimensioni. I pesi sono disponibili su Hugging Face.
Non è un modello generativo. Produce rappresentazioni numeriche confrontabili per ricerca semantica, retrieval-augmented generation (RAG), classificazione, clustering e misure di similarità. Il cambiamento rispetto alla prima EmbeddingGemma è soprattutto l'estensione dal testo a un indice realmente multimodale.