Il 6 ottobre 2026 Google ha presentato EmbeddingGemma 2, un modello di embedding multimodale aperto e leggero che porta la ricerca multimodale di testo, codice, immagini, audio e video direttamente sui dispositivi, senza dover caricare i contenuti sul cloud. La prima versione, EmbeddingGemma, ha superato i 20 milioni di download dal lancio nel 2025. Il nuovo modello è pensato per funzionare su hardware di consumo e Google lo descrive come il più capace della sua categoria per gli embedding multimodali su dispositivo. In sintesi, Google porta la ricerca semantica di contenuti multimediali fuori dal cloud e dentro i telefoni.
Cos'è EmbeddingGemma 2 e come funziona
Un embedding è una rappresentazione numerica di un contenuto — una frase, un'immagine, un video — che ne cattura il significato. EmbeddingGemma 2 mette testo, codice, immagini, video e audio in un unico spazio condiviso, così una ricerca in linguaggio naturale può trovare il momento esatto di un video o una clip audio. È costruito sull'architettura Gemma 4, deriva dalla stessa tecnologia dei modelli Gemini Embedding ed è distribuito con licenza Apache 2.0, permissiva anche per uso commerciale.
Il funzionamento locale è il punto chiave: gli embedding vengono generati sul dispositivo, riducendo la latenza, proteggendo la privacy e permettendo di costruire sistemi di ricerca e RAG (retrieval-augmented generation, cioè recupero di informazioni per alimentare un modello generativo) che operano anche offline. Questo significa che un'app può rispondere a una query anche in assenza di connessione, senza tempi di attesa per il caricamento.
Cosa cambia per chi cerca foto, video e audio
La differenza pratica riguarda soprattutto i media personali. Con EmbeddingGemma 2, uno sviluppatore può creare app che indicizzano video e memo vocali locali e restituiscono i timestamp corrispondenti a richieste come «cane che prende un frisbee» o «persona che spegne le candeline». Non serve caricare la libreria su un server: tutto può restare sul telefono o sul computer. Google mostra queste possibilità nelle demo Instant Media Search e Video Moments Finder della Google AI Edge Gallery.
Per chi lavora con file e riunioni, l'app AI Edge Foresight usa audio e documenti locali per arricchire note e recuperare informazioni senza inviare i dati sottostanti al cloud. In pratica, i contenuti privati diventano cercabili in linguaggio naturale, senza cederli a servizi esterni. Il recupero resta locale e i file non lasciano il dispositivo.
Quanto pesa e quanta RAM richiede?
EmbeddingGemma 2 è modulare: la parte solo testo può usare 270 milioni di parametri, mentre i codificatori opzionali per visione e audio aggiungono rispettivamente 170 e 300 milioni di parametri. Il modello completo arriva a 740 milioni.
Con la quantizzazione, su un Google Pixel 11 Pro servono circa 191 MB di RAM attivi per il solo testo e circa 567 MB per il modello multimodale completo.
La finestra di contesto è di 8.192 token, quattro volte quella della generazione precedente: sufficiente per circa 5,5 minuti di audio, 29 immagini o 58 fotogrammi video, anche in combinazione.
Grazie alla tecnica MRL (Matryoshka Representation Learning), i vettori di output possono essere ridotti da 768 dimensioni a 512, 256 o 128, con una riduzione fino a 6 volte dello spazio di archiviazione nei database vettoriali locali.
Dove scaricare EmbeddingGemma 2 e quando provarlo
Il modello è già presente su Hugging Face e Kaggle; la sua disponibilità nel Model Garden di Gemini Enterprise Agent Platform è prevista a breve. Per lo sviluppo su dispositivi, Google suggerisce MediaPipe e LiteRT, mentre per il browser si possono usare transformers.js o WebGPU. Chi lavora in ambienti server può scegliere tra transformers, sentence-transformers, MLX e vLLM, a cui si aggiungono llama.cpp, SGLang, Ollama e LMStudio; Qdrant è utile per salvare i vettori.
Sul fronte qualità, Google segnala un miglioramento di 9,92 punti nel benchmark MTEB Code rispetto a EmbeddingGemma: da 68,76 a 78,68. Nei benchmark per audio e immagini, il modello ottiene punteggi leader tra quelli sotto il miliardo di parametri e in diversi compiti supera modelli specializzati più grandi.

