Dienstag, 6. Oktober 2026 · 21:40 Uhr
Google stellt kompaktes multimodales Embedding-Modell EmbeddingGemma 2 vor
Google hat mit EmbeddingGemma 2 ein offenes, nur 740 Millionen Parameter großes Modell veröffentlicht, das Text, Bild, Video, Audio und Code in einen gemeinsamen Vektorraum überführt.
Google hat EmbeddingGemma 2 veröffentlicht, ein offenes Embedding-Modell, das fünf verschiedene Datentypen – Text, Bild, Video, Audio und Code – in denselben 768-dimensionalen Vektorraum abbildet12. Das auf Gemma 4 basierende Modell kommt mit nur 740 Millionen Parametern aus und benötigt laut Herstellerangaben nur rund 191 MB Arbeitsspeicher für die reine Text- und Code-Variante12. Trotz seiner geringen Größe übertrifft es nach Googles Angaben teils doppelt so große Konkurrenzmodelle1.
Die Architektur ist modular aufgebaut: Entwickler laden nur die Encoder, die sie tatsächlich benötigen, wobei die Vollversion mit allen Modalitäten bis zu 740 Millionen Parameter umfasst2. Durch das Training mit Matryoshka Representation Learning lassen sich die erzeugten Vektoren zudem nachträglich verkleinern, was auf Geräten mit begrenztem Speicherplatz hilfreich ist, da bereits eine Million Vektoren mehrere Gigabyte beanspruchen können2. Der Kontextumfang wurde zudem von 2.048 auf 8.192 Token vervierfacht, was nach Unternehmensangaben bis zu 5,5 Minuten Audio oder 58 Videoframes abdeckt2.
Das Modell läuft direkt auf dem Gerät und ist über LiteRT und MediaPipe Tasks bereits nutzbar, eine Integration in Android ML Kit mit NPU-Beschleunigung soll in den kommenden Wochen folgen12. In Kombination mit Gemma 4 ermöglicht EmbeddingGemma 2 datenschutzfreundliche Offline-RAG-Anwendungen, etwa für die lokale Durchsuchung von Fotos und Videos ohne Cloud-Anbindung12. Die Veröffentlichung unter Apache-2.0-Lizenz stieß auch auf Hacker News auf deutliches Interesse mit über 250 Punkten3.