6. oktober 2026 ob 20:153 min branja

Google EmbeddingGemma 2: Žepni večmodalni model umetne inteligence, ki lokalno razume slike, zvok in kodo

Google je predstavil EmbeddingGemma 2, odprtokodni večmodalni model, ki v le nekaj sto megabajtih RAM-a lokalno poveže besedilo, zvok in video.

Jan MacarolAvtorJan Macarol
Google EmbeddingGemma 2: Žepni večmodalni model umetne inteligence, ki lokalno razume slike, zvok in kodo

Dejstva v 30 sekundah

  1. EmbeddingGemma 2 ima skupno 740 milijonov parametrov, za obdelavo zgolj besedila pa potrebuje 270 milijonov parametrov.
  2. Z 8K kontekstnim oknom lahko model naenkrat lokalno obdela do 5,5 minute zvočnega zapisa, 29 slik ali 58 videosličic.
  3. Razvijalci lahko izhodne vektorje obrežejo s 768 na 128 dimenzij in porabo pomnilnika ter prostora v lokalnih vektorskih bazah zmanjšajo do 6-krat.
  4. Na preizkusu MTEB Code je model izboljšal rezultat z 68,76 na 78,68 točke in vodi v kategoriji pod eno milijardo parametrov.
  5. Model je brezplačno na voljo pod licenco Apache 2.0 na platformah Hugging Face in Kaggle, tudi za komercialne rešitve.

Če ste zadnji dve leti poslušali tehnološke evangeliste iz Silicijeve doline, ste verjetno dobili občutek, da umetna inteligenca potrebuje lastno jedrsko elektrarno in podatkovni center v velikosti manjšega mesta, da lahko sploh prepozna fotografijo vaše mačke. Toda pri Googlu so se odločili za povsem nasprotno pot – inženirski podvig, ki bi ga lahko primerjali z vgradnjo dvanajstvaljnega motorja v lahek gokart. Predstavili so EmbeddingGemma 2, odprtokodni model, ki revolucionarno spreminja način, kako pametne naprave obdelujejo podatke kar na sami napravi, brez pošiljanja enega samega bajta v oddaljene oblake.

Tehnična simfonija pod pokrovom motorja: 740 milijonov parametrov v žepu

Prejšnja generacija modela EmbeddingGemma je požela izjemen uspeh z več kot 20 milijoni prenosov, vendar je bila omejena zgolj na besedilo. Nova EmbeddingGemma 2, zgrajena na napredni arhitekturi Gemma 4, ruši te meje. Gre za popolnoma enoten večmodalni vloženi model (multimodal embedding model) s skupno 740 milijoni parametrov, ki v istem vektorskem prostoru združuje programsko kodo, slike, videoposnetke in zvočne zapise.

Genialnost tega modela se skriva v njegovi modularnosti. Če potrebujete zgolj obdelavo besedila, model zahteva skromnih 270 milijonov parametrov. Ko dodate vizualni modul (170 milijonov) in zvočni kodirnik (300 milijonov), dobite popoln večmodalni sistem, ki zlahka teče na mobilnem telefonu. Pri kvantizirani različici model na napravah, kot je Google Pixel, porabi zgolj približno 191 MB delovnega spomina (RAM) za besedilni del oziroma pičlih 567 MB RAM-a za celoten večmodalni sistem. Za primerjavo: povprečen spletni brskalnik z odprtimi tremi zavihki pogosto porabi več dragocenega pomnilnika.

Dimenzijska matjuška in razširjen kontekst

Google je implementiral tehniko učenja reprezentacij Matryoshka (Matryoshka Representation Learning – MRL). Kaj to pomeni v praksi? Izhodne vektorje lahko dinamično obrežete s privzetih 768 dimenzij na 512, 256 ali celo 128 dimenzij. S tem razvijalci pridobijo do 6-kratno zmanjšanje porabe pomnilnika in prostora v lokalnih vektorskih bazah, ne da bi pri tem drastično žrtvovali natančnost zadetkov.

Poleg tega model prinaša 8K kontekstno okno (kar je štirikrat več kot predhodnik). V enem samem zamahu lahko lokalno obdela do 5,5 minute zvočnega zapisa, 29 slik ali 58 videosličic. To pomeni, da lahko z glasovnim vprašanjem v domačem videoarhivu nemudoma poiščete točno tisti kader, kjer vaš otrok piha rojstnodnevno svečko, pri čemer noben posnetek ne zapusti vašega telefona.

Skok v zmogljivosti: Koda in večmodalno iskanje

Na zahtevnem preizkusu MTEB Code (Massive Text Embedding Benchmark) je model poskočil s prejšnjih 68,76 na izjemnih 78,68 točke, kar predstavlja skoraj 10-točkovno izboljšavo. S tem EmbeddingGemma 2 postaja vodilni model v kategoriji pod eno milijardo parametrov in celo presega specializirane tekmece, ki so dvakrat večji. Popolnoma blesti tudi pri zvočnih meritvah MAEB ter vizualnih nalogah.

Razvijalcem to odpira vrata do bliskovito hitrih sistemov RAG (Retrieval-Augmented Generation) brez zakasnitev, ki nastanejo pri omrežni komunikaciji. Model lahko neposredno povežete z lokalnimi orodji, kot so llama.cpp, Ollama, vLLM, transformers.js za spletne brskalnike ter vektorsko bazo Qdrant, prilagajanje pa omogoča priljubljena platforma Unsloth.

Hitrost razvoja je neverjetna

Priznati moram, da me le redko kaj zares osupne, saj nas proizvajalci prepogosto zasipavajo z marketinškim balastom in nedokončanimi obljubami. Toda EmbeddingGemma 2 je povsem drugačna zgodba. To je inženirska mojstrovina učinkovitosti. Zamisel, da lahko v žepu nosite model z manj kot 600 MB odtisa, ki brez internetne povezave razume zvok, video in programsko kodo, meji na znanstveno fantastiko. Google je tukaj ubral pravo smer: namesto da uporabnike sili v drage naročnine na oblačne storitve, je ponudil brezkompromisno zasebnost in izjemno hitrost lokalne izvedbe. Model je na voljo popolnoma brezplačno pod izjemno odprto licenco Apache 2.0 na platformah Hugging Face in Kaggle, kar pomeni, da ga lahko vsakdo začne uporabljati takoj – tako za hobiprojekte kot za resne komercialne rešitve.

Nazadnje objavljeno o znamki Google

Vsi članki
Oglasno sporočilo
Google Discover

Internet se spreminja

Dodajte nas kot vir na Google.

Dodaj

Pogovor

Komentarji

Nalagam pogovor…

Komentarji so mnenja bralcev. Uredništvo lahko odstrani žaljive, zavajajoče ali oglaševalske prispevke.

SorodnoTehnologijeGoogleumetna inteligenca