Večina naših vsakodnevnih misli ne zveni kot Shakespearovi soneti. Običajno je to kaotičen golaž neodločnih premorov, nepotrebnih mašil in lažnih začetkov stavkov. Če bi kdo dobesedno zapisal to, kar izgovorite v svojo pametno napravo med jutranjo kavico, bi vas verjetno poslali na hitri pregled. A pri Googlu so se odločili, da bodo našo govorno šepavost rešili s tehnologijo. Predstavili so Gemini 3.5 Transcribe, nov model pretvorbe govora v besedilo, ki ne le posluša, ampak dejansko razume, kaj ste želeli povedati.
Silicijeva dolina je znova ugotovila, da smo ljudje v osnovi leni. Zakaj bi namreč tipkali s prsti po zaslonu, ko pa lahko preprosto nekaj zamrmramo v telefon? Težava prejšnjih generacij glasovnih prepoznavnikov je bila v tem, da so bili preveč dobesedni. Zapisali so vsak vaš »hm«, »pač« in »eee«. Novi Gemini pa deluje kot izjemen urednik, ki sproti čisti vaše besedne neumnosti.

Kako deluje ta čarovnija brez mašil in zmede?
Google Gemini 3.5 Transcribe je zasnovan z enim samim ciljem: da prepozna vaš naravni glasovni tok in izloči balast. Če sredi stavka spremenite mnenje – na primer: »Pošlji sporočilo Petru... ne, čakaj, Marku, da naj prinese pivo... pravzaprav raje vino« – bo sistem samodejno popravil besedilo in oblikoval čisto, logično sporočilo brez nepotrebnih nevrotičnih popravkov v zapisu.
Poleg tega novi model samodejno zaznava več kot 85 jezikov in je izjemno spreten pri prepoznavanju specifičnega izrazoslovja, nenavadnih črkovanj ter zapletenih alfa-numeričnih nizov, kot so poštne številke ali številke naročil. Za vse tiste, ki snemate podkaste ali sestanke, pa prinaša še eno ključno funkcijo: ločevanje do treh različnih govorcev z natančnim časovnim žigom na ravni posamezne besede.
Odstranjevanje mašil: Zgodovini predaja vse vaše nepotrebne glasovne premore in kletvice.
Samodejni popravki v realnem času: Prepozna spremembo miselnega toka in ustrezno prilagodi zapis.
Ločevanje govorcev: Natančno prepozna do tri govorce z časovnim žigom za vsako besedo.







