Gemini 3.5 Transcribe: Tisztázza a hümmögést és a félremondásokat a Google új AI-modellje

gemini_3-5_transcribe

A dadogás és a felesleges hümmögés végleg eltűnhet a diktált szövegekből a Google legújabb hangfelismerő modelljével. A Gemini 3.5 Transcribe a puszta lejegyzés helyett valós időben megérti és megtisztítja a mondandónkat.

A hagyományos beszédhang-átalakító rendszerek évtizedek óta küzdenek a kötetlen emberi beszéd sajátosságaival. A lassú gondolkodási szünetek, az „őőő” és „aaa” jellegű töltelékszavak, valamint a háttérzajok eddig szinte kivétel nélkül elrontották az automatikusan generált átiratokat. A Google erre a régóta fennálló problémára nyújt megoldást az új generációs mesterséges intelligencia architektúrájával.

Töltelékszavak nélkül születik meg a tisztázott szöveg

A korábbi Chirp 3 modellt leváltó Gemini 3.5 Transcribe az audiofolyamot közvetlenül formázott, tiszta írott szöveggé alakítja. Az algoritmus automatikusan felismeri és kiszűri a hezitálásból fakadó hangokat, miközben azonnal megfelelő írásjelekkel látja el a mondatokat. Az új modell átlagosan 70 százalékkal gyorsabban adja vissza a végleges átiratot az előző generációhoz képest, ami érezhetően gördülékenyebbé teszi a mindennapi diktálást.

A felkészültségét a független mérések és a mérési mutatók is igazolják: élő audiofolyam esetén 4,0 százalékos, míg előre rögzített hanganyagoknál 2,6 százalékos szóhiba-arányt produkál. A nemzetközi FLEURS teszteken a nem-streamelt méréseknél 5,04 százalékos hibaarányt ért el. Ez a pontosság még változatos akcentusok és zajos környezet mellett is megmarad, ami alapjaiban változtatja meg a hangalapú adatbevitelt.

Okos hibajavítás és nyolcvanöt támogatott nyelv

A rendszer egyik leglényegesebb tulajdonsága az önjavító gondolatmenetek intelligens kezelése. Ha a beszélő közbeszúr egy módosítást — például „Találkozzunk kedden, vagyis inkább szerdán” —, az algoritmus megérti a kontextust, és a végleges szövegben már csak a javított változatot jeleníti meg. Nem kell tehát manuálisan törölgetni a félremondott szavakat vagy utólag módosítani a mondatszerkezetet.

Az eszköz több mint 85 nyelvet támogat, és képes a mondat közbeni nyelvváltások sima kezelésére is. A specifikus szakszavak, egyedi nevek vagy belső céges kifejezések sem okoznak neki fennakadást, mivel a fejlesztők egyéni szókészlet-listákkal is kiegészíthetik a rendszert. Ezen kívül az átirat készítése során a modell képes más rendszerek felé is utasításokat továbbítani a kontextus alapján.

A billentyűzetektől a böngészőkig terjed a jelenlét

A Gemini 3.5 Transcribe már működik az Android rendszerre elérhető Gboard billentyűzet Rambler nevű diktálási funkciójában, valamint a macOS-re készült Gemini alkalmazásban. A Google hivatalos tájékoztatása alapján a technológia hamarosan elérhetővé válik a Google Chrome böngészőben is, ahol bármely webes szövegmezőbe közvetlenül, saját hangunkkal gépelhetünk majd.

A böngészős integráció megszüntetheti a gépelési kényszert az e-mailek megfogalmazásakor vagy a hosszabb dokumentumok vázlatolásakor. A felhasználóknak nem kell attól tartaniuk, hogy az élőben elmondott gondolataik rendezetlenül vagy hibásan jelennek meg a képernyőn, hiszen a rendszer valós időben csiszolja készre a szöveget.

Beszélők megkülönböztetése és fejlesztői eszközök

A rögzített hanganyagok feldolgozásánál a modell akár három különálló beszélőt is képes elkülöníteni, és a szavak szintjéig terjedő időbélyegekkel ellátni az átiratot. Ez a funkció az interjúk, üzleti tárgyalások és podcastok feldolgozását teszi lényegesen egyszerűbbé és hatékonyabbá.

A fejlesztők a Google AI Studio felületén és a Gemini API-n keresztül érhetik el a modellt, mind a sub-second válaszidőt nyújtó WebSocket-streamingsorozatokhoz, mind utólagos fájlelemzéshez. A nagyvállalati ügyfelek számára pedig a Gemini Enterprise platform kínál közvetlen hozzáférést az új beszéd-szöveg átalakító infrastruktúrához.