Shop menü

ALAPOSAN FELPÖRGETI A GOOGLE A GEMINI BESZÉDKÉPESSÉGEIT

Elindult a Gemini 3.8 Live, amihez már animált avatar is kapcsolódhat, közben pedig egy új szövegfelolvasó modell is rajthoz állt.
Szécsi Dániel (DemonDani)
Szécsi Dániel (DemonDani)
Alaposan felpörgeti a Google a Gemini beszédképességeit

A Google egy ideig a Live funkciót látszólag hanyagolta, viszont a munka valójában egy pillanatig sem állt le. Az elmúlt napokban látjuk ennek az eredményét. Megjelent a Gemini 3.8 Live és a Live Extended Thinking variáns, majd ezekhez kapcsolódva színre befutott a Live Avatar, hogy az MI-vel való társalgás életszerűbb élmény legyen, és elkészült a Gemini 3.8 Flash TTS is kétféle verzióban.

A ChatGPT a Hang móddal sokakat nyűgözött le korábban, és ezzel sikerült elvennie a rivaldafényt a Geminitől, most a Google ezen próbál változtatni, igyekszik jobb versenyhelyzetbe kerülni a Gemini 3.8 Live révén. Ez a modell már sokkal életszerűbb kommunikációra lesz képes, kellemes tempójú beszélgetéseket lehet majd vele folytatni, ha pedig a felhasználó egy keményebb kérdést szegez a chatbotnak, akkor munkába áll a Gemini 3.8 Live Extended Thinking. 

Galéria megnyitása

A Gemini 3.8 Live-ot a skálázhatóság és a költséghatékonyság jegyében fejlesztették ki, ötvözve a beszélgetésalapú intelligenciát, a folyékony párbeszédet és a vizuális készségeket. Ez utóbbit pedig az új Live Avatar járatja csúcsra a szinte valós idejű videógenerálással és a beszédhez igazítva. Olyan dinamikus karaktert hoz létre, amely a beszélgetések során hallgat, lát és beszél. A beszéde pedig 97 nyelven pontos szájszinkronnal társul, és helyzetfüggő arckifejezéseket is alkalmazni fog.

Galéria megnyitása

A Live Avatar jól testreszabható lesz, a vállalat a cégeknek biztosítani fog ilyen téren extra lehetőségeket is. Továbbá igyekezett a Google elmondani, hogy beépítette a megfelelő biztonsági gátakat a szolgáltatásba, és megtoldotta a SynthID vízjellel is. Ez azt jelenti, hogy amennyiben valaki felveszi a Live Avatart működés közben, és ezzel szeretne visszaélni más felületeken, akkor jó eséllyel le fog bukni, mert egyre több helyen lesz jól láthatóan megjelölve, hogy mesterséges intelligenciával generált tartalmat lát az ember. 

Visszakanyarodva a Live funkcióhoz, a Gemini 3.8 Live Extended Thinking már rendkívül összetett feladatokra lett kialakítva, fokozott intelligenciával és többlépcsős érvelési képességgel. A komplex kérdéseket képes lesz lebontani és úgy feldolgozni, hogy a legpontosabb válaszokat adja a beszélgetések során. A fejlesztők és a vállalatok számára ez a modell lehetőséget nyújt megbízható hangalapú ügynökök létrehozására is.

A Google mérései szerint a legtöbb beszédmodelleket tesztelő feladatban az élen jár a Gemini 3.8 Live Extended Thinking. Az Artificial Analysis Speech to Speech Indexen megelőzi minden konkurensét, egy minimálisan a GPT-Live-1 és a Grok Voice Think Fast 2.0 felett teljesít. A kisebb és gyorsabb Gemini 3.8 Live pedig a Speech Agent Arena új királya lett, maga mögé utasítva az OpenAI eszközét.

Galéria megnyitása

A Gemini 3.8 Live automatikusan ismeri fel mind a 97 nyelven, ha fordítania kell egy társalgást, nem kell külön megkérni, hogy tolmácsnak álljon. A Gemini 3.8 Live Extended Thinking a beszéd közben a háttérben folyamatosan dolgozza fel az információkat, és úgy tudja húzni az időt, mint az emberek gondolkodás közben. Ezeknek köszönhetően lehet igazán természetes a modellek alkalmazása. 

A szövegfelolvasásra kihegyezett modellek a Gemini család legújabb fejlesztéseit fogják kamatoztatni a szavak beszéddé formálása során. Ezek hidat fognak képezni az egyszerű szöveges üzem és a teljesen beszédalapú használat között, így minden mögött a Gemini 3.8 lesz a továbbiakban. A Gemini 3.8 Flash TTS a hangalkotásra és a karaktertervezésre összpontosít, míg a Gemini 3.8 Flash-Lite TTS a nagy mennyiségű hanggenerálásra koncentrál. A Flash-Lite-ot folyamatos szinkronizáláshoz, jelentősebb hangalapú tartalom készítéséhez és hangalapú ügynökökhöz optimalizálták.

A Gemini 3.8 Flash TTS több mint 100 nyelvet, illetve nyelvjárást támogat már. Képes a létrehozott hangokat alakítani szerep, akcentus és hangjellemzők alapján, ezeket a felhasználók határozhatják meg természetes nyelvi utasításokkal. A modell több mint kétezer azonnal használható hangot tartalmaz a legkülönbözőbb akcentusokkal és nyelvi variációkkal, miközben felvonultat 30 eredeti hangot is, melyek egy hangtárból választhatók, és egyedi opciók is létrehozhatók.

A Google beszámolója szerint a Gemini 3.8 Flash TTS és a társa lehengerlő teljesítményt nyújt a különböző tesztekben, így például a Hume AI minőségi indexében. Nagyon ritkán talál legyőzőre a megmérettetésekben az új szövegfelolvasó páros, az viszont nem sokszor fordul elő, hogy jelentős előnyben van a vetélytársakkal szemben. Veri a Google az ellenfeleket olyan nyelveken is, mint a japán, a hindi vagy a vietnami. Minden bizonnyal sokan igyekeznek majd ezeket próbára tenni a következő időszakban.

Galéria megnyitása

A Gemini 3.8 Live és a Live Extended Thinking fokozatosan válik hozzáférhetővé mindenki számára, akár ingyen is, és először a Google Keresőn belül elérhető Live móddal lehet hozzáférni, nem pedig a Gemini Live keretében. Az API elérést az AI Studión keresztül biztosítja a Google. 

A Live Avatar egyelőre kizárólag a vállalati ügyfeleknek szól, a Gemini 3.8 Flash TTS pedig a Notebookon át jut el a széles közönséghez, így például a generált podcastokat már ez olvashatja fel, a Gemini 3.8 Flash-Lite TTS pedig a Google Vids videógenerátorban segít az ember szájába szöveget adni.

Hírlevél feliratkozás
A feliratkozással elfogadom a Felhasználási feltételeket és az Adatvédelmi nyilatkozatot.

Neked ajánljuk

    Tesztek

      Kapcsolódó cikkek

      Vissza az oldal tetejére