Shop menü

FÉLELMETESEN MANIPULÁLJA A VALÓSÁGOT AZ ALIBABA LEGÚJABB VIDEÓS MI MODELLJE

A Wan3.0 hatalmas fejlődést mutat, hosszú jelenetet képes egyben létrehozni kiemelkedő minőségben, és még mindig gazdaságosan lehet vele dolgozni.
Szécsi Dániel (DemonDani)
Szécsi Dániel (DemonDani)
Félelmetesen manipulálja a valóságot az Alibaba legújabb videós MI modellje

A kínai mesterséges intelligencia eszközök egyre nagyobb figyelmet kapnak, méghozzá egyáltalán nem érdemtelenül. Ezúttal egy új videogeneráló megoldással rukkolt elő az Alibaba, amelynek egyebek mellett a Qwen modelleket is köszönhetjük, ennek a legfrissebb kiadása a hónap elején debütált.

A Wan3.0 egy multimodális videogenerálásra és -szerkesztésre alkalmas modell, ami képes nagy mennyiségű bemeneti adatból (videó, kép, hang, szöveg) létrehozni dinamikus videós tartalmakat akár 30 másodperces terjedelemmel. Már kifejezetten úgy alkották meg a modellt a fejlesztők, hogy hétköznapi munkára minél alkalmasabb legyen, ezért a multimodális működés jegyében akár PDF, PowerPoint vagy egyéb dokumentumokat is fel tud dolgozni, és weboldalak is linkelhetők a számára. 

Egyelőre még béta verzióban érhető el a Wan3.0, de ez teljesen megszokott a kiélezett versenyben. Az Alibaba leginkább arra büszke, hogy milyen hosszú anyagokat tud egyben alkotni a modell, a korábbi Wan2.7-Video modellnél még 15 mp volt a plafon. A felhasználók már komplex kameramozgással, aprólékosan megtervezett jeleneteket tudnak készíteni, ezzel lényegesen felgyorsulhat a munka. Rövid reklámokat már akár egy az egyben létrehozhat a Wan3.0. 

A fejlesztők innentől intelligens videóhossz meghatározást is biztosítanak, ami azt jelenti, hogy fel tudja ismerni a prompt és a bevitt információk alapján a rendszer, hogy mennyi idő lehet a jelenet. Nem fog azért több tartalmat “hallucinálni”, hogy mindenképpen meglegyen a kívánt hossz. Ezzel párhuzamosan pedig adott a kiterjesztési funkció is, így lehet arról gondoskodni, hogy kellően hosszú, és valóban tartalmas videók készüljenek.

Ahogy minden MI által generált anyagban, így a videókban is gyakran előfordulnak vizuális pontatlanságok és torzulások, ezek kiküszöbölése érdekében a Wan3.0 nagy pontosságú vizuális folytonosságot biztosít. A modell rendkívül valósághű emberi arcokat képes alkotni, lemásolni szinkronizált arcmozgásokkal. Természetes többnyelvű hangot tud létrehozni, és még arra is képes, hogy stabilan ábrázoljon szoftveres felhasználói felületeket és mozgóképes grafikákat a videókon belül.

A referenciaanyagokat a modell finom részleteivel együtt adhatja majd vissza, szigorúan figyelembe véve a kulcsfontosságú pontokat, a térbeli viszonyokat, valamint a hangok következetességét. Ezek révén lesz igazán jó termékekkel kapcsolatos hirdetési, reklámanyagok létrehozására. 

Az Alibaba szerint a filmkészítők és a tartalomgyártók is komoly eszközt kapnak a kezükbe a Wan3.0 révén, ami lerövidítheti a munkájukat, és izgalmasabb anyagok létrehozását teszi lehetővé. Akár az oktatásban is jó lehet a modell, hiszen a gyerekeknek lehet vele vizuális szemléltető anyagokat létrehozni. Sőt mi több, úgy gondolják, hogy ez a technológia már alkalmas lehet arra is, hogy realisztikus videókat, szimulációkat hozzanak létre, amit például önvezető autók tréningezéséhez használhatnak fel. Így az autógyártók, beszállítók egyszerűen tudnak például baleseteket mutatni a rendszernek.

A Wan3.0 API elérése hamarosan biztosított lesz, de erre még egy kicsit várni kell. Az új MI-alapú videogenerátor és -szerkesztő modell 480p felbontás mellett már mindössze 0,05 dollár/mp-es áron munkára fogható lesz, és ahogy halad felfelé a felbontás, úgy nő a tarifa a duplájára. Ennek megfelelően 720p HD videókat 0,1 dollár/mp áron lehet vele előállítani, Full HD anyagok gyártására pedig 0,2 dollár/mp-es elszámolás mellett nyújt lehetőséget.

Hírlevél feliratkozás
A feliratkozással elfogadom a Felhasználási feltételeket és az Adatvédelmi nyilatkozatot.

Neked ajánljuk

    Tesztek

      Kapcsolódó cikkek

      Vissza az oldal tetejére