AI[kutak]
Veliki modeli

Alibaba predstavlja Qwen-Audio-3.0-TTS: Najbolji TTS model na tržištu

Kineski gigant osvaja tržište tekst-u-govor tehnologije sa modelom koji je prestigao sve konkurente po kvalitetu, a po ceni je tri puta jeftiniji.

Stevan K. • 12:06, 21. jul 2026.1 min čitanja
Alibaba predstavlja Qwen-Audio-3.0-TTS: Najbolji TTS model na tržištu

Alibaba je uspeo da napravi TTS model koji srušio sve rekorde. Qwen-Audio-3.0-TTS-Plus trenutno drži prvo mesto na prestižnom Artificial Analysis Text-to-Speech rang listu sa skorom od 1,236 Elo poena, neznatno ispred Simba 3.2 (1,234) i daleko ispred Giganta kao što su Gemini 3.1 Flash TTS (1,214) i Sonic 3.5 (1,207). Što je još impresivnije, ovo postignuće je dostigao po ceni od samo 27,59 dolara po milion karaktera – tri puta manjoj od vodećih konkurenata.

Kompanija je objavila dve verzije modela: Flash, optimizovan za real-time interakcije sa latencijom od oko 300 ms, i Plus verziju fokusiranu na vrhunski kvalitet generisanja govora. Oba modela su dostupna isključivo preko Alibaba Cloud Model Studio servisa, što znači da korisnici ne mogu da preuzmu samostalno već moraju da koriste Alibabine API-je.

Jedna od najvećih prednosti novog modela je njegova višejezička podrška. Qwen-Audio-3.0-TTS podržava čak 16 jezika, uključujući arapski, kineski, engleski, francuski, nemački i ruski, plus 20 kineskih dijalekata. Model pokazuje najbolje rezultate u 10 od 16 jezika po merilu tačnosti prepoznavanja reči i karaktera (WER/CER), sa prosečnim skorom od samo 3,87 kod Flash verzije.

Za one kojima je potrebna precizna kontrola nad generisanim govorom, Alibaba je uveo sistem od 86 detaljnih tagova. Ovi tagovi omogućavaju kontrolu na nivou reči i fraza, uključujući emocionalne prelaze ([uzbuđeno], [tužno]) i neverbalne elemente poput smeha ([smeh]), uzdisaja ([uzdah]) ili kašljanja ([kašalj]). Nažalost, ova funkcionalnost je dostupna samo u jednosmernom streaming modu.

Iako je tehnički najnapredniji, model ima i određena ograničenja. Plus verzija generiše samo oko 16 karaktera u sekundi, što je znatno sporije u poređenju sa Simba 3.2 (30,2) ili Sonic 3.5 (čak 120). Ovo ga čini manje pogodnim za aplikacije koje zahtevaju brzu obradu velikih količina teksta.

Reakcije u developer zajednici su podeljene. Dok mnogi hvale kvalitet i cenu, neki kritikuju činjenicu da model nije open source i da je dostupan samo kao hostovani servis. Ostaje pitanje da li će Alibaba uspeti da zadrži svoju poziciju na tržištu koje postaje sve konkurentnije, posebno s obzirom na brzu evoluciju TTS tehnologije.

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

Google DeepMind predstavio GenCeption: AI model koji razume svet kao ljudi
Veliki modeli

Google DeepMind predstavio GenCeption: AI model koji razume svet kao ljudi

Novi model obavlja pet vizuelnih zadataka istovremeno, sa neverovatnom preciznošću čak i na sintetičkim podacima. Kako će ovo promeniti računarsku viziju?

21. jul 2026.

Meta otvara Astryx, dizajn sistem za ljude i AI agente
Open Source

Meta otvara Astryx, dizajn sistem za ljude i AI agente

Meta je pustila u javnu beta verziju Astryx, svoj najkorišćeniji interni dizajn sistem sa 150+ komponenti, optimizovan za saradnju ljudi i veštačke inteligencije.

21. jul 2026.

YouTube pooštava pravila za AI-generisane videe: Šta neće moći da se monetizuje
Veliki modeli

YouTube pooštava pravila za AI-generisane videe: Šta neće moći da se monetizuje

YouTube sada jasno definiše koje AI-generisane sadržaje neće dozvoliti u svom partner programu, fokusirajući se na generičke, uznemirujuće i osetljive teme.

20. jul 2026.

Komentari (0)

Učitavanje komentara...