A kaliforniai székhelyű Zyphra kiadta a ZONOS2 nyílt szövegfelolvasó (TTS) modellt, amely valós időben tud beszédet generálni. A 8 milliárd paraméteres MoE architektúrájú modellből mindössze 900 millió aktív egy forward pass során, így akár felhasználói hardveren is futtatható, és Apache 2.0 licenc alatt érhető el, a Hugging Face-ről és a GitHub-ról ingyenesen letölthető.

A ZONOS2 különlegessége, hogy nemcsak angolul, hanem több mint 30 nyelven, köztük magyarul is képes élethűen beszélni, ideértve a hangklónozást is. Pintér Zsolt, AI-szakértő, már készített is egy bemutatóvideót, amelyben a modell magyar nyelvű képességeit és a hangklónozás minőségét demonstrálja: a YouTube-videó jól mutatja, hogy néhány másodpercnyi hangminta elegendő ahhoz, hogy a modell új szöveget olvasson fel a célhangon.

A modell két üzemmódot kínál: a „stable” mód a tiszta, stúdióminőségű kimenetre törekszik, míg az „expressive” mód a lehető legpontosabb hangklónozást valósítja meg — még akkor is, ha a forráshang zajos vagy szokatlan. A háttérben a Descript Audio Codec (DAC) 44,1 kHz-es stúdióminőségű hangot generál, és az UTF-8 byte-tokenizálás révén széles nyelvi támogatást nyújt, kódváltást (code-switching) is lehetővé téve. A modell az OpenRouter és a Zyphra Cloud platformon is elérhető API-n keresztül, ahol a megjelenést követő promóciós időszakban ingyenesen használható.