Az Alibaba kiadta a Qwen-Image 3.0-t, a képgeneráló modelljének harmadik generációját. A csapat szerint az első verzió a precizitásra, a második a változatosságra és hitelességre fókuszált, a 3.0 viszont egy szóval összefoglalva: „valóságos”. A modell gyakorlati munkára készült — újságelrendezések, storyboardok, vizsgalapok —, nem csupán esztétikus képekre.
A modell 4500 token hosszú promptot fogad be, ami egyetlen futásban is lehetővé teszi sűrű, összetett elrendezések létrehozását. A demók között szerepel egy 3×3-as infografika-elrendezés kilenc különálló panellel:

Egymásba ágyazott felületek (VSCode ablakban Qwen Chat, azon belül WeChat beszélgetés, abban egy kávéposzter):

Valamint tíz pixel nagyságú, olvasható szöveg és többsoros LaTeX képletek:

A portrék fotorealisztikus részletgazdagságot mutatnak — pórusok, bőrtextúra, egyes hajszálak:

A Qwen-Image 3.0 tizenkét nyelvet támogat natívan, élő internetes adatokat is képes bevonni, és weboldalak, játékok, livestream-felületek rekonstruálására is befogható. A modell jelenleg meghívásos alapon, API-hozzáféréssel érhető el, a és hamarosan megjelenik a Qwen Chatben is. A súlyok várhatóan nem lesznek publikusan elérhetők — az eredeti Qwen-Image még nyílt súlyokkal érkezett, de a májusban kiadott 2.0 óta ez a gyakorlat változott.
