A Black Forest Labs bemutatta a FLUX 3-at, egy új multimodális alapmodellt, amely egyszerre tanul képekből, videókból és hangból egyetlen architektúrán belül. A modell korai hozzáférésben már elérhető videógenerálásra, a képszerkesztő változatok pedig a következő hetekben és hónapokban érkeznek, várhatóan nyílt súlyú, ingyenes verziókkal együtt.
A FLUX 3 a vállalat korábbi Self-Flow módszerére épül, és egyszerre képes szöveges, képes, videós és hangpromptokat kezelni. Videót akár 20 másodperc hosszan, natív hanggal generál, és támogatja a képből-videóba, videóból-videóba, kulcsképből-videóba átalakítást is. Korai értékelések szerint a felhasználók a Runway Gen-4.5-tel és a Luma Ray 3.2-vel szemben 77, illetve 93 százalékban részesítették előnyben. A képgenerálásban többnyelvű, pontos szövegmegjelenítést ígér, és a FLUX 2-höz képest jelentősen javult a komplex promptok követése.
A vállalat a Mimic Robotics-szal közösen fejlesztett FLUX-mimic nevű akciópredikciós modellt is bejelentette, amelyet valós gyártási feladatokon tesztelnek az Audinál. A nyílt súlyú FLUX 3 Dev változat később érkezik, a cég hosszú távú célja pedig, hogy egyetlen modellben egyesítse a érzékelést, a cselekvést és a nyelvi predikciót.
