A Google bejelentette a Gemini 3.5 Transcribe modellt, amelyet a cég eddigi legpontosabb speech-to-text (beszédből szöveg) megoldásaként pozicionál. A modell a hagyományos beszédfelismerőknél pontosabban kezeli a háttérzajt, a szakzsargont és a spontán beszédben előforduló hibákat — a nyers audiot közvetlenül formázott, tiszta szöveggé alakítja.

Két API-n érhető el: a Live API valós idejű, kétirányú streamelést kínál másodperc alatti késleltetéssel, az Interactions API pedig felvett hanganyagokat dolgoz fel beszélő-azonosítással és szószintű időbélyegzéssel.

A modell 85 nyelvet támogat automatikus felismeréssel, kezeli az önjavító kifejezéseket („találkozzunk kedden — nem, szerdán”), kiszűri a kitöltő szavakat, és akár három beszélőt is megkülönböztet. A fejlesztők már használhatják a Gemini API-ban és a Google AI Studióban, a végfelhasználók pedig az Android Rambler funkciójában és a Gemini macOS alkalmazásában találkozhatnak vele.