Az OpenAI nyilvánosságra hozta, hogy több mint 50 százalékkal sikerült csökkenteniük az inference költségeket — vagyis a meglévő modellek futtatásának kiadásait — a ChatGPT vendégfelhasználói esetében. A The Information forrása szerint a szükséges Nvidia GPU-k száma néhány százra esett vissza.
Nem világos, pontosan hány GPU kellett korábban, és milyen technikákat alkalmaztak az eredmény eléréséhez. A vendégfelhasználók csak nagyon korlátozott funkciókészlethez férnek hozzá, így kérdés, hogy az optimalizációk átültethetők-e a teljes termékre. A DeepSeek szintén frissen adott ki egy nyílt forrású módszert, amely 60-85 százalékkal gyorsíthatja az inference kéréseket.
A felszabaduló erőforrásokat szolgáltatások skálázására, jobb modellekre, gyorsabb válaszokra vagy nagyobb haszonkulcsra fordíthatják. Az adatközpont-építések lassú üteme miatt azonban valószínűbb, hogy az ilyen eredmények inkább lélegzetvételt adnak a laboratóriumoknak, mintsem hogy csökkentenék a chip-iránti keresletet.
