La vista sintetica di ChatGPT che trasforma le sequenze video in testo
OpenAI estende le capacita di analisi dei modelli linguistici attraverso la scomposizione dei file multimediali in fotogrammi e campioni audio. La svolta architetturale permette di elaborare le registrazioni senza ricorrere alla riproduzione in tempo reale.