Quando Alexandru Voica, responsabile degli affari aziendali della startup di generazione video Synthesia, mi ha inviato quest'estate un link alla nuova aggiunta del loro team PR, sono rimasto sorpreso. Era un avatar virtuale interattivo di lui, addestrato a rispondere alle domande comuni della stampa su Synthesia, come cosa fa e come funziona. Il giorno prima ero a un panel dove gli addetti alle PR mi chiedevano se mi infastidivano i pitch che usavano testo generato dall'AI. Ma l'avatar di Alexandru andava oltre: mi sembrava il boss finale dell'uso dell'AI nelle PR.

A settembre, Synthesia mi ha invitato nel suo nuovo ufficio a New York. Originariamente con sede nel Regno Unito, Synthesia è una startup di avatar digitali in forte crescita insieme ad altre come D-ID, HeyGen e Colossyan. Ha raggiunto una valutazione di 4 miliardi di dollari all'inizio di quest'anno e l'anno scorso ha dichiarato di aver superato i 100 milioni di dollari di ARR.

Synthesia consente alle aziende di creare video di formazione interattivi con avatar AI e recentemente ha lanciato un prodotto chiamato Roleplay Sessions che permette ai dipendenti di esercitarsi, ad esempio, nelle presentazioni di vendita con un avatar AI interattivo che risponde e valuta le loro risposte.

Quando sono andato all'inaugurazione del nuovo ufficio e mi hanno chiesto se volevo il mio avatar AI, non ho esitato a dire sì. Certo che volevo il mio gemello digitale. Il mio outfit quel giorno era carino e i miei capelli erano a posto.

Fino a quando non ho incontrato il mio gemello digitale, ero indifferente verso gli avatar, ma sentivo che sarebbero inevitabilmente diventati parte della vita online quotidiana. Ho sentito di persone su Instagram che ne creano di simili a loro per aiutarli a produrre contenuti social. Trovo tutto molto interessante, ed è forse per questo che ora non ho remore a presentarvi il mio gemello digitale. Questa è la prima volta che Synthesia crea un avatar digitale per un giornalista (o per chiunque, a parte Voica). È addestrato sul mio articolo sul perché le startup finanziate da venture capital commettono più frodi rispetto a quelle non finanziate da VC e risponderà solo a domande su quell'articolo.

Qui sotto, basta premere "start in a new window" per iniziare.

Per realizzarlo, sono entrato in un mini studio cinematografico annidato nell'ufficio di Synthesia dove hanno scattato numerose foto di me e registrato due minuti della mia voce. Ho dovuto acconsentire alla creazione di questi avatar e, beh, è nato il Dom digitale. Hanno creato un avatar personale per me (uno che legge semplicemente qualsiasi copione gli dia) - con e senza occhiali - e hanno creato due avatar interattivi per me (quelli che possono rispondere e ascoltarmi), anche con e senza occhiali.

Abbiamo scelto un articolo su cui addestrare l'avatar interattivo, e poi uno dei team ha costruito il mio avatar interattivo, che è alimentato da una combinazione di modelli voice-to-text, video, linguaggio e text-to-voice. Lo stack tecnologico del mio avatar include i modelli video e vocali di Synthesia, anche se l'azienda consente ai clienti di scegliere alternative da altri laboratori come Cartesia, ElevenLabs, Google o OpenAI. Le aziende possono anche scegliere di ospitare i propri avatar su qualsiasi cloud desiderino o pagare Synthesia per ospitarli.

Il modello voice-to-text trasforma ciò che le persone dicono in testo, il modello linguistico agentico dà un senso al testo e può intraprendere azioni basate su di esso, il modello text-to-voice trasforma una risposta in audio e infine un modello video (costruito da Synthesia) anima l'avatar mentre parla.

Nel complesso, Synthesia costruisce tre tipi di prodotti: una piattaforma di creazione e distribuzione video con avatar classici, dove qualcuno digita un copione e l'avatar lo ripete; una piattaforma agentica chiamata Sessions dove le persone possono interagire con gli avatar in sondaggi o giochi di ruolo; e una piattaforma API dove le persone possono prendere i modelli video e vocali di Synthesia e combinarli con altri servizi tecnologici per costruire avatar interattivi o altri tipi di prodotti.

Il team di Synthesia ha impiegato un paio di giorni per creare i miei avatar. Ho giocato prima con quelli personali e ho digitato un copione abbastanza generico per vedere come suonava la mia voce AI. Gli ho fatto dire che l'autunno è arrivato a New York, il mio periodo preferito dell'anno. La voce era abbastanza accurata, e sono rimasto