När Alexandru Voica, chef för företagsaffärer på videogenereringsstartupen Synthesia, i somras skickade mig en länk till det senaste tillskottet i deras PR-team, blev jag förvånad. Det var en interaktiv virtuell avatar av honom, tränad att svara på vanliga pressfrågor om Synthesia, som vad de gör och hur det fungerar. Dagen innan satt jag i en panel där PR-folk frågade mig om jag hade något emot pitchar som använde AI-genererad text. Men Alexandrus avatar var bortom det – för mig verkade detta vara slutbossen för AI inom PR.

I september bjöd Synthesia in mig till sina nya kontor i New York. Synthesia, som ursprungligen är baserat i Storbritannien, är en het startup inom digitala avatarer tillsammans med andra som D-ID, HeyGen och Colossyan. Företaget nådde en värdering på 4 miljarder dollar tidigare i år och uppgav förra året att de passerat 100 miljoner dollar i ARR.

Synthesia låter företag bygga interaktiva träningsvideor med AI-avatarer och lanserade nyligen en produkt som heter Roleplay Sessions som låter anställda öva, till exempel säljpitchar, med en interaktiv AI-avatar som svarar och betygsätter deras svar.

När jag gick på invigningen av det nya kontoret och de frågade om jag ville ha min egen AI-avatar, tvekade jag inte ens att säga ja. Självklart ville jag ha min egen digitala tvilling. Min outfit var söt den dagen, och håret satt på plats.

Fram till jag träffade min digitala tvilling hade jag varit likgiltig inför avatarer, men jag kände att de oundvikligen skulle bli en del av vardagen online. Jag hade hört talas om folk på Instagram som skapade dem i sina egna avbilder för att hjälpa till att göra socialt innehåll. Jag tycker att allt detta är mycket intressant, och det är kanske därför jag nu utan betänkligheter presenterar min digitala tvilling för er. Detta är första gången Synthesia har gjort en digital avatar för en journalist (eller för någon överhuvudtaget, utanför Voica). Den är tränad på min artikel om varför riskkapitalfinansierade startups begår mer bedrägerier än startups utan riskkapital och kommer bara att svara på frågor om den artikeln.

Nedan, tryck bara på "starta i ett nytt fönster" för att börja.

För att göra detta gick jag in i en mini-filmstudio inrymd i Synthesias kontor där de tog många foton av mig och spelade in en tvåminuters inspelning av min röst. Jag var tvungen att samtycka till att dessa avatarer skapades och, ja, digitala Dom föddes. De skapade en personlig avatar för mig (en som bara läser vilket manus jag än ger den) – med och utan glasögon – och de gjorde två interaktiva avatarer för mig (sådana som kan prata tillbaka och lyssna på mig), också med och utan glasögon.

Vi valde en artikel att träna den interaktiva avataren på, och sedan byggde ett av teamen min interaktiva avatar, som drivs av en kombination av tal-till-text-, video-, språk- och text-till-tal-modeller. Min avatars teknikstack inkluderar Synthesias egna video- och röstmodeller, även om företaget också låter kunder välja alternativ från andra labb som Cartesia, ElevenLabs, Google eller OpenAI. Företag kan också välja att hosta sina avatarer i vilket moln de vill eller betala Synthesia för att hosta dem.

Tal-till-text-modellen omvandlar vad människor säger till text, den agentiska språkmodellen förstår text och kan vidta åtgärder baserat på den, text-till-tal-modellen omvandlar ett svar till ljud, och slutligen animerar en videomodell (byggd av Synthesia) avataren när den pratar.

Sammantaget bygger Synthesia tre typer av produkter – en plattform för videoskapande och distribution med klassiska avatarer, där någon skriver in ett manus och avataren upprepar det; en agentisk plattform som heter Sessions där människor kan interagera med avatarerna i undersökningar eller rollspel; och en API-plattform där människor kan ta Synthesias video- och röstmodeller och kombinera dem med andra tekniska tjänster för att bygga interaktiva avatarer eller andra typer av produkter.

Det tog Synthesia-teamet ett par dagar att göra mina avatarer. Jag lekte först med de personliga och skrev ett ganska generiskt manus för att se hur min AI-röst lät. Jag lät den prata om hur hösten har kommit till New York, min favoritårstid. Rösten var ganska korrekt, och jag blev