Kiedy Alexandru Voica, szef ds. komunikacji korporacyjnej w startupie Synthesia zajmującym się generowaniem wideo, przysłał mi tego lata link do najnowszego nabytku ich zespołu PR, byłem zaskoczony. Był to interaktywny wirtualny awatar jego samego, wyszkolony do odpowiadania na typowe pytania prasowe o Synthesię, takie jak czym się zajmuje i jak działa. Dzień wcześniej brałem udział w panelu, gdzie ludzie od PR pytali mnie, czy przeszkadzają mi propozycje wykorzystujące tekst generowany przez AI. Ale awatar Alexandru wykraczał poza to – dla mnie wyglądał jak ostateczny boss wykorzystania AI w PR.
We wrześniu Synthesia zaprosiła mnie do swojego nowego biura w Nowym Jorku. Pierwotnie z siedzibą w Wielkiej Brytanii, Synthesia to gorący startup zajmujący się cyfrowymi awatarami, obok takich jak D-ID, HeyGen i Colossyan. W tym roku osiągnęła wycenę 4 miliardów dolarów, a w zeszłym roku poinformowała, że przekroczyła 100 milionów dolarów ARR.
Synthesia pozwala przedsiębiorstwom tworzyć interaktywne filmy szkoleniowe z awatarami AI, a niedawno uruchomiła produkt o nazwie Roleplay Sessions, który umożliwia pracownikom ćwiczenie na przykład prezentacji sprzedażowych z interaktywnym awatarem AI, który odpowiada i ocenia ich odpowiedzi.
Kiedy poszedłem na otwarcie nowego biura i zapytali mnie, czy chciałbym mieć własnego awatara AI, nawet się nie zawahałem, żeby powiedzieć tak. Oczywiście, że chciałbym mieć własnego cyfrowego bliźniaka. Mój strój tego dnia był uroczy, a włosy ułożone.
Zanim poznałem swojego cyfrowego bliźniaka, byłem obojętny wobec awatarów, ale czułem, że nieuchronnie staną się częścią codziennego życia online. Słyszałem o ludziach na Instagramie tworzących je na swoje podobieństwo, aby pomóc sobie w tworzeniu treści społecznościowych. Uważam, że to wszystko jest bardzo interesujące i być może dlatego nie mam teraz oporów, aby przedstawić wam mojego cyfrowego bliźniaka. To pierwszy raz, kiedy Synthesia stworzyła cyfrowego awatara dla dziennikarza (lub dla kogokolwiek poza Voicą). Jest wyszkolony na moim artykule o tym, dlaczego startupy finansowane przez VC popełniają więcej oszustw niż startupy niefinansowane przez VC, i będzie odpowiadał tylko na pytania dotyczące tego artykułu.
Poniżej wystarczy nacisnąć „start w nowym oknie”, aby rozpocząć.
Aby to stworzyć, wszedłem do mini studia filmowego mieszczącego się w biurze Synthesii, gdzie zrobili mi wiele zdjęć i nagrali dwuminutowe nagranie mojego głosu. Musiałem wyrazić zgodę na tworzenie tych awatarów i cóż, cyfrowy Dom się narodził. Stworzyli dla mnie osobistego awatara (taki, który po prostu czyta dowolny scenariusz, jaki mu dam) – z okularami i bez – oraz dwa interaktywne awatary (takie, które mogą odpowiadać i słuchać mnie), również z okularami i bez.
Wybraliśmy artykuł, na którym miał być wyszkolony interaktywny awatar, a następnie jeden z zespołów zbudował mojego interaktywnego awatara, który jest napędzany kombinacją modeli zamiany mowy na tekst, wideo, języka i zamiany tekstu na mowę. Stack technologiczny mojego awatara obejmuje własne modele wideo i głosu Synthesii, chociaż firma pozwala klientom wybierać alternatywy od innych laboratoriów, takich jak Cartesia, ElevenLabs, Google czy OpenAI. Przedsiębiorstwa mogą również wybrać hosting swoich awatarów w dowolnej chmurze lub zapłacić Synthesii za ich hostowanie.
Model zamiany mowy na tekst przekształca to, co mówią ludzie, w tekst, agentowy model językowy rozumie tekst i może podejmować na jego podstawie działania, model zamiany tekstu na mowę przekształca odpowiedź w dźwięk, a na koniec model wideo (zbudowany przez Synthesię) animuje awatara, gdy mówi.
Ogólnie rzecz biorąc, Synthesia buduje trzy typy produktów – platformę do tworzenia i dystrybucji wideo z klasycznymi awatarami, gdzie ktoś wpisuje scenariusz, a awatar go powtarza; platformę agentową o nazwie Sessions, gdzie ludzie mogą wchodzić w interakcje z awatarami w ankietach lub odgrywaniu ról; oraz platformę API, gdzie ludzie mogą wziąć modele wideo i głosu Synthesii i połączyć je z innymi usługami technologicznymi, aby zbudować interaktywne awatary lub inne typy produktów.
Zespołowi Synthesii zajęło kilka dni stworzenie moich awatarów. Najpierw bawiłem się osobistymi i wpisałem dość ogólny scenariusz, aby sprawdzić, jak brzmi mój głos AI. Kazałem mu mówić o tym, jak nadeszła jesień w Nowym Jorku, moja ulubiona pora roku. Głos był dość dokładny i byłem