Als Alexandru Voica, Leiter der Unternehmenskommunikation beim Video-Generierungs-Startup Synthesia, mir diesen Sommer einen Link zum neuesten Mitglied ihres PR-Teams schickte, war ich überrascht. Es handelte sich um einen interaktiven virtuellen Avatar von ihm, der darauf trainiert war, häufige Pressefragen über Synthesia zu beantworten, wie zum Beispiel, was das Unternehmen tut und wie es funktioniert. Am Tag zuvor war ich in einem Panel, in dem PR-Leute mich fragten, ob ich etwas gegen Pitches hätte, die KI-generierten Text verwenden. Aber Alexandrus Avatar ging darüber hinaus – für mich schien das der Endgegner des KI-Einsatzes in der PR zu sein.
Im September lud Synthesia mich in seine neuen Büroräume in New York ein. Ursprünglich im Vereinigten Königreich ansässig, ist Synthesia ein angesagtes Digital-Avatar-Startup neben anderen wie D-ID, HeyGen und Colossyan. In diesem Jahr erreichte es eine Bewertung von 4 Milliarden Dollar und gab letztes Jahr bekannt, die Marke von 100 Millionen Dollar an wiederkehrenden Umsätzen überschritten zu haben.
Synthesia ermöglicht Unternehmen, interaktive Trainingsvideos mit KI-Avataren zu erstellen, und hat kürzlich ein Produkt namens Roleplay Sessions auf den Markt gebracht, mit dem Mitarbeiter beispielsweise Verkaufsgespräche mit einem interaktiven KI-Avatar üben können, der antwortet und ihre Antworten bewertet.
Als ich zur Eröffnung des neuen Büros ging und sie mich fragten, ob ich meinen eigenen KI-Avatar haben möchte, zögerte ich nicht einmal, ja zu sagen. Natürlich wollte ich meinen eigenen digitalen Zwilling. Mein Outfit war an diesem Tag süß, und meine Haare saßen.
Bis ich meinen digitalen Zwilling traf, war ich Avataren gegenüber gleichgültig gewesen, aber ich hatte das Gefühl, dass sie unweigerlich Teil des alltäglichen Online-Lebens werden würden. Ich hörte von Leuten auf Instagram, die sich welche nach ihrem Ebenbild erstellen ließen, um ihnen bei der Erstellung von Social-Content zu helfen. Ich finde das alles sehr interessant, und vielleicht ist das der Grund, warum ich jetzt keine Bedenken habe, Ihnen meinen digitalen Zwilling zu präsentieren. Dies ist das erste Mal, dass Synthesia einen digitalen Avatar für einen Journalisten erstellt hat (oder für irgendjemanden außerhalb von Voica). Er ist auf meine Geschichte darüber trainiert, warum risikokapitalfinanzierte Startups mehr Betrug begehen als nicht VC-finanzierte Startups, und wird nur Fragen zu dieser Geschichte beantworten.
Drücken Sie unten einfach auf „In neuem Fenster starten“, um zu beginnen.
Um dies zu erstellen, betrat ich ein Mini-Filmstudio, das in Synthesias Büro untergebracht ist, wo sie zahlreiche Fotos von mir machten und eine zwei-minütige Aufnahme meiner Stimme aufnahmen. Ich musste der Erstellung dieser Avatare zustimmen, und nun ja, der digitale Dom war geboren. Sie erstellten einen persönlichen Avatar für mich (einen, der einfach jedes Skript vorliest, das ich ihm gebe) – mit und ohne Brille – und sie erstellten zwei interaktive Avatare für mich (solche, die zurückreden und mir zuhören können), ebenfalls mit und ohne Brille.
Wir wählten einen Artikel aus, auf den der interaktive Avatar trainiert werden sollte, und dann baute eines der Teams meinen interaktiven Avatar, der auf einer Kombination aus Sprache-zu-Text-, Video-, Sprach- und Text-zu-Sprache-Modellen basiert. Der Tech-Stack meines Avatars umfasst Synthesias eigene Video- und Sprachmodelle, obwohl das Unternehmen Kunden auch erlaubt, Alternativen von anderen Labors wie Cartesia, ElevenLabs, Google oder OpenAI zu wählen. Unternehmen können ihre Avatare auch in einer beliebigen Cloud hosten oder Synthesia dafür bezahlen, sie zu hosten.
Das Sprache-zu-Text-Modell verwandelt das Gesagte in Text, das agentische Sprachmodell versteht Text und kann darauf basierend Aktionen ausführen, das Text-zu-Sprache-Modell verwandelt eine Antwort in Audio, und schließlich animiert ein Videomodell (von Synthesia entwickelt) den Avatar, während er spricht.
Insgesamt baut Synthesia drei Arten von Produkten – eine Videoerstellungs- und -vertriebsplattform mit klassischen Avataren, bei der jemand ein Skript eingibt und der Avatar es wiederholt; eine agentische Plattform namens Sessions, auf der Menschen in Umfragen oder Rollenspielen mit den Avataren interagieren können; und eine API-Plattform, auf der Menschen Synthesia-Video- und Sprachmodelle nehmen und sie mit anderen Tech-Diensten kombinieren können, um interaktive Avatare oder andere Arten von Produkten zu erstellen.
Das Synthesia-Team brauchte ein paar Tage, um meine Avatare zu erstellen. Ich spielte zuerst mit den persönlichen und tippte ein ziemlich generisches Skript ein, um zu sehen, wie meine KI-Stimme klang. Ich ließ sie darüber sprechen, wie der Herbst in New York angekommen ist, meine Lieblingsjahreszeit. Die Stimme war ziemlich genau, und ich war