Jahrelang basierte eine stille Nische auf YouTube und TikTok auf einer einfachen Formel: Nimm einen Reddit-Thread, füge eine KI-Stimme hinzu, die ihn vorliest, und lass die Kommentare den Rest erledigen. Reddit hat nun beschlossen, dieses Format intern umzusetzen.
Die Plattform führt ein Experiment durch, bei dem Textbeiträge in kurze Videos umgewandelt werden, in denen KI-Stimmen den Originalbeitrag und eine Auswahl von Kommentaren vorlesen, während der entsprechende Text auf dem Bildschirm hervorgehoben wird. Ein Label unter jedem Video kennzeichnet es als „Real conversation voiced by AI.“ Das Experiment ist derzeit im Web live und wird bald auf iOS und Android ausgeweitet.
Wie das Format tatsächlich funktioniert
Die Mechanik ist unkompliziert. Ein Beitrag, der normalerweise als Thread aus Textantworten erscheinen würde, wird stattdessen als Video präsentiert – typischerweise ein paar Minuten lang, wobei mehrere KI-Stimmen verschiedene Teile des Gesprächs übernehmen. Nutzer können über einen Schalter oben auf der Seite zwischen den beiden Formaten wechseln, der für den Originaltext mit „Read“ und für die Videoversion mit „Play“ markiert ist.
Reddit automatisiert diesen Prozess nicht vollständig. Das Unternehmen wählt manuell aus, welche Beiträge konvertiert werden, zumindest in dieser frühen Phase. Das Experiment beginnt mit bestehenden Beiträgen und wird im Laufe der Zeit auf weitere ausgedehnt. Ein anschauliches Beispiel aus dem Quellmaterial betrifft einen Beitrag in r/boardgames, der ursprünglich vor acht Jahren veröffentlicht wurde und 101 Antworten anzog. Dieser Thread existiert nun sowohl in seiner ursprünglichen Textform als auch als dreiminütiges Video, in dem KI-Stimmen die Antworten vorlesen.
Das ist erwähnenswert: Die Inhalte, die transformiert werden, sind nicht neu. Reddit greift in sein Archiv zurück, anstatt nur frische Diskussionen an die Oberfläche zu spülen. Diese Wahl signalisiert etwas Absichtliches an der Strategie.
Die Geschäftslogik hinter dem Experiment
Reddit-CEO Steve Huffman bestätigte das Experiment während einer Telefonkonferenz zu den Geschäftszahlen und beschrieb es als eine Möglichkeit, Menschen Beiträge im Hintergrund anhören zu lassen. Er wies auch auf einen sogenannten „aufkommenden Inhalts-Typ“ hin: die bereits weit verbreitete Praxis von Drittanbietern, die sich ein Publikum aufbauen, indem sie Reddit-Inhalte auf anderen Plattformen laut vorlesen. In einem Brief an die Aktionäre formulierte das Unternehmen die breiter angelegte Initiative so, dass sie neu erfindet, wie Nutzer sich mit Inhalten verbinden und diese durch ein modernisiertes Videoerlebnis konsumieren.
Die Geschäftslogik ist leicht nachvollziehbar. Wenn die Leute bereits Reddit-Inhalte mit KI-Stimmen auf YouTube und TikTok schauen, finden diese Aufrufe und Interaktionen außerhalb der Plattform statt. Indem Reddit dasselbe Format nativ produziert, hält es die Nutzer im eigenen Ökosystem und behält die Aufmerksamkeit, die sonst woanders hinfließen würde.
Anfang dieses Jahres hat Reddit zudem Video-Antworten eingeführt – ein weiterer Schritt, um die Plattform weniger wie ein statisches Forum und mehr wie eine Multimedia-Umgebung wirken zu lassen.
Was dies darüber verrät, wie sich Plattformen entwickeln
Hier ist, was die meiste Berichterstattung über diese Geschichte verpasst: Hier geht es eigentlich nicht um KI-Stimmen. Es geht um die sich verändernde Beziehung zwischen Text und Aufmerksamkeit.
Lange Text-Threads waren schon immer das Kernprodukt von Reddit. Sie belohnen Geduld und Lesekompetenz. Aber die breitere Medienlandschaft hat sich hin zu Formaten verlagert, die passiv leichter zu konsumieren sind – während des Pendelns, bei einer anderen Tätigkeit, ohne einen Bildschirm zu erfordern. Podcasts, kurze Videos und Audioinhalte sind gerade deshalb gewachsen, weil sie in Momente passen, in denen das Lesen nicht möglich ist.
Reddits Experiment ist der Versuch, seine bestehenden Inhalte mit diesen Momenten kompatibel zu machen. Die KI-Stimme ist das Werkzeug. Das Ziel ist Reichweite.
Dies wirft echte Fragen auf, die das Experiment beantworten muss. KI-Stimmen können Wörter falsch aussprechen, den Tonfall falsch zuordnen oder den Humor und die Ironie abflachen, die Reddit-Threads überhaupt erst lesenswert machen. Ein sarkastischer Kommentar, der mit einer neutralen KI-Stimme vorgetragen wird, ist etwas völlig anderes. Reddits Sprecher räumte diese Risiken implizit ein und wies darauf hin, dass das Unternehmen das Format „auf eine Weise liefern möchte, die sich authentisch für Reddit anfühlt.“ Authentizität lässt sich schwerer automatisieren als Audio.
Es gibt auch ein subtileres Problem. Reddits Wert kam schon immer von seinen Communities: der spezifischen Kultur, dem Vokabular und den Normen einzelner Subreddits. Ein dreiminütiges Video von KI-Stimmen, die einen Brettspiel-Thread vorlesen, ist nicht dasselbe wie Teil dieser Community zu sein. Es ist eine Zusammenfassung davon. Ob diese Zusammenfassung nützlich ist oder ob sie etwas Wichtiges verwässert, ist eine Frage, die das Experiment beantworten soll, auf die es aber keine offensichtliche Vorab-Antwort gibt.
Klar ist, dass Reddit mit dieser Ausrichtung nicht allein ist. Plattformen in der gesamten Branche untersuchen Möglichkeiten, textbasierte Inhalte hörbar und schackbar zu machen, weil Aufmerksamkeit zunehmend in Formaten zu Hause ist, die kein Lesen erfordern. Die Werkzeuge, um dies im großen Stil zu tun, existieren jetzt. Das schwierigere Problem ist, ob das Ergebnis immer noch konsumenswert ist.
Kurz gesagt
Reddit konvertiert seine Text-Threads in Videos mit KI-Stimmen, beginnend mit manuell ausgewählten bestehenden Beiträgen. Der Schritt ist eine direkte Reaktion auf ein Format, um das herum sich Drittanbieter-Creator auf anderen Plattformen bereits ein Publikum aufgebaut haben. Das Experiment testet, ob Reddit diese Aufmerksamkeit nativ zurückgewinnen kann und ob KI-Stimmen den Ton und die Textur transportieren können, die seine Communities unverwechselbar machen. Die Technologie ist der einfache Teil. Die Authentizität ist es nicht.
Basierend auf Berichten von The Verge.