Podcast mit KI erstellen: Alles geht. Die Stimme entscheidet.

KI recherchiert, schreibt, räumt Aufnahmen auf und liest vor. Dieser Ratgeber zeigt, welche Werkzeuge in einer Unternehmensproduktion Zeit sparen, wo eine deutsche KI-Stimme an ihre Grenze kommt, und warum seit August 2026 jede natürlich klingende KI-Stimme einen hörbaren Hinweis braucht.

Seit August 2026

Wann eine KI-Stimme im Podcast gekennzeichnet werden muss.

Sobald sie klingt wie ein Mensch, den es geben könnte. Eine bekannte Person muss dafür nicht nachgeahmt und keine echte Stimme geklont sein. Eine frei erfundene, natürlich klingende Stimme löst die Pflicht genauso aus.

Das ist der Punkt, an dem sich die meisten verrechnen. Viele lesen „Deepfake“ und denken an geklaute Prominentenstimmen. Artikel 50 der KI-Verordnung fragt jedoch nicht, wem die Stimme gehört, sondern ob euer Publikum glauben könnte, hier habe ein echter Mensch gesprochen. Seit dem 2. August 2026 gilt das in der gesamten EU.

Für einen Podcast bedeutet das Folgendes: Die ganz normale Standardstimme aus einem Sprachmodell, die einfach nur gut und natürlich klingt, ist genau der Fall, um den es geht. Ohne Klon, ohne Vorbild, ohne Täuschungsabsicht. Frei bleibt nur, was offensichtlich künstlich klingt, also die erkennbare Roboterstimme.

Der Hinweis gehört auf die Audiospur, an den Anfang, dorthin wo die Stimme läuft. Ein Vermerk in den Shownotes, in der Beschreibung oder im Impressum genügt nicht, weil ihn beim Hören niemand mitbekommt. Wer eine ganze Folgenreihe synthetisch vertonen lässt, beginnt also jede Folge mit einem Satz über die Maschine. Die Pflicht hängt dabei am Audio und nicht am Medium. Ob ein Beitrag im Radio läuft, in einem Podcast oder als Audio Ad im Streaming, macht keinen Unterschied.

Deshalb steht dieser Punkt hier ganz vorn und nicht im Kleingedruckten. Alles Weitere in diesem Ratgeber, die Werkzeuge, die Kosten und die Frage nach der Qualität, entscheidet sich unter dieser Bedingung.

Was heißt „Podcast mit KI erstellen“ eigentlich?

Hinter dem Begriff stecken vier sehr verschiedene Arbeitsweisen. Sie unterscheiden sich darin, wie viel am Ende noch ein Mensch entscheidet. Wer nach Podcast mit KI erstellen sucht, meint mal ein Werkzeug für den Schnitt und mal einen Knopf, der aus einem PDF eine fertige Folge macht.

Diese Unterscheidung ist keine Theorie. An ihr hängt, ob eure Hörerinnen und Hörer am Ende ein Format bekommen, das nach eurem Unternehmen klingt, oder eines, das nach jedem beliebigen klingt. Wir gehen die vier Stufen der Reihe nach durch und werden bei der dritten ausführlich, weil dort die meisten Fragen aufschlagen.

Studiomikrofon und Regler in unserer Podcastproduktion

1. KI als Werkzeug

Menschen sprechen, die Maschine räumt auf. Rauschen raus, Transkript und Kapitelmarken automatisch. Das Format bleibt eine echte Aufnahme.

2. KI als Zuarbeit

Recherche, Gliederung, Fragenkataloge und Textvorschläge kommen aus dem Modell. Die Redaktion entscheidet, gesprochen wird weiterhin ins Mikrofon.

3. KI als Stimme

Ein fertiges Skript geht in ein Sprachmodell und kommt als Audiodatei zurück. Hier fällt die Entscheidung, um die es in diesem Ratgeber vor allem geht.

4. KI als ganze Produktion

Aus einem Dokument entsteht auf Knopfdruck eine fertige Folge mit künstlichen Stimmen. Das Ergebnis läuft meist unter dem Stichwort KI-Podcast, im Markenkontext ist es bisher selten überzeugend.

Welche KI-Tools in einer Produktion Zeit sparen.

KI spart Zeit dort, wo Arbeit stumpf und wiederholbar ist. Überall dort, wo Geschmack im Spiel ist, kostet sie eher Zeit, weil jemand das Ergebnis prüfen muss.

Recherche und Struktur

ChatGPT, Claude und Perplexity liefern Gliederungen, Fragenkataloge und Gegenpositionen in Minuten. Quellen gehören trotzdem geprüft, weil ein erfundener Beleg im Fachpodcast teuer wird.

Skript und Fragen

Ein KI-Entwurf ist ein brauchbarer Rohbau und ein schwaches Endprodukt. Er glättet Sprache genau dorthin, wo am Ende alle Unternehmen gleich klingen.

Aufnahme aufräumen

Adobe Podcast, Auphonic und ähnliche Dienste holen Raumhall und Rauschen heraus. Sie retten schwache Aufnahmen, aus einer Handyaufnahme wird trotzdem keine Studioaufnahme.

Schnitt

Descript schneidet über das Transkript, geändert wird also der Text statt der Wellenform. Wo eine Folge zäh wird und gekürzt gehört, erkennt es nicht.

Transkript, Kapitel, Shownotes

Hier ist KI unbestritten stark und spart pro Folge leicht eine Stunde. Transkripte sind zugleich die Grundlage dafür, dass einzelne Folgen überhaupt auffindbar werden.

Stimme

ElevenLabs und vergleichbare Anbieter vertonen ein fertiges Skript in wenigen Minuten. Wie weit das im Deutschen reicht, steht im nächsten Abschnitt.

Die ersten fünf Punkte sind in unserem Alltag längst Routine. Was davon in eine laufende Produktion einfließt, steht auf den Seiten Postproduktion und Podcast-SEO & GEO.

Wie gut vertont eine KI-Stimme ein fertiges Skript?

Bei kurzen, sachlichen Passagen von wenigen Sätzen ist der Abstand zu einer echten Aufnahme klein geworden. Über eine ganze Folge hinweg bleibt er hörbar. Das liegt nicht am Klang, denn der ist gut. Es liegt an der Betonung.

Ein Sprachmodell sagt vorher, wie ein Satz mit hoher Wahrscheinlichkeit klingt. Ein Mensch weiß, worum es geht. Der Unterschied fällt überall dort auf, wo die Bedeutung entscheidet, welches Wort betont wird. Nehmt den Satz „Das habe ich nicht gesagt“. Liegt die Betonung auf „ich“, dann hat es jemand anderes gesagt. Liegt sie auf „gesagt“, dann steht es womöglich trotzdem irgendwo geschrieben. Liegt sie auf „das“, dann wurde sehr wohl gesprochen, nur etwas anderes. Ein Text, drei gegensätzliche Aussagen. Wer den Zusammenhang kennt, trifft die gemeinte. Ein Modell trifft den Durchschnitt.

Dazu kommt, was das Deutsche einer Maschine besonders schwer macht. Zusammengesetzte Wörter werden falsch zerlegt, Fugenlaute verschluckt, Fremdwörter und Anglizismen in Fachtexten geraten in die falsche Sprachfarbe. Firmennamen, Produktnamen und Abkürzungen wie GmbH, KPI oder EBIT trifft ein Modell nur zufällig richtig, weil es sie nicht kennt, sondern rät. Bei Zahlen und Datumsangaben wird es unangenehm konkret. „2026“ kann als Jahreszahl oder als Ziffernfolge herauskommen, und niemand hört das vorher.

Der größte Effekt ist der unauffälligste. Über zwanzig Minuten flacht die Dynamik ab. Die Pausen sind alle ungefähr gleich lang, weil sie an der Zeichensetzung hängen und nicht am Sinn. Es fehlt die Atmung an der Stelle, an der ein Mensch Luft holt, weil gleich etwas Wichtiges kommt. Niemand im Publikum benennt das. Menschen schalten trotzdem früher ab, weil nichts mehr passiert.

Je kürzer und sachlicher der Text, desto besser hält eine KI-Stimme mit. Je länger die Folge und je mehr Haltung im Text steckt, desto deutlicher fällt sie auseinander.

Woran euer Publikum eine KI-Stimme tatsächlich erkennt.

Eine synthetische Stimme im Deutschen verrät sich meist innerhalb einer Minute, wenn man weiß, worauf zu achten ist. Diese sieben Punkte tauchen bei uns in fast jedem Test auf.

  • Der Satzakzent sitzt falsch. Betont wird das wahrscheinlichste Wort, nicht das gemeinte. Bei Aufzählungen und Vergleichen fällt es zuerst auf.
  • Eigennamen kippen. Firmen-, Produkt- und Ortsnamen bekommen eine Aussprache, die im Unternehmen selbst niemand benutzt.
  • Zahlen und Datumsangaben raten. Jahreszahlen, Prozentwerte, Uhrzeiten und Einheiten werden mal so und mal anders gelesen, auch innerhalb einer Folge.
  • Abkürzungen werden buchstabiert oder eben nicht. Aus einem Fachbegriff wird eine Buchstabenreihe, aus einer Buchstabenreihe ein Fantasiewort.
  • Alle Pausen sind gleich lang. Sie folgen den Kommas, nicht dem Gedanken. Nach zehn Minuten wirkt das wie ein Metronom.
  • Die Atmung fehlt oder sitzt daneben. Manche Modelle setzen Atemgeräusche ein, allerdings an Stellen, an denen ein Mensch keine Luft holen würde.
  • Der Bogen über die Folge fehlt. Anfang, Mitte und Schluss klingen gleich engagiert. Genau das macht Zuhören anstrengend.

Ein sinnvoller Test dauert zehn Minuten. Lasst dieselben zwei Absätze einmal von einem Werkzeug erzeugen und einmal von einem Menschen sprechen, und spielt beides jemandem vor, der den Text nicht kennt. Die Frage lautet nicht „Ist das KI?“, sondern „Wo hast du zugehört und wo nicht mehr?“

Wie ihr ein Skript schreibt, das eine KI-Stimme sauber liest.

Die meisten schlechten Ergebnisse liegen nicht am Modell, sondern am Text. Ein Skript für eine Maschine wird anders geschrieben als eines für einen Menschen, weil die Maschine keinen Zusammenhang mitdenkt.

  • Ein Gedanke pro Satz. Verschachtelte Sätze mit zwei Nebensätzen bringen jede Stimme aus dem Rhythmus. Kurze Hauptsätze klingen sofort besser.
  • Zahlen ausschreiben. „zweitausendsechsundzwanzig“ statt „2026“, „fünfzehn Prozent“ statt „15 %“. Damit fällt die häufigste Fehlerquelle weg.
  • Eigennamen lautlich schreiben. Für Firmen- und Produktnamen eine Ersatzschreibung hinterlegen, die klingt wie die gewünschte Aussprache. Das ist unschön im Dokument und rettet die Aufnahme.
  • Abkürzungen auflösen. Das Wort ausschreiben, oder die Buchstaben durch Punkte trennen, damit die Stimme nicht rät.
  • Pausen über Absätze steuern. Modelle pausieren an Satzzeichen. Wer eine Denkpause will, macht einen Absatz und keine Kommakette.
  • Anglizismen prüfen. Englische Fachbegriffe in deutschen Sätzen wechseln oft die Sprachfarbe. Wo es geht, das deutsche Wort nehmen.
  • In Blöcken erzeugen. Zwei bis drei Absätze am Stück statt der ganzen Folge. Kurze Blöcke bleiben in der Betonung stabiler und lassen sich einzeln neu erzeugen, ohne dass alles danach kippt.

Diese sieben Punkte holen den größten Teil des Qualitätsunterschieds heraus. Was danach noch übrig bleibt, ist genau das, was ein Mensch am Mikrofon ohne Anleitung richtig macht.

Was ein KI-vertontes Skript am Ende kostet.

Die Lizenz ist der kleinste Posten. Teuer wird die Kontrollarbeit, weil jede schiefe Betonung von Hand gefunden, umgeschrieben und neu erzeugt werden muss.

ElevenLabs ist der Anbieter, an dem die meisten hängen bleiben. Der kostenlose Zugang deckt 10.000 Zeichen im Monat ab und erlaubt keine kommerzielle Nutzung. Kommerziell nutzbar wird es ab dem Starter-Tarif für 6 US-Dollar im Monat mit 30.000 Zeichen. Der Creator-Tarif liegt bei 22 US-Dollar mit 121.000 Zeichen, der Pro-Tarif bei 99 US-Dollar mit 600.000 Zeichen. Stand ist August 2026, und diese Tarife ändern sich häufig.

Für die Umrechnung auf eine Folge hilft eine Faustzahl. Bei ruhigem Sprechtempo entsprechen rund 850 Zeichen etwa einer Minute gesprochenem Deutsch. Eine Folge von zwanzig Minuten liegt damit bei ungefähr 17.000 Zeichen. Der Creator-Tarif reicht also rechnerisch für etwa sieben Folgen im Monat. So weit die Prospektrechnung.

In der Praxis erzeugt niemand eine Folge einmal. Jede korrigierte Passage kostet erneut Zeichen, und die Korrekturen sind der eigentliche Aufwand. Jemand muss die fertige Datei vollständig anhören, die schiefen Stellen notieren, den Text umschreiben oder mit Lautschrift nachhelfen, neu erzeugen und die Schnipsel wieder einsetzen. Für zwanzig Minuten sind zwei bis drei Stunden realistisch, und diese Stunden kosten mehr als jedes Abo.

Der ehrliche Vergleich stellt also 22 Dollar plus mehrere Stunden Kontrollarbeit gegen eine Aufnahme, die nach dem Take fertig ist. Woraus sich der Aufwand einer vollständigen Produktion zusammensetzt, ordnet die Seite Podcast-Kosten ein.

36 %
vermuten, schon KI-Audio gehört zu haben
unter Online-Audio-Hörerinnen und -Hörern in Deutschland
22 $
kostet der meistgenutzte Stimmen-Tarif
ElevenLabs Creator, 121.000 Zeichen im Monat, Stand August 2026

Quelle: Online-Audio-Monitor 2025 (BLM u. a., 16.09.2025) · elevenlabs.io/pricing

Wofür sich eine KI-Stimme lohnt und wofür nicht.

Statt „KI oder Mensch“ lohnt die Frage, wofür genau. Diese Aufteilung hat sich bei uns in Kundenprojekten bewährt.

Dafür ist eine KI-Stimme eine gute Wahl

  • Interne Formate mit hoher Frequenz. Wochenupdates, Schulungsinhalte und Wissensbausteine, die schnell veralten und nie das Unternehmen repräsentieren müssen.
  • Vorlesefassungen bestehender Texte. Ein Fachartikel als Audiofassung ist ein Zugewinn an Barrierefreiheit, auch wenn er synthetisch klingt.
  • Prototypen vor der Aufnahme. Ein Skript einmal maschinell vertonen, um Länge, Tempo und Verständlichkeit zu prüfen, bevor jemand ins Studio geht. Das spart echte Studiozeit.
  • Sprachversionen ohne Budget. Wenn ein Markt sonst gar nichts bekäme, ist eine gekennzeichnete synthetische Fassung besser als keine Fassung.

Davon raten wir ab

  • Das Hauptformat eines Unternehmens. Ein Podcast baut Vertrauen über Nähe auf. Nähe entsteht nicht über eine Stimme, hinter der niemand steht.
  • Recruiting und Arbeitgebermarke. Wer über Kultur und Menschen spricht und dabei nicht selbst spricht, widerlegt die eigene Botschaft. Mehr dazu unter Recruiting-Podcast und Employer Branding Podcast.
  • Werbung im Podcast. Ein Spot dauert 20 oder 30 Sekunden. Ein Hinweis auf die künstliche Stimme frisst davon einen spürbaren Teil. Details unter Podcast-Werbung.
  • Gespräche und Interviews. Der Reiz eines Gesprächs liegt im Unerwarteten. Ein Modell erzeugt das Erwartbare.

NotebookLM und die Generatoren: wann das reicht.

Google NotebookLM erzeugt aus hochgeladenen Quellen ein Audiogespräch zweier synthetischer Stimmen. Deutsch ist als Ausgabesprache verfügbar, klingt aber merklich künstlicher als die englische Fassung. Vergleichbare Generatoren wie HeyGen, Speechify oder NoteGPT machen im Kern dasselbe, nur mit anderer Oberfläche. Wer einen KI-Podcast erstellen will, ohne selbst zu schreiben, landet fast immer bei einem dieser Dienste.

Für internes Wissen ist das ein sinnvolles Werkzeug. Ein dreißigseitiges Handbuch als vierzehnminütiges Gespräch nimmt mehr Leute mit als das Handbuch selbst. Für Onboarding, Schulungen und Projektwissen ist das ein echter Zeitgewinn.

Als veröffentlichtes Format hat der Vollautomat ein Problem, das mit Tonqualität nichts zu tun hat. Er erzeugt aus jeder Quelle dieselbe Sorte Gespräch, zwei freundliche Stimmen, die einander bestätigen, mit dem gleichen Rhythmus und den gleichen Übergängen wie bei allen anderen. Genau die Wiedererkennbarkeit, für die ein Unternehmen einen Podcast startet, entsteht dabei nicht. Was ein Format eigenständig macht, steht unter Podcast-Konzept.

Was Plattformen regeln und was nicht.

Keine Plattform nimmt euch die Kennzeichnung ab. Spotify hat im August 2026 ein Kennzeichen angekündigt, ausgerollt ab Mitte September 2026, das Künstlerprofile in der Musik betrifft und nicht Podcasts.

Dieses Kennzeichen beschreibt außerdem nur, ob die Identität eines Profils KI-generiert ist, nicht wie die Inhalte produziert wurden. Für einen Podcast bleibt die Pflicht also dort, wo sie im vorherigen Abschnitt steht, nämlich beim Gesetz und bei euch als Auftraggeber.

Ein zweiter Punkt betrifft geklonte Stimmen. Wer die Stimme einer echten Person nachbildet, braucht deren Einwilligung, und zwar unabhängig von jeder Kennzeichnung. Die Einwilligung regelt, wessen Stimme benutzt werden darf. Der Hinweis regelt, dass das Publikum von der Maschine weiß. Das sind zwei getrennte Fragen, und beide müssen geklärt sein.

Wir sind keine Kanzlei, und dieser Abschnitt ist keine Rechtsberatung. Für den Einzelfall gehört die Frage zu jemandem mit juristischer Ausbildung.

Passend dazu, ausführlich aus Sprechersicht mit Ausnahmen, Bußgeldrahmen und Formulierungsbeispielen: Kennzeichnungspflicht für KI-Stimmen auf christiangrollmann.de.

Wo wir KI einsetzen und wo nicht.

Wir arbeiten mit KI, und wir sagen, wo. Transkripte, Kapitelmarken, erste Shownotes-Entwürfe und Rauschentfernung laufen bei uns maschinell. Das spart pro Folge Stunden, die niemandem fehlen. Geschnitten wird von Hand, auch die Füllwörter, weil eine Maschine nicht hört, welches „ähm“ zum Menschen gehört und welches stört.

Gesprochen wird bei uns von Menschen. Christian steht seit Jahren als Sprecher für Marken wie Porsche, Google und Spotify im Studio, Martin kommt aus dem Radio. Das ist kein Bekenntnis gegen Technik, sondern eine Rechnung. Eine Aufnahme mit jemandem, der das Briefing gelesen hat, ist nach dem Take fertig. Eine erzeugte Datei ist zum selben Zeitpunkt noch Rohmaterial. Sie muss erst vollständig abgehört und in Teilen neu erzeugt werden, bevor sie sendefähig ist. Mehr über uns beide steht unter Über uns, mehr über Christians Arbeit als Sprecher auf christiangrollmann.de.

Wenn ihr für ein bestimmtes Format eine synthetische Stimme einsetzen wollt, sagen wir euch, ob das funktioniert, und bauen es sauber mit ein. Wir verkaufen euch nur keine KI-Stimme für ein Format, bei dem sie das Gegenteil von dem bewirkt, was ihr vorhabt.

36 % vermuten, schon KI-generiertes Audio gehört zu haben.

Ihr wisst, was ihr sagen wollt. Wir klären, wer es sagt.

In einem Gespräch sortieren wir, welche Teile eurer Produktion die Maschine übernehmen kann und wo sich eine echte Aufnahme rechnet.

Projekt besprechen

Häufige Fragen zu Podcasts mit KI.

Technisch ja, vom Skript über die Stimme bis zur fertigen Audiodatei. Für ein Unternehmensformat raten wir davon ab, weil dabei genau die Wiedererkennbarkeit fehlt, für die ein Podcast gestartet wird.

Der Klang ist sehr nah an einer echten Aufnahme, die Sinnbetonung ist es nicht. Ein Modell betont das wahrscheinlichste Wort, ein Mensch das gemeinte.

Die Lizenz liegt je nach Anbieter und Umfang zwischen 6 und 99 US-Dollar im Monat. Deutlich schwerer wiegt die Zeit für Kontrolle und Korrekturschleifen.

Google NotebookLM wandelt hochgeladene Quellen in ein Gespräch zweier künstlicher Stimmen um, auch auf Deutsch. Im internen Wissenstransfer ist das Ergebnis brauchbar, als veröffentlichtes Markenformat fällt es durch.

Ja, und zwar schon dann, wenn die Stimme nach irgendeinem glaubwürdigen Menschen klingt. Weder ein prominentes Vorbild noch der Klon einer realen Person ist dafür nötig, und der Hinweis muss auf der Audiospur stehen.

Ja, Anbieter wie ElevenLabs bieten das an. Am meisten bringt ein Klon bei Korrekturen und Nachträgen in bereits fertigen Folgen.

Nein. Störgeräusche, Transkripte und Kapitelmarken erledigt sie zuverlässig, der Schnitt selbst und die Dramaturgie bleiben Handarbeit.