Der Canva AI Voice Generator verwandelt getippten Text in Sekunden in eine gesprochene Sprachausgabe, und er ist auf jedem Canva-Plan kostenlos nutzbar, auch dem Gratis-Plan. Du fügst ein Skript ein, wählst eine Stimme und Sprache, und Canva legt eine fertige Audiospur direkt auf die Timeline deines Designs. Es gibt kein Mikrofon, keine Aufnahme und keine separate App zu installieren.

Die meisten, die nach diesem Tool suchen, sind nicht nur neugierig, was es ist, sie wollen jetzt sofort einer Videoproduktion oder einer Präsentation eine Sprachausgabe hinzufügen. Dieser Leitfaden behandelt genau das. Du erfährst, wo das AI-Voice-Tool zu finden ist, und den Schritt-für-Schritt-Ablauf auf Desktop und Mobilgerät. Außerdem bekommst du das 1.000-Zeichen-Gratis-Limit, was Canva Pro zusätzlich bringt, wie die Sprachqualität wirklich im Vergleich zu dedizierten Tools wie ElevenLabs abschneidet, und wann eine Drittanbieter-App die klügere Wahl ist.

Das Wichtigste in Kürze

  • Canvas AI Voice ist ein eingebautes Text-zu-Sprache-Tool, das auf jedem Plan kostenlos ist, kein Add-on nötig.
  • Die Gratis-Stufe erzeugt bis zu 1.000 Zeichen Sprache pro Clip, etwa 150 bis 200 Wörter.
  • Canva Pro ($18/Monat) hebt das Limit pro Clip an und schaltet die komplette Premium-Stimmbibliothek in über 20 Sprachen frei.
  • Voice Cloning ist eine separate Canva-Funktion, die eine echte Stimme aus einer Audioprobe in über 130 Sprachen kopiert.
  • Für emotionale Erzählungen auf Broadcast-Niveau klingen dedizierte Tools wie Murf oder ElevenLabs noch einen Schritt voraus.

Was ist der Canva AI Voice Generator?

Vom Herausgeber

Jedes KI-Modell in einer App

Fello AI vereint GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 und mehr in einer nativen App für Mac und iPhone.

Jetzt herunterladen!

Der Canva AI Voice Generator ist ein eingebautes Text-zu-Sprache-Tool, das geschriebenen Text in eine natürlich klingende, gesprochene Sprachausgabe umwandelt. Du tippst oder fügst dein Skript ein, wählst aus einer Bibliothek von KI-Stimmen in mehr als 20 Sprachen, und Canva erzeugt das Audio und platziert es direkt auf der Timeline deines Designs. Es läuft im Web sowie in den iOS- und Android-Apps, sodass du ein Projekt vom Laptop oder vom Smartphone aus vertonen kannst.

Wichtig zu verstehen: Das ist synthetische Sprache, keine Aufnahme deiner eigenen Stimme. Das macht sie perfekt für Erklärvideos, Produktdemos, Social-Clips, Onboarding-Material und vertonte Foliendecks, bei denen du eine saubere, konsistente Sprachausgabe ohne Mikrofon-Setup willst. Sie reiht sich neben Canvas anderen generativen Tools ein, den vollständigen Stack findest du in unserem Leitfaden zu was Canva AI kann, oder lies Canvas eigene Übersicht zum AI Voice Generator.

Canva bietet tatsächlich drei verwandte Audiofunktionen an, und sie zu verwechseln ist die häufigste Verwirrungsquelle. AI Voice ist der Text-zu-Sprache-Generator, um den es in diesem Leitfaden geht. Voice Recording lässt dich dein eigenes Mikrofon-Audio aufnehmen. AI Voice Cloning ist ein eigenständiges Tool, das eine echte Stimme aus einer kurzen Probe kopiert, weiter unten behandelt.

So fügst du KI-Sprachausgabe in Canva hinzu, Schritt für Schritt

Eine KI-Sprachausgabe hinzuzufügen dauert unter einer Minute, sobald du weißt, wo die Schaltfläche sitzt. Es gibt zwei Einstiegspunkte, die zum selben Generator führen, und das Tool funktioniert gleich, egal ob dein Design ein Video, eine Präsentation oder ein Social-Beitrag ist. Unten findest du den zentralen Desktop-Ablauf, gefolgt von gerätespezifischen Hinweisen für Video, Präsentationen und Mobilgeräte, und du kannst ihn mit Canvas offizieller Hilfeseite zu AI Voice abgleichen.

  1. Öffne dein Design im Canva-Editor auf canva.com.
  2. Klicke in der linken Seitenleiste auf den Tab Elements, scrolle zu Audio und wähle AI Voice. Siehst du es nicht, öffne stattdessen das Panel Apps und suche nach „AI Voice“.
  3. Tippe dein Skript ein oder füge es ein, im Gratis-Plan bis zu 1.000 Zeichen.
  4. Wähle eine Stimme und eine Sprache aus dem Dropdown und höre sie dir bei Bedarf vorab an.
  5. Klicke auf Generate AI voice. Canva erzeugt das Audio in wenigen Sekunden.
  6. Die Sprachausgabe landet auf deiner Audio-Timeline, wo du sie an Position ziehen, zuschneiden und im Timing an deine Bilder anpassen kannst.

So fügst du KI-Sprachausgabe zu einem Canva-Video hinzu

Bei einem Video erzeugst du die Sprachausgabe wie oben beschrieben und konzentrierst dich dann auf die Abstimmung. Die Audiospur sitzt unter deinen Videoclips auf der Timeline, du kannst sie also nach links oder rechts schieben, bis die Erzählung zur Handlung auf dem Bildschirm passt. Teile dein Skript in kürzere Abschnitte, wenn die Stimme zwischen Szenen pausieren soll, und nutze die Zuschneide-Griffe, um Lücken zu schließen. Baust du die Bilder ebenfalls mit KI, passt unser Rundgang zum Canva AI Video Generator nahtlos dazu.

So fügst du KI-Sprachausgabe zu einer Canva-Präsentation hinzu

Präsentationen funktionieren gleich, mit einem Unterschied, den du kennen solltest. AI Voice wird pro Seite hinzugefügt, du erzeugst also für jede Folie eine eigene Sprachausgabe, und sie spielt, wenn diese Folie auf dem Bildschirm ist. Das gibt dir saubere, selbsterzählende Decks für Schulungen, asynchrone Updates oder aufgezeichnete Vorträge. Schreibe die Erzählung jeder Folie so, dass sie in das 1.000-Zeichen-Fenster passt, und wenn du die Folien selbst ebenfalls mit KI zusammenstellst, sieh dir unseren Leitfaden an, wie du eine Präsentation in Canva mit KI erstellst.

So fügst du KI-Sprachausgabe auf dem Smartphone hinzu

Die Canva-Mobile-App bringt dasselbe AI-Voice-Tool mit. Öffne dein Design, tippe auf die Schaltfläche Plus (+), wähle Apps oder Audio und wähle AI Voice. Tippe dein Skript, wähle eine Stimme und tippe auf Generieren. Das Audio erscheint auf der Timeline genau wie am Desktop, und du kannst es per Fingerzeig verschieben und neu positionieren. Ein praktischer Weg, um einen schnellen Clip zu vertonen, wenn du gerade nicht am Computer sitzt.

Canva AI Voice Gratis-Plan gegen Pro: Limits und Preise

Hier ist der Teil, den die meisten Funktionsseiten auslassen. Das AI-Voice-Tool ist auf jedem Plan kostenlos nutzbar, aber die Gratis-Stufe hat ein hartes 1.000-Zeichen-Limit pro Generierung, das sind etwa 150 bis 200 Wörter, oder ungefähr eine Minute Sprache.

Für alles Längere teilst du das Skript entweder in Abschnitte auf oder upgradest. Canva Pro hebt die Obergrenze pro Clip an und schaltet die komplette Premium-Stimmbibliothek frei, die Wahl hängt also wirklich davon ab, wie viel Erzählung du produzierst.

PlanPreisAI-Voice-ZugangAm besten für
Gratis$0Bis zu 1.000 Zeichen pro Clip, Auswahl an kostenlosen Stimmen, über 20 SprachenKurze Social-Clips, das Tool testen
Pro$18/Monat ($144/Jahr)Höheres Limit pro Clip, komplette Premium-StimmbibliothekCreator, Marketer, regelmäßige Videoarbeit
Business$25/Nutzer/MonatAlles aus Pro plus Team-MarkensteuerungTeams, die im großen Maßstab Markeninhalte produzieren

Jährliche Abrechnung bei Pro läuft auf etwa $12/Monat hinaus, die naheliegende Ersparnis, wenn du Canva regelmäßig nutzt. Fragst du dich, ob sich das Upgrade über die Sprachausgabe hinaus lohnt, deckt unsere vollständige Canva-Preisaufschlüsselung jeden Plan ab und zeigt, wo die KI-Guthaben-Limits wirklich zuschlagen.

Was der Canva AI Voice Generator kann

Über die einfache Text-zu-Sprache-Umwandlung hinaus gibt dir das Tool ein paar Regler, um zu formen, wie die Stimme klingt. Zu wissen, wo die Grenze dessen liegt, was es kann und nicht kann, bewahrt dich davor, Ergebnisse auf Broadcast-Niveau zu erwarten, für die es nie gebaut wurde.

Stimmen, Sprachen und Akzente

Canva bietet eine Bibliothek von KI-Stimmen in mehr als 20 Sprachen, darunter Englisch mit US-, UK- und australischem Akzent, dazu Spanisch, Französisch, Deutsch, Portugiesisch, Chinesisch, Japanisch und mehr. Die Stimmen reichen von umgangssprachlich bis professionell im Ton, mit männlichen und weiblichen Optionen. Der Gratis-Plan enthält eine solide Startauswahl, während Canva Pro das komplette Premium-Set hinzufügt.

Tempo, Tonhöhe und Emotion

Du kannst Tempo und Tonhöhe der erzeugten Stimme an das Tempo deines Videos oder deiner Folie anpassen. Was Canvas eingebaute Stimmen nicht bieten, ist feine emotionale Steuerung, die Art von Freude, Dringlichkeit oder Traurigkeit, die du auf einer dedizierten Plattform einstellen kannst. Der Vortrag ist sauber und klar statt dramatisch ausdrucksstark. Braucht dein Projekt echte Emotion, klinkt sich eine Drittanbieter-App wie Murf in Canva ein und liefert genau das.

Herunterladen und kommerzielle Nutzung

Die Sprachausgabe ist fest in dein Design eingebettet, exportierst du also das Video oder die Präsentation, kommt das Audio mit. Canvas Inhalte, einschließlich KI-generierter Stimmen, sind im Rahmen seiner Bedingungen für die kommerzielle Nutzung freigegeben, du kannst also vertonte Videos ohne zusätzliche Lizenzsorgen auf YouTube, in Anzeigen oder Kundenprojekten einsetzen. Lies bei hohem Einsatz immer kurz Canvas aktuelle Bedingungen durch.

Canva AI Voice Cloning: ein eigenständiges Tool

Verwechsle den AI Voice Generator nicht mit AI Voice Cloning, einer anderen Canva-Funktion. Cloning kopiert eine bestimmte echte Stimme aus einer kurzen Audioprobe und liest dann dein getipptes Skript in dieser Stimme vor. Canvas Cloning-Tool unterstützt über 130 Sprachen, deine eigene Stimme kann also Text in Sprachen sprechen, die du selbst nicht kannst. Bist du stattdessen auf der Empfängerseite des Klons einer anderen Person, hier ist, wie du eine KI-generierte Stimme erkennst.

Der alltägliche AI Voice Generator nutzt vorgefertigte synthetische Stimmen und ist für die meisten Projekte die richtige Wahl. Greif zu Cloning nur, wenn du speziell eine wiedererkennbare, persönliche Stimme über eine Videoreihe hinweg brauchst. Beide leben im selben Audiobereich des Editors, weshalb sie so oft durcheinandergebracht werden.

Ist Canvas AI Voice gut? Vor- und Nachteile und Alternativen

Für ein Tool, das ohne Aufpreis in eine Design-App gebündelt ist, liefert Canvas AI Voice über sein Gewicht hinaus. Es wird keinen professionellen Sprecher oder eine spezialisierte Plattform für High-End-Erzählungen ersetzen, aber für die große Mehrheit der Social-Videos und internen Decks macht es die Arbeit gut. Hier die ehrliche Aufschlüsselung, plus die beiden Alternativen, die du kennen solltest.

Die Stärken

Der größte Gewinn ist die Bequemlichkeit. Stimme, Bilder und Export leben alle an einem Ort, es gibt also kein Hin- und Herspringen zwischen Apps oder erneutes Synchronisieren von Audio. Es ist kostenlos zum Einstieg, die Stimmen sind klar und natürlich genug für die meisten Inhalte, und die Generierung dauert Sekunden. Für alle, die ohnehin schon in Canva designen, streicht es einen ganzen Schritt aus dem Video-Workflow.

Die Einschränkungen

Das 1.000-Zeichen-Gratis-Limit ist die größte Reibung, es zwingt dich, längere Skripte zu zerlegen. Das Fehlen tiefer emotionaler Steuerung sorgt dafür, dass der Vortrag neben Spezialtools flach wirkt. Und die Stimmbibliothek ist, so solide sie ist, kleiner und weniger anpassbar als das, was dedizierte Anbieter bieten.

Das sind vertretbare Kompromisse für eine kostenlose, gebündelte Funktion. Sie sind aber auch real.

Murf und ElevenLabs

Murf bindet sich direkt über das Apps-Panel in Canva ein und fügt Kontrolle über den emotionalen Ton, einen größeren Stimmkatalog und feineres Editing hinzu, was es zum natürlichen Upgrade macht, wenn du in Canva bleiben willst. ElevenLabs ist der Qualitätsmaßstab, mit den lebendigsten, ausdrucksstärksten verfügbaren KI-Stimmen und Tausenden Optionen über Dutzende Sprachen, allerdings arbeitest du außerhalb von Canva und fügst das Audio danach ein. Nutze Canvas eingebaute Stimme für Geschwindigkeit und steige auf eines dieser Tools um, wenn die Ausgabequalität wirklich zählt.

Canva AI 2.0 und Spracheingabe

Es lohnt sich, zwei Dinge zu trennen, die sich das Wort „Voice“ teilen. Der AI Voice Generator erzeugt gesprochene Ausgabe für deine Designs. Canva AI 2.0, das am 16. April 2026 als Forschungsvorschau startete, fügte Spracheingabe hinzu, du kannst also jetzt mit Canvas Assistenten sprechen, um zu beschreiben, was gebaut werden soll, statt zu tippen.

Diese Konversationsebene wurde außerdem auf 16 neue Sprachen erweitert, du kannst den Assistenten also in deiner Muttersprache briefen. Das ändert nichts daran, wie der AI Voice Generator funktioniert, zeigt aber, wohin sich Canva entwickelt, hin zu einer Plattform, mit der du zunehmend sprichst, statt dich durchzuklicken. Sie reiht sich neben den Rest des Toolkits ein, wie den Canva AI Image Generator, der aus einem Text-Prompt Bilder erzeugt.

Wo Fello AI ins Bild kommt

Canva vertont ein Skript, das du selbst schreibst, aber willst du gesprochenes Audio ganz ohne Skripten oder Aufnehmen, geht Fello AI einen anderen Weg. Sein Podcast-Skill verwandelt jedes PDF, jeden Weblink oder deine eigenen Notizen in ein natürliches Zwei-Personen-Podcast-Gespräch, sodass ein dichter Bericht zu einer pendlerfreundlichen Episode wird. Du steuerst Länge, Stil und Sprache, und es läuft auf iPhone, iPad und Mac für pauschal $9.99/Monat, mit ChatGPT, Claude, Gemini und Grok alle in derselben App.

Die beiden Tools decken unterschiedliche Audio-Aufgaben ab. Nutze Canvas AI Voice für kurze Erzählungen, die fest in ein Video oder eine Folie eingebettet sind, und greif zu Fello AIs Podcast-Skill, wenn du eine vollständige gesprochene Episode direkt aus deinem Ausgangsmaterial willst. Du kannst dir Fello AI im App Store holen und in Minuten deinen ersten Podcast erzeugen.

Fazit

Der Canva AI Voice Generator ist der schnellste Weg, einem Video oder einer Präsentation eine saubere KI-Sprachausgabe hinzuzufügen, ohne dein Design zu verlassen, und der Einstieg kostet nichts. Bleib für kurze Clips bei der Gratis-Stufe, upgrade auf Canva Pro, sobald das 1.000-Zeichen-Limit dich ausbremst, und greif zu Murf oder ElevenLabs nur, wenn du Emotion auf Broadcast-Niveau brauchst. Öffne ein Design, finde AI Voice unter dem Tab Audio, und du hast in unter einer Minute Erzählung auf der Timeline.

Häufig gestellte Fragen

Ist der Canva AI Voice Generator kostenlos?

Ja. Das AI-Voice-Tool ist auf jedem Canva-Plan kostenlos nutzbar, auch auf Canva Free. Die Gratis-Stufe lässt dich bis zu 1.000 Zeichen Sprache pro Clip erzeugen, etwa 150 bis 200 Wörter. Canva Pro für $18/Monat hebt dieses Limit an und schaltet die komplette Premium-Stimmbibliothek frei.

Wie füge ich in Canva eine KI-Sprachausgabe hinzu?

Öffne dein Design, klicke auf den Tab Elements, scrolle zu Audio und wähle AI Voice (oder suche im Apps-Panel nach AI Voice). Tippe dein Skript, wähle eine Stimme und Sprache und klicke dann auf Generate AI voice. Das Audio landet auf deiner Timeline, wo du es ziehen, zuschneiden und an deine Bilder anpassen kannst.

Wie hoch ist das Zeichenlimit für Canva AI Voice?

Der Gratis-Plan begrenzt jede Generierung auf 1.000 Zeichen, etwa 150 bis 200 Wörter oder ungefähr eine Minute Sprache. Für längere Erzählungen kannst du das Skript in mehrere Clips aufteilen oder auf Canva Pro upgraden, das die Obergrenze pro Clip anhebt.

Wie viele Sprachen unterstützt Canva AI Voice?

Canvas AI Voice Generator bietet eine Bibliothek von Stimmen in mehr als 20 Sprachen, darunter Englisch mit US-, UK- und australischem Akzent, dazu Spanisch, Französisch, Deutsch, Portugiesisch, Chinesisch und Japanisch. Canvas separates Voice-Cloning-Tool geht weiter und unterstützt über 130 Sprachen.

Kann ich in Canva meine eigene Stimme klonen?

Ja, aber über eine separate Funktion namens AI Voice Cloning, nicht den Standard-AI-Voice-Generator. Cloning kopiert eine echte Stimme aus einer kurzen Audioprobe und liest dein Skript in dieser Stimme in über 130 Sprachen vor. Das alltägliche AI-Voice-Tool nutzt stattdessen vorgefertigte synthetische Stimmen.