Veo 3 Prompt auf Deutsch: Audio gezielt steuern

So formulierst du Veo-3-Prompts auf Deutsch und Englisch für klare Dialoge, passende Umgebungsgeräusche und besser synchronisierte Soundeffekte.

Published

Updated

Topic: Prompting & Prompt Engineering

Creatorin formuliert einen deutschsprachigen Prompt für einen vertonten KI-Videoclip an einem hellen Schreibtisch

Ein Veo 3 Prompt auf Deutsch kann ein guter Ausgangspunkt für vertonte Kurzclips sein – aber „Deutsch funktioniert“ ist keine pauschale Aussage für jede Nutzung. Google beschreibt in einer deutschsprachigen Anleitung die Erstellung von Videos mit Sound, Dialog und Musik in Gemini. In der aktuellen Cloud-Dokumentation für Veo 3.1 ist dagegen Englisch als unterstützte Prompt-Sprache ausgewiesen. Für deutschsprachige Creator bedeutet das: erst auf Deutsch konzipieren, dann je nach Oberfläche und Modell mit einem kleinen bilingualen Test prüfen, welche Fassung Audio und Handlung zuverlässiger umsetzt.

Dieser Unterschied ist besonders bei Dialogen wichtig. Ein Modell muss nicht nur Wörter erzeugen, sondern zugleich Sprecher, Reihenfolge, Tonfall, Geräuschkulisse und Bildhandlung zusammenbringen. Je genauer du diese Ebenen trennst, desto leichter lässt sich ein misslungener Clip diagnostizieren. Die folgenden Muster sind deshalb keine Garantie für ein bestimmtes Ergebnis, sondern ein reproduzierbarer Arbeitsablauf für kurze Social-Videos, Werbeszenen und Storytelling-Clips.

Was bei Deutsch und Englisch tatsächlich dokumentiert ist

Die deutschsprachige Google-Anleitung richtet sich an die Nutzung von Veo 3 in Gemini und zeigt, dass Nutzer Audioanweisungen, Dialog und Geräusche in einem deutsch formulierten Prompt beschreiben können. Sie empfiehlt außerdem, bei Audio-Problemen die sprechende Figur genauer zu benennen. Das ist für die Praxis hilfreich: Statt nur „zwei Menschen reden“ zu schreiben, solltest du festlegen, wer spricht, wo diese Person im Bild steht und welcher Satz zu ihr gehört. Mehr Kontext reduziert die Zahl möglicher Zuordnungen.

TryVeo platform data: measured render times by model

Measured on TryVeo's own production render logs over the last 90 days (446 completed renders with full timing, as of 2026-09-11). Wall-clock from job start to finished file, so provider queueing is included. These are our own measurements, not vendor claims.

ModelMedian render90th percentileRenders measured
veo-3.1-fast-generate-preview88s128s302
seedance-2.0-fast195s343s74
kling-2.5-turbo132s155s19
seedance-2.0309s405s19
veo-3.1-generate-preview101s166s32

Für Veo 3.1 in der Google-Cloud-Dokumentation ist hingegen Englisch als Prompt-Sprache angegeben. Dort werden außerdem Soundgenerierung, 4-, 6- oder 8-Sekunden-Clips sowie die Seitenverhältnisse 9:16 und 16:9 genannt. Diese Angaben beschreiben die dokumentierte API- beziehungsweise Plattformumgebung und sollten nicht automatisch auf jede andere Veo-Oberfläche übertragen werden. Wenn du über eine Drittplattform arbeitest, prüfe daher zuerst, welches Veo-Modell und welcher Eingabekanal tatsächlich verwendet werden.

Die Bausteine für einen zuverlässigen Audio-Prompt

Google strukturiert Veo-Prompts im Kern über Kamera, Motiv, Handlung, Kontext und Stil. Für Audio ergänzt du diese Bildbausteine um Sprecher, gesprochenen Text, Geräusche und Timing. Der Google-Leitfaden zum Prompting für Veo 3.1 beschreibt außerdem Muster für Dialog, Soundeffekte, Umgebungsgeräusche und zeitcodierte Szenen. Eine kompakte Reihenfolge verhindert, dass die wichtigste Audioinformation am Ende in einer langen Beschreibung untergeht:

Bei Dialogen ist die Zuordnung wichtiger als literarische Eleganz. Schreibe nicht nur „Eine Frau und ein Mann sprechen über den Kaffee“. Besser ist: „Die Frau links im Bild hebt die rote Tasse und sagt ruhig auf Deutsch: ‚Der Kaffee ist noch heiß.‘ Der Mann rechts antwortet überrascht: ‚Dann warten wir kurz.‘“ Wenn ein Satz einer bestimmten Person zugeordnet werden muss, nenne Position, sichtbare Handlung und Stimme gemeinsam. Bei sehr kurzen Clips solltest du außerdem nur so viel Text verwenden, wie in der verfügbaren Zeit plausibel gesprochen werden kann.

Umgebungsgeräusche funktionieren am besten als konkrete, hörbare Ereignisse statt als abstrakte Stimmung. „Angenehme Atmosphäre“ lässt zu viele Möglichkeiten offen. Formulierungen wie „leises Verkehrsrumpeln im Hintergrund, einzelne Fahrradklingel aus der Ferne, Schritte auf nassem Asphalt“ geben dem Modell eine akustische Szene. Soundeffekte solltest du an eine sichtbare Aktion koppeln: „Beim Aufsetzen der Tasse ein kurzes Keramikklirren“ oder „Wenn die Tür zufällt, ein gedämpftes Holzgeräusch“. Musik kann ebenfalls beschrieben werden, sollte aber nicht die Dialogverständlichkeit überdecken.

Deutsches Promptmuster für Gemini

„Realistischer vertikaler Kurzfilm in einem kleinen Café am Morgen, 9:16. Halbnahe Einstellung, langsame Kamerafahrt von links nach rechts. Eine Frau mit gelber Jacke sitzt links im Bild und stellt eine rote Keramiktasse auf den Tisch. Beim Aufsetzen erklingt ein kurzes, realistisches Klirren. Sie sagt ruhig auf Deutsch: ‚Der Kaffee ist noch heiß.‘ Der Mann rechts im Bild schaut zur Tasse und antwortet überrascht: ‚Dann warten wir kurz.‘ Leises Stimmengewirr, Kaffeemaschine und gedämpftes Straßenrauschen im Hintergrund. Die Stimmen bleiben klar verständlich, keine zusätzliche Musik, natürliche Morgenbeleuchtung, dokumentarischer Stil.“

Englische Variante für einen dokumentierten API-Test

“Realistic vertical short film in a small café in the morning, 9:16. Medium shot, slow camera move from left to right. A woman in a yellow jacket sits on the left side of the frame and places a red ceramic cup on the table. A short realistic ceramic clink happens as the cup touches the table. She says calmly in German: ‘Der Kaffee ist noch heiß.’ The man on the right looks at the cup and replies in a surprised tone: ‘Dann warten wir kurz.’ Quiet background chatter, a coffee machine and distant muted street noise. Keep both voices clearly intelligible, no additional music, natural morning light, documentary style.”

A/B-Test: Deutsch gegen Englisch ohne unnötige Variablen

Ein fairer Vergleich ändert immer nur eine Hauptvariable. Nutze deshalb dieselbe Szene, dieselbe Dauer, dasselbe Seitenverhältnis, dieselben Sprecherbeschreibungen und dieselben Audioanforderungen. Erstelle zuerst die deutsche Version und anschließend die englische Fassung, in der der gesprochene Dialog ausdrücklich deutsch bleibt. So testest du die Sprache der Anweisung, nicht versehentlich eine andere Szene oder einen anderen Tonfall.

  1. Wähle eine kurze Szene mit einer klaren sichtbaren Handlung und höchstens zwei Sprechern.
  2. Formuliere zuerst den deutschen Prompt mit Sprecherposition, wörtlicher Rede, Geräusch und zeitlicher Zuordnung.
  3. Erstelle für den dokumentierten Veo-3.1-API-Test eine englische Fassung, lasse den gesprochenen Dialog aber ausdrücklich auf Deutsch.
  4. Prüfe Bild, Sprecherzuordnung, Dialogverständlichkeit und die Synchronität zwischen Aktion und Geräusch.
  5. Ändere danach nur eine Variable und dokumentiere, welche Promptversion das Ergebnis verbessert hat.

Für wiederholbare Social-Produktionen lohnt sich ein kleines Testprotokoll: Promptversion, verwendete Oberfläche, Modellbezeichnung, Format, Dauer und die drei Prüfkriterien. Notiere außerdem, ob das Problem im Bild, bei der Sprecherzuordnung, bei der Aussprache oder bei den Hintergrundgeräuschen lag. Dadurch wird aus einem subjektiven „Der Clip klingt komisch“ eine konkrete nächste Promptänderung.

Audiofehler systematisch diagnostizieren

Audio und Video müssen zeitlich zusammenpassen. Die Studie MOVA auf arXiv ordnet den technischen Hintergrund ein: Kaskadierte Video-und-Audio-Pipelines können Kosten erhöhen, Fehler aufsummieren und die Gesamtqualität verschlechtern. Für die Promptpraxis folgt daraus kein bestimmtes Erfolgsversprechen, aber ein klarer redaktioneller Fokus: Dialog, Geräusch und sichtbare Aktion sollten als zusammenhängende Ereignisse formuliert und anschließend gemeinsam kontrolliert werden.

Schnelle Fehlerdiagnose für vertonte Veo-Clips

Arbeitsreferenz für die nächste Promptiteration; die Maßnahmen sind praktische Empfehlungen, keine dokumentierten Modellgarantien.

BeobachtungWahrscheinlicher PromptkonfliktNächste Änderung
Falsche Figur sprichtSprecher und Satz sind nicht eindeutig verknüpftPosition, sichtbare Handlung und wörtliche Rede in einem Satz verbinden
Dialog klingt unklarZu viel Text oder konkurrierende GeräuscheDialog kürzen und Hintergrundton ausdrücklich leiser beziehungsweise zurückhaltend beschreiben
Geräusch passt nicht zur AktionSFX ist nicht an einen sichtbaren Moment gebunden„Beim Öffnen der Tür …“ statt nur „Türgeräusch“ schreiben
Musik überdeckt StimmenMusik ist zu dominant oder nicht priorisiertMusik weglassen oder als sehr dezent hinter dem Dialog angeben
Bild und Ton wirken zeitversetztZu viele Ereignisse in kurzer DauerNur eine oder zwei Audioaktionen behalten und deren Reihenfolge nennen

Sources: Google Cloud · arXiv

Wenn die Aussprache eines deutschen Satzes nicht passt, prüfe zuerst die Textmenge und die Schreibweise. Kurze, natürliche Sätze sind leichter zu kontrollieren als verschachtelte Werbeformulierungen. Bei Eigennamen oder ungewohnten Begriffen kann eine phonetische Hilfsbeschreibung einen Test wert sein; sie verändert jedoch ebenfalls den Prompt und sollte deshalb als eigene Version dokumentiert werden. Vermeide außerdem mehrere Sprecherwechsel, wenn der Clip sehr kurz ist.

Vom Testclip zum Social-Workflow

Beginne mit einem einzelnen achtsekündigen oder in deiner Umgebung verfügbaren Kurzclip und prüfe zuerst die Audioidee, nicht die komplette Kampagne. Für Reels, Shorts oder TikTok ist ein vertikales Ergebnis naheliegend; für einen Werbespot auf einer Website kann ein horizontales Format sinnvoller sein. Dokumentierte Veo-3.1-Angaben nennen 9:16 und 16:9 als unterstützte Seitenverhältnisse, doch der konkrete Zugang entscheidet darüber, welche Auswahl du tatsächlich siehst.

Wenn du aus einem Produktfoto startest, kann ein Bild-zu-Video-Workflow die visuelle Ausgangslage stabilisieren, während du den Audio-Prompt separat testest. Der passende Leitfaden zu KI-Produktvideos aus Produktfotos hilft bei der Einordnung dieses Produktionsschritts. Für die Audioplanung selbst kannst du außerdem die Prompt Academy als internes Arbeitsziel nutzen; die eigentliche Veo-Sprache solltest du weiterhin an der dokumentierten Modellumgebung ausrichten.

Der wichtigste Merksatz lautet: Beschreibe nicht „Audio“ als dekorative Zusatzoption, sondern als Abfolge hörbarer Ereignisse. Wer spricht? Was wird gesagt? Was geschieht gleichzeitig im Bild? Welches Geräusch gehört genau zu diesem Moment? Und welche Klänge sollen ausdrücklich im Hintergrund bleiben? Formulierst du diese Fragen in Deutsch und hältst für dokumentierte API-Tests eine englische Variante bereit, kannst du Veo-3-Prompts nachvollziehbarer vergleichen und Fehler gezielter beheben.

Sources

  1. Effektive Prompts für Veo 3, Google — Ab sofort können Google AI Pro-Abonnent*innen in Deutschland mit Veo 3 in Gemini kreative Videos mit Sound kreieren.
  2. Veo 3.1 | Gemini Enterprise Agent Platform, Google Cloud Documentation — Sound generation | Supported; Video lengths: 4, 6, or 8 seconds; Supported aspect ratios: 9:16, 16:9; Prompt languages | English
  3. The ultimate prompting guide for Veo 3.1, Google Cloud — Veo 3.1 can generate a complete soundtrack based on your text instructions.
  4. MOVA: Towards Scalable and Synchronized Video-Audio Generation, arXiv — Current approaches to producing audio-visual content often rely on cascaded pipelines, which increase cost, accumulate errors, and degrade overall quality.