Text-zu-Video Prompt Beispiele: Das Skelett-System
Zusammenfassung
Starke Text-zu-Video Prompts folgen einem Skelett: Kamerabewegung, Szene, einzelne Aktion, Licht und Stimmung. Halte jeden Clip auf 5–10 Sekunden, schreibe, was du sehen möchtest statt was zu vermeiden ist, und ändere pro Durchlauf ein Element. Dieser Leitfaden liefert sofort einsetzbare Prompts für Social Hooks, Produktaufnahmen, B-Roll und sprechende Szenen.
Text-zu-Video Prompt Beispiele folgen einem einfachen Skelett: Kamerabewegung, Schauplatz, eine Aktion, Details. Die meisten Prompts scheitern, weil sie wie ein Mood Board klingen ohne Physik. Ein Videogenerator braucht konkrete Bewegung: Wer macht was, wo, und wie bewegt sich die Kamera dazu.
Runway und Kling haben das gleiche Schema unabhängig entwickelt. Runway nennt es: Kamerabewegung, Schauplatz, eine Aktion pro Clip, Details. Kling sagt: Subject, Aktion, Setting, Kamerasprache, Licht und Stimmung. Beide landen bei einem 4-Element-Gerüst, das über alle Modelle funktioniert. Wir zeigen Beispiele für Social Hooks, Produktaufnahmen, B-Roll und sprechende Avatare.
Warum werden Text-zu-Video Prompts zu visueller Matsche?
Weil sie wie ein Atmosphären-Brief klingen. „Episch, filmisch, 8K, ultra-detailliert" – der Videogenerator kann damit keine Bewegung berechnen. Ein Modell braucht Physik: konkrete Aktionen und Kameraführung.
Runways Prompt-Anleitung fasst es prägnant zusammen: Kamerabewegung, Schauplatz, Aktion, Details – eine Aktion pro Clip. Klings Leitfaden landet auf den gleichen Komponenten: Subject, Aktion, Setting, Kamerasprache, Licht und Stimmung.
Zwei Gewohnheiten zerstören Clips. Erstens: Fünf Aktionen in einen Prompt quetschen. Zweitens: Das Wort „dann" verwenden, als hätte das Modell eine Timeline. Es hat nicht. Jede Generierung ist ein einziger Beat.

Welcher Prompt-Skelett funktioniert über alle Modelle?
Verwende diese Reihenfolge und höre auf zu schreiben, wenn der Shot klar ist:
[Kamerabewegung und Bildausschnitt]. [Schauplatz und Umgebung]. [Subject führt eine Aktion durch]. [Licht, Objektiv, Stimmung].
Hier ist die gleiche Idee dreimal hintereinander, von schwach bis einsatzbereit.
Schwach: „Ein schöner filmischer Shot einer Frau in einem Café."
Besser: „Eine junge Frau hebt eine Latte an ihre Lippen in einem sonnigen Café."
Einsatzbereit: „Langsame Push-in von Halbtotale zu Großaufnahme. Sonniges Eckchen eines Cafés, Dampf steigt von einer Keramiktasse auf. Eine junge Frau in einem cremefarbenen Wollpullover hebt den Becher und lächelt leicht. Flache Schärfentiefe, zartes goldenes Morgenlicht, gedämpfte Warmtöne."
Die dritte Version nennt die Kamera, die Aktion und das Licht. Nichts darin fordert das Modell auf zu raten. Produktionsskala beginnt hier: Ein Prompt, den du wiederverwenden kannst, ist ein Prompt mit Platzhaltern.
Welche Prompts funktionieren für Social Hooks und Werbe-Clips?
Kurz, prägnant, eine Idee. Vertikales Format gehört in den Prompt, nicht in deine Hoffnungen. Diese sind für 9:16 und 5 bis 8 Sekunden geschrieben.
Schnelle Schwenkbewegung über einen chaotischen Schreibtisch um Mitternacht. Laptop-Bildschirm leuchtet, Papiere verstreut, kalter Kaffee. Eine Hand schlägt den Laptop zu, dann hält der Frame still. Handheld, hartes Overhead-Licht, 9:16 vertikal.
Starres Makro-Setup. Ein einzelner Tropfen Tinte fällt ins klare Wasser und bricht in eine Spirale auf. Zeitlupe, schwarzer Hintergrund, Studio-Beleuchtung, scharfer Fokus auf die Blüte.
Flachwinkel-Tracking neben den Schuhen eines Läufers auf nasser Straße in der Dämmerung. Nebel in Fußhöhe, Straßenlaternen verblassen. Sanfte stabilisierte Bewegung, kühles blaues Licht.
Zwei weitere für Creator, die regelmäßig veröffentlichen, beide für anonyme Kanäle:
Langsame Dolly-Fahrt durch einen dunklen Büchereigang. Staub schwebt in einem einzelnen Lichtstrahl von einem hohen Fenster. Ein Lederbuch rutscht aus dem Regal und landet offen auf einem Lesetisch. Warme Tungsten-Töne, 16:9.
Sanfte Kran-Fahrt von oben nach oben: vom Laptop auf dem Schreibtisch bis zur Skyline einer Stadt zur blauen Stunde durch ein breites Fenster. Eine Tasse steht neben der Tastatur, der Bildschirm spiegelt weiches Licht. Ruhig, stetig, dokumentarischer Ton.
Das Muster: Ein Verb, das das Modell rendern kann, eine Textur, die es halten kann (nasse Straße, Tinte, Glas), und eine Kameraführung, die dem Subject nicht entgegenarbeitet. Vergiss den On-Screen-Text. Text in generiertem Video driftet immer noch ab und wird unleserlich in den meisten Modellen – füge Untertitel später im Editor hinzu.
Wie schreibt man Prompts für Produktaufnahmen und B-Roll?
Produktarbeit belohnt Zurückhaltung. Das Modell bewahrt Form und Licht besser, wenn wenig anderes sich bewegt.
Langsame Push-in auf eine Keramik-Kaffeetasse, Dampf steigt auf, stilles Küchenlicht am Morgen, flache Schärfentiefe, zartes Fensterlicht von links.
Overhead-Shot, ein Paar Hände packt einen matten schwarzen Speaker auf einem blassen Eichenholztisch aus. Der Deckel hebt sich, Seidenpapier legt sich. Neutrale Töne, diffuses Licht, kein Kamerabeben.
Orbit-Shot um eine Parfümflasche auf einem Samt-Sockel. Licht glitzert entlang der Glaskante. Langsam, gleichmäßige Rotation, dunkler Hintergrund, subtile Spiegelung auf der Oberfläche.

Für B-Roll denke in Establishing, Detail und Cutaway. Ein Prompt pro Typ:
Establishing: „Breiter Drohnen-Shot über eine Küstenstadt in der goldenen Stunde, Boote im Hafen."
Detail: „Extreme Nahaufnahme von Fingern, die auf einer beleuchteten Tastatur tippen, flacher Fokus."
Cutaway: „Mitteltotale eines Radfahrers, der einen leeren Platz überquert, Kamera statisch, lange Schatten."
Erzeuge jeweils drei und du hast eine Sequenz, keinen Zufallsclip. Das ist auch, wie du eine Bibliothek aufbaust: Markiere die gelungenen Clips nach Shot-Typ und verwende das Skelett erneut.
Wie schreibt man Trainings- und Erklärvideo-Clips?
L&D und Erklärvideo-Arbeit ist hauptsächlich Illustration: Ein Prozess, ein Ort, ein Vorher und Nachher. Der Prompt-Job ist es, eine Idee pro Clip zu zeigen, damit die Sprache den Rest tragen kann.
Statische Mitteltotale eines Lagerarbeiters, der ein Paket mit einem tragbaren Scanner scannt und dann auf ein Regal stellt. Helles, gleichmäßiges Industrielicht, sauberer Boden, keine weitere Bewegung im Bild.
Top-Down Shot von Händen, die Haftnotizen in drei Spalten auf einem Whiteboard anordnen. Notizen sind leer, Farben Gelb, Blau und Rosa. Stetige Kamera, weiches Tageslicht, flache Schatten.
Langsame Schwenkbewegung über ein ordentliches Open-Plan-Büro um 9 Uhr morgens, Schreibtische halb besetzt, Monitore zeigen generische Dashboards. Natürliches Licht, neutrale Palette, ruhiges Tempo.
Beachte, was fehlt: Logos, lesbare Bildschirme, Beschilderung, Namen. Alles, das der Zuschauer lesen muss, sollte später hinzugefügt werden, wo du die Schreibweise kontrollierst. Für eine 40-modulige Serie ist das die kostengünstigste Gewohnheit. Schreibe jeden Prompt als wiederverwendbare Szenen-Karte, markiere mit dem Modul, das er bedient, und du wirst einen generischen „Büro"-Shot nie zweimal erzeugen.
Was ändert sich, wenn man Prompts für sprechende Personen schreibt?
Text-zu-Video Prompt Beispiele, die Dialog enthalten, sind der Punkt, an dem die Ergebnisse nach Modell divergieren. Einige aktuelle Modelle erzeugen synchronisiertes Audio und Lippenbewegungen; andere geben dir einen stummen Clip und ein Gesicht, das nach wenigen Sekunden abweicht.
Wenn dein Modell Sprache unterstützt, sei buchstäblich und knapp:
Halbtotale, statische Kamera. Eine Frau an einem Küchentisch wendet sich zur Linse und sagt: „Drei Prompts, zehn Minuten, ein fertiger Clip." Natürliches Fensterlicht, flacher Fokus. Keine Untertitel.
Fälle, in denen es hält: ein Sprecher, ein Satz, ein Ort, unter 10 Sekunden. Fälle, in denen es bricht: lange Monologe, zwei Sprecher, die Sätze wechseln, Namen und Markennamen, alles wo das gleiche Gesicht über fünf separate Generierungen bestehen muss.
Das letzte Szenario ist wichtiger als es klingt. Konsistenz über Clips hinweg ist die echte Steuer der nur-Text-Video. Wenn deine Serie einen gleichbleibenden Moderator für 40 Module braucht, ist ein Prompt das falsche Werkzeug. Erzeuge die Szenen und B-Roll mit Text-zu-Video, dann lass eine Avatar-Pipeline die Sprache tragen. Skript rein, Avatar raus, Szenen drum herum schneiden.
Welche Prompt-Fehler solltest du komplett vermeiden?
Meinung folgt. Das sind die Gewohnheiten, die es wert sind, heute fallen gelassen zu werden.
Negative Prompts. Runways Anleitung sagt: positiv formulieren; „kein Kamerabeben" neigt dazu, das Beben ins Bild zu bringen. Schreibe stattdessen „sanfte, stabile Kamerabewegung."
Qualitäts-Mantras. „Meisterwerk, 8K, preisgekrönt" addiert Token, keine Kontrolle.
Abstrakte Gefühle. „Ein Gefühl der Einsamkeit" gibt dem Modell ein Rätsel. „Ein Mann sitzt allein auf einer Bank, Regen auf seinem Mantel, Kamera zieht langsam zurück" gibt ihm einen Shot.
Zwei Kamerabewegungen gleichzeitig. Wähle eine primäre Bewegung. Dolly rein oder Pan links, nicht alle drei zusammen.
Wo es hält: kurze Clips, einfache Bewegung, konkrete Nomen. Wo es sich verknotet: Menschenmengen, Hände bei feinen Aufgaben, lesbarer Text, physik-schwere Wasser- und Stofffaktoren im gleichen Frame.
Wie passt man einen Prompt über Modelle an?
Das Skelett reist. Das Vokabular reist nicht perfekt. Drei Anpassungen lohnen sich vor deinem Geld.
Kling: betone Kamerasprache, Multi-Shot-Skriptung und Subject-Referenzen. Vorsicht vor zu langen Prompts, die die Aktion ersticken.
Veo: betone Szenen-Details und Audio- oder Dialog-Hinweise. Vorsicht vor langer Sprache und Markennamen.
Runway: betone einfache Bewegungs-Prompts und Iteration von einem Basis-Bild. Vorsicht vor Wiederholung der Basis-Bild-Inhalte in Details.
Runways Anleitung ist hier spezifisch: Wenn du mit einem Bild startest, beschreibe die Bewegung, nicht das Bild. Das Bild wiederholen kann die Bewegung reduzieren. Klings Leitfaden hingegen drängt dich, in Shots zu denken statt in Clips – die gleiche Intuition wie die Ein-Aktion-Regel oben.
Wo führt man diese Prompts aus und wie iteriert man?
Wähle das Modell für den Job, nicht das Logo. Kling und Veo handhaben Kamerasprache und – je nach Version – natives Audio. Runway ist stark bei Iteration und Editing-Tools. Higgsfield bündelt mehrere Video-Modelle in einem Workspace, was hilft, wenn du einen Prompt gegen mehr als ein Modell testen willst ohne fünf Logins.
Führe den gleichen Skelett-Prompt auf zwei Modellen aus. Ändere nur ein Element: die Kamerabewegung, das Licht oder das Verb. Halte fest, was jede Änderung bewirkt. Nach zehn Läufen hast du einen House Style, und dieser House Style ist mehr wert als jede Liste von Beispielen, auch diese hier.

Was würdest du diese Woche konkret mit diesen Prompts machen?
Nimm ein Skript, das du bereits hast. Zerlege es in sechs Beats. Schreibe einen Prompt pro Beat mit dem Skelett: Kamera, Schauplatz, eine Aktion, Details. Erzeuge drei Takes davon, behalte das Beste und schneide es mit deinem Voiceover. Falls das Piece ein sprechendes Gesicht braucht, hole einen Avatar für diese Beats rein statt das Modell nach Konsistenz zu quälen.
Du hast eine erste Version in einem Nachmittag. Die Prompts, die überstehen, gehen in ein freigegebenes Dokument mit ihrem Shot-Typ. Das nächste Video startet aus diesem Dokument, nicht aus einer leeren Schachtel.