Prompt da testo a video: gli 8 esempi che funzionano
Riassunto
I prompt da testo a video efficaci seguono uno schema semplice: movimento di camera, inquadratura, un'azione sola, luce e atmosfera. Questa guida mostra esempi pronti per hook social, prodotti, B-roll e clip didattiche. Impara quale errori evitare e come iterare tra modelli.
Gli esempi di prompt da testo a video qui riportati sono pensati per essere copiati e adattati al tuo specifico bisogno di ripresa. Ognuno segue lo stesso schema: movimento di camera, inquadratura, un'unica azione, pochi dettagli. Mantienilo su una sola azione che stia in 5-10 secondi, descrivi quello che vuoi vedere invece di quello da evitare, e cambia un elemento soltanto per ogni nuovo tentativo. Gli esempi coprono hook per social, riprese di prodotto, B-roll, intro in talking head e clip didattiche.
Perché i prompt da testo a video tornano spesso come una pappa informe?
Perché sembrano mood board. "Capolavoro cinematografico epico, 8K, ultra dettagliato" non dice al modello nulla che possa muoversi. Un modello di generazione video ha bisogno di fisica: chi sta facendo cosa, dove, con quale comportamento di camera.
La guida al prompting di Runway lo sintetizza in quattro elementi ordinati: movimento di camera, inquadratura, azione, dettagli, con un'azione sola per clip. La guida di Kling arriva agli stessi ingredienti: soggetto, azione, ambientazione, linguaggio di camera, illuminazione e atmosfera.
Due abitudini distruggono i clip. Accumulare cinque azioni in un unico prompt, e scrivere "poi" come se il modello avesse una timeline. Non ce l'ha. Ogni generazione è un singolo beat.

Qual è lo schema di prompt che funziona su tutti i modelli?
Usa questo ordine e smetti di aggiungere parole quando l'inquadratura è chiara:
[Inquadratura e movimento di camera]. [Ambientazione e scenario]. [Soggetto che compie un'azione sola]. [Luce, obiettivo, atmosfera].
Ecco lo stesso concetto tre volte, dal debole all'utilizzabile.
Debole: "Un bel video cinematografico di una donna in un caffè."
Migliore: "Una giovane donna solleva un latte alle labbra in un caffè al sole."
Pronto per il set: "Zoom lento da piano medio a primissimo piano. Caffè d'angolo al sole, vapore che sale da una tazza di ceramica. Una giovane donna in maglione di lana color crema solleva la tazza e sorride leggermente. Profondità di campo ridotta, luce solare dorata e morbida di mattina, toni caldi e attutiti."
La terza versione nomina la camera, l'azione e la luce. Niente in essa chiede al modello di indovinare un sentimento. La scala di produzione inizia qui: un prompt che puoi riutilizzare è un prompt con slot liberi.
Quali prompt funzionano per hook social e clip nello stile di annunci?
Cortissimi, ad alto impatto, un'idea sola. Il formato verticale va nel prompt, non nella speranza. Questi sono scritti per 9:16 e 5-8 secondi.
Pan veloce verso una scrivania disordinata a mezzanotte. Lo schermo di un laptop brilla, carte sparse, un caffè freddo. Una mano sbatte il laptop, la camera rimane ferma. Handheld, luce sopra gli occhi dura e fredda, 9:16 verticale.
Ripresa macro statica. Una singola goccia d'inchiostro cade in acqua limpida e sboccia in una spirale. Slow motion, sfondo nero, illuminazione da studio, fuoco acuto sulla spirale.
Ripresa di tracking a basso angolo accanto alle scarpe di un corridore che colpiscono l'asfalto bagnato all'alba. Nebbia all'altezza delle caviglie, lampioni che si spengono. Movimento fluido e stabilizzato, luce blu fredda.
Altri due per creatori che pubblicano su programma, entrambi per canali senza volto:
Dolly lento in avanti attraverso una corsia di biblioteca buia. Polvere che galleggia in un singolo raggio di luce da una finestra alta. Un libro di pelle scivola da uno scaffale e atterra aperto su un tavolo di lettura. Toni tungsteno caldi, 16:9.
Crane morbido verso l'alto da un laptop su una scrivania per rivelare l'orizzonte della città all'ora blu attraverso una finestra ampia. Una tazza accanto alla tastiera, lo schermo riflette una luce morbida. Calmo, stabile, sensazione documentaristica.
Lo schema: un verbo che il modello può rendere, una texture che può sostenere (asfalto bagnato, inchiostro, vetro), e un comportamento di camera che non contrasta con il soggetto. Salta il testo sullo schermo. Il testo all'interno dei video generati ancora sbavatura e distorsione sulla maggior parte dei modelli, quindi aggiungi i sottotitoli in post-produzione.
Come strutturi i prompt per riprese di prodotto e B-roll?
Il lavoro su prodotto premia la disciplina. Il modello mantiene forma e luce bene quando poco altro si muove.
Zoom lento su una tazza di ceramica mentre sale vapore, mattina di cucina tranquilla, profondità di campo ridotta, luce morbida da finestra a sinistra.
Ripresa dall'alto, un paio di mani estrae un speaker nero opaco da una scatola su tavolo di quercia chiaro. Il coperchio si solleva, la carta velina si assesta. Toni neutri, luce diffusa, nessuna vibrazione di camera.
Ripresa orbitale attorno a una bottiglia di profumo su un piedistallo di velluto. La luce scintilla lungo il bordo del vetro. Rotazione lenta e uniforme, sfondo scuro, riflesso sottile sulla superficie.

Per il B-roll, pensa in totali, dettagli e inserti. Un prompt per tipo:
Totale: "Drone che sale su una città costiera all'ora dorata, barche in porto."
Dettaglio: "Primo piano estremo di dita che digitano su una tastiera retroilluminata, fuoco superficiale."
Inserto: "Piano medio di un ciclista che attraversa una piazza vuota, camera statica, ombre lunghe."
Genera tre di ognuno e hai una sequenza, non un clip fortunato. È anche come costruisci una libreria: etichetta i vincenti per tipo di inquadratura e riusa lo schema.
Come strutturi prompt per clip didattiche e esplicative?
Il lavoro L&D ed esplicativo è soprattutto illustrazione: un processo, un luogo, un prima e dopo. Il compito del prompt è mostrare un'idea sola per clip in modo che la voce fuori campo faccia il resto.
Ripresa media statica di un operaio di magazzino che scansiona una scatola con uno scanner portatile, poi la posiziona su uno scaffale. Illuminazione industriale luminosa e uniforme, pavimento pulito, nessun altro movimento in campo.
Ripresa da sopra di mani che dispongono post-it in tre colonne su una lavagna. I post-it sono vuoti, colori giallo, blu e rosa. Camera ferma, luce naturale soft, ombre leggere.
Pan lento attraverso un open space ordinato alle 9 di mattina, scrivanie mezzo occupate, monitor che mostrano dashboard generiche. Luce naturale, palette neutrale, ritmo calmo.
Nota cosa manca: loghi, schermi leggibili, insegne, nomi. Qualsiasi cosa il lettore debba leggere dovrebbe essere aggiunta in post, dove controlli l'ortografia. Per una serie di 40 moduli, questa è l'abitudine più economica da adottare. Scrivi ogni prompt come una scheda di scena riutilizzabile, etichettala con il modulo che serve, e non rigenerai mai due volte lo stesso shot generico di "ufficio".
Cosa cambia quando scrivi prompt che includono persone che parlano?
Gli esempi di prompt da testo a video che includono dialogo sono dove i risultati si dividono per modello. Alcuni modelli attuali generano audio sincronizzato e movimento delle labbra; altri ti danno un clip silenzioso e una faccia che si allontana dopo pochi secondi.
Se il tuo modello supporta il parlato, sii letterale e conciso:
Primo piano medio, camera statica. Una donna a un tavolo di cucina si gira verso l'obiettivo e dice: "Tre prompt, dieci minuti, un clip finito." Luce naturale da finestra, fuoco superficiale. Nessun sottotitolo.
Casi dove regge: un oratore, una riga, una location, sotto 10 secondi. Casi dove si rompe: monologhi lunghi, due oratori che si scambiano battute, nomi e parole di brand, qualsiasi cosa dove la stessa faccia deve sopravvivere a cinque generazioni separate.
Quell'ultimo conta più di quanto sembri. La coerenza tra clip è la vera tassa della generazione video da testo soltanto. Se la tua serie ha bisogno dello stesso presentatore per 40 moduli, un prompt è lo strumento sbagliato per la faccia. Genera le scene e il B-roll con testo a video, poi lascia che una pipeline avatar gestisca il parlato. Script in, avatar fuori, scene tagliate intorno.
Quali errori di prompt dovrebbero sparire dal tuo flusso?
Parere non richiesto. Queste sono le abitudini che vale la pena abbandonare oggi.
Prompt negativi. La guida di Runway è usare frasi positive; "nessuna vibrazione di camera" tende a mettere vibrazione nel fotogramma. Scrivi "movimento di camera liscio e stabile."
Incantesimi di qualità. "Capolavoro, 8K, premiato" aggiunge token, non controllo.
Sentimenti astratti. "Un senso di solitudine" dà al modello un indovinello. "Un uomo seduto solo su una panchina, pioggia sul cappotto, la camera lentamente si allontana" gli dà un'inquadratura.
Due movimenti di camera insieme. Scegli un movimento primario. Zoom in o pan a sinistra, non pan, tilt e orbita insieme.
Dove regge: clip cortissimi, movimento semplice, sostantivi concreti. Dove si aggroviglia: folle, mani che fanno compiti fini, testo leggibile, fisica pesante come acqua e tessuti nello stesso fotogramma.
Come adatti un prompt tra diversi modelli?
Lo schema viaggio. Il vocabolario non viaggia perfettamente. Tre adattamenti vale la pena conoscere prima di bruciare crediti.
Kling: insisti sul linguaggio di camera, scripting multi-shot e riferimenti a soggetti. Fai attenzione ai prompt troppo lunghi che seppelliscono l'azione.
Veo: insisti su dettagli di scena e indizi audio o dialogo. Fai attenzione a parlato lungo e marchi.
Runway: insisti su prompt di movimento semplice e iterazione da un'immagine di base. Fai attenzione a ridescrivere quello che l'immagine di input già mostra.
La guida di Runway è specifica qui: quando inizi da un'immagine, descrivi il movimento, non l'immagine. Ripetere i contenuti dell'immagine nei dettagli può ridurre il movimento. La guida di Kling, da parte sua, ti spinge a pensare in inquadrature piuttosto che clip, che è lo stesso istinto della regola un'azione-sola di sopra.
Dove esegui questi prompt e come itteri?
Scegli il modello per il lavoro, non per il logo. Kling e Veo gestiscono il linguaggio di camera e, a seconda della versione, audio nativo. Runway è forte su iterazione e strumenti di editing. Higgsfield raggruppa diversi modelli video in uno spazio di lavoro, che aiuta quando vuoi testare un prompt dello stesso schema su più di un motore senza cinque login.
Esegui lo stesso prompt-schema su due modelli. Cambia un elemento solo: il movimento di camera, la luce, o il verbo. Mantieni un registro di cosa ha fatto ogni cambio. Dopo dieci run hai uno stile house, e quello stile house vale più di qualsiasi lista di esempi, inclusa questa.

Cosa faresti effettivamente questa settimana con questi prompt?
Prendi uno script che hai già. Spezzalo in sei beat. Scrivi un prompt per beat usando lo schema: camera, inquadratura, un'azione, dettagli. Genera tre versioni ognuno, tieni il migliore, e tagliale sulla tua voce fuori campo. Se il pezzo ha bisogno di una faccia che parla, porta dentro un avatar per quei beat invece di lottare con il modello per coerenza.
Avrai una prima versione grezza in un pomeriggio. I prompt che sopravvivono vanno in un documento condiviso con il loro tipo di inquadratura. Il prossimo video inizia da quel documento, non da una scatola bianca.