テキストから動画 プロンプト 例:本番対応の骨組みとSNS用クリップ集

要約

テキストから動画が成功するプロンプトは同じ骨組みに従う:カメラ動き、シーン、単一の動作、細部。5~10秒ごとに1つの動作、やることを書いて避けることは言わない。以下は、SNS用フック、商品撮影、B-ロール、トークヘッド、研修動画の実践例。モデル別の調整も解説。

夜間の編集デスク。モニターに雨の濡れた街道の映像を表示、横にショットリストノート

テキストから動画 プロンプト 例:コピペして使える骨組み

これから紹介するテキストから動画のプロンプト例は、すべてコピペして使える実例です。どれもが同じ骨組みに従っています:カメラの動き、シーン、1つの動作、細部。5~10秒で納まる単一の動作として書き、やりたいことを明確に説明し、避けたいことは言わない。再実行するときは1つの要素だけを変える。以下で紹介するのは、SNS用フック、商品撮影、B-ロール、トークヘッド、研修動画の例です。

なぜテキストから動画は泥のような映像になるのか

「なんか雰囲気のいい画像集」みたいに書いたプロンプトが原因です。「壮大で映画的、8K、超詳細」と書いても、モデルにはカメラを動かす指示がない。動画モデルは物理的な指示が必要です。誰が、何をするのか、どこで、カメラはどう動くのか。

Runwayの公式ガイドは4つの順序に落とし込んでいます:カメラ動き、シーン、動作、細部。1クリップにつき1つの動作だけ。Klingのガイドも同じ要素に行き着いています:被写体、動作、背景、カメラの動き、ライト、ムード。

クリップを壊す悪い習慣は2つ。1つのプロンプトに5つの動作を詰め込むことと、「その次」と書くこと。モデルはタイムラインを持っていない。1回の生成は1ビート。

Storyboard of four blank frames on a desk with a pencil and a toy camera dolly

どのモデルでも通用するプロンプト骨組み

この順序を使って、ショットが明確になったら足すのをやめてください。

[ショット&カメラ動き]。[背景&シーン]。[被写体が1つの動作をしている]。[ライト、レンズ、ムード]。

弱い→良い→本番対応の3段階で同じ考えを示します。

弱い例: 「カフェにいる美しい若い女性の映像化。」

もっと良い例: 「日の当たるカフェで、女性がラテを唇まで持ち上げて、ほほ笑む。」

本番対応: 「ミディアムショットからクローズアップへのゆっくりなプッシュイン。日が差すカフェの隅。湯気が立つセラミックカップ。クリーム色のウールセーターを着た若い女性がカップを持ち上げ、かすかに微笑む。シャローフォーカス。柔らかい朝日の金色。くすんだ暖色。」

3番目のバージョンは、カメラ、動作、ライトを指定しています。その中に、モデルに推測させる感情はない。本番規模の制作はここから始まる。再利用できるプロンプトとは、スロットがあるプロンプトのことです。

SNS用フックと広告的なクリップのプロンプト例

短く、目立つ、1つのアイデア。縦フレーミングはプロンプトに入れる、願いではなく。これらは9:16と5~8秒で書かれています。

真夜中の散らかったデスクへのハイスピードウィップパン。ノートパソコンの画面が光り、紙が散らばり、冷めたコーヒー。手がノートパソコンを閉じ、フレームは静止。ハンドヘルド、厳しいオーバーヘッドライト、9:16縦。

固定マクロショット。インクの1滴が透明な水に落ち、スパイラル状に開く。スローモーション。黒い背景。スタジオライト。シャープなフォーカス。

夜明けの湿った舗装を打つ走者の靴の横、低角度のトラッキングショット。足首の高さに霧。街灯が消えていく。なめらかで安定した動き。冷たい青いライト。

定期的に発表するクリエイター向け、顔のないチャンネル用に2つ追加:

薄暗い図書館の通路をドーリーで前進。高い窓からの1本の光線にほこりが舞う。革の本が棚から滑り落ち、読書テーブルで開く。暖かいタングステン色。16:9。

青い時間の広い窓から都市スカイラインが見えるデスク上のノートパソコンからのスムーズなクレーンアップ。キーボード脇にマグカップ。画面は柔らかい光を反射。穏やか。着実。ドキュメンタリーの質感。

パターン:モデルが描画できる動詞、保持できるテクスチャ(濡れた舗装、インク、ガラス)、被写体と衝突しないカメラの動き。画面内のテキストはスキップ。生成された動画内のテキストはほとんどのモデルで漂流してぐちゃぐちゃになる。字幕はエディタで足してください。

商品撮影とB-ロールのプロンプト方法

商品撮影は抑制の報酬。他に動くものがほぼないとき、モデルは形とライトをよく保ちます。

セラミックコーヒーカップへのゆっくりプッシュイン。静かな朝のキッチン。シャローフォーカス。左からの柔らかい窓光。

オーバーヘッドショット。淡いオーク材のテーブルの上でマットな黒いスピーカーを開梱する両手。蓋が持ち上がり、ティッシュペーパーが沈む。ニュートラルトーン。拡散ライト。カメラの揺れなし。

ビロードのペデスタルの上の香水瓶の周りの軌道ショット。ガラスの縁に沿ってライトが輝く。ゆっくり、均等な回転。黒い背景。表面に微かな反射。

Miniature camera on a slider rail pushing in toward a steaming latte cup on a model cafe set

B-ロールは、エスタブリッシング、ディテール、カットアウェイで思考してください。タイプごとに1プロンプト:

3つずつ生成すれば、ラッキーなクリップではなく、シーケンスがあります。ライブラリも作られます。それはまた、ショットタイプで勝ち組にラベルを付け、骨組みを再利用する方法。

研修と説明ビデオのプロンプト方法

L&Dと説明動画はほぼイラストレーション:プロセス、場所、ビフォーアフター。プロンプトの仕事は1つのアイデアを見せること。ナレーションが残りを運べるようにします。

倉庫作業員がハンドスキャナーで箱をスキャンしてから棚に置く、静止した中距離ショット。明るく均等な産業用ライト。きれいな床。フレーム内に他の動きはない。

付箋3列を整理する手のオーバーヘッドショット。付箋は白紙。黄、青、ピンク。カメラ安定。柔らかい日光。浅い影。

午前9時の整理されたオープンオフィスをゆっくりパン。机は半分占有。モニターは汎用ダッシュボードを表示。自然光。ニュートラルパレット。穏やかなペース。

何が欠けているか気づきますか:ロゴ、読める画面、看板、名前。視聴者が読む必要のあるものはすべて、後処理で追加。40モジュールシリーズなら、これが採用する最も安い習慣。各プロンプトをモジュール用のシーンカードとして書き、ショットタイプでタグ付けすれば、同じ一般的な「オフィス」ショットを2回生成することはない。

セリフが入るプロンプトを書くときの変化

テキストから動画でセリフが入るプロンプトは、モデル間で結果が大きく分かれるポイント。一部のモデルは音声とリップシンクを同期生成し、他のモデルはサイレントクリップを返して、顔が数秒後に漂流します。

モデルが音声対応なら、リテラルに短く:

中距離クローズアップ。カメラ固定。キッチンテーブルの女性がレンズに向かって言う:「3つのプロンプト、10分、1つの完成したクリップ。」自然な窓光。シャローフォーカス。字幕なし。

成功する場合:1人のスピーカー、1行、1つの場所、10秒未満。失敗する場合:長いモノローグ、2人が会話、名前とブランド単語、同じ顔が5つの別の生成で生き残る必要があるとき。

最後の1つは見た目以上に重要。クリップ間の一貫性は、テキストのみの動画の本当のコスト。シリーズが同じプレゼンターの40モジュールを必要とするなら、プロンプトは顔の間違ったツール。テキスト → 動画でシーンとB-ロールを生成し、アバターパイプラインにセリフを任せてください。スクリプト入力、アバター出力、周りにシーンをカット。

完全に避けるべきプロンプト間違い

意見の時間。今日やめる価値のある習慣です。

うまくいく場所:短いクリップ、シンプルな動き、具体的な名詞。失敗する場所:群衆、細かい手作業、読める文字、水や布の物理的に複雑な部分が同じフレーム内。

1つのプロンプトをモデル間で変える方法

骨組みは転送可能。語彙は完璧には転送されない。クレジットを使う前に知る価値のある3つの調整:

Runwayのガイダンスはここで具体的。画像から始めるなら、イメージではなくモーションを説明。イメージの内容を詳しく繰り返すと、動きが減る可能性がある。Klingのガイドはクリップではなくショットで考えるよう促し、これは上記の1アクションルールと同じ直感。

これらのプロンプトはどこで走らせて、どう反復するか

ロゴではなく、仕事に合わせてモデルを選ぶ。KlingとVeoはカメラ言語とバージョンに応じてネイティブオーディオに対応。Runwayは反復とエディタツールで強い。Higgsfieldは複数の動画モデルを1つのワークスペースにバンドル。5つのログインなしに複数のエンジンに対して1つのプロンプトをテストできます。

同じ骨組みプロンプトを2つのモデルで走らせてください。1つの要素を変えるだけ:カメラ動き、ライト、または動詞。各変化が何をしたかログに記録。10回の実行で、あなたはハウススタイルを持ち、そのスタイルはこのリストを含むどんなプロンプト例より価値がある。

Laptop with two video timelines beside a studio microphone and ring light on a creator desk

今週、これらのプロンプトで実際に何をするか

既存のスクリプトを1つ取ります。6つのビートに分解。骨組みを使って各ビートに1つのプロンプト:カメラ、シーン、1つの動作、細部。各3テイク生成して、最高を保持。ナレーションにカット。ピースがナレーターの顔を必要とするなら、その部分にはアバターパイプラインを使います。

午後で粗いカットができます。生き残ったプロンプトは、ショットタイプ付きの共有ドキュメントに入る。次の動画は空のボックスからではなく、そのドキュメントから始まる。

よくある質問

テキストから動画の良いプロンプトとは何か?
カメラ動き、シーン、1つの目に見える動作、ライトやムードを、その順で指定するプロンプト。モデルが描画できる物理的な動きを説明し、抽象的な感情は除外。5~10秒の単一ビートに収まるもの。
テキストから動画のプロンプトはどのくらいの長さがいいか?
ショットを固定するのに十分で、明確さを失わない範囲。通常は2~4文。シンプルに始めて動きが機能することを確認し、それから1つずつ詳細を追加。
AI動画でネガティブプロンプトは使うべきか?
ほとんど使わない。Runwayは肯定的なフレージングを推奨。「揺れなし」と書くとフレーム内に揺れが入りやすい。代わりに「滑らかで安定した動き」と書いてください。
テキストから動画で音声とリップシンクが生成できるか?
一部の現在のモデルは短い台詞で音声とリップシンクを同期生成。1人のスピーカー、1行で成功する。長いスクリプトや複数話者には、アバターパイプラインが安定。
同じプロンプトを何度も実行すると映像が違うのはなぜか?
生成は確率的なので毎回異なる。固定できるものを使う:具体的な名詞、1つのカメラ動き、リファレンス画像。それから複数テイク生成して最良を選ぶ。
AI動画のプロンプト試験に最適なモデルはどれか?
単一の勝者はない。Kling、Veo、Runwayはカメラ言語を少し異なる方法で解釈。同じ骨組みプロンプトを2つのモデルで走らせて比較、1つずつ要素を変更。