
HOW TO
Grok Imagineで90年代通販番組パロディを作る方法|日本語吹き替えのコツ
2026年9月30日
家事と子育てのスキマで経営する3方よしAI共創コンサルタントの田中啓之、ひろくん(@passion_tanaka)です。今回は、90年代通販番組っぽいアメリカ風のパロディ動画を、私がAIに指示して作った記録を、そのまま真似できる作る方法として整えました。
英語でしゃべる外国人に、大げさな日本語の吹き替えが重なる。あの深夜の通販番組です。これで分身AI講座の紹介動画(92秒)を作りました。私がAI秘書の凛ちゃんに指示を出して、出来上がりを見ては直させて、仕上げたものです。この記事では、その時に途中で言った直しを全部最初から入れた「これを言えば出来上がる指示」を載せます。AIが道具に渡した実際のプロンプトとコマンドも、全部付けました。
3行でわかるポイント
- 2章の指示1本をAIに渡せば、同じ動画が出来上がる
- 英語でしゃべる映像に、日本語を後から重ねると吹き替えに見える
- まず1本だけ作らせて、1本ごとに確かめてから次へ進む

完成した92秒の通販番組パロディと、この記事で持ち帰れるもの

まずは完成品です。92秒あります。
登場人物は3人。仕事に追われる夫のジョージ、妻のケイト、それと隣人のトムです。英語でしゃべっている口に、日本語の声が乗っています。口と声がずれる。今回は、このずれで吹き替えっぽさを出しました。
見どころは3つあります。
- 同じ紹介を2回やるお約束。「紹介するよ、妻のケイトだ!」「知ってるよ、先週も会った。」
- 普通なら「AIが全部やってくれます!」で終わる所に、トムが「ノンノンノン、そこが違うんだ!」とツッコむ
- 白黒のBEFOREから、突然カラーの庭のAFTERへ。主人公が子どもにギターを弾いている
9本の流れは、こうなっています。日本語は吹き替えのセリフです。
| 本 | 場面 | 吹き替えのセリフ(抜粋) |
|---|---|---|
| 1 | 白黒。書類の山とほこりをかぶったギター | 「ああ、なんてこった!やりたくないことだけで、一日が終わっちまった!」 |
| 2 | 妻ケイトがギターを指さす | 「まあジョージ!ギター、もう何ヶ月も弾いてないじゃないの!」/「ああっ!僕がもう一人いればいいのに!」 |
| 3 | 隣人トムが乱入。くどい紹介 | 「トムじゃないか!紹介するよ、妻のケイトだ!」/「知ってるよ、先週も会った。」 |
| 4 | トムが箱を掲げる。商品カット4秒 | 「そんな時はコレ!分身AIさ!」/「じゃーん!これが、分身AI講座!」/「ノンノンノン、そこが違うんだ!」 |
| 5 | トムの説明 | 「自動化じゃない、分身化さ!君の考え方や大事にしていることを映すんだ!」 |
| 6 | 画面の中の半透明の分身 | 「君はギターの話をする時が、いちばん、たのしそうだね。」 |
| 7 | 源泉・接点・目的の板 | 「分身AIを育てるほど、自分が育つ!源泉は君、接点は分身AI、目的は君の人生さ!」/「今言ったよ!」 |
| 8 | 突然カラーの庭。AFTER | 「あなた〜!最近たのしそうね!」/「ハハッ、僕が僕に戻っただけさ!」 |
| 9 | 3人でサムズアップ | 「分身AI講座!今すぐアクセスを!」 |
この記事で持ち帰れるのは、次の4つです。
- AIに貼るだけで同じ動画が出来上がる指示(2章)
- その指示の1行ずつに入れた、私の実際の直し(3章)
- AIが道具に渡した実際のプロンプト6本とコマンド(4章)
- 書き出す前に見るチェックリスト
結論:この指示をAIに渡せば、Grok Imagineで同じ動画が出来上がる

先に答えを書きます。この動画は、私がAIに指示を出して作りました。使ったのは、Claude Code で動くAI秘書の凛ちゃんです。
ただ、最初の1行だけで出来たわけではありません。途中で何回も「違う」と直しています。その直しを、最初から全部入れた指示がこれです。Claude Code のように、コマンドまで打てるAIに貼ってください。
📋 コピペ用:これを言えば出来上がる指示
海外の90年代通販番組のパロディで、[自分の商品]を紹介する動画を作って。参考: [参考にしたい動画のURL] ・台本は中の道具の話ではなく、商品の本質で書く(例: 分身AI講座なら「自動化じゃない、分身化」) ・映像はGrok Imagineで10秒×9本。英語でしゃべる外国人の映像にして、日本語音声を後から重ねる吹き替えにする ・吹き替えは通販番組らしい大げさな翻訳調の日本語。大事な言葉は読みを指定する(例: 楽したい→らくしたい) ・テロップは通販番組風。商品はちゃんとパッケージにして登場人物に持たせる(白箱にしない) ・セリフの話者の入れ違い、人物が増える・消える、誰を指さして紹介しているかを1本ごとに確かめる ・まず1本だけ作って見せて。OKなら残りを同じ方式で
[ ] の2か所を書き換えるだけです。
1行ずつに、私が実際にやらかしを見つけて直させた理由があります。次の章で、その理由を1行ずつ書きます。AIが道具に渡した細かいプロンプトとコマンドは、その次の章にまとめました。自分で手を動かして作る方法を知りたい人は、そちらを見てください。
日本語吹き替えも箱も、指示の1行ずつに私の実際の直しが入っています

ここからは、指示の1行ずつについて、私が途中で言ったことと、それで何が変わったかを書きます。私の言葉は、AIへの指示をそのまま載せています。
1行目 台本は、道具の話ではなく商品の本質で書く
最初に出てきた台本は、中で使うツールの紹介でした。NotebookLM や Claude Code が並んでいる。そこで私はこう返しました。「中の AI がどうこうではなく、本質の部分で台本作ってください。分身 AI 起点の話です」
書き直した台本の芯は、私が親設計書に書いている言葉です。「源泉は自分。接点は分身AI。目的は人生。」これを7本目で、トムに言わせました。「源泉は君、接点は分身AI、目的は君の人生さ!」って。もう一つが「分身を育てるってことは自分が育つ」。これも同じ7本目のセリフです。
オチも芯から決まりました。普通の通販なら「AIが全部やってくれます!」で終わるところです。そこでトムが「ノンノンノン、そこが違うんだ!」とツッコむ。自動化じゃなくて、分身化。料理でいうと出汁です。ここが決まると、9本ぜんぶの味がそろいます。
2行目 英語でしゃべる映像に、日本語音声を後から重ねる
ここがいちばん大事なところです。最初の試作は、Grokに日本語でしゃべらせたものでした。見た瞬間に、私はこう言っています。「吹き替えにしないとだめだろ」
次に出てきたのは、Grokに「英語の口に、日本語の声を重ねて」と頼んだものです。これも前と同じに見えました。なので、もう一度はっきり言いました。「英語で話してる動画に日本語音声を合成だよ」
| やり方 | 結果 |
|---|---|
| ① Grokに日本語でしゃべらせる | 口と声が合う。日本人が話しているように見えた |
| ② Grokに「英語の口+日本語の声」を頼む | ①と同じに見えた |
| ③ 英語でしゃべらせ、英語の声だけ抜いて、日本語を後から重ねる | 採用。口と声が必ずずれるので、吹き替えに見える |
口と声がぴったり合った映像は、タレを最初から混ぜ込んで焼いたお肉です。おいしくても、タレの味だけを後から見分けることはできません。吹き替え感は、先に素焼きにした素材(英語の映像)に、別に作ったタレ(日本語の声)を最後にかけるから出ます。
ずれているから、吹き替えに見える。だから指示に、最初から「英語でしゃべる映像に、日本語を後から重ねる」と書いておきます。
3行目 大げさな翻訳調にして、大事な言葉は読みを指定する
吹き替えを重ねた版を見て、私が引っかかったのは奥さんの声です。「奥さんの声が淡々として違和感。もっと通販番組っぽく大袈裟な翻訳日本語音声にできない?」と返しました。
AI秘書の凛ちゃんは、日本語の女性の声4つに同じセリフを読ませて、声の高さの上下の幅を測りました。一番幅の広い声に替えて、219〜533Hzが276〜593Hzになっています。セリフも「まあ!」「なんてこった!」の調子に直しました。
もう一つが読み間違いです。「らくしたい、って読まないとだめだろ」と言いました。漢字のままだと、音声AIが読みを間違えます。実際に「楽しそう」は「たまし そう」と読まれていました。「らく」「たの」をひらがなで書くと、読みが固定されます。
4行目 テロップは通販番組風に。商品はちゃんとパッケージにする
9本がつながった段階では、テロップも商品もありませんでした。私が出した指示は2つです。テロップを通販番組風にすること。商品をちゃんとパッケージにして入れること。
それで入ったのが、名札、BEFORE/AFTER のバッジ、赤い帯のテロップ、星形の「分身AI!!」、最後のエンドカードです。ところが、出来上がりを見ると箱が真っ白。「パッケージが白箱」と返しました。箱の画像を先に作って、登場人物に持たせた1コマから動画を作り直すと、箱の絵柄が残りました。
5行目 話者の入れ違い・人物の増減・指さしを1本ごとに確かめる
9本そろった版を見て、私はこう言いました。「トムのセリフ入れ違ったり、最後のシーン奥さん分裂してからトム出てきたりやばいよ」次の版では「トムを指さしながら妻を紹介してる」とも返しています。
Grokは、指示に書いていない所を自分で埋めます(推測: 今回の失敗を見ての見立てです)。今回、実物で起きたのは次の3つです。
- 3本目で、トムのセリフをジョージがしゃべった
- 最後の庭の場面で、奥さんが2人に増え、1人がトムに変わっていった
- 3本目で、ジョージがトムを指さしたまま「妻のケイトだ!」と紹介した
直し方は、どれも同じでした。崩れた所に「誰が・いつ・何をするか」を1つずつ書き足して作り直す。奥さんの分裂には、分裂する前のきれいなコマから作り直して、次の1行を足しています。
📋 足した1行
Keep exactly these same people in the frame the whole time; nobody duplicates or transforms.
指さしは、「『Tom!』と言う時だけ指さす。左を向いて妻の肩を抱き、司会者のように手で示す」と動きを順番に書いて直しました。3本目は計4回作っています。作った回数は、記録が残っている分で15回。採用したのは9本です。
だから指示には、最初から「1本ごとに確かめる」と入れておきます。9本作ってから気づくより、1本ずつ見るほうが作り直しが少なく済みます(推測)。
6行目 まず1本だけ作って見せてもらう
吹き替えのやり方が決まる前、試作は2本ありました。私は「吹き替えにしないとだめだろ 1本だけ作って」と返しています。方式を変えた1本を見てOKを出し、「この方式で残り8本を作る」を選びました。
最初の1本で方向を確かめれば、ずれたまま9本作ることはありません。これが最後の1行です。
90年代通販番組パロディを作る方法①:台本・映像・箱で、AIが道具に渡した実際のプロンプト

ここからは、2章の指示を受けて、AI秘書の凛ちゃんが道具に実際に渡したものです。2章の指示だけで作れますが、自分で手を動かしたい人や、途中で直したい人のために全部載せます。この章がSTEP0〜5、次の章がSTEP6〜10です。
STEP0 準備:使う道具と置き場所
やること
使う道具は、次の7つです。
| 役割 | 道具 |
|---|---|
| 台本・翻訳 | ChatGPT か Claude |
| 最初の1コマの画像 | Grok の画像生成 |
| 商品の箱・箱を持たせる編集 | 参照画像を渡して編集できる画像生成AI(今回は gpt-image-2) |
| 動画(画像+指示→10秒) | Grok Imagine(ブラウザ版 grok.com/imagine) |
| 英語の声だけ抜く | Demucs(htdemucs) |
| 英語の単語の時刻を取る | faster-whisper |
| 日本語の吹き替え声 | ElevenLabs(eleven_v4_turbo・感情タグ付き) |
| テロップ・結合・書き出し | Python の Pillow と ffmpeg |
コマンドは、全部 Claude Code に打ってもらう前提です。今回もAI秘書の凛ちゃんが打っています。フォルダは1本ずつ番号で分けておくと、あとで迷いません。
📋 置き場所の例
tsuhan/ spec.json … 台本(STEP1で作る) frames/ … 最初の1コマ・最後のコマ clips/ … Grok Imagine から落とした 10秒動画 dub/ … 声を抜いた音・吹き替え音声 telop/ … テロップの透明PNG out/ … 書き出した完成品
📋 コピペ用コマンド(フォルダを一度に作る・Mac / Linux のターミナル)
mkdir -p tsuhan/frames tsuhan/clips tsuhan/dub tsuhan/telop tsuhan/out cd tsuhan
⚠️ よくある失敗と直し方
- Grok をコマンドから動かしたら、動画の生成を断られた
→ 今回はGrok側の「データを保存しない設定(ZDR)」で3回とも断られました。ブラウザ版のGrok Imagineに切り替えて作っています
STEP1 台本:芯の一言を決めて、10秒×9本に割る
やること
台本は、1本ごとに場面・英語のセリフ・日本語の吹き替えの3点セットで書きます。英語はGrokにしゃべらせる用。日本語は後から重ねる用です。
芯の決め方は3章の1行目に書きました。芯の一言を先に決めてから、台本を作らせます。
📋 コピペ用プロンプト① 台本(ChatGPT / Claude に貼る)
あなたは90年代アメリカのテレビ通販番組の脚本家です。
[商品名]を紹介する、通販番組パロディ動画の台本を作ってください。
■設定
- 主人公: [主人公の名前](悩み: [悩み])
- 相棒: [相棒の名前](主人公の[妻/夫/同僚])
- 紹介役: [紹介役の名前](突然やってくる隣人。商品を紹介する)
- 商品の芯(いちばん伝えたいこと): [芯の一言]
- よくある誤解(ツッコミどころ): [誤解。例: 全部まかせてラクできる]
■形式
- 10秒のシーンを9本。合計90秒前後
- 1〜3本目は白黒で「悩み」。4本目で商品登場。8本目で突然カラーのAFTER。9本目は全員で「[行動]を今すぐ!」
- 各シーンを次の3点セットで書く
1. scene(英語): 誰がどこで何をするか。動きの順番とカメラの動きまで。1〜3文
2. 英語のセリフ: 話者ごと。1発言10語以内。1シーン最大3発言
3. 日本語の吹き替え: 英語と同じ順番・同じ話者。海外通販の吹き替え調で大げさに(「まあ!」「なんてこった!」「ノンノンノン」)。1発言は全角20字以内
- お約束のギャグを1つ入れる(例: 同じ人を2回紹介する/「今言ったよ!」)
- 誤解に対して、紹介役が「ノンノン、そこが違うんだ!」とツッコむ場面を必ず入れる
■書かないこと
- 価格、利用者の声、効果の数字(確かめられないものは書かない)
■出力(JSONだけ)
{"clips":{"01":{"scene":"...","lines":[["話者","英語","日本語"]]}, "02":{...}}}
⚠️ よくある失敗と直し方
- 日本語のセリフが長くて、10秒に入らない
→ 1発言は全角20字以内と先に縛る。入らなければSTEP7で1.4倍速まで縮め、それでも無理なら短く書き直す - 道具の紹介が並ぶだけの台本になった
→ 「商品の芯」を1行で書いてから作らせる。今回も1本目はツール紹介で、芯の話に書き直しました
STEP2 最初の1コマ:白黒の「悩み」の絵を1枚
やること
1本目の元になる絵を、Grokの画像生成で1枚作ります。ここで決めた人物と部屋が、最後まで続きます。だから、服と髪と小道具まで書き込みます。
📋 コピペ用プロンプト② 最初の1コマ(画像生成に貼る)
Still frame from a cheesy 1990s American TV infomercial, black-and-white grainy film look, 16:9 wide shot. [場所。例: Late night suburban home office]. [主人公の見た目。例: A man in his 30s with short brown hair and a plaid flannel shirt] sits at [悩みの舞台。例: a cluttered desk with a laptop and tall piles of paperwork], [大げさな悩みのポーズ。例: both hands on his head in exaggerated theatrical despair]. In the corner, [本当はやりたいことの小道具。例: an acoustic guitar leans against the wall, covered in dust]. No text, no logos, no watermark.
最後の「本当はやりたいことの小道具」が効きます。今回はほこりをかぶったギター。これがAFTERの庭で弾くギターにつながります。
⚠️ よくある失敗と直し方
- あとの動画で、人の見た目が変わってしまう
→ 今回もトムの見た目が、白黒のパートと最後のシーンで違ってしまいました。推測: 最初の1コマで服・髪・小道具まで書き込んでおくと、あとの動画がこの絵を土台にできるので、ぶれが減ります
STEP3 動画生成:画像+英語の指示で10秒
やること
Grok Imagine の画面で、画像を渡して、指示文を貼って、10秒で作ります。指示文は毎回同じ型です。場面を書いて、英語でしゃべらせて、最後に「字幕なし」を付ける。
📋 コピペ用プロンプト③ Grok Imagine の動画指示の型
Cheesy 1990s American TV infomercial parody. [Same black-and-white room / Full color], same [人数] people. [場面: 誰が何をするか。動きの順番どおりに英語で1〜3文] Everyone speaks in ENGLISH with big exaggerated American lip movements and theatrical over-the-top acting. The [話者Aの見た目] says in English: "[英語のセリフ1]" The [話者Bの見た目] says in English: "[英語のセリフ2]" Cheesy upbeat infomercial music and comedic sound effects. No subtitles, no on-screen text, no logos, no watermark.
実際に4本目で使った指示文は、これです。
📋 実例(4本目・そのまま)
Cheesy 1990s American TV infomercial parody. Same black-and-white room, same three people. The neighbor proudly holds up the FULL-COLOR glossy blue product box with the yellow and red Japanese title toward the camera with a big grin and a sparkle; the box stays in vivid color while everything else stays black-and-white, like a classic infomercial product reveal. Keep the box design exactly the same. The woman clasps her hands excitedly, then the neighbor wags his finger no. Everyone speaks in ENGLISH with big exaggerated American lip movements and theatrical over-the-top acting. The grinning neighbor says in English: "When that happens, you need this! Bunshin AI!" The woman says in English: "So the AI does everything for you!" The grinning neighbor says in English: "No, no, no, that's the thing!" Cheesy upbeat infomercial music and comedic sound effects. No subtitles, no on-screen text, no logos, no watermark.
話者は、名前ではなく「笑顔の隣人」「女性」と見た目で呼んでいます。推測: 名前だけだと、画面の誰なのかGrokには分かりにくいはずです。
⚠️ よくある失敗と直し方
- 別の人が、ほかの人のセリフをしゃべった
→ 3本目で、トムのセリフをジョージがしゃべりました。話者を見た目で指定し、しゃべらない人は「口を閉じて固まる」と書いて作り直し - 指さしと言葉が合わない
→ 3本目で、ジョージがトムを指さしたまま妻を紹介しました。「『Tom!』と言う時だけ指さす。左を向いて妻の肩を抱き、司会者のように手で示す」と動きを順番に書いて直しています。3本目は計4回作りました
STEP4 つなぐ:前の動画の最後のコマを、次の最初の画像にする
やること
2本目からは、新しい絵を作りません。1本目の最後の1コマを切り出して、2本目の最初の画像にします。これで人物も部屋も、9本ずっと続きます。
📋 コピペ用コマンド(最後の1コマを切り出す)
ffmpeg -sseof -0.1 -i clips/c01.mp4 -frames:v 1 -q:v 2 frames/last01.jpg
⚠️ よくある失敗と直し方
- 回を重ねるほど、人の顔が少しずつ変わる
→ 推測: Grok Imagine は1本ずつ別に作るので、9本通して顔を完全には固定できません。今回もトムの見た目が白黒パートと最後で違っています。2本目以降の指示文は毎回「Same」で始めて、同じ部屋・同じ人だと念押ししています
STEP5 商品パッケージ:箱を作って、登場人物に持たせる
やること
通販番組には、ピカピカの箱が要ります。箱は2段階で作ります。先に箱だけの商品写真を作る。次に、3本目の最後のコマに箱を持たせる編集をする。できた1コマを、4本目の最初の画像にします。白黒の部屋で、箱だけカラー。あの「商品登場!」の絵になります。
📋 コピペ用プロンプト④-1 箱だけの商品写真
Studio product shot in the style of a cheesy 1990s American TV infomercial. A glossy retail product box standing on a rotating white pedestal against a bright blue gradient background with sparkles, lens flare and a starburst. The box front shows large bold Japanese title text "[商品名]" in yellow with thick red outline, [箱の絵柄。例: a friendly illustration of a man in a plaid shirt next to his glowing translucent blue double], and a smaller Japanese tagline "[キャッチコピー]". The box side shows "[英字のロゴ]". Clean, realistic packaging, crisp legible text, no other text, no watermark. 16:9 composition with the box centered and some empty space on both sides.
📋 コピペ用プロンプト④-2 登場人物に箱を持たせる(参照画像2枚: 1枚目=最後のコマ、2枚目=箱)
Edit the first reference image. Keep it the exact same black-and-white photo: same room, same [人数] people, same faces, same clothes, same positions and framing. Change only one thing: [持たせる人の見た目。例: the neighbor man on the right in the dark polo shirt] now proudly holds the product box from the second reference image up in front of his chest with both hands, front side facing the camera. The box is in FULL VIVID COLOR ([箱の色と文字。例: blue box, yellow and red Japanese title "[商品名]"]), identical design to the second reference image, with a small sparkle. Everything except the box stays black-and-white. Photorealistic, no other text, no watermark.
商品カットは、4本目の途中に4秒だけ差し込みます。「じゃーん!これが、分身AI講座!」の場面です。やり方はSTEP9で書きます。
⚠️ よくある失敗と直し方
- 動画の中で、箱が真っ白になった
→ 4本目で、箱が白い無地になりました。④-2で箱を合成した1コマから作り直すと、箱の絵柄が残りました
作る方法②:吹き替え・テロップ・書き出しで、AIが打った実際のコマンド

ここからは、Grok Imagine で作った9本に、日本語の吹き替えとテロップを重ねて、1本に書き出すところです。2章の指示の2行目から4行目を、AI秘書の凛ちゃんがこのコマンドで形にしました。
STEP6 英語の声を抜く:BGMと効果音は残す
やること
Grokが作った10秒には、英語の声と、通販っぽい音楽と効果音が入っています。声だけ抜いて、音楽と効果音は残します。ついでに、英語の各単語が何秒目に出たかも取っておく。これがSTEP7の位置合わせに効きます。
📋 コピペ用コマンド(Demucs で声と伴奏を分ける)
ffmpeg -i clips/c01.mp4 -vn -ac 2 -ar 44100 dub/c01.wav demucs -n htdemucs --two-stems=vocals -o dub/sep dub/c01.wav # dub/sep/htdemucs/c01/vocals.wav … 英語の声 # dub/sep/htdemucs/c01/no_vocals.wav … 音楽と効果音(これを残す)
📋 コピペ用コード(faster-whisper で単語の時刻を取る)
from faster_whisper import WhisperModel
import json
m = WhisperModel("medium", compute_type="int8")
segs, info = m.transcribe("dub/sep/htdemucs/c01/vocals.wav", language="en", word_timestamps=True)
words = [{"w": w.word, "s": w.start, "e": w.end} for s in segs for w in s.words]
json.dump({"words": words}, open("dub/words01.json", "w"), ensure_ascii=False)
STEP7 吹き替え:訳して、読ませて、英語の出だしに合わせる
やること
まず英語のセリフを、吹き替え調の日本語に訳します。STEP1の台本に日本語があるなら、そのまま使ってOKです。
📋 コピペ用プロンプト⑤ 英語 → 吹き替え調の日本語
次の英語のセリフを、90年代の海外通販番組の日本語吹き替え調に訳してください。 ■ルール - 大げさに。「まあ!」「なんてこった!」「ノンノンノン」「じゃーん!」を使ってよい - 1発言は、英語をしゃべっている秒数に収まる長さにする - 話者の順番と人数は英語と同じにする - 読み間違えやすい漢字はひらがなにする(例: 楽しそう → たのしそう、楽したい → らくしたい) - ElevenLabs の感情タグを先頭に付ける(例: [excited] [dramatic] [gasps] [sighs]) ■英語のセリフ(話者 / 秒数 / 英語) [話者] / [秒数] / [英語] [話者] / [秒数] / [英語] ■出力 [感情タグ] 日本語 の形で1行ずつ
次に、Claude Code に位置合わせの一式を作ってもらいます。今回AI秘書の凛ちゃんが使った考え方を、そのまま依頼文にしました。
📋 コピペ用プロンプト⑥ Claude Code への依頼文(吹き替えの位置合わせ一式)
通販番組パロディ動画の日本語吹き替えを、1本ずつ自動で重ねる Python スクリプトを作ってください。
■入力
- clips/c{番号}.mp4(Grok Imagine が作った10秒動画。英語でしゃべっている)
- spec.json(clips.{番号}.lines に [話者, 英語, 日本語] の配列。voices に話者ごとの ElevenLabs の声ID)
■手順
1. Demucs(htdemucs)で英語の声と、それ以外(音楽・効果音)に分ける
2. faster-whisper(medium・word_timestamps)で英語の声から単語ごとの時刻を取る
3. 各セリフの最初の英単語を、単語の並びの中から順番に探す(前のセリフの続きから14語以内)。見つかった単語の開始時刻を、そのセリフの開始時刻にする
4. 日本語を ElevenLabs(eleven_v4_turbo・感情タグ付き)で読ませる
5. 音声の前後の無音を削る(ffmpeg silenceremove・-45dB)
6. 開始時刻は「英語の開始時刻」と「前のセリフの終わり+0.1秒」の遅い方
7. 次のセリフの開始までに収まらなければ atempo で縮める。上限は1.4倍。それを超える行は一覧で出す(台本を短く直すため)
8. 分身など特別な役だけ aecho=0.8:0.6:60:0.3 をかける
9. 音楽・効果音(音量0.8)と吹き替え(音量1.6)を amix で重ね、元の映像と合わせて書き出す
(libx264 crf20 / aac 192k / -movflags +faststart)
■出力
- dub/c{番号}_ja.mp4
- セリフごとの 開始秒・長さ・倍率 のログ
⚠️ よくある失敗と直し方
- 動画の長さで割り振ったら、口の動きとセリフがずれた
→ 最初は比例で配置してずれました。英語の単語の時刻に合わせる方式に変えています - Grokが台本にない英語を足した
→ 「Exactly! A clone!」「Oh, yes.」のアドリブが入りました。空いた口には、日本語を1行足して埋めます - 読ませた音声が、思ったより長い
→ ElevenLabs の音声は前後に無音が付いていました。無音を削ってから置きます - 奥さんの声が淡々としていて、通販っぽくない
→ 日本語の女性の声4つに同じセリフを読ませ、音程の上下の幅を測りました。一番幅の広い声に替えて、219〜533Hzが276〜593Hzになっています。セリフも「まあ!」調に直しました - 「楽しそう」が「たまし そう」と読まれた
→ 「らく」「たの」をひらがなで書いて、読みを固定します
STEP8 テロップ:透明の画像を作って、時間指定で重ねる
やること
テロップは、Pillow で透明のPNGを作って、ffmpeg で秒数を指定して重ねます。今回入れたのは、次のテロップです。
- 左上の名札(「おとなりさん トム」)
- 右上の BEFORE / AFTER のバッジ
- 下の赤い帯のテロップ
- 星形のはじける文字(「分身AI!!」「ノンノン!」)
- 源泉・接点・目的が1段ずつ積み上がる板
- 小さい注意書き(「※画面はイメージです」「※先週も会っています」)
- 最後のエンドカード(箱・講座名・URL・「今すぐアクセス!」)
📋 コピペ用コマンド(2.0〜5.5秒の間だけ下の帯を重ねる)
ffmpeg -i dub/c01_ja.mp4 -i telop/c01_lower.png \ -filter_complex "[0:v][1:v]overlay=0:0:enable='between(t,2.0,5.5)'[v]" \ -map "[v]" -map 0:a -c:v libx264 -crf 20 -c:a copy telop/c01_t.mp4
文字はヒラギノ角ゴの太いもの(W8とW6)を使いました。下の赤い帯は、次のコードで作れます。文字を差し替えれば、ほかの帯も同じです。
📋 コピペ用コード(下の赤い帯のテロップPNGを作る・lower.py)
from PIL import Image, ImageDraw, ImageFont
FONT = "/System/Library/Fonts/ヒラギノ角ゴシック W8.ttc" # Windowsなら太いゴシック体のパスに変える
TEXT = "やりたくないことで、一日が終わる…" # [テロップの文字]
OUT = "telop/c01_lower.png"
im = Image.new("RGBA", (1280, 720), (0, 0, 0, 0)) # 透明の1280x720
d = ImageDraw.Draw(im)
f = ImageFont.truetype(FONT, 64)
d.rectangle((0, 560, 1280, 680), fill=(180, 0, 20, 215)) # 赤い帯
d.rectangle((0, 556, 1280, 562), fill=(255, 230, 0, 255)) # 上の黄色い線
d.rectangle((0, 678, 1280, 684), fill=(255, 230, 0, 255)) # 下の黄色い線
w = d.textlength(TEXT, font=f)
d.text(((1280 - w) / 2, 580), TEXT, font=f, fill=(255, 230, 0),
stroke_width=6, stroke_fill="black") # 黄色の文字に黒いふち
im.save(OUT)
名札やバッジも、四角と文字の位置を変えるだけの同じ作りです。まとめて作らせるなら、STEP7の依頼文と同じように Claude Code に「このテロップを、この秒数で」と一覧で渡します。
⚠️ よくある失敗と直し方
- テロップを出す秒数が、セリフとずれる
→ 推測: 秒数を勘で決めるとずれます。STEP7で出したログ(セリフごとの開始秒と長さ)を見て、between の秒数を決めます - Windowsで文字が出ない・豆腐(□)になる
→ ヒラギノはMacのフォントです。日本語の太いゴシック体のファイルの場所に、FONT の行を書き換えます
STEP9 結合と書き出し:商品カットを差し込んで、1本にする
やること
4本目を3.1秒の所で2つに割って、間に4秒の商品カットを差し込みます。あとは9本を順番につなぐだけ。最後に必ず -movflags +faststart を付けます。これが無いと、ブラウザで再生が始まらないことがあります。
今回の商品カットは、STEP5で作った箱の画像に4秒かけてゆっくり寄りながら、「NEW!」の星を重ねたものです。声はSTEP7と同じ手順で作ったセリフ(「じゃーん!これが、分身AI講座!」)を入れました。同じ形は、次のコマンドで作れます。
📋 コピペ用コマンド(商品カット4秒を作る)
# frames/pack.png = 箱の画像(1280x720) # telop/pack_new.png = 星のテロップ(透明PNG) # dub/pack_ja.mp3 = 商品カットの吹き替え ffmpeg -loop 1 -framerate 24 -i frames/pack.png -i telop/pack_new.png -i dub/pack_ja.mp3 -filter_complex "[0:v]scale=1280:720,zoompan=z='1+0.0015*on':x='iw/2-iw/zoom/2':y='ih/2-ih/zoom/2':d=1:s=1280x720:fps=24[bg];[bg][1:v]overlay=0:0[v];[2:a]apad[a]" -map "[v]" -map "[a]" -t 4 -c:v libx264 -crf 20 -pix_fmt yuv420p -c:a aac -ar 44100 -ac 2 telop/pack.mp4
📋 コピペ用コマンド(割る・差し込む・つなぐ)
# 4本目を3.1秒で割る ffmpeg -i telop/c04_t.mp4 -t 3.1 -c:v libx264 -crf 20 -c:a aac telop/c04a.mp4 ffmpeg -ss 3.1 -i telop/c04_t.mp4 -c:v libx264 -crf 20 -c:a aac telop/c04b.mp4 # list.txt に順番を書く(この11行をそのまま保存) cat > list.txt <<'LIST' file 'telop/c01_t.mp4' file 'telop/c02_t.mp4' file 'telop/c03_t.mp4' file 'telop/c04a.mp4' file 'telop/pack.mp4' file 'telop/c04b.mp4' file 'telop/c05_t.mp4' file 'telop/c06_t.mp4' file 'telop/c07_t.mp4' file 'telop/c08_t.mp4' file 'telop/c09_t.mp4' LIST ffmpeg -f concat -safe 0 -i list.txt -c:v libx264 -crf 20 -pix_fmt yuv420p \ -c:a aac -b:a 192k -movflags +faststart out/final.mp4
⚠️ よくある失敗と直し方
- 書き出した動画が、ブラウザで再生できない
→ -movflags +faststart を付け忘れています。付けて書き出し直します - つないだ所で、映像が止まる・音がずれる
→ 推測: 大きさ・コマ数・音の形式がそろっていないと起きます。上のコマンドはどれも libx264・1280×720・aac 44100Hz に書き出して、形をそろえています
STEP10 書き出す前のチェック
やること
最後に、完成した動画をもう一度文字起こしします。吹き替えの日本語が、全部台本の順番で聞こえるか。英語が残っていないか。今回は24セリフ、全部OKでした。
それでも、粗は2つ残っています。正直に書いておきます。
- 5本目で、ジョージの声がトムの口に約0.5秒かぶっている
- トムの見た目が、白黒のパートと最後のシーンで違う
この2つは、直さずに残しています。
📋 コピペ用コード(完成品を文字起こしして、台本と見比べる)
from faster_whisper import WhisperModel
m = WhisperModel("medium", compute_type="int8")
segs, info = m.transcribe("out/final.mp4", language="ja")
for s in segs:
print(f"{s.start:6.1f}〜{s.end:6.1f} {s.text}")
出てきた行を、台本の日本語と上から順に見比べます。英語の行が混ざっていたら、声を抜き残した所です。
⚠️ よくある失敗と直し方
- 吹き替えの声が、次の人の口にかぶる
→ 今回は5本目に約0.5秒残しました。推測: 直すなら、そのセリフを短く書き直すか、前のセリフを早く終わらせます(1.4倍速まで) - 同じ人なのに、パートごとに見た目が違う
→ 今回はトムの見た目が違ったまま残しました。推測: 直すなら、そのシーンも前の動画の最後のコマから作り直します(STEP4)
✅ 通販パロディ動画のチェックリスト
- ☐ 台本の芯を、1行で言える
- ☐ 全9本が「場面・英語・日本語」の3点セットになっている
- ☐ 日本語の1発言が、全角20字以内
- ☐ 2本目以降は、前の動画の最後のコマから作った
- ☐ 話者を、名前ではなく見た目で指定した
- ☐ しゃべらない人は「口を閉じて固まる」と書いた
- ☐ 箱は、合成した1コマから動かした
- ☐ 人が増えたり変わったりしていない
- ☐ 英語の声が残っていない
- ☐ 吹き替えが1.4倍速を超えていない
- ☐ 読み間違いが無い(楽しそう・楽したい など)
- ☐ 価格・利用者の声・効果の数字を入れていない
- ☐ -movflags +faststart を付けて書き出した
よくある質問
Q. Grokに日本語でしゃべらせたほうが早くないですか?
A. 早いです。ただ、口と声がぴったり合うので、日本人が話している映像に見えました。今回は2本試して、吹き替え感が出ませんでした。英語でしゃべらせて声を抜き、日本語を重ねるほうを採用しています。
Q. 吹き替えの音声がセリフに収まらない時はどうしますか?
A. 1.4倍速までは縮めて入れます。それを超える行は、台本の日本語を短く書き直します。
Q. 9本つなぐと、人物の顔が変わりませんか?
A. 少し変わります。前の動画の最後のコマを次の最初の画像にすると人物と部屋は続きましたが、今回もトムの見た目は白黒パートと最後で違いました。推測ですが、1本ずつ別に作る仕組みなので、完全には固定できません。
Q. コマンドを自分で打てなくても作れますか?
A. 作れます。2章の指示を Claude Code のようなコマンドまで打てるAIに貼れば、道具の操作はAIがやります。私も今回、AI秘書の凛ちゃんに指示を出して作りました。
まとめ:直した所を、最初から指示に入れておく

この動画は、私がAIに指示を出して、出来上がりを見ては直させて作りました。その直しを最初から全部入れたのが、2章の指示です。芯は商品の本質で書く。英語の映像に日本語を重ねる。大げさに、読みは指定。箱はちゃんとパッケージに。1本ごとに確かめる。まず1本だけ。で、今回の台本の芯は「自動化じゃない、分身化」です。ツッコミも、AFTERの庭も、この一言から作っています。
まずは2章の指示の [ ] に、自分の商品と参考の動画を入れて、AIに貼ってみてください。最初の1本を見て、違う所を返す。それだけで進みます!
COLUMN
「全部まかせて」に、ノンノンと言いたかった

この動画でいちばん入れたかったのは、4本目のツッコミです。
ケイトが言います。「全部まかせて、らくしたい放題ね!」。トムが返す。「ノンノンノン、そこが違うんだ!」
私には、どんな条件を出されてもやらない仕事がいくつかあります。その1つが、相手を依存させる仕事です。「全部やってあげます」は優しさじゃない。そう決めています。
よくある通販の流れなら、「全部やってくれます!」で終わるところです。でも分身AIは、代わりに全部やる道具じゃないんです。自分の考え方や大事にしていることを映すもの。だから動画のオチも、ラクになった話ではなく「僕が僕に戻っただけさ」
になっています。
で、この動画の作り方そのものが、その実例になっていました。私がやったのは、AIに指示を出して、出来上がりを見て直させること。日本語の口パクだと吹き替えにならない。奥さんの声が淡々としている。指さす相手が違う。どれも、私が見て返した言葉です。
分身AIを育てるって、こういう判断の軸を言葉にしていくことなんです。前に「AI秘書が失敗したとき、分身AIは育つ」でも書きました。AIが凝った仕組みを出してきた時に、私が引き戻した話は「AIが凝った仕組みを出すたび、私が「もっとシンプルでいい」って引き戻した話」にあります。
作業は手放していい。判断は自分の手に残す。料理でいえば、仕込みは任せても、味見は自分の舌でやる。今回の動画づくりも、その分け方のまま進みました。
👉 自分の考え方を映す分身AIについてもっと知りたい方は分身AI.comもチェックしてね!
関連記事
参考リンク
🎁 無料プレゼント
Aiport(ClaudeCode AIエージェント実践会)
ClaudeCodeでAI秘書+分身AI+AIカンパニーが無料で作れるキット&解説動画をプレゼント!
▶ 無料で入会してキットを受け取る🤖 AI生成コンテンツについて
この記事はAIツール(Claude Code)を活用して制作しています。構成・文章生成・画像制作にAIを使用し、最終的な内容の確認・編集・公開判断はひろくん(田中啓之)本人が行っています。「分身AIひろくん」(bunshin-ai.com)とは別のコンテンツです。
AI氣道 — 三方よしのAI活用
家事と子育てのスキマで経営する、ひろくんのAIブログ
📺 毎朝無料LIVE配信中!見逃しても大丈夫、アーカイブも完全無料。
記事も完全無料。見逃しても大丈夫!
YouTubeチャンネル: @AIKIDO-GPTs
| 曜日 | 時間 | メインホスト | ゲスト | テーマ |
|---|---|---|---|---|
| 月 | 7:00〜7:30 | ひろくん | ただっち | AI最新ニュース・実験 |
| 月 | 13:00〜 | ひろくん | れんくん(戸野塚蓮) | AI経営術LIVE |
| 火 | 7:00〜7:30 | ひろくん | 公ちゃん | 共感ストーリー×分身AI |
| 水 | 7:00〜8:00 | ひろくん | 高崎さん・たくみくん | AI×開発・教育 |
| 木 | 7:00〜7:30 | ただっち | 友くん | AIツール最前線 |
| 金 | 7:00〜7:30 | ただっち | ともみん | AI×デザイン |
| 土 | 7:00〜7:30 | ただっち | 愛紗さん | AI×起業・発信 |
| 日 | 7:00〜7:30 / 7:30〜 | WACAコラボ | ひろくん+仲間たち | 生成AI最新ニュースまとめ |
📍 日曜7:00〜7:30のLIVEは無料視聴、7:30〜のWACAのZOOMは登録制です。詳細・登録はこちら
🔥 火曜15:00〜 社長モテる化計画LIVEもやってるよ!