WATCH REPORT

AIのSonnet 5.5に動画編集を任せる3ステップを
Jayさんが解説。切る・見た目を決める・見て直す

2026.10.03

家事と子育てのスキマで経営する3方よしAI共創コンサルタントの田中啓之、ひろくん(@passion_tanaka)です。今回は、YouTubeチャンネル「Jay E | RoboNuggets」のJayさんの動画「Turn Claude Into a Video Editing GENIUS (in 3 simple steps)」を紹介するね。Sonnet 5.5で動画を切って、見た目を決めて、見て直す。この3ステップを、私が1行で頼んで、AI秘書の凛ちゃんがOpus 5.5で動画を切った9月27日のリールの場面と並べて読みます。動画の工程を、私はまだ手元で再現していません。動画は冒頭で、Sonnet 5.5は動画編集とモーショングラフィックスが相当すごい、と言います(0:02)。

テーマは「動画編集のAI化を、切る・見た目を決める・見て直す、の順に分けて読む」。Jayさんの3ステップに、私のリールとスキルの場面を重ねます。

3行でわかるポイント

  1. 切る:言葉を先に文字にして切る。私のリールも、単語ごとの時刻から切る位置を決めて、書き出したあとにもう一度文字にして、つなぎ目4か所を見つけて直していました
  2. 見た目を決める:汎用の頼み方だと、AIっぽい見た目に揃う。Jayさんは、先に自分のデザインシステムを用意して、スキルにします
  3. 見て直す:1回目は80%くらい。直した学びを /animate のスキルに焼き込みます。私の言い方だと、1回分を手で直し切ってから型にする

AIの「今」を毎日シェアしてる無料コミュニティやってます

GPTs研究会に参加する(無料・8,900名突破!)
AIのSonnet 5.5に動画編集を任せる3ステップ、切る・見た目を決める・見て直すを、ひろくんの過去のリールと並べて読む全体図
01

「Sonnet 5.5は動画編集に相当すごい」。動画編集のAI化は、仕事を3段に分けて読める

仕事を切る・絵を足す・見て直すの3段に分け、映像のフィルムが階段を上っていく図解
動画キャプチャ: 撮ったままの映像と、アニメの図を重ねた完成版を左右に並べた画面(0:14頃)
動画キャプチャ: 撮ったままの映像と、アニメの図を重ねた完成版を左右に並べた画面(0:14頃)

動画は、のっけからデモで始まります(0:02)。Jayさんは、Sonnet 5.5が今週の初めにリリースされて、動画編集とモーショングラフィックスのアニメーションが相当すごいと分かった、と言います。

Jayさん

So, Sonnet 5.5 got released early this week, and it turns out it’s quite incredible when it comes to video editing and motion graphic animations…(0:02)

訳: Sonnet 5.5は今週の初めにリリースされて、動画編集とモーショングラフィックスのアニメーションに関しては相当すごいことが分かった。

画面は左右に分かれています(0:14)。左が本人の生の映像。右が、「/animate」というスキルを使って、Sonnet 5.5に1回のプロンプトで作らせた動画です。

今日のゴールは、ほかのAI動画生成モデルに頼らず、Sonnet 5.5で動画のアニメを作るスキルを3ステップで作ること(1:15)。

章立ては、Step 1「カット」、Step 2「アニメ化」、Step 3「ディレクション」です(4:44・8:44・12:28)。

ここで、私の読みを先に書きます。動画編集のAI化って1語で言うけど、中身は3段の仕事に分かれているってことなんです。素材を切る。絵を足す。見て直す。

私は前の記事で、すでにある映像を切る型と、絵を描くプログラムで作る型を分けて読みました(描く型と切る型を書いた記事)。Jayさんの Step 1 は切る型、Step 2 は描く型にあたります。

動画の中のアニメは、JavaScriptとHTMLで動きを処理している、とJayさん自身も説明しています(2:42)。

3つ目の「見て直す」が Step 3 です。この記事は、この順に、私の手元の場面と並べて読んでいきます。

3行メモで仕事を分ける 手元の動画を1本選んで、「切る所」「絵を足す所」「見て直す所」を1行ずつ書きます。3行そろったら、今日の分は終わりです。3分で足ります。

02

Step 1「切る」。言い直しは文字に起こして、最後のテイクを残す

生の映像を文字に起こし、最後のテイクだけを残して、切る前に全文を見てから書き出す流れの図解
動画キャプチャ: Step 1「切る」でClaudeに頼む文章の画面。しゃべった言葉を文字に起こし、いちばんいいテイクだけを残すよう書かれている(5:25頃)
動画キャプチャ: Step 1「切る」でClaudeに頼む文章の画面。しゃべった言葉を文字に起こし、いちばんいいテイクだけを残すよう書かれている(5:25頃)

Step 1は、文字起こしから始まります(4:44)。画面のプロンプト例(5:25)は、こう並んでいます。生の映像のパスを渡す。AssemblyAIで文字に起こさせる。同じ行を何回も言っていたら、最後のテイクを残す。

切る前に、全文を見せさせる。ffmpegで書き出す。曖昧な所は、列挙させる。

文字起こしの速さも、動画で比べています(6:13)。

Jayさん

with Assembly AI, the good news about it is if you have an hour of audio, that takes around 42 seconds, which is one of the fastest from the ones that we’ve tried out.(6:13)

訳: AssemblyAIの良い点は、1時間の音声が約42秒で終わること。試した中で最速クラスだ。

比べたのは、手元のPCで動かすWhisper、AssemblyAI、ElevenLabsの3つ。画面では、1時間の音声で、AssemblyAIが42秒、ElevenLabsが1分11秒でした(6:24)。

実例は1分50秒の素材で、Claudeが残す所を判定していました(6:39)。

ここから、私の場面です。9月27日の夜22時24分、私はAGI Cockpitに「リール動画にして」とYouTubeのURLを、1行だけ送りました。受け取ったのは、AI秘書の凛ちゃんです。中身はClaude Opus 5.5。

AI秘書の凛ちゃんは、Macの中で動くWhisper(large-v3-turbo)で、動画の音声を単語ごとの時刻つきで文字に起こしました。その時刻から切る位置を決めて、ffmpegで縦動画を書き出しています。

書き出したあとに、57秒版の音声を文字に起こし直して、元の台本と突き合わせたのもAI秘書の凛ちゃんです。その記事には、こう書きました。

「最初の書き出しはつなぎ目が4か所おかしかったんです。」たとえば「ブリーフィング」の頭が切れて「イフング」と聞こえた。「起きたら」が「あら」になった。次の場面の「5時45分に」と「さっき」も混ざった。

4か所とも直った版が、翌朝届いていました!(リールを1本作った記事)。

違いも書きます。Jayさんの切り方は、言い直しの中から最後のテイクを残す切り方です。私のリールは、7分41秒の動画から、見どころの5場面を選ぶ切り方でした。Jayさんは、切る前に全文を見ます。

私のリールで確認が届いたのは、書き出したあとの22時32分でした。

共通点は、切る位置を「聞こえた言葉の時刻」で決めていることです。書き出したあとにもう一度文字にするのは、私のリールの側だけの手順でした。私のリールで欠けに気づけたのは、その2回目の文字起こしで台本と突き合わせたからです。

2回目があると、つなぎ目の欠けが見えるのかなって、私は読んでいます。

文字にして言い直しを数える 自分の動画を1本、文字に起こします。同じ文を言い直している所が何か所あるか、数えます。数が出たら、そこで止めて大丈夫です。10分で足ります。

03

Step 2「アニメ化」。見た目を決めずに頼むと、AIっぽい見た目に揃ってしまう

見た目の型がないと全部そっくり、型を決めると違いが出ることを並べて見せるアニメ化の比較図
動画キャプチャ: 撮ったままの映像と、1つの指示だけで作った完成版を並べた画面。右はスキルなしのClaude Codeで、見た目の型を決めていない(9:21頃)
動画キャプチャ: 撮ったままの映像と、1つの指示だけで作った完成版を並べた画面。右はスキルなしのClaude Codeで、見た目の型を決めていない(9:21頃)

Step 2は、アニメ化です(8:44)。ここでJayさんが強く言うのは、汎用のプロンプトのままだとどうなるか、という話でした(9:07)。

Jayさん

because these are Sonnet’s defaults, these are quickly going to become the new AI vibe-coded slop that a lot of people would want to avoid…(9:07)

訳: それらはSonnetのデフォルトなので、多くの人が避けたがる、新しい「AIのバイブコーディング産スロップ」にすぐなってしまう。

画面には、「Plain Claude Code, no skill」と書いた汎用版の仕上がりが出ます(9:21)。スキルも見た目の指定も入れずに頼んだ結果です。

じゃあ、どうするか。Jayさんの答えは、自分のデザインシステムを呼び出すことです。見た目の型を先に用意して、スキルにしておく。

用意のしかたは、いくつか紹介されています。たとえば、プロンプトが付いた作品集のskillery.devから、好きな見た目を選ぶやり方(10:10)。もう1つは、プロンプトが付いていないXの作例から起こすやり方です。

投稿のURLをClaudeに渡して、ffmpegでスクリーンショットを撮らせて、見た目からデザインシステムを作らせます(10:59)。

見た目の名前は、フラットベクター、アイソメ、3Dレンダー、リキッド、グラスモーフィズム、Vox風のカットアウト(1:03)。同じ素材でも、デザインシステムを替えると、別の動画になるってことです。

Jayさん

if you’re just going to prompt Claude generically, then you’ll probably be disappointed. What you first need is a real design system that is attuned to whatever your use case is.(12:02)

訳: 汎用的にClaudeへ指示するだけだと、たぶん失望する。まず必要なのは、用途に合った本物のデザインシステムだ。

ここからが、私の場面です。私の手元には、静かな語り動画を作るスキル(shizuka-video)があります。plan.json というファイルに、章ごとの絵の指示、字幕、読み上げ文を書くと、絵、声、字幕、合成まで一括で動きます。

build.py は126行でした(2026年9月30日に wc -l で数えています)。

違うのは、絵の作り方です。私の絵は、画像生成AIに頼んで作っています。コードで描いているわけではありません(描く型と切る型を書いた記事)。Jayさんのデザインシステムは、コードで動きを描く側にあります。

ただ、「頼む前に何かを置く」という所は似ています。私の plan.json は1本の動画の中身で、Jayさんのデザインシステムは、動画をまたぐ見た目の型です。役割は別物です。

ここで、私の読みを1つ足します。見た目の型を先に置く話に、私は「なぜその見た目か」の1行を足したいと思うんです。私が最初の1本で残したいのは、表面の文体ではなく、「なぜそうするのか」という判断軸と、体験の物語です。

だから私なら、見た目の型と一緒に、なぜその見た目なのかを1行書いておきます。これは私の読みで、Jayさんの話ではありません。

見た目を3行で書く 好きな動画を1本選んで、色・字体・動きを1行ずつ書き出します。1行ずつ書けたら終わりです。10分あれば書けます。

04

Step 3「見て直す」。1回目は80%くらい。直した学びを、スキルに焼き込む

1回目の仕上がりを見て、直しメモを書いて直し、直した学びをスキルに残して次の依頼へつなぐ循環の図解
動画キャプチャ: 「Step 3: direct」のスライド。フィードバックを返して、/animate のスキルを直したり更新したりする、と書かれている(14:40頃)
動画キャプチャ: 「Step 3: direct」のスライド。フィードバックを返して、/animate のスキルを直したり更新したりする、と書かれている(14:40頃)

Step 3は、ディレクション(演出)です(12:28)。Jayさんは、Step 1と2は1回の頼みで、時には8〜9割まで行く、と言います(14:29)。ただし、1回目は、たぶん80%くらいまで、とも話しています。

Jayさん

You’ll probably get to 80% there, but for you to actually polish it, you need to get to step three, which is about directing and actually looking at the beats and all of the animations that it made…(12:26)

訳: 80%くらいまでは行く。でも磨き込むにはステップ3、つまり演出として、ビートと作られたアニメーションを実際に見ることが必要。

例が1つ出ます(12:38)。ある動画の中に、Claudeのデザイン用の画面を足したい場面です。1回目の版は、線画のアニメで始まっていました。Jayさんは、実際の画面を見せたほうがもっと良くなる、と考えて直しました(13:03)。

2回目の版には、見慣れた画面が出ます(14:04)。

直し方は、動画の好きな位置にコメントを付けて、Claudeへ1回で送る形です(13:52)。その中身は、次の章で書きます。

そして、一番大事な一手は最後に来ます。

Jayさん

all the learnings in that particular session, all your feedback that you sent, will now be codified into this /animate shortcut.(14:54)

訳: そのセッションで得た学びと、送ったフィードバックの全部が、この /animate ショートカットに落とし込まれる。

そのセッションで出した見た目の決めごとと、送ったフィードバックの全部を、/animate のスキルに入れる。すでにスキルがあるなら、スキルの作り方の決まりに沿って更新する(15:07)。

そうすると、スキルが好みに合わせて磨かれていくってことです!

私の場面は、ここと重なります。今西さんの動画の話を、私は前の記事でこう要約しました。スキルにした60点は、そのまま量産されてしまう。私の結論は「60点のままスキルにしない」です(60点のままスキルにしない記事)。

1回分を手で直し切ってから、スキルにする。スキルにした60点は、受け取る全員に、同じ60点を届けてしまうからです。

Jayさんの学びの置き場は、/animate が中心です。私の場合は、「作り方が決まる前に作らない」という指摘を、3月17日から9月27日までに7回しています。ルールの記録には、こう書いてあります。

注意書きはメモリにあったのに、毎回読まれる場所になかったから、くり返した。それで、その日付と私が言った原文を、読まれる場所のルールの置き場へ書き込みました。2026年10月1日に数えると、その置き場は15項目、文書11本です。

違いは、直す対象です。Jayさんが直すのは「動画の見た目」。私が直すのは「作り始める前の進め方」。どちらも、直した学びを次の依頼に残す、という点は同じです。

時刻つきの直しメモを3つ付ける 1回目の仕上がりを通して見て、直したい所を時刻つきで3つ書きます。「1:20 字幕が長い」くらいで足ります。10分です。

05

直しは時刻つきで書いて、まとめて返す。窓口を1つにしておく

時刻つきの直しを3つ書き、窓口に集めてまとめてClaudeへ送るじょうごの図解
動画キャプチャ: 編集画面で、動画の1か所に印を付けてコメントを入れる場面。台本とコメント欄、時間軸が並んでいる(13:50頃)
動画キャプチャ: 編集画面で、動画の1か所に印を付けてコメントを入れる場面。台本とコメント欄、時間軸が並んでいる(13:50頃)

Jayさんの直し方の中身を、もう少し見ます。カットの手直しにも、同じ画面が出てきます(7:25)。Jayさんたちが作っているRubric Editorという画面で、クリップごとにカットの位置を直す。

直した所はコメントとして残して、まとめてClaudeに送る。そのコメントでスキルを校正して、次のカットの精度を上げる、という流れです。

Step 3も同じ形です。動画の好きな位置にコメントを付けると、その場所の時刻が一緒に記録されます(13:28)。コメントを全部コピーして、Claudeへ1回で送ります(13:52)。

チャットで直接伝えても動く、とも話しています(13:16)。

ここで、私の読みを書きます。この作りの良い所は、直しの窓口が1つで、1件ずつ時刻がついていることだと思うんです。あとで「どこを何回直したか」を数えられます。

私が7回の指摘を数えられたのも、日付と私が言った原文を、記録に書き込んであったからでした。窓口の形は違っても、直しを数えられる形で残す所は、同じ向きです。これは私の読みで、Jayさんの話ではありません。

直しの窓口を1つ決める 直したい所を書く場所を、メモ帳でもスプレッドシートでも1つ決めます。1行目に時刻か日付を書けたら、窓口はできあがりです。5分で作れます。

06

Step 3が一番大事。型にする順番を決める

Step 1とStep 2は自動で通し、人の時間はStep 3の見る作業に回す天秤の図解
動画キャプチャ: 「3 STEPS」のスライド。Step 1: cut、Step 2: animate、Step 3: direct が横に並んでいる(15:30頃)
動画キャプチャ: 「3 STEPS」のスライド。Step 1: cut、Step 2: animate、Step 3: direct が横に並んでいる(15:30頃)

Jayさんは、Step 1と2は自動に任せて、1回の頼みで、時には8〜9割まで行く、と言います(14:16)。Step 3の「見て直す」が一番大事、とも言います(14:39)。人の時間が集まる場所も、そこだと私は読みます。

ここから私の読みです。型にする順番も、この重さに合わせるのが自然かな、って思うんです。まず Step 1 と 2 を、1回の頼みで通る形にする。人の時間は、Step 3に回す。スキルにするのは、直した学びがたまってからです。

私の9月27日のリールでも、人の私に残ったのは「見て決める」所でした。切る所は、1行の依頼からAI秘書の凛ちゃんが走っています(リールを1本作った記事)。

Jayさんの動画は、最後に /animate のスキルへ学びを入れて終わります(14:54)。Jayさんは、見た目の型を先にスキルにして、直した学びは最後に /animate へ入れます。

直したあとに型へ入れる所は、私の順番と同じ向きです。違うのは、見た目の型を先に置く所です。

学びを1つだけ残す 時刻つきの直しメモ3つのうち、次の動画でも使えそうな1つを選びます。それを、次の依頼の先頭に1行で置きます。5分です。

FAQ

よくある質問

Q. Sonnet 5.5で動画編集をするには、何をしますか?

A. 動画では、Claude Codeに生の映像のパスを渡して、文字起こしと切り出しをさせます。見た目は、別に用意したデザインシステムをスキルにして呼び出します。画面には、文字起こしのAssemblyAIと、書き出しのffmpegが出ていました。

Q. 3ステップの順番は?

A. Step 1がカット、Step 2がアニメ化、Step 3がディレクションです。動画の章は、4:44・8:44・12:28から始まります。

Q. 汎用のプロンプトだと、何が困るのですか?

A. Jayさんは、Sonnetのデフォルトの見た目は、多くの人が避けたがるAI量産のスロップにすぐなる、と言っています。そのため、先に用途に合ったデザインシステムを用意する流れです。

Q. 直した学びは、どう残しますか?

A. 動画では、デザインシステムとフィードバックを送ったセッションの中で、Claudeに /animate スキルへまとめさせます。すでにスキルがあれば、スキルの作り方の決まりに沿って更新して、磨き続けます。

Q. この記事の筆者は、Sonnet 5.5の3ステップを試しましたか?

A. いいえ。私が1行で頼んで、AI秘書の凛ちゃん(Opus 5.5)が動画を切ったのは、9月27日のリールまでです。静かな語り動画のスキルは、設計図までが私の手元にあります。Sonnet 5.5の /animate の工程は、動画の内容を整理した紹介で、私の検証ではありません。

MATOME

まとめ。次の一歩は、手元の動画を1本選んで、3行メモを書くこと

この動画の持ち帰りを、順に書きます。

1つ目。動画編集のAI化は、切る・見た目を決める・見て直す、の順に分けて読める。私のリールは、切るところが中心でした。

2つ目。汎用の頼み方だと、AIっぽい見た目に揃う、とJayさんは言います。見た目の型を先に置くのは、私の plan.json とは役割が別です。似ているのは、頼む前に何かを置く所だけでした。

3つ目。1回目は80%くらい。直した学びを、次の依頼に残すまでが1セットです。私の言い方だと、1回分を手で直し切ってから、型にする。

動画編集をAIに任せるなら、先に決めるのは、どこまで任せて、どこから人が見るか、です。

Sonnet 5.5の3ステップを、全部やる必要はありません。今日は、1本だけで十分です。それでいいんです!

あなたの手元の動画のうち、切る所と絵を足す所が、一番はっきりしているのは、どの1本ですか?

COLUMN

直しの場面に、私はいませんでした。選んだのは別の1つだけ

直すのはAI、選ぶのは私。作るボタンと作らないボタンを前にしたひろくんと、フィルムを持つAI秘書のコラム図解

Jayさんの Step 3 では、人が動画を見て、時刻つきのコメントを書いて、Claudeに返します。私の9月27日のリールで、私がしたことは違いました。

22時24分に1行送って、翌朝8時42分に「60秒以内の短い版も作る」を選んで、9時1分に投稿先を伝えて、9時17分に「両方公開する」を選びました。答えたのは3回です。つなぎ目4か所の直しは、その間にAI秘書の凛ちゃんが自分で見つけて直していました。私は、直しのコメントを1つも書いていません。

「味見は卒業しない」は、私が言葉にした考え方です。味見の粒度は固定しません。個々の成果物は、分身AIが判断して、味見して、直すところまで走る。私は、その判断の置き方と、自分の反応を、一段上から味見する。2026年8月7日に、そう言葉にしました。リールを動かしたのはAI秘書の凛ちゃんで、分身AIとは別です。ただ、直しを私が全部書かなくていい、という考え方は同じ向きです。

直しの場面に、私はいませんでした。私が選んだのは、「60秒以内の短い版も作る」かどうか、だけです。3分後の8時45分に、57秒版が届いています。

だから Step 3 を私の言葉に直すと、「見て直す」は人が直すことではなく、誰が見て、どの粒度で直すかを決めることなのかなって。これは私の読みです。

ミスをその日のうちにルールへ落とした話は、分身AI日記の「AI秘書がルールを作った翌日、また同じミスをした話」にも書いています。

👉 分身AIについてもっと知りたい方は分身AI.comもチェックしてね!

LINK

関連記事

REF

参考リンク

📺 今回紹介した動画

タイトルTurn Claude Into a Video Editing GENIUS (in 3 simple steps)
チャンネルJay E | RoboNuggets
公開日2026年10月2日
長さ15分46秒
URLhttps://www.youtube.com/watch?v=uaVYHiF8f7k

🎁 無料プレゼント

Aiport(ClaudeCode AIエージェント実践会)

ClaudeCodeでAI秘書+分身AI+AIカンパニーが無料で作れるキット&解説動画をプレゼント!

▶ 無料で入会してキットを受け取る

🤖 AI生成コンテンツについて

この記事はAIツール(Claude Code)を活用して制作しています。構成・文章生成にAIを使用し、最終的な内容の確認・編集・公開判断はひろくん(田中啓之)本人が行っています。「分身AIひろくん」(bunshin-ai.com)とは別のコンテンツです。

この記事が気に入ったら、シェアをお願いします

この記事で学んだことを誰かに教えて恩送りして学びを深めよう!

XLINEはてブ

関連記事