WATCH REPORT

AI音声ElevenLabsのEleven v4は、
日本語の数字をどう読むか。動画の実演で確かめた

2026.09.30

家事と子育てのスキマで経営する3方よしAI共創コンサルタントの田中啓之、ひろくん(@passion_tanaka)です。今回は、YouTubeでAIツールを紹介しているゲボクさんの動画から、ElevenLabsの新モデルEleven v4の日本語と、ボイスクローンの作り方を紹介するね。

テーマは「AI音声が見分けのつかない水準に来た今、声を複製するとき、どこで立ち止まるか」。動画の語り手は、ゲボクさん。冒頭の声は生成だったと、自分から種明かしします。この記事では、動画で実演されたことと、ゲボクさんの感想と、私の読みを、章ごとに分けて書きました。ElevenLabsは、私も講座動画の音声や、声のクローンで動画を自動で作る流れで使ってきました。その記録は、過去の自分の記事から、日付つきで引いています。

3行でわかるポイント

  1. ゲボクさんは、Eleven v4の日本語を「自然」と評価した。ニュース原稿を読ませ、抑揚も数字の読みも自然だったと話し、括弧のタグで感情や口調も指定できると実演します
  2. ボイスクローンは、インスタントなら30秒の録音で作れた。プロフェッショナルは有料プランが必要で、本人確認の読み上げ認証があります。ゲボクさん自身は、インスタントを「ちょっと補正は入っている」と感じた、と話します
  3. 私の読みは、複製が簡単になるほど、決めるのは「誰の声として出すか」だということ。自分の声の複製で確かめたことと、ElevenLabsを使ってきた過去の自分の記事も引きました。最後に、概要欄へ入れる「AI音声を使っています」の1行を書く一手を置いています

MY ELEVENLABS RECORD

私が実際にElevenLabsで作っている記録は、こちらに書いています

「講座動画のナレーションは、ElevenLabsで作っています。私の声のクローンと、AI秘書の凛ちゃんの声で、台本を1行ずつ読ませる形です。」

「同じElevenLabsの新しい版、v4 Turboに替えています。」(2026年9月30日の記事)

ElevenLabsとGemini 3.8 TTS。自分の声で5本聴き比べた記事を読む

この記事の動画は、ゲボクさんの実演です。私の記録は、章の中でも引いています。

AIの「今」を毎日シェアしてる無料コミュニティやってます

GPTs研究会に参加する(無料・8,900名突破!)
01

「もう音声生成で見分けがつかなくなりました」——冒頭の声が生成だと、動画は自分から明かす

冒頭の声が生成だと明かされる、人の声とAI音声の波形と種明かしの図解
動画のキャプチャ: 冒頭、ゲボクさんが話す場面。画面下にチャンネル名「AI様の下僕」
動画キャプチャ: 冒頭、声が生成だと明かす場面(0:34頃)

動画は、ニュース原稿の読み上げで始まります。続いて、関西弁の炊飯器のコント。29秒で「こんにちはこんばんはゲボクです」と名乗る声が入ります。その声が、こう言うんです。

動画の声

「もう音声生成で見分けがつかなくなりました」(0:31)

3秒後に、動画が「この声も」と明かします。

動画の声

「おっとちなみにこの声も音声生成AIなんですが」(0:34)

冒頭は、生成した声だった、ということ。41秒で「ここからは」自分が話す、と切り替わります。動画の内容は、ElevenLabsから待望の新モデル、Eleven v4がリリースされたって紹介です。

ゲボクさんの説明では、公式のアナウンスは前日の夜11時。

ここで、公式側の情報を足しておきます。ElevenLabs公式ブログによると、Eleven v4は2026年9月28日の発表で、90を超える言語に対応します。私が確かめられたのは、ここまで。

日本語の自然さそのものは、公式ブログには書かれていません。日本語の自然さは、この動画の実演から見ていきます。

動画の中で、私がいちばん注目したのは、種明かしの順番です。見分けがつかなくなった、と言ってから、声が生成だったと明かす。ゲボクさん本人は、見分けがつかない水準になった、と言っています。

動画の流れは、この章のあとも同じ形で進みます。ゲボクさんはプロフェッショナルボイスの声を流したあと、「この声も生成した音声です」と、また自分から明かしている。11分52秒の場面です。

生成した声を使うことと、使っていると伝えることは、別の作業です。ここは、私が動画から受け取った読みです。

声の棚卸し。手元にある動画か配信の音声を1つ選び、「本人の声」「生成した声」を1行ずつ書き分けます。書き分けられたら完了です。生成の声があったら、見る人に伝えているかどうかも、そのまま1行足しておきます。

02

「それでも日本語は不自然なことが多い」——Eleven v4は日本語の数字をどう読むか

ニュース原稿の数字を読み上げる、原稿から音の波が出る図解
動画のキャプチャ: Eleven v4に読ませる図書館オープンのニュース原稿
動画キャプチャ: 読ませたニュース原稿の画面(3:19頃)

1分43秒。ゲボクさんは、なぜEleven v4を試すのか、動機を話します。視聴者にはクリエイティブ系が多く、SeedanceやMiniMaxで演技をさせてきた。

でも、日本語の演技は、こんな状況だったそうです。

ゲボクさん

「それでも日本語は不自然なことが多い」(1:43)

その不自然さが、新モデルで変わるかもしれない。その期待から、使ってみるって流れです。使い方は、ElevenLabsにアクセスして、右上からGoogleアカウントでログインするだけです。

ゲボクさんによると、無料プランでも最新のモデルは試せます。ただし商用利用はできません。

デモは、ニュース原稿です。図書館のオープンを伝える、短い原稿。開館時間、蔵書の冊数、初日の来館者数、予想を上回った割合まで、数字が並びます。読み終わったあとの感想が、こちら。

ゲボクさん

「自然な日本語で抑揚もしっかりね」(3:19)

続けて「数値も綺麗に読み上げてましたよね」とも話しています。生成される音声は毎回2種類。聞き比べて、好きなほうを選べばいい、という運用です。

v3は、私も実際に使ってきました。2026年3月のNotebookLM動画講座の作り方の記事に、講座動画の音声は「ElevenLabs V3の感情タグ付きTTSを使っています」と書いています。

工程表には、音声を私とAI秘書の凛ちゃんで6本ずつ作ると書き、FAQには、それぞれのカスタムボイスを使ったと書いています。

FAQの問いと答えは、こうです。「動画の音声はAIですか?」に、「はい。ElevenLabs V3の感情タグ付きTTSを使っています」。

続けて、「それぞれのカスタムボイスで、感情に合わせた抑揚がつきます」と書いています。3月時点の私の答えは、v3でした。

同じ3月のLIVEでは、高崎さんの実体験も聞いています。

Remotion×Claude Codeの回の記事に、高崎さんが「最新バージョンがまだ全然不安定なので、日本語を3分以上作ると」と話した場面が残っています。

長い日本語で、同じ言葉が続けて出てしまう現象です。これは私が確かめた話ではなく、高崎さんの実体験として書かれたものです。

動画のv4は、ニュース原稿を、抑揚も数字も自然に読んでいました。3月の不具合が、v4で3分以上の日本語でどうなるかは、私は確かめていません。

v3のあと、私の講座のナレーションは、v4 Turboに替えています。ElevenLabsとGemini 3.8 TTSを、自分の声で聴き比べた記事の冒頭に、こう書きました。

「講座動画のナレーションは、ElevenLabsで作っています。私の声のクローンと、AI秘書の凛ちゃんの声で、台本を1行ずつ読ませる形です。」。続けて、「答えは、乗り換えないでした。

同じElevenLabsの新しい版、v4 Turboに替えています」とあります。2026年9月30日の記事です。

同じ記事は、聴き比べのまとめを、こう書いています。「読み間違いの差はほぼ無し。決め手は声でした」。切り替えの手間については、「変えたのはモデル名の1行だけでした」。

動画のゲボクさんは新しいモデルを試す側、私の記事は、自分の講座で使い続ける側の記録です。動画の実演と、私のこの記録は、別々に読んでください。

読み合わせの400字。自分の台本の冒頭400字を1本選び、数字が入った箇所を含めて音声にします。読み違えた箇所を数えて、メモに残します。10分。

03

「同じモデルでも声優のような喋りを生成することができる」——タグは台本の演出

台本の行頭に感情のタグを付けて音の波が変わる図解
動画のキャプチャ: 感情タグの一覧表
動画キャプチャ: 感情やトーンを指定するタグの一覧表(4:10頃)

3分48秒。ゲボクさんは、口調の調整に話を進めます。ElevenLabsでは、タグと呼ばれる括弧の指示が使えるんです。

ゲボクさん

「括弧で感情とかトーンを指定してあげると」(4:01)

ゲボクさん

「同じモデルでも声優のような喋りを生成することができるんですよ」(4:06)

タグの一覧は、ゲボクさんがレポートにまとめて、概要欄のURLで公開しています。動画の画面には、感情や口調のタグが、いくつかの分類で並んでいました。詳しい一覧は、概要欄のGitHubで見られます。

実演は、感情を切り替えていく短い台本です。信じられない気持ちから始まって、怒り、悲しみ、笑い、最後は優しく「おかえり」。ゲボクさんは、短い文の中にも、いろいろな感情を入れてみた、って話してるんです。

画面のプロンプトでは、英語のタグの後ろに、日本語のセリフが続く形でした。

たとえば「遅いよ」の前には、怒りで声が震えるような指定が入る。泣くのをこらえながら、怒ったふりをする、という複合の指定も画面に見えました。動画の中で確かめられるのは、この形です。

5分30秒。感情を切り替える台本の生成音声を聞き終えたゲボクさんは、こんな感想を口にします。

ゲボクさん

「AIのガチ恋勢っていうのがガンガン増えてくるんじゃないかなと思っちゃいます」(5:30)

ここは、ゲボクさんの感想です。動画で確かめられたのは、感情のこもった声が生成できた、というところまで。ガチ恋勢が増えるかどうかは、動画の中の見立てになります。

公式ブログにも、タグの例が載っています。ElevenLabs公式ブログでは、笑い声や、怒った言い方の指定が例に挙がっていました。日本語のタグ例までは、確かめていません。

私がこの章で持ち帰ったのは、タグを付ける作業の位置づけです。タグって、機械の設定ではなく、台本の演出なんです。どこで怒って、どこで泣いて、どこで優しくなるか。それを決めるのは、台本を書く人なんです。

私も、感情タグを台本の演出として使ってきました。

Claude Codeで作るAI秘書チーム自動化の記事には、分身AIとAI秘書が、記事のあとのポッドキャスト動画まで作る流れを、「ElevenLabsという音声AIで感情タグを入れて、ひろくんの声と凛ちゃんの声で会話形式に仕上げる」と書いています。

3月のRemotionの回の記事には、「感情タグ(excited、calm、whispersなど)は、日本語でも使えるんですよ」とも書きました。

この動画のタグも、英語のタグの後ろに日本語のセリフが続く形でした。

v4 Turboでのタグは、私も確かめています。聴き比べた記事に、こう書きました。「感情タグも確かめました。

[surprised] のようなタグが付いた8行をv4 Turboで作って、文字起こしにかける。タグを文字として読み上げた行は0でした」。動画のv4そのものではなく、私の講座の台本での確認です。

同じ記事には、ブログ記事を声にした話もあります。「私も分身AI日記で、記事を声に変えて公開しました。台本を23パートに分けて、パートごとに感情のタグを付けて、3分11秒の音声にしました」。

タグを付ける作業が、そのまま台本の演出になる、という実例です。

タグの考え方は、Googleの音声でも同じです。2026年4月の生成AIアップデート速報に、Gemini 3.1 Flash TTSの話を書きました。

台本に感情タグを書き込むと、「そのトーンで話してくれる」。タグの例は、「ささやくように(whispers)」と「力強く(determined)」です。

タグで声色を指定する流れは、ElevenLabsだけの話ではありません。

タグを何個まで付けるかは、動画では語られていません。ここは私の提案で、最初は3個までに絞ります。多すぎるとどうなるかは、私は確かめていません。

タグは少なめに(私の提案)。自分の台本から短い1文を選び、感情のタグを3個まで付けて読ませてみてください。聞き比べて、外れたタグを1つ消す。2周できたら完了です。

04

「同じセリフを使って生成されるニュアンスを比較していきたい」——Eleven v4、Seedance 2.0、MiniMax H3を同じ実況で聞き比べる

同じ実況の台本を3つのスピーカーに読ませて聞き比べる図解
動画のキャプチャ: 同じ実況を読ませて作った、ヘッドセット姿の実況者のアニメ映像
動画キャプチャ: 同じ実況で作られたアニメ映像の場面(6:31頃)

5分45秒。ここからは、モデルの比較です。ゲボクさんは、こう切り出します。

ゲボクさん

「同じセリフを使って生成されるニュアンスを比較していきたい」(5:45)

次は、モデル比較。Eleven v4、Seedance 2.0、MiniMax H3に、同じセリフを読ませて、ニュアンスを比べます。セリフは、感情を込めたスポーツ実況。

ゲボクさんは、実況は難しいと思ってるから、この題材にしたって話します。映像つきで15秒を超えるとクレジットが厳しくなるので、一部分だけを使う、とも説明してるんです。

MiniMax H3、Seedance 2.0、Eleven v4の順で、実況が流れます。私が動画を見て確かめられたのは、この順番と、同じセリフを使ったこと。

どのモデルがいちばん良かったか、という結論は、動画の中で語られていません。文字起こしにも、途中に欠けている部分があります。だから、この記事にも、優劣は書きません。

その代わり、比較の作り方から持ち帰れることがあります。同じセリフを使う。使う範囲は一部分に絞る。ここまでは、動画の実演のとおりです。

ゲボクさんは、実況の声にEleven v4を使うとき、自分のボイスクローンを使ったと明かします。比較の最後に出てきた声は、ゲボクさん本人の声の複製だった、ということ。

となると、モデルの違いと、声の違いが混ざる可能性があります。これは私の推測で、動画では触れられていません。次の章で、その作り方を見ていくね。

聞いた人が感じる自然さは、数字では測れません。比べるなら、聞き比べの基準を先に書いておくのが、私の提案です。

基準は、3行で足ります。「名前と数字を読み違えないか」「セリフの切れ目で息が続いているか」「感情のタグが、聞いて分かる形で出ているか」。この3行は、私の提案で、まだ試していません。

聞き比べの基準3行。同じ1文を2つのモデルに読ませ、聞き比べの基準を3行で書き出します。15分。基準を先に書いてから聞くのが、コツです。

05

「めちゃくちゃ簡単すぎると思うんですが」——30秒で作る声と、認証がいる声

録音から声の複製へ進み、認証の扉の前で止まる図解
動画のキャプチャ: ボイスクローンの Verify your voice 画面
動画キャプチャ: 声の複製で認証(Verify your voice)を求められる画面(11:31頃)

6分59秒。ボイスクローンの手順に入ります。で、画面の左側で「Voices」を選び、「Create Voice」を押す。クローンは2種類で、インスタントとプロフェッショナルです。

ゲボクさんは、まずインスタントを選びました。

手順は、こうです。録音かアップロードかを選ぶ。今回は録音で、30秒間、ゲボクさんが話しかける。背景ノイズがあれば「Remove background noise」にチェック。

で、名前を付けて、言語やアクセント、性別、年齢のラベルを選び、説明文を入れて保存。

ゲボクさん

「めちゃくちゃ簡単すぎると思うんですが」(9:23)

保存の画面には、権利と同意の確認文が出ていました。ElevenLabsの利用規約や、禁止事項のポリシーに触れた文です。作るときは、この確認を通ります。

公式ブログ側の数字も、書いておきます。ElevenLabs公式ブログによると、インスタントボイスクローンは10秒の音声でも声を捉えられる、と説明されています。動画の実演は30秒。

この差は、私には理由が分かりません。ゲボクさんは30秒で録音したので、この記事は、動画の実演に合わせて書きます。

プロフェッショナルボイスクローンは、条件が増えます。ゲボクさんの説明では、有料プランに入っていないと使えません。有料プランでも作れるのは1つで、2つ以上ならビジネスプラン以上。

音声は30分以上がおすすめ。ゲボクさんは、最近のポッドキャストの、自分だけの音声データを使いました。

11分14秒。音声のアップロードが終わると、認証のステージに変わります。そこで、こう話します。

ゲボクさん

「まあこのあたりは悪用されかねないですからね」(11:21)

ElevenLabsがランダムで表示する文字を、読み上げる必要があります。ゲボクさんの言い方は、悪用されかねない部分だから、というものです。完成まで、長いと6時間ほど。今回は数十分でした。

悪用の線は、私も何度か書いています。2025年2月には、ただっちさんとのLIVEを声をクローンしてみたら、笑いもバグも出てきた音声AIの話にまとめました。ただっちさんは、こう話しています。

「ファイル音声もアップロードできるので、本当は悪用厳禁ですよね」(9:07〜)。続けて、有名人の方が喋っている音声も上げられてしまう点にも触れています。

2026年9月のv4 Turboの記事でも、私はこう書いています。「くれぐれも悪用厳禁です。声のクローンは、本人の同意がある声だけに使います。他人の声を勝手に作らず、誰かになりすまして使わない」。

記事には、ElevenLabsの利用規定の一文も引いています。

「Do not engage in unauthorized, deceptive or harmful impersonation.」、和訳は「許可のない、人を欺く、または害をおよぼす、なりすましをしないこと」です。

同じ記事で、私の声の使い分けはこう書いてあります。「私の役は私の声のクローン。AI秘書の凛ちゃんの役は、凛ちゃん用に決めた声です」。私の声は、私の同意で作ったクローン。

AI秘書の凛ちゃんの声は、凛ちゃん用に決めた声。同意の線は、この2つで分けています。

私がElevenLabsの声のクローンを使ったのは、今回が初めてではありません。2026年3月のLIVEで、私は自分のパイプラインをこう話しました。

Remotion×Claude Codeの回の記事によると、流れは「Sora2で映像、ElevenLabsで私の声、Remotionで編集と字幕、そしてYouTubeに自動アップロード」です。

LIVEの中の言葉は、「寝てる間に私の声のクローンが動画を作ってアップしてる」でした。

声の悪用は、それより前から気にしていた点です。2025年11月10日の朝LIVEで、私はこう話しています。「そういうAIが一般的に使われるようになってくるのがもう間近だと思うんでね」。

そう話したうえで、怖さの中身は詐欺だと言い、「本当に悪用されると怖いなってとこありますよね」と続けています。この日は、ElevenLabsのAI音声エージェントを作る回でした。

ElevenLabsで音声AIエージェントを作って遊んだ日のコラムに、私は「ElevenLabsのエージェントに既存のボイスを選んで乗せ、応答をテストするところまで触ってみた」と書いています。

この日のLIVEの記事は、最後をこう締めています。「次にElevenLabsを触るときは、私自身の声でエージェントを作って、実際に誰かに電話をかけてもらう実験も」。

そのあとに、素直にやってみたい、と続けています。これは当時の希望で、実験の結果ではありません。

2026年9月には、GoogleのGemini 3.8 Flash TTSの音声複製機能でも、自分の声の複製を作りました。

AI秘書の凛ちゃんが、API経由で試した4回は、どれも「同意の録音と声の材料が同じ人に聞こえない」という判定で通りませんでした。AI Studioの画面から、私が自分で作った1回だけが通りました。

作った複製音声の高さは100Hzで、私の録音は102Hzでした。

この実測から言えるのは、ここまでです。ElevenLabsではなくGoogle側の機能の話ですが、簡単に作れる声の複製にも、同じ人の声かを確かめる関門が働く例を、私は自分で見ました。

判定の理由は、記録に残っている文言以上のことは分かりません。

複製する声を決める。複製したい声を「自分の声」「同意のある声」の2つに絞って、紙かメモに書いてみてください。5分で足ります。同意のある声は、誰の声を、いつ、どこまで使っていいか、を1行ずつ足すところまで。

06

「ちょっとなんか補正は入っている」——似ていることと、本人の声であることは別

似た声と本人の声が天秤で釣り合わない図解
動画のキャプチャ: Speech画面に並んだタグ付きの台本
動画キャプチャ: タグ付きの台本をSpeech画面に入力した場面(10:11頃)

9分34秒。作ったインスタントボイスで、ゲボクさんは、サポート窓口の会話を生成します。「お電話ありがとうございます。製品サポートの森です」。

生成された声が流れたあと、視聴者に向けて、自分の声はクローンできていると思うか、と問いかけます。そして、自分の印象を、こう話しました。

ゲボクさん

「ちょっとなんか補正は入っている」(10:03)

ゲボクさん

「発声とか抑揚はねバッチリだと思います」(10:08)

ゲボクさんの評価は、2つに分かれてるんです。補正は入っている、という印象。発声と抑揚は、バッチリという印象。

「補正は入っている」が何を指すのかは、動画では説明されていません。ゲボクさんの感想です。私には、本人の声かどうかを、機械で測った数字は動画から分かりません。

聞いた視聴者の反応も、動画の中には出てきません。

ここから先は、動画の話ではなく、私の読みです。

複製が似ているかどうかは、耳で確かめられます。でも私は、声にはテキストにないものがたくさんあると考えています。「言霊というか響く」。私の言葉では、そう答えています。

響きは、似ているかどうかだけでは決まらないのかもしれません。

別の答えもあります。「愛している人の声を聞いてホッとした」。私にとっての「響く」には、声そのものだけでなく、その声の人を愛している自分の想いもある。ここから先は、私の仮説です。

同じ声でも、誰の声として聞くかで、響き方が違うのかな。似た声にホッとする部分はあっても、本人が話していると受け取るときとは、違いがあるかもしれません。仮説なので、確かめた話ではありません。

ここまでは、聞く人の受け取り方の話で、仮説です。

この向きの考えは、以前の記事にも残っています。ElevenLabsのエージェントを触った日のコラムに、私は「声はその人そのものだと思っている」と書きました。

続けて、「声を複製するということは、中身が空っぽのままだと、本当に空虚なものになる」とも書いています。2025年11月10日に公開した記事の記述です。

ここからは別の話で、私の提案です。本人の声として出していいかどうかは、声の持ち主が決めるものだと考えています。似ているかどうかを判断するのは、聞いた人。出していいかを決めるのは、持ち主です。

私がここで確かめたいのは、複製の精度ではありません。複製した声を、聞いた人が、どう受け取ったか。似ているかどうかを聞くと、聞かれた人は、比べる聞き方になります。

どう聞こえたかを聞くと、その人の受け取り方が出てきます。

聞いた人の感想を1つ。自分の声の複製を、家族か身近な人に1つ聞かせ、「似てる?」ではなく「どう聞こえた?」って聞いてみてください。10分で足ります。聞いた感想は、そのまま1行だけメモに残します。

07

「マジでわからないレベルにはなると思うんですよね」——見分けがつかないから、出し方を先に決める

動画の概要欄に一行の表示を書き込む図解
動画のキャプチャ: ゲボクさんの投稿「ElevenLabsで生成した声でしょうか」
動画キャプチャ: 「ElevenLabsで生成した声でしょうか」と問う投稿の画面(12:07頃)

12分11秒。動画は、まとめに入ります。ゲボクさんは、最後の仕掛けを打つんです。実はこの動画の音声は、全部ElevenLabsのモデルで生成しました。そして、12分24秒。

全部生成というのは、冗談です。ゲボクさんは「はい嘘です」と、その場で自分から撤回しています。自分から声が生成だと明かしたのは、0分34秒と11分52秒の2回です。

一方で、11分55秒には、こんな発言もあります。

ゲボクさん

「さすがにこの動画一本通してだとマイクも違うからわかりますかね」(11:55)

見分けられる可能性にも、ゲボクさん自身が触れているんです。そのうえで、まとめの言葉は、こうでした。

ゲボクさん

「マジでわからないレベルにはなると思うんですよね」(12:34)

活用の場面として、作品作り、クライアントワーク、オフィス系の窓口が挙がります。ElevenLabsはAPIを発行しているので、自分のツールに組み込みやすい、とも話してるんです。

ここまでが、動画で語られた話。

ここから先は、私の読みです。動画は、タグを使えば見分けがつかないレベルになる、と言います。見分けがつかない水準に来たとき、明かすかどうかは、出す側が先に決めるしかない。私は、そう受け取りました。

私は、AIが出す文章や声の、実行を任せることと、判断を手放すことは、別だと考えています。声のように、聞く人に届いてしまうものは、判断の側に人が残る。この考え方は、コラムにも書きました。

動画の実演のように、生成した声を使う場面は、これから増えます。そのとき、私が先に決めておきたいのは、次の点です。生成の声を使っていると伝えるか。誰の声を使っていいか。読み違いを、誰が最後に聞き直すか。

どれも、道具を選ぶ前に、人が決めておけます。

概要欄の1行は、その入り口として、いちばん軽いものだと私は思います。AI音声を使っています、と1行書くだけ。動画の冒頭で種明かしをするゲボクさんのやり方は、そのまま真似できる形なんです。

ただし、表示が義務かどうかは、私は確かめていません。

声のクローンで動画を自動で作って上げる流れは、私も2026年3月に話しています。だから、この章の問いは、動画のゲボクさんだけでなく、私の側にも向いています。

声を、どこに預けるか。この問いは、2026年のローカルAIが声を持つ日の記事にも書きました。「これまでの音声AIは、ほぼクラウド前提でした。

マイクで拾った声も、打ち込んだテキストも、いったんネット越しのサーバーへ」。ElevenLabsのようなクラウドの音声AIを使うとき、声をどこに置くかを決めるのも、出す側の判断です。

概要欄の1行。動画や配信の概要欄に入れる「この動画の一部はAI音声です」の1行を、自分の言葉で書いてみてください。5分で足ります!使わない場合も、使っていない、と分かる1行を書いておく手もあります。

ここで、動画の終わりの部分を、宣伝として1か所にまとめておきます。12分53秒から、ゲボクさんはチャンネルの紹介に入ります。

AIガジェットやAIツールの最新情報を発信していること、チャンネル登録と通知のお願い、動画が良かったときの高評価などのお願い。これが、動画末尾の宣伝です。

この記事で扱ったのは、その手前までの、動画で語られた話だけ。

FAQ

よくある質問

Q. Eleven v4は、日本語でも自然に読めますか?

A. 動画では、ゲボクさんが日本語のニュース原稿を読ませ、自然な日本語で抑揚もしっかりしていた、数字も綺麗に読んでいた、って話しています。

Q. ボイスクローンは何秒の録音で作れますか?

A. 動画では、インスタントボイスクローンを30秒の録音で作っています。ElevenLabs公式ブログには、10秒の音声でも声を捉えられると書かれています。動画と公式で、数字が違います。理由は確かめていません。

Q. 感情や口調は、どう指定しますか?

A. 動画では、括弧のタグで感情やトーンを指定していました。例は、怒りで声が震える、泣くような言い方、優しく、など。タグの一覧は、動画の概要欄のGitHubで公開されています。

Q. ひろくんは、ElevenLabsを使ったことがありますか?

A. 過去の記事に、次の記録があります。2025年11月は、ElevenLabsのエージェントに既存のボイスを選んで、応答をテストしました。2026年3月は、講座動画の音声を、ElevenLabs V3の感情タグ付きTTSで作りました。同じ3月のLIVEでは、声のクローンで動画を自動で作る流れも話しています。2026年9月30日には、講座のナレーションをv4 Turboに替え、感情タグの8行を確かめた記事も書きました。動画のようにEleven v4を新しく触った記録ではなく、自分の講座で使い続けている記録です。

Q. 他人の声を複製してもいいですか?

A. 動画では、プロフェッショナルボイスの認証で、ランダムに表示される文字を読み上げる必要があり、ゲボクさんは、悪用されかねない部分だって話しています。インスタントの保存画面にも、権利と同意の確認文が出ていました。何をもって複製してよいかの決まりは、私は確かめていません。私は、複製は自分の声と、同意のある声だけに絞る形をおすすめします。

Q. AI音声を使っていると、表示する義務はありますか?

A. 義務があるかどうかは、私は確かめていません。動画の中では、ゲボクさんが、冒頭と途中で、生成した声だと自分から明かしていました。私は、概要欄に1行書くところから始めるのが、いちばん軽い方法だと考えています。

MATOME

まとめ——声が複製できるほど、決めるのは「誰の声として出すか」になる

ゲボクさんは、Eleven v4が日本語のニュース原稿を、抑揚も数字も自然に読んだと評価しました。口調はタグで指定でき、ボイスクローンは、インスタントなら30秒の録音で作れた。

ゲボクさんは、自分の複製を「ちょっと補正は入っている」と感じつつ、発声と抑揚はバッチリだ、という評価でした。ここまでが、動画で語られた話。

ここからは、私の読みです。声が簡単に複製できるようになるほど、簡単にならないのは、その声を誰の声として出すか、という判断。

私の複製では、API経由の4回は、同意の録音と声の材料が同じ人に聞こえない、という判定で通らず、自分で作った1回だけが通りました。

似ていることと、本人の声として出していいかは、別の判断だと私は読みます。

持ち帰る一手は、概要欄の1行です。動画か配信を1つ選び、AI音声を使っていることを、自分の言葉で1行書く。書けたら、今日は十分です!

COLUMN

鍋は任せる、味見の舌は手放さない

台所で鍋を火にかけ、小皿で味見をするひろくんのコラム図解

動画の話は、ここまで。ここからは、本文で言いきれなかった私の話です。声の複製は、料理で言えば、鍋を回す作業。回す作業は、AIに任せていい。私は、運用上の判断も、味見も、修正も、分身AIに委ねています。私の役目は、毎回の皿を止めて合否を決めることではありません。判断軸と、その育ち方を、上から味見することです。

声も、同じ鍋の中にあります。声の複製は、鍋を回す作業。回すのは、AIに任せていい。ただ、どの声を鍋に入れるか、出来上がった声を誰の声として出すかは、味見の舌を持つ人が決める。これは私の提案で、声の運用としては、まだ実装していません。

声の話は、聞いた人が本人の話として受け取りやすい分野です。だから今回は、動画で語られたことと、私が確かめたことと、私の読みを分けて書きました。

味見の舌が要るのは、皿が出る直前だけではありません。鍋に何を入れるかを決める場面にも、要ります。声の場合は、どの声を材料に使うか。自分の声か、同意のある声か。ここを先に決めておくと、あとの作業は任せやすくなります。

料理は、火を入れる作業と、味を決める作業に分かれます。火を入れる作業は、鍋に任せていい。味を決める作業は、私の舌に残しておきたいんです。声の複製も、同じ分け方で考えています。これは私の提案で、まだ運用にはしていません。

同じ話は、分身AI日記にも書いています。「賢いAI」より「委ねるAI」だった、と気づいた日です。任せ方の話。鍋は任せる。味見の舌は、まだ自分の口の中にあります。分身AIの考え方は、分身AI.comにも書いています。

LINK

関連記事

REF

参考リンク

今回紹介した動画

タイトル【無料OK】日本人に特化したAI音声生成「ElevenLabs」が凄すぎる。
チャンネルAI様の下僕
出演ゲボクさん(動画内の自己紹介より)
公開日2026年9月29日(長さ 14:19)
URLhttps://www.youtube.com/watch?v=z6_62czjlIo

🎁 無料プレゼント

Aiport(ClaudeCode AIエージェント実践会)

ClaudeCodeでAI秘書+分身AI+AIカンパニーが無料で作れるキット&解説動画をプレゼント!

▶ 無料で入会してキットを受け取る

🤖 AI生成コンテンツについて

この記事はAIツール(Claude Code)を活用して制作しています。構成・文章生成にAIを使用し、最終的な内容の確認・編集・公開判断はひろくん(田中啓之)本人が行っています。「分身AIひろくん」(bunshin-ai.com)とは別のコンテンツです。

この記事が気に入ったら、シェアをお願いします

この記事で学んだことを誰かに教えて恩送りして学びを深めよう!

XLINEはてブ

関連記事