声をクローンしてみたら、笑いもバグも出てきた音声AIの話

家事と子育てのスキマで経営する3方よしAI共創コンサルタントの田中啓之、ひろくん(@passion_tanaka)です。今回はただっちが語った音声AI比較のLIVEを紹介するね。2月22日、土曜日の朝。いつもは誰かとの掛け合いが多いGPTs研究会だけど、この日は珍しく、ただっち一人だけの「一人ぼっちのライブ」。画面の向こうで一人黙々と、音声AIをいくつも動かしていく——そんな回でした。

テーマは音声AI。自分の声をAIにコピーさせて喋らせる「声のクローン」の実演を中心に、ゾノスというサービスと、ただっちが普段から使っているHeyGenを次々に試していく20分間でした。デフォルトの声にうっとりしたかと思えば、突然の笑い声バグに首をかしげ、悪用のリスクにも真顔で釘を刺す。放送事故でミュートになる一幕もありつつ、最後は「結局、音声入力が一番」という着地点にたどり着く……そんな、生々しい実験の記録です。

音声AI比較ライブは、まさかの一人ぼっちから始まった

音声AI比較ライブは、まさかの一人ぼっちから始まった
▶ 配信 0:24 時点の画面

▶ この話題を動画で見る(0:24〜)

放送が始まった瞬間、いつもと空気がちょっと違いました。2月22日、土曜日の朝。GPTs研究会の朝LIVEといえば誰かと誰かの掛け合いが定番なんですが、この日はコメント欄に呼びかける声だけが響く、静かなスタートでした。

ただっち(0:24〜)

「2月22日、土曜日。音声生成や進化ということで、比較ライブをやってみようと思っております。今日はですね、一人ぼっちのライブですので、ぜひコメントいただけたら嬉しいなと思います。」

一人ぼっちのライブ。この一言に、私はちょっとにやけてしまいました。誰かと盛り上がるのも楽しいけど、一人で黙々と道具を動かしていく回って、実はいちばん本音が出るんですよね。ユミさん、マリンさん、ショコたん……常連のみなさんに一人ずつ挨拶しながら、ただっちは淡々と準備を進めていきます。あ、そうだ。今日のテーマは音声AI。自分の声をAIに喋らせる、あの技術です。

ただっち(1:21〜)

「いいなというのは前々から思っていて、試しはしているんですけども、じゃあ新しいAI音声AIツールも関さんからですね、ご紹介いただきましたよ。そちらのご紹介と、じゃあ他のやつとサービスを比べてみてどうなのかというところを、今日はライブ配信をしていきますので。」

関さんから教わった新顔サービスと、いつも使っている道具。二つを並べて、その場でボタンを押しながら比べていく。うまくいったところだけ切り取った紹介動画とは、根っこから違うんだよね。台本なし、リハなし、一人だからこそ逃げ場もない。画面のこっち側にも、ただっちの手元の緊張感がそのまま伝わってきます。

正直に言うと、音声AIには前々からずっと興味がありました。自分の声を先に録っておけば、忙しい朝でも喋らなくていい瞬間が増える——そんな期待をずっと抱えていたからです。今日のライブは、その期待を関さんのおすすめと一緒に確かめていく回。ChatGPTの音声入力とはまた違う、「自分の声そのものを複製する」という一歩踏み込んだ話。だから私も、画面の前でつい前のめりになりました。

私自身、コンサルの現場で「AIに任せられるところは任せて、時間を生み出す」という話をよくします。今日のただっちのテーマも、まさにそこに重なっていました。声を扱う仕事をしている人にとって、この検証はきっと他人事じゃない。ただ触ってみるだけじゃなく、実際に自分の声を投げ込んで、その場でうまくいくかどうかを確かめる。飾らないこのライブ感こそ、今日いちばんの価値だと私は見ています。

ちなみに、ただっちは「一人で頑張るあなたの親友」というコンセプトでAI活用をディレクションしている人。配信の冒頭でも、AIで世界を平和にというテーマを掲げて、経営者や起業家さんの業務効率化や集客の自動化をAIでサポートしていること、生成AI導入支援のセミナーもやっていることを、いつも通りさらっと自己紹介していました。AIを活用して時間を生み出し、心のゆとりを作る——今日の音声AI検証も、その大きなテーマの入口に位置づけられているわけです。だから単なるツール自慢の回じゃなくて、「これで日々の発信が本当にラクになるのか」を等身大で確かめにいく回。私はそこにいちばん共感しました。

コメント欄には、いつもの常連さんたちが次々と集まってきます。一人で進める配信だからこそ、視聴者との距離もぐっと近い。声をかけられれば、その場で拾って答える。掛け合う相手がいなくても、コメント越しのやり取りがちゃんと配信のテンポを作っていました。さあ、いよいよ本題です。

ゾノスで声をクローンしてみたら、見た目からしてかっこよかった

ゾノスで声をクローンしてみたら、見た目からしてかっこよかった
▶ 配信 2:49 時点の画面

▶ この話題を動画で見る(2:49〜)

関さんが教えてくれた新顔は「ゾノス」というサービス。まず驚いたのは、見た目のかっこよさでした。よくあるチャット画面とはひと味違う、道具そのものにワクワクさせる作りです。

ただっち(2:49〜)

「見た目がかっこいいですよね、見た目からして。」

触ったばかりの道具を分かった風に語らない。この距離感、実演ライブとしてはすごく健全だなと思いました。でね、ゾノスの中身は「声のクローン」機能。自分の声をアップロードすれば、その声でテキストを読み上げてくれる仕組みです。まずはデフォルトの声から試してみることに。

ただっち(3:38〜)

「はい、こんな感じがですね。これはデフォルトの音声で結構いい声してますよね。でこれですね、僕の声で、ちょっと僕のこれ音声入力するとですね、ここにChromeViceというのがあるので、ChromeViceを入力すると自分の声がアップロードできるというものになっております。」

結構いい声。まずはそこに素直に感心する。そこから、耳には「ChromeVice」と聞こえたボタン(たぶん「クローンボイス」を早口で言った音だと思う)を押して、自分の声をアップロードする流れへ。マイクで直接録音するか、事前に用意した音声ファイルをドラッグ&ドロップするか——入口は二つ。声をクローンするって、言葉にすると簡単そうだけど、実際にボタンひとつで動く様子を見ると、なんだか妙な緊張感があるんだよね。次はいよいよ、自分の声を投げ込んでみる番です。

ゾノスという名前、配信の中でも呼び方が微妙に揺れていて、正直、私も正確な読み方には自信がありません。関さんのおすすめで初めて聞いた名前だったようで、ただっちにとってもほぼ初対面の道具。それでも、ボタンひとつひとつを確かめながら進めていく手つきに変な力みがなくて、見ていてこっちまで肩の力が抜けました。

デフォルトの音声を聞いた瞬間の「結構いい声してますよね」という一言。地味だけど、実はいちばん大事なポイントだと思うんです。自分の声を投げ込む前に、まず土台になる音声のクオリティを確かめる。料理で言えば、下味をつける前にまず出汁を味見するようなもの。出汁がしっかりしていれば、多少の調整でちゃんと美味しくなる。逆に土台が弱いと、どれだけ手を加えても物足りなさが残ってしまう。ここ、地味に効いてくるところなんだよね。

マイクで直接録音するか、ファイルをアップロードするか。この二択が用意されている時点で、いろんな人が使えるように配慮されている。忙しい朝にサッと録音する人もいれば、事前にしっかり録っておいた音声を使う人もいる。どちらの入口もふさがれていない——地味だけど、ここがありがたい設計なんだよね。

見た目のかっこよさに気を取られがちですが、私が気になったのはむしろ「日本語がデフォルトで通る」という点。海外発のサービスだと、日本語対応が後回しにされることも少なくないから。ゾノスは最初から日本語の選択肢が用意されていて、そこはやっぱり素直に嬉しいポイントです。

もっとも、ここまでの流れが全部スムーズだったわけじゃありません。事前に試した音声を再生しようとしたところ、うまく音が出なくて「音、聞こえてない?」と何度か確認し直す一幕もありました。「聞こえてないか、ちょっと待って、もう一回試してみます」と落ち着いて撮り直し、「これ、聞こえてます?」とコメント欄に確かめながら進めていく。こういう小さなつまずきをそのまま見せてくれるのが、実演ライブのいいところなんだよね。編集済みの紹介動画だったら、まず切り落とされてしまう部分だから。

自分の声をアップロードしたら、笑い声とバグと「悪用厳禁」まで出てきた

自分の声をアップロードしたら、笑い声とバグと「悪用厳禁」まで出てきた
▶ 配信 7:34 時点の画面

▶ この話題を動画で見る(7:34〜)

いよいよ本番。自分の声をアップロードして、AIに読み上げさせてみる。ここからが今日いちばんの見どころでした。

ただっち(7:34〜)

「っていう感じで今アップロード、これでアップロード、今始まりましたね、アップロードが。もともと音声ファイルみたいなのもできるみたいなんですけども、これでもう一回やってみようかな。昨日はなんかちょっと雑音がある中でやったので、これでできるのかどうか。さてどんなのができるでしょう。」

「さてどんなのができるでしょう」——このワクワクと不安が混ざった感じこそ、実演ライブの醍醐味なんだよね。で、再生してみると……最初に流れたのは、なぜか笑い声。本人はまったく笑っていないのに、出力の途中に紛れ込んでしまったようです。理由はただっち自身にも分からない様子でした。編集機能があることも確認して、もう一度撮り直すことに。

何度もコピーし直し、条件を変えて試す。地味な作業の積み重ねが、画面の向こうにちゃんと映っていました。派手な一発成功より、この泥臭い繰り返しのほうが、実際に自分で使う人にはよっぽど参考になるんじゃないかな。

ただっち(8:38〜)

「バグってしまうところはあるようですね。なんか途中でバグってしまうので、この入力があれなのか、もう少し改善は必要かもしれないですね。なんかそういうのが出ますよね。ありがとうございます。先日ありがとうございました。かなりね、いい感じしゃべってくれるところとそうでないところとの結構差が激しいので、そこら辺はまだまだこれから改善の余地があるかなとは思います。」

差が激しい。この一言に、今の音声AIのリアルが詰まっている気がします。いやー、うまくいく時は本当に自然なのに、うまくいかない時はちゃんとバグる。完成された魔法より、育っている途中の道具のほうが、こうして手元でつまずく様子まで見せてもらえる分、よっぽど面白いんだよね。

そして、ここで話題は声のクローンのリスクへと移ります。ファイルをアップロードするだけなら、自分の声でなくても——極端な話、他人の声でも動かせてしまうからです。

ただっち(9:07〜)

「ファイル音声もアップロードできるので、本当は悪用厳禁ですよね。他の例えば、有名人の方が喋っているものもアップロードできちゃうんですけど、これはちょっとですね、悪用厳禁なものかなとは思います。このぐらいAIだなってわかるぐらいはまだいいんですけど。」

悪用厳禁。この言葉を、便利さを見せている真っ最中に自分から挟み込む。ここが今日いちばん引っかかったポイントでした。褒めて終わりじゃなく、危うさにもちゃんと自分でブレーキをかける。声を扱う道具だからこそ、その線引きは軽く扱っちゃいけないんだよね。私もコンサル現場で似たような話をすることがあるから、他人事には思えませんでした。

編集機能があると分かったのも、今日のちょっとした収穫。一度撮って終わりじゃなく、気に入らなければ直せる。AIが生成したものを、そのまま垂れ流しにしない。人の手で最後の仕上げをする余地があるって、地味だけど大事な安心材料だと思う。料理で言えば、盛り付け直前にもう一度味見できる工程があるようなもの。仕上げの一手間が、最終的な満足度を大きく左右するんだよね。

この技術、いずれ自分のコンサル先でも「音声で発信したい」という相談につながりそうだなと思いました。分身AIを育てる相談でも、実はよく似た壁にぶつかります。技術より先に、「誰の声を、誰の許可を得て使うのか」という線引きを最初に決めておくこと。便利さと危うさは、いつだって背中合わせなんだよね。

放送事故のあとに現れたHeyGenは、日本語がまだ苦手だった

放送事故のあとに現れたHeyGenは、日本語がまだ苦手だった
▶ 配信 14:02 時点の画面

▶ この話題を動画で見る(14:02〜)

ここで一瞬、放送が止まったのかとひやっとしました。

ただっち(14:02〜)

「失礼します。ありがとうございます。ごめんなさい。ちょっと放送事故がありました。たまに最近ミュートになってしまうことがありまして。これが僕がよく使っているHeyGenですね。僕の声を登録しております。いろんな声があるんですけど、僕の声を登録してあるので、僕の声に喋らせてみたいと思います。」

放送事故。この一言でさらっと流して、そのまま次の道具へ進んでしまうあたり、場数を踏んでいる感じがします。ここで登場したのが「HeyGen」。ただっちが普段から使い慣れている、いわば本命の道具です。自分の声を事前に登録してあるから、いろんな声の候補から選ぶのではなく、自分の声でそのまま喋らせられます。

ただっち(15:54〜)

「ちょっとね、日本は弱いんですけども、まあまあいい感じで発音とかは。英語とかだとね、ちょっとこれ英文に変えてみましょうか。ありがとうございます。英文はだいぶ滑らかなはずです。これをちょっと1回翻訳かけて。」

日本語は、まだ弱い。名前の読み方や専門用語のイントネーション……そのあたりでどうしても引っかかる瞬間があるようでした。それでも「前よりはだいぶ良くなった」という実感は、ただっちの言葉の端々から伝わってきます。固有名詞は日本語話者同士でも読み方に迷うくらいだから、AIに正確に読ませるのは思っている以上にハードルが高い。だからこそ、この一言には誇張がないんだよね。でね、ここでただっちが取った手が面白かった。日本語で無理に完璧を目指すんじゃなく、いったん英語に翻訳してから読み上げさせる。素材は同じでも、出す言語を変えるだけで結果がガラッと変わる——そんな期待を込めて、ボタンを押します。

放送事故という言葉、配信を長く続けている人ほど、さらっと口にできるものだと思う。焦らず、謝りすぎず、次の話題にすっと移る。その落ち着きの裏に、これまで何度も似たようなトラブルを乗り越えてきた場数があるんだろうな。

HeyGenは、ただっちにとってもう慣れ親しんだ道具でした。ゾノスのように初めて触る緊張感とは違って、操作の一つひとつに迷いがありません。自分の声をあらかじめ登録しておく——その一手間をかけているからこそ、いざという時にすぐ使える状態を保てている。準備しておくことの強さって、こういうところに出るんだよね。

無理に日本語で完璧を目指すんじゃなく、得意な方に寄せる。道具の得意不得意を見極めて、使い分ける。この判断のスピード感こそ、実際に手を動かしている人だからこそ持てる感覚だと私は思います。

コメント欄からの反応も、画面越しに伝わってきます。りょうさんという名前が挙がっていたのも印象的でした。一人ぼっちのライブのはずなのに、視聴者とのやり取りがちゃんと会話として成立している。孤独な検証のはずが、実はちゃんと誰かと一緒に確かめている時間だったんだなあ。

英語に変えたら滑らかになり、結局「音声入力が一番」に着地した

英語に変えたら滑らかになり、結局「音声入力が一番」に着地した
▶ 配信 16:24 時点の画面

▶ この話題を動画で見る(16:24〜)

翻訳ボタンを押した瞬間、空気が変わりました。

ただっち(16:24〜)

「翻訳を一回かけてあげますね。りょうさん、リクエストありがとうございます。もう英語が喋れなくても喋れてしまう、喋れてしまうというか、AIのおかげで喋れる時代にはなりましたので。今、翻訳を一回して、こっちですね。これですね。これで喋らせてみたいと思います。」

英語が喋れなくても、喋れてしまう。この言い回し、私は何度も読み返したくなりました。語学の壁って、ずっと大きな壁だったはずなのに、AIを一枚挟むだけでするっと越えられてしまう。実際に再生された英語音声は、日本語の時よりも滑らかで、自然に聞こえたそうです。コメント欄からのリクエストにその場で応える、こういう双方向のやり取りも一人ライブならではの温度でした。

いろいろ試して、いろいろバグって、いろいろ悪用リスクにも触れて——ここまで来て、ただっちが最後にぽつりとこぼした一言がありました。

「一番のおすすめは、なんだかんだまだ音声入力ですね。」

音声入力。それだけ。派手な機能を全部試したうえでのこの着地、正直ちょっと拍子抜けするくらいシンプルでした。でもそのシンプルさの中に、今の音声AIがまだ超えられていない一線がある気がするんだよね。声をクローンする技術も、翻訳して読み上げる技術も、確かにすごい。でも今この瞬間、いちばん確実で、いちばん自分らしいのは、結局「自分の声で、自分の言葉を、そのまま話す」ことでした。

同じHeyGenでも、日本語と英語でここまで完成度が違うのか、というのが今日地味に大きな発見です。日本語はまだ発展途上、英語はだいぶ滑らかなはずです。言語によって得意不得意がはっきり分かれるんだなと、あらためて感じました。

いろんな道具を次々に試して、その都度うまくいったりいかなかったりをそのまま見せる。この20分間を通してただっちが体現していたのは、完璧な結論を出すことじゃなくて「今の現在地を、そのまま共有する」という姿勢だったと思う。うまくいった話だけを集めたハイライト動画より、こういう回のほうがよっぽど参考になるんじゃないかな。

私自身、音声で発信する場面がこれから増えていくだろうなと思っています。だからこそ、今日みたいに「うまくいく部分といかない部分をそのまま見せてくれる回」はありがたい。派手な成功事例よりよっぽど、判断材料になるから。技術が便利になればなるほど、最後は「自分の声で、自分の言葉で話す」という原点に立ち返る瞬間があるんだなと、この回を見ながらしみじみ感じていました。

関さんが教えてくれた新顔から、使い慣れた本命の道具まで。声を扱う仕事をしている人なら、今日の20分間を早送りで追うだけでも十分に元は取れると思います。ゾノスの見た目のワクワク感、途中のバグの手触り、HeyGenの実務感——同じ「声のクローン」というテーマでも、道具によってここまで顔つきが変わるんだよね。

一人ぼっちのライブ、と最初に聞いた時は少し寂しい響きに感じました。でも見終えてみると、むしろ濃密な20分間だったと思います。

IF塾 ASHURA。LPも、動画も、本も。AIの秘奥義で、自分で作る側へ。秘奥義の一部: LP作成、スライド、Kindle出版、ショート動画、動画編集、漫画、LINE公式、議事録、レシート経理。秘奥義45巻以上・回数無制限で使い放題。毎週水曜グルコンで完成まで伴走、AI賢者アシュラ君に24時間相談、自習講座で基礎から。30日無料体験

IF塾 ASHURA

非エンジニアのためのAI開発コミュニティ「アシュラ」。
AIで仕事を片付ける道具「秘奥義」45巻以上が、回数無制限で使い放題。

秘奥義もグルコンも全部、30日間無料で体験
受け取り口は、アシュラ公式LINE。友だち追加して、30日無料体験へ。
体験中も全部使えます・いつでも解約OK
▶ 30日無料で、秘奥義を使ってみる

押すと、アシュラ公式LINEの友だち追加に進みます(30日無料体験はLINEから)

ひろくんコラム — 「一人ぼっちのライブ」が教えてくれたこと

あ、そうだ。最後に少しだけ、コンサル現場の話を。声のクローンにしても、翻訳読み上げにしても、今日ただっちが見せてくれた技術は、どれも「自分の代わりに、自分の言葉を届ける」ための道具でした。声で発信したいけど時間がない、喋るのが得意じゃない——そんな人にとって、こういう道具はまさに心強い味方になり得ます。

でも今日いちばん印象に残ったのは、便利さの裏でただっちがちゃんと「悪用厳禁」って自分から言ったこと。技術を広げる人ほど、リスクにも自分で線を引く責任があるなあ、と改めて感じました。これって、AIエージェントを育てる時にも同じことが言える気がします。声も、分身も、育て方を間違えなければ、ちゃんと自分の味方になってくれる。

分身AI.comもよかったらチェックしてみてね。

よくある質問

Q. ゾノス(Zonos)の音声クローンは、どうやって使うの?

LIVEでは、音声アップロード用のボタン(配信内では「ChromeVice」と聞こえる名前でした)から、マイクで直接録音するか、事前に用意した音声ファイルをドラッグ&ドロップしてアップロードする流れが紹介されていました。アップロード後にテキストを入力すると、その声で読み上げてくれる仕組みです。

Q. 音声クローンにバグはあるの?

LIVEの実演では、笑っていないのに出力に笑い声が混ざってしまうバグや、うまく喋ってくれる部分とそうでない部分の差が激しいという声が出ていました。編集機能もあるようで、その場で撮り直しながら試している様子が見られました。

Q. HeyGen(HeyGen)は日本語と英語、どちらが得意?

LIVEでは「日本語はまだ弱い」としつつ「前よりはだいぶ良くなった」という実感が語られました。一方で英文に翻訳してから読み上げさせると、かなり滑らかになったとのことです。

Q. 声のクローン技術で気をつけることは?

LIVE中、ファイル音声をアップロードすれば技術的には他人の声も使えてしまうため、「悪用厳禁」だとはっきり釘を刺す場面がありました。自分の声で使う分には便利だけど、他者の声の無断利用は避けたい、と語られています。

🎯 AIと愛で、未来をひらく。「あいあいらぼ。」

起業家・経営者のためのAI実践型コミュニティ。AI実践ワークショップ・AIクリエイティブ会・AI目標達成会が月額5,500円で遊び放題!AIMUNIQ(株)主催。

📱 ただっちのFacebook 🌐 あいあいらぼ。

【保存版】2025年2月のAI進化を総まとめ|月刊GPTs研究会マガジン(全36記事)

2年分・900本の朝LIVEを、AIエージェントで1冊の本にしてみた

ブロッコリー農家がCodexで現場を変えた話|GPTs研究会×WACAコラボLIVE

🎁 無料プレゼント

Aiport(ClaudeCode AIエージェント実践会)

ClaudeCodeでAI秘書+分身AI+AIカンパニーが無料で作れるキット&解説動画をプレゼント!

▶ 無料で入会してキットを受け取る

LINE OPEN CHAT

Claude Code・AIエージェント実践会

4,500人突破! インストールから自動化まで、仲間と一緒に実践しよう

LINEオープンチャットに参加する(無料)

パスコード: 1111

🤖 AI生成コンテンツについて

この記事はAIツール(Claude Code)を活用して制作しています。構成・文章生成・画像制作にAIを使用し、最終的な内容の確認・編集・公開判断はひろくん(田中啓之)本人が行っています。「分身AIひろくん」(bunshin-ai.com)とは別のコンテンツです。

この記事が気に入ったら、シェアをお願いします

この記事で学んだことを誰かに教えて恩送りして学びを深めよう!

XLINEはてブ

関連記事