EXPERIMENT/AI仕事術

imajevをMacで試した。Jev派生の判定AIは画像も読めたが、任せる線は自分で引く

2026年9月28日

家事と子育てのスキマで経営する3方よしAI共創コンサルタントの田中啓之、ひろくん(@passion_tanaka)です。

9月28日、GitHubで見つけた「imajev」のURLを、AI秘書の凛ちゃんに送りました。添えたのは「jevの派生形試したい。」の一言だけ。判定だけ返すAI「Jev」と同じ使い方で、写真まで読めて、私のMacの中だけで動くモデルです。ブログの挿絵40枚と、日本語の問い合わせ20件で試しました。

3行でわかるポイント

  1. 写真を見て、どの見出し用の挿絵かを40枚中36枚当てた。画像もデータもMacの外に出ません。
  2. 別の記事の挿絵を見せても、「分からない」とはほぼ言わなかった。旗だけに頼ると、6枚中5枚で知らん顔です。
  3. だから、確信の線を自分で引く。料理で言えば、味見して自信がある皿だけ出して、迷った皿は店主に回す。この形なら、4Bは66問中53問を任せられて、外れは3問でした。

imajevの4Bと2Bの比較表(今回の実測だけ)

imajev-4bimajev-2b
挿絵→見出し当て(6記事・40枚)36枚 正解36枚 正解
別の記事の挿絵(6枚)で「分からない」と言えたか1枚0枚
日本語の問い合わせ振り分け(20件)19件 正解17件 正解
確信0.85以上で自動にした時(全66問)53問を自動・うち3問が外れ29問を自動・外れ0
人に回った数(全66問)13問37問
1件の速さ(画像/文章・中央値)1.5秒/0.44秒0.44秒/0.14秒
動く場所手元のMac(Apple M5 Max)同じ
全体図解: 挿絵→見出し当て36/40、別記事の挿絵で「分からない」は1/6、問い合わせ振り分け19/20、確信0.85の線で上は任せ下は人へ
01

Jevの派生形「imajev」を、私のMacで試してほしいと頼んだ

Jevの派生形imajevのURLを送り、AI秘書がMacで試す流れ

Jevは、このブログで何度も使ってきた判定のAIです。文章を書かずに、「はい/いいえ」「どれか」「何点か」だけを確率つきで返します(Jevそのものの説明はこちらの記事)。

9月25日には、オープンのLayaとJevを比べました(Jev vs Laya の記事)。結論は使い分け。手元で動く判定AIには、文章を外に出さない安心があります。

で、今回見つけたのがimajevです。GitHubのURLを、AI秘書の凛ちゃんに送りました。

頼んだのはそれだけです。ダウンロードも、テストの問題づくりも、数えるのも、手を動かしたのは全部AI秘書の凛ちゃん。結果を見て、私は「実際どうだったかブログ記事にして」と返しました。

使ったのは私のMac(Apple M5 Max・メモリ128GB)。試したのは9月28日です。

🎯 今日やること:自分の仕事で「毎回同じ基準で選んでいる判断」を1つ書き出す。任せる候補は、そこです。

02

imajevとは。Jevと同じ「判定だけ返す」を、写真つきで手元で動かすモデル

Jev(クラウド・文章)とimajev(手元のMac・写真+文章)の対比

imajevは、Jevと同じ形の質問に答えるオープンのモデルです。作ったのはTypeSafe(Jevの会社)ではなく、別の開発者(GitHubのmohit67890さん)。私は「派生形」と呼んで頼みましたが、公式の兄弟ではありません。

違いは2つあります。

1つ目は、写真を一緒に渡せること。商品の写真と商品情報を渡して、「色が食い違っているのはどの項目?」と聞けます。

2つ目は、手元で動くこと。重みはApache-2.0で公開されていて、大きさは2B・4B・9Bの3種類。READMEによると、学習にJevの出力は使っていないそうです。

READMEには、JevBench(判定AIの比較表)の9月27日の採点で、91の中の1位になったとも書かれています。これは開発者側の掲示で、私は確かめていません。今回測ったのは、私の手元のデータでどうだったか、だけです。

🎯 今日やること:新しいAIの説明を読んだら、「誰が測った数字か」を1行メモする。

03

動かすまで。説明書どおりでは起動せず、Mac用の指定を1つ足した

README通りではtorchエラー、--backend mlx を足して起動1.7秒

手順はREADMEのとおりです。GitHubから取ってきて、土台のモデル(Qwen3.5-4B・約9.3GB)と、判定用の追加部品をダウンロードします。

ところが、READMEのコマンドそのままでは起動しないって、最初につまずきました。

エラーは「torchが入っていない」。Mac用の部品(MLX)は入れたのに、起動のときに自動でMac用を選ばず、別の方式を探しに行っていました。

直したのは1か所です。起動に「–backend mlx」を足しただけ。これで、読み込み1.7秒で立ち上がりました。

PYTHONPATH=src:scripts python scripts/playground/server.py --backend mlx \
  --model-bundle artifacts/model-qwen4b.json --adapter adapters/imajev-4b/mlx \
  --calibration adapters/imajev-4b/calibration-rot4.json --rotations 4 \
  --model-name imajev-4b --port 8765

まず、READMEに載っている例(靴の写真と商品情報)を同じ手順で流しました。「色の項目が写真と食い違っている」という答えが、READMEと同じく出ました。ここまでで、動かし方は合っていると確かめられました。

🎯 今日やること:新しい道具を入れたら、まず説明書の例を1つだけ流して、同じ答えが出るか見る。

04

テスト①ブログの挿絵を見せて「どの見出し用?」と聞いたら、ほぼ当てた

挿絵と見出しを結ぶ図。36/40正解、迷った挿絵は人へ

本番のテストは、このブログで実際に使った挿絵です。AI氣道の過去の記事6本から、見出しの挿絵を40枚使いました。

聞き方はこうです。記事の見出しを6〜7本並べて、1枚の挿絵を見せて、「この画像はどの見出しのための挿絵か」。答えは見出しの番号で返ってきます。

結果、4Bは40枚中36枚正解でした。

外れた4枚も、見ると納得がいくものがありました。たとえば「評価は外からやってくる」という挿絵。絵の中にテレビとWebメディアが大きく描いてあって、imajevは「メディアに向けて書く」の見出しを選びました。

大事なのは、外れた4枚のうち3枚は自信が低かったことです。確信が0.85より下なら人に回す、と決めておけば、3枚は人の目に届きます。自信満々で外したのは1枚だけでした。

🎯 今日やること:ブログの見出しと挿絵の組み合わせを、1記事ぶん並べてみる。人が見ても迷う組は、AIも迷います。

05

テスト②別の記事の挿絵には、「分からない」とはほとんど言わなかった

「分からない」の旗は6枚中1枚、確信の線より下は人へ

次は、意地悪な問題です。記事Aの見出しを並べて、記事Bの挿絵を見せます。正解はどれでもない、なので「分からない」と言えたら正解です。

最初の味見では、靴の写真を見せたら、ちゃんと「分からない」と返しました。

でも、同じ水彩の挿絵だと話が違いました。6枚中、「分からない」と言えたのは4Bで1枚、2Bは0枚。似た絵柄だと、どれかの見出しを選んでしまいます。

ここで効いたのが、確信の線です。4Bは6枚中5枚が0.85より下で、人に回る側に入りました。自信満々で選んだのは1枚だけ(0.96)。2Bは6枚とも線より下でした。

つまり、「分からない」の旗だけ見て任せると危ないって分かりました。確信の数字とセットで見る必要があります。

🎯 今日やること:AIに判定を任せるときは、「答え」だけでなく「どれくらい自信があるか」も一緒に記録する。

06

テスト③日本語の問い合わせ振り分け。選択肢に説明を1行足すと当たった

問い合わせを請求・技術・アカウント・その他の4つの箱へ振り分ける図

3つ目は文章だけのテストです。講座やセミナーに届きそうな問い合わせを、AI秘書の凛ちゃんが20件つくりました。窓口は「請求」「技術」「アカウント」「その他」の4つ。正解ラベルも、AI秘書の凛ちゃんが付けたものです。

4Bは20件中19件正解でした。

面白かったのは、最初の味見との違いです。最初は窓口の名前だけを渡していて、「二重に引き落とされています。1件分返金してください。」を「アカウント」と答えました(確信0.21)。

本番では、窓口ごとに説明を1行足しました。「請求=お金・支払い・請求書・返金」のように。すると同じ文が「請求」0.94になりました。

1件だけの観察なので、言い切りはしません。でも、選択肢の名前だけで察してもらうより、1行の説明を添えたほうが、人間の新人と同じで迷いにくいかな、と見ています。

外れた1件は「クレジットカードを変えたい」。正解は「請求」にしていましたが、imajevは「その他」を選びました。カードの登録は「アカウント」とも読めるので、ここは正解の付け方も割れるところです。

🎯 今日やること:自分の問い合わせ窓口に、1行ずつ説明を書く。AIに任せる前に、人の新人にも渡せる形になります。

07

4Bと2Bの違い。当たる数は同じで、自信の持ち方が違った

4Bと2Bの比較。当たる数は同じで自信の持ち方が違う

同じ66問を、小さい2Bでも流しました。

挿絵の当たりは、2Bも40枚中36枚。4Bと同じです! 速さは、画像1件0.44秒で、4Bの約3.5倍でした。

違ったのは自信の持ち方です。2Bは、正しく当てていても確信が0.85に届かないことが多い。66問中37問が人に回りました。4Bは13問です。

その代わり、2Bが自信を持って答えた29問は、全部当たっていました。4Bは53問を自動で答えて、外れが3問です。

料理に例えると、2Bは慎重な新人です。自信がある皿は確かにおいしい。でも、店主に聞きに来る回数が多い。4Bは、ほとんどの皿を任せられるけれど、たまに自信満々で違う皿を出します。

9Bは今回は試していません。READMEによると、動かすのに約19GBのメモリが要ります。

🎯 今日やること:任せる判断が「外れると痛いか」「人の手間を減らしたいか」、どちらが大事かを先に決める。それでモデルの大きさが決まります。

08

任せ方の結論。確信の線を決めて、線より下は人に回す

確信0.85の線より上は任せる、下は人に回す

今回の結論はシンプルです。

imajevは、写真も日本語も、手元のMacだけで判定できました。ブログの挿絵を40枚中36枚当てて、問い合わせを20件中19件振り分けました。

でも、「分からない」の旗は、似た絵柄の前ではほとんど立ちません。

だから、線を自分で引く。READMEの例でも、確信が0.85より下なら人に回す書き方をしています。今回もその線で数えると、4Bは66問中53問を任せられて、13問が人に回りました。

それから、線を決める前に、自分のデータで数十問のテストを作ること。READMEも、自分のデータで数百件試してから線を決めるよう勧めています。今回の66問は、その入口です。

🎯 今日やること:自分の判断を1つ選んで、正解つきの問題を20問つくる。AIの答えと確信を並べて、どこに線を引くか決める。

FAQ

よくある質問

Q. imajevとは何ですか?

A. 判定だけ返すAI「Jev」と同じ形の質問に、写真つきで答えられるオープンのモデルです。重みはApache-2.0で公開されていて、2B・4B・9Bの3種類があります。作ったのはJevのTypeSafeではなく、別の開発者です。

Q. Jevとimajev、どう使い分けますか?

A. 今回は同じ問題でJevと比べていないので、どちらが上とは言えません。imajevは、写真を一緒に見せたいとき、データをMacの外に出したくないときの候補です。

Q. 「分からない」と言ってくれるなら、そのまま任せていいですか?

A. おすすめしません。別の記事の挿絵6枚を見せたとき、4Bが「分からない」と言えたのは1枚だけでした。確信の数字に線を引いて、線より下は人に回すと、6枚中5枚が人に回りました。

Q. 自分のMacでも動きますか?

A. Apple M5 Max・メモリ128GBのMacで、4Bと2Bが動きました。README通りのコマンドでは起動せず、「–backend mlx」を足す必要がありました。9BはREADMEによると約19GBのメモリが要り、今回は試していません。

MATOME

まとめ。imajevは手元で写真も読めた。任せる線は自分で引く

Jevの派生形として頼んだimajevを、私のMacで試しました。ブログの挿絵は40枚中36枚、日本語の問い合わせは20件中19件当てました。写真も文章も、Macの外には出ていません。

一方で、似た絵柄の挿絵を見せても「分からない」とはほぼ言いませんでした。だから、確信の線を決めて、線より下は人に回す。4Bなら66問中53問を任せて、13問が人に回りました。

手を動かしたのはAI秘書の凛ちゃん。私はURLを送って、「記事にして」と頼みました。その分担もそのまま書きました。

COLUMN

自信がある皿だけ出して、迷った皿は店主に回す

コラム図解: ロボットの料理人が迷った皿を店主のひろくんに回す

料理に例えると、imajevは新しく入った料理人です。写真を見て、どの皿の盛り付けかを当てられる。66問のうち、ほとんどは合っていました。

ただ、この料理人は「分からない」をあまり言いません。似た器が並ぶと、どれかを選んで出してしまう。だから、店主が線を決めます。自信がある皿だけ出して、迷った皿は店主に回す。

これは、AI秘書の凛ちゃんとの付き合い方と同じ形です。以前「賢いAIより委ねるAIだった」と書きました。今回も、URLを送ったあと、私が手を動かした場面はありません。

全部を任せるか、全部を自分でやるか、の二択にしない。線より上は任せて、線より下だけ見る。今回の66問なら、私が見るのは13問ぶんで済みました。一人で抱えていた確認の山が、それだけ小さくなります。

👉 判断を一つずつ手放していく「分身AI」の作り方は、分身AI.comもチェックしてね!

REF

参考リンク

🎁 無料プレゼント

Aiport(ClaudeCode AIエージェント実践会)

ClaudeCodeでAI秘書+分身AI+AIカンパニーが無料で作れるキット&解説動画をプレゼント!

▶ 無料で入会してキットを受け取る

🤖 AI生成コンテンツについて

この記事はAIツール(Claude Code)を活用して制作しています。本文と画像はAI秘書(凛ちゃん)が作成し、公開判断はひろくん(田中啓之)本人が行っています。「分身AIひろくん」(bunshin-ai.com)とは別のコンテンツです。

関連記事