【BUZZ SYNC】文章を書かない AI「Jev」が突いた急所 — 人が全件確認している限り、AI を増やしても効かない

BUZZ SYNC

X で話題になっていた投稿を SYNCON 編集部が深掘りする。今回の入口は、AWS の現場で AI 導入を手がけるエンジニア、だん氏(@dan_pro_man)が 9 月 21 日に投稿した「小学生でも分かる Jev ガイド」。発表されたばかりの新しい AI を、専門用語をほとんど使わずに解説した記事だ。だが読み進めると、この投稿の本題は道具の紹介ではない。AI をどれだけ速くしても、人が出力を全部確認している限り、仕事はそこで止まる。この一点を、自身の運用記録に基づいて書いている。非エンジニアの経営判断に直結する話なので、一次資料まで戻って深掘りした。

3 行まとめ

  • 米 TypeSafe AI が 9 月 15 日に発表した Jev は、文章を一切作らない AI。選ぶ・点をつける・イエスかノーかの 3 形式だけを返す
  • 返り値には自信の度合いを示す数字が付く。自信が高いものは自動で流し、低いものだけ人が見る、という分け方ができる
  • だん氏の投稿で効いていたのは道具の紹介ではなく順序。自社データで一致率を測り、外れたときに気づける形を作ってから、人の全数確認を外す

文章を書かない AI という、聞き慣れない種類

だん氏は Jev を病院の問診票にたとえた。丸をつける欄だけがあって、自由に書く欄がない。これが的確な説明であることは、開発元 TypeSafe AI の公式ドキュメントでも確認できる。同社は「テキスト生成なし、解析なし」と明記し、Jev は返答も、プログラムの記述も、判断理由の説明も出さないと書いている。書けないのではなく、書く経路が最初から無い。

返ってくるのは 3 形式だけだ。用意した選択肢から 1 つ選ぶ(1 問あたり最大 255 択)、決めた尺度で点をつける(最大 10 段階)、イエスかノーかを確率で返す。処理時間は同社公表で 1 回 70 ミリ秒から 500 ミリ秒。料金は入力 100 万トークンあたり 0.042 ドルで、出力は 0.00 ドル、つまり無料だ。返す文字が無いので、返す側の料金も発生しない。

ここで注意が要る。トークンとは AI が文章を数える単位で、文字数とは違う。日本語は 1 文字でおよそ 1 トークンを消費するため、「100 万文字で数円」と読み替えると実際より安く見積もることになる。それでも、文章を書く AI に同じ仕事をさせた場合と比べれば桁が違う水準であることは変わらない。

この投稿が効いていたのは、AI の説明ではなく「外す順番」

だん氏の記事で最も価値があるのは、製品解説ではなく後半の自身の記録だ。以前はどうしていたか。AI に仕分けをさせたうえで、その結果を全部自分で確認していた。これを本人は「AI は働いているが、人が輪の中から抜けていない」と書く。AI が何倍速くなっても、人が全件見る限り、そこが最後の詰まりになる。

では人の確認をどう外したか。いきなり外すのをやめ、3 か月間、AI の判定と人の判定を並べて動かし、一致率を数えた。そのうえで一致率が 95% を超えた種類から順に、人の全数確認を外していった。本人が強調しているのは 95% という数字そのものではない。仕事の重さで適正値は変わるし、これは本人の基準にすぎないと断っている。重要なのは、AI を信じたから外したのではなく、外していい状態になったことを測ってから外した、という順序のほうだ。

さらに踏み込んでいる箇所がある。だん氏は、Jev をまだ本番に入れていないと書く。理由は速さでも正確さでもなく、自動化を外したときに自社側で気づける形をまだ作っていないから。自信の数字は返ってくるが、それをどこに残し、誰がいつ見返すのかが決まっていない。だから入れない。道具を入れる日より、外れたことに気づける日のほうが先である、という結びは、AI の性能比較に忙しい議論のなかで珍しく順番が正しい。

日本語で試した人たちが出した数字

投稿は日本語の業務に置く前提で書かれているが、一次資料に当たると補っておくべき点がある。TypeSafe AI の公式ドキュメントは「Jev の主要な訓練言語は英語であり、日本語を含む CJK も受け付けるが、現時点では精度が低い」と明記している。日本語で使うなら、公表された性能をそのまま前提にはできない。

国内では既に実測が出ている。クラスメソッドの検証では、日本語の書類項目の突合を 107 件試し、完全一致の判定で 98.1%、意味の一致を問う判定で 91.5% という結果が出た。同じ内容でも日本語の問いは英語より約 13% 多くトークンを消費し、確率の値も英語版より低く出る傾向が報告されている。「株式会社サンプル商事」と「サンプル商事株式会社」のような前株・後株のゆれでは、確信度が下がる。

もう一つ、YTAL は本番ログを使って取引先の名寄せを再生した。自信の度合いが 0.85 以上なら自動、それ以外は保留という設計で動かしたところ、保留が 228 件、全体の 43.4% に達した。結論はそのままの採用を見送り。ただし同社は、これはモデルの限界ではなく、問いの切り方と判定をまとめるルールが効いていたと書いている。つまり、うまくいかない原因は AI の側ではなく、設計の側にあった。

性能についても、断定は避けたほうがよい。速度も価格も現時点では開発元の自己申告で、同社自身が「この価格が補助されていないことは証明できない」と述べている。第三者の評価も割れており、Vercel の最高経営責任者は p95 で GPT Luna より 18 倍速くより正確だと報告する一方、ある企業の技術責任者は Gemini のほうがわずかに精度は高いと述べている。

SYNCON の視点 — 日本の非エンジニア経営層は何を盗むべきか

Jev を導入すべきかどうかは、多くの企業にとってまだ先の話でよい。盗むべきは道具ではなく、だん氏が実際にやった 2 段の手順だ。第 1 段は、AI の判定と人の判定を一定期間並べて動かし、一致率を測ること。第 2 段は、自動化して間違いが起きたときに自社側で気づけるかを確認し、気づけないなら外さないこと。この順序は AI の種類にも業種にも依存しない。経理の仕訳、問い合わせの一次振り分け、与信の予備審査、稟議の分類。自社で「判定するだけの作業を人が目視している」場所は、思っているより多い。

そしてもう一つ。どこに境目を置くかは、道具が決めてくれない。自信の数字を返すのは AI でも、何点以上なら人を外すかを決めるのは経営側の判断だ。誤りが 1 件出たときの損害が大きい業務なら基準は高く、取り返しがつく業務なら低くてよい。国内の検証で保留が 43.4% に達した例が示すのは、基準の置き方と問いの切り方次第で、自動化の効果はいくらでも消えるということだ。来週の経営会議で問うべきは「どの AI を入れるか」ではない。いま人が全件確認している作業を 1 つ挙げ、その一致率を我々は測ったことがあるか、そして外したとき誰がどこで気づくのか、である。

要点まとめ

  • Jev は文章を生成しない AI。選ぶ(最大 255 択)・点をつける(最大 10 段階)・イエスかノーかの 3 形式のみを返す
  • 公表値は 70 ミリ秒から 500 ミリ秒、入力 100 万トークンあたり 0.042 ドル、出力 0.00 ドル。ただし開発元の自己申告で、第三者の精度評価は割れている
  • 公式ドキュメントは日本語を含む CJK の精度が現時点で低いと明記。国内検証では完全一致 98.1%、意味の一致 91.5%、日本語は英語より約 13% 多くトークンを消費
  • 本番ログでの名寄せ再生では、自信 0.85 を基準にしたところ保留が 43.4% に達し、そのままの採用は見送られた。原因は設計の側にあった
  • 持ち帰るべきは手順。一致率を測ってから人の確認を外す、外れたとき気づける形を先に作る、境目は経営が決める

情報ソース:
・TypeSafe AI 公式ドキュメント(docs.typesafe.ai)
・ITmedia AI+「テキストを生成しないAI『Jev』」(2026 年 9 月 20 日)
・MarkTechPost「TypeSafe AI Releases Jev」(2026 年 9 月 19 日)
・DevelopersIO「Jev で書類項目の突合はどこまでできるか」
・YTAL, Inc.「TypeSafe AI の『Jev』は本番で使えるか」
・元投稿:だん氏(@dan_pro_man)、2026 年 9 月 21 日

AI・最新テックの動きを、毎日 X でお届けしています

X で @SYNCONJP をフォロー

PR

Amazon プライム感謝祭 10/16(金)〜10/19(月)

コメント

タイトルとURLをコピーしました