文章を書かないAI「Jev」が話題──何がすごい?成果事例は?BERTとの違いは?




文章を書かないAI「Jev」が話題です

こんにちは、プロクラスの堀口です。

ここ最近、AI界隈で「Jev(ジェブ)」という名前をよく見かけるようになりました。生成AIといえば「文章を書いてくれるもの」というイメージが定着してきたなかで、Jevはなんと「文章をいっさい書かない」という、これまでとは逆方向のAIです。

それなのに、公開されるやいなや大きな話題になっている。いったい何がそんなに新しいのか。今日はこのJevについて、私なりに調べたことを整理してみたいと思います。

1. Jevの「これまでにない価値」とは?なぜ話題なのか

Jevは、米スタートアップのTypeSafe AIが2026年9月に公開したAIモデルです。開発者のディオゴ・アルメイダ氏は、ChatGPTの前身にあたる「InstructGPT」の論文にも名を連ねた元OpenAIの研究者。つまり、いわば”生成AIの中心にいた人”が、あえて「文章を生成しないAI」を世に出した——ここがまず注目を集めたポイントでした。

TypeSafe AIによるJevの発表ページ
▲ TypeSafe AIの発表ページ。「The First (Public) System One Model」と大きく掲げられている(typesafe.ai)

Jevは「LLM(大規模言語モデル)」ではなく、「System One Model(システムワン・モデル)」という新しいカテゴリだと説明されています。人間の思考でいう「じっくり考えるSystem 2」ではなく、「パッと直感で判断するSystem 1」のほう。文章で答えるのではなく、「判断(ジャッジ)」だけを返すことに特化しているわけです。

具体的には、こちらから「状況(テキストやデータ)」と「質問」を渡すと、Jevは次の3つの型で答えを返します。

  • Choice:最大255個の選択肢から1つを選ぶ
  • Score:決められた範囲のなかで点数を返す
  • Noul:Yes / No を確率で返す

ポイントは、LLMのように単語を1つずつ書き出していくのではなく、すべての答えの「確からしさ(確率)」を一度の計算でまとめて返すこと。文章を書く工程がないぶん圧倒的に速く、そして安い。TypeSafe AIは「従来のLLMより20〜200倍速く、40〜1000倍安い」と主張しています。料金も入力100万トークンあたり0.042ドル前後と、けた違いの安さです。

そしてもう一つ、私が面白いと思ったのが「確信度(confidence)」の扱いです。Jevは「確信度が高いほど、実際に正解している割合も高くなる」ように調整されている(キャリブレーションといいます)。開発者はこれを「スマートなif文」と表現しています。

たとえば、

  • 確信度0.9以上 → そのまま自動で処理を進める
  • 確信度0.5〜0.9 → 候補として人間に見せる
  • 確信度0.5未満 → 人間がじっくり判断する

——というように、確信度の数字を条件分岐にそのまま使えるのです。「AIに全部お任せ」でも「全部人力」でもなく、その間をなめらかにつなぐ設計思想ですね。しかも選択肢のなかから選ぶだけなので、LLMの弱点だったハルシネーション(もっともらしい嘘)が構造上ほぼ起きないのも大きな魅力です。

2. すでに”成果”が見え始めている──実際の事例

「判断だけを返す」と言われても、正直ピンときにくいですよね。ですが、Jevを使ったデモがすでにいくつも公開されていて、これがなかなか面白いのです。

まず有名なのが、ゲーム「DOOM」の自動プレイ。Jevが約100ミリ秒ごとに「今どう動くべきか」を判断し続けてゲームを進めていきます。文章を書かず判断だけを返すJevだからこそ、これだけの高速なリアルタイム制御が成立するわけです。

同じ発想のデモとして、「JEVTOWN」という”生きているピクセルの街”も公開されています。街の住人一人ひとりの行動を、そのつどJevの判断で動かしていくというもの。さらに信号制御のシミュレーション(JEVCITY)では、約300ミリ秒ごとにJevが各信号を制御して渋滞を抑えます。AIをオフにするボタンがあって、切った途端に街が渋滞していくのを体感できる——「判断を任せるとこう変わる」が一目でわかる、よくできたデモでした。

実務寄りの検証も出てきています。あるメール分類のテストでは、Jevに1つの質問だけを投げると正答率62.6%(比較したLLMは81.3%)と、正直あまり奮いませんでした。ところが、同じ判断を5つの小さな質問に分解して投げると、Jevの正答率は95.0%まで跳ね上がり、LLMを組み合わせた結果(93.2%)すら上回ったのです。しかも興味深いことに、この「質問を分解すると精度が上がる」効果はJev側にだけ強く効いたそうです。

コスト面のインパクトも見逃せません。月に10万件の問い合わせを振り分ける想定で試算すると、Jev単体なら数ドル程度、上位のLLMに全部任せると数百ドル。この差は、大量の判断を毎日さばく現場ほど効いてきます。「まずJevで振り分けて、本当に文章生成が必要なものだけをLLMに回す」——そんな役割分担が現実的になってきた、というわけです。

3.「それ、BERTと同じでは?」──争点はどこにあるのか

一方で、Jevが話題になるほどに増えてきたのが「それって結局BERTと同じじゃないの?」という声です。BERTは2018年にGoogleが公開した、文章の分類などを得意とするモデル。たしかに「文章を書かず、決められた答えを返す」という点だけを見れば、発想は昔からあるものです。

この論争、整理してみると「本当の争点はどこか」が見えてきます。

▼ 懐疑派の言い分
「判断専用・出力が固定のモデル」なんてBERTの時代からある。分類そのものは新しくないし、しっかり学習させたBERTがLLMのプロンプトを上回る例だってある。おまけにTypeSafe社はJevの中身(アーキテクチャ)を公開していないので、”本当に新しいのか”を外から検証できない——という指摘です。

▼ 擁護派の言い分
決定的に違うのは、「何を判断させるかを、その場の”質問文”で決められる」点だといいます。BERTのような従来の分類器は、タスクごとにラベル付きの学習データを集めて訓練する必要があり、準備に数ヶ月かかることも珍しくありません。一方Jevは学習不要(ゼロショット)で、質問を書けばすぐ使える。しかも複数の質問を並列に評価し、結果の組み立てはプログラム側に任せる。この”手軽さと速さ”はBERTにはなかったものだ、という主張です。

ここが肝だと私は感じました。つまり争点は「タイプ付きの出力が新しいかどうか」ではなく、「利便性・スピード」と「精度の天井」のどちらを取るかにあります。

精度だけを比べれば、Jevは専用に訓練した分類器や上位LLMにまだ一歩譲る場面があります(あるテストでは67.8%対74.1%)。それでも、学習データを何ヶ月もかけて用意しなくても、今日から判断タスクを立ち上げられる——この立ち上がりの速さは、多くの現場にとって現実的な価値です。「まずJevで試して、データがたまってきたら専用モデルに育てる」といった使い分けが、これからの定石になるのかもしれません。

4. 使ってみたい人へ──今はウェイトリスト登録して順番待ち

「そんなに便利なら早速使ってみたい」と思った方も多いはず。ただ、2026年9月の時点では、Jevは誰でもすぐに触れるわけではありません。公式サイト(typesafe.ai)からウェイトリストに登録し、順番が来るのを待つかたちになっています。

私も試しに登録してみました。メールアドレスを入力して申し込むと、すぐに下のような「You’re on the waitlist for Jev!(Jevのウェイトリストに登録されました)」という確認メールが届きます。

Jevのウェイトリスト登録完了メール
▲ 登録するとすぐ届く「You’re on the waitlist for Jev!」の完了メール

あとは順番が回ってくるのを待つだけ。登録から半日ほどでアクセス権が付与されたという情報もあります。私のところにアクセスできるようになったら、実際に触ってみた感想を改めてレポートしたいと思います。

おわりに

「生成AI=文章を書くもの」という私たちの思い込みを、Jevは気持ちよく裏切ってくれました。AIに何もかも書かせるのではなく、「判断はJev、文章はLLM、計算はプログラム」と役割を分けて組み合わせる。そんな設計の発想そのものが、これからのAI活用のヒントになりそうです。

プロクラスでも、新しい技術は「まず自分たちで触って確かめる」を大切にしています。私のところにも順番が回ってきたら、実際にJevを動かして、続きをこのブログでレポートしたいと思います。それではまた。