こんなことはありませんか
- 自社のAIチャットボットが、料金や手続きについて、それらしいけれど間違った答えを返す
- 資料に書いていないことまで、自信ありげに答えてしまう
- 人に回すべき問い合わせを、チャットボットが抱え込んでしまう
AIがそれらしい作り話をしてしまうことを、ハルシネーションと呼びます。資料を探してから答える仕組み(RAG)や、指示の工夫である程度は減らせますが、ゼロにするのは難しいのが実情です。
そこで今回は、2026年9月に登場した Jev というAIを使って、チャットボットの精度を底上げする設計を考えてみます。考え方をひとことで言うと、**「判断はJevに、文章はこれまでのAIに」**です。
Jevとは
Jev は、米国の TypeSafe AI が開発したAIモデルで、2026年9月15日に早期提供が始まり、9月21日からは順番待ちなしで使えるようになりました。開発を率いているのは、ChatGPT の開発に関わった元 OpenAI の研究者です。
いちばんの特徴は、文章を一切書かないことです。ChatGPT のようなAIが文章を1文字ずつ生み出すのに対し、Jev は、あらかじめ決めた選択肢の中から答えを選び、その確からしさ(確率)を数字で返します。
問いの形は3種類です。
- Choice:決めた選択肢の中から1つを選ぶ(例:「料金」「手続き」「不具合」「その他」)
- Score:決めた段階で評価する(例:緊急度を「低・中・高」で)
- Noul:はい・いいえで答え、その確率を0〜1で返す
選択肢の外の答えは出せないので、TypeSafe AI は「ハルシネーションが起きない」と説明しています。
ただし、「間違えない」わけではない
ここは大事なところです。Jev が保証しているのは、決めた形の外の答えを出さないことです。4つの選択肢から選ばせれば、5つ目の答えを作り出すことはありません。
けれど、4つのうち間違ったものを、自信を持って選ぶことはあり得ます。この点は、海外の技術者からも指摘されています。また、仕組みの詳しい論文などはまだ公開されていません。
だからこそ、Jev の返す確率を使って「自信がないときは人に回す」設計にするのが、この記事の考え方です。
設計:判断をJevに任せる
チャットボットの中で起きている処理を分解すると、「判断」と「文章づくり」が混ざっています。
- この質問は何についての質問か(判断)
- 資料で答えられる質問か(判断)
- 急いで人が対応すべきか(判断)
- 答えを文章にする(文章づくり)
これまでは、この全部を ChatGPT のような文章を書くAIに任せていました。判断の部分をJevに切り出すのが、今回の設計です。
① 質問の種類を分ける(Choice)
届いた質問を、Jev に「料金/手続き/不具合/契約の変更/その他」のどれかに分けさせます。種類ごとに、参照する資料と答え方を変えます。「契約の変更」のように、チャットボットで答えるべきでない種類は、この時点で人に回します。
② 資料で答えられるかを確かめる(Noul)
RAGで資料を探したあと、Jev に「この資料の中に、質問への答えが書かれているか」をはい・いいえで判断させます。
- 確率が高ければ、文章を書くAIに答えを書かせる
- 確率が低ければ、答えを作らせずに「担当者から回答します」と案内して人に回す
答えられないときに、答えを作らせない。ハルシネーションを減らすうえで、いちばん効くのがここです。
③ 急ぎかどうかを見る(Score)
「サービスが止まっている」「今日中に」といった問い合わせは、緊急度を Jev に「低・中・高」で判定させ、高いものはすぐ担当者に通知します。
④ 答えを書いたあとに確かめる(Noul)
文章を書くAIが作った答えを、もう一度 Jev に「この答えは、参照した資料の内容と食い違っていないか」と判断させます。食い違っている可能性が高ければ、送る前に止めて人が確認します。
流れをまとめると
- 質問を受け取る
- Jev が種類を分ける(答えるべきでない種類は人へ)
- RAGで資料を探す
- Jev が「資料で答えられるか」を判断(自信がなければ人へ)
- 文章を書くAIが答えを書く
- Jev が「資料と食い違っていないか」を判断(怪しければ人へ)
- 答えを返す
どこで人に回すかは、Jev が返す確率にしきい値を決めて切り替えます。最初は厳しめ(少しでも怪しければ人へ)に設定し、会話の記録を見ながら緩めていくのが安全です。
コストは激安
判断を増やすとコストが心配になりますが、Jev はここが強みです。コストは激安と言ってよい水準です。
公表されている料金は、入力100万トークンあたり0.042ドルで、出力は無料です(2026年9月時点)。TypeSafe AI は、従来のAIに比べて速さは20〜200倍、コストは40分の1〜400分の1と説明しています。応答も0.07〜0.5秒ほどとされています。
たとえば、1回の判断に500トークンを使うとして、1万回の判断で500万トークン。料金は約0.21ドルです。上の設計では1件の問い合わせで3〜4回判断しますが、それでも1万件で1ドルに届きません。登録時には5ドル分の無料クレジットも付きます。
判断を細かく挟んでも、費用の面ではほとんど気にならない。これが、判断をJevに切り出す設計を後押しする理由です。
試すときの注意
- 自社のデータで精度を確かめる:公表されている速度やコストの数字は、提供元の説明です。とくに日本語の問い合わせでどこまで正確に判断できるかは、自社の過去の問い合わせで試してから本番に使ってください
- 新しいサービスである:2026年9月に一般提供が始まったばかりです。利用規約(日本からの利用やデータの扱い)を確認し、止まったときの代わりの流れも用意しておきます
- しきい値は記録を見て決める:人に回した件数と、Jevが自信を持って間違えた件数を記録し、定期的に見直します
まとめ
- ハルシネーションを減らすには、「判断」と「文章づくり」を分けるのが効く
- Jev は、決めた選択肢から選び、確率を返す判断専用のAI。形の外の答えは出さないが、選び間違いはあり得る
- 質問の分類・答えられるかの判断・緊急度・書いた答えの確認をJevに任せ、自信がなければ人に回す
- コストは激安。判断を何度挟んでも、費用はほとんど増えない
YUWA の AIチャットボット導入・運用 では、答える範囲の線引きから、会話の記録を見ながらの改善までを一緒に進めています。今のチャットボットの精度に悩んでいたら、お気軽にご相談ください。

