AIチャットボットのハルシネーションを減らす:Jevに「判断」を任せる設計

自社のAIチャットボットが、それらしい間違いを繰り返していませんか。2026年9月に登場した判断専用のAI「Jev」に判断を任せ、精度を底上げする設計を考えました。コストも激安です。

こんなことはありませんか

  • 自社のAIチャットボットが、料金や手続きについて、それらしいけれど間違った答えを返す
  • 資料に書いていないことまで、自信ありげに答えてしまう
  • 人に回すべき問い合わせを、チャットボットが抱え込んでしまう

AIがそれらしい作り話をしてしまうことを、ハルシネーションと呼びます。資料を探してから答える仕組み(RAG)や、指示の工夫である程度は減らせますが、ゼロにするのは難しいのが実情です。

そこで今回は、2026年9月に登場した Jev というAIを使って、チャットボットの精度を底上げする設計を考えてみます。考え方をひとことで言うと、**「判断はJevに、文章はこれまでのAIに」**です。

Jevとは

Jev は、米国の TypeSafe AI が開発したAIモデルで、2026年9月15日に早期提供が始まり、9月21日からは順番待ちなしで使えるようになりました。開発を率いているのは、ChatGPT の開発に関わった元 OpenAI の研究者です。

いちばんの特徴は、文章を一切書かないことです。ChatGPT のようなAIが文章を1文字ずつ生み出すのに対し、Jev は、あらかじめ決めた選択肢の中から答えを選び、その確からしさ(確率)を数字で返します。

問いの形は3種類です。

  • Choice:決めた選択肢の中から1つを選ぶ(例:「料金」「手続き」「不具合」「その他」)
  • Score:決めた段階で評価する(例:緊急度を「低・中・高」で)
  • Noul:はい・いいえで答え、その確率を0〜1で返す

選択肢の外の答えは出せないので、TypeSafe AI は「ハルシネーションが起きない」と説明しています。

ただし、「間違えない」わけではない

ここは大事なところです。Jev が保証しているのは、決めた形の外の答えを出さないことです。4つの選択肢から選ばせれば、5つ目の答えを作り出すことはありません。

けれど、4つのうち間違ったものを、自信を持って選ぶことはあり得ます。この点は、海外の技術者からも指摘されています。また、仕組みの詳しい論文などはまだ公開されていません。

だからこそ、Jev の返す確率を使って「自信がないときは人に回す」設計にするのが、この記事の考え方です。

設計:判断をJevに任せる

チャットボットの中で起きている処理を分解すると、「判断」と「文章づくり」が混ざっています。

  • この質問は何についての質問か(判断)
  • 資料で答えられる質問か(判断)
  • 急いで人が対応すべきか(判断)
  • 答えを文章にする(文章づくり)

これまでは、この全部を ChatGPT のような文章を書くAIに任せていました。判断の部分をJevに切り出すのが、今回の設計です。

① 質問の種類を分ける(Choice)

届いた質問を、Jev に「料金/手続き/不具合/契約の変更/その他」のどれかに分けさせます。種類ごとに、参照する資料と答え方を変えます。「契約の変更」のように、チャットボットで答えるべきでない種類は、この時点で人に回します。

② 資料で答えられるかを確かめる(Noul)

RAGで資料を探したあと、Jev に「この資料の中に、質問への答えが書かれているか」をはい・いいえで判断させます。

  • 確率が高ければ、文章を書くAIに答えを書かせる
  • 確率が低ければ、答えを作らせずに「担当者から回答します」と案内して人に回す

答えられないときに、答えを作らせない。ハルシネーションを減らすうえで、いちばん効くのがここです。

③ 急ぎかどうかを見る(Score)

「サービスが止まっている」「今日中に」といった問い合わせは、緊急度を Jev に「低・中・高」で判定させ、高いものはすぐ担当者に通知します。

④ 答えを書いたあとに確かめる(Noul)

文章を書くAIが作った答えを、もう一度 Jev に「この答えは、参照した資料の内容と食い違っていないか」と判断させます。食い違っている可能性が高ければ、送る前に止めて人が確認します。

流れをまとめると

  1. 質問を受け取る
  2. Jev が種類を分ける(答えるべきでない種類は人へ)
  3. RAGで資料を探す
  4. Jev が「資料で答えられるか」を判断(自信がなければ人へ)
  5. 文章を書くAIが答えを書く
  6. Jev が「資料と食い違っていないか」を判断(怪しければ人へ)
  7. 答えを返す

どこで人に回すかは、Jev が返す確率にしきい値を決めて切り替えます。最初は厳しめ(少しでも怪しければ人へ)に設定し、会話の記録を見ながら緩めていくのが安全です。

コストは激安

判断を増やすとコストが心配になりますが、Jev はここが強みです。コストは激安と言ってよい水準です。

公表されている料金は、入力100万トークンあたり0.042ドルで、出力は無料です(2026年9月時点)。TypeSafe AI は、従来のAIに比べて速さは20〜200倍、コストは40分の1〜400分の1と説明しています。応答も0.07〜0.5秒ほどとされています。

たとえば、1回の判断に500トークンを使うとして、1万回の判断で500万トークン。料金は約0.21ドルです。上の設計では1件の問い合わせで3〜4回判断しますが、それでも1万件で1ドルに届きません。登録時には5ドル分の無料クレジットも付きます。

判断を細かく挟んでも、費用の面ではほとんど気にならない。これが、判断をJevに切り出す設計を後押しする理由です。

試すときの注意

  • 自社のデータで精度を確かめる:公表されている速度やコストの数字は、提供元の説明です。とくに日本語の問い合わせでどこまで正確に判断できるかは、自社の過去の問い合わせで試してから本番に使ってください
  • 新しいサービスである:2026年9月に一般提供が始まったばかりです。利用規約(日本からの利用やデータの扱い)を確認し、止まったときの代わりの流れも用意しておきます
  • しきい値は記録を見て決める:人に回した件数と、Jevが自信を持って間違えた件数を記録し、定期的に見直します

まとめ

  • ハルシネーションを減らすには、「判断」と「文章づくり」を分けるのが効く
  • Jev は、決めた選択肢から選び、確率を返す判断専用のAI。形の外の答えは出さないが、選び間違いはあり得る
  • 質問の分類・答えられるかの判断・緊急度・書いた答えの確認をJevに任せ、自信がなければ人に回す
  • コストは激安。判断を何度挟んでも、費用はほとんど増えない

YUWA の AIチャットボット導入・運用 では、答える範囲の線引きから、会話の記録を見ながらの改善までを一緒に進めています。今のチャットボットの精度に悩んでいたら、お気軽にご相談ください。

参考

  • #AIチャットボット
  • #ハルシネーション
  • #Jev
  • #TypeSafe AI

ほかの記事

すべての記事