お問い合わせ
AI開発

AIの誤回答(ハルシネーション)に備える設計|業務アプリで取り入れたい対策

AIのハルシネーション対策を、根拠の参照・回答の保留・出力検査・人の確認から解説。製品仕様の誤回答を直す例と、公開前の評価表を紹介します。

この記事のポイント

  • AIの誤回答は完全にはなくせないため、起きる前提でアプリを設計する。
  • 資料の参照と出典の表示で、利用者が根拠を確かめられるようにする。
  • 出典の有無だけで合格にせず、回答の各条件が元資料で裏付けられるかを確かめる。

生成AIを業務で使うときに、多くの人が気にするのが誤った回答です。AIは、事実と異なる内容や存在しない情報を、自然な文章で出力することがあります。この現象は、ハルシネーションと呼ばれています。

誤回答が社外への回答や社内の判断にそのまま使われると、信用の低下や手戻りにつながりかねません。かといって、誤回答を理由にAIの活用をすべて止めてしまうと、効率化の機会も失われます。

この記事では、ハルシネーションが起きる理由を簡単に説明したうえで、業務で使うAIアプリに取り入れたい対策を紹介します。

ハルシネーションが起きる理由

文章を作るAIのモデルは、大量の文章から学習した傾向をもとに、入力に続く文章として自然なものを作る仕組みです。事実かどうかを一つずつ確かめてから出力しているわけではありません。

そのため、学習した情報に含まれない内容や、社内にしかない情報について聞かれると、それらしい文章で補ってしまうことがあります。日付や金額、固有名詞、法令の条文番号のような細かな情報は、特に誤りが混ざりやすい部分です。

AIのモデルは改良が続けられていますが、誤回答を完全になくす方法は確立されていません。業務アプリを作るときは、誤回答が起きることを前提にして、起きたときに気づける仕組み、影響を小さくする仕組みを組み込むことが基本になります。

対策1:参照する資料を渡し、出典を表示する

もっとも基本的な対策は、回答の根拠になる資料をAIに渡すことです。社内の資料を検索し、見つかった文章をもとに回答を作らせる仕組みはRAGと呼ばれます。仕組みの詳細はRAGとは?社内の資料を参照して答えるAIの仕組みで説明しました。

あわせて、回答と一緒に参照した資料の名前や該当箇所を表示しましょう。利用者が元の資料を開いて確認できれば、誤りに気づきやすくなります。

ただし、RAGを使っても誤回答はなくなりません。検索で関係の薄い資料が選ばれたり、資料そのものが古かったりすると、それをもとにした誤った回答が出てきます。資料を最新の状態に保つ運用も、対策の一部として考えておく必要があるでしょう。

対策2:答えない条件を決める

AIへの指示文で、答えてよい範囲と答えない範囲を明確にしておくことも有効です。たとえば「渡した資料に書かれていない内容は答えず、該当する情報が見つからないと伝える」と指示しておけば、推測で補った回答を減らせます。

業務によっては、特定の話題には答えない設定も必要です。個別の契約条件、医療や法律に関する個別の判断、価格の約束などは、AIの回答対象から外して担当者へ案内するほうが安全でしょう。

答えられなかった質問は記録しておき、後から確認しましょう。資料が足りないことが原因であれば、資料を追加することで答えられる範囲を広げられます。

対策3:出力の形を決め、数字はシステムから入れる

自由な文章で出力させるほど、人が確認すべき範囲は広くなるものです。業務アプリでは、出力する項目や順番をあらかじめ決めておくと、どこに何が書かれているかが分かり、確認しやすくなります。

出力の決まった形の書類のうち、説明の文章の欄にはAIが作った文章が入り、金額・数量・日付の欄には販売管理や見積もりのシステムに登録された値がそのまま差し込まれる役割分担を示している。
誤りが許されない金額や日付はシステムから入れ、AIには説明の文章だけを作らせます。

金額、数量、日付のように誤りが許されない情報は、AIに書かせないことも一つの方法です。販売管理や見積もりのシステムに登録されている値を、出力の決まった位置にそのまま差し込めば、転記の誤りを防げます。AIには説明の文章だけを作らせる、という役割の分け方です。

出力の形を決めておくと、プログラムで機械的に確かめられる範囲も増えます。たとえば、必須の項目が空になっていないか、表示した資料名が実際に登録されている資料と一致しているかは、人が読まなくても自動で確認できます。

対策4:人が確認する場所を決める

どれだけ対策を重ねても、最後に人が確認する手順を残すことが欠かせません。ただし、すべての出力を同じように確認すると、手間が増えてAIを使う意味が薄れてしまいます。

社内の担当者が参考にする下書きは使う人がその場で確認し、顧客に送る文章や金額・契約に関わる内容は担当者が承認してから外へ出す、という影響の大きさに応じた2つの確認の流れを上下に並べている。
出力の影響の大きさに応じて、その場の確認と承認後の送付を使い分けます。

そこで、出力の影響の大きさに応じて確認の方法を変えます。社内の担当者が参考にする下書きであれば、使う人がその場で確認すれば十分な場合が多いでしょう。顧客に送る文章や、金額・契約に関わる内容は、担当者が確認して承認してから外へ出す流れにしておくと安心です。

承認の流れをシステムに組み込む方法については、AIの出力に人の承認を組み込む方法でも紹介しています。

対策5:評価用の例で確かめ続ける

公開前には、実際の業務に近い質問と期待する回答の組を用意し、AIの出力を確かめます。誤りやすい質問、資料に答えがない質問、答えてはいけない質問も含めておくと、対策が効果を上げているかを確認しやすくなるはずです。

公開後も、指示文の変更やAIのモデルの切り替えのたびに、同じ例で確かめてください。利用者の質問と回答の記録を定期的に見て、新しく見つかった誤りを評価用の例に加えていくと、確認の範囲が少しずつ広がっていきます。

利用者への説明も対策の一つ

アプリの画面で、回答がAIによるものであり、誤りを含む可能性があることを示しておきます。重要な判断に使う前に、出典の資料を確認するよう案内しておくことも大切です。

社内で使うアプリなら、導入時の説明会や利用ルールの中で、AIの回答をどう扱うかを伝えておきましょう。利用者が誤回答の可能性を知っていれば、出典を確認する習慣がつきやすくなります。

出典が付いていても誤っている回答の例

架空の製品資料に「型番Cは屋内用、型番Dは屋外用」と記載されているとします。利用者が「型番Cを屋外で使えますか」と聞き、AIが「屋外で使用できます」と回答した場合、資料へのリンクが付いていても誤回答です。別の行の条件を読み違えているからです。

この場合、出典が表示されるかだけを評価しても問題を見つけられません。型番と条件の対応を元資料で照合する必要があります。表を読み取る際に列の対応が崩れたのか、正しい文章を渡したのに生成時に取り違えたのかを、順に調べます。

修正方法も原因に合わせます。取込み時の問題なら、表の構造を保つ処理や、型番ごとの説明へ整理する方法を検討します。生成時の問題なら、回答に必要な型番と条件を先に抽出し、その対応を確認できる形にします。指示文へ「絶対に間違えない」と足すだけでは、原因を取り除けません。

評価用の質問を四種類に分ける

よく答えられる質問だけで試すと、問題がある場面を見落とします。公開前の評価には、根拠の状態が異なる質問を含めましょう。次の表は、製品問い合わせを想定した評価の例です。

質問の種類 用意する入力 期待する動作
根拠が十分 型番と用途が明確な質問 対応する条件と出典を示す
情報が不足 型番が書かれていない質問 必要な情報を聞き返す
根拠が矛盾 新旧の仕様が混ざる質問 適用対象を確認し、曖昧なまま断定しない
回答の対象外 特別保証や価格交渉の依頼 担当者へ引き継ぐ

期待する回答は、文章を一字一句固定する必要はありません。「屋外で使えると答えない」「確認できない条件を明示する」のように、残すべき意味と禁止する断定を決めます。質問の表現を少し変えても同じ判断になるかを試すと、指示の弱い部分が見えます。

誤回答を見つけたときの調査手順

最初に、実際の質問、参照した資料、返した回答を一組で確認します。次に、資料に正しい答えがあるかを見ます。資料がないなら追加や回答範囲の見直しが必要です。資料があれば、検索でその箇所を拾えたかを確認します。

その後、回答のどこが根拠を超えているかを特定します。「防水」までしか書かれていないのに「水中でも利用できる」と広げたのか、注意事項を落としたのかで、評価する観点が異なります。誤回答を一つのラベルにまとめず、間違った条件を言葉で記録してください。

最後に、修正した質問を評価用の一覧へ加えます。同じ質問だけを覚えさせるような変更にせず、似た条件と反対の条件も確認します。型番Cを直した結果、型番Dまで屋内専用と答えるようになっていないかを見る、といった確認です。

「分からない」が増えた場合の見直し

誤回答を避ける指示を強くしすぎると、資料に答えがある質問まで保留することがあります。業務では正しい回答を返すことと、根拠がないときに止まることの両方を評価します。

保留された質問を見て、資料不足と検索失敗を分けます。必要な資料が存在するのに見つけられないなら、答えない条件を緩める前に検索を改善します。担当者へ戻した件数が増えても、必要な判断だけが人へ戻っているなら設計として適切な場合があります。単に回答率を上げるため、根拠のない推測を許す変更は避けてください。

まとめ

ハルシネーションは、現時点では完全になくすことができないため、起きる前提でアプリを設計することが大切です。資料の参照と出典の表示、答えない条件の設定、出力の形の固定、人による確認、評価の継続を組み合わせることで、誤回答による影響を小さくできます。どの対策をどこまで入れるかは、業務の内容と出力の影響の大きさによって決めてください。

e-Grantsでは、RAGやLLMを使ったAIアプリケーションについて、課題の整理から設計・開発、公開後の保守運用まで対応しています。誤回答への対策を含めてAIアプリを設計したい方は、AIアプリケーション受託開発のページをご覧ください。

益田 尚紀

この記事を書いた人

益田 尚紀株式会社e-Grants 代表取締役

株式会社e-Grants代表取締役。愛知県一宮市を拠点に、企業のAI導入支援・AI受託開発・社内AI基盤の構築と、工務店のWeb集客支援に取り組んでいます。現場で使えるAI活用とデジタル集客を、むずかしい言葉をほどいて発信します。

お問い合わせ

AIの開発・導入のご相談から、工務店向け集客パッケージのお見積もりまで承ります。何から始めるか決まっていなくても大丈夫です。