ハルシネーション対策|業務のファクトチェックはどこまでやるか
生成AIを業務に入れてしばらく経つと、多くの職場が同じ場所でつまずきます。出てきた文章がもっともらしいので、そのまま出すのは怖い。かといって全部を確認していると、AIを使う前より時間がかかっている。この記事は「AIを疑ってファクトチェックしましょう」の先、つまり業務のどこまでを確認し、どこを確認しないでいいのかという線引きから始めます。
ハルシネーション対策で最初に決めるのは「確認しないもの」
ハルシネーション対策の記事はたいてい「AIの出力を鵜呑みにせず、必ず人がファクトチェックしましょう」で締めくくられます。言っていることは正しいのですが、業務に持ち帰った瞬間に行き詰まります。全件を確認しようとすると、AIに書かせた時間よりも確認する時間のほうが長くなり、効率化のために入れたはずの道具が、単なる工程の追加になってしまうからです。そして厄介なことに、全件確認は静かに破綻します。守れないルールは守られなくなり、確認は形だけになり、最終的には誰も確認しないまま外に出ていきます。厳しくしたはずの運用が、いちばん危ない状態を作ってしまうわけです。
ですから業務での対策は、「全部確認する」からではなく「確認しないものを先に決める」から始めます。確認しない範囲を自分で決めて宣言できれば、残った範囲には時間をかけられます。逆に、確認しない範囲を決めないまま「全部やる」と言っている限り、実際にどこが確認されているのかは誰にも分かりません。まずは、対策の前提として押さえておくべき最小限のところだけ整理します。
| 押さえる点 | 内容 |
|---|---|
| 何が起きているか | 事実でないことを、事実らしい形式で出力します。嘘をつこうとしているのではなく、空欄をそれらしく埋めています |
| なぜ起きるか | 次に来る語をもっともらしさで選ぶ仕組みそのものによります。知らないことを「知らない」と判定する機構が別にあるわけではありません |
| 業務で何が困るか | 誤りが文体の自然さに紛れるため、読んで違和感が立たず、そのまま社内・社外に流れます |
この記事は、ここから「どこまで確認するか(次章)」「どうやって確認するか(業務別の手順と照合先)」「機械には任せられない範囲(複数AIの限界)」「確認する人間が機能しているか」「確認したことをどう残すか」の順に進みます。技術的な対策は最後に、期待値だけを確認します。
取り返しがつくかで、ファクトチェックの強度を3段に分ける
確認する範囲を決める軸は、取り返しがつくかどうかです。間違っていたときに自分で直せば済むのか、上司まで巻き込むのか、社外に訂正のお詫びを出すことになるのか。この一点で、かける手間はまったく変わってよいはずです。ところが実務では、この軸を持たないまま「AIが書いたものは全部危ない」と一律に扱ってしまうため、自分用のメモの数字まで出典に当たりに行くことになり、結局どこかで力尽きます。
そこで、成果物を3段の強度に振り分けます。強度1は素通しです。間違っていても社内で直せるもの、たとえば自分用のメモ、下書きの構成案、要約の叩き台がここに入ります。強度2は要点だけ照合します。社内で共有され、誰かの判断材料になるもの、たとえば会議資料や社内向けの説明文です。強度3は全件を一次情報で確認します。外に出る、記録に残る、数字と固有名詞が入る、この条件のどれかに当てはまるもの、つまり顧客提出物、契約や法令に関わる記述、公開コンテンツ、金額です。判定に迷ったら、間違っていたときに訂正のお詫びを誰に出すことになるかを考えてください。自分だけで済むなら強度1、上司までなら強度2、社外に出すなら強度3です。
強度1〜3:素通し/要点だけ照合/全件を一次情報で確認
3段の中身をもう少し具体的にします。強度1の素通しでは、事実確認をしません。読んで筋が通らなければ書き直させる、それだけです。ここに確認を持ち込まないことが、後の強度3に時間を残す条件になります。強度2の要点だけ照合では、その文書が判断に使われる部分に限って確認します。会議で意思決定の根拠になる数字と、社外の固有名詞、この2種類だけを見て、あとは読んで通します。全部を見ようとせず、判断が乗っている箇所だけを見るのが要点照合です。
強度3の全件確認では、記述の一つひとつについて、どの出典で確かめたかを言える状態にします。ここで初めて、後の章で扱う照合先の固定と、確認者を分ける運用と、確認の記録が必要になります。逆に言えば、強度3以外にはその手間をかけません。3段に分ける目的は、確認を厚くすることではなく、厚くする範囲を絞ることにあります。
強度は情報の種類ではなく「文書の行き先」で決まる
ここがこの分け方のいちばん大事なところです。よくある切り分けは「数値・法令・固有名詞は人が見る、文体や誤字はAIに任せる」という情報の種類による分類です。一見合理的ですが、この軸で切ると、社内メモに書いた概算の数字も、見積書に書いた金額も、同じ「数値」として同じ強度で扱うことになります。結果として確認対象がほとんど減らず、全件確認へ逆戻りします。
強度を決めるのは、情報の種類ではなく文書の行き先です。同じ数字でも、自分の頭の整理のためのメモなら強度1で構いませんし、顧客に出す見積書なら強度3です。同じ社名でも、社内チャットに書くのと、案内文に刷って郵送するのとでは違います。まず文書がどこへ行くのかを見て強度を決め、その強度の中で「何を見るか」として情報の種類を使う。順番を逆にしないでください。この順番にして初めて、確認対象は現実的な量まで落ちます。
業務別・ファクトチェックの手順(文書/数値/法令/社外文/議事録)
強度を決めたら、次は業務ごとにそれを当てはめます。ここで大事なのは、業務ごとに違う確認手順を発明しないことです。見る項目と照合先をあらかじめ決めておき、担当者はその表を見るだけにします。手順が人によって違うと、確認したかどうかを後から誰も判断できなくなります。以下は地図にあたる部分で、照合先の決め方は次章、機械に任せられる範囲はその次の章で扱います。
なお、議事録や要約はAI利用が最も多いにもかかわらず、対策の話ではほとんど扱われません。元の発言にない内容が紛れ込む典型的な用途ですから、必ず対象に入れてください。同時にこれは、照合先が手元にある唯一の業務でもあります。元の音声やメモと突き合わせるだけで済むので、確認は最も速く終わります。
| 業務 | AIに任せる範囲 | 人が必ず見る項目 | 照合先 | 既定の強度 |
|---|---|---|---|---|
| 文書作成・報告書 | 構成案、下書き、表現の整え | 事実として書かれた記述、引用の有無 | 社内の原資料 | 強度2(社外に出るなら3) |
| 数値・集計 | 計算式の説明、表の整形 | 桁、期間の定義、単位、出所 | 社内の原簿 | 強度3 |
| 法令・規程・契約 | 用語の平易な言い換え | 条文番号、施行時期、改正の有無 | 所管官庁の原典 | 強度3 |
| 社外メール・案内文 | 文面のたたき台 | 社名、役職名、日付、金額、URL | 先方からの原文書 | 強度3 |
| 議事録・要約 | 要約、論点の整理 | 元の発言にない断定、決定事項 | 元の記録そのもの | 強度2(決定事項は3) |
「一次情報で確認」の一次情報はどこにあるか——照合先を先に決める
「一次情報で確認しましょう」という言葉は、どの記事にも書かれています。ところが実務では、この一言だけでは動けません。担当者は一次情報がどこにあるか分からないので、とりあえず検索します。そして検索結果の上位に出てきたまとめ記事や他社のブログ、あるいは検索結果に添えられたAIの要約を読んで、「確認しました」と報告します。これは確認ではなく、二次情報での追認です。しかも当人には確認した実感が残るため、いちばん見つかりにくい失敗になります。ファクトチェックの所要時間が読めないのも、毎回ここで検索から始めているからです。
ですから、確認するたびに探すのではなく、業務ごとの照合先を先に固定します。法令や条文なら法令検索の公式サービス、統計や白書なら政府統計のポータルと各省庁が出している原典の資料、企業情報ならその企業自身のIR資料やプレスリリースと法人番号の公表サイト、判例なら裁判所のウェブサイト、規格や制度なら所管官庁の告示、自社の数字なら社内の原簿です。自社の数字については、AIにも社内の説明資料にも聞かず、必ず原簿に当たってください。判定基準は一つで、その情報を作った当人が出しているかどうか、それだけです。誰かがまとめ直した時点で、それは照合先ではありません。
もう一つ、照合先を決めると同時に処理を決めておきたいものがあります。出典が存在しない主張です。誰が言ったのか分からない一般論、将来の見通し、「そう言われています」という書き方。これらは確認しようとしても照合先がないので、探すだけ時間が溶けます。業務文書では、確認するのではなく落としてください。書かないという判断も、ファクトチェックの結論の一つです。
複数のAIが同じ答えを返しても、間違いは残る
ファクトチェックの方法として広く勧められているのが、別のAIに同じことを聞いて答え合わせをする方法です。手軽ですし、実際に食い違いが出れば疑うきっかけになります。ただ、この方法には限界があり、その限界はほとんど語られません。複数のモデルが一致したという事実は、正しさの証拠ではありません。それは、同じ情報源を見た証拠にすぎない可能性があります。
なぜなら、主要なモデルは重なりの大きい公開情報を学習しているからです。ある誤りがネット上に広く存在していれば、どのモデルもそれを学んでいます。人間の世界で、同じ噂を聞いた三人に確認しても裏が取れないのと同じことが起きます。ここを取り違えると、二重に確認したという安心だけが残り、誤りはそのまま通ります。以下では、同じ誤りが揃って出る条件と、そもそもこの方法が効く問い・効かない問いを分けて整理します。
別のモデルでも同じ誤りが出る3つの条件
条件は大きく三つあります。一つ目は、その誤情報がネット上に広く存在している場合です。転載や引用を重ねて広まった誤った数字や、誤った経緯の説明は、複数のモデルが同じように学んでいますから、揃って同じ答えを返します。二つ目は、日本語のローカルな話題で、そもそも情報量が少ない場合です。自治体ごとの制度、中小企業の社名や沿革、業界の商慣行、地名の読みなどは、確かな記述が薄いところを推測で埋めるため、どのモデルも似た埋め方をします。
三つ目は、直近に変わった事項です。法改正、料金や制度の改定、組織変更や社名変更のように、変更前の情報が大量に残っていて変更後の情報が少ない領域では、モデルを変えても古いほうの答えが返ってきます。この三つはいずれも、モデルの性能の問題ではなく、参照している世界が同じであることによる問題です。だから、より賢いモデルを足しても解決しません。
クロスチェックが効く問い/効かない問い
とはいえ、別のAIに聞く方法が無意味なわけではありません。効く問いがあります。計算、論理の筋道、文章の整合性です。これらは別のモデルが手順を踏み直せるため、食い違いが表に出ます。「この段落は前の段落と矛盾していないか」「この計算をもう一度やり直して」という使い方は有効ですし、長い文書の中の言い落としを見つけるのにも向いています。ここは積極的に任せてよい範囲です。
効かないのは、外の世界の事実を問う場合です。固有名詞が実在するか、その数値の出所はどこか、条文の番号は何番か、いまの制度はどうなっているか。こうした問いは、モデルを何台並べても確定しません。確定できるのは、それを出した当人の情報に当たったときだけです。つまり、前章で照合先を決めておくことは省略できません。AIにAIを検証させる使い方は、計算と整合性のチェックに限定し、事実の確定には使わない。この線引きが、複数AIの正しい使い方です。
見落とすのはAIではなく確認する側——自分に出させた文章は疑えない
疑うという行為は、意志や注意力の産物というより、位置関係の産物なのかもしれません。仕事の文書がこれまで一応の精度を保ってきたのは、関わる全員が慎重だったからではなく、書く人と読む人のあいだに距離があったからです。担当者が書いたものを課長が読み、別の部署が受け取り、最後に社外の目に触れる。その一つひとつの受け渡しで、書いた事情を知らない誰かが、素の状態で文字を読みます。誤りはそこで引っかかっていました。つまり、確認という機能は個人の能力ではなく、工程の距離が担っていたわけです。
生成AIを入れると、この距離が消えます。指示を出した人がそのまま出力を受け取り、そのまま整えて、そのまま出せてしまう。速くなったのは工程であり、同時に短くなったのは受け渡しの回数です。ここを見誤ると、対策は「気をつけて読む」という個人の心構えに集約されていきます。ですが、もともと個人が担っていなかった機能を、個人の努力で埋め直すのは無理があるはずです。ハルシネーション対策で本当に問い直すべきなのは、AIの出力が正しいかどうかよりも、失われた距離をどこに作り直すか、なのだと思います。
ここまでは、どこまで確認するか、どこを見に行くか、機械に何を任せられるかを決めてきました。残っているのは、確認する人間が本当に機能しているのかという問題です。対策の記事はどれも「AIを疑いましょう」と書きますが、疑う側が見落とす構造にはほとんど触れません。実務で誤りが通ってしまう原因の多くは、注意力の不足ではなく、確認する人の立ち位置にあります。
プロンプトを書いた本人が、そのまま確認者を兼ねている。これが最大の落とし穴です。自分が指示した内容が返ってきているので、読んでも違和感が立ちません。自分で書いた文章の誤字が自分では見つからないのと同じ現象が、規模を大きくして起きます。さらにAIの文章は文体が整っていて読みやすいため、すらすら読めてしまうこと自体が確認の緩みを生みます。読みにくい文章のほうが、かえって立ち止まって確かめるものです。
書かせた人と確かめる人を分ける、最小の運用
対策は単純で、書かせた人と確かめる人を分けることです。ただし全件で分けるのは現実的ではありませんし、そうしようとすれば前章までの線引きが台無しになります。分けるのは強度3のものだけにしてください。外に出る、記録に残る、数字と固有名詞が入る、この条件に当たる文書に限って、他人の目を一度通す。それ以外は本人が確認して終わりで構いません。
そして、この役割に専任のレビュー担当を置く必要はありません。台帳や承認フローを作ると、途端に運用が重くなって回らなくなります。隣の席の人に「数字と固有名詞だけ見て」と渡す、それだけで十分です。作った本人ではない目が、期待の入っていない状態で見る。この短い時間が、時間をかけた自己チェックより確実に効きます。重要なのは分ける時間の長さではなく、分けるという事実のほうです。
見落としが集中する4か所(桁・年度・固有名詞・出典URL)
他人の目に何を見てもらうかも、あらかじめ決めておきます。見落としが集中するのは四か所です。一つ目は桁です。万と億の取り違え、一桁のずれは、文章として自然に読めてしまうため、読み流すと気づきません。二つ目は年度です。和暦と西暦、年度と暦年、改正の前と後。どれも文中では小さな違いにしか見えませんが、意味は反転します。
三つ目は固有名詞のわずかな差です。株式会社が社名の前につくのか後ろにつくのか、旧社名のままになっていないか、似た名前の制度と取り違えていないか。四つ目は出典のURLです。リンクが存在していても中身が別の資料だったり、そもそも開かなかったりします。これらは「AIが間違えやすい場所」として並べられることが多いのですが、ここではあえて「人が見落としやすい場所」として挙げています。見る側が意識して止まらない限り、目は素通りします。
「確認した」を記録に残す——後から誤りが出たとき遡れるか
誤りが社外で発覚したとき、実際に問われるのは「AIが間違えた」ではありません。「誰が確認したことになっていたのか」です。ここに答えられないと、何が起きるか。その一件を説明するために、同じ時期に同じやり方で作った成果物を、すべて確認し直すことになります。対策のコストが一気に跳ね上がるのはこの瞬間で、しかも本来なら不要だったはずの作業です。
逆に、確認の記録さえ残っていれば、影響範囲はその一件に閉じます。前章までで決めた強度を運用に固定するのも、この記録の役目です。決めただけのルールは時間とともに曖昧になりますが、書く欄があるものは残ります。ただし、重い仕組みにすると誰も書かなくなり、全件確認と同じ失敗を繰り返します。残すものは最小限にしてください。
残すのは3項目だけ(何を/どの出典で/誰が)
記録するのは三項目だけです。何を確認したか、つまり文書のどの記述を確認対象にしたか。どの出典で確認したか、つまりURLか資料名。そして誰が確認したか。この三つがあれば、後から遡るには足ります。日時はファイルの更新履歴に残っていますから、あらためて書く必要はありません。
置き場所も大げさにしないでください。文書の末尾に一行添えるか、共有ドライブのコメント欄に書くだけで十分です。専用のツールも、チェックリストの台帳も、承認の押印も要りません。記録を残す目的は管理することではなく、後から辿れるようにすることだけです。書くのに時間がかかる形式にした瞬間に、現場は書かなくなり、記録は「書いてあるものと書いていないものが混在する」という最も使えない状態になります。三項目一行、これを守ってください。
未チェックの生成物とチェック済みを混ぜない置き場のルール
もう一つ、記録と同じくらい効くのが置き場の分離です。実務で起きる事故の多くは、確認を怠ったからではなく、「下書きのつもりのファイルがそのまま送られた」型で起きます。確認前の生成物と確認済みの文書が同じフォルダに並んでいれば、急いでいるときに取り違えるのは避けられません。人の注意力で防ぐ話ではなく、置き場で防ぐ話です。
やることは、ファイル名の頭に確認前と分かる印をつけるか、保存先のフォルダを分けるか、そのどちらかだけです。運用が増えるわけではありません。加えて、強度3の文書では、AIに出させた出典やこちらで確認した出典を本文中に残したまま作業を進め、納品版を作る最後の工程でまとめて外すようにしてください。先に消してしまうと、後から一件だけ確認したいときに、また探し直すことになります。
プロンプトとRAGでどこまで減らせるか——技術対策の期待値
技術的な工夫で発生を減らすことはできます。ただし、減らせる量と、減らせない部分を取り違えないでください。よく紹介される対策と、その期待値を整理します。結論から言えば、これらは確認しなければならない範囲の分母を下げますが、前の章で決めた強度3の確認をゼロにはしません。「RAGを入れれば防げますか」「完全になくせますか」という問いへの答えも、この表の中にあります。
| 対策 | どこまで減るか | 残る誤り |
|---|---|---|
| 出典を必ず添えさせる | 検証の起点ができ、確認が速くなります | 出典そのものが実在しないことがあります |
| 分からない場合は分からないと答えさせる | 推測で埋める頻度は下がります | 誤りだと自覚していない箇所は、そのまま断定で返ります |
| タスクを限定・分割する | 推測の余地が減り、精度は上がります | 分割した各所での事実の誤りは残ります |
| 社内文書を読ませる(RAG) | 参照範囲が社内資料に絞られます | 社内文書に載っていない範囲では、従来どおり創作します |
まとめ:今週決める3つ
ルールを作る話にはしないでください。決めるのは三つだけで、いずれも今週中に終わります。一つ目は、自分の部署の主な成果物を強度1から3に振り分けることです。紙一枚に書き出す作業で、そう時間はかかりません。二つ目は、業務ごとの照合先を一枚にまとめることです。この記事の表を自社版に書き換えるだけで構いません。
三つ目は、強度3に振り分けた文書だけ、他人の目を一度通し、確認した三項目を一行残すことです。全社の運用を変える必要はありませんし、承認フローを作る必要もありません。明日つくる一件から、確認しないものと確認するものが分かれていれば、それで足ります。

