AI のハルシネーション事例:実際の企業ワークフローでどのように現れるか

大きな損失につながる AI のハルシネーションは、オンラインで話題になるような面白いスクリーンショットの形で現れるとは限りません。たとえば、チャットボットが存在しない払い戻しポリシーを案内し、後に裁判所が航空会社へ賠償金の支払いを命じたケースがあります。政府へ納品されたコンサルティング レポートに、架空の引用が含まれることもあります。医療用文字起こしツールが、医師の指示していない治療内容を追加する場合もあります。本記事では、実際の企業ワークフローで確認された AI のハルシネーション事例を取り上げ、発生する理由と、その代償を解説します。

主なポイント

  • AI のハルシネーションとは、根拠となる資料や検証可能な事実に裏付けられていないにもかかわらず、確信を持って提示される生成結果です。主に、現実の事実と矛盾する「事実性のハルシネーション」と、与えられた情報源と矛盾する「忠実性のハルシネーション」の 2 種類があります。
  • 企業で確認された事例には、架空の判例 (Mata v. Avianca)、Air Canada が裁判所から賠償金の支払いを命じられる原因となったチャットボットによる架空のポリシー、Deloitte が政府へ納品した有償レポート内の偽の引用、医療記録の文字起こしに追加された架空の内容、スロップスクワッティングに悪用された架空のソフトウェア パッケージなどがあります。
  • 最も大きな損失につながるハルシネーションは、明らかな誤りではなく、流ちょうで一見もっともらしい内容です。そのため、レビューをすり抜け、顧客、規制当局、裁判所にまで届いてしまいます。
  • モデルが進化してもハルシネーションがなくならないのは、推論モデルがより多くの主張を生成し、エージェント型ワークフローでは複数ステップにわたりエラーが重なり、検索を利用しても必ずしも根拠付けが保証されないためです。
  • 企業に必要なのは、アーキテクチャ レベルの対策です。出力単位の情報源トレーサビリティ、影響度スコアリング、エージェントの完全な実行ログ、人による異議申し立てと修正の仕組みを、自社のワークフローで評価する必要があります。

まず定義から確認します。この問題では、正確な理解が重要です。AI のハルシネーションとは、生成 AI システムが確信を持って提示した出力のうち、システムの根拠資料や検証可能な事実に裏付けられていないものを指します。技術的な意味で、モデルが故障しているわけではありません。モデルは設計どおりに、もっともらしいテキストを予測しています。しかし、もっともらしさと真実は同じではありません。AI のハルシネーションには、捏造された事実、架空の引用、存在しない製品、作り上げられたポリシー、誤った帰属などが含まれ、正しい回答と同じように流ちょうで自信に満ちた文体で提示されます。

この問題を理解する必要があるのは、誤った回答が法務、財務、または業務上の影響をもたらすワークフローで生成 AI を導入するすべての担当者です。

具体的には、法務/コンプライアンス部門、カスタマー サービス責任者、財務部門、医療機関の運用担当者、AI 支援で作成したコードを製品やサービスへ組み込むエンジニアリング チームなどが該当します。

本記事では、AI のハルシネーションの明確な定義、企業ワークフロー別に整理した 7 つの事例カテゴリ、そのコストが発生する仕組み、モデルが進化しても問題が続くアーキテクチャ上の理由を解説します。

AI のハルシネーションとは:企業向けの実用的な定義

AI のハルシネーションとは、正確には何でしょうか。根拠のない生成コンテンツであり、「根拠がない」ことこそが危険性の核心です。「わかりません」と回答するモデルは安全です。一方、事件番号やもっともらしい引用文まで備えた架空の判例を生成するモデルは、作業負担とリスクを同時に生み出します。

企業のリスク評価では、次の 2 種類の AI ハルシネーションが重要です。

  1. 事実性のハルシネーション:出力が、検証可能な現実の事実と矛盾します。例:実在しない研究論文を引用する。
  2. 忠実性のハルシネーション:出力が、与えられた情報源と矛盾するか、その内容を超えます。例:元の文書にない主張を要約へ追加する。

企業環境では、忠実性のハルシネーションのほうが気付きにくい脅威です。この問題は、本来ハルシネーションを抑えるはずの検索拡張生成 (RAG) システムでも発生します。モデルへ適切な文書を与えても、その範囲内だけで回答するとは限りません。

ハルシネーションの議論で頻出する用語

  • AI のハルシネーション:根拠資料や検証可能な事実に裏付けられていないにもかかわらず、確信を持って提示される生成結果。
  • 事実性のハルシネーション:現実の事実と矛盾する出力 (捏造された統計や、実在しない判例など)。
  • 忠実性のハルシネーション:モデルに与えられた情報源と矛盾する、またはその範囲を超える出力 (文書にない主張を追加した要約など)。
  • 作話 (Confabulation):一部の研究や NIST AI リスク マネジメント フレームワークで使われる、ハルシネーションの同義語。生成システムの信頼性リスクとして扱われます。
  • グラウンディング:モデルの出力を検証可能な根拠資料に結び付けること。強固なグラウンディングはハルシネーションのリスクを低減しますが、完全には排除できません。
  • スロップスクワッティング:AI コード アシスタントが生成した架空のソフトウェア パッケージ名を第三者が登録し、悪意のあるコードを仕込むサプライ チェーン攻撃。「AI slop」と「typosquatting」を組み合わせた用語です。

これらの違いは、種類によって対策が異なるため、リスク評価で重要です。事実性のハルシネーションには、グラウンディングと情報源管理の強化が必要です。忠実性のハルシネーションには、検索された個々の情報源と照合する出力レベルの検証が求められます。これは、より難易度が高く、アーキテクチャに関わる課題です。

実際の企業ワークフローで発生した 7 つの AI ハルシネーション事例

以下は公に記録されている AI ハルシネーションの事例を、発生したワークフロー別に整理したものです。共通しているのは、どの事例でも出力が流ちょうかつ具体的でありながら、誤っていたことです。

1. 法務調査:架空の判例

Mata v. Avianca (2023 年) では、弁護士が実在しない複数の判決を引用した準備書面を連邦裁判所へ提出しました。ChatGPT は、もっともらしい引用情報を含む判例を作り上げ、確認を求められた際にもその真正性を「確認」しました。裁判所は弁護士へ制裁を科しました。その後、複数の国の裁判所が、AI による架空の引用を含む多数の提出書類に制裁を科しています。また、Stanford RegLab の調査では、汎用モデルが法律関連の質問の 69 ~ 88% でハルシネーションを発生させることが示されました。法律文書は情報量が多く複雑であり、参照される判例には利用頻度の低いものが数多く含まれます。実在しない判例を根拠として引用すれば、専門職として懲戒処分を受ける可能性があります。

2. カスタマー サービス:架空のポリシー

Air Canada の Web サイトに設置されたチャットボットは、顧客に対し、正規運賃の航空券を購入した後で忌引割引を申請できると案内しました。しかし、そのようなポリシーは存在しませんでした。2024 年、カナダの裁判所は、チャットボットは独立した存在であり、その発言にはチャットボット自身が責任を負うという航空会社の主張を退け、航空会社に賠償金の支払いを命じました。この判断は広く当てはまります。顧客向け AI の発言は、企業の発言として扱われます。

3. コンサルティングとレポート作成:有償成果物に含まれた架空の引用

2025 年後半、Deloitte Australia は、オーストラリア政府から委託されたレポートに、実在しない情報源への参照など AI が生成した誤りが見つかったことを受け、報酬の一部を返金しました。これは、生成 AI の導入が最も進んでいる一般的なナレッジ ワーク、すなわちレポート作成で発生した事例です。ハルシネーションが専門家によるレビューをすり抜け、有償顧客にまで届いたことを示しています。

4. 医療文書:内容を追加する文字起こし

2024 年の Associated Press の調査では、医療用文字起こしツールで広く使用されている OpenAI の音声テキスト変換モデル Whisper が、臨床会話の文字起こしに、架空の投薬や所見を含む文全体を追加する場合があると報告されました。調査対象となった文字起こしのうち、無視できない割合で架空の内容が確認されています。文書化ワークフローでは、作り上げられた文がエラーには見えず、記録の一部に見えてしまいます。

5. ソフトウェア エンジニアリング:生成コード内の架空パッケージ

コード アシスタントは、実在しないソフトウェア パッケージのインポートを繰り返し提案します。セキュリティ研究者は、攻撃者がこうした架空のパッケージ名を登録して悪意のあるコードを仕込めることを実証しています。このサプライ チェーン攻撃は、スロップスクワッティングと呼ばれることがあります。ここでのハルシネーションは、単なる誤った出力ではありません。開発ワークフロー内で悪用可能な攻撃対象領域になります。

6. 財務分析:出典を追跡できない数値

財務ワークフローにおける生成 AI のハルシネーションは、より見分けにくい傾向があります。たとえば、決算数値を誤った四半期に帰属させる、契約条項のしきい値を検索せず「記憶」に基づいて回答する、根拠文書にない推論でリスク評価を正当化する、といったケースです。財務チームが手作業のレビューで発見するため、公になる事例は多くありません。しかし、この検出作業そのものが隠れたコストです。アナリストが AI の出力を毎回再検証するなら、同じ作業へ二重にコストを支払っていることになります。規模を示す事例として、Deloitte CFO Advisory は 2026 年 1 月、ある医療関連企業で、財務部門が根拠を示して妥当性を説明できる成果との対応関係を追跡できないトークン消費により、年換算で約 600 万ドルの想定外の AI コストが発生したと報告しました。

7. 一般公開コンテンツ:発表当日の誤り

Google の Bard は、2023 年 2 月のデモで、ジェイムズ・ウェッブ宇宙望遠鏡が太陽系外惑星を初めて撮影したと述べたことで知られています。しかし、これは誤りでした。同じ日に Alphabet の時価総額は約 1,000 億ドル下落しました。この事例が今も引用されるのは、問題の全体像が 1 つの場面に凝縮されているためです。企業ブランドを背負った公開の場で、自信に満ちた、具体的で、もっともらしい主張が提示されたにもかかわらず、誤っていたのです。

政府サービスと開発者向けツールで発生した、さらに 2 つの事例

政府サービス:ニューヨーク市の MyCity チャットボット。2024 年の調査報道では、大手クラウド AI サービスを基盤に構築されたニューヨーク市公式の中小企業向けチャットボットが、法律に反する案内をしていたことが判明しました。一時は、雇用主が従業員のチップを受け取ってよいと示唆していました。政府のチャットボットが誤った法務/規制情報を提供する問題は、Air Canada の事例を公共部門に置き換えたものであり、影響を受けるのは顧客ではなく市民です。

開発者向けツール:架空のポリシーを作り上げた AI サポート エージェント。2025 年、AI コーディング ツール Cursor の AI サポート エージェントが、複数デバイスでの製品利用を制限する、実在しないポリシーを案内したとユーザーから報告されました。会社が訂正するまで、存在しないルールを理由にサブスクリプションを解約したユーザーもいました。この事例では、企業が顧客向けに導入した AI が、自社製品について誤った説明を行い、自社の売上とブランドを損なうことになりました。

ワークフロー リスク別に整理した AI ハルシネーション事例

ワークフロー確認された事例主なリスクコストを負担する部門/関係者
法務調査と裁判所への提出Mata v. Avianca の架空判例裁判所による制裁、職務上の過失責任法務部門、外部弁護士
カスタマー サービスAir Canada のチャットボット ポリシー法的責任、ブランド毀損サポート、法務、ブランド管理
レポートと成果物Deloitte Australia の政府向けレポート返金、信用の低下コンサルティング チーム、顧客からの信頼
臨床文書Whisper の文字起こしで生成された架空の内容患者の安全、記録の完全性医療従事者、コンプライアンス部門
ソフトウェア開発架空のパッケージ名サプライ チェーンの侵害エンジニアリング、セキュリティ
財務分析追跡できない数値と推論誤った意思決定、再検証コスト財務、リスク管理
一般公開コンテンツBard による JWST に関する主張市場とブランドへの影響会社全体
政府サービスニューヨーク市の MyCity チャットボット市民への被害、法的責任行政機関、住民
開発者向けツールCursor サポート エージェントのポリシー解約、企業自らが招くブランド毀損製品、サポート

モデルが進化しても AI のハルシネーションがなくならない理由

業界では、ハルシネーションは減少していると説明されています。限定的な要約ベンチマークでは、実際に減っています。しかし、本番環境のデータでは、次の 3 つの理由から異なる状況をが示されています。

推論モデルは、より多くの主張を生成します。OpenAI が 2025 年 4 月に公開したシステム カードでは、o3 モデルが PersonQA のプロンプトの 33% でハルシネーションを発生させ、前世代の o1 の 2 倍に達したと報告されています。推論チェーンが長くなるほど主張が増え、すべての主張が誤りの発生機会になります。

エージェント型ワークフローでは、エラーが重なります。計画、検索、ツールの呼び出し、最終回答の作成を行うエージェントは、どのステップでもハルシネーションを起こす可能性があり、エラーは後続処理へ伝播します。Microsoft Research は、エージェント型タスクで、チャット形式の対話のおよそ 1,000 倍のトークンが消費されると測定しています。企業がまさに拡大しているのは、ステップごとのエラー率が積み重なる形のワークロードです。

検索は、回答の根拠付けを保証するものではありません。RAG は問題の範囲を狭めますが、完全には解決しません。検索によって古いポリシー文書が返された場合、モデルがその内容を忠実に要約しても、回答は誤りになります。関連情報が何も見つからなくても、多くのシステムは回答を生成します。検索されたコンテンツを基にしていても忠実性のハルシネーションは発生するため、「RAG を使用している」という説明だけでは、リスク委員会への十分な回答になりません。

企業が実施できる対策

AI ハルシネーションの事例を、具体的な対策へつなげるための簡潔なチェックリストを示します。

  • 生成 AI が重要な意思決定に関与する箇所を把握します。前述の事例は、法務、顧客対応、医療、財務、エンジニアリングのワークフローに集中しています。自社の該当箇所を特定します。
  • 回答だけでなく、出典を求めます。システムは、各出力がどの情報源に基づいて推論されたかを示す必要があります。追跡可能な情報源がない回答は、既定で未検証として扱います。
  • 情報源の品質を評価し、管理します。ハルシネーションを短期間で減らす方法は、モデルが依存する不適切な情報源を特定して修正することです。そのためには、データ レベルで影響度を可視化する必要があります。
  • エージェントの完全な実行トレースを記録します。複数ステップのワークフローで問題が発生した場合、原因となった箇所を特定するには、すべてのステップを確認する必要があります。
  • 影響の大きい出力では、人による管理を維持します。担当者が AI の出力へ異議を申し立て、内容を確認し、必要に応じて修正できる仕組みは、優れた運用というだけでなく、EU AI Act に基づく規制上の要件になりつつあります。
  • 自社環境で発生率を測定します。実際のワークフローの質問から評価セットを作成し、ハルシネーション率と、出力の根拠を示して妥当性を説明できる割合を継続的に追跡します。公開ベンチマークだけでは、自社の状況を評価できません。

Seekr が SeekrFlow を設計したのは、AI の出力に根拠と追跡可能性を持たせるためです。SeekrFlow は、モデルを中身の見えない箱として扱いません。すべての出力を、その形成に影響した特定の根拠文書やトレーニング データまで追跡し、各情報源が回答へ与えた影響度をスコア化します。さらに、エージェント ワークフロー全体の実行トレースを記録します。出力が誤っている場合、チームは原因を確認して情報源を修正し、その修正効果を証明できます。これにより、ハルシネーションへの対応を、問題発生後の個別対応から継続的な運用プロセスへ移行できます。SeekrGuard は、モデルを本番環境へ移行する前に評価と認証を追加します。これは、前述の事例の多くで実施されていなかったステップです。

率直に言えば、どのようなアーキテクチャでも、前述の事例を完全に防げるわけではありません。生成システムは確率的であり続けます。また、影響の小さい社内文書の作成を人がレビューする用途では、包括的な情報源管理基盤を導入する合理性がない場合もあります。判断基準は、出力がもたらす影響の大きさです。出力が制裁、法的責任、患者記録の誤り、市場への影響を引き起こす可能性がある場合、トレーサビリティの有無が、説明できるインシデントと説明できないインシデントを分けます。

国内における信頼できる AI の導入・運用に関するご相談

本記事で紹介したように、AI のハルシネーション対策では、モデルの精度だけでなく、出力の根拠を追跡し、問題の原因を特定して継続的に改善できる仕組みが重要です。一方で、必要な対策や評価方法は、対象となる業務、利用データ、既存システム、求められる説明責任の水準によって異なります。

エクセルソフトでは、SeekrFlow に関するご質問への回答、製品デモ、生成 AI のユースケースやシステム/デプロイメント要件のヒアリング、要件と予算に応じたプランのご提案、POC 支援、お見積りに対応しています。また、技術サポートをご購入いただいたお客様には、導入時および導入後の製品利用に関するお問い合わせ窓口を日本語で提供します。SeekrFlow の導入を検討されている場合は、お気軽にご相談ください。


この記事は、Seekr 社の Web サイトで公開されている「AI Hallucination Examples: What They Look Like in Real Enterprise Workflows」の日本語参考訳です。原文は更新される可能性があります。原文と翻訳文の内容が異なる場合は原文を優先してください。


タイトルとURLをコピーしました