Gemini・ChatGPT・Google AIはどれが一番ハルシネーションが多い?比較するときに知っておきたい事実

プログラミング

生成AIを使ううえで避けて通れない問題の一つが「ハルシネーション」です。もっともらしい文章なのに、実在しない人物・論文・URLを挙げたり、日付や制度を間違えたりすることがあり、ChatGPTやGeminiを情報収集に使う場合には注意が必要です。

では、Gemini・ChatGPT・Google AIのうち、どれが一番ハルシネーションを起こしやすいのでしょうか。実は、この3つをそのまま並べて「1位・2位・3位」と決めることはできません。理由は、GeminiとChatGPTはそれぞれ複数のモデルや機能を持つサービスであり、「Google AI」は一つの特定モデルを指す名称ではないからです。

結論を先にまとめると、「Gemini・ChatGPT・Google AIの中では○○が最もハルシネーションが多い」と一般化できる信頼性の高い共通データはありません。比較するならサービス名ではなく、「どのモデルを、検索あり・なしのどの条件で、何について質問したか」をそろえる必要があります。

そもそも「Gemini・ChatGPT・Google AI」は同じ分類ではない

まず整理したいのが名称です。ChatGPTはOpenAIが提供するAIサービスで、その中で複数のモデルや検索・調査などの機能が使われます。GeminiもGoogleが提供するAIアシスタントの名称として使われる一方、その基盤となるGeminiモデルには複数の種類があります。

一方、「Google AI」は通常、ChatGPTやGeminiと一対一で比較できる単独の生成AIモデル名ではありません。GoogleにはGeminiのほか、Google検索のAI OverviewsやAI Modeなど、生成AIを利用した複数の機能があります。

例えば「GeminiとGoogle AIを比較する」といっても、Google AIがGoogle検索のAI Overviewsを意味するのであれば、これは「GeminiというAIアシスタント」と「検索結果を利用して回答を生成するGoogle検索機能」の比較になります。前提条件が異なるため、単純なハルシネーション率の比較にはなりません。

ハルシネーションとは何か

ハルシネーションとは、生成AIが事実ではない内容を、もっともらしい回答として生成してしまう現象を指します。OpenAIも、ChatGPTが誤った情報や存在しない引用・研究・参考文献などを生成することがあると公式に説明しています。OpenAI公式情報[参照]

典型的な例としては、「実在しない本のタイトルを紹介する」「存在しない裁判例を示す」「人物の経歴や生年月日を間違える」「存在しないURLや論文を引用する」といったものがあります。

厄介なのは、文章の自然さと正確性が別物である点です。文法的に自然で詳しく説明されていても、内容まで正しいとは限りません。OpenAIも、AIが誤っている場合でも自信があるような回答を生成する可能性を明示しています。

ChatGPTにもハルシネーションはある

ChatGPTは高性能な生成AIですが、ハルシネーションがなくなったわけではありません。OpenAIは2025年に公開したハルシネーションに関する研究解説で、最新モデルではハルシネーションが減少しているものの、依然として大規模言語モデルに残る重要な課題だと説明しています。OpenAI「Why language models hallucinate」[参照]

さらにOpenAIはモデルごとに事実性評価を実施しています。つまり「ChatGPTのハルシネーション率」という一つの固定値があるのではなく、利用するモデル、質問の種類、検索などのツール利用条件によって結果が変わります。

例えば、モデル内部の知識だけで最新ニュースについて答えさせる場合と、Web検索を行い複数の最新資料を参照して答える場合では条件が大きく異なります。そのため、ChatGPTというサービス名だけでハルシネーションの多さを評価するのは適切ではありません。

Geminiにもハルシネーションはある

Geminiについても同様です。Google自身がハルシネーションを生成AIにおける課題として認識しており、モデルの事実性を評価・改善する研究を続けています。

Google DeepMindはLLMの事実性を評価する「FACTS Benchmark Suite」を公開しており、Grounding、Parametric、Search、Multimodalなど複数の観点からモデルを評価しています。Google DeepMind FACTS Benchmark Suite[参照]

2025年末にGoogle DeepMindが公表した結果では、当時評価した15モデルの中でGemini 3 Proが総合FACTS Score 68.8%で首位となりました。一方、Google自身が「すべての評価モデルが70%未満だった」と説明しており、高性能なモデルでも事実性が完全ではないことが分かります。

「Geminiは絶対にChatGPTより正確」とも「ChatGPTの方が正確」ともいえない

生成AIを比較した記事では「Geminiの方がハルシネーションが少ない」「ChatGPTの方が正確」といった結論を見ることがあります。しかし、その結果をすべての用途へ一般化することはできません。

例えば、あるベンチマークではGeminiの特定モデルが上位でも、別の推論テスト、プログラミング、長文処理、検索を伴う質問などでは順位が変わる可能性があります。さらにモデルは継続的に更新されるため、数年前のGPTとGeminiを比較した結果を現在のサービスへそのまま当てはめることもできません。

「Gemini対ChatGPT」ではなく、「Geminiのどのモデル対GPTのどのモデルを、どの評価方法で比べた結果なのか」を確認することが重要です。

Google検索のAI Overviewsなら話が少し変わる

「Google AI」がGoogle検索に表示されるAI Overviewsを意味している場合、GeminiチャットやChatGPTとの比較にはさらに注意が必要です。AI Overviewsは、一般的なチャット型LLMが内部知識だけから文章を生成する場合とは仕組みや目的が異なります。

GoogleはAI Overviewsについて、検索結果を利用して回答を生成し、関連するWebページへのリンクを提示する設計にしています。Googleは2024年の説明で、AI Overviewsが誤った回答をする場合には、典型的なLLMの「作り話」だけではなく、検索クエリやWeb上の文章の解釈を誤るケースなどがあると説明しています。Google公式 AI Overviewsの説明[参照]

ただし、検索結果を利用しているからといって必ず正しいわけではありません。元になったWebページが間違っていたり、AIが文脈を取り違えたり、古い情報を参照したりすれば、最終的な回答も誤る可能性があります。

2026年現在のGoogle検索ではGemini 3がAI Overviewsに使われている

生成AIは更新が非常に速いため、比較記事では時点も重要です。Googleは2026年1月、Google検索のAI OverviewsでGemini 3をデフォルトモデルとして利用すると発表しています。Google公式発表[参照]

つまり、2024年にGoogle検索の生成AIを試した経験と、2026年のAI Overviewsを使った経験では、同じ「Google AI」であっても中身が同一とは限りません。

ChatGPT側も同様にモデルや検索機能が更新されています。したがって「以前使ったときGeminiの方が間違えた」という個人の体験は参考にはなりますが、現在のサービス全体のハルシネーション率を証明するデータにはなりません。

なぜ「どれが一番多い」を数字で答えにくいのか

ハルシネーション率を比較するには、最低でも条件をそろえる必要があります。例えば次のような条件です。

条件 結果に影響する理由
モデル 同じサービスでも高性能モデルと軽量モデルでは能力が異なる
検索の有無 最新情報を外部から取得できるかが変わる
質問分野 歴史、法律、医学、人物、プログラムなどで得意不得意が異なる
質問の難易度 有名な事実と非常にマイナーな事実では誤答率が異なる
回答を拒否できるか 分からないと回答するモデルと推測するモデルではハルシネーション率が変わる
評価基準 一文でも誤りがあれば失敗とするのか、個々の主張を採点するのかで数字が変わる

そのため、異なる会社が異なるテストで発表した数字をそのまま横に並べて「20%対10%だからこちらが優秀」と判断するのも危険です。

ベンチマークの「正答率」とハルシネーション率も同じではない

AI比較で特に混同されやすいのが、ベンチマークの正答率とハルシネーション率です。正答率70%だから残り30%がすべてハルシネーション、という単純な関係ではありません。

例えば、分からない質問に「判断できません」と答えた場合、正答率を測るテストでは不正解になることがあります。しかし、架空の答えを自信満々に作ったわけではないため、ハルシネーションとしての評価は異なる可能性があります。

OpenAIも、従来の評価方法が「分からない」と回答するより推測した方が得点しやすくなることがあり、それがハルシネーションを促す要因になり得ると論じています。OpenAI研究解説[参照]

同じAIでも質問によってハルシネーションの起こりやすさは変わる

AIが間違いやすいのは、単純に難しい質問だけではありません。「世の中に情報はあるが非常にマイナー」という質問も要注意です。

例えば「東京タワーの高さは?」のように大量の資料が存在する質問と、「1998年に地方の小さな大会で3位だった人物は?」という質問では、後者の方が正確な情報をモデル内部から再現するのが難しくなります。

実在するかどうか怪しい人物・商品・論文について「詳しく教えて」と質問するのも典型例です。モデルが質問の前提を疑わず、存在するものとして架空の説明を組み立ててしまう可能性があります。

ハルシネーションを減らしたいなら「検索できるAI」を使えば終わりではない

Web検索を利用できる生成AIは、最新情報やマイナーな情報について外部資料を参照できるため、内部知識だけで回答する場合より事実確認をしやすくなります。しかし、検索機能が付いているだけで誤情報がゼロになるわけではありません。

重要なのは、回答に出典が付いているかだけではなく、その出典に本当に同じ内容が書かれているかを確認することです。AIが適切なページを示していても、回答部分では資料を誤解している可能性があります。

特に法律、医療、税金、投資、契約など重大な判断につながる内容では、AIの回答そのものではなく、官公庁、法令、医療機関、公的機関、企業公式資料など一次情報まで確認することが重要です。

実際にGeminiとChatGPTを比較するなら同じ問題を出す

自分の用途でどちらが正確か知りたい場合は、一般的なランキングを見るだけでなく、自分が普段質問する分野で比較する方法があります。

例えば歴史について利用したいなら、答えと信頼できる出典を自分で確認できる問題を20~50問ほど用意し、GeminiとChatGPTへ同じ条件で質問します。「分からない場合は推測しない」「根拠となるURLを示す」といった指示も統一します。

そして、正解、明確な誤答、根拠のない推測、回答保留、出典の誤りなどを記録します。こうすると「世間一般でどちらが優秀か」ではなく、自分が使いたい用途ではどちらが信頼しやすいかを判断できます。

AIへ「出典を付けて」と頼むだけでも油断は禁物

ハルシネーション対策として「出典を示してください」というプロンプトは有効ですが、それだけで完全ではありません。生成AIは存在しない論文名、著者名、URLなどを生成することがあります。

OpenAIもChatGPTのハルシネーション例として、架空の引用、研究、参考文献を生成するケースを明示しています。OpenAI公式情報[参照]

そのため重要な情報では、リンクを実際に開き、「そのページが存在するか」「AIが主張した内容が本当に書かれているか」「公開日はいつか」まで確認すると信頼性が大きく上がります。

ハルシネーションを減らす実用的な使い方

GeminiでもChatGPTでも、使い方を工夫することで誤情報をそのまま信じるリスクを下げられます。

  • 最新情報ではWeb検索を利用する
  • 「分からない場合は推測せず、分からないと回答してください」と指示する
  • 根拠となる一次情報を求める
  • 提示されたURLを実際に開く
  • 日付・価格・人物名・法律・統計などは原典と照合する
  • 一つのAIだけで最終確認しない
  • 重要な判断では専門家や公的機関の情報を優先する

例えば「○○という法律は2026年現在も有効ですか?」という質問なら、AIに結論だけを聞くのではなく、「2026年現在の公的な一次資料を検索し、根拠となるページを示してください」と頼む方が確認しやすくなります。

「自信満々だから正しい」は生成AIでは通用しない

生成AIを使う際に特に覚えておきたいのは、文章の自信度と正確性を同一視しないことです。AIは人間のように「自分は今かなり自信がある」と理解したうえで文章の口調を決めているわけではありません。

非常に丁寧で専門的な説明の中に、一つだけ架空の固有名詞や間違った数字が混ざることもあります。むしろ文章全体が自然なため、その一つの誤りを人間が見落とすことがあります。

ChatGPT、Gemini、Google検索の生成AI機能のどれを使う場合でも、「もっともらしさ」と「検証可能な正しさ」を分けて考えることが重要です。

まとめ|Gemini・ChatGPT・Google AIのどれが一番多いとは一概に決められない

Gemini・ChatGPT・Google AIについて、「この中では○○が一番ハルシネーションが多い」とサービス名だけで順位付けすることはできません。GeminiとChatGPTには複数のモデル・機能があり、「Google AI」も一つの特定モデルを意味する名称ではないからです。

Google DeepMindのFACTS Benchmark Suiteのように複数モデルの事実性を比較する評価は存在し、特定の条件ではモデル間に明確な差も出ています。しかし、その順位があらゆる質問、言語、検索条件、サービスへそのまま当てはまるわけではありません。Google DeepMindの比較結果[参照]

また、ChatGPT側もハルシネーションの存在を公式に認め、モデル更新によって事実性の改善を続けています。したがって、古い比較結果だけから現在の優劣を決めることにも注意が必要です。

実用上もっとも重要なのは「絶対に間違えないAI」を探すことではなく、検索や一次資料を利用し、AIの回答を検証できる使い方をすることです。どの生成AIにも誤答の可能性があることを前提にすれば、便利さを活用しながらハルシネーションによる失敗を減らせます。

コメント

タイトルとURLをコピーしました