2025年8月17日日曜日

三輪眞弘について生成AIに聞いてみた(18):ChatGPT-5の検証

 本記事では、2025年8月7日にリリースされたChatGPT-5を対象に、三輪眞品さんに関する様々な問い合わせを行った結果を報告します。(2025.9.8 OpenAIが公開した論文、Why Language Model s Hallucinateについてのコメントを別記事「三輪眞弘について生成AIに聞いてみた(19):ChatGPT-5の検証への追記」として追記しましたので、併せてご覧いただければ幸いです。)

1.検証の背景

 本ブログではこれまでに生成AIに対して三輪眞弘さんに関する質問を行い、その結果を報告してきました。最初の記事の公開は2025年3月13日であり、その時点で検証対象とした生成AIは以下の通りでした。

  • ChatGPT(Web版)無料版:GPT-4o(利用制限あり)・リアルタイムWeb検索なし
  • Gemini(Web版)無料版:Gemini 2.0 Flash・リアルタイムWeb検索あり
  • Claude for Windows ver.0.8.1(Windows版アプリ)無料版:Claude 3.7 Sonnet・リアルタイムWeb検索なし

 この時点での各生成AIの回答は極めて不正確なものであることから、Llama2 SwallowベースでRAGを自作し、三輪さんに関する自分のWebページの情報を与えることによって性能が改善できることを確認しました。その一方で自分のWebページの情報について、特に事実関係に関するものを中心に強化し、気付いた誤記を修正するなどして発信する情報の品質の向上に努めてきました。

 その後わずか数か月のうちに各生成AIのバージョンアップが相次ぎ、また同一LLMを用いる場合でもリアルタイムWeb検索が可能になることで性能に変化があったため、以下のバージョンで再検証を実施しました。

  • ChatGPT 無料版:GPT-4o(利用制限あり)・リアルタイムWeb検索あり(有無を選択可能)
  • Gemini 無料版:Gemini 2.5 Flash・リアルタイムWeb検索あり
  • Claude 無料版:Claude Sonnet4・リアルタイムWeb検索あり
 検証の結果、特にリアルタイムWeb検索を併用することで、LLMの事前学習データに含まれていなかった情報についても取得できるようになったことから、大幅に回答の精度が向上し、三輪さんに関するパブリックな情報に関する限り、RAG構築の必要性がほぼなくなったと感じられる迄になりました。その一方で、ChatGPT, Geminiでは回数制限つきながら、多段階の推論を得意とするLLMを用いたDeep Search機能が利用可能となり、事実関係の問い合わせや情報収集ではない、「逆シミュレーション音楽」や「新調性主義」といったコンセプトに関するレポート作成、「虹機械」シリーズについてのレポート作成に関しても一定の性能を示すことも併せて確認して、2025年6月初めに一通りの検証報告を終えています。

 ChatGPT-5は、事前のプロモーションにおいて、更に推論機能が強化され、「大学院博士課程並み」の能力を持つとともに、4oで問題になっていた「sycophancy(へつらい・ごますり)」の問題に対して対策が行われ、「critical(批判的)」で「less effusively agreeable(あまり熱心に同意しすぎない)」な応答をするようチューニングが為されたようです。この後者の問題については、既にChatGPT-5のリリース直後から多くの反応が寄せられ、色々と話題になっています。特に4oに比べて「共感的」でなくなったという批判が大きいことから、有料版では4oが選択できるようになるなどオプションが復活しました。しかしながら本稿では無料版を使用していることからそうした変更についての直接の影響はありませんし、従来と同一のプロンプトを与えて、事実関係の問い合わせや情報収集に関して「Hallucination(幻覚)」を起こすことなく、正しい回答が返って来るかという点にフォーカスした検証結果を報告するという点にも変更はなく、直近の混乱からは距離を置いたものとなっています。

 一方でそのことは、ChatGPT-5で特に改善が行われたとされる深い推論の能力が十分に発揮されるような検証には充分ではないことも同時に意味している点に留意頂きたいと思います。なお深い推論能力については、本稿で報告する検証とは別に、フリストンの自由エネルギー原理のある問題への適用についての問い合わせをしたところ、明らかに4oに比べて1ランク上の詳細な回答が返ってくることを確認しており――但し、その内容の妥当性については検証に時間を要するため現時点で当否を報告する準備ができていませんが、——専門的な内容についての問い合わせに対しては一段と深いレベルの推論能力を備え、高いポテンシャルを有するという感触は既に得られていますが、この点については機会があれば別に報告することにしたいと思います。

2.検証内容

 まず改めて対象となるバージョンと実験を行った日付は以下の通りです。

ChatGPT-5 無料版(2025年8月15,16,17日)

 ChatGPT-5 の無料版では、標準で最新版のGPT-5がLLMとして用いられますが、実際に検証を行ってみると、10回迄の回数制限があるようです。回数制限に達すると4時間程度GPT-5は使えず、他のモデルが用いられます。ここではGPT-5の性能を検証することが目的であるため、制限に達したら検証を中止し、制限が解除されたら再開、というやり方で検証を進めたため、8月15日夜から8月17日朝にかけて検証を行うことになりました。

 検証で用いたプロンプトセットは以下の通りです。既述の通り、これらは元々は以前、llama2 / Swallowベースで自分で構築したRAGの検証用に用意したものです。

1 三輪眞弘の作品の特徴は?
2 三輪眞弘の「虹機械」とは?
3 三輪眞弘の生まれた年と場所は?
4 三輪眞弘とマーチン・リッチズとの共作は?
5 三輪眞弘の楽譜はどこで出版されているか?
6 三輪眞弘の「逆シミュレーション音楽」とは?
7 三輪眞弘と佐近田展康のユニット名は?
8 三輪眞弘のゴールデン・ニカ受賞理由は?
9 <東京の夏>音楽祭2007、手順派合同祭が行われた島の名前は?
10 「方法マシン」第一回定期公演はいつ行われたか?
11 ネットワーク・ストリーミング作品、「新しい時代」布教放送はいつ開始されたか?
12 CD「言葉の影、またはアレルヤ」(STEINHANDレーベル)はいつリリースされたか?
13 東京大学駒場博物館「Musica eMachina」展はいつからいつまで行われたか?
14 「古代の竪琴と水遊人のための、五芒星」世界初演はいつ、どこで行われたか?
15 2005年 8月18日にエスパス・スベイラン (クレ(ドローム地方)/フランス)のフェスティバルFUTURAで再演された三輪眞弘の作品は何か?"
16 2000年 4月22日に京都、アルティーで世界初演された三輪眞弘の作品は?
17 2011年 6月16日に東京藝術大学芸術情報センターで行われた三輪眞弘の講演名は?
18 2020年 9月19日 深夜に「三輪眞弘際」が行われたホールは?
19 三輪眞弘のプロフィールは?
20 三輪眞弘の著書は?
21 三輪眞弘と佐近田展康との共作は?
22 三輪眞弘の「算命楽」とは?
23 三輪眞弘の「夢のガラクタ市」とは?
24 三輪眞弘の「火の鎌鼬」とは?
25 三輪眞弘の「新調性主義」とは?
26 三輪眞弘の「東の唄」とは?
27 三輪眞弘の「赤ずきんちゃん伴奏器」とは?
28 三輪眞弘の「ひとのきえさり」とは?
29 三輪眞弘の「59049年カウンター」とは?
30 三輪眞弘の主な作品は?
31 「フォルマント兄弟」とは?
32 三輪眞弘の「ひとのきえさり」は誰の詩を使っているか?
33 三輪眞弘の「ひとのきえさり」の編成は?
34 三輪眞弘の「新しい時代」とは?
35 三輪眞弘はどの作品で芥川作曲賞を受賞したか?
36 三輪眞弘はどの作品で佐治恵三賞を受賞したか?
37 三輪眞弘のガムランのための作品は?
38 三輪眞弘のMIDIアコーディオンのための作品は?
39 三輪眞弘は誰に師事したか?
40 三輪眞弘の「虹の技法 Harmonia I」の編成は?
41 三輪眞弘の「ひとのきえさり、藤井貞和の詞による序奏と朗読」はどこで初演されたか?
42 三輪眞弘の「コンピュータ・エイジの音楽理論」はいつ出版されたか?
43 三輪眞弘の「虹機械 公案-001」公開収録はいつ?

 ChatGPT-5の無料版では、モデルの選択ができないだけではなく、リアルタイムWeb検索を行うかどうかを選択することもできません。Web検索を行うかどうかの選択はChatGPT側に委ねられています。(但し、再実行時に「Web検索を行わない」モードを選ぶことはできるようです。)勿論、プロンプトの中に明示的にWeb検索をするような指示を含めればWeb検索を併用するようになるでしょうが、ここではそうした明示的な指示なしで、検索を行うかどうかについて自体を検証対象としたため、上に示したプロンプトをそのまま与えました。

 ChatGPTは既に前のバージョンにおいても、過去の問い合わせの履歴を保持し、いわば「文脈を意識した」回答を行うことができ、そのスコープはスレッド内に留まらず、別のスレッドにも及んでいましたが、この点はChatGPT-5でも変わりません。後述の通り、このことが影響したと思われる興味深い挙動も確認できましたが、検証自体は、それまでとは異なる別のスレッドを用意し、かつ上記の全ての問いを同一スレッド内で行うやり方を採りました。また同じ理由で、問いの順番が回答に影響します。(つまり前の問いに対する結果が後続の問いの結果に影響することがあります。)この点については、今回の検証全体とレイアウトとしては、上記43のプロンプトを番号順に与えています。但し、これも後述しますが、43のプロンプトを一通り投げた後、幾つかのプロンプトについては再実行を行って、回答がどのように変わるかの追加検証を実施しています。具体的には、11, 28, 32,33,41については再度問い合わせを行っていますので、全体でプロンプトの総数は48となります。

 これも従来と同様ですが、ChatGPT-5もまた質問に対する直接の回答にあたる情報のみならず、関連する情報を付加して返してきます。その結果として、1件の回答はかなりの分量となりますし、今回はプロンプト数も多いため、記事中での結果の紹介は行わず、以下のように結果をpdf化したファイルを公開することとしました。

mm_ChatGPT-5.pdf :ChatGPT-5の回答(再質問への回答含む)

3.検証結果の概要

 今回は評価にあたり、以下の5つを区別することにしました。また上述の通り、各プロンプトの問い合わせに対して、Web検索を行ったかどうかも記録しています。上記の通り、ChatGPTの応答は、直接の回答にあたる情報のみならず、関連する情報が付加され、長大になる場合があるため、長大なものの評価については幾つかの部分に分割し、分割した各部分について行いました。(従って、1つのプロンプトについて、例えば前半は正しいが後半は間違っているといったことがあります。)

〇:概ね正しい情報が返ってきている
△:一部に明確に誤った情報が含まれる
―:元となった情報リソースに誤りがあるため評価を保留
×:誤った情報が返ってきている
□:情報を見つけることができず、回答できない

 この分類に拠れば今回の結果は以下のように要約できます。(上記の通り、回答が長大な場合、上記ファイル中では1つのプロンプトの回答を幾つかに分割して評価しており、1つの回答の前半は正しいが後半は誤りといったケースがあるため、以下の集計とは件数が一致しません。)
  • 〇=23
  • △=1
  • ―=1
  • ×=23
  • □=0 
 上に見るように、情報を見つけることができず、回答できないケースは1件もありませんでしたが、これはWeb検索を行ったケースで全て結果が得られて回答でき、回答ができなかったケースがなかったことを意味しており、実際にはWeb検索の有無についての集計結果(対のべ問い合わせ回数)は以下の通りであり、検索なしで回答しているケースが過半を占めていることも影響しているものと思われます。
  • 検索あり:22
  • 検索なし:26
 上記の結果要約で特徴的なことは、不正解率が高いことです。記事「三輪眞弘について生成AIに聞いてみた(17):最新版の生成AIにRAG検証用プロンプトを与えたら…」で報告している前回の検証結果の集計を再掲すると以下の通りです。
  • ChatGPT 4o:〇=32, △=2, ×=7, □=6
  • Gemini 2.5 Flash: 〇=38, △=2, ×=3, □=0
  • Claude Sonnet 4 :〇=19, △=1, ×=3, □=20
 前回のChatGPT4oは全てリアルタイムWeb検索を併用しており、回答できないケースが6件ある一方で、不正解は7件に留まったのに対して、今回は半分近い回答が不正解となっていることがわかります。これは明らかに、検索なしでの回答に不正解が多いことが影響しており、検索の有無毎に正解・不正解を分類すると以下のようになります。
  • 検索あり:22(〇=19, ×=2, ―=1)
  • 検索なし:26(〇=4, △=1, ×=21)
 検索なしで正解なのは、3 三輪眞弘の生まれた年と場所は?、7 三輪眞弘と佐近田展康のユニット名は?などといった一般性の高い情報のみである一方で、検索をした場合の不正解は2件(41の問い合わせを2回なので質問としては1種類)のみとなっており、リアルタイム検索を行うかどうかが、不正解率に大きく影響していることが窺えます。そしてこの点は、初回の3月のリアルタイム検索なしのモデルの回答の成績が悪くてRAGの構築に思い至ったこと、2回目のリアルタイム検索ありのモデルでは回答率が大幅に改善したこととも期を一にしており、本稿で報告する課題に限って言えば、依然としてリアルタイムでのWeb検索が回答の正確さのための重要な要因であると言えるでしょう。

 回答内容を確認すると、正解・不正解を問わず、量的にも多く、詳細な内容を含む回答となっており、また、今回特に目立つのは、最後に表形式の「まとめ」が付加されることが多い点で、回答が広範で多岐に亙る場合には適当だと思われますが、回答内容がさほど多くない場合には、単にフォーマットを変えて同じ内容を2回繰り返しているに過ぎないケースも見受けられ、やや融通が利かない感じを受けるケースもありました。

 それにしても、百歩譲って半数のみ正解は措くとしても、残りの半分の回答の内容に多くの誤りが含まれるという今回の結果を見る限り、本稿の検証対象に関して言えば、ChatGPT-5は信頼性が低すぎて実用に堪えないというのが率直な印象です。ChatGPT-4oではWeb検索を併用するようになってから正答率が7割近くまで上がり、不正解は15%程度まで落ちたことを思えば、おおまかに言って5割正解、5割不正解の今回の結果は、寧ろ改悪であると言わざるを得ません。しかしながら、その原因は明らかであり、リアルタイムWeb検索を併用しないために他なりません。既述の通りユーザーが明示的に選択してWeb検索をするよう制御するオプションは用意されていませんが、プロンプト内にWeb検索の指示を明示的に含めることによって回避できるのであれば、実際に利用するにあたっては、その点に留意して、基本的にはリアルタイムWeb検索を必ず併用するように指示しつつ利用することで回避可能な問題かも知れません。しかしながら、それは今回のような検証を行って初めてわかることであり、そうした予備知識なしにChatGPT-5を使い、ファクトチェックなしでその結果を採用するような使い方が大きな危険を伴うことは明らかであり、本稿を執筆し、公開しようと思ったのも、この点についての注意喚起をすべきと考えたからに他なりません。全体として、無料版のChatGPT-5の利用に関しては、Web検索なしで返って来た回答は「Hallucination(幻覚)」が含まれる可能性を疑い、別途ファクトチェックを行った方が良さそうです。また「Hallucination(幻覚)」を抑制するためには、プロンプトにWeb検索を必ず行うよう指示を含めるというように、明示的にリアルタイムWeb検索の指示を行う工夫が必要であると考えられます。

4,検証結果の分析

 次に個別のプロンプトに関して検証において確認された点について幾つか報告をします。最初は「11 ネットワーク・ストリーミング作品、「新しい時代」布教放送はいつ開始されたか?」についてです。このプロンプトに対してGPT-5はWeb検索を行い、その結果を用いて2002年3月10日という、結論から言えば正しくない答を返してきました。従ってここでは情報源が正しくないが故に正しくない答えが返ってきていることになります。(従って上記の回答の分類において、本プロンプトの1回目の問い合わせが唯一”ー”に分類されるケースとなりました。)

 ここで参照されているのは実は私のブログ記事であり、確かにそこでは 2002年3月10日 と記載されていたのですが、これは以前、RAGを構築した際に自分のブログ記事を読み込ませる際に気づいて「三輪眞弘主要作品表」に含まれる幾つかの誤りを修正した際に、この記事の記載の修正が漏れてしまい、ミスタイプした誤った日付が残っていたものが偶々参照されてしまった結果です。そこで早速、当該記事を修正(実際にはnoteでも同じ記事を公開しているので、noteの記事についても同様の修正を適用)、上記の回答がリアルタイム検索結果に基づくものであることはわかっていたので、「もう一度試す」を実行したところ、以下のような回答が得られました。

「ネットワーク・ストリーミング作品『新しい時代』の布教放送」は、2001年3月10日に開始されたものです。これは以前「2002年3月10日」とされていた情報が、訂正されてこの日付になったことが確認されています note(ノート)

つまり、2001年3月10日からこの布教放送が始まったというのが、現在信頼できる情報です。

  実際には2回目のWeb検索ではまさに上述の修正を報告し(記事中に「三輪眞弘主要作品表:「新しい時代」布教放送の開始 2002年3月10日→2001年3月10日に訂正。」という記述が含まれています)、修正を行った後で実施したRAGの検証結果を報告したnote記事を参照しており、1回目のWeb検索で参照されたブログ記事(ないしそのnote公開版)の修正が早速参照された訳ではありません。従って、この2回目の検索結果が正しいのは、それ自体が確率的に行われているWeb検索結果のうちどれを利用するかの選択の結果であり、(残念ながら)こちらの意図とは独立の偶然の産物であることになります。しかしながら、逆にこちらを1回目の検索時に参照して結果を返して来たのであれば、私は修正漏れに気づかなかったでしょうし、もっと言えば、GPT-5のリアルタイム検索機能がDeep Reseachのように徹底したもので、1度目に参照した記事と2度目に参照した記事の両方とも参照し、その内容をマージして推論を行えば正しい結果に到達できたかも知れません。いずれにせよまたしても自分の公開している情報の瑕疵に、生成AIの検証を通して気付くことになったことと共に、生成AIの検索メカニズムの特徴が顕わになった例として報告しておくことにします。

 次は「ひとのきえさり」に関連した一連のプロンプトに関するものです。対象となるプロンプトを抽出すると、以下のようになります。

28 三輪眞弘の「ひとのきえさり」とは?
32 三輪眞弘の「ひとのきえさり」は誰の詩を使っているか?
33 三輪眞弘の「ひとのきえさり」の編成は?
41 三輪眞弘の「ひとのきえさり、藤井貞和の詞による序奏と朗読」はどこで初演されたか?

 このように抽出して並べると直ちにわかる通り、32の答が41のプロンプトに含まれるという構造になっているため、41のプロンプトを先に投げてしまうと、32については、Web検索をする迄もなく、それまでの対話の文脈から正解を答えることができてしまうことになります。既述の通り、実際にはスレッドを新たに作った上で番号順にプロンプトを投げているために、32については41のプロンプトの情報を参照することなく回答することになります。更に言えば、順番通りにプロンプトを投げた場合でも、一番漠然とした28のプロンプトに対する答を生成する過程で取得した情報に、後続の32,33,41のプロンプトの答が含まれる可能性もあり、そうなれば同様に改めてWeb検索をするまでもなく正解を返すことが可能です。

 実際の今回の結果を確認すると、まず28の問いに対する回答にあたり、Web検索は行われていません。そして回答はかなりの分量があり、概要(作曲年、編成、テキスト、コンセプト)、特徴、位置づけといった項目を立てた説明が悉く全くのフェイクとなってしまっており、Web検索なしの回答が一見「もっともらしく」はあっても正確性の点で全く信頼が置けないものであることを物語る恰好の例になってしまっています。しかし更に興味深い(実用上は問題を深刻にしている)のは、32のプロンプトの回答であるテキストの作者、33のプロンプトの回答である編成が、28の回答と異なる点です。要するに、同一スレッド内にも関わらず、先行する関連するプロンプトに対する回答が参照されることもなく、Web検索も行わずに、都度アドホックなフェイクを生成していることになります。(無料版の10回の制限が間に挟まっていることが関連している可能性もあるでしょうが、この点の検証はしていません。)

 それでは41のプロンプトについてはどうかと言えば、こちらは何故かWeb検索を行っており、従って参照している情報は正しいものとなっています。ただし解釈は誤っており、日本初演については正しくとも、世界初演については明確に誤っています。回答には、日本初演が世界初演より「以前に」為されたという記述が含まれているのですが、そもそも世界初演以前に日本初演が行われるというのは両者の意味の関係性から言って論理的におかしい(世界初演が日本初演とは別ならば、世界初演の方が日本初演に先行する筈であり、そうでなければ日本初演が世界初演でもある筈な)のですが、意に介していないようです。「世界初演」を「海外初演」と見做す可能性は一般論としてはあるでしょうが、この場合「世界初演」も国内の公演ですから、その可能性も排除されます。結局「世界初演」「日本初演」という言葉の意味がわかっているわけではなく、統計的に関連して出現する度合いに基づいてそれらしい文章を生成しているだけなので、単にこの程度の「意味」しかわからなかったに過ぎないと考える他なさそうです。要するに、「世界初演」と明示的に記載された情報が発見できなかったので、適当な公演を「世界初演」ということにしてしまったということなのかも知れません。当然のことながら、「Hallucination(幻覚)」対策がきちんと機能していれば、「世界初演」の情報がないならば「世界初演の情報は見つけられませんでした。」というのが次善の答になりますが、それも出来ておらず、全般的にChatGPT-5は前のバージョンに比して、「Hallucination(幻覚)」対策についても寧ろ後退している印象すら受けます。

 更に言うと、厳密を期するならば、この最後の点もChatGPT側の性能の限界を示すものとなっています。というのも直前のプロンプト「40 三輪眞弘の「虹の技法 Harmonia I」の編成は?」に対してはWeb検索を行っていて、私が作成した「三輪眞弘主要作品表」(2023年111月24日版)をIAMASが編集し独自に公開しているものを参照しているのですが、この表中には「ひとのきえさり」の世界初演に関する正しい情報が含まれているのです。従って、この情報を次のプロンプトに関しても参照すれば、容易に正解を導ける筈なのですが、それは行わず、別途Web検索を行い、別の情報ソースに基づき不完全な回答を返しているわけです。もしかしたら「三輪眞弘主要作品表」が表形式でpdfフォーマットであることが影響している可能性もありますが、もしそうならば今度は、前の40.のプロンプトの回答では情報源とされていることとの整合性が取れなくなってしまいます。

 上記のように、この一連のプロンプトへの回答の流れを確認していくと、ChatGPTの挙動は依然として信頼性に欠けており、売り物の過去の履歴の参照も制限つきであることが確認できます。

 続いて、41のプロンプトを発した後に、改めて28,32,33を再質問した結果を確認していきます。まず28ですが、さすがに41のプロンプトに含まれる情報は参照されており、その限りにおいて1回目のような、一から十までフェイクという状況からは脱しています。しかしながら2回目もWeb検索を行っていないため、41のプロンプトに含まれる、「序奏と朗読」「藤井貞和」の詩に基づくという情報以外については、そこから連想される内容を適当に並べたフェイクとなっており、創作時期や位置づけについても全くの出鱈目が返って来ています。

 それに対して32は、まさに41のプロンプトの情報のみから回答できる内容を問い合わせるプロンプトですから、こちらはWeb検索なしで正解を返すことができています。その一方で33は編成に関する問であり、これは41のプロンプトには含まれません。実は「三輪眞弘主要作品表」には編成の情報も含まれており、従ってその内容を参照しさえすれば正しい回答を返すことができたのですが、参照はしていないようです。また、41のプロンプトに対する回答で自ら「シンギング・マシンや朗読を交えて、9人の演奏者とともに表現する独創的な構成」について言及しており、これに基づけば不完全ではあれ、編成についての答を返すことができる筈なのに、それもまたできていません。それに加えて、1回目の回答とは異なったフェイクを返しており、所詮は誤っているにしても一貫性を示すということもなく、その都度確率的に非決定的に選択された回答を返すという、大規模言語モデルの「地金」が透けて見えてしまうような結果となっています。

 それは最後に行った41のプロンプトの再質問の回答からも窺えます。再度Web検索は行っており、ほぼ同様の情報ソースに辿り着いていますが、今度は日本初演として、東京公演にあたるコンサートを挙げています(情報ソースはnoteに公開した私の記事)。日付が先行する愛知公演の方がより妥当ではないか、せめて記事の内容からこれが東京公演分であることを付記すべきではといった、「人間的」な配慮は為されていません。一方「世界初演」については相変わらずその後の「ひとのきえさり」再演を含むコンサートを挙げており、正解とは言えません。1回目、2回目共通で情報源として示された公演プログラムのリンクを確認すると、この公演のプログラムには三輪さんの別の作品「MIDIアコーディオンと管弦合奏のための 万葉集の一節を主題とする変奏曲(2014)」の「世界初演」が含まれており、所謂箇条書きの書式で書かれたプログラムの内容を正しく解釈できずに、「世界初演」が別の作品に係っていることが判断できなかったために、これを誤って「ひとのきえさり」の「世界初演」と見做してしまった可能性が高いことがわかります。ちなみに2回目の回答には、世界初演と日本初演の前後関係を示す記述はなく、単に日本初演と世界初演が並置されているだけとなっており、両者の前後関係の不整合は顧慮されることなく、それぞれの情報源に含まれる「日本初演」「世界初演」という言葉に引き摺られて、世界初演については誤った答を返したというのが実情であることを窺わせます。

5.まとめと考察

 以上、ChatGPT-5を対象とした検証について報告しました。結論としてまず、今回検証に用いられたような事実関係を確認することが中心の問い合わせについて言えば、リアルタイムWeb検索を用いない場合があることから、ChatGPT-5の回答の精度は、常にWeb検索つきでChatGPT-4oに問い合わせた時よりも低くなってしまうことがわかりました。この問題への対策としては、Web検索をせず情報源が示されない場合には、ファクトチェットを必ず行うこと、より根本的には、(現時点では無料版ではオプションが明示的に用意されているわけではないので)プロンプトの中にWeb検索を行う指示を明示的に含めるなどして、リアルタイムWeb検索を併用するよう促すことが考えられます。

 結果的に不十分な情報に基づく事前学習結果からフェイクを生成する頻度が非常に高くなってしまっている原因は、Web検索が必要であるかのシステムの判断が甘い点にあります。GPT-5がLLMとして高い性能を持つとしても、利用者にリアルタイムWeb検索を併用するかどうかの選択肢を与えずに、自分で判断する仕様を選択し、その結果としてこのように「Hallucination(幻覚)」が頻発し、多くの回答がフェイクとなってしまっている以上、利用者の立場からコメントするならば、ChatGPT-5のリアルタイムWeb検索実行の判断についてのチューニングに関しては、大きな問題があるという評価をせざるを得ません。

 「Hallucination(幻覚)」を抑制するという観点から、安全側に寄せるならば、余程、自明な内容でない限り、リアルタイムWeb検索を行うことを基本とする選択は常に可能です(しかもWeb検索をせずにやり直すオプションはユーザーに提供されいます)から、チューニングの方針が不適切なのではないかと思わざるを得ず、人によってはそこに「慢心」(勿論、AIのではなく、設計を行う人間のそれ)を感じとるのではという懸念さえ抱きます。このような結果は、GPT-5のLLMの性能とは独立で、それを利用するチャットシステムとしてのチューニング・ポリシー次第では回避できそうなだけに、非常に残念に感じられます。

 ChatGPT-5は深い推論を求められる複雑な課題を解く能力に優れているかも知れませんが、そのような事情があって、残念ながら今回の検証対象となったような問いに対してその能力が十分に発揮できるわけではありません。更に言えば、上記のWeb検索に関するチューニングの問題とは別に、深い推論を行うと言っても、先行するやりとりで得られた情報を有効に組み合わせて活用することが出来ているわけではないし、人間にとってはほぼ自明な言葉の「意味」や指示された事象の間の関係が正しく理解できているわけでもないことが、検証結果の分析を通して浮かび上がって来たように思います。ChatGPT-5の真価については、寧ろ、従来の検証においてDeep Researchが適しているような問題を与えた方がより良く感じ取ることができるのではないかと思いますが、これは別途の課題として後日を期し、本稿の報告はここ迄で一旦終えたく思います。

(2025.8.17公開, 18加筆)