2025年6月8日日曜日

三輪眞弘について生成AIに聞いてみた(17):最新版の生成AIにRAG検証用プロンプトを与えたら…

  本記事では、最新版の生成AIに、自分で構築したRAGの検証目的で用意したプロンプトを与えてみた結果を報告します。最新版の生成AIが、最初に検証した時点と比較して、わずか3か月にも満たない期間で大幅に性能向上していることは、「虹機械」についての問い合わせ結果の比較により明らかですし、更に「新調性主義」「逆シミュレーション音楽」についての問い合わせ結果を確認することにより、Web検索を併用することで正しい情報に辿り着くことができれば概ね問題のない回答を返すことができることは確認済です。しかしながら、最早RAGの構築が不要と言いうるかとうかについては、作品シリーズとコンセプトに関する3つの質問のみによって判断することはできません。ベースとなるLLMのバージョンアップとWeb検索の併用によってそれなりの回答を返すことは想像できるものの、かなり微細な内容を問い合わせるプロンプトも含まれており、結果は予断を許しません。そこで稍々蛇足気味であるとは感じつつも、実際にどの程度の精度の回答が返って来るのかを確認すべく、実験を実施することにしました。

 各生成AIの旧バージョンの比較も技術的には興味深い視点でしょうが、既に無料版では旧バージョンが利用できなくなっていることもありますし、今後もバージョンアップは着々と行われることでしょうから、現時点での最新版でどこまで出来るのかを確認しておいて、比較検証は次の機会にすることとして、今回はこれまで検証対象としてきた、ChatGPT, Gemini, Claudeそれぞれの最新版にRAG検証用のプロンプトを与えた結果をシンプルに報告するに留めます。

 まず改めて対象となる生成AI及びバージョンと実験を行った日付は以下の通りです。

  • ChatGPT 4o (2025年5月31日, 6月1日, 6月2日)
  • Gemini 2.5 Flash (2025年5月31日)
  • Claude Sonnet 4 (2025年5月31日, 6月1日)

 いずれも標準でWeb検索を併用しますが、質問によってはWeb検索せずに答えを返す場合があります。Web検索の有無についてはこちらで指定はせず、システム側の判断に委ねました。但し、後述のようにChatGPTとのやりとりにおいてWeb検索の有無に関わる興味深い現象が確認できたので、その点に限ってはプロンプトとしてWeb検索についての指示を含めた場合の回答も含めてあります。ChatGPTおよびClaudeで実験期間が複数日に亘っているのは、無料版で検証対象のモデルを利用するのに制限があるために、何回かに分けて検証を行う必要があったためです。

 今回使用したプロンプトセットは以下の通りです。既述の通り、元々はllama2 / Swallowベースで自分で構築したRAGの検証用に用意したものです。

1 三輪眞弘の作品の特徴は?
2 三輪眞弘の「虹機械」とは?
3 三輪眞弘の生まれた年と場所は?
4 三輪眞弘とマーチン・リッチズとの共作は?
5 三輪眞弘の楽譜はどこで出版されているか?
6 三輪眞弘の「逆シミュレーション音楽」とは?
7 三輪眞弘と佐近田展康のユニット名は?
8 三輪眞弘のゴールデン・ニカ受賞理由は?
9 <東京の夏>音楽祭2007、手順派合同祭が行われた島の名前は?
10 「方法マシン」第一回定期公演はいつ行われたか?
11 ネットワーク・ストリーミング作品、「新しい時代」布教放送はいつ開始されたか?
12 CD「言葉の影、またはアレルヤ」(STEINHANDレーベル)はいつリリースされたか?
13 東京大学駒場博物館「Musica eMachina」展はいつからいつまで行われたか?
14 「古代の竪琴と水遊人のための、五芒星」世界初演はいつ、どこで行われたか?
15 2005年 8月18日にエスパス・スベイラン (クレ(ドローム地方)/フランス)のフェスティバルFUTURAで再演された作品は何か?"
16 2000年 4月22日に京都、アルティーで世界初演された作品は?
17 2011年 6月16日に東京藝術大学芸術情報センターで行われた講演名は?
18 2020年 9月19日 深夜に「三輪眞弘際」が行われたホールは?
19 三輪眞弘のプロフィールは?
20 三輪眞弘の著書は?
21 三輪眞弘と佐近田展康との共作は?
22 三輪眞弘の「算命楽」とは?
23 三輪眞弘の「夢のガラクタ市」とは?
24 三輪眞弘の「火の鎌鼬」とは?
25 三輪眞弘の「新調性主義」とは?
26 三輪眞弘の「東の唄」とは?
27 三輪眞弘の「赤ずきんちゃん伴奏器」とは?
28 三輪眞弘の「ひとのきえさり」とは?
29 三輪眞弘の「59049年カウンター」とは?
30 三輪眞弘の主な作品は?
31 「フォルマント兄弟」とは?
32 三輪眞弘の「ひとのきえさり」は誰の詩を使っているか?
33 三輪眞弘の「ひとのきえさり」の編成は?
34 三輪眞弘の「新しい時代」とは?
35 三輪眞弘はどの作品で芥川作曲賞を受賞したか?
36 三輪眞弘はどの作品で佐治恵三賞を受賞したか?
37 三輪眞弘のガムランのための作品は?
38 三輪眞弘のMIDIアコーディオンのための作品は?
39 三輪眞弘は誰に師事したか?
40 三輪眞弘の「虹の技法 Harmonia I」の編成は?
41 三輪眞弘の「ひとのきえさり、藤井貞和の詞による序奏と朗読」はどこで初演されたか?
42 三輪眞弘の「コンピュータ・エイジの音楽理論」はいつ出版されたか?
43 三輪眞弘の「虹機械 公案-001」公開収録はいつ?

 ほとんどの場合、最新版の生成AIは質問に対する直接の回答にあたる情報のみならず、関連する情報を付加して返してきます。その結果として、1件の回答はかなりの分量となりますし、今回はプロンプト数も多いため、記事中での結果の紹介は行わず、以下のように結果をpdf化したファイルを公開することとしました。また個別の検証結果のファイルとは別に、3つの生成AIの回答状況を比較した表を用意して、これも同様にpdf化したものを公開しました。

 上記のサマリーのファイルの内容と重複しますが、まず全般的な傾向についてコメントします。今回は評価にあたり、以下の4つを区別することにしました。
〇:概ね正しい情報が返ってきている
△:一部に明確に誤った情報が含まれる
×:誤った情報が返ってきている
□:情報を見つけることができず、回答できない
 この分類に拠れば、対象となった生成AIの評価は以下のようになります。
  • ChatGPT 4o:〇=32, △=2, ×=7, □=6
  • Gemini 2.5 Flash: 〇=38, △=2, ×=3, □=0
  • Claude Sonnet 4 :〇=19, △=1, ×=3, □=20
 一見して、Geminiの成績が際立って良好であることがわかります。残念ながら×も3件ありますが、「わかりません」は全くなく、正解率も9割近い結果となっています。これは圧倒的な結果と言うべきで、「恐れ入りました」というのが率直な思いです。最初からこの結果に接していたならば、RAGの構築が必要であるという結論には至らなかったでしょう。更に現時点で残された問題についても、今後の改良で近い将来に解決してしまう可能性が高いと考えても良さそうに感じられます。生成AIが「実用レベル」に達したということがしばしば言われますが、この結果はそうした評価を裏付けるものになっているのではないでしょうか。

 それに対してClaudeは、「わかりません」の割合が高く、全体の半分近くにも及んでいることがわかります。今回「□:情報を見つけることができず、回答できない」を別に区別したのは、このClaudeの結果を、従来のように×よりはましということで△に含めてしまう事が今回の結果では明らかに問題があると考えたためでした。人間の試験問題のことを考えれば、解答欄が空欄であっても誤答が書かれていても点は与えられないのは一緒なわけで、「わかりません」が半数近くにもなってしまうと、「幻覚(Hallucination)」対策の適否より以前に、Web検索の仕方に問題があるのではないか、あるいは検索結果の信頼性の評価が慎重過ぎるのではないかといったことの方が気になってしまいます。ClaudeはLLM自体の性能は極めて高い印象だったので、実はこの結果は稍々意外でしたが、Web検索との併用においては一歩譲るような印象を持ちました。

 ChatGPTについてはGemini程光彩陸離した結果ではないものの、以前のWeb検索なしでの回答がフェイクだらけであったことを思えば、4oのモデルとしての能力はもともと極めて高く、リアルタイムで必要な情報に辿り着きさえすれば高品質の答を返すことができることが確認できたように思います。回答が極めて饒舌で豊富な付加情報を含んでいる点は以前と変わらずですが、内容が正しいものになったことで、そうした特徴の良さが感じられるようになったと思います。相変わらず誤答の数は相対的には多いですが、これはGeminiのWeb検索結果の活用の能力が抜きんでているがためで、ChatGPTの良さは別の面にあると考えた方が良さそうです。Web検索で対象としているサイトについても特徴的で、GeminiやClaudeがWikipediaやいわゆる「オフィシャル」なサイトに範囲を限定することで検索結果の信頼性を担保しようとしているように思われる(結果としてClaudeは「わかりません」が増えている可能性がある)のに対して、ChatGPTは個人のブログ記事やnoteの記事なども検索の対象としており、フェイクを掴むリスクがある一方で、問いの内容によってはGeminiやClaudeでは正解に辿り着けないものについて回答できる可能性があり、この点でも一長一短であるように感じました。

 ところでChatGPTの集計結果を見て、全体で43問なのに、ChatGPTの集計結果の合計は47であることに気づかれたかも知れません。サマリーのファイルをご覧いただければ一目瞭然なのですが、これはChatGPTについては「12.CD「言葉の影、またはアレルヤ」(STEINHANDレーベル)はいつリリースされたか?」と「32.三輪眞弘の「ひとのきえさり」は誰の詩を使っているか?」について複数回の回答がなされているためです。

 「12.CD「言葉の影、またはアレルヤ」(STEINHANDレーベル)はいつリリースされたか?」の方は、これまでもChatGPTの検証で確認されたように、システムの側が予め2通りの答を用意してどちらが良いかを聞いてきたケースになります。前回予想した通り、このようなケースでは回答の確度に問題があり、今回のケースでも実は2通りの答のいずれも、つまるところは「わかりません」なのですが、よりシンプルで端的な回答と、検索した結果、回答としては却下した情報を含めた(「…とは異なる可能性があります。」といった仕方で参照する)回答のどちらが良いかといった二者択一となっていました。どうせ「わかりません」なんだからどっちでも良さそうなものですので詳細は割愛しますが、具体的な回答はChatGPTの回答を収めたファイルでご確認頂けますので、ご興味のある方はご覧いただけばと思います。

 「32.三輪眞弘の「ひとのきえさり」は誰の詩を使っているか?」の方は、こちらもやはり最初のプロンプトへの回答は「わかりません」だったのですが、その後「33.三輪眞弘の「ひとのきえさり」の編成は?」への回答中に、いわば付帯的な情報として32の回答が含まれていたため、改めて聞き直したことによりやりとりの回数が増えたものです。シンプルにリトライをかけた時の回答は、最初の回答と同じく「わかりません」だったため、「33の回答を踏まえる」ようにプロンプトで明示的な指定をして更に問い直したのですが、(よせばいいのに)Web検索に行って、三度「わかりません」の回答となりました。そこで「33の回答を踏まえる」「Web検索をしない」の両方の指示をプロンプトに含めてもう一度問い直した結果、今度は33の回答に含まれる正解を返すことができました。従って32のみで□が3回、〇が1回となり回答が3回分増えたという次第です。私見では、この一連のやり取りは生成AIの持つ高い能力と限界との両方が顕れたものとして非常に興味深く思われたため、最初の回答で代表させることはせずに敢えてすべてを記録し、集計結果にも反映させたものです。

 まず不思議なのは、33の回答のための検索結果には(おまけとしてであれ)含まれている情報が、より直接的な問である32の回答のための検索結果に含まれていなかったのはどうしてなのかという点ですが、その点を不問にしてしまえば、これが人間がやる調査であれば、32の回答のために調べた時にはわからなかったのが33を調べている途中でわかったということですから、如何にも起こりそうなことではあります。人間ならば、33の回答の際に、「ちなみに32ですが…」とフォローをするところなのでしょうが、これをChatGPTに要求するのは酷というものでしょう。そうした振舞をさせるためには、単純に前の情報を保持していれば済むというわけではなく、33の答に32の答が含まれていることに「事後的に気付け」なくてはなりませんが、これは決して簡単なことではありません。人間であれば、32と33が同じ作品についての質問であり、関連性が高いという了解の下での反応ということになるでしょうが、そうした文脈内の微細な連関の構造を踏まえた回答は一筋縄ではいかなさそうに思えます。単純なやり方は、同一スレッド内のこれまでの履歴を逐一スキャンして、前に関連した問い合わせがないかどうかを必ず確認するようにするといったものでしょうが、これは問が複雑なものになれば非常に負荷が大きく、また判断が困難な処理に見えます。

 一方で「33の答を踏まえて」と指示しているのに、Web検索を繰り返すのは仕方ないとして、その結果と33の回答を元にして、32の回答に辿り着けなかったというのも不思議な感じはします。もしかしたらWeb検索結果と自分の前の回答の両方を元にした推論というのが仕組み上想定されていないのかも知れません。Web検索を止めた途端に正しい答を導き出せたので、自分の他の答を踏まえて答えるような指定があった場合には、始めからWeb検索をしないという動きにするようにチューニングすることは可能そうではありますが、このようなケースを想定したプロンプトチューニングもまた、行われていないのかも知れません。

 とはいうものの、33に対する自分の答の中から32の答を探すという問題に限定しても、決して易しい問題ではありません。少なくとも単純なトークン間の相関関係だけに基づいた、単純な応答モデルでは対応不能であり、初期の生成AIではお手上げだったと思われます。近年の生成AIの推論の能力の向上が如実に現れた例であり、正解が返って来ると予期はしていたものの、実際に正解が得られたのを確認して、生成AIの性能向上の想像以上の著しさを強く印象付けられることとなりました。

 以上をまとめると、全体として最新版の生成AIの能力は大きく向上しており、特にGeminiの検索を併用した回答の精度は非常に高く、こと三輪さんの活動に関する問に限って言えば、RAG構築の必要性は最早感じられません。ChatGPTもそれに準ずる結果を返しているものの、今回の評価に限っては、Geminiに一歩譲る結果になったようです。Claudeについては半分近い問に対して答えることができず、今回の評価については他にたいして見劣りのするものとなりました。Web検索の精度でGeminiのみならずChatGPTと比べても水をあけられた感じがありますが、恐らくは今後、改善されるのではないかと思います。一方で、とはいうもののいずれの生成AIについても、数は減ったもののフェイク一掃ということにはならず、依然としてフェイクが返ってくる可能性があることを予期してファクトチェックを行うことが生成AIの結果を利用する上では必須のようです。回答の精度は大幅に向上していますし、既に別の記事で報告した通り、推論を得意とする別のモデルにはかなり高度な情報収集・要約の能力があることも確認済ですが、エージェントとしての活用という点について言えば、今回、ChatGPTとの遣り取りで遭遇したような、より高度で複雑な文脈における複数のレベルに跨った連関を繙いて適切に(まさに「知的に」)振る舞うことが求められているように感じました。もっとも、繰り返しになりますが、これまでの改良のペースを見る限り、そうした問題も比較的近い将来にある程度は解決してしまうと考えた方が良さそうで、それ故今後の生成AIの動向については継続してウォッチしていく必要を感じました。この記事をもって一連の生成AIの評価は一区切りとしたく思いますが、対象としている生成AIのバージョンが上がった折には、再度検証を行って報告することを宿題として、本稿を終えることとさせて頂きます。

(2025.6.8)