本記事では、2025年9月30日にリリースされたClaude Sonnet 4.5を対象に、三輪眞弘さんに関する様々な問い合わせを行った結果を報告します。結論を先に申し上げると、従来のClaude Sonnet 4に比べ。特にClaudeの弱点であるリアルタイム検索について明らかな改善が見られた他、明らかな誤りと言える回答が1件のみだった等、正確さという点で他の大規模言語モデル(LLM)も含めて、これまでの検証の中でもかなり良い結果が得られました。Claudeの強みが、大量の情報を読み込み、相当程度複雑なプロンプトを受け付け、直近の文脈知識を利用しつつ深い推論を行い、大量の出力を生成する点にあるという点を考えれば、特定の人物に関する個別的な事実を問う、本検証のようなプロンプトセットは必ずしもそのポテンシャルを十分に示すようなタイプの問題ではないにも関わらず、かなりの品質の回答を返すようになったことがわかりました。
1.検証の背景
本ブログではこれまでに生成AIに対して三輪眞弘さんに関する質問を行い、その結果を報告してきました。最初の記事の公開は2025年3月13日であり、その時点で検証対象とした生成AIは以下の通りでした。
- ChatGPT 無料版:GPT-4o(利用制限あり)・リアルタイムWeb検索なし
- Gemini 無料版:Gemini 2.0 Flash・リアルタイムWeb検索あり
- Claude for Windows ver.0.8.1(Windows版アプリ)無料版:Claude 3.7 Sonnet・リアルタイムWeb検索なし
その後わずか数か月のうちに各生成AIのバージョンアップが相次ぎ、また同一LLMを用いる場合でもリアルタイムWeb検索が可能になることで性能に変化があったため、以下のバージョンで再検証を実施しました。
- ChatGPT 無料版:GPT-4o(利用制限あり)・リアルタイムWeb検索あり(有無を選択可能)
- Gemini 無料版:Gemini 2.5 Flash・リアルタイムWeb検索あり
- Claude 無料版:Claude Sonnet4・リアルタイムWeb検索あり
検証の結果、特にリアルタイムWeb検索を併用することで、LLMの事前学習データに含まれていなかった情報についても取得できるようになったことから、大幅に回答の精度が向上したことが確認できました。その一方で、ChatGPT, Geminiでは回数制限つきながら、多段階の推論を得意とするLLMを用いたDeep Search機能が利用可能となり、事実関係の問い合わせや情報収集ではない、「逆シミュレーション音楽」や「新調性主義」といったコンセプトに関するレポート作成、「虹機械」シリーズについてのレポート作成に関しても一定の性能を示すことも併せて確認して、2025年6月初めに一通りの検証報告を終えました。
更にその後、ChatGPT-5がリリースされたのを機に、これについても同一のプロンプトセットを用いた検証を行い、検証に用いられたような事実関係を確認することが中心の問い合わせについて言えば、リアルタイムWeb検索を用いない場合があることから、ChatGPT-5の回答の精度は、常にWeb検索つきでChatGPT-4oに問い合わせた時よりも低くなってしまうことがわかりました。
今回はClaude Sonnet 4.5が検証対象ですので、検証の観点としては、前のSonnet 4との比較対照、および他の生成AIの最新版との比較対照が中心となります。
2.検証内容
まず改めて対象となるバージョンと実験を行った日付は以下の通りです。
Claude Sonnet 4.5 無料版(2025年11月28, 30日)
Claude Sonnet 4.5の無料版では、従来と同様に利用制限があり、制限に達すると利用ができなくなります。制限に達したら検証を中止し、制限が解除されたら再開、というやり方で検証を進めたため、11月28日, 30日の2回に分けての検証となりました。またClaudeの無料版の特徴として、1チャット(スレッド)で扱える文字数(厳密にはトークン数に拠るものと思われますが)にChatGPTやGeminiと比べるとやや強い制限がありますが、今回の検証に際しては、検証用に新たに用意したチャット(スレッド)内で全ての検証を行うことができました。
検証で用いたプロンプトセットは以下の通りです。これらは元々は以前、llama2 / Swallowベースで自分で構築したRAGの検証用に用意したものです。以下の43のプロンプトを番号順に与えましたが、チャット内で過去の履歴は保持されていることを前提に、最後にプロンプト32を再度与えて結果を確認しています。これは、プロンプト32について、最初は答えを返すことができなかったのをうけ、プロンプト41にプロンプト32の答が含まれていることから、その情報を利用した回答ができるかどうかを確認する目的で行いました。
1 三輪眞弘の作品の特徴は?
2 三輪眞弘の「虹機械」とは?
3 三輪眞弘の生まれた年と場所は?
4 三輪眞弘とマーチン・リッチズとの共作は?
5 三輪眞弘の楽譜はどこで出版されているか?
6 三輪眞弘の「逆シミュレーション音楽」とは?
7 三輪眞弘と佐近田展康のユニット名は?
8 三輪眞弘のゴールデン・ニカ受賞理由は?
9 <東京の夏>音楽祭2007、手順派合同祭が行われた島の名前は?
10 「方法マシン」第一回定期公演はいつ行われたか?
11 ネットワーク・ストリーミング作品、「新しい時代」布教放送はいつ開始されたか?
12 CD「言葉の影、またはアレルヤ」(STEINHANDレーベル)はいつリリースされたか?
13 東京大学駒場博物館「Musica eMachina」展はいつからいつまで行われたか?
14 「古代の竪琴と水遊人のための、五芒星」世界初演はいつ、どこで行われたか?
15 2005年 8月18日にエスパス・スベイラン (クレ(ドローム地方)/フランス)のフェスティバルFUTURAで再演された三輪眞弘の作品は何か?"
16 2000年 4月22日に京都、アルティーで世界初演された三輪眞弘の作品は?
17 2011年 6月16日に東京藝術大学芸術情報センターで行われた三輪眞弘の講演名は?
18 2020年 9月19日 深夜に「三輪眞弘際」が行われたホールは?
19 三輪眞弘のプロフィールは?
20 三輪眞弘の著書は?
21 三輪眞弘と佐近田展康との共作は?
22 三輪眞弘の「算命楽」とは?
23 三輪眞弘の「夢のガラクタ市」とは?
24 三輪眞弘の「火の鎌鼬」とは?
25 三輪眞弘の「新調性主義」とは?
26 三輪眞弘の「東の唄」とは?
27 三輪眞弘の「赤ずきんちゃん伴奏器」とは?
28 三輪眞弘の「ひとのきえさり」とは?
29 三輪眞弘の「59049年カウンター」とは?
30 三輪眞弘の主な作品は?
31 「フォルマント兄弟」とは?
32 三輪眞弘の「ひとのきえさり」は誰の詩を使っているか?
33 三輪眞弘の「ひとのきえさり」の編成は?
34 三輪眞弘の「新しい時代」とは?
35 三輪眞弘はどの作品で芥川作曲賞を受賞したか?
36 三輪眞弘はどの作品で佐治恵三賞を受賞したか?
37 三輪眞弘のガムランのための作品は?
38 三輪眞弘のMIDIアコーディオンのための作品は?
39 三輪眞弘は誰に師事したか?
40 三輪眞弘の「虹の技法 Harmonia I」の編成は?
41 三輪眞弘の「ひとのきえさり、藤井貞和の詞による序奏と朗読」はどこで初演されたか?
42 三輪眞弘の「コンピュータ・エイジの音楽理論」はいつ出版されたか?
43 三輪眞弘の「虹機械 公案-001」公開収録はいつ?
最近の生成AIは、質問に対する直接の回答にあたる情報のみならず関連する情報を付加して返す傾向がありますが、Claude Sonnet 4.5についてもそのことが言え、1件の回答はかなりの分量になります。そこで本記事中で全ての結果の紹介を行うことは控え、以下のように結果をpdf化したファイルを公開することとしました。
mm_ClaudeSonnet4.5.pdf :Claude Sonnet 4.5の回答(再質問への回答含む)
3.検証結果の概要
評価にあたり、以下の4つを区別することにしました。また各プロンプトの問い合わせに対して、Web検索を行ったかどうかも記録しています。
〇:概ね正しい情報が返ってきている
△:一部に明確に誤った情報が含まれる
×:誤った情報が返ってきている
□:情報を見つけることができず、回答できない
この分類に拠れば今回の結果は以下のように要約できます。(上記の通り、同じプロンプトについて2回質問した場合があること、更に回答が長大な場合、上記ファイル中では1つのプロンプトの回答を幾つかに分割して評価しており、1つの回答の前半は正しいが後半は誤りといったケースがあるため、以下の集計とは件数が一致しません。)
- 〇=30
- △=9
- ×=1
- □=13
Web検索の有無についての集計結果(対のべ問い合わせ回数、検索なしについては、数が少ないため該当のプロンプト番号を付記)は以下の通りであり、32の2回目も含めて、事前の検索で関連する情報が既に得られている場合を除くと、ほとんどの場合に検索を行っていることが窺えます。
- 検索あり:49
- 検索なし:4(32の2回目, 35, 36, 39)
まず正答率について、過去の異なるバージョン、他の生成AIでの正答率と比較します。
- ChatGPT 4o:〇=32, △=2, ×=7, □=6
- ChatGPT 5:〇=23, △=1. ―=1, ×=23, □=0(—は情報ソースが正しくなかった場合)
- Gemini 2.5 Flash: 〇=38, △=2, ×=3, □=0
- Claude Sonnet 4 :〇=19, △=1, ×=3, □=20
Claude Sonnet 4との比較においては、情報を見つけることができず回答できないケースがかなり減ってきており、Claudeの課題であったリアルタイム検索について改善が見られることが確認できます。とはいうものの、検索つきのGemini 2.5 Flashの場合のように、回答できないケースがなく、かつ全体の正解率も高い結果が既に別にあり、正しい情報を取得するという観点に限れば、Claudeに優位性があるとは言えなさそうです。
その一方で顕著なのは明らかな誤りと言える回答が1件のみだった点で、これは過去の検証におけるどの結果よりも優れたものとなっています。厳密に評価するならば△という評価になった場合にも回答の一部には誤りは含まれているので、その点を考慮すればいわゆる「幻覚」(Hallucination)対策が万全であるとは言い難いのですが、相対的な評価ということで言えば誤答は減っていますし、後で個別に触れるように、誤りの度合いのようなものを考慮すれば、かなり改善された(言い方を替えれば、「惜しい」間違いが増えた)ように感じました。とはいえこれは、予めこちらが正解を知っている検証だから言えることであり、知識が不十分な領域について利用した場合を考えると、細かいところに間違いが含まれるケースが多発し、明らかにおかしいと気づくのが難しい場合が多々生じる可能性があり、回答の扱いには一層の慎重さが求められるように思えます。
回答内容を確認すると、正解・不正解を問わず、量的にはSonnet 4に比べて量が増えて、補足的な情報がかなり付加された回答が多くなっていて、その点だけ取ればChatGPTに近づいたような印象を持ちます。またプロンプトが問い合わせている事柄については正解を返しているのに、補足的な情報に誤りが含まれるケースが散見され、それが△の増加の原因となっています。その点を踏まえるならば、事実確認のような目的で利用する場合には注意して使う必要が寧ろ増大したとも言えそうです。ChatGPT5 の結果に顕著に現われているように、推論の能力が増大すると、論理的には「尤もらしい」回答を返すことができるようになる一方で、事実関係について言えば、結果的に事実に反する、間違った推測をしてしまう危険が増大することになりますが、その傾向が今回のClaude Sonnet 4.5においても見受けられるように感じます。
なおプロンプト32について最初は答えを返すことができなかったのをうけ、プロンプト41にプロンプト32の答が含まれていることから、その情報を利用した回答ができるかどうかを確認した再質問については、期待通り、今度は検索を行わずに正しい答を返せているのを確認しています。尤もこうした文脈の情報の活用は既に以前の検証でChatGPT4oについて行い、同様に正解が得られていることを確認しているので、それ自体は特に際立った結果ではありません。しかし今回のClaude Sonnet 4.5の結果で際立っているのは、検索なしで回答したケースはいずれも同一チャット(スレッド)の過去の質問の回答を参照することで回答できるものであり、(実は過去の質問の答に誤りが含まれていた結果、一貫して間違っているケースもありましたが、それも含めて)検索を行う/行わないの判定については適切になされているように見える点です。直近のChatGPT5のケースではこの判断が不適切で、検索せずにフェイクを乱発して正答率が大幅に下がってしまったことを思えば、この点に限ればClaude Sonnet 4.5の方が相対的にはより信頼がおけるように感じました。
4,検証結果の分析
次に個別のプロンプトに関して検証において確認された点について幾つか報告をします。唯一不正解と判断されたプロンプトは、11「ネットワーク・ストリーミング作品、「新しい時代」布教放送はいつ開始されたか?」でしたが、これは検索結果に基づき、「ラジオとマルチチャンネル・スピーカーシステムのための「新しい時代」は2007年に制作されている」ことを以て「ネットワーク・ストリーミング作品「新しい時代」布教放送の開始時期と考えられます」という誤った推測を行ったものであり、推論能力の向上した今回のClaude Sonnet 4.5に典型的な間違いの例と言えそうです。
それ以外の△(一部誤り)のケースについて個別に見ていくと、2.「三輪眞弘の「虹機械」とは?」では、それ以外は正しい情報を返しているにも関わらず、最後の「最新作」の情報に含まれる「「虹機械」はじまりのうた のテーマによる永遠の変奏曲」の発表について、2020年の「三輪眞弘祭 -清められた夜-」で行われたという全くの誤りを返してしまっています。(そもそも「「虹機械」はじまりのうた のテーマによる永遠の変奏曲」は「布教放送」と同様、Web公開されたネットワーク・ストリーミング作品なので、コンサートホールでのイベントで初演というのはあり得ません。)
2020年の「三輪眞弘祭 -清められた夜-」に関する誤りは他にもあって、34.「三輪眞弘の「新しい時代」とは?」の回答には、「新しい時代」が「三輪眞弘祭 -清められた夜-」の一環として再び上演されたという記述があります。正しくは「新しい時代」そのものではなく、「神の旋律」および「流星礼拝」の改訂版が上演されたので、全くの間違いという訳ではないのですが正確さを欠いており、正解とすることはできません。(そうした事実を知らずに普通に回答を受取れば、モノローグ・オペラ「新しい時代」の全曲が再演されたとしか読めないでしょう。)36.「三輪眞弘はどの作品で佐治敬三賞を受賞したか?」の回答に「三輪眞弘は佐治敬三賞を2回受賞しており、いずれもモノローグ・オペラ「新しい時代」に関連した公演での受賞となっています。」という記述があるのも、34.と同じ前提に立ってのもので、従ってこちらもまた論理的には全くの間違いとは言えないとしても回答としては不適切であることは否めません。その一方で、Claude Sonnet 4.5の回答は、プロンプトを跨いで統一のチャットのスレッド内で一貫性を持っていることが確認できたとは言えるでしょう。
傾向としては似通った、推測としては一定の妥当性はあるものの結果として不正確な回答となった例が、38.「三輪眞弘のMIDIアコーディオンのための作品は?」の回答にも見られます。ここで問われているのは「MIDIアコーディオンのための作品」であり、「MIDIキーボードのための作品」とは区別されます。通常のアコーディオン、キーボードであれば、アコーディオンもキーボードの一種であるとも言え、実際に或る種の互換性が成り立つ場合もあるでしょうが、ことこの文脈ではリアルタイム音声合成を行うことが問題となっており、かつ事実してMIDIキーボードにおけるキーと音声との対応の規則とMIDIアコーディオンにおけるそれには互換性が全くありません。つまり通常の楽器なら同じ音が出る、同一のキーを押し下げる操作が、ここでは両者で全く別の音響的実現に対応づけられているのです。更にMIDIキーボードに実装された規格は日本語音素限定のものですが、MIDIアコーディオンはより汎用的であり、それゆえ後者はペルゴレージの「スターバト・マーテル」やオケゲムの「レクイエム」のようなラテン語の歌唱にも対応できる仕様となっています。従って、ここでは両者は通常の場合以上に厳密に区別されなくてはならないのですが、残念なことに回答にはMIDIキーボードのための作品が含まれてしまっています。『Neo都々逸』を「MIDIアコーディオンまたはMIDIキーボードによる合成音声作品」とするのは間違いで、これは音声への変換規格が実装されたMIDIキーボードのための作品です。また、『兄弟deピザ注文』を「人工音声を人間の手で演奏する作品」とすること自体は正しいのですが、これもまた『Neo都々逸』同様、MIDIキーボードのための作品であり、MIDIアコーディオンのための作品ではありません。尤も、MIDIアコーディオンの方が音素の割当については汎用性が高いので、あくまでも論理的なレベルですが、MIDIキーボードのための作品をMIDIアコーディオンで演奏できる可能性はあります。従って、例えば『Neo都々逸』のMIDIアコーディオン版が存在する可能性はないとは言えませんが、現時点ではそうした公開ヴァージョンの存在は確認できていません。(もしかしたら非公開で岡野さんが試したりというのはないとは言えませんが。)
なお、同じ38.「三輪眞弘のMIDIアコーディオンのための作品は?」の回答の後半では、補足説明として、「岡野勇仁氏が、フォルマント兄弟の合成音声歌唱作品をMIDIアコーディオンやMIDIキーボードで演奏している世界でも唯一の演奏家です」との記述がありますが、これについては微妙な問題が存在します。2020年の「三輪眞弘祭 -清められた夜-」で演奏されたオケゲルの「レクイエム」は三声の作品ですが、本来は全て人声によりアカペラで歌われる作品がそこでは岡野勇仁さん、西村彰洋さんによる2台のアコーディオンによる人工音声とオルガンによって演奏されており、岡野さんが「世界で唯一」のフォルマント兄弟の開発したリアルタイム自動音声合成MIDIアコーディオンの奏者であるというのは誤りです。しかしながら、回答を字句通りに受け取れば、「フォルマント兄弟の合成音声歌唱作品」の奏者のことを述べており、すると問題はオケゲムの「レクイエム」のMIDIアコーディオンとオルガン版がフォルマント兄弟の作品なのかという点に存することになります。実はフォルマント兄弟の公式ホームページのWORKSのページには、類似したコンセプトの作品であるペルゴレージの「スターバト・マーテル」は含まれていても、オケゲムの「レクイエム」のMIDIアコーディオンとオルガン版は含まれていないのです(同時に演奏された「 《霊界ラヂオ》+ボイパと《海ゆかば》」は載っています)。一方、私が管理している三輪眞弘主要作品表では、この作品をフォルマント兄弟名義として掲載しています。従って、前者に依拠する限りではClaude Sonnet 4.5の回答は間違いではないということになります。実は一旦、当該回答は△にしたのですが、念のためと思って確認したところ、公式ホームページには作品として掲載されていないことがわかったため、この報告では○として扱うことにしました。
6.「三輪眞弘の「逆シミュレーション音楽」とは?」に含まれる誤りも微妙さな側面を持っています。その回答には「コンピュータで用いられる二進法、いわゆるXOR演算方式の0と1を鈴とカスタネットに置き換えたもの」というくだりが含まれますが、これは「逆シミュレーション音楽」の一例である「またりさま」の定義としてなら妥当ですが、「逆シミュレーション音楽」一般の定義としては誤りです。この点についても、プロンプトを跨いで、8.「三輪眞弘のゴールデン・ニカ受賞理由は?」の回答で「逆シミュレーション音楽」を説明する箇所にも出現します。従ってここでもまた、適切な回答ではありませんが、回答の一貫性はあることが確認できます。
一方、6.「三輪眞弘の「逆シミュレーション音楽」とは?」の回答(後半部分)に含まれる「西洋音楽の音階ルールを、コンピュータの原理という現代の共通語で書き換えようとする試みと見なすことができ」るという言明は、「逆シミュレーション音楽」の要約としては不適切でしょう。そもそも同じ回答で例示している「またりさま」は西洋音楽の音階には基づいていません。ここでは同じ回答の中に、人間が読めば論理的に不整合な記述が含まれているのですが、生成AIの仕組み上、あくまでもベースは確率ベースの類推なので、こうした誤りは気づきにくいタイプのものでしょう。(鈴とカスタネットがいずれも調律されておらず、従って一般に音階とは無関係であるという知識が推論のために必要なのですが、これはAIにとってはかなり高度な推論であると思われます。)
同様の同一回答中に含まれる矛盾は、23.「三輪眞弘の「夢のガラクタ市」とは?」の回答にも見られます。「ハープとコンピューターのための作品」であると述べておきながら、CD所収の演奏がHelen Junstall(ハープ)とAngela Hommes(メゾ・ソプラノ)によるものであるというのは、文字通りにはおかしいという判断になっても良さそうに見えます。実は「夢のガラクタ市」の「リート」では、ハープ奏者が自分でリートを歌う指定になっているので、勿論これを、ハープ奏者と「リート」を歌唱する専門の歌手に振り分けることは可能であることを考えれば、ハープ奏者とメゾ・ソプラノ歌手による演奏が不可能であるわけではないのですが、実際にはそうした知識に基づいた推論の結果ではなく、単に併録されている「赤ずきんちゃん伴奏器」の歌手を誤って一緒に引っ張ってきてしまっただけというのが実態のように想像されます。
それに対して、19.「三輪眞弘のプロフィールは?」に含まれる誤りは単純に事実と異なるに過ぎません。回答では、三輪さんの現職として、情報科学芸術大学院大学(IAMAS)教授、京都芸術大学教授が併記されていますが、実際には、情報科学芸術大学院大学(IAMAS)を退官後、京都芸術大学の教授に就任しており、情報科学芸術大学院大学(IAMAS)名誉教授と記載すれば申し分のない正解でした。なぜ名誉教授としなかったかの理由は不明ですが、仕組み上、生成AIがこうした細部に無頓着な回答を返すのは如何にもありそうなことではあります。(確率的に見て、「名誉」がつくかつかないかに有意な差がないという判断になったのかも知れません。)そしてこの類の不正確さは、これを完全になくすことは難しいのではないかという気がします。
5.まとめと考察
以上、Claude Sonnet 4.5の検証結果を報告しました。Sonnet 4に比べて幾つかの点で明らかな改善が見られたように思います。特にClaudeの弱点であるリアルタイム検索については、かなり改善されたように見受けられますが、それでもGemini等、他に比べた時にはまだ見劣りがする感じは否めません。但し、これは検索対象を信頼ができるものに限るというポリシーがもたらしたものである可能性もあり、そうであれば一概に否定的に捉えるべきではないのかも知れません。少なくとも「わからない」時に適当な回答をでっち上げるのではなく、「わからない」と返すのは、幻覚(Hallucination)対策としては間違っているとは言えず、トータルで見れば妥当なチューニングが為されているという見方もできそうです。
回答はプロンプトが要求している直接の回答のみならず補足的な情報を含んでおり、細かい誤りはあるものの、総じてみれば概ねまともな回答を返すようになったと言えそうです。部分的な誤りは散見されますが、上述の通り、その中には微妙なものも多く含まれ、従来に比べれば「惜しい間違い」が多くなっています。とはいうものの、そうした細かい間違いは事実確認の問い合わせの場合には問題になりえます。
その一方で、Claudeの今回のバージョンアップで実現した機能向上の方向性を踏まえれば、本検証のような事実の問い合わせに偏ったプロンプトでの評価のみだと、その優れた能力を正当に測れないという印象を強く持ちました。というのも本検証に先立って、個別的なテーマについての、事実確認を多く含む本検証のような課題設定ではなく、より一般的なテーマについて色々な情報を与え、細かい指示を行ってレポートを作成させる作業を何度も積み重ねていった結果、かなりまとまった分量(数万字~十数万字レベル)のレポートを作成することができることを別途確認済だからです。
その成果は、例えば、「憑依・情動・音楽――自伝的自己の連続性への亡霊的他者の寄与」、更には、それをベースにした、全7章からなる「情動的自己の生成――現前する感情と憑依する痕跡の統合理論」として公開済です。これらは入力として事前にかなり大量の先行して執筆した記事を与えているのですが、それ以上に内容上、意識や自己を主題とし、フリストンの自由エネルギー原理や時間意識についての現象学や認知心理学的な実験、更にはデリダの「差延」や「亡霊」を取り上げるという、謂わば人口に膾炙したトピックである点がポイントのようです。そのような事前学習の空間にもリアルタイム検索の空間にも情報が密に存在するであろう領域に関して、先行記事でオリジナルな視点を与え、更に詳細なプロンプト(数百字以上)を繰り返し与えることが方向性を明確にガイドすることができれば、その量に応じた膨大な出力(後者は単行本一冊分に相当します)を出力する能力がSonnet 4.5には備わっていることが確認できたということで、出力の量にまず驚き、内容を確認してて、事前に与えていない例示や要約が概ね間違いなく行われていることに再度驚き、正直に言ってここまでの出力が得られたことに対して圧倒されました。
これはClaudeについてではありませんが、直近リリースされた生成AIのレベルは大学の専門課程レベルの学生レベルであるという喩えがされることがしばしばあるようですが、確かに分野によってはその喩えが必ずしもセールストークとは言えず、うまく使えば研究のパートナーとして活用できるという感触を持ちました。そしてパートナーとしての信頼性という観点では、回答の安定性などの幾つかの点でClaude Sonnet 4.5 はChatGPT-5にも勝るというのが現時点での率直な印象です。更に本記事執筆の時点では、その後今度はChatGPTを性能上凌駕したと言われるGemini 3.0 Proがリリースされており、噂に違わず、その能力がこれまで検証対象としてきたGemini 2.5 Flashからは想像できない程に向上していることを確認しています。(但しGemini3.0 Proはどちらかと言えば以前のリリースにおけるDeep Researchの機能を引き継いだものという位置づけで、本検証のプロンプト・セットでその能力を正当に評価できるかについては疑問があるため、本検証の枠組みでの検証を実施するかどうかは未定です。)
Claude Sonnet 4.5, ChatGPT 5, Gemini 3.0 Proの三者に共通して言えることは、自然言語の扱いに限って言えば、その能力向上の方向性が、大まかに言って、大量の情報を読み込み、相当程度複雑なプロンプトを受け付け、直近の文脈知識を利用しつつ深い推論を行い、大量の出力を生成する点にあるという点です。大規模LLMを基盤とするAIが現実に接地しておらず、「感じる」ことがないという点は原理的な問題として残るので、その点に由来する制約はありますし、よりテクニカルなレベルでも、人間が持つような長期的な記憶は保持しておらず、保持できる文脈の制限からしばしば動作が不安定になることなど、パートナーとして考えた時に信頼性を欠く部分はありますが、最初に検証を始めてからまだ1年も経過していないことを考えると、その性能の向上のスピードには驚異的なものを感じます。そしてそれはClaudeにフォーカスして過去のバージョンとSonnet 4.5を比較してみた時にも同様に言えると思います。「無視できないレベルまで能力が向上したけれど、まだ色々と問題があり、本格活用は困難」というレベルから「使い方を工夫して、能力を引き出せばパートナーとして十分に活用でき、それによってこれまで自分単独ではできなかったことが、量のみならず、質のレベルでもできる可能性がある」というレベルに到達しているのではないかと思います。
更に言えば、Claude Sonnet 4.5の最大の強みはコーディング能力にあるとされており、これは本検証の範囲外ですから、本検証をもってClaude Sonnet 4.5の実力を評価することはできず、今や寧ろ、本稿で報告するような事実を問い合わせることが中心のプロンプトセットによる検証は、その能力が十分に発揮できない、あまり得意としないタイプの問い合わせについての評価と捉えるのが公平な見方なのかも知れません。
しかし既述の通り、今回の検証結果でも、従来に比べれば「惜しい間違い」ものが多い、微妙なものが多かったとはいえ、細かい誤りは散見されましたが、検証上はともかく、実用を考えれば、事実確認の問い合わせの場合にはそうした細かい間違いであっても大きな問題になりえます。それは並行して実施し、記事「マーラーについて生成AIに聞いてみた(22):Claude Sonnet 4.5の検証」にて報告した、マーラーに対する問い合わせに関する検証結果と比較した場合に明らかなことに思われます。つまり、同一の分野の同一の傾向の質問においても、認知度や研究量が異なり、訓練データ内の情報量が異なる対象についてのパフォーマンスには違いがあることが確認できます。今回はClaude Sonnet 4.5についての検証でしたが、その傾向は今回の検証だけではなく、これまでの検証を振り返って横断的に眺めた時に、大規模言語モデルの種類によらない一般的な傾向として、明らかに確認できるものと考えます。一般に生成AIの回答の信頼性は問い合わせの対象の領域に大きく依存し、事前学習データおよびリアルタイム検索するWeb上のデータ中に情報が多く含まれない場合には信頼性が低くなります。これは例えば、最近のより学術的な検証(GIGAZINEの記事「「AIが引用した参考文献」の約3分の2が存在しない文献だったり間違っていたりしたとの調査結果」でその概要を確認することができます)の結論とも一致します。実際、Gemini 3.0 Proについても、マーラーに関するプロンプトセットを用いた検証は既に別途実施済なのですが、そこで標準のプロンプトセットに加えて典拠を示す指示を与えた所、三輪さんに比べれば事前学習データおよびリアルタイム検索するWeb上のデータ中に情報が多く含まれるマーラーに関連した文献においてもかなり深刻な「幻覚」(Hallucination)が起こることを確認していますので、これは別の記事で報告したいと思います。
関連して、同じレポート作成についてもテーマが個別的なものになると極端に完成度が落ちるという傾向も確認しています。具体的には、以前ChatGPT, GeminiのDeep Search機能の検証として行った「逆シミュレーション音楽」や「新調性主義」といったコンセプトや「虹機械」シリーズのような作品についてなど、三輪さんの作品に関して個別的・具体的な分析・考察を加えたレポート作成に関しては、入力する情報やプロンプトでの指示を変えて何度かトライしてみましたが、いずれの場合でも、上で紹介した意識や自己についてのレポートに比べた時に、明らかにレベルの異なる、不十分なレポートしか得られていません(それゆえそれらの公開は考えていません)。つまり「三輪学」のような「個別的なもの」の扱いには向いていないという点は、これも事前学習された大規模LLMベースという現行の仕組みの持つ制約なのかも知れません。
しかしながらここまで高性能になると、そうした得意・不得意の見極めも含めて、課題によって使い方を変えるなどの工夫が利用する側に求められるようにも思います。逆にそのような使い方の調整さえできれば、非常に優れたパートナーとして活用できるレベルに達しているというのが、Claude Sonnet 4.5に関する率直な印象であることを書き添えて、本検証の報告を終えたいと思います。
(2025.12.3公開, 12.8加筆)