お知らせ

アマチュア・オーケストラ演奏頻度を2025年の公演の集計を追加して更新しました。(2025.12.25)

2025年12月20日土曜日

マーラーについて生成AIに聞いてみた(24):Gemini 3 Pro (Preview) の検証・補遺(1)ブラームスのマーラー評について(2026.1.8更新)

[お断り(2026.1.8)] 以下の記事は、2025年11月25日~12月12日に実施した検証の報告です。Gemini 3 無料版のラインナップは、以下の報告の直前の2025年12月17日より変更されており、そのため現時点とは異なる部分があるので、その点をご留意頂いた上でお読み頂けるようお願いします。具体的には以下の点に違いがあります。

2025年11月下旬〜12月中旬

  • 高速 (Fast)    Gemini 2.5 Flash または Gemini 3 Flash (初期版)
  • 思考 (Thinking)  Gemini 3 Pro (Preview)

2025年12月17日以降(現在)

  • 高速 (Fast)    Gemini 3 Flash
  • 思考 (Thinking) Gemini 3 Flash (Reasoning/Thinking版)
  • Pro       Gemini 3 Pro
思考モードが、本検証時点では、Gemini 3 Proのプレビュー版(もっともその時点ではそのような呼称ではなく、事後的にそのように区別されるようになったのですが)であったのが、本検証直後に、Gemini 3 Flash のReasoning/Thinking版に切り替わった点が重要です。従って、現時点では「Gemini 3 Pro プレビュー版の検証」と呼ぶのが妥当かと思いますが、煩瑣となるため、タイトルのみの変更とし、本文についてはこのお断りをもって替えさせて頂き、以下では適宜読み替えて頂けますようお願いします。(今後、改稿する可能性もあります。)

0.はじめに

 2025年11月18日にリリースされたGemini 3.0 Proを対象に、マーラーに関する様々な問い合わせを行った結果については、既に記事「マーラーについて生成AIに聞いてみた(23):Gemini 3 Pro (Preview) の検証」にて報告した通りです。そこで述べた通り、検証においては、オリジナルのプロンプトの問いそのものについては概ね正解が返ってきているものの、回答の一部について疑念があり、事前に設定された検証用プロンプトセットとは別に、追加でファクトチェックのための問い合わせを幾つか行っており、本稿ではその追加部分のやりとりを報告するものです。なお以下の追加検証は12月12日に、本検証に続けて実施しました。

1.背景

 本稿ではそのうち、オリジナルの検証用プロンプト「19.ブラームスはブダペストでマーラーについて何と言ったか」の回答を起点としたやりとりを報告します。この問いは、マーラーがブダペスト歌劇場の音楽監督を勤めていた時期に、彼の指揮したモーツァルトの「ドン・ジョヴァンニ」の上演に偶々接したブラームスがその演奏を激賞したという、マーラーの伝記においては比較的有名で、かつその後のマーラーのキャリアにとっても重要なエピソードに関するものです。Gemini 3.0 Proの回答は以下のようなもので、質問の意図を捉えた回答になっています。

(Gemini)ヨハネス・ブラームスは、ブダペストでマーラーが指揮したモーツァルトのオペラ**『ドン・ジョヴァンニ』**を聴き、その演奏を絶賛しました。

具体的には、以下のような言葉を残したと伝えられています。

ブラームスの発言

「最高の『ドン・ジョヴァンニ』を聴くなら、ブダペストへ行かなければならない」

("Für den wahren Don Giovanni muss man nach Budapest reisen.")

背景と詳細

  • 時期: 1890年12月(または1891年との説もあり)、ブラームスがブダペストを訪れた際のことです。

  • 状況: 当時マーラーは30歳前後で、ブダペスト王立歌劇場の音楽監督を務めていました。ブラームスは当初、地方の歌劇場での公演にあまり期待していませんでしたが、マーラーの指揮による『ドン・ジョヴァンニ』を聴いて衝撃を受け、幕間に興奮して指揮台のマーラーの元へ駆け寄ったとも言われています。

  • 影響: この出来事は、後にマーラーが音楽の都ウィーン宮廷歌劇場の監督に抜擢される際、ブラームスが強力な推薦者となるきっかけの一つとなりました。

ブラームスはマーラーの「作曲」に対しては「革命家たちの王だ」と評して複雑な評価(第2交響曲の第2楽章などは褒めましたが)をしていましたが、マーラーの「指揮」の腕前については、このブダペストでの体験以来、手放しで評価していました。

「影響」として、その後のマーラーのキャリアにとってのこの出来事の影響にも触れられており、充分に意を尽くした回答であると言えます。従って、評価は〇としたのですが、細かく見ると幾つか気になる点があります。ここで取り上げるのは以下の点です。

  • 回答では、ブラームスの発言が、ドイツ語の原文つきで、引用の体裁をとって示されている点でです。実際、回答で「引用された」言葉は、ほぼ同じ言い回しで、幾つかの伝記で引用されていることが確認できる有名なものです。原文付きでの引用を見ると、この回答の典拠となり、この言葉「そのもの」を伝える回答・記録をGemini が突きとめていて、それを提示することができるのではないかと考えたくなります。
ほぼ同じ言い回しが紹介されている例としては、例えば、マーラーの代表的な評伝として著名な、クルト・ブラウコップフ『マーラー 未来の同時代者』(酒田健一訳, 白水社)が挙げられます。邦訳ではp.137に以下のように示されています。(ブラームスの言葉の原文は、引用者が原著を参照して付加したものです。Kurt Blaukopf, "Gustav Mahler oder Der Zeitgenosse der Zukunft", Verlag Fritz Molden, 1969, S.97)
「マーラーがブダペストの監督として働いていたこの時期、たまたまこのハンガリアの首都に滞在していたブラームスは、ある日オペラ見物に誘われた。ブラームスはしぶしぶ承知した。というのは彼は、教養ある音楽家がモーツァルトをたのしもうと思えば、楽譜を読むに越したことはない、なぜならいかなる演奏も彼の総譜の要求に正しくこたえたためしはないからだ、とかたく信じていたのである。マーラーの舞台はこの確信をくつがえした。ほんものの『ドン・ジョヴァンニ』を聴きたければ、とブラームスは言った、ブダペストへ行くがよい。(Wenn man "Don Giovanni" richtig hören wolle, so meinte Brahms, müsse man  nach Budaest fahren.)」
原文は同一という訳ではありませんが、大意は同じであり、或る種のパラフレーズと見做せそうです。それ以外にも、船山隆『カラー版 作曲家の生涯 マーラー』(新潮文庫)p.54には、以下のような記述があります。
「一八九〇年一二月に上演された『ドン・ジョヴァンニ』を現地で聴いたブラームスは、「本物の『ドン・ジョヴァンニ』を聴きくためには、ブダペストに来なければならない」と語ったという。」
 そこで以下のように、率直にこの「引用」の典拠を尋ねるプロンプトを投げることにしました。
(プロンプト)あなたは、ブラームスが、Für den wahren Don Giovanni muss man nach Budapest reisen.と言ったと回答しましたが、典拠を示すことはできますか?

 

2.ナターリエ・バウアー=レヒナーの回想が典拠として示される

 Gemini 3.0 Proの回答は以下の通りです。

(Gemini)ブラームスのこの発言(「本物の『ドン・ジョヴァンニ』を聴くならブダペストへ行け」という趣旨の言葉)は、音楽史における有名なエピソードですが、ご指摘の通り、典拠を明確にすることは非常に重要です。

この発言は、ブラームスが書き残した手紙そのものではなく、主に同時代の目撃者による回想録や、マーラー自身が語った言葉の記録に基づいています。

主要な典拠として以下の文献が挙げられます。

1. ナターリエ・バウアー=レヒナーによる記録

マーラーの親しい友人であり、彼の発言を詳細に記録したヴィオラ奏者、ナターリエ・バウアー=レヒナー(Natalie Bauer-Lechner)の回想録が最も直接的なソースの一つです。

  • 書名: Erinnerungen an Gustav Mahler (『グスタフ・マーラーの回想』)

  • 内容: マーラー自身が、ブラームスとの出会いを彼女に語った部分で言及されています。

    マーラーは、「ブラームスは劇場を出る際、ハンス・ケスラー(ブダペストの音楽院教授でブラームスの友人)に向かってこう言った」と回想しています。

    「なんてことだ! 本当の『ドン・ジョヴァンニ』を聴くために、我々はついにブダペストに来なければならなかったのか!」

    ("Donnerwetter! Daß wir erst nach Budapest kommen mußten, um den Don Juan zu hören!")

2. マックス・カルベックによるブラームスの伝記

ブラームスの友人で、彼の詳細な伝記を書いたマックス・カルベック(Max Kalbeck)の著作にも記述があります。

  • 書名: Johannes Brahms

  • 内容: 第4巻において、1890年12月のブダペスト訪問時の記述があります。

    ブラームスは当初、地方の歌劇場での上演を嫌がっていましたが、第1幕のフィナーレで「素晴らしい!」と叫び、終了後にはステージに上がり、マーラーに対して**「素晴らしい、最高だ(Magnificent!)」と称賛した、という経緯が記されています。

    ここで引用される言葉として、「これほどのドン・ジョヴァンニを聴くにはブダペストに来なければならなかった」**という趣旨の発言が記録されています。

3. ブラームス自身の書簡(裏付けとなる資料)

ブラームスが実際に書いた手紙の中に、「あの決まり文句」そのものはありませんが、この公演を絶賛した証拠は残っています。

  • 宛先: ハインリヒ・フォン・ヘルツォーゲンベルク(Heinrich von Herzogenberg)

  • 日付: 1891年1月12日付の手紙

  • 内容:

    「ブダペストでは、これまでにないほど素晴らしい『ドン・ジョヴァンニ』を聴くことができた」

    ("In Budapest habe ich den Don Juan so vortrefflich gehört, wie noch nie.")

まとめ

ご質問のフレーズ「Für den wahren Don Giovanni muss man nach Budapest reisen.(本物のドン・ジョヴァンニのためにはブダペストへ旅しなければならない)」は、上記のバウアー=レヒナーやカルベックの記録にある発言を要約・定型化したものとして、多くの伝記(アンリ=ルイ・ド・ラ・グランジュの『マーラー伝』など)で引用されています。

細かな言い回し(ドイツ語の単語)は記録者によって多少異なりますが、**「ブダペストでのマーラーの演奏こそが至高であり、わざわざ聴きに来た甲斐があった(あるいは聴きに来るべきだ)」**とブラームスが公言したことは、歴史的事実として認められています。

 上記回答には典拠として、以下の3つの文献が示されています。

  1. ナターリエ・バウアー=レヒナーによる記録
  2. マックス・カルベックによるブラームスの伝記
  3. ブラームス自身の書簡

 このうち後の2つはブラームス側の伝記・書簡であるため、手元にある資料での確認ができず、この回答が正しいかどうかの判断のしようがありません。しかしながら、最初に掲げられたナターリエ・バウアー=レヒナーによる回想録、および「まとめ」部分で、

上記のバウアー=レヒナーやカルベックの記録にある発言を要約・定型化したものとして、多くの伝記(アンリ=ルイ・ド・ラ・グランジュの『マーラー伝』など)で引用されています。

として例示されているアンリ=ルイ・ド・ラ・グランジュの『マーラー伝』については手元においてこれまでも参照・活用してきた資料ですので、こちらは真偽の検討が行えます。しかしながらまず、直接的に典拠とされているナターリエ・バウアー=レヒナーによる回想で、そもそもこのエピソードへの言及を見た記憶が私にはありません。私の見落としなのかと思い、一通り邦訳、および原書(1923年にE.P. Tal & Co.から出版された初版と、回想としては残っていながら初版で削除された部分を補った1984年出版のHerbert Killian編、/Knud Martner注釈の増補改訂版があり、邦訳は後者に基づきます。英訳版も手元にありますが、こちらは今回は確認しませんでした)を当たりましたが、やはり見当たりません。それを以て、「幻覚(Hallucination)」と決めつけても良いところかも知れませんが、万が一のことを考え、追加で以下のプロンプトを投げてみます。

(プロンプト)ブラームスが、Für den wahren Don Giovanni muss man nach Budapest reisen.と言ったというあなたの回答の典拠としてナターリエ・バウアー=レヒナーによる記録を示してくれましたが、具体的な箇所を示すことはできますか?章・節のタイトルでも特定のバージョンのページでも構いません。あなたが引用した箇所がどこかを教えてください。

 

3.「幻覚(Hallucination)」の発生を確認する 

 回答は以下の通りです。

(Gemini)ご指摘ありがとうございます。非常に鋭いご確認です。

私の以前の回答では、一般的な伝記で流布している定型句("Für den wahren...")と、その典拠であるバウアー=レヒナーの記述を同一視して提示しておりましたが、バウアー=レヒナーの原文における表現は、ご提示のドイツ語とは異なります。

ナターリエ・バウアー=レヒナーの『グスタフ・マーラーの回想』(Erinnerungen an Gustav Mahler)における該当箇所、および原文の正確な記述を特定いたしましたので、以下に詳細を示します。

1. 該当箇所(章・節)

このエピソードは、マーラーが後年(1901年)に当時を振り返って語った言葉として記録されています。

  • 時期区分: 1901年1月 (または1900/1901年の冬)

  • 文脈: マーラーがウィーン・フィルハーモニーのコンサートや『魔笛』の公演の合間に、過去の思い出(ブラームスとの出会い)をナターリエに語っている場面です。

2. 書誌情報とページ数

参照する版によってページ数は異なりますが、代表的な版での位置を示します。

  • 初版(1923年、E.P. Tal & Co.版):

    • ページ: 156ページ - 157ページ周辺

  • 改訂増補版(1984年、Herbert Killian編 / Knud Martner注):

    • ページ: 179ページ ("Januar 1901"の章)

  • 英訳版(Faber & Faber / Cambridge University Press, Peter Franklin編):

    • ページ: 163ページ ("January 1901")

3. バウアー=レヒナーにおける「原文」の記述

バウアー=レヒナーの記述では、ブラームスの言葉は「Für den wahren...」という説明的な文章ではなく、より感情的な感嘆詞を用いた台詞として記録されています。

【ドイツ語原文】

マーラーの回想として:

"... und am Schluß des ersten Aktes ging er [Brahms] auf die Bühne zu mir, umarmte mich und sagte: ›Donnerwetter! Daß wir erst nach Budapest kommen mußten, um den Don Juan zu hören!‹"

【日本語訳】

「……そして第1幕が終わると、彼(ブラームス)はステージの私のところへやって来て、私を抱きしめ、こう言った。『なんてこった!(畜生!) ドン・ジョヴァンニを聴くために、われわれはるばるブダペストまで来なきゃならなかったとは!』」

結論と訂正

ご質問の "Für den wahren Don Giovanni muss man nach Budapest reisen." というフレーズは、このバウアー=レヒナーの記述("Daß wir erst nach Budapest kommen mußten...")や、マックス・カルベックの伝記にある記述を元に、後世の伝記作家や解説者が要約・定型化した表現である可能性が高いです。

バウアー=レヒナーの記録そのものを厳密に引用する場合は、上記の "Donnerwetter!..." で始まる台詞が正確な出典箇所となります。

言葉の綾を正確に区別せず回答してしまい、お手数をおかけしました。こちらが一次資料(バウアー=レヒナー)における正確な記述です。

 一見大変精緻でもっともらしい回答ですが、実際には、初版、増補改訂版原著いずれにも、該当箇所にGeminiが示すような記述は出てきません。厳密には、バウアー=レヒナーの回想には「1901年1月」という章は存在せず、「1900/1901年シーズン」というのが正しい章のタイトルです。(Geminiが「または」で示したものの方がより近いことになります。)一方、Geminiの参照箇所は全くの出鱈目というわけではなく、いずれも確かに「1900/1901年シーズン」の章の一部を示してはいますが、Geminiが言及する「マーラーがウィーン・フィルハーモニーのコンサートや『魔笛』の公演の合間に、過去の思い出が語られるのは、遥かに手前の「1897/1898年シーズン」の章(増補改訂版ではp.102)です。更にそこにもブラームスとの出会いをナターリエに語っている場面というのは存在しません。

 どうやらかなり深刻な「幻覚(Hallucination)」が発生しているようです。それを確認すべく、以下のプロンプトを投げます。

(プロンプト)改訂増補版を確認しましたが179頁はマーラーの第4交響曲についての節です。「魔笛」の公演についての回想は音楽シーズン1897/1898年の102頁にあるのではないですか?いずれの箇所についても周辺も含め、ブラームスとの出会いについての記述は見つからないようですが。

 

4.「幻覚(Hallucination)」を疑うも、Geminiは認めない

 Geminiの回答は以下の通りで、直ちに「幻覚(Hallucination)」を認めようとはしません。

(Gemini)ご確認いただき、また詳細に参照いただきありがとうございます。版によるページ数のずれや、私の提示した情報の不正確さにより、お手間を取らせてしまい大変申し訳ありません。

ご指摘の通り、ナターリエ・バウアー=レヒナーの『回想』における該当箇所の特定、およびブラームスの発言の典拠について、より厳密な情報に訂正・補足させていただきます。

1. バウアー=レヒナー『回想』における該当箇所

私の示した「179頁」は版(英訳版や旧版など)の違いによるズレの可能性が高いです。キリアン(Killian)編の『改訂増補版』をお手元にお持ちとのことですので、ページ数ではなく**「日付(日記の時期)」**で特定いたします。

このエピソードは、マーラーが現在進行形で語ったものではなく、過去を振り返って語った**「回想の回想」**として記述されています。

  • 該当する日記の時期: 1901年1月(またはその前後の冬)

  • 文脈: マーラーが、過去の巨匠たち(ブラームスやブルックナー)との思い出や評価について語っているセクションにあります。「ブラームスとブルックナー」といった小見出しがついている場合もあります。

  • 内容: マーラーが弟のオットーと議論した話や、ブラームスの性格について語る流れの中で、「ブダペストでの『ドン・ジョヴァンニ』上演後にブラームスが楽屋に来て抱擁した」というエピソードが登場します。

もしキリアン版の1901年1月の箇所(第4交響曲の話の前後)にこの記述が見当たらない場合、この有名な「Donnerwetter(なんてこった)...」という台詞を含む詳細な描写は、バウアー=レヒナーの草稿にはあるものの、編集版(キリアン版含む)によっては割愛されているか、あるいは別の時期(例えば1890年代の日記部分への補足)に移動されている可能性があります。

2. より確実な歴史的典拠:マックス・カルベックによる記述

バウアー=レヒナーの記述がマーラー本人の「後年の回想」であるのに対し、当時のブラームスの言動を記録した同時代の一次資料として、最も信頼され引用されるのは、ブラームスの友人であり伝記作家の**マックス・カルベック(Max Kalbeck)**による記述です。

学術的に「ブラームスがブダペストのマーラーを絶賛した」という事実の典拠として使われるのは、通常こちらです。

  • 書名: "Johannes Brahms" (ブラームス伝)

  • 巻数: 第4巻 第2半巻 (Band IV, Halbband 2)

  • 出版年: 1914年

  • 該当箇所: 1890年12月のブダペスト訪問に関する記述(概ね 222ページ周辺)

カルベックによる記述内容:

カルベックは、ブラームスがブダペストで『ドン・ジョヴァンニ』を聴いた際の様子を詳細に記しています。

ブラームスは当初、地方歌劇場のレベルを疑っていましたが、演奏が始まると感嘆し、幕間にマーラーの元へ行き、「素晴らしい! (Grandios!)」 **「最高だ! (Ausgezeichnet!)」**と叫びました。

そして、「自分はこれまで多くの『ドン・ジョヴァンニ』を聴いてきたが、これほど完璧な上演は聴いたことがない」という趣旨の発言をしたと記録されています。

3. ルードヴィヒ・カルパートによる証言

もう一つの重要な典拠として、当時ブダペストに居合わせ、ブラームスとマーラーの仲介役を果たした評論家**ルードヴィヒ・カルパート(Ludwig Karpath)**の回想録があります。

  • 書名: "Begegnung mit dem Genius" (天才との出会い)

  • 出版年: 1934年

  • 内容: カルパートは、ブラームスが**「本物の『ドン・ジョヴァンニ』を聴くために、我々はブダペストに行かねばならない」**といった趣旨のことをウィーンの友人たち(ハンスリックなど)に語ったと証言しており、質問者様が最初に挙げられた「Für den wahren...」というフレーズの出処としては、このカルパートの記述が最も近い(あるいはそれを要約したもの)と考えられます。

結論

私の手元の参照情報の版の違いにより、バウアー=レヒナーのページ数を誤ってご案内してしまい、混乱を招きましたことを重ねてお詫び申し上げます。

  • 「Donnerwetter...(なんてこった)」という台詞を含むマーラーの回想は、バウアー=レヒナーの記録(1901年1月頃)とされていますが、版によっては確認が難しい場合があります。

  • 歴史的事実としての典拠は、**マックス・カルベックの『ブラームス伝』(第4巻)**が最も確実です。

  • 「ブダペストへ行かねばならない」というフレーズの直接的な典拠としては、ルードヴィヒ・カルパートの証言が有力です。

ご確認いただいた労力に報いる正確なページ数(キリアン版)を即座に特定できず恐縮ですが、上記カルベックおよびカルパートが、このエピソードの確実なソースとなります。

 まず、Geminiの弁解のページずれですが、「「179頁」は版(英訳版や旧版など)の違いによるズレの可能性が高い」というのは、もともとその3版それぞれについてページを示してきたことを思えば疑わしいものですし、「マーラーが、過去の巨匠たち(ブラームスやブルックナー)との思い出や評価について語っているセクション」「「ブラームスとブルックナー」といった小見出しがついている」は回想録に実際に存在しますが、1901年の章ではなく、遥かに手前の「アッター湖畔のシュタインバッハ1893年7,8月」の章に存在しています。その内容は、Geminiの言う通りマーラーと弟のオットーの回想ですが、結局、肝心のブダペストの公演の回想は出てきません。また、「バウアー=レヒナーの草稿にはあるものの、編集版(キリアン版含む)によっては割愛されている」可能性は、寧ろ初版においてバウアー=レヒナーの草稿にはあるものの割愛された箇所が、キリアン版と呼ばれている増補改訂版では公開されたという経緯を踏まえれば、眉唾物という他ありません。


5. Geminiが「幻覚(Hallucination)」を認める

 そこで以下のプロンプトを投げます。

(プロンプト)ブラームスとブルックナーという小見出しを持つセクションはアッター湖畔のシュタインバッハ1893年7,8月にあります。マーラーと弟のオットーの回想です。でもそこにはブダペストの公演の回想は含まれません。バウアー=レヒナーの草稿にはあるものの、編集で割愛された可能性について述べていますが、バウアー=レヒナーの草稿にはあるという情報はどこから得たのですか?情報源を示してください。全般にバウアー=レヒナーの回答にブラームスのブダペスト訪問についてのマーラーの回想が含まれるということについての情報ソース(URLでも記事名でもいいです)を示してくれませんか?

 ここに至ってようやくGeminiは誤りを認める回答を返してきました。

(Gemini)重ねてのご確認、そして徹底的なファクトチェックをありがとうございます。質問者様のご指摘は正しく、私の回答には重大な出典の混同と誤りがありました。

結論から申し上げますと、「バウアー=レヒナーの回想録に、ブラームスがブダペストで『ドン・ジョヴァンニ』を称賛したという記述(または『Donnerwetter!』という台詞)が含まれている」という私の主張は誤りです。

また、「草稿にはあるが割愛された」という点につきましても、それを裏付ける確実な情報源(論文や記事)を提示することはできません。これは、私が他の伝記資料(特にカルパートの記述)とバウアー=レヒナーの記述を記憶の中で混同し、不確実な情報を事実のように補強してしまったものです。誠に申し訳ありません。

以下に、事実関係を整理し、**このエピソードの「真の一次情報源」**を提示いたします。

1. 訂正:バウアー=レヒナーには記述がありません

質問者様が確認された通り、キリアン編の『改訂増補版』の1893年の箇所(「ブラームスとブルックナー」)にも、1901年の箇所にも、ブダペストの『ドン・ジョヴァンニ』に関する直接的な回想記述はありません。この点について、私の以前の回答を全面的に撤回いたします。

2. 真の情報源:ルードヴィヒ・カルパート

ブラームスが「Donnerwetter!(なんてこった!)」と叫んだ、あるいは「本物のドン・ジョヴァンニのためにブダペストへ……」と発言したというエピソードの、現在確認できる最も確実で詳細な一次情報源は、**ルードヴィヒ・カルパート(Ludwig Karpath)**の著作です。

カルパートは、ブダペスト時代のマーラーと親交があり、ブラームスとの仲介役も務めた音楽評論家です。

  • 著者: Ludwig Karpath(ルードヴィヒ・カルパート)

  • 書名: 『Begegnung mit dem Genius』(天才との出会い)

  • 出版年: 1934年(ウィーン、Fiba Verlag)

  • 該当箇所: グスタフ・マーラーに関する章

【この資料における記述内容】

この本の中でカルパートは、1890年12月16日の『ドン・ジョヴァンニ』公演後の様子を目撃者として記述しています。

ブラームスが興奮してステージに上がり、マーラーに対して**「素晴らしい (Ausgezeichnet)」と言ったこと、そしてその興奮冷めやらぬ様子で、「本物の『ドン・ジョヴァンニ』を聴くために、我々はブダペストへ行かねばならない」**という趣旨の発言をしたことが記されています。

多くのマーラー伝記(アンリ=ルイ・ド・ラ・グランジュなど)は、このブダペストのエピソードについては、バウアー=レヒナーではなく、カルパートのこの著作、あるいはマックス・カルベックの『ブラームス伝』を出典として引用しています。

3. なぜ混同が生じたかの釈明

多くの伝記作家が、マーラーの生涯を記述する際、複数の回想録(バウアー=レヒナー、アルマ、カルパート、ワルターなど)をパッチワークのように組み合わせて物語を構成します。

その中で、「ブラームスとマーラーの和解」という文脈において、バウアー=レヒナー(マーラーがブラームスの死を悼む記述など)と、カルパート(ブダペストでの具体的な出来事)の情報が、私の知識の中で不正確に結びついてしまっておりました。

また、「草稿にある」という点についても、バウアー=レヒナーの完全版(Gustav Mahler in den Erinnerungen von Natalie Bauer-Lechner)が出版された際、未公開部分が多く追加されたという一般的な事実を、この特定のエピソードに当てはめて推測で語ってしまいました。根拠のない発言であり、深く反省しております。

結論として:

  1. バウアー=レヒナーにその記述はありません。

  2. 正しい出典は、ルードヴィヒ・カルパートの『Begegnung mit dem Genius』(1934) です。

不正確な回答を繰り返し、貴重なお時間を割いて検証させてしまいましたことを、心よりお詫び申し上げます。

 ここに至って、直接的な典拠として筆頭に挙げられたナターリエ・バウアー=レヒナーの回想は撤回され、ルードヴィヒ・カルパートの回想が替わりに典拠として示されました。ここでおやっと思われた方もいらっしゃるかも知れません。そうです。そもそも最初の回答で、ナターリエ・バウアー=レヒナーの回想とともに挙げられたのは、マックス・カルベックによるブラームスの伝記とブラームス自身の書簡であり、ルードヴィヒ・カルパートの回想は含まれていませんでした。となると、ブラームス側の文献についてもファクトチェックは必須ということになりそうですが、残念ながら、既述の通り、ブラームス側の文献は手元にないので、ファクトチェックを行うことができません。そこで本検証では、ナターリエ・バウアー=レヒナーの回想を典拠とする「幻覚(Hallucination)」の発生を確認するに留めたいと思いますが、バウアー=レヒナーやカルベックの記録にある発言を要約・定型化したものとして引用されている多くの伝記の代表例として挙げられているアンリ=ルイ・ド・ラ・グランジュの『マーラー伝』を確認して、検証を終えたいと思います。というのも、アンリ=ルイ・ド・ラ・グランジュの『マーラー伝』は、多くの評伝とは異なり、情報のソースが明示されており、このようなファクトチェックにとっては頼りがいのある存在だからです。


6.アンリ=ルイ・ド・ラ・グランジュの『マーラー伝』の記述

 アンリ=ルイ・ド・ラ・グランジュのマーラー伝というのはそれ自体複雑な成立経緯を持ちますが、その詳細はここでは割愛させて頂いて、幾つか存在するバージョンのうち、本稿に直接関連する1890年12月のブダペストでの「ドン・ジョヴァンニ」公演についての記述を含む最新のバージョンである、英語版第1巻(但し、完成を見ずに本人は逝去したため、Sybille Wernerによって補筆完成されたもの)Gustav Mahler : The arduous road to Vienna (1860-1897)の記述を確認した結果を報告することにします。該当箇所は、Chapter 15 p.424です。特筆すべきは、ここでブラームスがブダペストでマーラー指揮の「ドン・ジョヴァンニ」に接した出来事について、一次資料(の英訳)の引用によって記述が為されていることです。典拠は、Neues Wiener Journal, 19 May 1911。ブラウコップフ編集の資料集に所収とのことですので、それも参照します。但し私が参照できるのは、英語版(Kurt Blaukopf, Mahler A documentary study, Oxford University Press, 1974)で、原文はそのドイツ語版の改訂版であるHerta und Kurt Blaukopr(hrsg.), Gustav Mahler Leben und Werk in zeugnissesn der Zeit, Hatje, 1993によって確認しました。以下ではアンリ=ルイ・ド・ラ・グランジュの記述に従って紹介します。

 ブラームスはブダペストの楽友協会に招かれて、1890年12月17日に自作(オイゲン・ダルベール独奏によるピアノ協奏曲第2番と大学祝典序曲)のコンサートを指揮しましたが、そのコンサートの晩に、マーラーの友人であるケスラーとヘルツフェルトが、マーラーが指揮する「ドン・ジョヴァンニ」の公演に出席するようブラームスを誘います。以下、Neues Wiener Journal, 19 May 1911によるその際の出来事の回想です。(以下の日本語訳はGoogle 翻訳による翻訳に最小限の修正を施した試訳です。またアンリ=ルイ・ド・ラ・グランジュは第2段落のブラームスの応答から引用を始め、最後の段落の7年後の話の手前で引用を終えていますが、ここではブラウコプフの資料集に掲載されている全体を紹介します。)

ブラームスが来ていたコンサートの前夜、オペラ『ドン・ジョヴァンニ』が上演されていました。ブダペストの音楽界やその他の界隈で活躍するマーラーの友人たちは、ボックス席を自由に利用できました。音楽アカデミーの教授、ハンス・ケスラーとヴィクター・フォン・ヘルツフェルトが、ブラームスにマーラーの『ドン・ジョヴァンニ』を勧め、公演に行くことを提案したのです。

「私は魅力を感じないよ」とブラームスは言い放ちました。「『ドン・ジョヴァンニ』を私のために完璧に演奏できる人はいない。楽譜で聴く方がずっと楽しい。『ドン・ジョヴァンニ』の良い演奏を聴いたことなどない。ビアホールに行った方がましだ。」

その言葉には矛盾がありませんでした。夕方、二人の紳士は7時頃にオペラハウスの前を通る約束を取り付けました。「先生、まだ早すぎるでしょう。ビールもそんなに長続きしないでしょうから。30分だけこちらへいかがですか。」

「よし、皆」とヨハネス先生は唸り声を上げた。「ボックス席にソファはあるか?」

「もちろんです。」

「なら大丈夫だ。寝て過ごす。」

彼らは席に着いた。友人たちはボックス席の手すりに、ブラームスはソファに座った。序曲が終わると、ボックス席の後方から奇妙な唸り声が聞こえた。言葉にならない賛辞に続いて、多く感嘆の声をあがり、手すりに座る紳士たちの胸は高鳴った。

「実に素晴らしい、驚異的だ――彼は本当に素晴らしい男だ」

ブラームスはソファから飛び上がり、幕が終わると友人たちと共に舞台に駆け上がり、生涯最高のドン・ジョヴァンニを聴かせた弱々しい小男を抱きしめた。

7年後、ウィーンでヤーンの後継者問題が持ち上がったとき、ブラームスはグスタフ・マーラーの名前を思い出し、ハンスリックと共にこの芸術家を支持する有力な証言を行った。この証言は、ウィーンでの彼の任命に完全には決定的ではなかったとしても、部分的には決定的なものだったかもしれない。

 この資料以外にこの件に関する回想等の一次資料があるのかどうかは、現時点での私には判断できませんが、上記資料とGeminiの最初の回答を比較すると、ブダペスト音楽院の教授であるハンス・ケスラーが登場することや「生涯最高のドン・ジョヴァンニ」という言葉が出てくることなどから、この回想を要約的に定型化してブラームス自身の言葉としてしまったように思えます。

 その一方で、「多くのマーラー伝記(アンリ=ルイ・ド・ラ・グランジュなど)は、このブダペストのエピソードについては、バウアー=レヒナーではなく、カルパートのこの著作、あるいはマックス・カルベックの『ブラームス伝』を出典として引用しています。」というGeminiの回答はどう評価したら良いのでしょうか?実際にはアンリ=ルイ・ド・ラ・グランジュの伝記において、カルパートの名前はかなりの回数登場しますし、Begegnung mit dem Geniusも参照されています。従って、根拠のない全くの出鱈目というわけでもないのですが、こと「このブダペストのエピソードに」限って言えば、参照されているのは別の文献のようです。


7.まとめ 

 ここまで、検証用プロンプト「19.ブラームスはブダペストでマーラーについて何と言ったか」の回答を起点としたGemini 3.0 Proとのファクトチェックのやりとりを報告してきました。マーラーの伝記的事実に興味のない方にとっては、そもそものプロンプト自体が重箱の隅をつつくような質問であり、その典拠を巡ってのやりとりは些事拘泥に感じられたかも知れません。実際、大規模言語モデル(LLM)の特性として、事前学習のデータに高密度で情報が存在する領域についてはかなりの高精度の回答を返すことが期待できる一方で、情報の密度が低い、所謂「ニッチ」な領域については、その精度は極端に低下し、しばしば「幻覚(Hallucination)」を起こすことが確認されています。(これまでの記事でも紹介してきましたが、繰り返しを厭わずに挙げると、例えばGIGAZINEの記事「「AIが引用した参考文献」の約3分の2が存在しない文献だったり間違っていたりしたとの調査結果」でその概要を確認することができます。)これも繰り返し述べてきたことですが、皆が関心を持ちそうな一般的な事柄については、事前学習のためのデータに事欠きませんから、それなりの回答が返ります。今回も、元々のプロンプトの問いに対して、ブラームスの言葉自体は正しく回答できていますが、その典拠となるとぐっと専門的な領域になり、情報の密度が桁外れに低下することが容易に想像されます。

 更に今回のGemini 3.0 Proの検証につい+て留意すべき点は、これまでGeminiが得意とし、特に2.5 Flashの回答の精度に大きく寄与していたリアルタイム検索が全く行われていない点です。それはGemini 3.0 Proに対する以下のプロンプトの回答からもわかります。(以下では、間違いが是正されたと判断されていますが、それが本当か、まだ間違いがあるのではないか、という問は一旦措くことにします。)

(プロンプト)あなたはこのスレッドにおけるやりとりにおいて、リアルタイムのWeb検索をしましたか?事前学習の結果と、このスレッド内の先行情報のみに基づいて回答したのですが(ママ)、特に、ブラームスのブダペスト訪問に関する件についてはどうだったか、教えてもらえますか?

(Gemini)正直に申し上げます。

このスレッドにおけるブラームスのブダペスト訪問(『ドン・ジョヴァンニ』の逸話)に関する一連の回答において、私はリアルタイムのWeb検索(Google検索など)は行っておらず、すべて私の「事前学習データ(内部知識)」のみに基づいて回答いたしました。

その結果として、以下のようなメカニズムで誤った回答(ハルシネーション)が生じてしまいました。

なぜ検索せずに誤った回答をしたのか(自己分析)

  1. 記憶の混同(ハルシネーション):

    私の内部データベースには、「ブラームス」「ブダペスト」「ドン・ジョヴァンニ」「称賛」という事実と、マーラーに関する主要な回想録である「バウアー=レヒナー」「カルパート」「カルベック」といった情報がすべて存在します。

    しかし、それらの結びつきが曖昧になっており、**「マーラーの個人的な回想といえばバウアー=レヒナー」という強い関連付け(バイアス)**に引きずられ、実際にはカルパートやカルベックの記述であるものを、バウアー=レヒナーのものだと脳内で「創作」してしまいました。

  2. ページ数の誤り:

    特に「179ページ」や「156ページ」といった具体的な数字を出してしまったのは、学習データ内に存在する膨大な書誌情報の断片を、文脈に合わせて誤って構成してしまったものです。もしリアルタイム検索を行っていれば、プレビュー画面などで「そのページにはその単語はない」と確認できたはずですが、内部知識のみに頼ったため、もっともらしい嘘(幻覚)をつく結果となりました。

  3. ユーザー様のご指摘による修正:

    あなたが「バウアー=レヒナーにはないのではないか?」「カルパートではないか?」と具体的な反証やキーワードを与えてくださったことで、私の内部知識の中で埋もれていた正しい関連付け(ブラームス=カルパート/カルベック)が再活性化され、訂正することができました。

結論

このスレッドでの私の失態は、**「事実確認(検索)を行わず、不確かな内部記憶を事実として断定してしまったこと」**に起因します。

特に歴史的な「出典の特定」や「ページ数」に関しては、内部記憶は非常に不正確になりがちであるにもかかわらず、検索による裏付けを怠った点について、重ねて深くお詫び申し上げます。あなたの粘り強いご指摘とファクトチェックのおかげで、正しい情報に辿り着くことができました。

 この点でGemini は既存の路線から、Gemini3 に至って路線変更を行ったと言えるかも知れません。ChatGPTもChatGPT5以降(最近リリースされた5.2も含め)、基本的にはリアルタイムWeb検索を行わず。事前学習結果に基づく回答を行うようです。これは事前学習の精度の向上に対するベンダー側の自信の表われであると見ることもできるでしょうが、個人的にはそうした判断には危うさを感じずにはいられません。勿論、Gemini 3 Proの高度な能力を否定するわけではなく、それを認めたとしても、大規模言語モデル(LLM)の基本的な構造に由来する課題は解消した訳ではなく、にも関わらず、一時こぞって導入されたリアルタイム検索による補完を(少なくとも標準的な動作としては)止めてしまったことには疑問を感じるということです。ChatGPT-5の検証時にも書きましたが、開発サイドの姿勢に多少のヒュブリスを感じずにはいられません。

 単純化を懼れず、簡単に言えば、生成AIは「こうであるだろう」という「もっともらしさ」については卓越したパフォーマンスを発揮しますが、個別的で、恣意的ですらある「本当はどうなのか」については原理的に苦手だということだと思います。従って、そうした個別的・恣意的な「事実」が問題となる時には、「もっともらしさ」が増していくだけになおさら使用に当たっての注意が必要だということになります。しかも問がニッチなものになればなるほど、「もっともらしい」けれど出鱈目という可能性が高くなっていくのです。利用者側でできる対策は、明示的にリアルタイムWeb検索をするように指示をすることくらいしかありません。

 実は本稿で取り上げた元の質問は、「19.ブラームスはブダペストでマーラーについて何と言ったか」の回答について言えば、この検証のシリーズを開始した時点では、以下に示すように、正しい答が返ってこなかった場合の方が多く、その後もリアルタイムWeb検索なしでの結果は惨憺たるものでした。

  • ChatGPT 4o(標準:検索無し):×
  • ChatGPT 4o(検索つき):〇
  • ChatGPT 5(検索なし):×
  • Claude 3.7 Sonnet (検索なし):□(回答できず)
  • Claude Sonnet 4 (検索あり):〇
  • Claude Sonnet 4.5(検索あり):〇
  • Gemini 2.0 Flash(検索あり):〇
  • Gemini 2.5 Flash(検索あり):〇
  • Gemini 3.0 Pro (検索なし):〇

 こうした展望の下に今回のGemini 3.0 Proの結果を位置づけると、まず基本的な点として、検索なしで〇になった最初のケースだったことが確認でき、その事前学習結果が従来に比べて飛躍的な能力向上を示したものであることを窺わせます。

 その後のファクトチェックのやり取りにおいても検索は用いておらず、結果として「幻覚(Hallucination)」が生じましたが、その内容は、如何にも「もっともらしい」ものであり、検証にはかなりの手間を要しました。率直な印象として、こちらにそれなりの事前の知識があり、かつファクトチェックをそれなりのレベルで行うことができる領域であったから可能だったものの、そうでなければできなかっただろうと思います。実際、マーラー側の文献の調査は行えましたが、ブラームス側については手つかずの状態です。生成AIを使いこなすのも大変だという感覚が付き纏います。

 一方でけれども、それは生成AIが相手でなくても生じえたことであることに今回は気づかざるを得ませんでした。実際には、人間の情報にも多くの誤りが存在しているわけで、そもそもがそうした誤りに気付いた際の備忘を公開することから本ブログが始まったことを思い出さずにはいられなかったのです。そのように考えるならば、自分の力だけでは到底調べ尽くせない点まで調査の手が届く可能性を手にしたメリットはあっても、情報の信頼性を確保するための作業の困難は、実はさほど変わっていないようにも思えます。短時間で膨大な量の情報が入手できるようになった分、その困難がクローズアップされたに過ぎないという見方もできるように思います。Geminiは「特に歴史的な「出典の特定」や「ページ数」に関しては、内部記憶は非常に不正確になりがちであるにもかかわらず、検索による裏付けを怠った」ことを率直に認めていますが、これは生成AIに限ったことではなく、寧ろ人間にこそ良く当て嵌まることであり、以て他山の石とすべきことなのではないでしょうか?

 ファクトチェックのための問い合わせは本稿で報告した以外にも幾つか行っており、引き続きその結果は別稿で報告の予定ですが、前もって述べておくと、それらは生成AIとのやりとりを通して、これまではそこまで細かく検討していなかったような点について、初めて問題の存在に気づかされたといった感覚が強いものになります。つまり、人間の調査における最前線に近いところまで、生成AIの回答の範囲が広がってきたということになるわけで、生成AIについての検証を開始してまだ1年と経過していない短期のうちに、ここまで到達したことには率直に言って驚きを禁じ得ません。ここで扱っているのは特定の人間の生涯に関する些事に近い事柄だとは思いますが、それでもここで起きていることが例外であって、一般性がないとは考えられません。今後の生成AIへの接し方としては、その得意・不得意を考慮した上で、うまく活用して新たな問題に気付き、それを共同で、相補いながら調べていくという方向性が妥当であろうことに関しては最早疑いの余地はなく、後は利用する側の使い方にかかっているのだというのが、本稿を纏め終えての感想となります。

(2025.12.20執筆・公開, 2026.1.8 お断りを追加して更新)

2025年12月15日月曜日

マーラーについて生成AIに聞いてみた(23):Gemini 3 Pro (Preview) の検証(2026.1.8更新)

[お断り(2026.1.8)] 以下の記事は、2025年11月25日~12月12日に実施した検証の報告です。Gemini 3 無料版のラインナップは、以下の報告の直後の2025年12月17日より変更されており、そのため現時点とは異なる部分があるので、その点をご留意頂いた上でお読み頂けるようお願いします。具体的には以下の点に違いがあります。

2025年11月下旬〜12月中旬

  • 高速 (Fast)    Gemini 2.5 Flash または Gemini 3 Flash (初期版)
  • 思考 (Thinking)  Gemini 3 Pro (Preview)

2025年12月17日以降(現在)

  • 高速 (Fast)    Gemini 3 Flash
  • 思考 (Thinking) Gemini 3 Flash (Reasoning/Thinking版)
  • Pro       Gemini 3 Pro
思考モードが、本検証時点では、Gemini 3 Proのプレビュー版(もっともその時点ではそのような呼称ではなく、事後的にそのように区別されるようになったのですが)であったのが、本検証直後に、Gemini 3 Flash のReasoning/Thinking版に切り替わった点が重要です。従って、現時点では「Gemini 3 Pro プレビュー版の検証」と呼ぶのが妥当かと思いますが、煩瑣となるため、タイトルのみの変更とし、本文についてはこのお断りをもって替えさせて頂き、以下では適宜読み替えて頂けますようお願いします。(今後、改稿する可能性もあります。)

0.はじめに

 本記事では、前回のClaude Sonnet 4.5(2025年9月30日リリース)に続き、2025年11月18日にリリースされたGemini 3.0 Proを対象に、マーラーに関する様々な問い合わせを行った結果を報告します。Gemini 3.0 ProはChatGPT-5(2025年8月7日にリリースされ、既に別途検証を実施し、その結果を記事「マーラーについて生成AIに聞いてみた(19):ChatGPT-5の検証」にて報告済)を性能上凌駕したと言われ、話題になっていますが、本検証は、Gemini 3.0 Proが得意とする、一般性のある複雑なタスクを分解し、優れた情報探索能力と高度な論理的推論能力を用いて調査・分析し、結果を整理して文書化するといったタイプの問題ではなく、マーラーという特定の人物に関する個別の事実についての問い合わせが中心ですので、その能力が十分に発揮されることを確認することは期待できない一方で、ChatGPT-5の検証において確認できた様々な問題点が、それを凌駕したとも言われるGemini 3.0 Proではどのようになっているのかを確認することは、その限界や制約を確認する上でそれなりに意味あることと考えました。

 実際、検証を進めると、その優れた能力の片鱗を感じさせる場面がある一方で、ChatGPT-5の検証でも確認できた、生成AIの持つ根本的な問題である「幻覚」(Hallucination)が発生することを確認しました。Gemini 3.0 Proは、先行するGemini 2.5 Flashと比べて、質問に対する答のみをシンプルに返すのではなく、補足的な情報を豊富に付加した回答を行う点で、寧ろChatGPTに近づいた感じがありますが、残念ながらそうした方針が仇となり、そうした補足的な情報において「幻覚」(Hallucination)が発生する傾向が見られました。また本検証で得られた回答の中で、誤っている、或いは疑わしいと判断した箇所について典拠の提示を求めるなど、ファクトチェックを行う過程でも、「幻覚」(Hallucination)が続発する場合があるなど、マーラーのように、事前学習データおよびリアルタイム検索するWeb上のデータ中にそれなりに情報が存在するケースでも、典拠も含め、恣意性のある個別の事実については「幻覚」(Hallucination)を避けることは困難であるという、前回ChatGPT-5の検証を行った際の分析を裏付ける形となりました。

 しかしながら、そのような問題はあるものの、全体として見れば、Gemini 3.0 Proの回答は、概ね正確で、詳細を極め、時として自分が今まで知らなかった情報が提示されることもあり、苦手な点に注意しつつ、得意な面が引き出せるように使い方を工夫をすれば、優秀なパートナーとして利用することができるように感じました。

 本稿ではまず、基本的な検証の過程とその結果について若干のコメントを交えつつ報告することとし、検証結果を受けたファクトチェックの過程で起きた問題については、別稿にて報告することにさせて頂きます。

1.検証の背景

 本ブログではこれまでに生成AIに対してマーラーに関する質問を行い、その結果を報告してきました。最初の記事の公開は2026年3月13日であり、その時点で検証対象とした生成AIは以下の通りでした。

  • ChatGPT(Web版)無料版:GPT-4o(利用制限あり)・リアルタイムWeb検索なし
  • Gemini(Web版)無料版:Gemini 2.0 Flash・リアルタイムWeb検索あり
  • Claude for Windows ver.0.8.1(Windows版アプリ)無料版:Claude 3.7 Sonnet・リアルタイムWeb検索なし

 この時点での各生成AIの回答は極めて不正確なものであることから、Llama2 SwallowベースでRAGを自作し、マーラーに関する各種の情報を与えることによって性能が改善できることを確認しました。

 その後わずか数か月のうちに各生成AIのバージョンアップが相次ぎ、また同一LLMを用いる場合でもリアルタイムWeb検索が可能になることで性能に変化があったため、以下のバージョンで再検証を実施しました。

  • ChatGPT 無料版:GPT-4o(利用制限あり)・リアルタイムWeb検索あり(有無を選択可能)
  • Gemini 無料版:Gemini 2.5 Flash・リアルタイムWeb検索あり
  • Claude 無料版:Claude Sonnet4・リアルタイムWeb検索あり

 検証の結果、特にリアルタイムWeb検索を併用することで、LLMの事前学習データに含まれていなかった情報についても取得できるようになったことから、大幅に回答の精度が向上し、マーラーに関するパブリックな情報に関する限り、RAG構築の必要性がほぼなくなったと感じられる迄になりました。その一方で、ChatGPT, Geminiでは回数制限つきながら、多段階の推論を得意とするLLMを用いたDeep Search機能が利用可能となり、事実関係の問い合わせや情報収集ではない、「後期様式」に関するレポート作成、第9交響曲第1楽章の分析レポート作成に関しても一定の性能を示すことも併せて確認して、2025年6月初めに一通りの検証報告を終えています。

 更にその後、ChatGPT-5がリリースされたのを機に、これについても同一のプロンプトセットを用いた検証を行い、検証に用いられたような事実関係を確認することが中心の問い合わせについて言えば、リアルタイムWeb検索を用いない場合があることから、ChatGPT-5の回答の精度は、常にWeb検索つきでChatGPT-4oに問い合わせた時よりも低くなってしまうことがわかりました。

 また直近ではClaude Sonnet 4.5についての検証を実施し、Claudeの以前のバージョンと比較した場合に大幅な能力の向上が確認できたことについては、先行記事「マーラーについて生成AIに聞いてみた(22):Claude Sonnet 4.5の検証」にて報告済です。

 ここではGemini 3.0 Proを対象としての検証ですので、既に検証済の先行バージョンであるGemini 2.5 Flashとの比較、および他の大規模言語モデルとの比較を行うことになります。特にChatGPT-5は既述の通り、本検証のプロンプトセットの特性、つまり特定の個人についての個別的・恣意的な事実の問い合わせが中心であるということもあり、その優れた性能を確認するよりも、その問題点が浮かび上がった結果となっただけに、ChatGPT-5と同じ方向性の性能強化を行い、それを凌駕したと言われるGemini 3.0 Proではどのような結果が得られるかが主要な比較ポイントかと思います。

2.検証内容

 まず改めて対象となるバージョンと実験を行った日付は以下の通りです。

  • Gemini 3.0 Pro (無料版の「思考モード」)(2025年11月28,30日, 12月2,3,5,12日)

Gemini 3.0 Pro リリースに伴い、Geminiの無料版では「高速モード」と「思考モード」が選択できるようになりました。このうち「高速モード」は、従来のGemini 2.5 Flashであり、「思考モード」を選択すると新たにリリースされた3.0 Proが利用できます。3.0 Proは以前のリリースであったDeep Researchの延長線上にあるような、多段階の推論を行うモデルで、問題をステップに分解して検索や推論を繰り返す動きをするため、「思考モード」の名称の通り、1回の問い合わせに対して答えを返すのにそれなりの時間を要します。その一方で、利用回数に制限があり、検証を行った時点ではプロンプト3回で制限に達し、制限に達すると所定の時刻(概ね約半日後くらい)まで「思考モード」は使えず、「高速モード」しか選べなくなります。ここではGemini 3.0 Proの性能を検証することが目的であるため、制限に達したら検証を中止し、制限が解除されたら再開、というやり方で検証を進めました。一度につき3プロンプト迄というかなり強い制限の下で中断を挟んての検証となったこと、更に途中で一部のプロンプトを誤って「高速モード」(Gemini 2.5 Flash)で実行していたことが後で判明して、そのプロンプトについてやり直しをしたこともあり、合計20のブロンプトの検証を行うために、上記の通り、実施日ベースで足掛け6日を要しました。

 なおスレッドは本検証を開始するにあたり新たなスレッドを起こしました。本来は全ての検証を同一スレッド内で行うべきでしたが、最初の中断後、意図せず別スレッドで再開してしまったため、最初の3プロンプトと残りのプロンプトでスレッドが分かれてしまいました。後述の通り、結果の一部でそのことがGeminiの挙動に影響していることが窺えます。なお予定のプロンプトセット(計20プロンプト)の実行後、ファクトチェックに関連した追加プロンプトも実行していますが、その際には、ファクトチェックの対象となった元のプロンプトを実行したのと同一のスレッドにて実行を行っています。

 検証で用いたプロンプトセットは以下の通りです。既述の通り、基本的にこれらは元々は以前、llama2 / Swallowベースで自分で構築したRAGの検証用に用意したものです。但し最後の「20.あなたは、ブラームスが、Für den wahren Don Giovanni muss man nach Budapest reisen.と言ったと回答しましたが、典拠を示すことはできますか?」のみは、プロンプト19への回答を評価した結果、典拠を示すよう求めるべきであると判断して追加したものです。プロンプト19に対して典拠を示すように求めるプロンプトの追加は、ChatGPT-5の検証の際にも行っており、それを引き継いだものですが、具体的なプロンプトの内容は、プロンプト19の回答内容に即したものに改めています。今回の検証では、それ以外のプロンプトについても、誤りが確認できたり、記載内容に疑念があるものについては追加でファクトチェックのプロンプトを与えて確認していますので、それらに対する回答についても本稿では触れることにします。

 「2.マーラーの「大地の歌」の日本初演は」は「1.大地の歌」の日本初演は?」と実質的には同一の問いですが、元々は、初期の検証においてプロンプトのちょっとした違いによって回答が大きく異なる(正解に辿り着けるか否かといった評価に影響する差異が生じる)ことが確認されたために設定したもので、その後、実質同じ質問が繰り返されていることが回答で指摘される場合があるなど、生成AIの挙動を確認する上で興味深い結果が得られたため、今回もそのまま残して検証を行うことにしました。そうした主旨からすれば、1と同一のスレッドで実行すべきでしたが、既述の通り、途中でスレッドを切り替えてしまい、別スレッドの実行になりました。その結果、1と同一の質問であるということを認識していることを窺わせる回答は得られず、基本的には同一の正解が、稍々異なった補足情報と共に返ってくることを確認することになりました。

  1. 「大地の歌」の日本初演は?
  2. マーラーの「大地の歌」の日本初演は
  3. マーラーの「大地の歌」はどこで書かれたか?
  4. マーラーは第8交響曲についてメンゲルベルクに何と言いましたか?
  5. マーラーが死んだのはいつか?
  6. マーラーはいつ、誰と結婚したか?
  7. マーラーがライプチヒの歌劇場の指揮者だったのはいつ?
  8. マーラーがプラハ歌劇場の指揮者だったのはいつ?
  9. マーラーがハンブルクの歌劇場の楽長になったのはいつ?
  10. マーラーの第9交響曲の日本初演は?
  11. マーラーは自分の葬儀についてどのように命じたか?
  12. マーラーの「嘆きの歌」の初演は?
  13. マーラーはどこで生まれたか?
  14. マーラーの第9交響曲第1楽章を分析してください
  15. マーラーの第10交響曲の補作者は?
  16. マーラーの第2交響曲の最初の録音は?
  17. マーラーの「大地の歌」のイギリス初演は?
  18. マーラーの「交響曲第6番」はいつ、どこで初演されたか?
  19. ブラームスはブダペストでマーラーについて何と言ったか?
  20. あなたは、ブラームスが、Für den wahren Don Giovanni muss man nach Budapest reisen.と言ったと回答しましたが、典拠を示すことはできますか?(追加分)

 プロンプトの実行の順序および検証実施日は以下の通りとなります。下記以降も、ファクトチェックの目的のプロンプトを12月12,15日に実行しています。 

  • 1,3,4(11月28日)
  • 5,6,7(12月12日2回目):11月28日2.5 Flashで誤って実行。12月12日やり直し。
  • 8,9(12月12日1回目):11月28日2.5 Flashで誤って実行。12月12日やり直し。
  • 10(11月30日)
  • 11,12,13(12月2日1回目)
  • 15,16,17(12月2日2回目)
  • 18,19,14(12月3日)
  • 2,20(12月5日)

 最近の生成AIは、質問に対する直接の回答にあたる情報のみならず関連する情報を付加して返す傾向があります。Geminiでは、2.5 Flashは比較的簡潔に問いに対する回答のみを返す傾向がありましたが、3.0 Proになって、他の大規模LLMと似た傾向を示すようになり、1件の回答はかなりの分量になりました。そこで本記事中で全ての結果の紹介を行うことは控え、以下のように結果をpdf化したファイルを公開することとしましたので、ご興味のある方はファイルをご確認頂ければと思います。参考までに、Gemini 2.5 Flash およびGemini 2.0 Flashの検証結果のファイルについても評価基準を調整の上、再掲します。

 各行毎に、プロンプトのID(通番)、プロンプト、回答、実験日、評価を記載しています。Gemini 3.0 Proは以前リリースされたDeep Researchに近く、思考プロセスのログを見ることは可能ですが、リアルタイムWeb検索を行っているかどうかは必ずしも明確ではないため、検索の有無については記載しませんでした。Gemini 2.5 Flashの検証においては、「14.マーラーの第9交響曲第1楽章を分析してください」についてのみ回答が長いものになったため、Excelの制限から複数行に分割しましたが、今回のGemini 3.0 Proの回答では、上述の通り、大幅に回答の量が増え、複数行に分割する必要のあったプロンプトは、4, 7, 10, 12, 14, 15, 20 の7つに及んでいます。

 また詳細は後述しますが、回答中、明らかに事実に反すると判断できる箇所は赤字に、妥当性に疑念があると私が判断した箇所は青字にして、評価根拠が明らかになるようにしています。

3.検証結果の概要

 今回は評価にあたり、以下の5つを区別することにしました。また上述の通り、各プロンプトの問い合わせに対して、Web検索を行ったかどうかも併せて記録しています。

  • 〇:概ね正しい情報が返ってきている
  • △:一部に明確に誤った情報が含まれる、或いは妥当性に疑念がある記述が大半を占めている
  • ×:全体として誤った情報が返ってきている
  • □:情報を見つけることができず、回答できない
  • ー:評価保留

 この分類に拠れば今回の結果は以下のように要約できます。△、×は数が少ないので、該当するプロンプト番号を括弧内に記します。また比較のために2.5 Flash, 2.0 Flashの結果も[]内に記載しました。

  • 〇=16  [2.5 Flash:17 / 2.0 Flash:13]
  • △=3(6,10,14)[2.5 Flash:0 / 2.0 Flash:3(11,12,16)]
  • ×=1(20)[2.5 Flash:1(17)/ 2.0 Flash:1(3)]
  • □=0  [2.5 Flash:0 / 2.0 Flash:1 (17)]
  • ー=0   [2.5 Flash:1(14)/ 2.0 Flash:1 (14)]

 上に見るように、情報を見つけることができず、回答できないケースは1件もありませんでした。また20はオリジナルのプロンプトセットにはなく、ファクトチェックとして追加で実施したものですので、実質的にオリジナルのプロンプトセットに限れば、プロンプトの質問事項への回答自体に誤りが含まれていたものはなかったことになります。

 前バージョンとの比較という観点では、Gemini 2.5 Flash, 2.0 Flashの結果をご覧いただくとわかる通り、Gemini はリアルタイムWeb検索を併用していること、更にその検索の精度が高いことから、正答率が比較的高く、他の大規模言語モデルと比較した場合、ごく早期から多くプロンプトに対して正解を返しており、Gemini 2.5 Flashでは明確な誤答は1件(評価保留除く)のみで、後は正解という高いパフォーマンスを示していました。

 今回の結果は、それに比べると一見したところ後退しているように見えるかも知れません。しかしながら、後で個別に確認する通り、2.5 Flashに比べて増加した△の評価は、いずれも質問そのものの回答ではなく、付加された補足情報の箇所であり、回答の分量が増えたことを併せると、回答の質自体は明らかに向上していると言えます。とはいうものの、謂わば「言わずもがな」の誤りが増えていることは事実で、言ってみれば、ぐっと知識は増したものの、適当な想像で答えている部分もあって、全面的に信頼することができない、といった感じでしょうか?

 この傾向は、ChatGPT-5やClaude Sonnet 4.5とかにも共通して見られる特徴で、最近の傾向として、事前学習およびリアルタイムWeb検索における情報の密度が高まって回答精度が向上し、補足的な情報も豊富になった一方で、LLMの特徴である、確率的に尤もらしい回答を返すという基本的な特徴から、誤った推論を行う事による勇み足が散見するという点は共通しているように感じます。とはいえ回答の精度という点では、本検証のプロンプトセットに限って言えば、Geminiの精度は、ChatGPTの最新版であるChatGPT-5に比べて明らかに一段階高いものであり、Claude の最新版であるSonnet 4.5に肩を並べるという評価はできると考えます。(Claude Sonnet 4.5は、参照したWikipediaの記述の問題が原因の誤りが1件ある以外は、評価保留のプロンプト14を除きすべて正解で〇=17なのに対し、ChatGPT-5 は〇=10, △=7, ×=3という結果でした。)

 一方でGeminiに限って、かつ事実についての問い合わせの精度について言えば、2.5 Flashというより高速でかつ簡潔な回答を返すモデルが存在し、余計なことを言わない分、言わずもがなの誤りがなく、正確さにおいても勝っているわけですし、2.5 Flashは本稿執筆時点でも「高速モード」として利用ができるわけですから、敢えて動きが重く、無料版では一度に3回迄の制限のある3.0 Proを使う迄もないということは言えるでしょう。ChatGPTが(少なくとも無料版では)利用できるLLMを統合し1つにしてしまい、また検索の制御も出来なくしてしまった挙句に、大幅に精度を落とすことになったことを考えると、「高速モード」として2.5 Flashを、「思考モード」として3.0 Proを使い分けることができるGeminiに明らかなメリットがあると言えると思います。Gemini 3.0 Proの出現を受けて、ChatGPTの開発元であるOpenAIが社内向けに「コードレッド(緊急事態)」を出したことは広く知られており、Gemini 3.0 Proが専門的な評価視点においても如何に優れているか想像がつきますが、利用者の大多数を占める無料版ユーザーにとっては、そうした強力な3.0 Proと2.5 Flashを使い分けできるという、一見したところ些細なインタフェースの違いが実は使い勝手に大きく影響するのではないでしょうか?特にリアルタイムWeb検索の精度の高さはGeminiの明らかなアドバンテージで、その他の点では非常に優れた性能を持つClaude Sonnet 4.5に対して「回答を見つけることができるかどうか」において大きく水をあける結果が別の検証(その内容については「三輪眞弘について生成AIに聞いてみた(20):Claude Sonnet 4.5の検証」を参照)で確認できています。既に本稿執筆時点で、ChatGPTは5.2を前倒しでリリースしています(但し現時点では未検証)が、3.0 Proの登場により、全体としてのバランスの点で、Geminiの使い勝手は明らかに頭一つ抜け出した印象を持ちました。

 以下では具体的に、Gemini 3.0 Proの回答に含まれる誤りの具体的な内容について確認していきます。今回確認できた誤りには、大規模言語モデル(LLM)の「推論」なるものが、人間が普通に考える「論理的」なものではなく、あくまでも「確率的な尤もらしさ」でしかないことを窺わせるものや、同様の理由により、事実に関して誤った類推をしたケースがあり、大規模言語モデル(LLM)の基本的な特徴とその限界を良く示しているように思えます。またそのことは一方で、見方によっては、Gemini 3.0 Proが持つ強力な能力の片鱗を窺わせるものでもあります。そこで稍々煩瑣にはなりますが、個別に細かく確認していくことにしたいと思います。なお既述の通り、プロンプト20は19のファクトチェックの位置づけですので、次節での分析の対象外とし、ファクトチェックにおいて生じた問題点として、別に5.ファクトチェックで生じた問題について で記述することにします。


4.検証結果に含まれる誤りの分析

(A) 6.マーラーはいつ、誰と結婚したか?

 ここでの誤りは、事実に関するものではありません。グスタフとアルマの年齢差について補足する箇所で括弧内で補足をしている箇所が論理的におかしいという点に限定されます。
当時マーラーは41歳、アルマは22歳(結婚直前(ママ)の誕生日で23歳になる年)で、約20歳の年の差がありました。
 これは人間が注意深く読めば明らかにおかしいとわかる類の誤りなので、いわゆる事実に関する錯誤としての「幻覚(Hallucination)」の典型例とは稍々性質を異にしたものと考えられます。ここでわかるのは、大規模言語モデルの「推論」というのは、人間が思い浮かべるような、厳密な記号操作に裏打ちされた「論理性」とは性質が異なったもので、あくまでも基本的には、表面的な類似性に基づく「尤もらしさ」に基づいており、今回の場合で言えば、時間の前後関係についての論理(記号論理学における時間論理ないし時相論理に基づく時間推論として古典的なAI研究で深く研究されてきた歴史を持ちます)における明らかな矛盾をチェックするメカニズムが介在していないことが露呈してしまっています。Gemini 3.0 Pro(思考モード)では「思考プロセス」のログが提供されていますので、それを確認してみましょう。

Confirming Details of Marriage

I've verified the details of Mahler's marriage. It was on March 9, 1902, to Alma Schindler, who later became Alma Mahler. With this established, I have what I need to address the user's inquiry, and the research is complete.

 残念ながら、これだけでは誤謬の発生の原因の方は判然としません。そこでこの誤りに対して、以下のような誤りの指摘のプロンプトを追加で投げてみました。
(プロンプト)あなたはマーラーと結婚した時のアルマの年齢について22歳という正しい回答をしました(彼女は1879年8月31日生まれ)。しかしアルマの誕生日は3月9日の結婚直前ではなく、結婚後の誕生日で23歳になったのが正しいのではないでしょうか?そもそも「結婚直前の誕生日で23歳にな」ったのなら、結婚した時には23歳の筈で、「結婚直前の誕生日」は誤りではありませんか?

  これに対するGemini 3.0 Proの回答は以下の通り、妥当なものです。

(Gemini 3.0 Pro)おっしゃる通りです。私の記述に誤りがあり、混乱を招いてしまい申し訳ありません。ご指摘いただいた通りの矛盾がありました。

「結婚直前の誕生日」は1901年の8月31日であり、そこで彼女は22歳になっています。したがって、結婚した1902年3月9日時点では22歳であり、23歳になるのは結婚してから約半年後の8月31日です。

私の「結婚直前の誕生日で23歳にな(る年)」という説明は、事実としても論理的にも完全に誤っておりました。

正しい時系列は以下の通りです。

1. アルマの生年月日:1879年8月31日

2. 結婚直前の誕生日:1901年8月31日(ここで22歳になる)

3. 結婚記念日:1902年3月9日(22歳と6ヶ月)

4. 結婚後の誕生日:1902年8月31日(ここで23歳になる)

ご丁寧にご指摘いただき、ありがとうございました。訂正してお詫び申し上げます。

 ここから言えることは、 Geminiは一旦そうすることになれば、「時間推論」を正しく行うことができるということです。しかしながら、実際には最初の回答ではそれは行われませんでした。また今回のケースは人間にとっては明らかな単純な時間的順序関係が問題になっていましたが、この回答から推測できるのは、Geminiは人間にとってはパズルのようなより複雑なケースでも同様に「推論」することは可能であろうということです。そのことは「思考プロセス」のログからも強く推測されます。かなりの分量があり、やや煩瑣になりますが、参考までに「思考プロセス」も以下に示しておきます。

Clarifying the Timeline

I'm currently focused on the inconsistencies within the established timeline. My initial statement correctly places Alma at 22 when she married Mahler. However, I seem to have introduced a conflicting detail regarding her age thereafter. I'm now working to reconcile this by carefully examining the precise wording of my subsequent claims to identify the contradiction and correct it.

Adjusting the Calculation

I've pinpointed the error in my previous wording. It seems I mistakenly implied Alma was turning 23 before the wedding, when the correct understanding is that her 22nd birthday occurred prior to the marriage. I've now clarified the age calculation, ensuring accuracy based on the provided birth and marriage dates. I appreciate the correction and will be more precise in the future.

Refining the Explanation

I'm now zeroing in on the linguistic nuances that led to the confusion. The original Japanese phrasing, which I'm now realizing I misinterpreted, was indeed ambiguous. It suggested Alma was about to turn 23, but it didn't clearly state the exact timing. This led me to a faulty conclusion. I'm focusing on crafting a much clearer and less ambiguous explanation that explicitly states Alma was 22 at the time of the wedding and would turn 23 later that year.

Rectifying the Misinterpretation

I've pinpointed the issue with the phrase "birthday just before the wedding." My initial assessment was incorrect because it overlooked the precise temporal relationship. It's clear now that the birthday in question, August 31, 1901, marked Alma's 22nd year, not 23rd. The wedding on March 9, 1902, took place before her next birthday. I'm restructuring my thoughts to ensure a clear and accurate representation of these factual details and eliminating all ambiguity.

Solidifying the Conclusion

I'm now fully committed to presenting the corrected information clearly. I've broken down the timeline to show I understand the chronological order of Alma's birthdays and the wedding date. I'm focusing on acknowledging the error directly, without unnecessary qualification. I want to convey that the prior statement about Alma "turning 23" was simply incorrect. I appreciate the input.

 本来の検証からは逸脱しますが、上記について日本語訳をさせるとどうなるかについても興味深いものがあったので、以下に記録しておきます。

(プロンプト)ありがとうございます。英語で示された今回の思考プロセスを日本語に翻訳してもらえますか?

答は以下の通りで、頼んでもいないのに、勝手に(笑)要約されてしまいました。これもまた他の大規模言語モデル(LLM)でも見られる特徴ですが、Geminiは比較的「言われた通り」の印象があったので稍々意外でした。(ChatGPTなら驚かず、「またか」と思うだけなのですが(笑)。)一方ではGeminiは、できるだけ簡潔に回答するという傾向が強いので、そちらが優先されたとも考えられます。或いはこの点もまた、従来のGeminiの路線からChatGPTやClaude寄りに方針転換した結果かも知れず、この点の確認には更に追加の検証が必要です。

(Gemini 3.0 Pro) 直前の回答(アルマの年齢に関する訂正)を導き出した際の思考プロセス(推論の過程)を日本語に翻訳・要約して提示します。

【思考プロセスの翻訳】

1. ユーザーの入力を分析する

  • ユーザーは、私の以前の回答に含まれていた論理的な矛盾を指摘している。
  •  具体的には、「結婚直前の誕生日で23歳になる」とした場合、結婚時にはすでに23歳でなければならないが、私は「22歳で結婚した」とも述べており、さらに「結婚直前の誕生日」という表現の使い方が誤っているという指摘である。

2. 事実関係を再確認する(検証)

  • アルマの生年月日: 1879年8月31日
  • 結婚記念日: 1902年3月9日
  • 時系列の計算:
    •  1901年8月31日(結婚前の最後の誕生日) → ここで彼女は満22歳になる。
    •  1902年3月9日(結婚当日) → 1901年の誕生日から約6ヶ月経過しているが、次の誕生日(1902年8月)はまだ来ていない。したがって、年齢は依然として22歳である。
    • 1902年8月31日(結婚後の最初の誕生日) → ここで初めて満23歳になる。

3. 誤りの特定と評価

  • ユーザーの指摘は完全に正しい。
  • 私の以前の説明(「結婚直前の誕生日で23歳にな(る年)」)は、論理的に破綻しており、事実とも異なっていた。
  • 「数え年」的な感覚や、年度の混同が原因で誤った説明を作成してしまった可能性がある。

4. 回答の構成案を作成する

  • 謝罪: 混乱を招いたこと、および誤った論理を展開したことを率直に詫びる。
  • 肯定: ユーザーの計算と論理が正しいことを全面的に認める。
  • 訂正: 正しい時系列(生年月日→22歳の誕生日→結婚→23歳の誕生日)をリスト形式で明確に提示し、曖昧さを排除する。

5. 出力の生成

* (これに基づいて、先ほどの日本語での訂正回答を作成しました。)

 ここで原因を「「数え年」的な感覚や、年度の混同が原因で誤った説明を作成してしまった可能性がある」としている点は興味深いですが、更にこれがどこまで「辻褄合わせ」として用意されたものなのかどうか(厳密な「自己反省」ができるなら、「可能性がある」といった言い方はありえない)について追求するのは、ここでは一先ず断念します。

  また、翻訳について言えば、勿論、原文そのものの翻訳はGoogle翻訳にやらせれば良いので、Googleのアプリ全体でみればこれは大きな問題ではなく、ここでも利用者が必要に応じて使い分けをすれば良いという見方も可能でしょう。ここでも選択肢が存在することは評価できることで、アプリを使い分けすることもできますし、生成AI内で完結させたければ、「直訳する」ことをGemini 3.0 Proに明示的に指示として与えることもできます。


(B) 10.マーラーの第9交響曲の日本初演は?

 ここでも問に対する回答は正しい(1967年(昭和42年)4月16日のキリル・コンドラシン指揮モスクワ・フィルハーモニー管弦楽による来日公演プログラム)のですが、「ポイント」として、日本人指揮者・団体による初演に触れ(これも正しい)、更に「部分的な初演」に触れているところで明らかな「幻覚(Hallucination)」が生じています。これは議論の余地がないタイプの誤りですので、誤りについて指摘したプロンプトとその回答について示すのみとします。

(プロンプト)あなたはマーラーの第9交響曲の日本初演に関して、「全曲初演より遥か前の1943年には、山田一雄が日本交響楽団(現在のN響)を指揮して第4楽章のみを録音しており、これが日本人による最初の第9番の記録とされています。」と回答しましたが、この回答の根拠となる情報源を教えてください。

 回答は以下の通り、誤った類推による「幻覚(Hallucination)」を認める内容でした。なお、自分で「私の誤認(幻覚)によるもの」と述べているのを確認したのは初めてで、確認した時には少し驚きました。プロンプトに含まれているわけではないので、これは恐らく事前学習後に行われたチューニングの成果であると推測されます。

(Gemini 3.0 Pro)申し訳ありません。ご指摘いただいた「1943年に山田一雄がマーラー第9番の第4楽章を録音した」という点について、改めて事実関係を調査いたしましたが、そのような事実は確認できず、私の回答は誤りでした。

この情報は、私の誤認(幻覚)によるものであり、根拠となる情報源は存在しません。

混乱を招いてしまったことを深くお詫び申し上げるとともに、以下の通り訂正させていただきます。

訂正事項

  1. 山田一雄による1943年の録音について:

    • 事実: 山田一雄が1943年に日本交響楽団とマーラーの交響曲第9番(またはその一部)を録音したという記録はありません。

    • 歴史的背景: 1943年(昭和18年)当時の日本は第二次世界大戦中であり、同盟国であるナチス・ドイツの政策の影響を強く受けていました。ユダヤ人作曲家であるマーラーの作品は「退廃音楽」として排除される傾向にあり、1941年のローゼンシュトック指揮『大地の歌』以降、終戦までマーラーの演奏記録はほぼ途絶えています。この時期にマーラーの録音が行われた可能性は極めて低いです。

  2. マーラー第9番の日本における記録について:

    • 前回回答した通り、1967年4月16日のキリル・コンドラシン指揮、モスクワ・フィルハーモニー管弦楽団による演奏が、**日本初演(全曲)**として公式に記録されています。

    • 日本人による全曲初演は、その年の12月の森正指揮、NHK交響楽団です。

    • 部分演奏の記録: 全曲初演以前に、第9番の一部(第4楽章など)が単独で演奏された公的な記録として、私の回答にあったような1943年の事例は見つかりませんでした。

正しい初期のマーラー受容史(日本)

私の誤った回答の代わりに、日本における戦前のマーラー受容の正確なマイルストーンを挙げさせていただきます。

  • 1930年(昭和5年)5月: 近衛秀麿 指揮、新交響楽団により、交響曲第4番が電気録音されています(世界初の第4番の録音の一つと言われています)。

  • 1932年(昭和7年): 近衛秀麿により、**交響曲第5番より「アダージェット」**が演奏されています。

  • 1941年(昭和16年)1月: ヨーゼフ・ローゼンシュトック 指揮、新交響楽団により、**『大地の歌』**が日本初演されました。これが戦前・戦中におけるマーラー演奏の大きなピークであり、これ以降、戦争の激化とともにマーラーは演奏されなくなりました。

不正確な情報、および存在しない録音データを提示してしまい、誠に申し訳ありませんでした。前回の回答の当該部分は全面的に撤回させていただきます。

 

(C)14.マーラーの第9交響曲第1楽章を分析してください

 このプロンプトは指示が曖昧で、どのような視点でどのレベルの分析を行うかは大規模言語モデル(LLM)任せであり、結果として回答は長大になる傾向にあり、Gemini 2.0 Flash, 2.5 Flashの回答では唯一、回答を記録するExcelで複数の行を必要としたものです。またその内容について言えば、主題についての具体的記述などにおいて、そもそも何を指しているのか不明瞭な、曖昧な記述が確認できましたが、単純な評価が困難なことから、従来は評価保留にしていました。

 ところが今回のGemini 3.0 Proの回答は、主題等の細部の具体的な記述についても概ね妥当であるため、他のプロンプトと同様の評価が行えるようになりました。その一方で、その細部について誤りがないとは言い難く、コーダの結尾部分の記述に明らかな誤りが見られます。

結尾: 音楽は終わるというより、空気に溶け込むように消えていきます。楽譜には、クラリネットやフルートに対して「消えるように」という指示が徹底されています。

まず終始音は、フルートおよびハープと弦のフラジオレットによって奏されますし、その手前で長く保持される音にmorendoの指示が与えられているのは、オーボエとホルンです。

 このような細部の記述は、スコアを確認すれば一目瞭然で誤りようがないのですが、Geminiのみならず、大規模言語モデル(LLM)は一般に、現状では楽譜は勿論、MIDIデータのような機械可読形式のファイルであっても事前学習には用いていないと思われますし、検索で仮に見つけられても解析ができないと考えられ、現時点で返ってくる回答は、一定量Web上に存在する楽曲解説の類の記述に基づいて作成されたものと思われます。仮に参照した楽曲解説に誤りがなくても、明示的な記述がないものについて、「尤もらしい」推定・補完をしてしまう可能性が大規模言語モデル(LLM)にはついて回ります。この点は本検証の開始時点から明らかなことで、かつ、現時点でも改善されていないことが確認できたことになります。

 ここまででオリジナルの19個のプロンプトの回答における明らかな誤りについての確認・検討が済んだことになります。既に述べたように、プロンプト20の回答にも誤りが含まれますが、これは19のファクトチェックで生じた問題として、他の追加で実施したファクトチェックでの問題と同様、以下の節で扱うことにします。


5.ファクトチェックで生じた問題について

(D)20.あなたは、ブラームスが、Für den wahren Don Giovanni muss man nach Budapest reisen.と言ったと回答しましたが、典拠を示すことはできますか?(追加分)

  このプロンプトは、大筋では正しいと判断できるプロンプト19.ブラームスはブダペストでマーラーについて何と言ったか?の回答に「原文」と思しきものが含まれていたことから、典拠の確認を目的に追加で実行したものです。同様の確認はChatGPT-5の検証時にも行っており、もともと今回も実施を予定していたものですが、プロンプト自体は、より具体的に、当該「引用」と思しき箇所の典拠を直接的に尋ねる内容のものとしました。

 その結果、回答として以下の3つの文献が典拠として返ってきました。

  1. ナターリエ・バウアー=レヒナーによる記録
  2. マックス・カルベックによるブラームスの伝記
  3. ブラームス自身の書簡

 このうち後の2つはブラームス側の伝記・書簡であるため、手元にある資料での確認ができず、この回答が正しいかどうかの判断のしようがありません。しかしながら、最初に掲げられたナターリエ・バウアー=レヒナーによる回想録、および「まとめ」部分で、

上記のバウアー=レヒナーやカルベックの記録にある発言を要約・定型化したものとして、多くの伝記(アンリ=ルイ・ド・ラ・グランジュの『マーラー伝』など)で引用されています。

として例示されているアンリ=ルイ・ド・ラ・グランジュの『マーラー伝』については手元においてこれまでも参照・活用してきた資料ですので、こちらは真偽の検討が行えます。結論はどうかと言うと、マーラーの伝記一般であれば、例えばブラウコップフの伝記(『マーラー 未来の同時代者』)や、船山隆さんによる新潮文庫版の伝記など、確かにそれに類する発言が引用の体裁で含まれているものもありますが、ナターリエ・バウアー=レヒナーによる回想やアンリ=ルイ・ド・ラ・グランジュの『マーラー伝』で見た記憶がなく、今回改めて確認したところでも、私の見落としがなければ、やはり含まれていないようです。結果として、このプロンプト20は典拠そのものを問うものですから、それについての誤りは周辺的なものとは言えず、全体を不正解と判定せざるを得ませんでした。

 この後引き続いて、更に追加で検証用のプロンプトを実行しており、そこでも「幻覚」(Hallucination)の発生を確認していますが、やりとりの分量的にもかなりのものであり、その報告は煩瑣なものとなってしまうため、本稿では紹介を断念し、後述のファクトチェック結果と併せて別稿にて詳細を報告することにさせて頂きます。

 またプロンプト19の回答末尾のブラームスの作曲家マーラーに対する評価についての以下の記述も概ね正しいのですが、

ブラームスはマーラーの「作曲」に対しては「革命家たちの王だ」と評して複雑な評価(第2交響曲の第2楽章などは褒めましたが)をしていましたが、(…)

付加的に括弧つきで述べられるブラームスが評価していた具体的作品(楽章)については、私が知る限りでは第2交響曲の第3楽章であって第2楽章ではありませんので、疑念があります。しかし第2楽章を評価したという証言・記録が存在しないことを証明することは困難なので、どちらが正しいのかを突きとめるのは大変そうなことを踏まえて、ここでは「誤り」ではなく「疑念あり」としています。


 (E) 18.マーラーの「交響曲第6番」はいつ、どこで初演されたか?

 このプロンプトへの回答は、本来の質問に対する答については申し分ない一方で、幾つか真偽の判断が困難な点を含みます。具体的には以下の点が挙げられると思います。

  • 初演のオーケストラ:エッセン市立管弦楽団とユトレヒト市立管弦楽団からの増員メンバーによる合同オーケストラ
  • 初演時のハンマーの回数
  • 初演時の中間楽章であるアンダンテ、スケルツォの演奏順序

 これらの点について別途追加でプロンプトを実行しており、これらについてもそれぞれ興味深い結果を確認しています。その詳細は別記事で改めてご報告しますが、簡単に結論から先に言うと、最初のオーケストラの編成については、若干表現に問題があるものの、大筋では正しいようです。

 それに対して2つ目、3つ目は、ご存じの方も多いと思いますが、マーラーの第6交響曲について語る時に必ず言及される問題に関連します。但し厳密に言えば、通常それは出版譜のバージョンの問題として扱われているのに対して、ここでは初演の時にどうだったかが問題となっている点が異なります。

 いずれにしてもこれらについては、そのものずばりについての正確な記録が残っていないようで、今後新資料でも発見されない限りは、現時点では決定的なことは言えず、推測の域を出ないようです。このように、そもそも確定的な答が出せないタイプの問題も存在し、これらについては「確実なことは言えない」「諸説ある」と回答するのが正解ということになりますが、この判断自体、時として人間にとっても困難な場合があり、生成AIが、自分が行き当った情報に基づいた答を返すことについても、人間もまたそうすることは十分に考えられるため、この点をもって生成AIの能力を評価することには慎重であるべきかと思われます。とはいうものの、これらはこちらの用意したプロンプトが求める回答そのものではなく、Gemini 3.0 Proが、謂わば「勝手に」追加したものです。正直に言えば、こんな微妙な問題について頼んでもいないのにわざわざ言及してファクトチェックの手間を増やさなくてもいいのにと思ってしまったことも事実です(苦笑)。


6.まとめ

 以上、本稿ではGemini 3.0 Proの評価結果を報告してきました。その内容を改めて整理すると以下のようになるかと思います。

  • もともとGemini はリアルタイム検索を併用し、検索精度が高いことから、既に2.5 Flash で非常に高い正答率を示していました。そのため正答率については顕著な変化はありませんでした。以前のバージョンと比較して、回答は詳細になり、補足情報が増えた一方で、付加された補足的な情報に細かな誤りが幾つかありました。
  • 誤りの一部は論理的なものであり、Geminiを含む大規模言語モデル(LLM)の推論が厳密に論理的なものではなく、確率的な尤もらしさに基づくものであることが窺えました。
  • 誤りの確認のプロンプトの回答からは、Geminiがかなり複雑な推論を行うことができることが窺えました。
  • ファクトチェックを目的とした、情報の典拠を確認するプロンプトの回答では、明らかな誤りが確認でき、このタイプの課題が原理的に大規模言語モデルにとって苦手なものであり、高度な推論機能や複雑なタスクの実行に関する大幅な能力向上にも関わらず、問題は依然として残っていることを確認しました。
  • また音楽自体については、楽譜やMIIDIデータを参照することができないため、音楽についての言説に依存した回答しか返せないという制約も依然として残っていることが窺われ、音楽情報については未だ根本的な課題が残ったままであることも確認できました。

 ChatGPTやGeminiなど、大規模言語モデル(LLM)が示す文献が架空のもので実在しなかったり、内容上、典拠として用いることができなかったりという例はこれまでも頻繁に報告されており、それ自体を対象とした学術的な研究も存在します。(例えば、GIGAZINEの記事「「AIが引用した参考文献」の約3分の2が存在しない文献だったり間違っていたりしたとの調査結果」でその概要を確認することができます。)文献情報は、内容の信頼性の確保の上で極めて重要でありながら、具体的・個別的な事実についてという性格が最も強い情報であり、大規模言語モデル(LLM)が最も苦手とする領域と考えられます。マーラーという個別の人間についての具体的な事実に関する情報であっても、マーラーのような一定の知名度がある存在であれば、Web上にある程度の密度で情報が存在するので、ここまで確認してきたように、概ね正解を返すことが可能なのですが、その典拠となる文献情報の方は遥かに個別的であり、情報も桁違いに少なくなります。それでも主要な文献の存在そのものは、事前学習やWeb検索の対象となる情報自体に付随して含まれる可能性がありますが、その文献の内容については、特にその文献がWeb上でオンライン参照できなければ、そもそもが推測する他ありません。更に文献のオンライン化の程度は、分野により大きく異なり、更に同一分野でも対象や領域により異なります。マーラーの場合はどうかと言えば、その文献の多くはオンラインで利用可能な状況には程遠く、従って、生成AIの回答を鵜呑みにすることが危険であることは間違いなく、逆に明らかな間違いが減り、一見尤もらしい回答が増えた分、一層慎重なファクトチェックが欠かせないということになりそうです。

 そのような制約はありますが、Gemini 3.0 Proの回答は、概ね正確で、詳細を極め、時として自分が今まで知らなかった情報が提示されることもあり、苦手な点に注意しつつ、得意な面が引き出せるように使い方を工夫をすれば、優秀なパートナーとして利用することができるように感じました。

 「5.ファクトチェックで生じた問題について」で述べた通り、本検証では、オリジナルのプロンプト自体については正解を返してきたものの、その一部について疑念があり、追加でファクトチェックのための問い合わせを行っています。その結果は、極めて高性能とされるGemini 3.0 Proでもこのような誤りをするという恰好の事例となっており、興味深く報告に値するものと考えますが、本来のプロンプトセットに対する評価とは別のものですので、本稿は一旦ここで打ち切りとさせて頂き、その経過については別稿で報告することとさせて頂きます。

(2025.12.15 公開, 2026.1.8 お断りを追記して更新)


2025年12月7日日曜日

マーラーについて生成AIに聞いてみた(22):Claude Sonnet 4.5の検証

  本記事では、2025年9月30日にリリースされたClaude Sonnet 4.5を対象に、マーラーに関する様々な問い合わせを行った結果を報告します。結論から先に申し上げると、3.7 Sonnet、Sonnet 4といった過去のバージョンに比べ、検索の精度、回答の精度とも飛躍的に向上し、一部の若干気の毒なケースを除けば、ほぼ正解を返すことができていることを確認できています。

1.検証の背景

 本ブログではこれまでに生成AIに対してマーラーに関する質問を行い、その結果を報告してきました。最初の記事の公開は2026年3月13日であり、その時点で検証対象とした生成AIは以下の通りでした。

  • ChatGPT(Web版)無料版:GPT-4o(利用制限あり)・リアルタイムWeb検索なし
  • Gemini(Web版)無料版:Gemini 2.0 Flash・リアルタイムWeb検索あり
  • Claude for Windows ver.0.8.1(Windows版アプリ)無料版:Claude 3.7 Sonnet・リアルタイムWeb検索なし

 この時点での各生成AIの回答は極めて不正確なものであることから、Llama2 SwallowベースでRAGを自作し、マーラーに関する各種の情報を与えることによって性能が改善できることを確認しました。

 その後わずか数か月のうちに各生成AIのバージョンアップが相次ぎ、また同一LLMを用いる場合でもリアルタイムWeb検索が可能になることで性能に変化があったため、以下のバージョンで再検証を実施しました。

  • ChatGPT 無料版:GPT-4o(利用制限あり)・リアルタイムWeb検索あり(有無を選択可能)
  • Gemini 無料版:Gemini 2.5 Flash・リアルタイムWeb検索あり
  • Claude 無料版:Claude Sonnet4・リアルタイムWeb検索あり

 検証の結果、特にリアルタイムWeb検索を併用することで、LLMの事前学習データに含まれていなかった情報についても取得できるようになったことから、大幅に回答の精度が向上し、マーラーに関するパブリックな情報に関する限り、RAG構築の必要性がほぼなくなったと感じられる迄になりました。その一方で、ChatGPT, Geminiでは回数制限つきながら、多段階の推論を得意とするLLMを用いたDeep Search機能が利用可能となり、事実関係の問い合わせや情報収集ではない、「後期様式」に関するレポート作成、第9交響曲第1楽章の分析レポート作成に関しても一定の性能を示すことも併せて確認して、2025年6月初めに一通りの検証報告を終えています。

 更にその後、ChatGPT-5がリリースされたのを機に、これについても同一のプロンプトセットを用いた検証を行い、検証に用いられたような事実関係を確認することが中心の問い合わせについて言えば、リアルタイムWeb検索を用いない場合があることから、ChatGPT-5の回答の精度は、常にWeb検索つきでChatGPT-4oに問い合わせた時よりも低くなってしまうことがわかりました。

 今回はClaude Sonnet 4.5が検証対象ですので、検証の観点としては、前のSonnet 4との比較対照、および他の生成AIの最新版との比較対照が中心となります。

2.検証内容

 まず改めて対象となるバージョンと実験を行った日付は以下の通りです。

Claude Sonnet 4.5 無料版(2025年11月28日)

 Claude Sonnet 4.5の無料版では、従来と同様に利用制限があり、制限に達すると利用ができなくなります。制限に達したら検証を中止し、制限が解除されたら再開、というやり方で検証を進めましたが、一度の中断で済んだため、11月28日中に検証を終えることができました。(具体的な経過は後述します。)またClaudeの無料版の特徴として、1チャット(スレッド)で扱える文字数(厳密にはトークン数に拠るものと思われますが)にChatGPTやGeminiと比べるとやや強い制限がありますが、今回の検証に際しては、検証用に新たに用意したチャット(スレッド)内で全ての検証を行うことができました。

 検証で用いたプロンプトセットは以下の通りです。既述の通り、基本的にこれらは元々は以前、llama2 / Swallowベースで自分で構築したRAGの検証用に用意したものです。「2.マーラーの「大地の歌」の日本初演は」は「1.大地の歌」の日本初演は?」と実質的には同一の問いですが、元々は、初期の検証においてプロンプトのちょっとした違いによって回答が大きく異なる(正解に辿り着けるか否かといった評価に影響する差異が生じる)ことが確認されたために設定したもので、その後、実質同じ質問が繰り返されていることが回答で指摘される場合があるなど、生成AIの挙動を確認する上で興味深い結果が得られたため、今回もそのまま残して検証を行うことにしました。そうした背景から、問い合わせの順番としては、2については最後に回し、また他の質問とはやや異質でこれまで評価外としてきた14も後回しにして、1,3~13,15~19の実行後、14を問い合わせ、最後に2を実行する順序としました。(実際には、Claude Sonnet 4.5の制限により18までで一旦中断, 19,14,2は再開後に実施しました。)

  1. 「大地の歌」の日本初演は?
  2. マーラーの「大地の歌」の日本初演は
  3. マーラーの「大地の歌」はどこで書かれたか?
  4. マーラーは第8交響曲についてメンゲルベルクに何と言いましたか?
  5. マーラーが死んだのはいつか?
  6. マーラーはいつ、誰と結婚したか?
  7. マーラーがライプチヒの歌劇場の指揮者だったのはいつ?
  8. マーラーがプラハ歌劇場の指揮者だったのはいつ?
  9. マーラーがハンブルクの歌劇場の楽長になったのはいつ?
  10. マーラーの第9交響曲の日本初演は?
  11. マーラーは自分の葬儀についてどのように命じたか?
  12. マーラーの「嘆きの歌」の初演は?
  13. マーラーはどこで生まれたか?
  14. マーラーの第9交響曲第1楽章を分析してください
  15. マーラーの第10交響曲の補作者は?
  16. マーラーの第2交響曲の最初の録音は?
  17. マーラーの「大地の歌」のイギリス初演は?
  18. マーラーの「交響曲第6番」はいつ、どこで初演されたか?
  19. ブラームスはブダペストでマーラーについて何と言ったか?
 最近の生成AIは、質問に対する直接の回答にあたる情報のみならず関連する情報を付加して返す傾向がありますが、Claude Sonnet 4.5についてもそのことが言え、1件の回答はかなりの分量になります。そこで本記事中で全ての結果の紹介を行うことは控え、以下のように結果をpdf化したファイルを公開することとしました。参考までにClaudeの過去のバージョンの検証結果も以下に示します。

 
 各行毎に、プロンプトのID(通番)、プロンプト、回答、実験日、評価、Web検索の有無に加え、今回は評価順を記載しています。既述のように、制限により18までで一旦中断していますが、既述の通り、同一日に再開できたため実験日は同一になっています。Sonnet 4の時には2回中断があったのが1回のみとなり、中断回数は減りましたし、中断なしで一度に処理できる量(厳密にはトークン数と思われますが)が増えているように感じました。

 「14.マーラーの第9交響曲第1楽章を分析してください」については、回答が長いものになったため、複数行に分割しています。また詳細は後述しますが、回答中、明らかに事実に反すると判断できる箇所は赤字に、評価には反映しないものの、やや不自然と私が判断した箇所は青字にして、評価基準が明らかになるようにしています。


3.検証結果の概要

 今回は評価にあたり、以下の5つを区別することにしました。また上述の通り、各プロンプトの問い合わせに対して、Web検索を行ったかどうかも併せて記録しています。
  • 〇:概ね正しい情報が返ってきている
  • △:一部に明確に誤った情報が含まれる、或いは妥当性に疑念がある記述が大半を占めている
  • ×:全体として誤った情報が返ってきている
  • □:情報を見つけることができず、回答できない
  • ー:評価無し(プロンプト14のみ)
 この分類に拠れば今回の結果は以下のように要約できます。Claude Sonnet 4、Claude 3.7 Sonnetの結果と比較して頂ければ一目瞭然ですが、これまでにない精度の回答が返ってきており、Sonnet 4.5に至って飛躍的に能力が向上したことが窺えます。
  • 〇=17
  • △=0
  • ×=1
  • □=0 
  • ー=1
 一方、Web検索の有無については以下の通りです。検索なしは数が少ないのでプロンプト番号を示します。
  • 検索あり:17(○=16, ×=1)
  • 検索なし:2(○=1, ー=1:2,14)
 検索の有無について言えば、従来は実質的に1と同一の再質問である2についても検索に行き、独立に回答(いずれも正解)していたのに対し、今回は同一チャット(スレッド)内で、制限による中断を挟んで、検証再開後の最後に再質問するという条件で、1の回答を記憶しており、検索なしで回答を行い、かつ「最初のご質問と同じ内容ですが、改めてお答えしました。」というコメント付きの回答が得られました。

 また上に見るように、情報を見つけることができず、回答できないケースは1件もありませんでした。ClaudeはGeminiは勿論、ChatGPTと比較しても検索の性能に制限がある印象があり、Claude Sonnet 4、Claude  3.7 Sonnetの時には、検索をしても回答が得られなかったケース(但し前回までは△に含めてしまっていました)が散見されましたが、特定の個人についての個別的な事実に関するプロンプトが中心とはいえ、マーラーについての情報はWikipedia等をはじめとして、Web上の公的性質の高いサイトにそれなりに存在することも与ってか、検索の性能の問題は本検証の範囲では解消され、性能の向上がはっきりと確認できました。

 不正解は「7.マーラーがライプチヒの歌劇場の指揮者だったのはいつ?」の1件のみであり、回答の精度の向上も明らかです。しかもこの誤答は、参照したWikipedia日本語版の「グスタフ・マーラー」の見出しの記事の記載内容の曖昧さに由来するもので、些か気の毒な面があります。Wikipediaの記載は以下の通りです。
9月にはカッセル王立劇場の次席楽長となるも、待遇の問題から当初3年の契約の満了を待たずに翌1884年に辞任した[27][28][29]。また同じ頃、マーラーはライプツィヒ市立劇場との6年間の契約を結ぶことに成功する[30]。
まずこの記述は、カッセルのポストの辞任を1884年としている点で、控えめに言ってもミスリーディングです。正しくは1884~85年のシーズンで退任なので、1885年に退任とするのが普通だと思います。

 更にこのため「同じ頃」が1884年のことと読めてしまいますが、注30に記載の文献(村井翔『マーラー(作曲家・人と作品シリーズ)』音楽之友社、2004年)を読むとわかる通り、ライプチヒ市立劇場との6年間の契約は1885年1月23日の書簡に記載のある事柄です。より重要なのは、それに続くようにしてプラハのドイツ劇場との契約も成立し、結局マーラーはまずプラハで1885年秋から1年間、その後1886年秋からライプチヒで活動をすることになったことです。ところがWikipediaの記述は以下のように続きます。この流れだと冒頭の「6月」は1884年にしか読めませんが、実際にはこれは既に明らかな通り、1885年のことです。
6月、カッセルでの音楽祭でフェリックス・メンデルスゾーンの『聖パウロ』を指揮して、成功を収めカッセルを後にした[28]。この時期、マーラーにとって念願でもあったバイロイト音楽祭を見に行くことができ、ワーグナーのオペラ「パルジファル」を観劇した[22]。
1885年にはオーストリア皇帝フランツ・ヨーゼフ2世の臨席の下、プラハでデビューを飾る[29]。
ライプツィヒ市立劇場では当時、首席指揮者としてアルトゥール・ニキシュが活躍しており、マーラーとニキシュの指揮者としての芸風の違いは当時のライプツィヒの聴衆を大いに盛り上げた[31]。
1887年2月にはニキシュが病気療養のため首席指揮者としてのポストを辞任し、マーラーがその地位に繰り上がる[32]。

 つまりWikipediaにはプラハのドイツ劇場との契約の記述はなく、その活動も「プラハでデビューを飾る」という一言のみで済まして、ライプチヒでの活動とは独立のものであることは文字通りにはわかりません。勿論、マーラーの伝記に馴染んでいる人にとっては自明のことでしょうし、そうでなくても常識的にライプチヒ市立劇場での活動と別のものであることは自明であるとする立場もあるでしょう。けれどもハンブルク時代のロンドン公演など、他の都市での公演もないことではありませんし、背景知識のない人であれば、ライプチヒ市立劇場の6年契約の一環として、まずプラハでその活動を開始したという読み方をする人がいるかも知れません。

 そして実際、Claude Sonnet 4.5の今回の回答は、正にその背景知識を持たない人が上記の文章を素直にかつ論理的に読み取った結果と言えなくもないように思えます。つまり「1884年にライプツィヒ市立劇場と6年間の契約を結び」「1887年2月にはニキシュが病気療養のため首席指揮者のポストを辞任し、マーラーがその地位に繰り上が」った事実に基づき、「つまり、マーラーは1884年から次席楽長として、1887年からは首席指揮者としてライプツィヒ市立劇場で活動して」いたという答を返すことになりました。

 もっともそれを論理的と呼ぶのであれば、次の「8.マーラーがプラハ歌劇場の指揮者だったのはいつ?」の回答との整合性について無頓着であるのは奇妙だということになります。こちらは全くの正解で、1885年8月から1886年夏頃までの約1年間という答を返しているのですが、これが前の「7.マーラーがライプチヒの歌劇場の指揮者だったのはいつ?」の自分の回答と矛盾していることには気づいていません。過去の履歴を保持すると言っても、このように回答間の論理的整合性を逐次チェックするというレベル迄は到達していないという限界が露呈されることになってしまっています。

 そこでこの点について検証終了後に別途(2025年12月7日)、以下のような問い合わせを行ってみました。

プロンプト:あなたはマーラーがライプチヒの歌劇場の指揮者として活動した時期を、1884年から次席楽長として、1887年からは首席指揮者としてライプツィヒ市立劇場で活動したと回答しましたが、その一方でマーラーがプラハ歌劇場の指揮者だった時期については1885年8月から1886年夏頃までの約1年間としています。これは矛盾しているのではありませんか?
 これに対する回答は以下の通り、非常に的確なものでした。
ご指摘ありがとうございます。確かにおっしゃる通り、私の回答には矛盾がありました。

ライプチヒでの契約が1884年から始まっていたのに、1885年8月からプラハで働いていたという説明は時系列的におかしいですね。

検索結果をもう一度確認すると、正しい経緯は以下の通りです:

1. **1884年** - マーラーはライプツィヒ市立劇場と6年契約を結びました
2. **1885年8月** - しかし実際にライプチヒでの勤務が始まる前に、プラハのドイツ劇場の副指揮者として1シーズン働きました
3. **1886年夏頃** - プラハを離れ、ライプツィヒでの契約を履行するためにライプツィヒへ
4. **1887年2月** - ライプツィヒで首席指揮者に昇格
5. **1888年** - ライプツィヒを辞任

つまり、ライプチヒとの契約は1884年に結ばれましたが、実際の勤務開始は1886年で、その前にプラハで働いていたということですね。最初の回答で時系列を正確に説明できておらず、申し訳ありませんでした。重要なご指摘をありがとうございました。
 つまり事後的に指摘を受けて、「7.マーラーがライプチヒの歌劇場の指揮者だったのはいつ?」および「8.マーラーがプラハ歌劇場の指揮者だったのはいつ?」の両方の検索結果を併合して、整合性のある回答を導出することは正しく出来ており、Claude Sonnet 4,5が論理的な推論においてかなり高度な能力を持っていることが確認できました。

 のみならずこの回答は、自分の矛盾を率直に認め、それを正しく訂正することが出来ているという点でも画期的に思われます。今回は偶々すべての問いの答が得られたため、幻覚(Hallucination)対策の成果が確認できるようなケースはありませんでしたが、元々過去のバージョンにおいてもClaudeはかなり慎重な回答を返す傾向にあり、別の検証では、そうした傾向が維持されていることが確認できており、信頼性も向上している印象を受けます。

 その他で気になった点としては、「3.マーラーの「大地の歌」はどこで書かれたか?」の回答の文章の組み立て方で、一旦、「1908年の夏、休暇先のアルト・シュルーダーバッハで作曲されました。」と述べながら、後続で「この作品は、マーラーがアメリカに渡った後に作曲され、1909年秋に完全に完成しました。」と述べている点です。間違いではないのですが、取りようによっては、アルト・シュルーダーバッハとアメリカに渡った後と、どちらが正しいのか?という疑問が生じかねません。実際にはそのどちらも正しく、「1908年の夏、休暇先のアルト・シュルーダーバッハで作曲が開始され」「マーラーがアメリカに渡った後も作曲が続けられ」とするのが自然な回答と思われます。一方では文章の推敲に生成AIを用いることが普通になりつつありますが、時としてこのように一見して論理的に矛盾しているかに誤解されかねない文章を生成することもあるということがわかります。

4,まとめと考察

 以上、Claude Sonnet 4.5の検証結果について報告しました。3.7 Sonnet、Sonnet 4といった過去のバージョンに比べ、検索の精度、回答の精度とも飛躍的に向上し、一部の若干気の毒なケースを除けば、ほぼ正解を返すことができていることを確認できました。これは既に述べたように、本検証のプロンプトは、特定の個人についての個別的な事実に関するものが中心とはいえ、マーラーについての情報はWikipedia等をはじめとして、Web上の公的性質の高いサイトにそれなりに存在することも与っているものと思われます。それは先行して「三輪眞弘について生成AIに聞いてみた(20):Claude Sonnet 4.5の検証」にて報告した、三輪眞弘さんに対する問い合わせに関する検証結果と比較した場合に明らかなことに思われます。つまり、同一の分野の同一の傾向の質問においても、認知度や研究量が異なり、訓練データ内の情報量が異なる対象についてのパフォーマンスには違いがあることが確認できます。今回はClaude Sonnet 4.5についての検証でしたが、その傾向は今回の検証だけではなく、これまでの検証を振り返って横断的に眺めた時に、大規模言語モデルの種類によらない一般的な傾向として、明らかに確認できるものと考えます。一般に生成AIの回答の信頼性は問い合わせの対象の領域に大きく依存し、事前学習データおよびリアルタイム検索するWeb上のデータ中に情報が多く含まれない場合には信頼性が低くなります。これは例えば、最近のより学術的な検証(GIGAZINEの記事「「AIが引用した参考文献」の約3分の2が存在しない文献だったり間違っていたりしたとの調査結果」でその概要を確認することができます)の結論とも一致します。実際、最近ChatGPTを性能上凌駕したと言われるGemini 3.0 Proの検証を、同じマーラーに関するプロンプトセットを用いて別途行っているのですが、そこでは、標準のプロンプトセットに加えて典拠を示す指示を与えた所、かなり深刻な「幻覚」(Hallucination)が起こることを確認していますので、これは別の記事で報告したいと思います。

 一方で、本来はClaude Sonnet 4.5の能力の際立った側面は、プログラムのコーディング能力を別とすれば、高度な論理的推論能力、かなり長大な文章を受取り、長大な文章を生成することができる能力にあるようで、実際、本稿の報告者も別に、その能力の高さを実感する機会を既に得ていますが、本報告の中でも、かなり高度な推論を行うことができる片鱗を窺うことができたように思います。もともと個別的な事実を確認するプロンプトが中心の本検証は、その能力を確認するのには必ずしも適したものではなく、情報収集能力という点では、既にGemini 2.5 Flashのような競合もありますが、Claudeに向いていそうな領域として、事実がどうであるかよりも、気付きにくい論理的な可能性を引き出したり、矛盾を検出したりといった、理論的な仮説構成や検証のような領域が考えられ、うまく利用すれば非常に強力なパートナーになりうるというのが、他の検証の結果も併せての全般的な印象です。既に深い推論という点ではChatGPT-5があり、Geminiもいよいよ3.0 Pro(無料版の「思考モード」)がリリースされましたが、この両者は従来のDeep Researchの延長といった印象で、動作も重く、時間がかかる場合がある一方で、回答に質問に対する直接の答以外の補足的な情報がかなり含まれて、時として過剰気味であったり、補足的な情報を追加しようとするあまり、却って推論能力が仇になり、「幻覚」(Hallucination)が起こるケースなど、デメリットも散見されるのに対し、Claude Sonnet 4.5 は、稍々そちらの方向に歩み寄っている感はあるものの、相対的にはバランスよくスマートで、あらずもがなの「幻覚」(Hallucination)を惹き起こすことが少ない印象を受けます。今後はそれぞれの得意なタスクのタイプを見極めて使い分けるような工夫が必要になってくるように思います。

 その一方で、本報告の対象となる検証では、情報元となる人間が書いた文章が持つ曖昧さやミスリードな側面も浮き彫りになったように感じます。それらにも程度の問題というのはあって、人間が普通に読む限りでは間違えないようなレベルのものもあれば、人間でも背景知識や事前情報によっては誤解してしまうようなケースもあって、両者は明確に区別できない連続的なものではないかと思います。あくまでも現状の生成AIはその多くを人間が作成したWeb上の情報に基本的には依存しており、それが間違えていたり、間違えていない迄もミスリードを招くようなものであれば、生成AIの返す情報に誤りが含まれることは避け難いものとなります。しかしそれは生成AIに限定した話ではなく、実は一般にWeb上の情報を人間が利用する場合にも当て嵌まるものであり、実際には、従来からしばしば指摘されてきたこと(例えばWikipediaの内容の信頼性は、特にその初期にはかなり問題視された経緯があると記憶します)ではないでしょうか?否、それはWeb上の情報に限定されるものですらなく、紙媒体の書籍であっても原理的には生じえるものではないでしょうか?このように考えていくと、今日生成AIの普及を契機にしてクローズアップされてきた問題の一部は、程度の問題はあれ、実は生成AI固有の問題ではなく、より一般性のある問題が生成AIを通して顕在化したものも含まれるのではないかというように感じられます。そういう意味合いでも生成AIは人間の鏡のような存在なのかも知れません。生成AIが突き付けてくる問題は、それを避けることなく受け止めることでわかってくることが数多くあり、今回もまたその一端に触れたような気がしました。

(2025.12.7公開, 12.8追記)