ChatGPTやClaudeのような大規模言語モデル(LLM)に「架空の研究者を作って」と頼むと、なぜか同じ名前ばかり出てくる。Elena Vasquez(エレナ・バスケス)、Marcus Chen(マーカス・チェン)、Elara Voss(エララ・ヴォス)——AIをよく使う人の間では、前から知られていた癖である。
サムスンAIセンター(ワルシャワ)とワルシャワ大学の研究者が2026年6月に公開した論文は、この癖の「行き先」を追いかけた。タイトルは “The Ghost Couple”——幽霊の二人組。論文によると、これらの実在しない名前が、いま学術データベースの中に「著者」として住みつき始めている。CERNが運営する研究データの保管サービスには、幽霊が書いたことになっている記録が1,655件見つかった。しかも、正規のDOI付きで。

繰り返し現れる名前という現象
まず前提から。LLMは、名前を指定せずに架空の専門家や登場人物を作らせると、確率の高い「定番の名前」に寄っていく性質がある。たとえば2026年6月には、複数のチャットボットが小説を書くと Elias Thorne(イライアス・ソーン)という灯台守がやたら登場する、という話が404 Mediaで報じられていた。ChatGPTにソフトウェア開発者のキャラクターを作らせると Marcus Chen になりがち、という観察もユーザーの間で共有されていた。
今回の論文が新しいのは、これを体系的に測ったことと、「名前が単独ではなくセットで出る」ことを示した点にある。研究チームはClaude 9バージョン、GPT 10バージョン、Geminiの公開APIに対して、「架空の研究者を1人/2人/3人作って」という趣旨のプロンプトを各30本ずつ投げ、出てきた名前を集計した。
結果、モデルの系統ごとに決まった「顔ぶれ」があった。この研究の報告では、Claudeは Elena Vasquez と Marcus Chen のペア(3人目に Amara Okafor が加わることも)、Geminiは Aris Thorne と Lena Petrova のペア、GPTは Elara Voss が単独で頻出する——という構図だ。Geminiのあるバージョンでは、1人だけ作らせたときの93%が Aris Thorne になったという。単に同じ名前が出るだけでなく、「この名前とこの名前は一緒に出やすい」という相関があり、それがモデルの系統ごとに違う。
もうひとつ面白いのは、この癖がバージョンごとに変わっていくことだ。測定によると、Elena Vasquez は2025年5月版のClaude Sonnet 4では6割超の頻度で出ていたが、新しいバージョンほど頻度が下がり、最新に近い版ではほぼ出なくなっている。開発側が意図的に抑え込んでいるとみられる、と論文は指摘する。つまり「どの名前がどれくらい出るか」は、モデルの版ごとに異なる指紋のようなものになっている——ここが、あとで効いてくる。
学術データベースで見つかった1,655件
研究チームは、この指紋を逆向きに使った。AIが出しがちな名前が分かっているなら、その名前でウェブや学術データベースを検索すれば、AIが作った文書を釣り上げられるはずだ、という発想である。
ウェブ側では、予想どおりの光景が広がっていた。Elena Vasquez と Marcus Chen は、火山の専門家、宇宙飛行士、スリラー小説の主人公、ポッドキャストの司会者として、互いに無関係な何百ものAI生成ページに登場していた。スペイン語の火山情報サイトが「専門家チーム」として2人を紹介し、カナダの心理クリニックのスタッフ紹介ページにも名を連ねる。どのページの人物も、実在しない。
ただ、本当に驚くのはここからだ。舞台が学術インフラに移る。
Zenodo(ゼノド)という、CERN(欧州原子核研究機構)が運営する研究データの保管サービスがある。論文やデータを誰でも無料でアップロードでき、登録するとDOIが発行される。DOIは論文などに割り振られる世界共通の識別番号で、これが付いていると「正式な学術記録」として各種のデータベースから参照できるようになる。
研究チームがZenodoを調べたところ、実在しない2つの雑誌名——「Journal of Functional Materials」と「Journal of Computer Engineering」——を掲載誌として名乗る記録が1,655件見つかった。どちらの誌名も、学術誌の登録データベースに該当がなく、ISSN(雑誌の登録番号)も発行元も存在しない。そして著者欄には、あの名前たちが並んでいた。1,655件の中で最も多く著者として登場したのは Elena Vasquez で、77本。研究チームは彼女の名前で検索したわけではなく、雑誌名から辿り着いた先に、また彼女がいたのである。
手口も分かっている。これらの記録は「2020年〜2023年に出版された」と自己申告していたが、DOIの登録システム側に残るタイムスタンプ(利用者には書き換えられない)を見ると、99%が2026年3月〜4月に登録されていた。つまり、意図的に日付を古く偽装している。アップロードのペースは2025年まで月1〜2件だったのが、2026年3月に991件、4月に666件——60日間、毎日25件前後という機械的なペースで、自動化されたパイプラインの存在を示している。
Zenodoは無料アカウントさえあれば誰でもDOIを発行できる仕組みで、そこが突かれた形だ。誰が何のためにやっているのかは、論文からは分からない。
ResearchGate上の合成研究グループ
幽霊たちは、研究者向けSNSのResearchGateにもいた。こちらはさらに手が込んでいる。
論文が詳しく取り上げているのは、あるナイジェリアの大学に所属するとされる人物のプロフィールだ。35本の論文がすべてその人物を最終著者(研究室の主宰者が入る位置)とし、共著者には Elena Vasquez(Claudeの幽霊)や Aris Thorne(Geminiの幽霊)が繰り返し登場する。1本の論文の著者欄に、別々のAIモデルが生み出した幽霊が並んで載っているケースまであった。論文のテーマはKubernetesのセキュリティから製油所の脱炭素、農業支援まで、およそ一人の研究者が書いたとは思えないほどバラバラで、引用は0件。論文はこれを、幽霊名を共有の「著者プール」として使い回す合成研究グループの典型例だとしている。
そして、こうしたResearchGate上の記録は、Google ScholarやSemantic Scholarといった学術検索サービスに、実在確認なしで載る。研究者の名前を検索したとき、幽霊の「業績」が普通に検索結果に出てくる状態が、すでにできあがっている。
学術の外でも実害の芽は出ている。404 Mediaは2026年8月、「100%人間が書いた医療研究」を売りにしながら実際は全部AI生成だった企業を報じたが、その企業の「創業者・主任方法論者」の名前が Elena Vasquez だった(報道後、サイトから削除された)。また、米国で起きた射殺事件をめぐるFacebook上のデマでは、実在しない「Elena Vasquez博士」の発言として偽の情報が拡散された。AIの定番名は、偽の権威付けにちょうどいい道具になってしまっている。
まだ始まっていない汚染と、閉じつつある輪
ひとつ、正確に書いておきたいことがある。Zenodoの1,655件は、2026年5月の時点ではSemantic Scholarにまだ収載されておらず、本物の論文の「引用された文献」リストに幽霊論文が混ざる事態も、まだ起きていない。論文の表現を借りれば、「大規模な汚染のためのインフラはすでに整っているが、汚染そのものはまだ広がっていない」段階だ。正規のDOIが付いている以上、DOIの情報を自動で取り込む学術サービスなら、いつでも取り込める状態にある——ということである。
一方で、この研究には希望のある読み方もできる。モデルごと・バージョンごとに名前の指紋が違うのだから、逆にその名前を手がかりに「この文書はどのAIがいつ頃作ったか」を推定できるかもしれない。実際、研究チームは著者名の出現時期から、AI生成コンテンツの生成時期をある程度割り出せることを示している。
ただし筆頭著者のBrzozowski氏は404 Mediaの取材に対し、この精度は長くは持たないだろうと話している。理由は単純で、これらの名前を含むAI生成コンテンツがすでにネットにあふれており、それが次のAIモデルの学習データに流れ込むからだ。
整理すると、こういう輪ができつつある。LLMが決まった偽名を出す。その偽名で偽の論文や記事が量産される。それがDOI付きで学術インフラに登録され、「実在の著者」の体裁を得る。ウェブに定着したその内容を、次のLLMが学習する。そしてまた同じ名前が出てくる——。輪のどこかで止めない限り、幽霊は増え続けることになる。
解釈上の留意点
この論文は査読前のプレプリント(正式な審査を受ける前の公開版)で、内容はまだ第三者の検証を経ていない。プロンプトは各条件30本ずつなので、頻度の低い名前は拾いきれていない可能性がある、と著者ら自身も述べている。
また、「どのモデルがどの名前を出すか」は測定した時点・バージョンでの観察結果であり、固定的な事実ではない。上で見たとおり、開発側の対策で名前の頻度はバージョンごとに大きく変わっている。
そして大事な断りをもうひとつ。Elena Vasquez も Marcus Chen も、ごく普通にある名前で、同姓同名の実在の研究者や専門家は当然いる。論文も「名前そのものが偽物だと言っているのではない」と明記している。問題にしているのは、名乗っている専門分野・所属・名前の組み合わせがAI生成コンテンツの中にしか存在しないケースだ。この名前を見かけたら即ニセモノ、という話ではない。
出典
元論文(査読前プレプリント):Michał Brzozowski, Neo Christopher Chung (2026) The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing. arXiv:2606.02184
https://arxiv.org/pdf/2606.02184
報道:Emanuel Maiberg (2026) The AI ‘Ghosts’ Contaminating Academic Publishing. 404 Media(2026年8月27日)
https://www.404media.co/the-ai-ghosts-contaminating-academic-publishing/


コメント