Epoch AIの最新研究によると、主流のAIテキスト検出ツールはほぼ完璧に通常のAI生成テキストを識別できるが、大規模言語モデルが特定の著者のライティングスタイルを意図的に模倣する場合、検出精度は顕著に低下し、科学的ライティングが最も識別が難しいシナリオとなっている。
研究チームは、Pangram(3.3.2)、GPTZero(2026-05-11-base)およびOriginality.ai(Turbo3.0.2)という3つの主要なAIテキスト検出ツールをテストし、495編の人類によるオリジナルテキストを含むテストセットを作成した。このテストセットにはブログ、小説および科学的ライティングの3種類のコンテンツが含まれており、すべてのサンプルはChatGPTが2022年11月にリリースされた前までに作成されたもので、トレーニングデータの汚染を避けるためである。

テスト結果によると、通常のAI生成テキストの場合、3つのツールの見逃し率は最大で0.7%にとどまった。人間のテキストの識別に関しては、PangramとGPTZeroは誤報がなかったが、Originality.aiは19件の人間のテキストをAI生成と誤って判定し、誤報率は3.8%となった。
さらに研究では、Claude Opus4.8、GPT-5.5およびGemini3.1Proが提供された著者の5編の真実作品を学習し、同じ文風で新しいコンテンツを生成した。297編のスタイル模倣テキストにおいて、平均して約13%が検出ツールによって識別されなかった。その中で、Pangramの見逃し率は10%、GPTZeroは11%、Originality.aiは18%だった。
科学的ライティングが検出ツールの性能が最も弱い分野となった。Pangram、GPTZeroおよびOriginality.aiが学術的なスタイルのAIテキストの見逃し率はそれぞれ25%、24%および29%に達した。一部のモデルの組み合わせではさらに悪化しており、例えばPangramはGeminiが生成した学術的なテキストの48%を見逃し、Originality.aiはGPT-5.5が生成した学術的な内容の39%を見逃した。
3つのツールはニューラルネットワーク、テキストの予測可能性分析、統計パターン認識などの異なる技術的アプローチを使用しているが、ともに似たような欠点を露呈した。研究結果は、大規模モデルがますます人間のライティングスタイルを模倣するようになるにつれて、教育や研究など学術的なライティングの真実性に依存する場面において、現行のAIテキスト検出技術が大きな識別課題に直面していることを示している。
