執筆・編集

長文読解AIの盲点?コンテキスト長が性能を落とす、誰も知らなかった不都合な真実

長文読解AIの盲点?コンテキスト長が性能を落とす、誰も知らなかった不都合な真実
mail@yanagiya.biz

イリノイ大学の研究チームが2025年10月に公開した論文をもとに、LLMの長文処理で起きる意外な性能低下を解説しています。これまで長文タスクの失敗は必要な情報を見つけられない検索の失敗が原因だと考えられてきましたが、この研究は入力の絶対的な長さそのものが性能を損なうことを明らかにしました。Llama-3.1やGPT-4oなど5種類のLLMを使い、数学、質疑応答、コーディングのタスクで検証したところ、Llama-3.1-8Bは30kトークンまで拡張した長文で関連情報を97%の精度で抽出できていたにもかかわらず、正答率は24.2%低下しました。

問題と情報の間に空白を挿入した場合でも、Llamaで48%、Mistralで30%の性能低下が観測されています。原因としては訓練データの位置バイアスが推測され、いったん情報を抽出してから解かせる二段階の手法ではGPT-4oの性能が最大4%向上しました。RAGで参照文書を増やしすぎると精度が下がる理由を説明する結果でもあります。

この要約は生成AIで作成しました。

記事はこちら
長文読解AIの盲点?コンテキスト長が性能を落とす、誰も知らなかった不都合な真実
長文読解AIの盲点?コンテキスト長が性能を落とす、誰も知らなかった不都合な真実
ABOUT ME
柳谷智宣
柳谷智宣
ITライター
1972年生まれ、東京育ち。ITやビジネスといったカテゴリーで執筆しているライターです。キャリアは27年目で、雑紙やムック、単行本、新聞といった紙媒体から、ウェブ記事、メールマガジン、プレスリリースなども手掛けています。現在は、執筆だけでなく、企画提案から執筆・編集までを行っております。主に一般ビジネスユーザーをターゲットに、易しく解説する記事が多いですが、エンタープライズ向けの記事やメーカーや企業のウェブサイトのコンテンツ制作も請け負っています。可能な限り、様々な案件に対応できますので、まずは打診いただけると幸いです。
記事URLをコピーしました