執筆・編集

1000件処理でAI精度が急落?コンテキストウィンドウに収まっても起きる性能低下の正体

1000件処理でAI精度が急落?コンテキストウィンドウに収まっても起きる性能低下の正体
mail@yanagiya.biz

カーディフ大学の研究チームによる、LLMが大量のデータを一度に処理すると精度が落ちる現象の論文を検証しています。DeepSeek R1やLlama 4 Maverickなどのオープンウェイト9種と、Claude Sonnet 4.6、Gemini 3.1 Pro、GPT-5、Grok 4などのクローズド7種の計16モデルに、加減算やニュース分類、感情判定など8種類の課題を2件から2000件まで件数を変えて解かせました。1件なら全モデルが解ける課題でも200件を超えると低下が加速し、1000件以上では全モデルが正答率40%未満、2000件では20%未満まで落ち込みます。

スピアマン相関は件数がマイナス0.61、総コンテキスト長がマイナス0.37で、長さより件数が効いていました。分割処理を自ら提案したのは4620回中27回だけです。50〜100件ずつ分けてIDを付け、集計は表計算やプログラムに任せる工程設計が要点です。

この要約は生成AIで作成しました。

記事はこちら
1000件処理でAI精度が急落?コンテキストウィンドウに収まっても起きる性能低下の正体
1000件処理でAI精度が急落?コンテキストウィンドウに収まっても起きる性能低下の正体
ABOUT ME
柳谷智宣
柳谷智宣
ITライター
1972年生まれ、東京育ち。ITやビジネスといったカテゴリーで執筆しているライターです。キャリアは27年目で、雑紙やムック、単行本、新聞といった紙媒体から、ウェブ記事、メールマガジン、プレスリリースなども手掛けています。現在は、執筆だけでなく、企画提案から執筆・編集までを行っております。主に一般ビジネスユーザーをターゲットに、易しく解説する記事が多いですが、エンタープライズ向けの記事やメーカーや企業のウェブサイトのコンテンツ制作も請け負っています。可能な限り、様々な案件に対応できますので、まずは打診いただけると幸いです。
記事URLをコピーしました