メールで国勢調査の回答を依頼することは「絶対にありません」。届いたらそれは詐欺、即ゴミ箱へ!
mail@yanagiya.biz
ITライター柳谷智宣
カーディフ大学の研究チームによる、LLMが大量のデータを一度に処理すると精度が落ちる現象の論文を検証しています。DeepSeek R1やLlama 4 Maverickなどのオープンウェイト9種と、Claude Sonnet 4.6、Gemini 3.1 Pro、GPT-5、Grok 4などのクローズド7種の計16モデルに、加減算やニュース分類、感情判定など8種類の課題を2件から2000件まで件数を変えて解かせました。1件なら全モデルが解ける課題でも200件を超えると低下が加速し、1000件以上では全モデルが正答率40%未満、2000件では20%未満まで落ち込みます。
スピアマン相関は件数がマイナス0.61、総コンテキスト長がマイナス0.37で、長さより件数が効いていました。分割処理を自ら提案したのは4620回中27回だけです。50〜100件ずつ分けてIDを付け、集計は表計算やプログラムに任せる工程設計が要点です。
この要約は生成AIで作成しました。
