OpenAI 2025年総括:ChatGPT-5.2、推論、エージェント化──開発者が知るべき進化の全て
mail@yanagiya.biz
ITライター柳谷智宣
2026年5月にarXivで公開された、Slackの会話ログから誰が何を知っているかをLLMが推定できるかを検証した論文を紹介しています。対象は2017年4月から2024年11月までの27,188件のメッセージで、43ユーザー、94チャンネルを分析し、27人が自己評価に協力しました。投稿数は最多10,819件から最少3件までばらつきがあります。
Claude HaikuとSonnet、Gemini 2.5 FlashとPro、GPT-4o、o3、GPT-5の7モデルにログから技術用語やスキルを抽出させて知識レベルを推定させ、本人が0〜100の尺度でつけた自己評価と比べたところ、最も精度が高かったのはGemini 2.5 Flashで平均絶対誤差は21.13でした。メッセージの量より内容の濃さが効き、短い返事や雑談が多いと精度が落ちます。人事評価ではなく社内の詳しい人を探す案内板としての活用が現実的で、匿名化などの対策が課題だとしています。
この要約は生成AIで作成しました。
