執筆・編集

相坂ソウタの最新論文紹介:「同じ質問」なのに「違う答え」? 最新論文が暴く、マルチモーダルAIの“知覚の歪み”

相坂ソウタの最新論文紹介:「同じ質問」なのに「違う答え」? 最新論文が暴く、マルチモーダルAIの“知覚の歪み”
mail@yanagiya.biz

アムステルダム大学のvan Sprang氏らの研究チームが論文「Same Content, Different Answers」を発表しました。同じ内容でもテキストと画像のどちらで提示するかによって回答が変わる「クロスモーダル・インコンシステンシー」を、独自ベンチマーク「REST」を用いてGPT-5-mini、Claude Haiku 4.5、Qwen2.5-VLなど15の最新モデルで検証しています。OCR精度の問題を除外しても不整合が生じ、画像形式の正答率はテキストより著しく低く、視覚トークンの消費量も多いことが判明しました。

さらに黒文字より赤や黄色の文字の方が正答率が上がるという不可解なバイアスも確認され、内部表現の類似度が低いモデルほど不整合が大きいことが示されています。最新モデルでも一貫性は9割程度にとどまり、業務利用では画像認識結果を人間が検証する体制が必要だと結論づけています。

この要約は生成AIで作成しました。

記事はこちら
相坂ソウタの最新論文紹介:「同じ質問」なのに「違う答え」? 最新論文が暴く、マルチモーダルAIの“知覚の歪み”
相坂ソウタの最新論文紹介:「同じ質問」なのに「違う答え」? 最新論文が暴く、マルチモーダルAIの“知覚の歪み”
ABOUT ME
柳谷智宣
柳谷智宣
ITライター
1972年生まれ、東京育ち。ITやビジネスといったカテゴリーで執筆しているライターです。キャリアは27年目で、雑紙やムック、単行本、新聞といった紙媒体から、ウェブ記事、メールマガジン、プレスリリースなども手掛けています。現在は、執筆だけでなく、企画提案から執筆・編集までを行っております。主に一般ビジネスユーザーをターゲットに、易しく解説する記事が多いですが、エンタープライズ向けの記事やメーカーや企業のウェブサイトのコンテンツ制作も請け負っています。可能な限り、様々な案件に対応できますので、まずは打診いただけると幸いです。
記事URLをコピーしました