執筆・編集

「同じ質問」なのに「違う答え」? 最新論文が暴く、マルチモーダルAIの“知覚の歪み”

「同じ質問」なのに「違う答え」? 最新論文が暴く、マルチモーダルAIの“知覚の歪み”
mail@yanagiya.biz

2025年12月9日に公開された論文「Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs」を取り上げ、マルチモーダルAIが同じ内容でもテキストか画像かで答えを変える現象を解説しています。アムステルダム大学やニュルンベルク工科大学らの研究チームはRESTとREST+というベンチマークを作り、GPT-5-miniやClaude Haiku 4.5、Qwen2.5-VLなど15のモデルを検証しました。「3+3」のような問題でも提示形式が変わると答えが揺らぎ、最新モデルでも一貫性は約90%にとどまり、画像入力では正答率が半減する例もありました。

黒より赤や黄色の文字のほうが正答率が高い一方、フォントの影響は軽微でした。原因は内部表現のモダリティ・ギャップにあり、重要な情報はスクリーンショットではなくテキストで渡すべきだとまとめています。

この要約は生成AIで作成しました。

記事はこちら
「同じ質問」なのに「違う答え」? 最新論文が暴く、マルチモーダルAIの“知覚の歪み”
「同じ質問」なのに「違う答え」? 最新論文が暴く、マルチモーダルAIの“知覚の歪み”
ABOUT ME
柳谷智宣
柳谷智宣
ITライター
1972年生まれ、東京育ち。ITやビジネスといったカテゴリーで執筆しているライターです。キャリアは27年目で、雑紙やムック、単行本、新聞といった紙媒体から、ウェブ記事、メールマガジン、プレスリリースなども手掛けています。現在は、執筆だけでなく、企画提案から執筆・編集までを行っております。主に一般ビジネスユーザーをターゲットに、易しく解説する記事が多いですが、エンタープライズ向けの記事やメーカーや企業のウェブサイトのコンテンツ制作も請け負っています。可能な限り、様々な案件に対応できますので、まずは打診いただけると幸いです。
記事URLをコピーしました