執筆・編集

「洗車に行くなら歩く? 運転する?」AIモデル53種の9割が間違えた常識テスト

「洗車に行くなら歩く? 運転する?」AIモデル53種の9割が間違えた常識テスト
mail@yanagiya.biz

Opper社のFelix Wunderlich氏が、53種類のAIモデルに「洗車場が50メートル先にある場合、歩くか運転するか」という常識問題を出題した検証結果を紹介しています。1回のテストで正解したのは11モデルのみで、Claude Opus 4.6やGPT-5、Gemini 3のFlash・Proなどにとどまり、Llama・Mistral・DeepSeekは全滅でした。同一プロンプトを10回ずつ計530回実施したところ、10回連続正解はClaude Opus 4.6、Gemini系3モデル、Grok-4の5モデルのみで、GPT-5は7割、Kimi K2.5は5割にとどまりました。

Rapidataと提携し1万人に同じ問題を出したところ人間の正答率は71.5%で、これを上回れたAIは7モデルのみ。距離に関する経験則が文脈推論を上書きしてしまう点が本番運用のリスクとして指摘されています。

この要約は生成AIで作成しました。

記事はこちら
「洗車に行くなら歩く? 運転する?」AIモデル53種の9割が間違えた常識テスト
「洗車に行くなら歩く? 運転する?」AIモデル53種の9割が間違えた常識テスト
ABOUT ME
柳谷智宣
柳谷智宣
ITライター
1972年生まれ、東京育ち。ITやビジネスといったカテゴリーで執筆しているライターです。キャリアは27年目で、雑紙やムック、単行本、新聞といった紙媒体から、ウェブ記事、メールマガジン、プレスリリースなども手掛けています。現在は、執筆だけでなく、企画提案から執筆・編集までを行っております。主に一般ビジネスユーザーをターゲットに、易しく解説する記事が多いですが、エンタープライズ向けの記事やメーカーや企業のウェブサイトのコンテンツ制作も請け負っています。可能な限り、様々な案件に対応できますので、まずは打診いただけると幸いです。
記事URLをコピーしました