執筆・編集

AIを業務で使う前に知っておきたい「洗車テスト」——9割が失敗した常識問題が示すリスク

AIを業務で使う前に知っておきたい「洗車テスト」——9割が失敗した常識問題が示すリスク
mail@yanagiya.biz

Opper社が2026年2月に実施した「洗車テスト」を紹介しています。「車を洗いたい。洗車場は50メートル先にある。歩くべきか運転すべきか」という一段階の常識問題を53種類のAIモデルに解かせたところ、1回のテストで正解したのは11モデルだけで、91%が誤答しました。

10回連続で正解し続けたのはClaude Opus 4.6、Gemini 3 Flash、Gemini 3 Pro、Grok-4など5モデルにとどまり、GPT-5は10回中7回、Kimi K2.5は5回と不安定でした。1万人を対象にした人間の正答率71.5%を上回ったAIも7種だけです。誤答は「50メートルなら歩いた方が効率的」という学習済みの傾向が、車を洗車場へ運ぶ必要があるという文脈推論を上書きするために起きます。完全に外すモデルより正解と誤答を行き来する中間層こそ業務では危険だとし、事例やドメイン知識をプロンプトに与えるコンテキストエンジニアリングの重要性を説きます。

この要約は生成AIで作成しました。

記事はこちら
AIを業務で使う前に知っておきたい「洗車テスト」——9割が失敗した常識問題が示すリスク
AIを業務で使う前に知っておきたい「洗車テスト」——9割が失敗した常識問題が示すリスク
ABOUT ME
柳谷智宣
柳谷智宣
ITライター
1972年生まれ、東京育ち。ITやビジネスといったカテゴリーで執筆しているライターです。キャリアは27年目で、雑紙やムック、単行本、新聞といった紙媒体から、ウェブ記事、メールマガジン、プレスリリースなども手掛けています。現在は、執筆だけでなく、企画提案から執筆・編集までを行っております。主に一般ビジネスユーザーをターゲットに、易しく解説する記事が多いですが、エンタープライズ向けの記事やメーカーや企業のウェブサイトのコンテンツ制作も請け負っています。可能な限り、様々な案件に対応できますので、まずは打診いただけると幸いです。
記事URLをコピーしました