執筆・編集

数理最適化で検証!生成AIは英語プロンプトより日本語で十分か、鍵は「問いの書き方」と「モデル規模」

数理最適化で検証!生成AIは英語プロンプトより日本語で十分か、鍵は「問いの書き方」と「モデル規模」
mail@yanagiya.biz

生成AIは英語のプロンプトのほうが強いのかを、CyberAgentが公開したベンチマーク「JOR-Bench」を使って検証しています。産業向け100問、線形計画203問、入門問題245問などを含む実務的な最適化問題1319問を英語から日本語に翻訳し、Qwen3の8Bと32B、Swallowの8Bと32B、CAT-Thinking、Nemotron、gpt-oss-120bの7モデルで日英の性能を比べました。正答率の差はわずか0.3ポイントにとどまり、多くの組み合わせで差は5ポイント以内でした。

むしろ効いていたのはモデル規模で、Qwen3は8Bから32Bで倍以上、Swallowは6倍近く改善しています。また「何回使うべきか」と尋ねると回数だけが返るなど、問いの書き方が結果を左右するため、明確な指示が重要だと指摘。Swallow-32Bでは正答率が同じ32.0%でも日本語だけ正解が約3割、英語だけ正解が約2割と解けた問題が異なっていました。

この要約は生成AIで作成しました。

記事はこちら
数理最適化で検証!生成AIは英語プロンプトより日本語で十分か、鍵は「問いの書き方」と「モデル規模」
数理最適化で検証!生成AIは英語プロンプトより日本語で十分か、鍵は「問いの書き方」と「モデル規模」
ABOUT ME
柳谷智宣
柳谷智宣
ITライター
1972年生まれ、東京育ち。ITやビジネスといったカテゴリーで執筆しているライターです。キャリアは27年目で、雑紙やムック、単行本、新聞といった紙媒体から、ウェブ記事、メールマガジン、プレスリリースなども手掛けています。現在は、執筆だけでなく、企画提案から執筆・編集までを行っております。主に一般ビジネスユーザーをターゲットに、易しく解説する記事が多いですが、エンタープライズ向けの記事やメーカーや企業のウェブサイトのコンテンツ制作も請け負っています。可能な限り、様々な案件に対応できますので、まずは打診いただけると幸いです。
記事URLをコピーしました