執筆・編集

学習データが「1万分の1」に? Googleが実証したLLMファインチューニングの革命的効率化手法

学習データが「1万分の1」に? Googleが実証したLLMファインチューニングの革命的効率化手法
mail@yanagiya.biz

Googleが2025年8月に発表した、LLMのファインチューニングに必要な学習データを大幅に削減する手法を紹介しています。広告の安全性分類というタスクで、学習データを最大1万分の1に減らしながら精度を高めた研究で、鍵となるのはモデルが判断に迷う「決定境界」に注目するアクティブラーニングです。クリックベイト広告と良性の広告のクラスターが重なる領域から紛らわしいデータの組を選び、専門家に評価させることでコスト効率を大きく改善しました。

ラベルの一致度をコーエンのカッパ係数で測ると専門家は約0.8に達したのに対し、クラウドソースは0.41〜0.59にとどまり、データを10万件から500件未満に絞っても人間の判断との一致度は最大65%向上しています。Gemini Nano-2など大規模なモデルでは5〜6回の反復学習と250〜400件程度で効果が出る一方、小型モデルでは利得が限定的でした。量より質という原理を実証した成果として整理されています。

この要約は生成AIで作成しました。

記事はこちら
学習データが「1万分の1」に? Googleが実証したLLMファインチューニングの革命的効率化手法
学習データが「1万分の1」に? Googleが実証したLLMファインチューニングの革命的効率化手法
ABOUT ME
柳谷智宣
柳谷智宣
ITライター
1972年生まれ、東京育ち。ITやビジネスといったカテゴリーで執筆しているライターです。キャリアは27年目で、雑紙やムック、単行本、新聞といった紙媒体から、ウェブ記事、メールマガジン、プレスリリースなども手掛けています。現在は、執筆だけでなく、企画提案から執筆・編集までを行っております。主に一般ビジネスユーザーをターゲットに、易しく解説する記事が多いですが、エンタープライズ向けの記事やメーカーや企業のウェブサイトのコンテンツ制作も請け負っています。可能な限り、様々な案件に対応できますので、まずは打診いただけると幸いです。
記事URLをコピーしました