社長から直接「業務連絡」すぐに返信は危うい訳、LINEやチャットワークを悪用"新型CEO詐欺"《まさか自分が…コロっとだまされてしまう手口》
mail@yanagiya.biz
ITライター柳谷智宣
Googleが2025年8月に発表した、LLMのファインチューニングに必要な学習データを大幅に削減する手法を紹介しています。広告の安全性分類というタスクで、学習データを最大1万分の1に減らしながら精度を高めた研究で、鍵となるのはモデルが判断に迷う「決定境界」に注目するアクティブラーニングです。クリックベイト広告と良性の広告のクラスターが重なる領域から紛らわしいデータの組を選び、専門家に評価させることでコスト効率を大きく改善しました。
ラベルの一致度をコーエンのカッパ係数で測ると専門家は約0.8に達したのに対し、クラウドソースは0.41〜0.59にとどまり、データを10万件から500件未満に絞っても人間の判断との一致度は最大65%向上しています。Gemini Nano-2など大規模なモデルでは5〜6回の反復学習と250〜400件程度で効果が出る一方、小型モデルでは利得が限定的でした。量より質という原理を実証した成果として整理されています。
この要約は生成AIで作成しました。
