2026年、「詐欺師としてのAI」に注意せよ! 進化する詐欺の「危険信号」にあなたは気付くことができるか?
mail@yanagiya.biz
ITライター柳谷智宣
テキストや画像、音声など複数のデータ形式を同時に扱える「マルチモーダルAI」について解説しています。従来のシングルモーダルAIとの違いを、監視カメラの映像だけでは話しているのか揉めているのか判別できないが音声も扱えば区別できるといった例で説明したうえで、「Gemini 1.5 Pro」に画像をアップロードして複数パターンのキャプションを生成させたり、「ChatGPT」の「GPT-4o」でコインパーキングの料金表を読み取らせたりした実践例を紹介します。
2023年10月に富士通と理化学研究所が発表した、生成AIで電子顕微鏡画像からタンパク質構造変化を従来の10倍以上速く予測する技術にも言及。医療診断や手術支援、自動運転、製造業の異常検知、小売の無人店舗、教育のパーソナライズ学習など幅広い応用可能性を示す一方、異なるモダリティのデータ統合の難しさやラベル付けコスト、計算資源の増大が課題だと指摘しています。
この要約は生成AIで作成しました。
