AIをAI生成データで学習させると、学習モデルが崩壊してしまうリスクが発生 (3/4ページ)
[画像を見る]
以前のバージョンのモデルで生成されたデータで学習したAIによって生成された、どんどん歪んでいく画像 / image credit:Credit: M. Bohaček & H. Farid/arXiv (CC BY 4.0)・人間のデータに新たな価値
この研究は、従来のAI学習法の重大な欠陥を浮き彫りにしている。
最近のインターネットは、AIがまとめたニュースやAI生成画像など、AIが作り出したコンテンツで溢れかえっている。
それなりに信頼されているメディア企業ですらも、AI生成コンテンツを普通に使っているくらいだ。
これまでのAI開発では、主にオープンウェブやSNSから抽出されたデータでモデルの訓練を行ってきた。
だがネットに溢れるAI生成コンテンツのほとんどは、わざわざAIのお手製ですなどと表示されていない。
そのためAI開発に必要なデータをこうしたソースから集める限り、そのAIには崩壊へといたるエラーが蓄積されている可能性が高いのだ。
研究チームは、「LLMによって生成されたデータを他のデータと区別する必要」がある一方、「LLMによって生成されたコンテンツをどのように追跡できるかは不明」と述べている。
突破口があるとすれば、AIの訓練にできるだけ多くの人間製データを混ぜておくことで、その崩壊を多少なりとも先延ばしにできることだ。
このことは人間が作り出すデータには、AI時代ならではの新しい価値があるだろうことを物語っている。