L’intelligence artificielle avance Ă un rythme effrĂ©nĂ©, mais un mur se dresse sur sa route.
Les grands modĂšles de langage, qui animent chatbots et assistants virtuels, engloutissent des quantitĂ©s astronomiques de donnĂ©es humaines. Or, ces rĂ©serves de contenu original s’Ă©puisent rapidement. Sans apport frais, l’apprentissage de ces machines pourrait dĂ©railler.
Sans nouvelles donnĂ©es, les IA commenceraient Ă se nourrir de leurs propres productions. Ce cycle fermĂ© mĂšne Ă un phĂ©nomĂšne appelĂ© effondrement du modĂšle, en deux stades distincts. Au dĂ©but, les rĂ©ponses perdent les dĂ©tails rares et deviennent insipides, semblables Ă du texte gĂ©nĂ©rique. Ensuite, elles virent au charabia complet, rendant l’IA inutilisable.

Des chercheurs de plusieurs institutions ont identifiĂ© une parade Ă©tonnamment simple Ă ce problĂšme. Leur Ă©tude, publiĂ©e dans Physical Review Letters, montre qu’un seul exemple humain authentique, insĂ©rĂ© dans un ocĂ©an de donnĂ©es artificielles, suffit Ă empĂȘcher l’effondrement.
Ce rĂ©sultat dĂ©coule de travaux sur des modĂšles mathĂ©matiques appelĂ©s familles exponentielles, qui permettent de comprendre pourquoi et comment l’effondrement se produit.
Pour comprendre ce mĂ©canisme, il faut savoir que lorsque l’on recycle un modĂšle sur ses propres sorties, les fluctuations statistiques s’estompent progressivement. Les cas rares et les informations nuancĂ©es disparaissent, laissant place Ă des rĂ©ponses homogĂšnes. Un point de rĂ©fĂ©rence rĂ©el, correctement Ă©tiquetĂ© par un humain, rĂ©tablit la diversitĂ© perdue.
Les scientifiques ont utilisĂ© des modĂšles mathĂ©matiques simples pour analyser en dĂ©tail ce processus. Forts de cette comprĂ©hension, ils ont pu concevoir une solution thĂ©orique. La prochaine Ă©tape consistera Ă tester cette mĂ©thode sur les gigantesques modĂšles commerciaux pour vĂ©rifier son efficacitĂ© Ă grande Ă©chelle. Si le principe se vĂ©rifie, les ingĂ©nieurs disposeront d’une recette simple pour Ă©viter un effondrement.
