00:00Avec Anthony Morel, bonjour Anthony.
00:02Bonjour.
00:03Alors, on le sait, la matière première essentielle de l'IA, c'est la data.
00:06Les géants de la tech sont prêts à tout pour récupérer le plus de données possibles,
00:11pour entraîner et améliorer leurs modèles.
00:13Et ça va parfois très loin.
00:14Oui, la dernière illustration en date, c'est le projet Panama,
00:17dont on a connu l'existence cet été.
00:20Le projet Panama, c'est Anthropik,
00:22qui, pour entraîner ses modèles d'intelligence artificielle,
00:25dans le plus grand des secrets,
00:27achète, pour les numériser puis les détruire,
00:30des millions de livres, des livres physiques, des livres papiers,
00:32des livres d'occasion, donc auprès de revendeurs spécialisés.
00:35Ils en récupèrent comme ça des millions et des millions.
00:37Et ensuite, ces bouquins, ils sont acheminés vers de grands entrepôts
00:40où les attendent des machines spéciales qui vont découper la relure,
00:45qui vont trancher les pages une par une.
00:46Oui, c'est plus facile ensuite pour les scanner et les numériser.
00:49Tout ça, ça va servir de matière première pour alimenter les algorithmes,
00:53pour les améliorer d'une certaine manière.
00:54Et puis, une fois qu'on n'en a plus besoin,
00:56parce que ces livres déchirés, ça ne sert pas à grand-chose,
00:58on va les broyer et puis ça va servir,
01:00on va les recycler pour faire, je ne sais pas, du papier toilette,
01:02ce qui n'est pas un avenir très enviable pour un bouquin.
01:05Mais en tout cas, l'objectif de ce projet Panama,
01:07c'est de convertir en six mois,
01:09deux millions de livres en données exploitables
01:12pour alimenter les algorithmes
01:13et les rendre toujours plus performants dans leurs réponses.
01:15Parce que c'est vraiment ça la clé du sujet.
01:18C'est-à-dire qu'aujourd'hui, pour l'intelligence artificielle,
01:20les livres, c'est une donnée, une matière première
01:23qui est extrêmement précieuse. Pourquoi ?
01:24Eh bien parce que ce sont des matériaux
01:27qui sont en général assez bien écrits,
01:29en tout cas mieux que ce qu'on va trouver en moyenne sur Internet.
01:32C'est une matière qui a été relue,
01:34qui est contextualisée,
01:35qui est bien structurée.
01:36Et donc ça, c'est incroyablement précieux.
01:39Évidemment, le problème,
01:39c'est la destruction de ces livres,
01:41qui pour certains sont des livres rares,
01:43des livres qui ne sont plus ou qui sont peu édités.
01:46Le projet d'ailleurs a été censé rester clandestin.
01:48Il a été rendu public à l'occasion d'une procédure judiciaire
01:51qui a été intentée par un groupe d'auteurs
01:53qui accusent Anthropique de violation du droit d'auteur.
01:56Bon, là, on parle d'Anthropique,
01:57mais en réalité, il ne faut pas se le cacher,
01:59tous les grands modèles d'IA font la même chose.
02:00On a appris d'ailleurs qu'Amazon faisait la même chose,
02:02donc achetait des livres pour les broyer,
02:04les scanner et les numériser pour entraîner ces modèles.
02:07On rappelle que ce n'est pas quand même
02:08des autodafés organisés comme sur les nazis,
02:11parce que de toute façon, on garde évidemment
02:12et c'est numérisé.
02:13Tout à fait.
02:14Voilà la nuance.
02:15Récupérer de la donnée, c'est devenu le nerf de la guerre
02:17pour tous les gens de la tech.
02:18Et tous les moyens sont bons, ça ne s'arrête pas aux livres.
02:21Non, les livres, c'est un exemple.
02:22Mais en fait, il faut bien comprendre que le problème,
02:24c'est qu'on arrive au bout des données exploitables,
02:26des données humaines de qualité, facilement accessibles.
02:29En gros, les géants de la tech, OpenAI et Anthropique,
02:31ils ont déjà siphonné tout Internet.
02:33Donc, qu'est-ce qu'on fait pour aller plus loin ?
02:35On a eu un autre exemple il y a quelques jours,
02:37c'est Google.
02:37Google qui a racheté pour 10 millions de dollars
02:39les archives d'une entreprise en faillite,
02:42Spirit Airline.
02:43Spirit Airline, c'est une compagnie aérienne qui a fait faillite.
02:46Et donc, ils ont racheté des millions de mails de l'entreprise,
02:50des échanges sur WhatsApp ou sur Slack,
02:53des documents internes à caractère financier,
02:56des enregistrements d'appels aux services clients,
02:58une sorte de fossile d'entreprise.
02:59Et toute cette data-là, elle va être utilisée, là encore,
03:02pour entraîner les futurs modèles
03:04et les rendre plus performants.
03:06Et c'est un vrai sujet.
03:06Il y a plein d'entre...
03:07Enfin, en tout cas, un certain nombre de startups
03:09et d'entreprises qui font faillite,
03:10qui vendent maintenant leurs informations
03:12à des géants de l'intelligence artificielle
03:14qui sont très friands.
03:15Il faut vraiment voir l'intelligence artificielle
03:17comme une sorte d'ogre
03:18qui a toujours faim de données fraîches.
03:20Et donc, il faut la nourrir en permanence.
03:22Ça veut dire que pour valoriser une société,
03:24il faudra aussi valoriser les data.
03:26Quand on aura épuisé toutes les sources de données humaines,
03:29on fera comment ?
03:29Alors, c'est un vrai problème.
03:31C'est-à-dire qu'aujourd'hui,
03:32l'IA s'alimente de plus en plus par elle-même.
03:35En gros, vous avez une forme...
03:36Certains parlent d'ailleurs de consanguinité
03:38de l'intelligence artificielle.
03:40Pour nourrir l'IA,
03:41on utilise des données
03:42qui ont été déjà générées
03:43par l'intelligence artificielle.
03:45Et ça, au fil du temps,
03:47ça va créer une sorte d'affaiblissement général.
03:49D'où l'importance de trouver toujours
03:50des nouvelles sources de données.
03:51Alors, il y en a toujours.
03:53Parce que si vous prenez, par exemple,
03:54ce qui se passe sur les réseaux sociaux,
03:55ça, on peut le récupérer.
03:56Et d'ailleurs, depuis quelques mois,
03:58tous les réseaux sociaux,
03:59maintenant, à moins que vous ne décochiez
04:00une case dans les paramètres,
04:02ont l'autorisation de récupérer
04:04tout ce que vous publiez,
04:05que ce soit du texte,
04:06que ce soit de la photo,
04:07de la vidéo.
04:08C'est vrai sur Instagram,
04:09c'est vrai sur LinkedIn.
04:09On a appris il y a quelques jours
04:10que Twitch,
04:11le réseau de streaming,
04:13allait récupérer tous les streams,
04:14donc toutes les vidéos
04:15qui sont publiées
04:16pour entraîner ces modèles d'IA.
04:17Ça, ça peut servir, par exemple,
04:18à entraîner des futurs robots.
04:19C'est très important,
04:20la vidéo, pour ça.
04:21Donc oui, on a toujours besoin
04:23de données supplémentaires, évidemment.
04:25Et puis, parfois,
04:26les utilisateurs se rebiffent un petit peu.
04:27Par exemple,
04:28WeTransfer, il y a quelques mois,
04:29vous savez, WeTransfer,
04:30on s'en sert pour transférer
04:31des très gros fichiers.
04:32Ils avaient dit,
04:33à partir de maintenant,
04:34on pourra utiliser
04:35toutes les données
04:36que vous transférez
04:36pour entraîner nos IA.
04:38Et là, les gens avaient dit,
04:38attendez, non,
04:39ce n'est pas possible
04:39que vous récupériez
04:40tout ce qu'on vous envoie.
04:42Et donc, ils avaient dû faire
04:43Machinaria.
04:43Mais en fait,
04:44il y a une vraie réflexion.
04:45Est-ce que finalement,
04:46nous, les utilisateurs,
04:47on ne devrait pas être rémunérés
04:48d'une manière ou d'une autre
04:49parce que finalement,
04:50notre data est utilisée
04:51pour entraîner ces modèles d'IA
04:52sans qu'on n'ait rien à y dire
04:54et sans que ça ne nous rapporte rien ?
04:55Merci Anthony Morel.
04:57C'était donc le projet Panama
04:58d'Entropique.
Commentaires