Passer au playerPasser au contenu principal
  • il y a 13 minutes

Catégorie

🗞
News
Transcription
00:04Spécial interview de l'IA, on s'intéresse au watermarking, à la détection des contenus
00:08générés par l'intelligence artificielle avec Anthony Level. Bonjour, merci beaucoup d'être
00:12dans Smartech. Vous êtes le cofondateur de Label4AI en charge de la stratégie. Vous allez nous aider à
00:18y comprendre un petit peu plus, à comprendre un peu plus ce qui se passe en ce moment autour des
00:22contenus générés par IA, comment est-ce qu'on peut les détecter, mais aussi de cette question du
00:27watermarking qui doit apporter de la transparence sur ces contenus auto-générés. Alors, vous
00:34contribuez, je le sais, à des travaux au niveau européen, mais aussi au niveau international
00:39sur cette question de la transparence. C'est en train de changer. Il y a des règles qui s'imposent
00:45désormais, notamment à travers l'IA Act. Oui, déjà, merci beaucoup Delphine pour votre invitation.
00:51Effectivement, alors que jusque-là, le watermarking causait vraiment à personne. Vous étiez peut-être
00:55la seule à m'inviter à l'époque pour parler de ça. On a eu quand même deux moments forts
00:59cet été qui ont remis ce sujet en lumière. Les deux moments forts, c'est ce que vous avez
01:03dit, c'est-à-dire l'entrée en vigueur de l'IA Act, en particulier son article 50,
01:07qui traite de la transparence justement des outputs, donc la transparence des sorties
01:11d'IA génératives. Donc ça, c'est le volet réglementaire. Ça agite évidemment pas mal
01:15de monde. Mais il y a eu un autre événement cet été qui n'est pas passé une adperçue,
01:18c'est le watermark de Claude. Et là, il y a eu beaucoup de réactions.
01:21Claude Dantropique.
01:22Claude, absolument, Dantropique, qui a fait coller beaucoup d'encre en août. Et là,
01:27c'est revenu sur la table la problématique du watermark. Qu'est-ce que c'est ? Comment
01:31ils font ? À quoi ça sert ?
01:33Alors, prenons une définition déjà justement du watermark.
01:37Le watermark, ça consiste à insérer dans un contenu un signal ou une marque, d'où
01:43le nom, qui permet de donner la provenance du contenu. Donc c'est un signal qui est caché
01:48dans le contenu. Il n'est pas à côté, il n'est pas attaché comme des métadonnées.
01:51Non, il est véritablement dans le contenu. Et il dit, je viens d'ici, je viens de ChatGPT,
01:56où j'ai été créé par une IA, où j'ai été manipulé par une IA. Et ce watermark,
02:01en fait, il est imperceptible au sens humain. C'est-à-dire qu'il n'y a qu'une machine
02:06qui est capable de le détecter. La machine qui, en général, l'a encodée, va mettre
02:09ce signal dès la génération du contenu, vraiment à la sortie. Et ensuite, pendant toute
02:15la vie du contenu, on va pouvoir retrouver ce signal. Et avec le détecteur approprié,
02:19on va pouvoir le lire et dire, ah ben, ça vient bien de ChatGPT, de Claude ou d'ailleurs.
02:24Ce n'est pas un sujet nouveau, le watermarking. Bon, là, il s'impose davantage aujourd'hui
02:29avec l'intelligence artificielle générative. Qu'est-ce qu'apporte, par exemple, parce
02:34que Label4EA, c'est une deep tech qui est issue des travaux d'Inria et du CNRS.
02:40Quels sont les apports technologiques aujourd'hui qu'apporte la France sur ce sujet du watermarking
02:45pour l'IA générative ?
02:46Alors, déjà, effectivement, vous avez raison, le watermarking était utilisé jusque-là
02:50dans d'autres secteurs. Il y a deux principaux. Le premier, c'est les ayants droit. Je cite
02:54toujours l'exemple des camcording. Vous savez, les gens qui enregistraient les films en salle.
02:58En fait, il faut savoir que les studios de cinéma mettaient un watermark par salle, de manière
03:01à pouvoir finalement tracer de quelle salle est parti le camcording et d'engager la responsabilité
03:07de l'exploitant de salle. Le deuxième usage, c'était la fuite. En fait, beaucoup d'entreprises
03:12watermarkaient les contenus de manière à ce que s'ils se retrouvaient à l'extérieur,
03:15un document confidentiel, qu'on se trouvait par exemple sur les réseaux Pire2Pire ou sur
03:18des blogs, on pouvait remonter à la source et savoir qui avait fait fuiter le contenu.
03:23Et aujourd'hui, il faut savoir déjà que Rennes, parce que Label4EA est à cheval entre
03:27Rennes et Paris, et Rennes, c'est la capitale du watermarking. C'est là où des travaux
03:31scientifiques de haut niveau ont eu lieu sur le watermark. Et c'est vraiment la capitale mondiale.
03:34Aujourd'hui, il y a Singapour qui est aussi très très en avance, mais on capitalise
03:38nous, parce qu'effectivement, vous avez cité les laboratoires de recherche français,
03:40CNRS INRIA, donc on combine cette expertise croisée, mais on va un peu plus loin.
03:44C'est-à-dire qu'on a créé un comité scientifique qui réunit, j'ai envie de dire,
03:47la crème de la crème des chercheurs européens sur le domaine. Et on a réuni ces chercheurs
03:51justement pour avoir, on essaie d'avoir la meilleure technologie possible.
03:55Dites-nous un peu plus justement sur cette technologie. Qu'est-ce qu'elle a de spécifique ?
03:59Alors, il y a watermark et watermark. En fait, vous avez toute la gamme de watermark.
04:02Quand on parle de watermark, donc une marque comme de l'eau, si je le traduis littéralement,
04:05une marque aussi transparente, fluide et robuste que l'eau. Et en fait, ce watermark,
04:11en réalité, il doit avoir des caractéristiques intrinsèques. Le premier, je vous en ai parlé,
04:18c'est qu'il doit être imperceptible au sens humain. Et ça, ce n'est pas déjà forcément
04:21évident à faire. Ensuite, il doit avoir deux caractéristiques, qui notamment sont reprises
04:25dans la réglementation mondiale, j'ai envie de dire, pas qu'européenne, c'est qu'il doit être robuste.
04:28C'est-à-dire qu'évidemment, si mon watermark, il saute, dès qu'il y a un recodage,
04:32dès qu'il y a une compression ou dès qu'il y a un recadrage du contenu pour ce qui
04:35est
04:35de l'image, par exemple, évidemment, il faut que je continue à trouver ma marque.
04:38Ça, c'est la robustesse. Et ensuite, la sécurité. Si quelqu'un est capable de supprimer
04:42ou d'imiter ma marque, ma marque ne vaut plus rien. Donc, c'est là-dessus, nous,
04:46sur lesquels on est très en pointe. En fait, c'est sur les caractéristiques techniques.
04:49Et le fait d'être déjà en pointe là-dessus fait qu'en fait, il est automatiquement
04:53compliant avec l'article 50, nous, ce qu'on propose.
04:55Et donc, on le propose au généreux de l'IAC.
04:58Vous dites, on est finalement une petite poignée à travailler sur ces sujets,
05:01en tout cas, être bon techniquement sur ces sujets.
05:04Mais vous avez cité le watermark de Claude d'Entropique.
05:08Vous voulez savoir comment ça fonctionne ?
05:09J'ai envie de comprendre la différence.
05:12C'est bien légitime. Alors, il faut que je reparte à la base du watermark.
05:15C'est-à-dire, il faut que je vous cite déjà d'autres natures de contenu
05:17pour mieux comprendre comment ça se passe sur le texte.
05:19On a besoin d'entropie pour mettre un signal dans un contenu.
05:22L'image, c'est super, puisque j'ai des millions de pixels, j'ai des couleurs.
05:26D'entropie.
05:27D'entropie, là, j'ai dit entropie.
05:31Et donc, vous avez finalement plein de paramètres, plein de variables
05:34dans lesquelles vous pouvez cacher un message.
05:36Pour l'audio, je vais pouvoir cacher un bruit qui est inaudible sur une fréquence
05:39pour moduler une fréquence particulière.
05:41Et je peux cacher un message dedans.
05:42Pour la vidéo, c'est encore plus simple.
05:44Ça combine l'audio et l'image.
05:45Donc, je vais faire frame par frame pour l'image.
05:47Et puis, l'audio, je vais rajouter aussi potentiellement quelque chose.
05:49Le texte.
05:50Le texte, il n'y a pas assez d'entropie dans le texte.
05:51Un texte libre, j'ai du noir sur du blanc et j'ai des mots.
05:54Donc, où est-ce que je cache un message là-dessus ?
05:56Le premier réflexe, ce serait de jouer sur la police de caractère,
05:59de manière très subtile, invisible à l'œil nu,
06:01ou jouer sur l'espacement des caractères.
06:03Sauf que ce watermark, là, serait extrêmement peu robuste,
06:06puisqu'il ne résisterait pas à un copier-coller.
06:07Parce que, typiquement, si je copie-colle ça dans Word,
06:09je vais me retrouver avec la casse et la typologie de Word.
06:13Et donc, je ne retrouverai plus mon message.
06:14La typographie.
06:16Oui.
06:17La typographie, exactement.
06:19Et donc, quelles sont les variables sur lesquelles je peux jouer
06:22pour marquer un texte généré par l'IA ?
06:24Eh bien, il n'y en a véritablement qu'une qui, aujourd'hui, est la meilleure.
06:28C'est la technique publiée par Google DeepMind en 2024
06:31dans la revue scientifique Nature,
06:33et qui s'appelle Saint-Hidy Text,
06:35et qui consiste, en fait, à...
06:36Vous savez, pour construire des paragraphes et des phrases,
06:40les LLM choisissent les mots qui suivent.
06:43Eh bien, c'est là où, en fait, on va jouer.
06:44On va un petit peu biaiser.
06:45Si, par exemple, le LLM aurait dû nativement choisir un mot,
06:48il va en choisir un autre qui est un synonyme de ce premier mot.
06:51Donc, le ciel est nuageux, le ciel est gris, le ciel est maussade.
06:54Il aurait dû choisir gris.
06:55Il va choisir peut-être un des deux autres.
06:57Et du coup, ça laisse un biais.
06:58On appelle ça un motif statistique.
06:59Et quand on va le retrouver plusieurs fois, finalement, dans un texte libre,
07:03on va avoir de plus en plus d'indices
07:05comme quoi ce texte est watermarké par Claude,
07:08qui, lui, a mis son détecteur.
07:09C'est une forme de signature, finalement.
07:10Oui, absolument.
07:11C'est comme une signature électronique du contenu.
07:13Ce n'est pas de la cryptographie, mais c'est de la stéganographie.
07:15D'accord.
07:16Et quel regard vous portez là-dessus ?
07:18Est-ce que ça apporte la transparence nécessaire
07:20telle qu'elle est demandée par la réglementation européenne, selon vous ?
07:23Moi, chez Label4AI, on travaille sur la détection forensics.
07:26Donc, on sait les limites aussi de quand on n'a aucun avantage sur le contenu,
07:29quand on a un contenu brut devant soi,
07:31on doit investiguer dessus, et c'est assez compliqué.
07:32Et vous pouvez potentiellement vous tromper.
07:35Là, tout le but de la réglementation mondiale,
07:37et particulièrement européenne,
07:38c'est de rajouter un avantage pour celui qui veut identifier le contenu.
07:41En mettant dans le contenu sa carte d'identité,
07:44vous avez parlé de signature, on va dire, de carte d'identité,
07:46de manière très robuste et sécurisée,
07:47je vais pouvoir l'extraire.
07:48Et je n'ai plus besoin de faire l'investigation sur le contenu,
07:50puisque j'ai sa carte d'identité.
07:53Sur la partie de détection,
07:55on parle d'autres technologies,
07:57ou les deux sont vraiment liées ?
07:59Alors, le watermark est très lié à la détection.
08:01Puisqu'en fait, par exemple, nous, on utilise aussi,
08:03quand on trouve des traces de watermark,
08:05on va pouvoir faire une affirmation sur le contenu
08:07dont on nous a demandé l'analyse.
08:08Donc ça vient nourrir.
08:09C'est pour ça que nous, on agit à deux niveaux.
08:10À la source, avec la fourniture d'un watermark très robuste et sécurisé,
08:14pour assainir, si vous voulez, la place du web,
08:18et d'autres canaux,
08:19et de l'autre côté, sur les forensics.
08:21Je ne sais pas qu'on peut tout assainir,
08:22qu'on aura forcément des deepfakes et des contenus généraux
08:25qui ne le disent pas ?
08:26Bien sûr.
08:26Alors, vous m'avez posé la question sur ce que vous y croyez un peu, vous.
08:30C'était un peu ça, la question.
08:31Eh bien, il faut savoir que, par exemple,
08:33la Commission européenne est très honnête là-dessus.
08:34Elle dit, c'est pour garder, keep honest, people honest,
08:37en français, donc pour garder honnête les gens honnêtes.
08:39C'est tellement facile de frauder, de faire des deepfakes,
08:41qu'il faut mettre quelques barrières à l'entrée, quand même.
08:43Et le watermark en fait partie.
08:44Les modèles étatiques, les états mafieux,
08:47vont évidemment utiliser des modèles non marqués.
08:49Donc, c'est là où on a besoin de la détection.
08:51Exactement.
08:51Et donc, est-ce qu'on est dans le même type de technologie ?
08:53Comment ça fonctionne la détection aujourd'hui ?
08:55Alors non, la détection, c'est autre chose.
08:56C'est ce qu'on appelle l'inforensic, forensics en anglais.
09:00Et là, c'est vraiment, on va chercher,
09:01en fait, nous, on est spécialisé dans la recherche de traces invisibles dans le contenu.
09:05C'est-à-dire, on va s'attacher à regarder s'il y a des micro-signaux,
09:09des signatures, des artefacts qui trahissent
09:12ou qui révèlent l'intervention de l'IA générative en tout en partie dans le contenu.
09:15Et ça, on essaie de le faire à la pixel près.
09:17C'est-à-dire que typiquement, on est capable de zoner
09:19la partie qui a été manipulée par l'IA
09:21si l'image était authentique au départ, par exemple.
09:23On a l'impression que pour l'instant,
09:24ce n'est pas trop difficile à détecter quand même, Anthony,
09:26pour être tout à fait honnête.
09:28Quand on croise des contenus créés par les IA génératives,
09:32on les repère assez vite, non ?
09:34Alors, de moins en moins.
09:35Que ce soit sur les images ou sur les textes, même.
09:37De moins en moins.
09:38Encore, la dernière, effectivement, en date,
09:39c'est celle de Trump au Golfe,
09:41avec soi-disant sa petite amie.
09:43Le baiser.
09:44Voilà.
09:44Et là, il y a six doigts.
09:45Donc, le coup des six doigts,
09:47on pensait qu'il n'existait plus.
09:48On pensait que c'était fini, mais si.
09:49Finalement, il revient à la charge.
09:51Mais c'est parce que c'est un modèle particulier
09:52qui a aussi utilisé ça.
09:53Donc, en fait, le sémantique,
09:54nous, on ne travaille même plus dessus.
09:55Parce qu'on sait que dans très peu de temps,
09:57il n'y aura plus de traces sémantiques
09:58puisque, en fait, les modèles,
10:00pour plaire à l'utilisateur final,
10:01ils rendent les choses de plus en plus réalistes.
10:03Et donc, les problématiques d'ombre,
10:04les problématiques, en fait,
10:06de non-respect des lois physiques ou biologiques
10:08sur l'image ou sur la vidéo,
10:09vont disparaître au fur et à mesure.
10:11Et donc, nous, on s'attache pour ça
10:12aux traces invisibles qui, elles,
10:13resteront toujours, sont toujours détectables.
10:16Ça, vous parlez de la fabrication de Diffey
10:18qui se perfectionne, évidemment.
10:21Mais il y a ce sujet aussi
10:23de l'intelligence artificielle générative,
10:24finalement, qui s'auto-dénature par elle-même
10:27puisqu'elle utilise des contenus
10:28qui sont générés déjà par d'autres IA.
10:32Merci.
10:32Est-ce qu'on va pas résoudre, finalement,
10:33ce problème, tout simplement,
10:35par l'impossibilité de faire mieux
10:36qu'une IA générative a déjà fait ?
10:38Ah, alors, je pense qu'il y a deux questions
10:39dans votre question.
10:41Je ne sais pas.
10:42Répondez peut-être à la première, déjà.
10:43Alors, vous pouvez me la répéter ?
10:46Non, je dis peut-être que ce problème de détection
10:47va être tout simplement réglé
10:48par le fait que les IA génératives
10:50se nourrissent déjà d'IA génératives
10:51et donc on a une sorte de dégradation
10:53ou de signature permanente de leur production.
10:56Alors, tout à l'heure,
10:57on a parlé du mouvement réglementaire
10:58qui, lui, poursuit un objet,
11:00une mission politique.
11:02L'autre problématique,
11:03c'est qu'effectivement,
11:04on s'est rendu compte qu'il y a quelques années,
11:05les scientifiques se sont rendus compte
11:06que quand une IA générative se nourrit,
11:08s'entraîne sur des contenus de synthèse,
11:10elle peut dégénérer.
11:11Et c'est aussi pour ça que,
11:13parce qu'on a parlé de Claude,
11:14ça fait un tollé,
11:15mais en fait, Gemini l'avait fait deux ans avant.
11:17Tout ce qui était, en fait,
11:20via Gemini était déjà marqué,
11:21en réalité, par Synth, ID, Texte,
11:23la méthode de nature.
11:25Et ça, ça n'avait pas fait de tollé à l'époque.
11:27Donc, en fait,
11:28la limite qu'ils ont quand même,
11:29c'est qu'ils sont capables d'identifier
11:30uniquement les contenus qui sortent
11:32de leur générateur,
11:33les big tech,
11:33mais pas ceux des autres.
11:34Google est incapable de dire
11:35ce qui sort de méta,
11:36ce qui sort de tchat GPT.
11:38Donc, on n'est pas encore au bout
11:40de la problématique,
11:40mais ils essayent, justement,
11:42de s'entraîner que sur du vrai
11:43et donc, ils peuvent déjà écarter
11:44tout ce qui est dans leur écosystème
11:46et flaguer comme générer.
11:48Merci beaucoup, Anthony,
11:49pour vos explications.
11:50Je rappelle que vous êtes le cofondateur
11:52et le CSO de Label4AI,
11:54qui travaille sur ces technologies
11:56sur lesquelles il y a une poignée
11:57d'acteurs dans le monde.
11:58Très, très peu.
11:59Capables de répondre aux exigences
12:01en matière de transparence
12:02sur les contenus générés
12:04par l'intelligence artificielle.
12:05Merci à tous de nous suivre.
12:06C'était Smartech,
12:07une édition un peu particulière
12:09de ces interviews de l'IA.
12:10On se retrouve dès demain
12:11sur HNB Smart.

Recommandations