- il y a 1 heure
Mercredi 23 septembre 2026, retrouvez Anthony Level (cofondateur, Label4.AI) dans SMART TECH, une émission présentée par Delphine Sabattier.
Catégorie
🗞
NewsTranscription
00:07Bonjour à tous, bienvenue dans Smartech édition spéciale.
00:10Aujourd'hui des interviews de l'IA, on va s'intéresser à la question du watermarking.
00:14On a tellement d'images aujourd'hui diffusées, créées par des intelligences artificielles.
00:19Comment est-ce qu'on s'en sort pour protéger les contenus culturels et aussi pour détecter ces images générées
00:24par l'IA ?
00:25Voilà notre grand sujet du jour.
00:31Spéciale interview de l'IA, on s'intéresse au watermarking, à la détection des contenus générés par l'intelligence artificielle.
00:37Avec Anthony Level, bonjour. Merci beaucoup d'être dans Smartech.
00:40Vous êtes le cofondateur de Label4AI, en charge de la stratégie.
00:44Vous allez nous aider à y comprendre un peu plus ce qui se passe en ce moment autour des contenus
00:49générés par l'IA.
00:50Comment est-ce qu'on peut les détecter ?
00:52Mais aussi de cette question du watermarking qui doit apporter de la transparence sur ces contenus auto-générés.
01:00Alors vous contribuez, je le sais, à des travaux au niveau européen, mais aussi au niveau international sur cette question
01:07de la transparence.
01:08C'est en train de changer.
01:10Il y a des règles qui s'imposent désormais, notamment à travers l'IA Act.
01:15Oui, mais déjà, merci beaucoup Delphine pour votre invitation.
01:18Effectivement, alors que jusque-là, le watermark causait vraiment à personne, vous étiez peut-être la seule à m'inviter
01:23à l'époque pour parler de ça.
01:25On a eu quand même deux moments forts cet été qui ont remis ce sujet en lumière.
01:29Les deux moments forts, c'est ce que vous avez dit, c'est-à-dire l'entrée en vigueur de
01:32l'IA Act, en particulier son article 50,
01:34qui traite de la transparence des outputs, donc la transparence des sorties d'IA génératives.
01:39Donc ça, c'est le volet réglementaire.
01:41Ça agite évidemment pas mal de monde.
01:42Mais il y a eu un autre événement cet été qui n'est pas passé inaperçu, c'est le watermark
01:46de Claude.
01:47Et là, il y a eu beaucoup de réactions.
01:48Claude d'entropique.
01:49Claude, absolument d'entropique, qui a fait coller beaucoup d'encre en août.
01:53Et là, c'est revenu sur la table la problématique du watermark.
01:57Qu'est-ce que c'est ? Comment ils font ? À quoi ça sert ?
02:00Alors, prenons une définition déjà justement du watermark.
02:05Le watermark, ça consiste à insérer dans un contenu un signal ou une marque, d'où le nom,
02:11qui permet en fait de donner la provenance du contenu.
02:13Donc c'est un signal qui est caché dans le contenu.
02:16Il n'est pas à côté, il n'est pas attaché comme des métadonnées.
02:18Non, il est véritablement dans le contenu.
02:20Et il dit, je viens d'ici, je viens de chaque GPT, ou j'ai été créé par une IA,
02:25ou j'ai été manipulé par une IA.
02:27Et ce watermark, en fait, il est imperceptible au sens humain.
02:31C'est-à-dire qu'il n'y a qu'une machine qui est capable de le détecter.
02:34La machine qui, en général, l'a encodée, va mettre ce signal dès la génération du contenu, vraiment à la
02:39sortie.
02:40Et ensuite, pendant toute la vie du contenu, on va pouvoir retrouver ce signal.
02:44Et avec le détecteur approprié, on va pouvoir le lire et dire, ça vient bien de ChatGPT, de Claude ou
02:50d'ailleurs.
02:51Ce n'est pas un sujet nouveau, le watermarking.
02:53Bon, là, il s'impose davantage aujourd'hui avec l'intelligence artificielle générative.
02:58Qu'est-ce qu'apporte, par exemple, parce que Label for AI, c'est une deep tech qui est issue
03:04des travaux de INRIA et du CNRS.
03:07Quels sont les apports technologiques aujourd'hui qu'apporte la France sur ce sujet du watermarking pour l'IA générative
03:13?
03:13Alors, déjà, effectivement, vous avez raison, le watermarking a été utilisé jusque-là dans d'autres secteurs.
03:18Il y en a deux principaux.
03:19Le premier, c'est les ayants droit.
03:21Je cite toujours l'exemple des camcordings.
03:23Vous savez, les gens qui enregistraient les films en salle.
03:25En fait, il faut savoir que les studios de cinéma mettaient un watermark par salle,
03:28de manière à pouvoir finalement tracer de quelle salle est parti le camcording
03:32et d'engager la responsabilité de l'exploitant de salle.
03:35Le deuxième usage, c'était la fuite.
03:37En fait, beaucoup d'entreprises watermarkaient les contenus,
03:40de manière à ce que s'ils se retrouvaient à l'extérieur, un document confidentiel,
03:43qu'on se trouvait par exemple sur les réseaux Peer to Peer ou sur des blogs,
03:45on pouvait remonter à la source et savoir qui avait fait fuiter le contenu.
03:50Et aujourd'hui, il faut savoir déjà que Rennes,
03:52parce que la Belforia est à cheval entre Rennes et Paris,
03:55et Rennes, c'est la capitale du watermarking.
03:57C'est là où des travaux scientifiques de haut niveau ont eu lieu sur le watermark,
04:00et c'est vraiment la capitale mondiale.
04:01Aujourd'hui, il y a Singapour qui est aussi très en avance,
04:04mais on capitalise, nous, parce que vous avez cité les laboratoires de recherche français,
04:07CNRS INRIA, donc on combine cette expertise croisée,
04:10mais on va un peu plus loin, c'est-à-dire qu'on a créé un comité scientifique
04:12qui réunit, j'ai envie de dire, la crème de la crème des chercheurs européens sur le domaine,
04:17et on a réuni ces chercheurs justement pour avoir,
04:19on essaie d'avoir la meilleure technologie possible.
04:22Dites-nous un peu plus justement sur cette technologie, qu'est-ce qu'elle a de spécifique ?
04:26Alors, il y a watermark et watermark, et en fait, vous avez toute la gamme de watermark.
04:29Quand on parle de watermark, donc une marque comme de l'eau, si je le traduis littéralement,
04:32une marque aussi transparente, fluide et robuste que l'eau,
04:35et en fait, ce watermark, en réalité, il doit avoir des caractéristiques intrinsèques.
04:43Le premier, je vous en ai parlé, c'est qu'il doit être imperceptible au sens humain.
04:47Et ça, ce n'est pas déjà forcément évident à faire.
04:49Ensuite, il doit avoir deux caractéristiques, qui notamment sont reprises dans la réglementation mondiale,
04:53j'ai envie de dire, pas qu'européenne, c'est qu'il doit être robuste,
04:55c'est-à-dire qu'évidemment, si mon watermark saute, dès qu'il y a un recodage,
04:59dès qu'il y a une compression ou dès qu'il y a un recadrage du contenu pour ce qui
05:02est de l'image,
05:02par exemple, évidemment, il faut que je continue à trouver ma marque.
05:05Ça, c'est la robustesse.
05:06Et ensuite, la sécurité.
05:07Si quelqu'un est capable de supprimer ou d'imiter ma marque, ma marque ne vaut plus rien.
05:12Donc, c'est là-dessus, nous, sur lesquels on est très en pointe,
05:14en fait, c'est sur les caractéristiques techniques.
05:16Et le fait d'être déjà en pointe là-dessus, fait qu'en fait,
05:18il est automatiquement compliant avec l'article 50, nous, ce qu'on propose.
05:22Et donc, on le propose au généreur de l'AAC.
05:25Vous dites, on est finalement une petite poignée à travailler sur ces sujets,
05:28en tout cas, être bon techniquement sur ces sujets.
05:31Mais vous avez cité le watermark de Claude d'Entropique.
05:35Vous voulez savoir comment ça fonctionne ?
05:36J'ai envie de comprendre la différence.
05:39C'est bien légitime.
05:40Alors, il faut que je reparte à la base du watermark.
05:42C'est-à-dire, il faut que je vous cite déjà d'autres natures de contenu
05:44pour mieux comprendre comment ça se passe sur le texte.
05:46On a besoin d'entropie pour mettre un signal dans un contenu.
05:49L'image, c'est super, puisque j'ai des millions de pixels, j'ai des couleurs.
05:53D'entropie, vous avez dit.
05:54D'entropie, là, j'ai dit.
05:55Oui, non, mais je...
05:55J'ai dit entropie.
05:58Et donc, vous avez finalement plein de paramètres,
06:01plein de variables dans lesquelles vous pouvez cacher un message.
06:03Pour l'audio, je vais pouvoir cacher un bruit qui est inaudible
06:06sur une fréquence pour moduler une fréquence particulière.
06:08Et je peux cacher un message dedans.
06:09Pour la vidéo, c'est encore plus simple.
06:11Ça combine l'audio et l'image.
06:12Donc, je vais faire frame par frame pour l'image.
06:14Et puis, l'audio, je vais rajouter aussi potentiellement quelque chose.
06:16Le texte.
06:16Le texte, il n'y a pas assez d'entropie dans le texte.
06:18Un texte libre, j'ai du noir sur du blanc et j'ai des mots.
06:21Donc, où est-ce que je cache un message là-dessus ?
06:23Le premier réflexe, ce serait de jouer sur la police de caractère,
06:26de manière très subtile, invisible à l'œil nu,
06:28ou jouer sur l'espacement des caractères.
06:30Sauf que ce watermark là serait extrêmement peu robuste
06:33puisqu'il ne résisterait pas à un copier-coller.
06:34Parce que typiquement, si je copie-colle ça dans Word,
06:36je vais me retrouver avec la casse et la typologie de Word.
06:40Et donc, je ne retrouverai plus mon message.
06:41Donc...
06:41La typographie.
06:42Oui.
06:43La typographie, exactement.
06:46Et donc, quelles sont les variables sur lesquelles je peux jouer
06:49pour marquer un texte généré par l'IA ?
06:51Eh bien, il n'y en a véritablement qu'une qui, aujourd'hui, est la meilleure.
06:54C'est la technique publiée par Google DeepMind en 2024
06:58dans la revue scientifique Nature,
07:00et qui s'appelle Saint-Idi-Text,
07:02et qui consiste en fait à...
07:04Vous savez, pour construire des paragraphes et des phrases,
07:07les LLM choisissent les mots qui suivent.
07:09Eh bien, c'est là où, en fait, on va jouer.
07:11On va un petit peu biaiser.
07:12Si, par exemple, le LLM aurait dû nativement choisir un mot,
07:15il va en choisir un autre qui est un synonyme de ce premier mot.
07:18Donc, le ciel est nuageux, le ciel est gris, le ciel est maussade.
07:21Il aurait dû choisir gris.
07:22Il va choisir peut-être un des deux autres.
07:24Et du coup, ça laisse un biais.
07:25On appelle ça un motif statistique.
07:26Et quand on va le retrouver plusieurs fois, finalement, dans un texte libre,
07:30on va avoir de plus en plus d'indices
07:32comme quoi ce texte est watermarké par Claude,
07:35qui lui a mis son détecteur.
07:36C'est une forme de signature, finalement.
07:37Oui, absolument.
07:38C'est comme une signature électronique du contenu.
07:40Ce n'est pas de la cryptographie, mais c'est de la stéganographie.
07:42D'accord.
07:43Et quel regard vous portez là-dessus ?
07:45Est-ce que ça apporte la transparence nécessaire
07:47telle qu'elle est demandée par la réglementation européenne, selon vous ?
07:49Moi, chez Label4EI, on travaille sur la détection forensics.
07:53Donc, on sait les limites aussi de,
07:55quand on n'a aucun avantage sur le contenu,
07:56quand on a un contenu brut devant soi,
07:58on doit investiguer dessus.
07:59Et c'est assez compliqué.
08:00Et vous pouvez potentiellement vous tromper.
08:01Là, tout le but de la réglementation mondiale,
08:04et particulièrement européenne,
08:05c'est de rajouter un avantage, en fait,
08:06pour celui qui veut identifier le contenu.
08:08En mettant dans le contenu sa carte d'identité,
08:10vous avez parlé de signature, on va dire,
08:12de carte d'identité,
08:12de manière très robuste et sécurisée,
08:14je vais pouvoir l'extraire.
08:15Et je n'ai plus besoin de faire l'investigation sur le contenu,
08:17puisque j'ai sa carte d'identité.
08:20Sur la partie de détection,
08:22on parle d'autres technologies,
08:24ou les deux sont vraiment liées ?
08:26Alors, le watermark est très lié à la détection.
08:28Oui.
08:28Puisqu'en fait, par exemple, nous,
08:29on utilise aussi,
08:30quand on trouve des traces de watermark,
08:32on va pouvoir faire une affirmation sur le contenu
08:33dont on nous a demandé l'analyse.
08:35Donc, ça vient nourrir.
08:36C'est pour ça que nous, on agit à deux niveaux,
08:37à la source,
08:38avec la fourniture d'un watermark très robuste et sécurisé,
08:41pour assainir, si vous voulez,
08:43la place du web et d'autres canaux.
08:47Et de l'autre côté, on va faire sur le 26.
08:48En même temps, ce n'est pas qu'on peut tout assainir,
08:49qu'on aura forcément des deepfakes
08:51et des contenus généraux qui ne le disent pas ?
08:53Bien sûr.
08:53Alors, vous m'avez posé la question
08:55sur ce que vous y croyez un peu, vous.
08:56C'était un peu ça, la question.
08:58Eh bien, il faut savoir que, par exemple,
09:00la Commission européenne est très honnête là-dessus.
09:01Elle dit, c'est pour garder honnête,
09:03people honest, en français.
09:06C'est tellement facile de frauder et de faire des deepfakes
09:08qu'il faut mettre quelques barrières à l'entrée, quand même.
09:10Et le watermark en fait partie.
09:11Les modèles étatiques, les états mafieux
09:14vont évidemment utiliser des modèles non marqués.
09:16Donc, c'est là où on a besoin de la détection.
09:18Exactement.
09:18Et donc, est-ce qu'on est dans le même type de technologie ?
09:20Comment ça fonctionne la détection aujourd'hui ?
09:22Alors non, la détection, c'est autre chose.
09:23C'est ce qu'on appelle l'inforensic,
09:26forensics en anglais.
09:27Et là, c'est vraiment, on va chercher,
09:28en fait, nous, on est spécialisé dans la recherche de traces
09:31invisibles dans le contenu.
09:32C'est-à-dire, on va s'attacher à regarder
09:34s'il y a des micro-signaux, des signatures,
09:37des artefacts qui trahissent ou qui révèlent
09:40l'intervention de l'IA générative en tout en partie dans le contenu.
09:42Et ça, on essaie de le faire à la pixel près.
09:44C'est-à-dire que typiquement, on est capable de zoner
09:46la partie qui a été manipulée par l'IA
09:47si l'image était authentique au départ, par exemple.
09:50On a l'impression que pour l'instant,
09:51c'est pas trop difficile à détecter quand même,
09:52Anthony, pour être tout à fait honnête.
09:55Quand on croise des contenus créés par l'IA générative,
09:59on les repère assez vite, non ?
10:01Alors, de moins en moins.
10:02Que ce soit sur les images ou sur les textes, même.
10:04De moins en moins.
10:05Encore, la dernière, effectivement, en date,
10:06c'est celle de Trump au golf,
10:08avec, soi-disant, sa petite amie.
10:10Le baiser.
10:11Voilà.
10:11Et là, il y a six doigts.
10:12Donc, le coup des six doigts,
10:13on pensait qu'il n'existait plus.
10:15On pensait que c'était fini, mais si.
10:16Finalement, il revient à la charge.
10:18Mais c'est parce que c'est un modèle particulier
10:19qui a aussi utilisé ça.
10:20Donc, en fait, le sémantique,
10:21nous, on ne travaille même plus dessus.
10:22Parce qu'on sait que dans très peu de temps,
10:24il n'y aura plus de traces sémantiques
10:25puisque, en fait, les modèles,
10:27pour plaire à l'utilisateur final,
10:28ils rendent les choses de plus en plus réalistes.
10:30Et donc, les problématiques d'ombre,
10:32les problématiques, en fait,
10:33de non-respect des lois physiques ou biologiques
10:35sur l'image ou sur la vidéo,
10:36elles vont disparaître au fur et à mesure.
10:38Et donc, nous, on s'attache pour ça
10:39aux traces invisibles qui, elles, resteront toujours.
10:41Elles seront toujours détectables.
10:43Ça, vous parlez de la fabrication de Diffey
10:45qui se perfectionne, évidemment.
10:48Mais il y a ce sujet aussi
10:50de l'intelligence artificielle générative, finalement,
10:52qui s'auto-dénaturent par elles-mêmes
10:54puisqu'elles utilisent des contenus
10:55qui sont générés déjà par d'autres IA.
10:59Est-ce qu'on ne va pas résoudre, finalement,
11:00ce problème, tout simplement,
11:01par l'impossibilité de faire mieux
11:03qu'une IA générative a déjà fait ?
11:05Ah, alors, je pense qu'il y a deux questions
11:06dans votre question.
11:07Je ne sais pas.
11:09Répondez peut-être à la première, déjà.
11:10Alors, vous pouvez me la répéter ?
11:13Non, je dis peut-être que ce problème de détection
11:14va être tout simplement réglé
11:15par le fait que les IA génératives
11:17se nourrissent déjà d'IA génératives
11:18et donc on a une sorte de dégradation
11:20ou de signature permanente de leur production.
11:23Alors, tout à l'heure,
11:24on a parlé du mouvement réglementaire
11:25qui, lui, poursuit un objet,
11:27une mission politique.
11:29L'autre problématique,
11:30c'est qu'effectivement,
11:31on s'est rendu compte qu'il y a quelques années,
11:32les scientifiques se sont rendus compte
11:33que quand une IA générative se nourrit,
11:35s'entraîne sur des contenus de synthèse,
11:37elle peut dégénérer.
11:38Et c'est aussi pour ça que,
11:40parce qu'on a parlé de Claude,
11:41ça fait un tollé,
11:42mais en fait, Gemini l'avait fait deux ans avant.
11:44Tout ce qui était, en fait,
11:47via Gemini était déjà marqué,
11:48en réalité, par Synth, ID, texte,
11:50la méthode de nature.
11:52Et ça, ça n'avait pas fait de tollé à l'époque.
11:54Donc, en fait, la limite qu'ils ont quand même,
11:56c'est qu'ils sont capables d'identifier uniquement
11:58les contenus qui sortent de leur générateur,
12:00les big tech,
12:00mais pas ceux des autres.
12:01Google est incapable de dire
12:02ce qui sort de méta,
12:03ce qui sort de tchat GPT.
12:05Donc, on n'est pas encore au bout de la problématique,
12:07mais ils essayent, justement,
12:09de s'entraîner que sur du vrai
12:10et donc, ils peuvent déjà écarter
12:11tout ce qui est dans leur écosystème
12:13et flaguer comme générer.
12:15Merci beaucoup, Anthony,
12:16pour vos explications.
12:17Je rappelle que vous êtes le cofondateur
12:19et le CSO de Label4AI,
12:21donc qui travaille sur ces technologies
12:23sur lesquelles il y a une poignée d'acteurs
12:24dans le monde.
12:25Très peu.
12:26Capables de répondre aux exigences
12:28en matière de transparence
12:29sur les contenus générés
12:31par l'intelligence artificielle.
12:32Merci à tous de nous suivre.
12:33C'était Smartech,
12:34une édition un peu particulière
12:35de ces interviews de l'IA.
12:37On se retrouve dès demain
12:38sur HNB Smart.