Passer au playerPasser au contenu principal
  • il y a 7 minutes
Alexandre Défossez, cofondateur de Kyutai et directeur de la Recherche chez Gradium, était l'invité de François Sorel dans Tech & Co, la quotidienne, ce jeudi 24 septembre. Il s'est penché sur la spécialisation de Gradium dans l'IA vocale sur BFM Business. Retrouvez l'émission du lundi au jeudi et réécoutez-la en podcast.

Catégorie

📺
TV
Transcription
00:00Tech & Co, la quotidienne, l'invité.
00:04Voilà le retour de Tech & Co, la quotidienne depuis Marseille, depuis le stade Védoldrome à l'occasion de cette
00:09AIM.
00:10Troisième édition déjà de ce rendez-vous et je suis très heureux d'accueillir Alexandre Défossé,
00:15qui est le cofondateur de Qtai et directeur de la recherche chez Gradium.
00:19Bonsoir Alexandre.
00:21Bonsoir François.
00:22Alors vous, votre spécialité en fait c'est l'IA vocal en quelque sorte,
00:28qui petit à petit arrive dans notre quotidien.
00:30On est de plus en plus nombreux à poser des questions à notre IA, à ChatGPT, etc.
00:35On se rend compte qu'il y a d'énormes progrès qui sont faits avec une rapidité aujourd'hui de
00:40réponse
00:40qui n'est pas la même qu'il y a un an par exemple.
00:43On voit que ça va très très vite.
00:45Est-ce que vous pouvez nous expliquer ce qu'est Gradium et quel est votre point de vue en fait
00:50sur ce sujet ?
00:52Oui alors, donc Gradium, nous on est une start-up, donc on s'est lancé il y a un an
00:56Et auparavant vous étiez chez Qtai.
00:58Et auparavant, voilà, donc c'est des anciens, en partie des anciens de Qtai qui ont monté cette entreprise.
01:05On a pour mission de fournir les meilleurs modèles autour de la voix, donc pour l'interaction vocale.
01:11Donc ça, ça vient juste d'un constat en fait, on a développé énormément de technologies au fil de notre
01:17carrière.
01:17Donc il y a aussi Nel Zeguidour qui est le PDG de la start-up, qui était aussi chercheur en
01:25audio.
01:25Moi j'étais chercheur à Meta, il était chercheur à Google, ensuite on s'est rejoint à Qtai.
01:30Donc en fait, c'est l'expertise qu'on a acquise, ça fait de nombreuses années qu'on l'a
01:35construit,
01:35ça fait de nombreuses années qu'on construit ce leadership sur cette technologie.
01:39Et à un moment on s'est dit, bon ben là on a atteint le moment où il faut vraiment
01:43en faire un produit
01:44pour mettre ça dans les mains du plus grand nombre et aussi construire la valeur économique pour la France et
01:50pour l'Europe.
01:51Alors c'est intéressant parce que vous êtes passé chez Meta donc, c'était quoi votre job chez Meta à
01:55l'époque ?
01:56Chez Meta, j'étais chercheur et je travaillais sur la modélisation de l'audio à Facebook AI Research,
02:02donc le laboratoire qui avait été fondé par Yann Lequin.
02:04Ok, c'est intéressant de voir que tous ces profils qui ont travaillé dans des grandes boîtes américaines,
02:11et pareil pour Google, Microsoft, etc.
02:14après reviennent en France pour créer une solution souveraine, c'est très intéressant.
02:19Mais comme vous avez travaillé avec Meta, j'imagine que vous avez suivi l'actualité récente.
02:24Mark Zuckerberg a annoncé, pas plus tard que cette nuit je crois, pas mal de nouveaux produits.
02:28Alors les lunettes connectées, etc. on voit qu'il déroule sa stratégie,
02:32mais surtout un petit produit qui s'appelle Muse Charm, qui justement réagit qu'à la voix.
02:38Donc c'est qu'on voit que c'est quelque chose qui va prendre de l'ampleur en fait.
02:45Absolument, alors ça je ne suis pas surpris par ces annonces,
02:48c'est quelque chose qu'on observe depuis un certain nombre d'années.
02:52Maintenant le développement fait que ça commence à devenir un peu entre les mains du grand public.
02:56Alors pour la petite anecdote, la Muse Charm, l'équipe derrière ça,
02:59c'est une startup qui a été acquise, Wayforms AI, et donc qui a été co-fondée par Alexis Kono,
03:04qui était aussi à Facebook AI Research, un français également.
03:09Qui lui est resté aux Etats-Unis ?
03:10Lui il est resté aux Etats-Unis exactement.
03:12Il faut le débaucher vite fait là, maintenant c'est bon.
03:14Il a eu un gros chèque de marque, donc on va voir ce qu'on peut faire.
03:18Mais en tout cas ça montre le savoir-faire qu'on a, l'expertise, en fait on est un petit
03:22peu partout.
03:25Excusez-moi, je vous coupe juste une question sur la rémunération,
03:27parce que c'est un sujet qui est intéressant, la bataille d'échec, vous le disiez.
03:31Comment ne pas céder aux sirènes de l'argent ?
03:34Quand on est un chercheur de votre niveau, que vous décidez de revenir en France,
03:38alors j'imagine que vous gagnez bien votre vie,
03:40mais vous pourriez gagner 100 fois mieux votre vie aux Etats-Unis, aujourd'hui non ?
03:44En toute sincérité ?
03:47Pas je dis 100 fois, mais peut-être 10 fois, je ne sais pas.
03:49On peut gagner mieux sa vie, mais disons qu'aux Etats-Unis,
03:52il faut mettre beaucoup d'argent pour l'université de ses enfants,
03:55le prix des maisons dans la Silicon Valley n'a aucun sens.
03:59En fait, c'est une véritable qualité de vie qu'on a en Europe.
04:02Vous avez privilégié votre qualité de vie en France ?
04:07Absolument.
04:08Pas par rapport à une rémunération qui aurait pu être beaucoup plus importante ?
04:12Moi je trouve ça beaucoup plus enrichissant d'évoluer dans le milieu français-européen,
04:18il y a beaucoup plus de diversité dans les interactions.
04:20En fait, ce qu'on voit, et on le voit sur les annonces dernièrement,
04:23dans la Silicon Valley, on passe très vite de l'IA va sauver le monde
04:26à l'IA va détruire le monde, il n'y a pas vraiment d'entre-deux,
04:28il n'y a pas de modération, et ça, ça vient aussi du homogénéité des profils, des idées,
04:33et ça, je trouve que c'est un petit peu dommage.
04:35Mais vraiment, il y a tout un tas d'avantages à être en France, en Europe.
04:40Il y a des inconvénients aussi, on a accès à moindre ressource de calcul,
04:43le financement peut être plus compliqué, mais en tout cas, je pense que nous,
04:46que ça ait été à Qtai ou à Gradium, cette volonté de jouer sous les couleurs,
04:52sous notre drapeau, un peu, de rejoindre la sélection nationale,
04:55c'est vraiment quelque chose qui nous motive.
04:57Et puis, vous avez un peu d'ADN américain,
04:59parce que Nvidia a injecté 100 millions d'euros dans votre startup Gradium.
05:04Pourquoi ? Comment ? Comment ça s'est passé ?
05:07Johnson Young a tapé un jour à votre porte en vous disant,
05:10c'est génial ce que vous faites, allons-y.
05:12Oui, alors ça, c'est Nel qui l'a croisé et qui l'a directement convaincu.
05:20Mais ça ne sort pas de nulle part.
05:21En fait, il faut savoir que Nvidia fait énormément de travaux sur la voix,
05:26sur la synthèse vocale, sur l'interaction vocale temps réel.
05:29En fait, ils ont repris certains des travaux qu'on avait développés à Qtai.
05:33Leurs équipes de recherche suivent nos travaux avec attention.
05:36Donc, en fait, ils savaient un peu d'où en sortait.
05:40Et ça, je pense que c'est important, parce que souvent,
05:42quand on parle de souveraineté, on se dit,
05:44on a envie d'être la solution française ou la solution européenne.
05:46Nous, ce n'est pas du tout ce qu'on veut.
05:47On veut qu'on nous choisisse parce qu'on est la meilleure solution.
05:50Par ailleurs, on est français et européen.
05:51Et s'il y a une boîte américaine qui veut faire appel à vos services,
05:54go ! Allez-y !
05:56Et la confiance que Nvidia a placée en nous,
05:58pour nous, c'est vraiment une marque de ce savoir-faire qu'on a développé
06:02et un encouragement qui nous touche forcément.
06:07C'est 100 millions ? C'est du cash ?
06:08Ou est-ce qu'on vous dit, vous voulez quoi ?
06:10100 millions de GPU dernière génération ?
06:13C'est pour moi, je vous les offre.
06:15Enfin, je vous les offre.
06:16Non, je ne vous les offre pas, parce que c'est chiffré dans ces 100 millions.
06:19Comment ça marche, un deal avec Nvidia, aujourd'hui ?
06:21Alors, il y a différents types de deals, selon les situations.
06:25Il peut y avoir, effectivement, ce qu'on appelle equity, GPU for equity.
06:30Nous, dans notre cas, c'est un financement direct,
06:34comme lors d'une levée de fonds standard.
06:36Cela dit, après, vous avez besoin d'acheter des GPU Nvidia.
06:39Donc, en fait, cet argent-là repart dans la poche de Jensen Young.
06:45La stratégie d'Nvidia, là-dessus, est assez claire.
06:48Il cherche à développer tout ce qui va permettre de développer l'écosystème de l'IA.
06:53Et de vendre ce GPU, finalement.
06:54In fine, ça leur est utile.
06:58Comment vous imaginez les intérations qu'on aura avec nos appareils dans quelques années, Grégory,
07:04selon votre vision ?
07:07Alors, effectivement, je pense que ça se développe de plus en plus.
07:10Moi, à titre personnel, je sais que je m'en sers quand je vais cuisiner.
07:14Donc là, par exemple, il y a des sujets un peu techniques.
07:16Récemment, j'ai même parlé sur scène de l'équation de Navier-Stock.
07:19En fait, on peut se poser des questions.
07:20Qu'est-ce que c'est Navier-Stock ?
07:21Quel était l'état des connaissances ?
07:22D'où ça vient ?
07:23Et en fait, moi, j'adore, quand je cuisine, poser ces questions à l'IA.
07:26Qui n'ont rien à voir avec la recette.
07:28J'essaye quand même de suivre.
07:29La dernière fois que j'ai fait une tarte, j'ai oublié de mettre...
07:31Il faut rester concentré sur la recette quand même.
07:33J'ai oublié de mettre du sucre.
07:34C'était un peu moins bon.
07:35Mais bon, ça permet d'apprendre des choses.
07:38Et donc ça, c'est un cadre.
07:38Le cadre où on est un peu seul avec l'IA.
07:40On a envie d'apprendre.
07:41On est en voiture.
07:42On veut automatiser certaines tâches.
07:44Peut-être qu'on est en train de marcher dans la rue.
07:46Il y a quelque chose qui est, moi, je trouve assez intéressant.
07:48Et ça, ça va être une frontière.
07:49C'est que nous, on est une startup.
07:51On est en open space.
07:52Toutes les startups sont en open space aujourd'hui.
07:54L'open space est construit autour de l'idée qu'on veut que les gens puissent se parler.
07:57Ils tapent sur leur clavier.
07:59Maintenant, si tout le monde se met à parler à son IA en même temps,
08:02ça va être un petit peu problématique.
08:04Donc là, on est sur un cas intéressant où, en fait,
08:05le lieu de travail a coévolué avec la façon de travailler.
08:08Et aujourd'hui, il va agir un peu comme un...
08:09Vous êtes dans un environnement hostile, finalement, par rapport à votre solution.
08:14Ça peut être un petit peu hostile.
08:15Donc, il y a différents aspects.
08:17On peut imaginer que les choses vont évoluer.
08:19Donc, au fur et à mesure que l'IA va s'améliorer,
08:20peut-être qu'en fait, on va avoir un meeting de 30 minutes avec son IA.
08:24On va se mettre dans une salle de meeting.
08:27On va discuter avec elle.
08:27Ou l'IA va rejoindre des meetings avec d'autres personnes de l'entreprise.
08:33On peut imaginer des solutions techniques.
08:35Donc, de la même manière qu'on a des espèces de...
08:37Les casques Bose, ce qu'ils font, c'est juste qu'il y a des micros.
08:38Ils vont capter le son.
08:39Ils vont le transmettre à la vitesse de la lumière,
08:41à des petites enceintes dont le but est d'annuler exactement le son qui arrive.
08:44Donc, on peut imaginer ça autour du bureau
08:46où ça va créer une petite bulle de calme pour pouvoir se concentrer.
08:50Et que pensez-vous de l'achat de cette boîte par Apple
08:55qui est spécialisée dans le chuchotage ?
08:57Je ne sais pas si vous avez entendu parler de ça.
08:58Alors ça, je n'ai pas suivi.
09:00Apple a acheté une boîte, une start-up,
09:02qui arrive à comprendre ce que disent les gens en chuchotant.
09:07Et au début, je me suis dit, mais qu'est-ce que c'est que ce truc-là ?
09:09Ça sert à quoi ?
09:10Et on peut comprendre, ça peut avoir du sens finalement.
09:13Si on est dans un environnement où il y a du monde, etc.
09:16Et si on chuchote à un micro ce qu'on est en train de dire,
09:19des pensées personnelles qui ne sont pas entendues,
09:23ça peut être cool.
09:25Ça peut être effectivement intéressant.
09:27Alors je sais qu'il y a différentes technologies aussi
09:29dans lesquelles Apple investit.
09:30Donc par exemple, la conduction au sauce,
09:31c'est un autre moyen justement de capter le son,
09:33non pas par l'extérieur,
09:35mais en fait, notre voix va beaucoup plus se transférer
09:37au travers de notre boîte crânienne.
09:39En fait, le son se propage et on peut essayer de capter ça.
09:42Donc c'est d'autres technologies qui sont utiles.
09:44Donc effectivement, ça a du sens d'investir là-dedans.
09:48Alors après, c'est vrai que chuchoter toute la journée,
09:49ça peut être un petit peu fatigant.
09:53Mais en tout cas, moi, je vois de plus en plus souvent,
09:55à mesure que l'IA devient plus intelligente et plus autonome,
09:58en fait, il y a beaucoup de moments où j'ai envie de lui parler.
10:02Par exemple, aujourd'hui, on ne programme plus trop.
10:04Donc il y a des moments où je vais écrire des prompts
10:05qui peuvent être relativement longs.
10:07Donc j'ouvre un éditeur de texte, je vais éditer mon texte,
10:09puis je vais lui envoyer le message.
10:11Et c'est comme quand on envoie un mail et on se dit,
10:13ah non, j'aurais voulu rajouter ça.
10:14Donc il faut interrompre, reprendre et tout.
10:16La voix, en fait, c'est très naturel.
10:17Ça permet d'aller très vite.
10:18L'IA peut tout de suite faire surgir,
10:19demander confirmation, on reconfirme.
10:22Et ça permet aussi de faire du brainstorming
10:24de manière beaucoup plus efficace.
10:26Sur les sujets scientifiques, par exemple,
10:28moi, j'adore...
10:30J'avais fait des études de physique initialement.
10:31Après, je suis parti vers les maths appliquées.
10:33J'adore, du coup, recreuser le sujet avec l'IA.
10:36En fait, si je pose une question à une IA textuelle,
10:38elle a tendance à me sortir des pavés.
10:40Genre... Enfin, il y a 10 sections.
10:41Ça arrive directement...
10:42Elle est très bavarde, quoi.
10:42Oui, très bavarde.
10:43Et en fait, avec la voix, c'est beaucoup plus naturel.
10:45Parce que dès qu'il y a un truc que je ne comprends pas,
10:46je l'interroge et je dis que ça, en fait, je n'ai pas compris.
10:49Et ça change vraiment la nature de l'interaction.
10:53Mais est-ce que demain, on parlera à son téléphone ?
10:56Est-ce qu'on parlera à un Muse Charm ?
10:58Est-ce qu'on parlera à ses lunettes ?
11:00Je sais que ce n'est pas trop votre job, finalement,
11:02parce que vous n'en êtes pas là,
11:03mais vous imaginez sans doute le micro, il sera où ?
11:08Alors ça, c'est une bonne question.
11:09En fait, le micro, il peut être à beaucoup d'endroits.
11:11On peut être face à son ordinateur.
11:13Un sujet qui se développe énormément en ce moment,
11:14c'est la robotique. Dans la robotique,
11:16le micro est sur le robot, et donc on est loin du micro.
11:19Et pire que ça, le robot, il bouge,
11:20il a des moteurs, ça fait énormément de boucans.
11:22Donc en fait, notre voix est noyée au milieu d'un vacarme.
11:25Et il faut quand même que le robot fonctionne.
11:26On peut avoir son téléphone, mais il y a des chances
11:27pour que le téléphone, de plus en plus,
11:29on le laisse au milieu de la pièce et on se balade.
11:31Il n'entendra pas ce qu'il y aura.
11:32En fait, c'est possible.
11:33Et tout ça, c'est ce qui fait un peu l'intérêt de notre domaine.
11:38C'est qu'en fait, tout cela nécessite d'être résolu.
11:41On doit être capable de comprendre
11:43quel est le locuteur principal,
11:44qui sont des locuteurs secondaires,
11:45qui s'adresse à qui,
11:47être capable de faire dans des conditions
11:48où il y a du bruit, dans des conditions
11:49où on est face au micro, loin du micro.
11:52Et ça, moi, je pense que sur les années qui viennent,
11:53on va résoudre tous ces problèmes.
11:56Quel est le meilleur en ce moment pour ça ?
11:58Pour la compréhension vocale,
12:01la rapidité de réponse
12:04et la pertinence des réponses ?
12:05Alors, nous, à Gradium,
12:08on va fournir le text-to-speech
12:09qui est le plus rapide du marché.
12:11Donc en fait, on est capable de générer
12:12en moins de 50 millisecondes
12:14une réponse audio.
12:15Donc ça, c'est assez important.
12:18On peut tester ou pas ?
12:18Alors là, je n'ai pas de...
12:19Non, mais est-ce que n'importe qui peut tester
12:20sur Internet ou je ne sais pas quoi ?
12:21Si vous allez sur notre page
12:22Gradium.ai,
12:24en fait, on a une démo
12:25directement qu'on a construite
12:27et vous pouvez directement
12:27tester les produits,
12:29parler avec des agents.
12:31Pour le moment,
12:31on utilise une technologie
12:32qui est encore cascadée.
12:34Et donc le cascading,
12:35ça veut dire qu'on va commencer
12:36par transcrire,
12:37on va passer par un modèle de texte
12:38puis ensuite, on va synthétiser.
12:39Donc ça rajoute de la latence.
12:40Exactement.
12:41Et donc nous,
12:41voilà un de nos gros enjeux
12:42de recherche actuel
12:43et il y a très peu
12:44de laboratoires qui le font.
12:46Nous, on était les premiers
12:46à Cuta, il y a fourni un modèle
12:48qui faisait ça
12:48à titre de démonstration.
12:50On se souvient de Moshi,
12:51notamment.
12:52Qui était même
12:52un peu trop rapide parfois.
12:53Un peu trop rapide parfois
12:54et puis surtout,
12:55il manquait d'utilité.
12:57En fait, il ne peut pas
12:57vraiment faire grand-chose.
12:58On ne peut pas lui poser
12:59des questions de physique avancées.
13:01Donc sur ce mélange
13:02d'intelligence
13:03et de facilité d'utilisation,
13:05c'est sûr que les grosses
13:06entreprises américaines
13:07gardent une longueur d'avance.
13:09Mais nous, en fait,
13:10sur la partie...
13:10Il y en a un qui vous bluffe
13:11plus particulièrement en ce moment ?
13:13Il y a OpenAI
13:13qui a fait pas mal de progrès
13:15sur le sujet.
13:16Non mais je suis d'accord.
13:17Moi, je m'en sers souvent.
13:18C'est impressionnant.
13:19Et ce qu'il y a d'incroyable,
13:20c'est la qualité de la voix.
13:22Il y a des petites hésitations humaines.
13:24Il y a des petites...
13:25Comment dirais-je ?
13:26En fait, des...
13:28Oui, des choses naturelles
13:31qui ne sont pas parfaites
13:32et qu'ils arrivent
13:32à retranscrire dans la voix.
13:34C'est ça qui est fou.
13:35Alors, leur voix a souvent tendance
13:36à parler en accent québécois.
13:39Malheureusement, en français.
13:40Il reste des petits artefacts.
13:41Alors moi, en tant qu'expert,
13:41je vais noter la petite bête.
13:44Forcément.
13:45Mais c'est vrai que nous,
13:45une de nos grandes missions
13:46à Gradium aujourd'hui,
13:47c'est d'aller sur ce sujet
13:49de recherche de frontières.
13:50Donc, ramener de l'intelligence
13:51dans nos modèles.
13:52C'est extrêmement dur
13:53parce qu'au final,
13:53on doit faire un travail
13:54qui, sur l'intelligence,
13:57repose plus,
13:57ressemble plus
13:58à ce que fait une boîte
13:59traditionnelle de modèles de texte.
14:00Et on doit, en même temps,
14:02combiner ça avec notre expertise
14:03sur l'audio
14:04pour combiner le meilleur
14:04des demandes.
14:05C'est un challenge,
14:06mais je pense qu'on a
14:07une des meilleures équipes
14:08de recherche.
14:08Donc, on est parmi les mieux
14:10placés pour le réaliser.
14:11Et ça arrive quand ?
14:12Je ne vais pas m'avancer,
14:14mais on travaille
14:15très activement.
14:16Non, mais c'est quoi ?
14:162027, 2028 ?
14:18Ce ne sera pas...
14:19Ce sera moins de...
14:21Ouais, il faut qu'en 2027,
14:23on ait quelque chose.
14:24Il faut que ça sorte en 2027.
14:25C'est ça.
14:26L'accouchement est prévu en 2027.
14:28De toute façon, nous,
14:29un choix qu'on a fait très tôt
14:30avec Gradium,
14:30c'est d'itérer très rapidement,
14:32de sortir les produits
14:33parce que c'est comme ça aussi
14:34qu'on réalise...
14:35Nous, on venait vraiment
14:36d'une équipe de recherche,
14:37donc on a découvert un peu
14:38tout l'aspect entrepreneurial,
14:40les véritables clients
14:41dans le monde de l'entreprise.
14:42Donc, parfois,
14:42on a des idées préconçues
14:43sur ce qui va être hyper important,
14:44genre tel chiffre de performance.
14:46En fait, on sort le modèle,
14:47on réalise que les gens
14:47n'en ont rien à faire.
14:48Et en fait,
14:48ce qui va les bloquer,
14:49ce qui va les limiter,
14:50c'est complètement autre chose.
14:51Et nous,
14:52c'est aussi une des forces de Gradium,
14:53c'est...
14:54On est une petite structure,
14:55on a une équipe de recherche
14:56qui est en lien direct
14:57avec nos équipes commerciales
14:58et on fait des boucles
14:59de rétroaction extrêmement rapides
15:01pour apprendre, justement,
15:02de la réalité du terrain.
15:04Eh bien, voilà.
15:05Allez tester Gradium.ai.
15:06C'est la première itération.
15:09Et vous reviendrez en 2027
15:11nous présenter tout ça.
15:12Il faudra qu'on l'interview.
15:13Absolument.
15:14Il faudra qu'on arrive
15:14à trouver un système
15:15sur le plateau
15:15pour pouvoir interviewer
15:18cette IA, finalement.
15:20Merci beaucoup, Guillaume.
15:21Non.
15:22Alexandre, pardon.
15:23Pourquoi Guillaume ?
15:24Alexandre Desfossés, merci.
15:25Merci beaucoup.
15:25Vous êtes le cofondateur de Qtai
15:27et directeur de la recherche
15:28donc chez Gradium.
15:29Merci beaucoup.
Commentaires

Recommandations