00:02Je vais maintenant vous parler en quelques mots de GARANCE.
00:07L'idée, c'est de vous donner l'essentiel des informations sur ce projet.
00:14Alors, GARANCE, qu'est-ce que c'est ?
00:16En fait, c'est un acronyme que d'ailleurs UNIA a trouvé pour nous en 2024,
00:23quand nous avons essayé de lui donner un petit nom.
00:27Nous avons demandé un LLN, en lui donnant les informations sur les objectifs,
00:34comment on pourrait l'appeler.
00:37Et parmi les propositions, on a trouvé GARANCE,
00:42qui, vous le savez, a un prénom féminin, c'est aussi le nom du Blanche.
00:47Et pour, dans notre contexte, il s'agit du Graf des Archives Nationales de France
00:53pour la recherche, l'accès, la navigation des connaissances enrichies,
00:56bon, c'est un petit peu verbeux, pour préciser un peu,
01:02GARANCE est une application web que nous avons mise en ligne fin avril,
01:07donc il y a quelques semaines, à l'adresse qui est sur la diapositive.
01:11On va vous faire une démonstration, donc ce sera le plus important, je pense.
01:16Et le but de cette application, c'est de permettre à tous, puisqu'on est sur Internet,
01:21une exploration aisée des données de référence des archives nationales,
01:26en offrant pour cela des fonctionnalités de recherche et d'accès performantes,
01:31et aussi de rendre ces données de référence, référentielles, également accessibles aux machines.
01:37Comme Thomas l'a indiqué, ce projet, c'est le lab qui le porte depuis plusieurs années,
01:45et en particulier, si on a commencé à travailler sur l'interface de GARANCE en 2024,
01:52en fait, on avait commencé à travailler sur ces contenus dès 2021,
01:56ce qui fait qu'une succession d'ingénieurs et moi-même ont travaillé sur ce projet.
02:02Je mentionnerai notamment Pauline Charbonnier et Mathieu Zral,
02:08avant donc Yanis Massamba et Chimiche Michel.
02:12Alors, pour aborder plus précisément le sujet,
02:18le problème que nous avons voulu essayer de traiter,
02:24c'est que les données de référence des archives nationales
02:27ne sont pas actuellement accessibles directement sur le web
02:34via le système d'information,
02:35et en particulier la salle de lecture virtuelle des archives nationales.
02:38La seule exception, c'est le référentiel des producteurs,
02:42je le montrerai tout à l'heure.
02:44Or, ces données de référence, comme leur nom l'indique,
02:47ce sont des données auxquelles les agents des archives nationales
02:54ont accordé toute leur attention depuis des décennies
02:56et qui, en tant que telles, sont intéressantes.
03:00Le but de Garant, c'est donc de rendre ainsi de nouveaux services
03:04à toutes personnes potentiellement intéressées.
03:07Je reviendrai aussi sur les usages que l'on envisage,
03:12les usages possibles.
03:15Le point que, la décision que nous avons prise
03:19pour atteindre cet objectif a été de passer de données hétérogènes
03:25et de collection de fichiers, en fait, à un graphe d'entités,
03:33ce qui nous a permis d'envisager une solution innovante,
03:37à la fois opérationnelle et comme Thomas Vandeval l'a déjà un petit peu dit,
03:42provisoire, puisque le but est également de réfléchir à l'avenir.
03:48Le système d'information des archives nationales doit être réécrit
03:55et on l'espère, dans quelques années, un nouveau système tout beau,
03:59tout neuf sera déployé.
04:01En attendant, pour les données de référence, on disposera de Garance
04:05et Garance par son architecture et ses fonctionnalités
04:09permet de se projeter, d'essayer de réfléchir à cet avenir
04:14en espérant que le futur SCI, donc, prendra en charge
04:20les données pour en permettre un accès.
04:25Alors, pour être un peu plus précise encore sur les données
04:30dont on parle, vous avez à gauche un camembert qui vous en montre
04:38un petit peu la nature et la répartition.
04:41De quoi s'agit-il ? Il s'agit de nos dix plus ou moins détaillés
04:46qui décrivent des lieux des personnes, des collectivités ou des personnes
04:50physiques et aussi de vocabulaire et qui sont utilisées pour indexer
04:56la description des documents d'archives conservés par l'institution
04:59ou en indiquer la provenance.
05:05Elle résulte de décennies d'efforts, bien avant l'informatisation,
05:09le grand chantier d'informatisation lancé dans les années 2000.
05:14Avant ce chantier, il existait des fichiers, papiers, d'index,
05:20et des inventaires imprimés, manuscrits ou d'activographiés
05:24qui contenaient déjà des éléments sur ces entités.
05:29Donc, ce sont à la fois des points d'accès aux descriptions
05:32des archives et ils sont de ce fait intimement liés à l'avancement
05:36de ces travaux de description et au contenu des documents
05:39que nous conservons, mais aussi des données qui, au fil de ces décennies,
05:45se sont avancées certes imparfaites et incomplètes, mais aujourd'hui
05:48intéressantes par elles-mêmes.
05:50Si l'on veut être plus précis, les archives nationales étant un opérateur national
05:57dont la principale mission est de collecter, de conserver et de valoriser,
06:02de communiquer les archives des administrations centrales de l'État
06:06des origines à nos jours, dans les données de référence des archives nationales
06:12figurent de façon significative beaucoup de notices sur les services
06:17d'administration centrale du Moyen-Âge à aujourd'hui.
06:22On entend par là les ministères, mais aussi les subdivisions de ces ministères,
06:27les cabinets, les agences nationales.
06:29On y trouve aussi les archives des notaires de Paris,
06:32donc des notices sur les notaires, etc.
06:35On a aussi, parmi les documents que nous conservons, une forte représentation
06:39de documents concernant Paris et l'île de France.
06:42D'abord parce qu'on a les archives des notaires de Paris,
06:44mais pas seulement les archives de juridiction d'ancien régime,
06:48les archives de seigneurie, etc., qui font que nos référentiels
06:53contiennent beaucoup de notices de lieux sur des entités géohistoriques
06:58parisiennes, franciliennes.
07:00À gauche, dans le diagramme, vous voyez en vert, sans entrer dans le détail
07:06des effectifs, qu'on a en fait une majorité de notices qui concernent
07:12des lieux.
07:17Et la partie en bleu, en gamme de bleu, concerne plutôt des personnes
07:22et des collectivités ainsi que des familles.
07:25En orangé ou marron, ça n'est pas comment votre écran le montre,
07:29vous voyez un petit porceau du camembert qui en fait représente
07:34les termes enregistrés dans divers vocabulaires qui ont servi
07:41pour indexer, qui servent pour indexer les archives.
07:45Donc on a en fait un ensemble de données de référence sans équivalent,
07:50même si, encore une fois, elles sont imparfaites et incomplètes.
07:54On y reviendra.
07:55Une des grandes qualités de ces données, c'est que le SI des archives
07:58nationales leur assigne à chaque description un identifiant unique
08:02et persistant.
08:04Par contre, ces données ont différents défauts, des défauts techniques
08:10en premier, avec des formats hétérogènes, dont l'un qui est une DTD,
08:15XML maison, définissant une structure vraiment pauvre,
08:20des fichiers qui sont parfois très lourds à manipuler.
08:24Pour tout ce qui n'est pas une notice de producteur, en fait,
08:27on a de gros fichiers XML qui rendent leur manipulation dans le back-office
08:34qui est si compliqué.
08:38Des notices des personnes et des collectivités qui sont réparties
08:41dans trois référentiels, servant des besoins différents.
08:45Donc on a une partition liée à la fonction de ces référentiels
08:48qui entraînent la présence de doublons.
08:50Et enfin, des vocabulaires à divers niveaux qualitatifs,
08:56certains étant essentiellement des nomenclatures plates,
08:59c'est-à-dire qu'on y trouve des listes de termes.
09:01Alors, il y a quand même quelques exceptions, parmi lesquelles
09:04les vocabulaires des mots-matières, des trucs de documents et des types de supports.
09:09Alors, on pourrait penser que ce sont des fichiers autonomes les uns des autres,
09:14mais en fait, c'est beaucoup plus que ça.
09:18Vous avez à gauche un tableau qui vous donne des éléments statistiques
09:23qui montrent, par exemple, qu'entre les 16 000 notices de producteurs
09:28présents dans l'ESI en janvier 2025, il y avait un nombre très conséquent
09:34de relations.
09:35Des relations pour dire que telle direction, tel bureau appartient à tel ministère,
09:40que telle entité a succédé à tel autre, que telle personne appartient
09:43à telle famille ou que telle personne est associée à une autre.
09:48Donc, on a de fait déjà, quelque part, un graphe sous-jacent des personnes
09:54et des collectivités qui sont liées entre elles.
09:58On a aussi, donc, dans trois vocabulaires, comme je l'ai dit tout à l'heure,
10:01des concepts qui sont hiérarchisés.
10:03On a donc des relations génériques et spécifiques.
10:06Et enfin, certains lieux sont déjà liés à d'autres, au moins de façon implicite.
10:11Par exemple, en lisant certains référentiels, on sait que tel édifice se situe dans telle
10:16commune, même si ce n'est pas exprimé.
10:18Le problème est que le ESI des archives nationales ne permet pas d'exploiter
10:23aujourd'hui ces relations à cause du format dans lequel elles sont stockées,
10:26ni même de les montrer.
10:28Alors, juste rapidement, ici j'ai fait quelques copies d'écran qui vous montrent
10:33la belle exception à cette situation.
10:35Pour les notices de producteurs, on peut interroger les notices.
10:39Elles sont dotées d'un permalien.
10:43On peut interroger, notamment, les fonctions, les noms des agents, leur statut juridique,
10:48quand ce sont des collectivités.
10:50Donc, on a un formulaire de recherche avancée, si tant est qu'on pense à l'utiliser
10:55et qu'on comprenne la notion de producteur dans notre système.
11:00On a accès comme ça à ce réservoir.
11:02Mais par contre, on ne peut pas exploiter les relations.
11:04Par exemple, si je veux savoir quels sont les membres de la famille Bonaparte
11:08que le système d'information connaît, je ne peux pas poser cette question
11:11aujourd'hui dans le système.
11:13La règle générale, c'est que...
11:17Alors, il y a une déformation de l'écran.
11:20J'avoue que je ne sais pas pourquoi.
11:25La règle générale, c'est pour tous les autres référentiels qu'il n'y a pas d'accès direct.
11:30Ici, je vous montre un formulaire de recherche qui permet d'interroger les documents
11:34produits par les notaires de Paris que nous conservons.
11:38On peut interroger par lieu concerné par les documents
11:43et afficher une liste de lieux.
11:45Mais aucun des lieux n'est accessible via une URI.
11:52Il n'y a pas non plus d'API pour accéder à toutes ces données.
11:56Donc, c'est pour pallier ce problème qu'on a commencé à réfléchir.
12:00Le but étant d'essayer, premièrement, de révéler le graphe sous-jacent
12:07en considérant que chaque notice décrit une entité
12:12et en tirant parti de l'existence d'identifiants uniques pour ces notices
12:16pour en faire le segment de base d'URI d'identifiant uniforme de ressources
12:24pour ces entités et en explicitant les relations,
12:27soit qu'elles soient déjà exprimées, soit en travaillant à les expliciter automatiquement.
12:33Pour ce faire, on avait besoin d'un vocabulaire, d'un modèle
12:36et on a choisi un standard international récent qui est Recording Context.
12:40Je vais y revenir.
12:41Et on a choisi également d'utiliser un seul modèle
12:44et un seul cadre technique normalisé
12:46pour passer à quelque chose de beaucoup plus unifié
12:49et former un graphe de connaissances ou graphe sémantique,
12:54graphe de données ouvertes liées au link data.
12:58Plusieurs dénominations existent pour ce type de jeu de données.
13:03Parmi les propriétés intéressantes de tel graphe,
13:06on peut les publier sur le web
13:08et tous ces composants deviennent interrogeables
13:11en utilisant un langage de requête qui s'appelle Sparkle,
13:13qui est aussi un protocole d'accès par ailleurs.
13:16Pour faire cela, on n'avait pas le choix.
13:18Il fallait sortir les données d'USI,
13:21ce qui nous a donné une certaine liberté
13:24et qui nous a permis en même temps d'enrichir ces données,
13:29donc à l'extérieur d'USI,
13:31de données supplémentaires,
13:33la plupart d'entre elles récupérées par alignement
13:35avec d'autres jeux de données.
13:38Du coup, dans Garance, aujourd'hui,
13:39on a un peu plus de 75 000 entités.
13:42Vous avez ici des éléments statistiques globaux.
13:47On vous montrera d'autres statistiques
13:48un peu plus détaillées tout à l'heure.
13:52Et en particulier, parmi les lieux,
13:55on a donc 13 411 voies parisiennes,
13:57ainsi que les communes, départements
13:59et régions administratives françaises,
14:01dotées de coordonnées géographiques
14:02et de bien d'autres choses.
14:04Et tout cela a permis d'en situer un graphe
14:07qui compte aujourd'hui un peu plus de 16 400 000 triplés,
14:11ce qui n'est pas extrêmement lourd,
14:16mais qui quand même déjà commence à être significatif
14:19en termes de taille.
14:24Alors, les bénéfices qui sont déjà atteints
14:26de notre point de vue,
14:28ce sont des données de meilleure qualité
14:29et donc plus facilement accessibles et citables.
14:32Vous allez le voir tout à l'heure
14:34au travers de la démonstration.
14:36Avec un potentiel d'enrichissement important,
14:40on a pu s'affranchir des contraintes techniques
14:42du CIC actuel
14:43et on va continuer à travailler,
14:45enrichir les données.
14:47Les entités ont toutes été dotées d'un URI
14:50qui est déréférençable,
14:52c'est-à-dire que Garance permet
14:54d'accéder à une représentation HTML
14:57de ces entités
14:59quand on est un être humain
15:00et qu'on utilise un navigateur.
15:02et permet aussi d'accéder
15:05aux données RDF décrivant l'entité
15:07quand on est une machine.
15:10L'URI des entités,
15:12c'est très important à noter,
15:14est construit donc à partir de l'identifiant
15:16de la notice dans l'ESI.
15:18Ici, je vous donne quelques exemples
15:20avec un segment qui est toujours le même
15:22au début, suivi du nom
15:24de la classe d'appartenance,
15:27agent, lieu, type de support,
15:30suivi d'un segment qui...
15:33reprend l'entité de la notice
15:36dans l'ESI source,
15:37ce qui permet à tout moment,
15:40en tout cas pour les gens
15:41qui manipulent et gèrent
15:44ces données,
15:45l'équipe du Lab,
15:46de remonter à la source.
15:47et c'est aussi important pour les archivistes,
15:50en particulier pour les archivistes des archives nationales
15:53qui voudraient savoir d'où vient l'information
15:57et faire le pont avec ce qu'ils voient
16:02dans l'ESI et dans le Lab-Office.
16:03On a donc maintenant une page web
16:06d'engarance par agent,
16:08par vocabulaire.
16:10Les chiffres sont téléchargeables.
16:11Et enfin,
16:12et ça on vous le montrera tout à l'heure,
16:13on peut déjà interroger ces données
16:15et même poser des questions
16:16que le SIDZ-ANF n'est absolument pas capable
16:19de prendre en charge actuellement.
16:21On vous en montrera quelques-unes.
16:22Parmi les bénéfices attendus,
16:24il est trop tôt évidemment
16:25pour parler d'usage.
16:27On peut supposer,
16:29on peut imaginer que l'archiviste
16:31travaillant aux archives nationales
16:34ou dans l'écosystème administratif
16:35qui entoure les archives nationales
16:37comme les opérateurs nationaux
16:38ou les ministères
16:39qui versent des archives chez nous,
16:42qu'ils puissent donc facilement
16:44faire une recherche en ligne
16:45ou qu'ils soient sur le web,
16:48sur les référentiels des archives nationales
16:49sans devoir accéder au SI,
16:52sachant que hors du DESAEN,
16:55seuls les archivistes DESAEN
16:56qui ont accès à l'exception
16:59de la mission du ministère de la Culture,
17:01récupérer l'identifiant d'un objet décrit
17:03afin d'utiliser cet identifiant
17:05dans son travail de description.
17:07Ça peut être le cas notamment dans une mission.
17:10Faciliter ensuite la production
17:11d'inventaires riches.
17:14Le professionnel du patrimoine culturel
17:16pourrait également ainsi trouver en ligne
17:18ce que les archives nationales disent
17:20sur une entité donnée.
17:21Nous avons beaucoup d'entités de type agent
17:24qui sont dotées de descriptions
17:25extrêmement riches.
17:26On va vous montrer des exemples tout à l'heure.
17:28Copier l'URI d'un objet
17:30afin de l'utiliser dans les méta-données
17:31qu'il produit,
17:33voire rétablir une relation d'équivalence
17:35entre cet objet et un objet
17:37qui décrit dans son institution,
17:39voire récupérer les données
17:40produites par les ANF
17:41en téléchargement.
17:42Les chercheurs en sciences humaines et sociales
17:45ou data scientists ou engineers
17:47pourraient faire de même,
17:48mais aussi utiliser le Sparkle Service
17:51ou encore utiliser ces URI dans le cadre de projet.
17:56Et enfin, l'amateur.
17:57Nous avons beaucoup d'amateurs
17:58qui viennent consulter notre SI
18:00pour redécouvrir des données de référence.
18:02J'ai déjà cité quelques sous-ensembles de données
18:08qui sont intéressants dans notre campus.
18:11Pour revenir sur les projets de recherche,
18:14il se trouve que ces données RDF
18:16sont déjà utilisées
18:17ou ont déjà été utilisées dans plusieurs projets,
18:20en particulier dans le cadre du projet Oresme
18:22qui s'intéressait aux archives de la Sorbonne,
18:26l'Université de Paris,
18:28depuis sa création au Moyen-Âge
18:30jusqu'au début du XVIe siècle.
18:33Et c'est pour s'étudier
18:35de faire un relevé exhaustif
18:37des documents relatifs au collège
18:39de cette université
18:40et de décrire les personnes et collectivités
18:44à l'œuvre dans l'univers de l'Université de Paris.
18:48Là, je vous montre des copies d'écran
18:50qui sont tirées du portail Oresme,
18:53qui n'est pas encore en ligne,
18:54mais qui le sera bientôt,
18:56où vous voyez un exemple de Graff
18:58qui utilise Dalio Rico
18:59et qui utilise aussi pour décrire un testament
19:04et son support,
19:06en fait, un type de support
19:09qui, dans l'URI,
19:11est l'URI des archives nationales.
19:13Nous avons également prévu d'utiliser
19:16ces référentiels,
19:18et en particulier les référentiels de lieux
19:20et certains vocabulaires.
19:22Nous commençons à le faire actuellement,
19:24nous préparons des données
19:25pour le projet ANR Agap,
19:27qui associe les archives nationales,
19:29plusieurs services,
19:30dont le lab,
19:31et divers labos de recherche
19:34en informatique et en intelligence artificielle,
19:36ainsi qu'un laboratoire de recherche
19:38en histoire,
19:39pour travailler sur le géoréférencement
19:41et la reconnaissance de forme
19:43dans des photographies et vidéos.
19:51Ce projet démarre actuellement.
19:54Alors, ce sont des projets
19:55qui sont liés aux archives nationales.
19:57On espère évidemment que nos référentiels
19:59pourraient être utilisés par des projets
20:02dans lesquels nous ne sommes pas nous-mêmes
20:04par partie prenante.
20:06Alors, le projet s'est déroulé
20:09en plusieurs phases.
20:11Comme on l'a déjà dit,
20:12le travail sur les données
20:13a commencé dès 2021
20:15et il n'est pas terminé.
20:16En fait, le travail sur les données
20:19globalement ne se termine finalement jamais,
20:21en théorie, du moins.
20:22La réflexion sur la mise en place
20:24d'une interface a démarré début 2024.
20:27Nous n'avons pas pu obtenir
20:28de financement du ministère.
20:30Nous avons donc décidé,
20:32avec Thomas Vandeval,
20:33de poursuivre le projet
20:34avec les moyens propres
20:35des archives nationales,
20:36en continuant de produire
20:38les données nous-mêmes
20:40et en confiant la réalisation
20:41de l'interface web,
20:43de l'application web
20:44à la société Sparma
20:45que Thomas Franca représente ici.
20:49Et nous en sommes aujourd'hui
20:50à l'achèvement de la première phase.
20:53Nous allons vous présenter
20:54le site web dans l'état
20:56où il est aujourd'hui.
20:58Nous l'avons déployé
20:59sur le cloud de l'Universaire de la Culture
21:01chez un hébergeur français.
21:03Et nous avons également installé récemment
21:05un triple store.
21:07Après avoir choisi,
21:09on y reviendra,
21:10la base logiciel Clever,
21:12récemment développée en Suisse,
21:14et open source.
21:16Les composants logiciels utilisés
21:19sont open source
21:21et le code source est lui-même ouvert.
21:23Pour la suite de la feuille de route,
21:25on en reparlera tout à l'heure.
21:26on en reparlera tout à l'heure.
Commentaires