00:05Les données sont elles-mêmes gérées par le Lab des Archives nationales dans un entrepôt Bithub et nous y préparons
00:15actuellement activement une release 2.0.
00:18Une première release avait déjà été publiée en 2022. Le format de ces données, c'est le format RDF XML.
00:27Nous avons choisi ce format parce que nos données sources sont en XML, pour la très grande majorité d'entre
00:33elles, donc à une continuité technique.
00:35Et ces données RDF sont conformes à l'ontologie RICO dans sa dernière version officielle, qui est la version 1
00:44.1 publiée en 2025. Cette ontologie est un standard international.
00:52Dans une recommandation officielle du Conseil international des archives depuis fin 2023, elle est appuyée sur un socle conceptuel solide,
01:01puisqu'elle transpose un modèle conceptuel qui s'appelle RIC Conceptual Model.
01:06Alors pourquoi utiliser cette ontologie alors qu'on a affaire à des agents, des lieux et des concepts ?
01:12Parce que cette ontologie, comme son nom l'indique, Records in Context, les archives dans leur contexte, permet aussi de
01:24décrire justement les agents de façon très fine, ainsi que les relations qui peuvent les connecter entre eux.
01:32Dans le monde des archives, il est important de savoir qui a produit les documents, qui en est l'auteur,
01:40qui a pu échanger dans le cadre de ces activités avec quel autre agent, ce qui induit des échanges documentaires
01:48ou de données.
01:50Quelles activités avec tel ou tel agent ? C'est ce qui permet de comprendre et d'analyser correctement les
01:57archives, de les contextualiser.
01:58Il est également important de savoir quel ressort avec telle juridiction, dans quel territoire telle entité exerçait ses missions, où
02:09telle personne a pu également travailler ou vivre.
02:13Et c'est dans tout cela que RICO modélise également les agents et les lieux en tant qu'entité géo
02:20-historique.
02:21Elle modélise aussi cette ontologie, les catégories auxquelles ces entités appartiennent, leur nom, les activités ou les événements qui les
02:28ont affectés.
02:29Et enfin, elle nous a permis d'utiliser une des classes principales de RICO, qui est la classe Record, objet
02:41informationnel, pour décrire les notices elles-mêmes relatives aux agents.
02:47Donc, en fait, dans les fichiers RDF, vous avez un double de blocs RDF, un bloc qui représente, par exemple,
02:59un agent, et un bloc qui représente la notice descriptive de l'agent,
03:03ce qui nous permet d'établir des métadonnées sur cette notice.
03:09Enfin, nous avons également utilisé SCOS, que beaucoup de gens dans la salle connaissent, qui est le modèle international RDF,
03:18très utilisé partout dans le monde, peut-être surutilisé,
03:22mais pour représenter un RDF notamment des nomenclatures ou des vocabulaires contrôlés, et qui, évidemment, était tout indiqué pour travailler
03:29sur nos vocabulaires.
03:34Alors, sur RIC, je n'ai pas le temps d'aller plus loin, mais si vous ne connaissez pas RIC
03:40et l'anthologie, vous pourriez aller écouter,
03:44enfin, regarder les webinaires organisés par l'ICAA en mars 2025.
03:49Vous pourriez, évidemment, aller chercher sur le site web de l'ICAA la page qui parle de RIC et qui
03:54donne tous les liens utiles.
03:55Bien, nous avons, alors je dis nous parce qu'il se trouve que je suis membre du groupe d'experts
04:01qui pilote RIC depuis 2013, depuis son début,
04:05et j'en suis également la présidente, donc je connais très, très bien RIC, ce qui, évidemment, est un atout
04:10pour le projet.
04:11Nous avons publié fin 2025 un manuel de mise en œuvre.
04:14Une communauté d'intérêts et d'utilisateurs s'est formée avec un groupe de discussion sur Google Groups.
04:21Divers projets sont en cours dans le monde, des ateliers, des formations sont organisés,
04:25et pour le mentionner ici, un groupe de travail dont certains membres sont dans la salle, si je ne le
04:30trompe pas,
04:32travaillent actuellement, activement, à la traduction en français de RIC.
04:38Je voudrais également dire que plusieurs événements devraient avoir lieu en France cet automne pour parler de RIC.
04:43Il se trouve que les archives nationales utilisent RIC depuis longtemps.
04:46On a développé un outil de conversion de données EAD, EACCPF en RDF,
04:53et nous avons également mis en ligne un démonstrateur.
04:56Donc, je ne le présenterai pas parce que nous avons quelques soucis techniques actuellement très simples à corriger.
05:01Il nous faut juste prendre le temps de le faire.
05:04Mais nous avons déjà beaucoup travaillé avec RIC aux archives nationales.
05:09Alors, pour travailler sur les données sources que nous avions,
05:12nous avons en fait trois types de fichiers, les fichiers décrivant des vocabulaires,
05:18les fichiers sur des agents, les fichiers sur des lieux.
05:21Pour ce qui est des vocabulaires, nous avons pris en charge les vocabulaires dont j'ai mis la liste ici,
05:31c'est-à-dire huit vocabulaires, qui nous parlent des activités, des fonctions des agents,
05:41mais aussi des types de documents et des catégories des collectivités,
05:45pour ne citer que ceux qui sont les plus utilisés aujourd'hui.
05:51Ici, je vous montre l'état initial de ces fichiers.
05:54À gauche, vous avez un exemple extrêmement favorable pour la description d'un type de document
06:02qui est le grevet notarié avec une dénomination et une définition.
06:08Ce n'est pas du tout toujours le cas dans ce vocabulaire.
06:12Ce vocabulaire présente aussi une qualité d'être hiérarchique, ce qui est intéressant.
06:20Ici, ce que vous voyez, par exemple, c'est que l'acte notarié a deux termes spécifiques,
06:26acte imparfait et brevet notarié.
06:29Et tout cela est défini.
06:31Vous voyez aussi, alors ça, c'est plutôt un gros problème pour nous, à la base,
06:36qu'il y a la BTD simple, voire simpliste,
06:39et vous avez en fait, en tout et pour tout, un élément DEF
06:43dans lequel vous devez stocker tout ce que vous avez à dire sur le terme.
06:47et ce qui fait qu'on a commencé dans les dernières années aux archives nationales
06:52à utiliser des barres verticales pour séparer les informations selon la nature.
06:58Ici, vous voyez, par exemple, la définition arrive en premier
07:01et après une barre verticale, on a des indications de mise à jour.
07:05Il n'y a pas, en fait, d'éléments spécifiques pour stocker les indications de mise à jour,
07:10de même qu'il n'y a pas d'éléments spécifiques pour stocker des relations d'alignement
07:14ou ce genre de choses. À droite, vous avez un cas beaucoup moins favorable au départ,
07:19c'est-à-dire que nous avons affaire à une nomenclature toute simple et plate,
07:24alors qu'on y trouve des choses comme établissement public administratif,
07:27établissement public scientifique, qui est un type de PA,
07:32et il n'y a pas de définition. Il n'est pas possible techniquement aujourd'hui
07:36d'apporter des définitions dans ce vocabulaire-là,
07:38à cause de sa gestion technique.
07:42Donc, qu'est-ce qu'on a fait ? On a écrit une série de scripts
07:46pour avoir, à partir de ces fichiers sources, à chaque fois un fichier résultat,
07:51à l'exception du fichier des types de documents qui a été découpé en trois vocabulaires.
07:56Chacun des vocabulaires obtenus a été doté de métadonnées riches,
08:00alors que dans les fichiers sources, elles sont très peu présentes.
08:05Chaque notion définie dans le fichier est devenue un concept,
08:09et aussi un type, selon l'ontologie RICO.
08:13Par exemple, les catégories et les statuts juridiques des collectivités
08:17sont à la fois des concepts, et des corporate body types, comme le dit RICO.
08:22Toutes les données ont été conservées, on a essayé de travailler le plus finement possible
08:27pour dégager une structure plus riche, par exemple,
08:32de séparer la définition des notes de mise à jour,
08:36et évidemment de garder la hiérarchie quand elle existait.
08:41Des cas particuliers, le référentiel des statuts juridiques
08:45et celui des fonctions ont été enrichis de données extérieures.
08:49Pour les statuts juridiques, on disposait d'un fichier Word
08:53produit par les archives nationales, mais qui n'avait jamais été,
08:56dont le contenu n'avait jamais été intégré.
08:59On a intégré des définitions dans les statuts juridiques des collectivités,
09:04et pour le vocabulaire des fonctions, on a intégré un travail qui avait commencé
09:09et qui a dû être interrompu pendant le Covid et qu'on n'a jamais pu reprendre,
09:12un travail qui avait associé plusieurs missions d'archives dans les ministères,
09:17le SIAF et les archives nationales, sur les domaines fonctionnels de la justice
09:21et de l'agriculture, ce qui a permis d'intégrer une forme de hiérarchie
09:24et de nouveaux concepts. On a également aligné manuellement
09:28le référentiel des langues sur les concepts de la Library of Congress.
09:33Et voilà ce que cela donne pour les métadonnées du vocabulaire
09:38des types de collectivités. Aucune de ces métadonnées, en fait,
09:41quasiment aucune n'existait jusqu'ici.
09:43Vous avez en particulier des indications sur la source,
09:49les dates de mise à jour, la distribution avec un lien
09:52de téléchargement. Je passe vite.
09:57On a également créé un nouveau vocabulaire ex nihilo.
10:01On n'a pas pu le faire dans le SI.
10:03Ce n'était pas possible d'en ajouter un.
10:07Parce qu'on avait besoin de qualifier les 53 000 lieux
10:10des référentiels de lieux, qu'on allait par ailleurs traiter.
10:15On a donc élaboré un vocabulaire qui compte actuellement 215 concepts.
10:19Pour la plupart d'entre eux, cette fois-ci, dotés de définitions,
10:24hiérarchisés et dotés également de liens d'alignement et d'exemples.
10:30Voilà un exemple de ce que ça donne pour le boulevard.
10:37Vous voyez un petit peu la structure interne du fichier RDF
10:42pour ce concept-là.
10:46Voilà.
10:47Alors, par ailleurs, pour les 3525 concepts que comptent aujourd'hui,
10:52c'est vocabulaire.
10:55Nous avons également généré, à partir des fichiers RDF,
11:00en récupérant absolument toutes les données de ces fichiers,
11:03des fichiers CSV, de façon à permettre à des personnes
11:06qui n'auraient pas envie d'utiliser le RDF,
11:11pas la possibilité de le faire, de manipuler très facilement
11:14le contenu de ces fichiers.
11:16Un fichier CSV, tout le monde est en mesure de l'ouvrir
11:21dans Excel ou dans d'autres outils.
11:24Sur les agences, en passant très vite,
11:27nous avions affaire à, d'une part, le référentiel des producteurs,
11:31dont le format de stockage est un format riche,
11:35finement structuré,
11:38et permettant de produire des notices vraiment riches
11:41avec beaucoup de relations articulées dans notre référentiel.
11:45Il faut aussi noter que, je l'avais déjà écrit,
11:47mais ces notices renvoient au concept des vocabulaires,
11:52parce qu'on indexe les activités des agents,
11:54les fonctions des collectivités,
11:57les lieux, parfois, pour dire que telle personne a travaillé à tel endroit,
12:02ou a vécu, ou telle collectivité a siégé à tel endroit.
12:07Et donc, on avait affaire à des sources finement structurées.
12:12Par contre, d'autres référentiels existaient,
12:15sous la forme de deux gros fichiers,
12:16décrivant à peu près 2600 personnes physiques ou morales,
12:21et servant, eux, par destination exclusivement
12:25à indexer les descriptions des documents,
12:27pour dire, ce document a pour sujet telle personne,
12:30avec une structure beaucoup plus pauvre.
12:31Je vous montre un exemple ici.
12:33Un petit peu comme pour les lieux,
12:36pardon, pour les vocabulaires,
12:38on a, en tout et pour tout,
12:40deux éléments possibles
12:43pour stocker une biographie ou une bibliographie.
12:47Et donc, depuis quelques ans,
12:48on utilise des barres verticales
12:50pour structurer à l'interne
12:52ces éléments dans le back-office du SI,
12:59ce qui, évidemment, demande de les retraiter.
13:02Là, je vous montre un cas relativement favorable.
13:05Vous voyez, en haut, plus haut,
13:07la notice sur Jean-Louis Abot du Boucher
13:09se résume à un nom.
13:12Donc, ce que nous avons fait,
13:14nous avons mis en place deux workflows différents,
13:15puisque nous avions deux types de fichiers.
13:18Pour les notices producteurs,
13:20on a évidemment utilisé RicoConverter
13:22qui avait été fait
13:23pour pouvoir convertir des fichiers
13:25EACCPF en Rico.1.1.
13:27Pour les autres notices,
13:29on a utilisé des scripts écrits par nous-mêmes.
13:32Et ensuite, nous avons dû réconcilier
13:37les notices obtenues
13:39parce qu'à cause d'une logique un peu silotée,
13:49les référentiels d'indexation
13:51contenaient des notices de personnes
13:52ou de collectivités également décrites
13:54dans le référentiel des producteurs.
13:56On a fait deux campagnes de réconciliation
13:58et finalement, aujourd'hui,
14:01on a des doublonnées de 155 agents.
14:05En gardant dans ces cas-là
14:07les données RDF issues du référentiel des producteurs,
14:10on a choisi cette notice
14:11comme principale notice,
14:13mais on leur a ajouté l'identifiant
14:14de la notice supprimée
14:18identifiant issu du référentiel d'annexation.
14:22Voilà un exemple.
14:24Je vais passer vite
14:25parce que je ne suis pas sûre
14:26que la plupart d'entre vous
14:28connaissent bien RDF,
14:31mais ces notices sont téléchargeables
14:35dans le format RDF
14:37depuis Garance.
14:39Voilà des données statistiques générales.
14:42On vous montrera d'autres statistiques tout à l'heure.
14:44Encore une fois,
14:45il y a une forte représentation
14:46parmi les collectivités
14:47des services d'administration central de l'État.
14:50ou d'organismes du Moyen Âge.
14:56Une autre chose qu'on a faite après,
14:58c'est ajouter des relations d'équivalence
15:00avec des agents décrits
15:02dans d'autres référentiels.
15:04La plupart de ces relations
15:05ont pu être intégrées au fichier RDF
15:08en partant de fichiers produits
15:10dans le cas d'un atelier
15:12en décembre 2025
15:13par des collègues des archives nationales.
15:16Nous avons des relations étroites
15:19avec Wikimédia
15:20et dans ces cas-là,
15:21nous organisons assez souvent
15:23des petits datatons
15:25ou des ateliers internes.
15:26C'est ce qui nous a permis
15:27de récupérer des relations d'alignement
15:28en nombre non négligeable aujourd'hui.
15:31Les données sur les agents
15:33sont disponibles dans les formats RDF
15:35et EACCPF
15:35lorsque ce format existe,
15:37ainsi que sous la forme de listes.
15:39mais ces listes ne donnent pas
15:41le contenu complet des fichiers.
15:43J'insiste, ce ne sont que des listes.
15:47Pour les lieux, je vais aller encore plus vite,
15:50sachant qu'il faudrait deux heures,
15:52parce qu'on a énormément travaillé sur les lieux.
15:55En termes de quantité,
15:57c'était les entités les plus représentées,
15:59c'était aussi le travail le plus complexe à faire.
16:02Nous avions plusieurs fichiers XML,
16:04dont un très volumineux fichier
16:06de 15 méga octets
16:07pour tous les lieux dits hors Paris.
16:10C'est la construction administrative française,
16:12mais pas seulement.
16:14Des structures de données très peu élaborées,
16:17pas de lien entre, par exemple,
16:19les édifices et les rues
16:22ou les arrondissements ou quartiers
16:24dans lesquels ces édifices se situent.
16:26Des hiérarchies entre ces constructions administratives
16:29qui ne sont pas exprimées réellement,
16:31mais juste déductibles.
16:32Des données relativement complètes,
16:35sans historique en général
16:36et sans coordonnées géographiques.
16:39Voilà des exemples.
16:41En haut, un exemple intéressant,
16:44parce qu'on l'a enrichi récemment
16:47sur un édifice en Charente maritime,
16:51avec toujours la même logique.
16:54Un seul élément pour stocker tout
16:56et des barres verticales
16:57pour séparer certains types d'informations.
17:00à droite, enfin en gauche,
17:03une notice sur une commune
17:04avec tout de même assez peu d'informations,
17:07même si elle donne des indications importantes
17:11sur la localisation de la commune.
17:14Des exemples de Paris.
17:16Le boulevard Aspa est représenté
17:18par une dénomination et une information
17:22qui nous dit que la rue existe aujourd'hui,
17:25essentiellement.
17:26et pour le référentiel des arrondissements,
17:28nous avons juste le nom.
17:31Alors, on a plusieurs workflows
17:33qui nous ont permis de traiter ces fichiers.
17:36Pour ce qui est de ces conceptions administratives françaises,
17:39nous avons pu travailler
17:42avec les données RDF de l'INSEE en 2021,
17:45et également avec un jeu de données RDF fourni par l'IGN
17:49que je remercie au passage.
17:51Je ne sais pas si Nathalie Abadier est dans la salle,
17:53mais elle nous a fourni des données importantes pour nous.
17:57Ça nous a permis de récupérer des historiques
17:59en interrogeant via Sparkle les données RDF de l'INSEE,
18:04des indications d'adjacence entre communes
18:07ou en départements et régions
18:09à partir des données hygiènes
18:10et des coordonnées géographiques.
18:12Pour les autres lieux situés hors de Paris,
18:17on a créé des scripts d'XSCP spécifiques.
18:21Pour les lieux dans Paris,
18:23pareil, des scripts spécifiques
18:25avec une intégration parfois manuelle
18:27de données supplémentaires,
18:28notamment pour les arrondissements,
18:30les quartiers, les édifices parisiens.
18:32Et enfin, pour les voies de Paris,
18:33on a un chantier spécifique
18:35qui nous a occupé un nombre de mois conséquent
18:39et qui n'est pas tout à fait terminé,
18:41qui a consisté en fait à travailler,
18:45à réconcilier la nomenclature
18:47des archives nationales,
18:4813 189 voix tout de même,
18:51avec celle de la mairie de Paris,
18:55publiée sous la forme du jeu de données de 2023,
18:58publiée en open data.
19:00Un travail de réconciliation
19:01qui s'est fait en plusieurs étapes
19:03avec plusieurs itérations,
19:05avec des difficultés importantes,
19:07parmi lesquelles des graphies
19:08dans les noms divergentes
19:10et surtout plus de 670 noms communs
19:14à au moins deux voies,
19:15parfois même beaucoup plus que deux voies,
19:17ce qui nous a obligés
19:20à gérer plusieurs notices
19:21pour plusieurs rues différentes
19:22à partir du même nom.
19:24Un travail de modélisation
19:25qui nous a également pas mal pris de temps
19:29pour choisir dans Ripo
19:30ce qui nous était utile
19:32et qui nous a aussi conduit
19:34à créer une petite extension de l'anthologie
19:36pour par exemple dire
19:38telle rue traverse ou traverser tel quartier,
19:41telle rue commencer à tel point dans une autre rue,
19:45chose qui ne sont pas présentes dans Ripo
19:47parce que c'est trop générique.
19:50Et enfin, nous avons évidemment produit
19:52les fichiers RDF automatiquement.
19:55Alors, cela donne aujourd'hui,
19:57pour l'instant, 53 713 lieux.
20:02Tous sont décrits en utilisant
20:04le vocabulaire des types de lieux.
20:05Ça a aussi été un chantier conséquent
20:07de catégoriser toutes ces entités
20:10qui ne l'étaient pas.
20:12Toutes les dénominations de ces lieux
20:14ont été rendues conformes
20:16aux préconisations énoncées récemment
20:18par les règles de catalogage françaises RDA.
20:23Pour les voies de Paris,
20:24un petit focus,
20:2593 % des voies du référentiel
20:28des archives nationales
20:29sont aujourd'hui réconciliées
20:30avec celles de la mairie de Paris.
20:32Mais il y a encore une marge de progression
20:35et un peu plus de 6 000 de ces voies,
20:38donc plus de la moitié,
20:39ont des coordonnées géographiques
20:41sous la forme de polygones
20:42représentant l'emprise actuelle de la voie.
20:44Et les doutiers RDF obtenus
20:46sont beaucoup plus riches
20:47que les données initiales.
20:48Bref, un travail conséquent
20:51qui ne fait que commencer,
20:53qui a eu beaucoup de perspectives.