Passer au playerPasser au contenu principal
  • il y a 1 semaine
Présentation des travaux réalisés par le Lab pour, à partir des fichiers source des référentiels des Archives nationales (des fichiers XML de structure et de contenu variable), construire un unique graphe de connaissances constitué de triplets RDF conformes à l’ontologie Records in Contexts Ontology (RiC-O) dans sa dernière version en date (RiC-O 1.1 ; voir https://www.ica.org/standards/RiC/ontology) et à SKOS (voir https://www.w3.org/2004/02/skos/). Le travail déjà accompli sur les vocabulaires, sur les notices d’agents (notices de producteurs et autres petites notices décrivant des personnes) et sur les notices de lieux (parmi lesquelles un ensemble cohérent de notices sur les lieux de Paris dont plus de 13 000 voies alignées sur la nomenclature des voies parisiennes de la mairie de Paris, et un autre sur les circonscriptions administratives françaises).

Catégorie

📚
Éducation
Transcription
00:05Les données sont elles-mêmes gérées par le Lab des Archives nationales dans un entrepôt Bithub et nous y préparons
00:15actuellement activement une release 2.0.
00:18Une première release avait déjà été publiée en 2022. Le format de ces données, c'est le format RDF XML.
00:27Nous avons choisi ce format parce que nos données sources sont en XML, pour la très grande majorité d'entre
00:33elles, donc à une continuité technique.
00:35Et ces données RDF sont conformes à l'ontologie RICO dans sa dernière version officielle, qui est la version 1
00:44.1 publiée en 2025. Cette ontologie est un standard international.
00:52Dans une recommandation officielle du Conseil international des archives depuis fin 2023, elle est appuyée sur un socle conceptuel solide,
01:01puisqu'elle transpose un modèle conceptuel qui s'appelle RIC Conceptual Model.
01:06Alors pourquoi utiliser cette ontologie alors qu'on a affaire à des agents, des lieux et des concepts ?
01:12Parce que cette ontologie, comme son nom l'indique, Records in Context, les archives dans leur contexte, permet aussi de
01:24décrire justement les agents de façon très fine, ainsi que les relations qui peuvent les connecter entre eux.
01:32Dans le monde des archives, il est important de savoir qui a produit les documents, qui en est l'auteur,
01:40qui a pu échanger dans le cadre de ces activités avec quel autre agent, ce qui induit des échanges documentaires
01:48ou de données.
01:50Quelles activités avec tel ou tel agent ? C'est ce qui permet de comprendre et d'analyser correctement les
01:57archives, de les contextualiser.
01:58Il est également important de savoir quel ressort avec telle juridiction, dans quel territoire telle entité exerçait ses missions, où
02:09telle personne a pu également travailler ou vivre.
02:13Et c'est dans tout cela que RICO modélise également les agents et les lieux en tant qu'entité géo
02:20-historique.
02:21Elle modélise aussi cette ontologie, les catégories auxquelles ces entités appartiennent, leur nom, les activités ou les événements qui les
02:28ont affectés.
02:29Et enfin, elle nous a permis d'utiliser une des classes principales de RICO, qui est la classe Record, objet
02:41informationnel, pour décrire les notices elles-mêmes relatives aux agents.
02:47Donc, en fait, dans les fichiers RDF, vous avez un double de blocs RDF, un bloc qui représente, par exemple,
02:59un agent, et un bloc qui représente la notice descriptive de l'agent,
03:03ce qui nous permet d'établir des métadonnées sur cette notice.
03:09Enfin, nous avons également utilisé SCOS, que beaucoup de gens dans la salle connaissent, qui est le modèle international RDF,
03:18très utilisé partout dans le monde, peut-être surutilisé,
03:22mais pour représenter un RDF notamment des nomenclatures ou des vocabulaires contrôlés, et qui, évidemment, était tout indiqué pour travailler
03:29sur nos vocabulaires.
03:34Alors, sur RIC, je n'ai pas le temps d'aller plus loin, mais si vous ne connaissez pas RIC
03:40et l'anthologie, vous pourriez aller écouter,
03:44enfin, regarder les webinaires organisés par l'ICAA en mars 2025.
03:49Vous pourriez, évidemment, aller chercher sur le site web de l'ICAA la page qui parle de RIC et qui
03:54donne tous les liens utiles.
03:55Bien, nous avons, alors je dis nous parce qu'il se trouve que je suis membre du groupe d'experts
04:01qui pilote RIC depuis 2013, depuis son début,
04:05et j'en suis également la présidente, donc je connais très, très bien RIC, ce qui, évidemment, est un atout
04:10pour le projet.
04:11Nous avons publié fin 2025 un manuel de mise en œuvre.
04:14Une communauté d'intérêts et d'utilisateurs s'est formée avec un groupe de discussion sur Google Groups.
04:21Divers projets sont en cours dans le monde, des ateliers, des formations sont organisés,
04:25et pour le mentionner ici, un groupe de travail dont certains membres sont dans la salle, si je ne le
04:30trompe pas,
04:32travaillent actuellement, activement, à la traduction en français de RIC.
04:38Je voudrais également dire que plusieurs événements devraient avoir lieu en France cet automne pour parler de RIC.
04:43Il se trouve que les archives nationales utilisent RIC depuis longtemps.
04:46On a développé un outil de conversion de données EAD, EACCPF en RDF,
04:53et nous avons également mis en ligne un démonstrateur.
04:56Donc, je ne le présenterai pas parce que nous avons quelques soucis techniques actuellement très simples à corriger.
05:01Il nous faut juste prendre le temps de le faire.
05:04Mais nous avons déjà beaucoup travaillé avec RIC aux archives nationales.
05:09Alors, pour travailler sur les données sources que nous avions,
05:12nous avons en fait trois types de fichiers, les fichiers décrivant des vocabulaires,
05:18les fichiers sur des agents, les fichiers sur des lieux.
05:21Pour ce qui est des vocabulaires, nous avons pris en charge les vocabulaires dont j'ai mis la liste ici,
05:31c'est-à-dire huit vocabulaires, qui nous parlent des activités, des fonctions des agents,
05:41mais aussi des types de documents et des catégories des collectivités,
05:45pour ne citer que ceux qui sont les plus utilisés aujourd'hui.
05:51Ici, je vous montre l'état initial de ces fichiers.
05:54À gauche, vous avez un exemple extrêmement favorable pour la description d'un type de document
06:02qui est le grevet notarié avec une dénomination et une définition.
06:08Ce n'est pas du tout toujours le cas dans ce vocabulaire.
06:12Ce vocabulaire présente aussi une qualité d'être hiérarchique, ce qui est intéressant.
06:20Ici, ce que vous voyez, par exemple, c'est que l'acte notarié a deux termes spécifiques,
06:26acte imparfait et brevet notarié.
06:29Et tout cela est défini.
06:31Vous voyez aussi, alors ça, c'est plutôt un gros problème pour nous, à la base,
06:36qu'il y a la BTD simple, voire simpliste,
06:39et vous avez en fait, en tout et pour tout, un élément DEF
06:43dans lequel vous devez stocker tout ce que vous avez à dire sur le terme.
06:47et ce qui fait qu'on a commencé dans les dernières années aux archives nationales
06:52à utiliser des barres verticales pour séparer les informations selon la nature.
06:58Ici, vous voyez, par exemple, la définition arrive en premier
07:01et après une barre verticale, on a des indications de mise à jour.
07:05Il n'y a pas, en fait, d'éléments spécifiques pour stocker les indications de mise à jour,
07:10de même qu'il n'y a pas d'éléments spécifiques pour stocker des relations d'alignement
07:14ou ce genre de choses. À droite, vous avez un cas beaucoup moins favorable au départ,
07:19c'est-à-dire que nous avons affaire à une nomenclature toute simple et plate,
07:24alors qu'on y trouve des choses comme établissement public administratif,
07:27établissement public scientifique, qui est un type de PA,
07:32et il n'y a pas de définition. Il n'est pas possible techniquement aujourd'hui
07:36d'apporter des définitions dans ce vocabulaire-là,
07:38à cause de sa gestion technique.
07:42Donc, qu'est-ce qu'on a fait ? On a écrit une série de scripts
07:46pour avoir, à partir de ces fichiers sources, à chaque fois un fichier résultat,
07:51à l'exception du fichier des types de documents qui a été découpé en trois vocabulaires.
07:56Chacun des vocabulaires obtenus a été doté de métadonnées riches,
08:00alors que dans les fichiers sources, elles sont très peu présentes.
08:05Chaque notion définie dans le fichier est devenue un concept,
08:09et aussi un type, selon l'ontologie RICO.
08:13Par exemple, les catégories et les statuts juridiques des collectivités
08:17sont à la fois des concepts, et des corporate body types, comme le dit RICO.
08:22Toutes les données ont été conservées, on a essayé de travailler le plus finement possible
08:27pour dégager une structure plus riche, par exemple,
08:32de séparer la définition des notes de mise à jour,
08:36et évidemment de garder la hiérarchie quand elle existait.
08:41Des cas particuliers, le référentiel des statuts juridiques
08:45et celui des fonctions ont été enrichis de données extérieures.
08:49Pour les statuts juridiques, on disposait d'un fichier Word
08:53produit par les archives nationales, mais qui n'avait jamais été,
08:56dont le contenu n'avait jamais été intégré.
08:59On a intégré des définitions dans les statuts juridiques des collectivités,
09:04et pour le vocabulaire des fonctions, on a intégré un travail qui avait commencé
09:09et qui a dû être interrompu pendant le Covid et qu'on n'a jamais pu reprendre,
09:12un travail qui avait associé plusieurs missions d'archives dans les ministères,
09:17le SIAF et les archives nationales, sur les domaines fonctionnels de la justice
09:21et de l'agriculture, ce qui a permis d'intégrer une forme de hiérarchie
09:24et de nouveaux concepts. On a également aligné manuellement
09:28le référentiel des langues sur les concepts de la Library of Congress.
09:33Et voilà ce que cela donne pour les métadonnées du vocabulaire
09:38des types de collectivités. Aucune de ces métadonnées, en fait,
09:41quasiment aucune n'existait jusqu'ici.
09:43Vous avez en particulier des indications sur la source,
09:49les dates de mise à jour, la distribution avec un lien
09:52de téléchargement. Je passe vite.
09:57On a également créé un nouveau vocabulaire ex nihilo.
10:01On n'a pas pu le faire dans le SI.
10:03Ce n'était pas possible d'en ajouter un.
10:07Parce qu'on avait besoin de qualifier les 53 000 lieux
10:10des référentiels de lieux, qu'on allait par ailleurs traiter.
10:15On a donc élaboré un vocabulaire qui compte actuellement 215 concepts.
10:19Pour la plupart d'entre eux, cette fois-ci, dotés de définitions,
10:24hiérarchisés et dotés également de liens d'alignement et d'exemples.
10:30Voilà un exemple de ce que ça donne pour le boulevard.
10:37Vous voyez un petit peu la structure interne du fichier RDF
10:42pour ce concept-là.
10:46Voilà.
10:47Alors, par ailleurs, pour les 3525 concepts que comptent aujourd'hui,
10:52c'est vocabulaire.
10:55Nous avons également généré, à partir des fichiers RDF,
11:00en récupérant absolument toutes les données de ces fichiers,
11:03des fichiers CSV, de façon à permettre à des personnes
11:06qui n'auraient pas envie d'utiliser le RDF,
11:11pas la possibilité de le faire, de manipuler très facilement
11:14le contenu de ces fichiers.
11:16Un fichier CSV, tout le monde est en mesure de l'ouvrir
11:21dans Excel ou dans d'autres outils.
11:24Sur les agences, en passant très vite,
11:27nous avions affaire à, d'une part, le référentiel des producteurs,
11:31dont le format de stockage est un format riche,
11:35finement structuré,
11:38et permettant de produire des notices vraiment riches
11:41avec beaucoup de relations articulées dans notre référentiel.
11:45Il faut aussi noter que, je l'avais déjà écrit,
11:47mais ces notices renvoient au concept des vocabulaires,
11:52parce qu'on indexe les activités des agents,
11:54les fonctions des collectivités,
11:57les lieux, parfois, pour dire que telle personne a travaillé à tel endroit,
12:02ou a vécu, ou telle collectivité a siégé à tel endroit.
12:07Et donc, on avait affaire à des sources finement structurées.
12:12Par contre, d'autres référentiels existaient,
12:15sous la forme de deux gros fichiers,
12:16décrivant à peu près 2600 personnes physiques ou morales,
12:21et servant, eux, par destination exclusivement
12:25à indexer les descriptions des documents,
12:27pour dire, ce document a pour sujet telle personne,
12:30avec une structure beaucoup plus pauvre.
12:31Je vous montre un exemple ici.
12:33Un petit peu comme pour les lieux,
12:36pardon, pour les vocabulaires,
12:38on a, en tout et pour tout,
12:40deux éléments possibles
12:43pour stocker une biographie ou une bibliographie.
12:47Et donc, depuis quelques ans,
12:48on utilise des barres verticales
12:50pour structurer à l'interne
12:52ces éléments dans le back-office du SI,
12:59ce qui, évidemment, demande de les retraiter.
13:02Là, je vous montre un cas relativement favorable.
13:05Vous voyez, en haut, plus haut,
13:07la notice sur Jean-Louis Abot du Boucher
13:09se résume à un nom.
13:12Donc, ce que nous avons fait,
13:14nous avons mis en place deux workflows différents,
13:15puisque nous avions deux types de fichiers.
13:18Pour les notices producteurs,
13:20on a évidemment utilisé RicoConverter
13:22qui avait été fait
13:23pour pouvoir convertir des fichiers
13:25EACCPF en Rico.1.1.
13:27Pour les autres notices,
13:29on a utilisé des scripts écrits par nous-mêmes.
13:32Et ensuite, nous avons dû réconcilier
13:37les notices obtenues
13:39parce qu'à cause d'une logique un peu silotée,
13:49les référentiels d'indexation
13:51contenaient des notices de personnes
13:52ou de collectivités également décrites
13:54dans le référentiel des producteurs.
13:56On a fait deux campagnes de réconciliation
13:58et finalement, aujourd'hui,
14:01on a des doublonnées de 155 agents.
14:05En gardant dans ces cas-là
14:07les données RDF issues du référentiel des producteurs,
14:10on a choisi cette notice
14:11comme principale notice,
14:13mais on leur a ajouté l'identifiant
14:14de la notice supprimée
14:18identifiant issu du référentiel d'annexation.
14:22Voilà un exemple.
14:24Je vais passer vite
14:25parce que je ne suis pas sûre
14:26que la plupart d'entre vous
14:28connaissent bien RDF,
14:31mais ces notices sont téléchargeables
14:35dans le format RDF
14:37depuis Garance.
14:39Voilà des données statistiques générales.
14:42On vous montrera d'autres statistiques tout à l'heure.
14:44Encore une fois,
14:45il y a une forte représentation
14:46parmi les collectivités
14:47des services d'administration central de l'État.
14:50ou d'organismes du Moyen Âge.
14:56Une autre chose qu'on a faite après,
14:58c'est ajouter des relations d'équivalence
15:00avec des agents décrits
15:02dans d'autres référentiels.
15:04La plupart de ces relations
15:05ont pu être intégrées au fichier RDF
15:08en partant de fichiers produits
15:10dans le cas d'un atelier
15:12en décembre 2025
15:13par des collègues des archives nationales.
15:16Nous avons des relations étroites
15:19avec Wikimédia
15:20et dans ces cas-là,
15:21nous organisons assez souvent
15:23des petits datatons
15:25ou des ateliers internes.
15:26C'est ce qui nous a permis
15:27de récupérer des relations d'alignement
15:28en nombre non négligeable aujourd'hui.
15:31Les données sur les agents
15:33sont disponibles dans les formats RDF
15:35et EACCPF
15:35lorsque ce format existe,
15:37ainsi que sous la forme de listes.
15:39mais ces listes ne donnent pas
15:41le contenu complet des fichiers.
15:43J'insiste, ce ne sont que des listes.
15:47Pour les lieux, je vais aller encore plus vite,
15:50sachant qu'il faudrait deux heures,
15:52parce qu'on a énormément travaillé sur les lieux.
15:55En termes de quantité,
15:57c'était les entités les plus représentées,
15:59c'était aussi le travail le plus complexe à faire.
16:02Nous avions plusieurs fichiers XML,
16:04dont un très volumineux fichier
16:06de 15 méga octets
16:07pour tous les lieux dits hors Paris.
16:10C'est la construction administrative française,
16:12mais pas seulement.
16:14Des structures de données très peu élaborées,
16:17pas de lien entre, par exemple,
16:19les édifices et les rues
16:22ou les arrondissements ou quartiers
16:24dans lesquels ces édifices se situent.
16:26Des hiérarchies entre ces constructions administratives
16:29qui ne sont pas exprimées réellement,
16:31mais juste déductibles.
16:32Des données relativement complètes,
16:35sans historique en général
16:36et sans coordonnées géographiques.
16:39Voilà des exemples.
16:41En haut, un exemple intéressant,
16:44parce qu'on l'a enrichi récemment
16:47sur un édifice en Charente maritime,
16:51avec toujours la même logique.
16:54Un seul élément pour stocker tout
16:56et des barres verticales
16:57pour séparer certains types d'informations.
17:00à droite, enfin en gauche,
17:03une notice sur une commune
17:04avec tout de même assez peu d'informations,
17:07même si elle donne des indications importantes
17:11sur la localisation de la commune.
17:14Des exemples de Paris.
17:16Le boulevard Aspa est représenté
17:18par une dénomination et une information
17:22qui nous dit que la rue existe aujourd'hui,
17:25essentiellement.
17:26et pour le référentiel des arrondissements,
17:28nous avons juste le nom.
17:31Alors, on a plusieurs workflows
17:33qui nous ont permis de traiter ces fichiers.
17:36Pour ce qui est de ces conceptions administratives françaises,
17:39nous avons pu travailler
17:42avec les données RDF de l'INSEE en 2021,
17:45et également avec un jeu de données RDF fourni par l'IGN
17:49que je remercie au passage.
17:51Je ne sais pas si Nathalie Abadier est dans la salle,
17:53mais elle nous a fourni des données importantes pour nous.
17:57Ça nous a permis de récupérer des historiques
17:59en interrogeant via Sparkle les données RDF de l'INSEE,
18:04des indications d'adjacence entre communes
18:07ou en départements et régions
18:09à partir des données hygiènes
18:10et des coordonnées géographiques.
18:12Pour les autres lieux situés hors de Paris,
18:17on a créé des scripts d'XSCP spécifiques.
18:21Pour les lieux dans Paris,
18:23pareil, des scripts spécifiques
18:25avec une intégration parfois manuelle
18:27de données supplémentaires,
18:28notamment pour les arrondissements,
18:30les quartiers, les édifices parisiens.
18:32Et enfin, pour les voies de Paris,
18:33on a un chantier spécifique
18:35qui nous a occupé un nombre de mois conséquent
18:39et qui n'est pas tout à fait terminé,
18:41qui a consisté en fait à travailler,
18:45à réconcilier la nomenclature
18:47des archives nationales,
18:4813 189 voix tout de même,
18:51avec celle de la mairie de Paris,
18:55publiée sous la forme du jeu de données de 2023,
18:58publiée en open data.
19:00Un travail de réconciliation
19:01qui s'est fait en plusieurs étapes
19:03avec plusieurs itérations,
19:05avec des difficultés importantes,
19:07parmi lesquelles des graphies
19:08dans les noms divergentes
19:10et surtout plus de 670 noms communs
19:14à au moins deux voies,
19:15parfois même beaucoup plus que deux voies,
19:17ce qui nous a obligés
19:20à gérer plusieurs notices
19:21pour plusieurs rues différentes
19:22à partir du même nom.
19:24Un travail de modélisation
19:25qui nous a également pas mal pris de temps
19:29pour choisir dans Ripo
19:30ce qui nous était utile
19:32et qui nous a aussi conduit
19:34à créer une petite extension de l'anthologie
19:36pour par exemple dire
19:38telle rue traverse ou traverser tel quartier,
19:41telle rue commencer à tel point dans une autre rue,
19:45chose qui ne sont pas présentes dans Ripo
19:47parce que c'est trop générique.
19:50Et enfin, nous avons évidemment produit
19:52les fichiers RDF automatiquement.
19:55Alors, cela donne aujourd'hui,
19:57pour l'instant, 53 713 lieux.
20:02Tous sont décrits en utilisant
20:04le vocabulaire des types de lieux.
20:05Ça a aussi été un chantier conséquent
20:07de catégoriser toutes ces entités
20:10qui ne l'étaient pas.
20:12Toutes les dénominations de ces lieux
20:14ont été rendues conformes
20:16aux préconisations énoncées récemment
20:18par les règles de catalogage françaises RDA.
20:23Pour les voies de Paris,
20:24un petit focus,
20:2593 % des voies du référentiel
20:28des archives nationales
20:29sont aujourd'hui réconciliées
20:30avec celles de la mairie de Paris.
20:32Mais il y a encore une marge de progression
20:35et un peu plus de 6 000 de ces voies,
20:38donc plus de la moitié,
20:39ont des coordonnées géographiques
20:41sous la forme de polygones
20:42représentant l'emprise actuelle de la voie.
20:44Et les doutiers RDF obtenus
20:46sont beaucoup plus riches
20:47que les données initiales.
20:48Bref, un travail conséquent
20:51qui ne fait que commencer,
20:53qui a eu beaucoup de perspectives.

Recommandations