Plateforme Estrades
ARCHE UMR 3400 (Unistra) / MISHA
Journées des Plateformes Grand Est
Nancy - 10 juillet 2026

Estrades : Solutions de TRanscription, d’Analyse et de Diffusion pour l’Edition Structurée
Codirection ARCHE UMR 3400 (Unistra) / MISHA
- Direction scientifique : Émilie Dosquet (ARCHE UMR 3400)
- Direction administratif : Sébastien Michon (MISHA)
- Direction technique et coordination : Guillaume Porte (ARCHE UMR 3400)
Effectifs
- ARCHE : 0,5 ETP
- MISHA : 0,2 ETP
- BNU : 0,2 ETP
- PUI-A : 0,5 ETP
Dotation 5000€/an (Cortecs)
Périmètre Unistra / UHA / MISHA / BNU + national
Publics ESR / institutions patrimoniales
Labélisations Cortecs / RnMSH (Scripto)
Partenaires PHuN (MISHA) / Lab (BNU)
Réseaux
- RnMSH dont MRSH Caen, MSH Val de Loire, MSH Lorraine…
- Huma-Num dont consortiums Ariane, MASA+, Distam
- Réseau Alsace Humanités Numériques

Objectifs
Côté recherche en SHS
- exploitation de textes (+ ou - anciens)
- transcription (utilisation / ajustement de modèles)
- analyse (fouille de texte, édition scientifique)
- diffusion (web, entrepôts)
Côté ingénierie
- mutualisation des solutions
- éviter l’éparpillement technique
- open source
- science ouverte
Activités
- développements
- aide au montage de projets
- formation
- animation de réseaux
Chaîne éditoriale & single source publishing


Chaîne éditoriale & single source publishing


Chaîne éditoriale & single source publishing


Chaîne éditoriale & single source publishing


Chaîne éditoriale & single source publishing


Chaîne éditoriale & single source publishing


Outils

Méthodes
Automated Text Recognition (OCR/HTR)
OCR : Optical character recognition
HTR : Handwritten text recognition






LLM ?
peu performants sur ce type de corpus, notamment les plus anciens
trop grande variété de mises en page, langues, graphies, etc.
difficulté à identifier précisément des noms de personnes (homonymes, anagrammes, pseudonymes, etc.) et de lieux (modifiés, disparus, etc.)
hallucinations ou mauvaises attributions
meilleures pistes côté RAG
Analyse
“close reading”
- approche plutôt qualitative (corpus restreints)
- analyse fine
- comparaison de variantes textuelles
- indexation précise des entités nommées (NER + identification)
- données fortement structurées
- XML/TEI (Text Encoding Initiative)
- édition web ou pdf/imprimée
“distant reading”
- approche plutôt quantitative (corpus larges)
- fouille de texte
- analyse terminologique
- données “brutes” ou faiblement structurées
Développements
avec la Plateforme Humanités Numériques (MISHA - Alsace)
HECATE : interfaces de visualisation de différents types de données
- chef de projet : Régis Witz (PHuN)
- développeur : Vincent Juillon (financement PUI-A)
- https://gitlab.huma-num.fr/datasphere
s’appuie sur :
- HERA : schéma de description de données
- HEIMDALL : convertisseurs de données
pour Estrades : croisement BDD relationnelles/CSV et textes en XML

Développements
avec BNU Lab
modèle ATR d’après des journaux bilingues FR/DE
- segmentation
- transcription
et évaluation d’un déploiement Grand Est d’eScriptorium avec BNU Lab & Tacteo (projet Collex Persée)

Développements
avec le Pôle Document Numérique (MRSH - Normandie)
participation au développement du logiciel MaX (transformation XML -> HTML)
prestataires CSS : Derek Salmon & Timothée Goguely

Hoplà
Contacts
Réseau Alsace Humanités Numériques
