Plateforme Estrades

ARCHE UMR 3400 (Unistra) / MISHA

Journées des Plateformes Grand Est

Nancy - 10 juillet 2026

logos

CC BY

Estrades : Solutions de TRanscription, d’Analyse et de Diffusion pour l’Edition Structurée

Codirection ARCHE UMR 3400 (Unistra) / MISHA

  • Direction scientifique : Émilie Dosquet (ARCHE UMR 3400)
  • Direction administratif : Sébastien Michon (MISHA)
  • Direction technique et coordination : Guillaume Porte (ARCHE UMR 3400)

Effectifs

  • ARCHE : 0,5 ETP
  • MISHA : 0,2 ETP
  • BNU : 0,2 ETP
  • PUI-A : 0,5 ETP

Dotation 5000€/an (Cortecs)

Périmètre Unistra / UHA / MISHA / BNU + national

Publics ESR / institutions patrimoniales

Labélisations Cortecs / RnMSH (Scripto)

Partenaires PHuN (MISHA) / Lab (BNU)

Réseaux

  • RnMSH dont MRSH Caen, MSH Val de Loire, MSH Lorraine…
  • Huma-Num dont consortiums Ariane, MASA+, Distam
  • Réseau Alsace Humanités Numériques
CC BY

edition numerique

CC BY

Objectifs

Côté recherche en SHS

  • exploitation de textes (+ ou - anciens)
    • transcription (utilisation / ajustement de modèles)
    • analyse (fouille de texte, édition scientifique)
    • diffusion (web, entrepôts)

Côté ingénierie

  • mutualisation des solutions
  • éviter l’éparpillement technique
  • open source
  • science ouverte

Activités

  • développements
  • aide au montage de projets
  • formation
  • animation de réseaux
CC BY

Chaîne éditoriale & single source publishing

workflow

bibfr

CC BY

Chaîne éditoriale & single source publishing

workflow

bibfr

CC BY

Chaîne éditoriale & single source publishing

workflow

bibfr graph

CC BY

Chaîne éditoriale & single source publishing

workflow

bibfr carte

CC BY

Chaîne éditoriale & single source publishing

workflow

bibfr recherche

CC BY

Chaîne éditoriale & single source publishing

workflow

bibfr donnee

CC BY

Outils

workflow

CC BY

Méthodes

Automated Text Recognition (OCR/HTR)

OCR : Optical character recognition

HTR : Handwritten text recognition

htr

CC BY

AMCBB52

chiknowpo

courrier67

CC BY

escriptorium exemple

CC BY

escriptorium exemple

CC BY

LLM ?

  • peu performants sur ce type de corpus, notamment les plus anciens

  • trop grande variété de mises en page, langues, graphies, etc.

  • difficulté à identifier précisément des noms de personnes (homonymes, anagrammes, pseudonymes, etc.) et de lieux (modifiés, disparus, etc.)

  • hallucinations ou mauvaises attributions

  • meilleures pistes côté RAG

CC BY

Analyse

“close reading”

  • approche plutôt qualitative (corpus restreints)
  • analyse fine
    • comparaison de variantes textuelles
    • indexation précise des entités nommées (NER + identification)
  • données fortement structurées
  • XML/TEI (Text Encoding Initiative)
  • édition web ou pdf/imprimée

“distant reading”

  • approche plutôt quantitative (corpus larges)
  • fouille de texte
    • analyse terminologique
  • données “brutes” ou faiblement structurées
CC BY

Développements

avec la Plateforme Humanités Numériques (MISHA - Alsace)

HECATE : interfaces de visualisation de différents types de données

s’appuie sur :

  • HERA : schéma de description de données
  • HEIMDALL : convertisseurs de données

pour Estrades : croisement BDD relationnelles/CSV et textes en XML

escriptorium exemple

escriptorium exemple

CC BY

Développements

avec BNU Lab

modèle ATR d’après des journaux bilingues FR/DE

  • segmentation
  • transcription

et évaluation d’un déploiement Grand Est d’eScriptorium avec BNU Lab & Tacteo (projet Collex Persée)

kurrier

CC BY

Développements

avec le Pôle Document Numérique (MRSH - Normandie)

participation au développement du logiciel MaX (transformation XML -> HTML)

prestataires CSS : Derek Salmon & Timothée Goguely

max

CC BY

Hoplà

Contacts

https://estrades.huma-num.fr

estrades@misha.fr


Réseau Alsace Humanités Numériques

alhn@groupes.renater.fr

logos

CC BY