← Zurück zur Hauptseite

Epigraphic Latin Treebank

Die erste grosse UD-annotierte Ressource für lateinische Inschriften – eine Human-in-the-Loop-Annotationsplattform für die Computerlinguistik des epigraphischen Lateins.

Was ist die ELTB?

Die Epigraphic Latin Treebank (ELTB) ist ein syntaktisch annotiertes Korpus lateinischer Inschriften im Universal Dependencies (UD)-Format. Sie schliesst eine fundamentale Lücke in der digitalen Altertumswissenschaft: Bislang existiert keine annotierte Ressource, die speziell auf das epigraphische Latein zugeschnitten ist.

Bestehende Treebanks wie die Index Thomisticus Treebank oder PROIEL sind auf literarische und scholastische Texte ausgerichtet. Epigraphisches Latein unterscheidet sich jedoch fundamental: Syntax, Vokabular, der hohe Abkürzungsgrad und die Formularhaftigkeit erfordern eine eigene Spezialisierung.

Methodik

Die ELTB entsteht in einem iterativen Human-in-the-Loop-Verfahren:

  • Vorannotation: NLP-Modelle (LatinCy, GPT-basierte Tagger) liefern automatische Annotationen für POS, Morphologie und syntaktische Abhängigkeiten.
  • Expertenkorrekturen: Fachexpert:innen für Epigraphik und Latein korrigieren und validieren die automatischen Annotationen über die Webplattform.
  • Modellverbesserung: Die korrigierten Daten fliessen zurück in das Training verbesserter Modelle – ein kontinuierlicher Qualitätskreislauf.

⏳ Annotationsplattform im Aufbau

Die ELTB-Annotationsplattform befindet sich derzeit im Aufbau und ist noch nicht öffentlich zugänglich. Sie wird auf dem gleichen Server wie diese Webseite gehostet. Expert:innen werden dort Inschriften aus der EDCS-Datenbank annotieren, Korrekturen vornehmen und den Fortschritt verfolgen können.

Datenformat

Die ELTB folgt dem Universal Dependencies-Standard und enthält für jedes Token:

  • UPOS: Universal Part-of-Speech Tags
  • XPOS: Sprachspezifische POS-Tags
  • Morphologische Features: Kasus, Numerus, Genus, Tempus etc.
  • Syntaktische Relationen: Abhängigkeitsstrukturen (head, deprel)
  • Metadaten: EDCS-ID, Fundort, Datierung, Inschriftentyp

Open Data

Die ELTB wird FAIR-konform publiziert und steht der wissenschaftlichen Gemeinschaft als Open Data zur Verfügung. Die Daten bilden die Grundlage für die KI-Pipeline von Vox Lapidum und ermöglichen zukünftige computerlinguistische Forschung zum epigraphischen Latein.

# CoNLL-U Format – ELTB Beispiel
# sent_id = EDCS-15593
# text = D M Gaius Allius Oriens vixit annis XXXV

1  D(is)       dis       NOUN   Case=Dat|Number=Plur
2  M(anibus)   manes     NOUN   Case=Dat|Number=Plur
3  Gaius       Gaius     PROPN  Case=Nom|Gender=Masc
4  Allius      Allius    PROPN  Case=Nom|Gender=Masc
5  Oriens      Oriens    PROPN  Case=Nom|Gender=Masc
6  vixit       vivo      VERB   Mood=Ind|Tense=Past
7  annis       annus     NOUN   Case=Abl|Number=Plur
8  XXXV        XXXV      NUM    NumType=Card