UD_French-ECALM
La ressource UD_French-ECALM propose la ressource E-CALM dans une version "traduite" en orthographe strandard et mise au format conll-u.
Ce format permet de proposer une ressource enrichie d'informations contextuelles (méta-données) et d'une diversité d'annotations. Les annotations proposées sont de deux types:
- Annotations automatiques des parties du discours et relations syntaxiques réalisé par l'outil Stanza
- Annotations manuelles des traces manuscrites (ratures, inserts), des écarts à l'orthographe standard et des continuités référentielles liées aux personnages de la consigne.
Les méta-données sont encodées en en-tête de chaque phrase (lignes commençant par le symbole #).
Les annotations automatiques sont encodées selon le modèle conll-U.
Les annotations manuelles sont encodées dans la variable MISC du format conllu.
Exemple
# text = Julie opina, puis regagna sa chambre pour corriger 10 les copies de ses élèves, puis elle se coucha. # text_prod = Julie opinia, puis regagnia sa chambre pour corriger 10 les copies de ses élèves, puis elle se coucha. # sent_id = ECALM-FR-10-2016-MLJ-D1-E3-V1-15 # source_url = https://gitlab.huma-num.fr/clle/ud_french-ecalm-coref/-/blob/main/public/scans/ECALM-FR-10-2016-MLJ-D1-E3-V1.png # annee = 2016 # mois = inconnu # niveau_en = 10 # niveau_fr = 2e # version = V1 # scripteur_id = E3 # scripteur_sexe = inconnu # scripteur_langue-maternelle = inconnu # zone_geo = inconnu # consigne = ECRISCOL-SUITE-JULIE 1 Julie Julie PROPN _ _ 0 root _ start_char=650|end_char=655|ner=B-PER|mod=subst|norm=0|prod=(Julie)|coref=(Elle)|instr=0|SpaceAfter=Yes 2 opina opina X _ _ 1 flat:name _ start_char=656|end_char=661|ner=E-PER|mod=0|norm=1|prod=(opinia)|coref=0|instr=0|SpaceAfter=No
Subcorpora and sent_id description
La ligne # text= fournissent le texte de la phrase traduite en orthographe standard et annotée.
La ligne # text_prod= fournit le texte de la phrase dans sa version originale, telle que produite par l'élève.
La ligne # sent_id= contient l'identifiant du texte. Cet identifiant se compose des informations contextuelles liées à chaque texte (chaque information est délimitée par le "-"):
- ECALM (nom du projet et de la resource)
- Langue du texte (FR: français de France, BE: français de Belgique)
- Niveau : 01 (CP), 02 (CE1), 03 (CE2), 04 (CM1), 05 (CM2), 06 (6e), 07 (5e), 08 (4e), 09 (3e), 10 (2e), 11 (1e), 12 (Terminale), 13 (1ere année de Licence ou de BTS), 17 (2e année de Master)
- Année d'écriture
- Identifiant de la classe ou de l'école
- Identifiant du devoir pour cette classe
- Identifiant de l'élève. S# pour Scoledit, R# pour ResolCo et E# pour Ecriscol.
- La dernière valeur indique si le texte est une première version (V1) ou une version ayant fait l'objet d'un travail de réécriture (V2, V3)
Dans l'exemple précédent, le code ECALM-FR-10-2016-MLJ-D1-E3-V1 indique que le texte a été écrit en 2016 par l'élève E3 (E pour Ecriscol) qui était alors en 10e (2e pour le système français). Ce texte est une première version.
Ces informations se répètent dans des lignes d'en-têtes dédiées afin de faciliter les requêtes pour interroger les données (voir par exemple les exemples d'Exploration avec Grew).
Description de la colonne MISC
-
mod=0|del|subst|add|naindique si une trace d'écriture manuscrite a été signalée au cours de la transcription des copies scannées. Si aucune trace n'a été signalée,mod=0. Si une trace a été signalée, 3 types sont distingués :del(suppression),add(ajout) ousubst(substitution, càd suppression et ajout).mod=naindique que cette couche d'annotation n'est pas disponible pour ce texte (c'est le cas pour tous les textes Scoledit). norm=0|1indique le texte a été annoté au niveau de l'orthographe.norm=1indique qu'un écart à l'orthographe standard a été noté,norm=0indique qu'aucun écart n'a été observé. Si le token présente un écart à la norme orthographique, la valeurprod=fourni la forme produite à l'origine.prod=(xxx)|(_)fourni la forme originale du token. Si le token entier présente un écart à la norme orthographique et peut être normalisé par un seul token :prod=(xxx). Si le token présente un écart impliquant un problème de segmentation en ce sens qu'il ne peut être normélisé par un seul token, plusieurs situations se rencontrent :prod=(xxxindique que le token correspond au début d'un token normalisé.prod=xxx)indique que le token correspond à la fin d'un token normalisé.prod=xxxindique que le token correspond au milieu d'un token normalisé. Si le token a été ajouté dans la version normalisée et ne correspond à rien dans la version originale :prod="_".coref=0|(xxx)|(xxx|xxx|xxx)indique si le token a été annoté comme (faisant partie d’une) mention — c’est-à-dire une expression référentielle qui (co)renvoie à l'un des personnages principaux sollicité par la consigne d'écriture.coref=0indique que le token n'a pas été annoté comme faisant partie d'une mention.coref=(xxx)indique que le token correspond à une mention à token unique.coref=(xxxindique que le token correspond au début d'une mention multi-token.coref=xxx)indique que le token correspond à la fin d'une mention multi-token.coref=xxxindique que le token est inclus dans une mention multi-token. Seuls les personnages sollicités par la consigne d'écriture ont été considérés.xxxindique le référent. Pour les textes produits en réponse à la consigne "ECRISCOL_SUITE_JULIE" (sous-corpus EscriScol), les référénts peuvent être (Elle) ou (Il). Pour les textes produits en réponse à la consigne "SCOLEDIT_RECIT-2" (sous-corpus Scoledit texts, les référents peuvent être (Sorcière), (Robot), (Chat) ou (Loup). Pour les textes produits en réponse à la consigne "RESOLCO_RECIT-1" (sous-corpus ResolCo), les référénts peuvent être (Elle), (Il) ou (lesEnfants). Lorsqu'un référent est inclus dans un référent pluriel collectif (par exemple, la mention unique Les deux amis fait référence à deux personnages principaux), l'indicationxxxest suivie de la chaîneColl, comme dans le premier token de l'exemple ci-dessous.
# text = Ils repartirent ensemble pour retrouver le chemin. # text_prod = Il reparta emssenble pour retrouver le chemin. # sent_id = ECALM-FR-05-2018-17-D1-S573-V1-2 ... # consigne = SCOLEDIT-RECIT-2 1 Ils eux PRON _ Emph=No|Gender=Masc|Number=Plur|Person=3|PronType=Prs 2 nsubj _ start_char=95|end_char=98|ner=O|mod=None|norm=1|prod=(Il)|coref=(ChatColl),(LoupColl)|instr=0 2 repartirent repartir VERB _ Mood=Ind|Number=Plur|Person=3|Tense=Past|VerbForm=Fin 0 root _ start_char=99|end_char=110|ner=O|mod=None|norm=1|prod=(reparta)|coref=0|instr=0 3 ensemble ensemble ADV _ _ 2 advmod _ start_char=111|end_char=119|ner=O|mod=None|norm=1|prod=(emssenble)|coref=0|instr=0 4 pour pour ADP _ _ 5 mark _ start_char=120|end_char=124|ner=O|mod=None|norm=0|prod=(pour)|coref=0|instr=0 5 retrouver retrouver VERB _ VerbForm=Inf 2 advcl _ start_char=125|end_char=134|ner=O|mod=None|norm=0|prod=(retrouver)|coref=0|instr=0 6 le le DET _ Definite=Def|Gender=Masc|Number=Sing|PronType=Art 7 det _ start_char=135|end_char=137|ner=O|mod=None|norm=0|prod=(le)|coref=0|instr=0 7 chemin chemin NOUN _ Gender=Masc|Number=Sing 5 obj _ start_char=138|end_char=144|ner=O|mod=None|norm=0|prod=(chemin)|coref=0|instr=0 8 . . PUNCT _ _ 2 punct _ start_char=144|end_char=145|ner=O|mod=None|norm=0|prod=(.)|coref=0|instr=0
instr=0|1indique si le token fait partie de l'instruction (1) ou non (0). Dans les textes rédigés en réponse à l'instruction ResolCo, les élèves doivent insérer trois phrases prédéfinies dans leurs récits.
Annotation guidelines given to the human coders
Tous les textes de la ressource UD_French-ECALM ont été numérisés, encodés au format TEI, soumis à une vérification orthographique et annotés par des annotateurs humains. Les guides d'annotation sont disponibles dans le dossier annotationGuidelines.