Grew-match, un outil de correspondance de graphes en ligne permettant de rechercher une requête donnée dans un corpus de structures syntaxiques. La ressource est proposée dans les derniers corpus annotés en Universal Depencies.

Lien direct : https://universal.grew.fr/?corpus=UD_French-ECALM@main.

L'outil Grew-match (Guillaume 2021) a été spécialement conçu pour interroger des données encodées au format CoNLL-U. Cet outil utilise le langage de requête CQL (Corpus Query Language) pour définir des motifs (patterns) qui filtrent les contextes à observer, quantifier et/ou extraire en fonction d'une ou plusieurs contraintes.

Grew-match permet également de visualiser la structure syntaxique de tous les contextes correspondants et d'exporter les résultats dans différents formats, notamment au format TSV et sous forme de vue KWIC. Il fournit également des outils de regroupement (Clustering).

Le scan de la copie contenant les phrases sélectionnées est accessible en cliquant sur le bouton IMAGE

Un tutoriel et une documentation très complète est proposé pour découvrir les fonctionnalités de l'outil.

Exemples de requêtes

Phrases contenant la chaîne « Il était » (utilisation de la sytaxe des expressions régulières re".*Il était.*")

pattern{meta.text=re".*Il était.*"}

Tester sur

Clustering en fonction du niveau scolaire : Tester sur

Tous les verbes au pluriel dont la forme produite fini par "s" et qui ont été normalisés"

Cette requête permet de sélectionner des phrases dans lesquelles l'élève a pu mettre un "s" pour conjuguer un verbe au pluriel.


                pattern {X[norm=1, prod=re".*s)?", upos=VERB, Number=Plur]}
            

Possibilité de regrouper par lemme de la forme en question. Tester sur

Tous les tokens dont la forme produite fini par "er" et la forme en orthographe standard fini par "é(e)(s)"

Cette requête permet de sélectionner des phrases dans lesquelles il peut y avoir eu une confusion entre la forme infinitive et la forme au participe passé.


                pattern { X[form=re".*ée?s?",prod=re".*er)?"]}
            

Possibilité de regrouper par étiquette morpho-syntaxique de la forme en question. Tester sur

L'inverse peut également être recherchée : tokens dont la forme produite fini par "er" et la forme en orthographe standard fini par "é(e)(s)". Tester sur

Tous les NOMS, PRONOMS et NOMS PROPRES qui sont des sujets syntaxiques et qui ont été annotés comme une mention « (Elle) ».


                pattern { X [upos = NOUN|PRON|PROPN]; X [coref = re"Elle"]; Y -[nsubj]-> X; }
            

Tester sur

Recherche de contextes dans lesquels un NOM sujet ou objet d'un verbe a été annoté comme étant une mention coréférentielle

Clustering : Lemmes de conjonction de subordination et clacul de leur proportion d'apparition en fonction de leur position avant ou après la racine syntaxique (root) de la phrase.

Tester sur