Back to results

Université de Moncton,

Identification d'auteurs à l'aide de n-grammes et de skip-grammes de tailles variables, constitués d'étiquettes morphosyntaxiques

Abstract

dc:description.abstract

"L'identification de l'auteur d'un texte anonyme par l'analyse de ses écrits est un domaine qui a fait l'objet de nombreuses recherches, depuis plusieurs siècles. En effet, les premières études datent du 19e siècle. À cette époque, les chercheurs utilisaient uniquement des techniques statistiques pour identifier les auteurs. Les études réalisées par Medenhall en 1887 en sont un très bon exemple, prouvant l'efficacité des outils statistiques pour l'identification d'auteurs. Medenhall a mis en valeur la corrélation entre la distribution des mots et leur longueur dans les oeuvres d'un même auteur. En appliquant ses méthodes sur les pièces de théâtre de shakespeariennes, il a découverty des liens entre les écrits de Shakespeare et de Marlowe. Cependant, l'étude qui a le plus influencé l'avenir de l'identification d'auteurs est sans doute celle de Mosteller et Wallace en 1964 sur le fédéraliste, un recueil de 146 articles politiques publiés anonymement sous le pseudonyme "Publius" entre 1787 et 1788. Mosteller et Wallace arrivèrent à identifier les auteurs du fédéraliste en utilisant les méthodes d'identification d'auteurs. Plusieurs autres travaux ont permis d'isoler des indices caractérisant le style d'écriture d'auteurs afin d'identifier l'auteur d'une oeuvre dont la paternité est mise en doute. Ces indices sont dits stylistiques car ils permettent de capturer le style des auteurs et sont généralement invariables dans les oeuvres d'un auteur. En outre, les techniques d'identification d'auteurs ont de nombreuses applications telles que démasquer les individus qui profitent de l'anonymat offert par Internet et les réseaux sociaux pour menacer ou commettre des crimes comme l'intimidation. Dans plusieurs cas, les techniques d'identification d'auteurs ont permis de réduire les listes des potentiels suspects lors d'enquêtes, et ont souvent été utilisées lors de procès pour inculper ou disculper des accusés. Entre temps, la stylométrie à vue le jour dans les années 1990. Il s'agit d'un nouveau domaine de recherche ayant pour mission de découvrir de nouveaux indices stylistiques. Plusieurs avancées ont été effectuées dans le domaine donnant naissance à un nombre élevé d'indices de tout genre. En effet, il existe plus de 1000 différents indices stylométriques de plusieurs natures, soient lexicales, grammaticales ou sémantiques. Toutefois, il est crucial de trouver de nouveaux indices permettant d'identifier les auteurs avec précision et pouvant être utilisés sur des textes de longueurs et de natures diverses. Dans le même contexte, des études ont démontré que la combinaison de plusieurs indices stylistiques améliore le taux de succès des techniques d'identification d'auteurs. Par conséquent, la découverte de nouveaux indices personnels qui peuvent capturer la signature stylistique d,un auteur est un domaine de recherche important avec de véritables défis. C'est dans cette optique que nous proposons dans cette thèse deux nouveaux indices stylistiques de types syntaxiques utilisant les n-grammes ou skip-grammes (n-grammes avec sauts) constitués d'étiquettes morphosyntaxiques. Notre choix s'est porté sur les indices syntaxiques puisque leur usage est inconscient par les auteurs. Notre premier indice cherche les k motifs les plus fréquents constitués de n-grammes d'étiquettes morphosyntaxiques à taille variable pour construire les signatures d'auteurs. Une étude expérimentale avec un corpus, de 30 livres et 10 auteurs pour une total de 99, 903 phrases, extrait du Projet Gutenberg, démontre qu'il est possible d'identifier les auteurs avec un rappel de plus de 73% en utilisant un petit nombre de motifs (par exemple, k = 50). Le second indice exploite la possibilité qu'offrent les skip-grammes de permettre des sauts entre des étiquettes morphosyntaxiques adjacentes. Cela permet de détecter les habitudes qu'ont certains auteurs à utiliser des structures de phrases plus complexes. Une étude expérimentale utilisant le même corpus montre que les auteurs peuvent être identifiés avec un rappel de plus de 70% en utilisant un petit nombre de motifs (e.g. k = 250) et un seul saut (par exemple, saut = 1) entre les étiquettes morphosyntaxiques. En terminant, nous exploitons nos deux indices sur un corpus de billets de blogues écrits par 10 auteurs afin de mesurer les performances de nos indices et notre approche sur un corpus de thématique et de taille différente. Les résultats obtenus montrent que les auteurs peuvent être identifés avec une très bonne exactitude. Mots clés : identification d'auteurs, stylométrie, étiquettes morphosyntaxiques, n-grammes, skip-grammes, motifs séquentiels à taille variable."--Résumé.

Degree

thesis:*
Name thesis:degree_name
Maîtrise ès sciences (informatique)
Level thesis:degree_level
2e cycle
Discipline thesis:degree_discipline
Faculté des sciences
Grantor dc:publisher
Université de Moncton,
Year dc:date.issued
2016

Author and committee

dc:creator, dc:contributor.*
Author dc:creator
  • Pokou, Yao Jean Marc
Advisors dc:contributor.advisor
  • Moghrabi, Chadia
  • Fournier-Viger, Philippe

Subjects

dc:subject × 10

Rights

dc:rights
Statement dc:rights
  • Author
Language dc:language.iso
iso639-2b, fre

Identifiers

dc:identifier.*
Identifier
oclc: 984676290
Dc Identifier Other
umir:1833
OAI identifier oai:identifier
oai:umoncton.scholaris.ca:20.500.14658/8148

Chain of custody

source
Harvested from
University de Moncton
Base URL
umoncton.scholaris.ca/server/oai/request
Last updated
2026-07-24
Source record
OAI-PMH GetRecord
citation

Pokou, Yao Jean Marc. Identification d'auteurs à l'aide de n-grammes et de skip-grammes de tailles variables, constitués d'étiquettes morphosyntaxiques. 2e cycle thesis, Université de Moncton,, 2016. https://hdl.handle.net/20.500.14658/8148