Université de Moncton,
Identification d'auteurs à l'aide de n-grammes et de skip-grammes de tailles variables, constitués d'étiquettes morphosyntaxiques
Abstract
dc:description.abstract"L'identification de l'auteur d'un texte anonyme par l'analyse de ses écrits est un domaine qui a fait l'objet de nombreuses recherches, depuis plusieurs siècles. En effet, les premières études datent du 19e siècle. À cette époque, les chercheurs utilisaient uniquement des techniques statistiques pour identifier les auteurs. Les études réalisées par Medenhall en 1887 en sont un très bon exemple, prouvant l'efficacité des outils statistiques pour l'identification d'auteurs. Medenhall a mis en valeur la corrélation entre la distribution des mots et leur longueur dans les oeuvres d'un même auteur. En appliquant ses méthodes sur les pièces de théâtre de shakespeariennes, il a découverty des liens entre les écrits de Shakespeare et de Marlowe. Cependant, l'étude qui a le plus influencé l'avenir de l'identification d'auteurs est sans doute celle de Mosteller et Wallace en 1964 sur le fédéraliste, un recueil de 146 articles politiques publiés anonymement sous le pseudonyme "Publius" entre 1787 et 1788. Mosteller et Wallace arrivèrent à identifier les auteurs du fédéraliste en utilisant les méthodes d'identification d'auteurs. Plusieurs autres travaux ont permis d'isoler des indices caractérisant le style d'écriture d'auteurs afin d'identifier l'auteur d'une oeuvre dont la paternité est mise en doute. Ces indices sont dits stylistiques car ils permettent de capturer le style des auteurs et sont généralement invariables dans les oeuvres d'un auteur. En outre, les techniques d'identification d'auteurs ont de nombreuses applications telles que démasquer les individus qui profitent de l'anonymat offert par Internet et les réseaux sociaux pour menacer ou commettre des crimes comme l'intimidation. Dans plusieurs cas, les techniques d'identification d'auteurs ont permis de réduire les listes des potentiels suspects lors d'enquêtes, et ont souvent été utilisées lors de procès pour inculper ou disculper des accusés. Entre temps, la stylométrie à vue le jour dans les années 1990. Il s'agit d'un nouveau domaine de recherche ayant pour mission de découvrir de nouveaux indices stylistiques. Plusieurs avancées ont été effectuées dans le domaine donnant naissance à un nombre élevé d'indices de tout genre. En effet, il existe plus de 1000 différents indices stylométriques de plusieurs natures, soient lexicales, grammaticales ou sémantiques. Toutefois, il est crucial de trouver de nouveaux indices permettant d'identifier les auteurs avec précision et pouvant être utilisés sur des textes de longueurs et de natures diverses. Dans le même contexte, des études ont démontré que la combinaison de plusieurs indices stylistiques améliore le taux de succès des techniques d'identification d'auteurs. Par conséquent, la découverte de nouveaux indices personnels qui peuvent capturer la signature stylistique d,un auteur est un domaine de recherche important avec de véritables défis. C'est dans cette optique que nous proposons dans cette thèse deux nouveaux indices stylistiques de types syntaxiques utilisant les n-grammes ou skip-grammes (n-grammes avec sauts) constitués d'étiquettes morphosyntaxiques. Notre choix s'est porté sur les indices syntaxiques puisque leur usage est inconscient par les auteurs. Notre premier indice cherche les k motifs les plus fréquents constitués de n-grammes d'étiquettes morphosyntaxiques à taille variable pour construire les signatures d'auteurs. Une étude expérimentale avec un corpus, de 30 livres et 10 auteurs pour une total de 99, 903 phrases, extrait du Projet Gutenberg, démontre qu'il est possible d'identifier les auteurs avec un rappel de plus de 73% en utilisant un petit nombre de motifs (par exemple, k = 50). Le second indice exploite la possibilité qu'offrent les skip-grammes de permettre des sauts entre des étiquettes morphosyntaxiques adjacentes. Cela permet de détecter les habitudes qu'ont certains auteurs à utiliser des structures de phrases plus complexes. Une étude expérimentale utilisant le même corpus montre que les auteurs peuvent être identifiés avec un rappel de plus de 70% en utilisant un petit nombre de motifs (e.g. k = 250) et un seul saut (par exemple, saut = 1) entre les étiquettes morphosyntaxiques. En terminant, nous exploitons nos deux indices sur un corpus de billets de blogues écrits par 10 auteurs afin de mesurer les performances de nos indices et notre approche sur un corpus de thématique et de taille différente. Les résultats obtenus montrent que les auteurs peuvent être identifés avec une très bonne exactitude. Mots clés : identification d'auteurs, stylométrie, étiquettes morphosyntaxiques, n-grammes, skip-grammes, motifs séquentiels à taille variable."--Résumé.
Degree
thesis:*- Name thesis:degree_name
- Maîtrise ès sciences (informatique)
- Level thesis:degree_level
- 2e cycle
- Discipline thesis:degree_discipline
- Faculté des sciences
- Grantor dc:publisher
- Université de Moncton,
- Year dc:date.issued
- 2016
Author and committee
dc:creator, dc:contributor.*- Author dc:creator
-
- Pokou, Yao Jean Marc
- Advisors dc:contributor.advisor
-
- Moghrabi, Chadia
- Fournier-Viger, Philippe
Subjects
dc:subject × 10Rights
dc:rights- Statement dc:rights
-
- Author
- Language dc:language.iso
- iso639-2b, fre
Identifiers
dc:identifier.*- Identifier
- oclc: 984676290
- Dc Identifier Other
- umir:1833
- OAI identifier oai:identifier
- oai:umoncton.scholaris.ca:20.500.14658/8148