Università degli studi di Catania
Understanding the Phenomenon of Deepfake Audio: Challenges and Solutions [Comprendere il fenomeno dell'audio deepfake: sfide e soluzioni]
Abstract
dc:descriptionQuesta tesi analizza le crescenti sfide poste dall'audio deepfake, concentrandosi sul rilevamento e l'attribuzione delle voci sintetiche. Con la crescente accessibilità e sofisticazione delle tecnologie di sintesi vocale, il rilevamento dell'audio sintetico è diventato un compito cruciale nell'ambito dell'informatica forense, della sicurezza informatica e dell'integrità dei media. La ricerca esplora le feature create manualmente come alternativa interpretabile e computazionalmente efficiente ai metodi basati sul deep learning, garantendo robustezza su diversi set di dati, attività di audio sintetico complesse, condizioni di rumore e ambienti di registrazione. Lo studio è strutturato attorno a molteplici attività, tra cui la classificazione binaria di audio reale e falso, l'attribuzione del parlato sintetico (SSA), un'analisi approfondita dei segmenti silenziosi nel rilevamento del parlato sintetico e un'attività di reverse engineering relativa alla generazione di audio sintetico. Un contributo chiave è l'introduzione del dataset Synthetic Obama-Trump Speeches (SOS), progettato per valutare i modelli in condizioni reali e facilitare esperimenti di apprendimento a pochi scatti. Inoltre, sono state sviluppate un'applicazione web e la libreria Python SPAFE per migliorare l'analisi delle feature e l'interoperabilità della ricerca. I risultati sperimentali confermano che le caratteristiche artigianali non solo raggiungono un'elevata accuratezza nel rilevamento del parlato sintetico, ma si generalizzano efficacemente anche tra i vari set di dati. L'analisi dei segmenti silenziosi ne evidenzia il ruolo cruciale nel migliorare le prestazioni di rilevamento, mentre gli esperimenti SSA e l'identificazione dei parametri di generazione del rumore di Barkhausen tramite reverse engineering dimostrano la versatilità della tecnica artigianale. Inoltre, lo studio sottolinea l'importanza della spiegabilità nei sistemi di rilevamento basati sull'intelligenza artificiale, garantendo trasparenza e affidabilità nelle applicazioni reali. Combinando nuovi set di dati, metodologie spiegabili e strumenti pratici, questa tesi contribuisce al progresso della ricerca sull'audio sintetico e fornisce una solida base per ulteriori progressi in tecniche di rilevamento robuste, interpretabili ed efficienti.
Degree
thesis:*- Grantor dc:publisher
- Università degli studi di Catania
- Year dc:date
- 2026
Author and committee
dc:creator, dc:contributor.*- Author dc:creator
-
- BORZI', STEFANO
- Contributors dc:contributor
-
- ALLEGRA, DARIO
Subjects
dc:subject × 15- Deepfake audio
- Synthetic speech detection
- Voice cloning
- Handcrafted feature
- Machine Learning
- artificial intelligence
- Silence analysi
- Audio Forensic
- Synthetic speech attribution (SSA)
- Explainable AI
- Deepfake audio detection
- Clonazione della voce
- intelligenza artificiale
- Analisi del silenzio
- Audio forense
Rights
dc:rights- Statement dc:rights
-
- info:eu-repo/semantics/openAccess
- license:PUBBLICO - Pubblico con Copyright
- license uri:iris.PUB02
- Language dc:language
- eng
Identifiers
dc:identifier.*- Handle dc:identifier
- https://hdl.handle.net/20.500.11769/724673
- OAI identifier oai:identifier
- oai:www.iris.unict.it:20.500.11769/724673