Back to results

Università degli studi di Catania

Understanding the Phenomenon of Deepfake Audio: Challenges and Solutions [Comprendere il fenomeno dell'audio deepfake: sfide e soluzioni]

Abstract

dc:description

Questa tesi analizza le crescenti sfide poste dall'audio deepfake, concentrandosi sul rilevamento e l'attribuzione delle voci sintetiche. Con la crescente accessibilità e sofisticazione delle tecnologie di sintesi vocale, il rilevamento dell'audio sintetico è diventato un compito cruciale nell'ambito dell'informatica forense, della sicurezza informatica e dell'integrità dei media. La ricerca esplora le feature create manualmente come alternativa interpretabile e computazionalmente efficiente ai metodi basati sul deep learning, garantendo robustezza su diversi set di dati, attività di audio sintetico complesse, condizioni di rumore e ambienti di registrazione. Lo studio è strutturato attorno a molteplici attività, tra cui la classificazione binaria di audio reale e falso, l'attribuzione del parlato sintetico (SSA), un'analisi approfondita dei segmenti silenziosi nel rilevamento del parlato sintetico e un'attività di reverse engineering relativa alla generazione di audio sintetico. Un contributo chiave è l'introduzione del dataset Synthetic Obama-Trump Speeches (SOS), progettato per valutare i modelli in condizioni reali e facilitare esperimenti di apprendimento a pochi scatti. Inoltre, sono state sviluppate un'applicazione web e la libreria Python SPAFE per migliorare l'analisi delle feature e l'interoperabilità della ricerca. I risultati sperimentali confermano che le caratteristiche artigianali non solo raggiungono un'elevata accuratezza nel rilevamento del parlato sintetico, ma si generalizzano efficacemente anche tra i vari set di dati. L'analisi dei segmenti silenziosi ne evidenzia il ruolo cruciale nel migliorare le prestazioni di rilevamento, mentre gli esperimenti SSA e l'identificazione dei parametri di generazione del rumore di Barkhausen tramite reverse engineering dimostrano la versatilità della tecnica artigianale. Inoltre, lo studio sottolinea l'importanza della spiegabilità nei sistemi di rilevamento basati sull'intelligenza artificiale, garantendo trasparenza e affidabilità nelle applicazioni reali. Combinando nuovi set di dati, metodologie spiegabili e strumenti pratici, questa tesi contribuisce al progresso della ricerca sull'audio sintetico e fornisce una solida base per ulteriori progressi in tecniche di rilevamento robuste, interpretabili ed efficienti.

Degree

thesis:*
Grantor dc:publisher
Università degli studi di Catania
Year dc:date
2026

Author and committee

dc:creator, dc:contributor.*
Author dc:creator
  • BORZI', STEFANO
Contributors dc:contributor
  • ALLEGRA, DARIO

Subjects

dc:subject × 15

Rights

dc:rights
Statement dc:rights
  • info:eu-repo/semantics/openAccess
  • license:PUBBLICO - Pubblico con Copyright
  • license uri:iris.PUB02
Language dc:language
eng

Identifiers

dc:identifier.*
OAI identifier oai:identifier
oai:www.iris.unict.it:20.500.11769/724673

Chain of custody

source
Harvested from
Università degli Studi di Catania
Base URL
www.iris.unict.it/oai/request
Last updated
2026-07-24
Source record
OAI-PMH GetRecord
citation

BORZI', STEFANO. Understanding the Phenomenon of Deepfake Audio: Challenges and Solutions [Comprendere il fenomeno dell'audio deepfake: sfide e soluzioni]. Università degli studi di Catania, 2026. https://hdl.handle.net/20.500.11769/724673