{"id":{"repo_id":"catania","oai_identifier":"oai:www.iris.unict.it:20.500.11769/724673"},"canonical_url":"https://search.dev.ndltd.org/etd/catania/oai:www.iris.unict.it:20.500.11769/724673","repository":{"repo_id":"catania","name":"Università degli Studi di Catania","base_url":"https://www.iris.unict.it/oai/request"},"display":{"title":"Understanding the Phenomenon of Deepfake Audio: Challenges and Solutions [Comprendere il fenomeno dell'audio deepfake: sfide e soluzioni]","abstract":"Questa tesi analizza le crescenti sfide poste dall'audio deepfake, concentrandosi sul rilevamento e l'attribuzione delle voci sintetiche. Con la crescente accessibilità e sofisticazione delle tecnologie di sintesi vocale, il rilevamento dell'audio sintetico è diventato un compito cruciale nell'ambito dell'informatica forense, della sicurezza informatica e dell'integrità dei media. La ricerca esplora le feature create manualmente come alternativa interpretabile e computazionalmente efficiente ai metodi basati sul deep learning, garantendo robustezza su diversi set di dati, attività di audio sintetico complesse, condizioni di rumore e ambienti di registrazione. Lo studio è strutturato attorno a molteplici attività, tra cui la classificazione binaria di audio reale e falso, l'attribuzione del parlato sintetico (SSA), un'analisi approfondita dei segmenti silenziosi nel rilevamento del parlato sintetico e un'attività di reverse engineering relativa alla generazione di audio sintetico. Un contributo chiave è l'introduzione del dataset Synthetic Obama-Trump Speeches (SOS), progettato per valutare i modelli in condizioni reali e facilitare esperimenti di apprendimento a pochi scatti. Inoltre, sono state sviluppate un'applicazione web e la libreria Python SPAFE per migliorare l'analisi delle feature e l'interoperabilità della ricerca. I risultati sperimentali confermano che le caratteristiche artigianali non solo raggiungono un'elevata accuratezza nel rilevamento del parlato sintetico, ma si generalizzano efficacemente anche tra i vari set di dati. L'analisi dei segmenti silenziosi ne evidenzia il ruolo cruciale nel migliorare le prestazioni di rilevamento, mentre gli esperimenti SSA e l'identificazione dei parametri di generazione del rumore di Barkhausen tramite reverse engineering dimostrano la versatilità della tecnica artigianale. Inoltre, lo studio sottolinea l'importanza della spiegabilità nei sistemi di rilevamento basati sull'intelligenza artificiale, garantendo trasparenza e affidabilità nelle applicazioni reali. Combinando nuovi set di dati, metodologie spiegabili e strumenti pratici, questa tesi contribuisce al progresso della ricerca sull'audio sintetico e fornisce una solida base per ulteriori progressi in tecniche di rilevamento robuste, interpretabili ed efficienti.","abstract_html":"Questa tesi analizza le crescenti sfide poste dall&#x27;audio deepfake, concentrandosi sul rilevamento e l&#x27;attribuzione delle voci sintetiche. Con la crescente accessibilità e sofisticazione delle tecnologie di sintesi vocale, il rilevamento dell&#x27;audio sintetico è diventato un compito cruciale nell&#x27;ambito dell&#x27;informatica forense, della sicurezza informatica e dell&#x27;integrità dei media. La ricerca esplora le feature create manualmente come alternativa interpretabile e computazionalmente efficiente ai metodi basati sul deep learning, garantendo robustezza su diversi set di dati, attività di audio sintetico complesse, condizioni di rumore e ambienti di registrazione. Lo studio è strutturato attorno a molteplici attività, tra cui la classificazione binaria di audio reale e falso, l&#x27;attribuzione del parlato sintetico (SSA), un&#x27;analisi approfondita dei segmenti silenziosi nel rilevamento del parlato sintetico e un&#x27;attività di reverse engineering relativa alla generazione di audio sintetico. Un contributo chiave è l&#x27;introduzione del dataset Synthetic Obama-Trump Speeches (SOS), progettato per valutare i modelli in condizioni reali e facilitare esperimenti di apprendimento a pochi scatti. Inoltre, sono state sviluppate un&#x27;applicazione web e la libreria Python SPAFE per migliorare l&#x27;analisi delle feature e l&#x27;interoperabilità della ricerca. I risultati sperimentali confermano che le caratteristiche artigianali non solo raggiungono un&#x27;elevata accuratezza nel rilevamento del parlato sintetico, ma si generalizzano efficacemente anche tra i vari set di dati. L&#x27;analisi dei segmenti silenziosi ne evidenzia il ruolo cruciale nel migliorare le prestazioni di rilevamento, mentre gli esperimenti SSA e l&#x27;identificazione dei parametri di generazione del rumore di Barkhausen tramite reverse engineering dimostrano la versatilità della tecnica artigianale. Inoltre, lo studio sottolinea l&#x27;importanza della spiegabilità nei sistemi di rilevamento basati sull&#x27;intelligenza artificiale, garantendo trasparenza e affidabilità nelle applicazioni reali. Combinando nuovi set di dati, metodologie spiegabili e strumenti pratici, questa tesi contribuisce al progresso della ricerca sull&#x27;audio sintetico e fornisce una solida base per ulteriori progressi in tecniche di rilevamento robuste, interpretabili ed efficienti.","abstract_has_math":false,"creators":["BORZI', STEFANO"],"institution":"Università degli studi di Catania","degree_name":null,"degree_level":null,"degree_discipline":null,"degree_department":null,"school":null,"contributors":["ALLEGRA, DARIO"],"advisors":[],"committee_chairs":[],"committee_members":[],"year":2026,"date_issued":"2026-02-20","date_published":"2026-02-20","updated_at":"2026-07-24T01:35:01Z","subjects":["Deepfake audio","Synthetic speech detection","Voice cloning","Handcrafted feature","Machine Learning","artificial intelligence","Silence analysi","Audio Forensic","Synthetic speech attribution (SSA)","Explainable AI","Deepfake audio detection","Clonazione della voce","intelligenza artificiale","Analisi del silenzio","Audio forense"],"languages":["eng"],"rights":["info:eu-repo/semantics/openAccess","license:PUBBLICO - Pubblico con Copyright","license uri:iris.PUB02"],"rights_urls":[],"identifier_entries":[]},"links":{"outbound_url":"https://hdl.handle.net/20.500.11769/724673","outbound_label":"Handle","outbound_source":"dc:identifier"},"metadata_groups":[{"id":"people","label":"People","entries":[{"key":"dc:contributor","label":"Contributor","values":["Borzi', Stefano","ALLEGRA, DARIO"]},{"key":"dc:creator","label":"Author","values":["BORZI', STEFANO"]}]},{"id":"academic_context","label":"Academic Context","entries":[{"key":"dc:date","label":"Dc Date","values":["2026-02-20"]},{"key":"dc:publisher","label":"Institution","values":["Università degli studi di Catania","place:Catania"]},{"key":"dc:type","label":"Dc Type","values":["info:eu-repo/semantics/doctoralThesis"]}]},{"id":"subjects_keywords","label":"Subjects and Keywords","entries":[{"key":"dc:subject","label":"Dc Subject","values":["Deepfake audio","Synthetic speech detection","Voice cloning","Handcrafted feature","Machine Learning","artificial intelligence","Silence analysi","Audio Forensic","Synthetic speech attribution (SSA)","Explainable AI","Deepfake audio detection","Clonazione della voce","intelligenza artificiale","Analisi del silenzio","Audio forense"]}]},{"id":"language_rights","label":"Language and Rights","entries":[{"key":"dc:language","label":"Dc Language","values":["eng"]},{"key":"dc:rights","label":"Dc Rights","values":["info:eu-repo/semantics/openAccess","license:PUBBLICO - Pubblico con Copyright","license uri:iris.PUB02"]}]},{"id":"identifiers","label":"Identifiers","entries":[{"key":"dc:identifier","label":"Identifier","values":["https://hdl.handle.net/20.500.11769/724673"]}]},{"id":"additional","label":"Additional Metadata","entries":[{"key":"dc:description","label":"Description","values":["Questa tesi analizza le crescenti sfide poste dall'audio deepfake, concentrandosi sul rilevamento e l'attribuzione delle voci sintetiche. Con la crescente accessibilità e sofisticazione delle tecnologie di sintesi vocale, il rilevamento dell'audio sintetico è diventato un compito cruciale nell'ambito dell'informatica forense, della sicurezza informatica e dell'integrità dei media. La ricerca esplora le feature create manualmente come alternativa interpretabile e computazionalmente efficiente ai metodi basati sul deep learning, garantendo robustezza su diversi set di dati, attività di audio sintetico complesse, condizioni di rumore e ambienti di registrazione. Lo studio è strutturato attorno a molteplici attività, tra cui la classificazione binaria di audio reale e falso, l'attribuzione del parlato sintetico (SSA), un'analisi approfondita dei segmenti silenziosi nel rilevamento del parlato sintetico e un'attività di reverse engineering relativa alla generazione di audio sintetico. Un contributo chiave è l'introduzione del dataset Synthetic Obama-Trump Speeches (SOS), progettato per valutare i modelli in condizioni reali e facilitare esperimenti di apprendimento a pochi scatti. Inoltre, sono state sviluppate un'applicazione web e la libreria Python SPAFE per migliorare l'analisi delle feature e l'interoperabilità della ricerca. I risultati sperimentali confermano che le caratteristiche artigianali non solo raggiungono un'elevata accuratezza nel rilevamento del parlato sintetico, ma si generalizzano efficacemente anche tra i vari set di dati. L'analisi dei segmenti silenziosi ne evidenzia il ruolo cruciale nel migliorare le prestazioni di rilevamento, mentre gli esperimenti SSA e l'identificazione dei parametri di generazione del rumore di Barkhausen tramite reverse engineering dimostrano la versatilità della tecnica artigianale. Inoltre, lo studio sottolinea l'importanza della spiegabilità nei sistemi di rilevamento basati sull'intelligenza artificiale, garantendo trasparenza e affidabilità nelle applicazioni reali. Combinando nuovi set di dati, metodologie spiegabili e strumenti pratici, questa tesi contribuisce al progresso della ricerca sull'audio sintetico e fornisce una solida base per ulteriori progressi in tecniche di rilevamento robuste, interpretabili ed efficienti.","This thesis investigates the growing challenges posed by deepfake audio, focusing on the detection and attribution of synthetic speech. With the increasing accessibility and sophistication of voice synthesis technologies, detecting synthetic audio has become a crucial task in digital forensics, cybersecurity, and media integrity. The research explores handcrafted features as an interpretable and computationally efficient alternative to deep learning-based methods, ensuring robustness across diverse datasets, challenging synthetic audio tasks, noise conditions, and recording environments. The study is structured around multiple tasks, including binary classification of real vs. fake audio, Synthetic Speech Attribution (SSA), an in-depth analysis of silent segments in synthetic speech detection and a reverse engineering task related to the generation of synthetic audio. A key contribution is the introduction of the Synthetic Obama-Trump Speeches (SOS) dataset, designed to evaluate models under real-world conditions and facilitate few-shot learning experiments. Additionally, a web application and the SPAFE Python library were developed to enhance feature analysis and research interoperability. Experimental results confirm that handcrafted features not only achieve high accuracy in detecting synthetic speech but also generalize effectively across datasets. The analysis of silent segments highlights their critical role in enhancing detection performance, while SSA experiments and the identification of Barkhausen noise generation parameters through reverse engineering demonstrate the versatility of the handcrafted technique. Furthermore, the study underscores the importance of explainability in AI-driven detection systems, ensuring transparency and reliability in real-world applications. By combining novel datasets, explainable methodologies, and practical tools, this thesis contributes to the advancement of synthetic audio research and provides a solid basis for further progress in robust, interpretable, and efficient detection techniques."]},{"key":"dc:title","label":"Title","values":["Understanding the Phenomenon of Deepfake Audio: Challenges and Solutions [Comprendere il fenomeno dell'audio deepfake: sfide e soluzioni]"]}]}],"canonical_facts":{"dc:contributor":["Borzi', Stefano","ALLEGRA, DARIO"],"dc:creator":["BORZI', STEFANO"],"dc:date":["2026-02-20"],"dc:description":["Questa tesi analizza le crescenti sfide poste dall'audio deepfake, concentrandosi sul rilevamento e l'attribuzione delle voci sintetiche. Con la crescente accessibilità e sofisticazione delle tecnologie di sintesi vocale, il rilevamento dell'audio sintetico è diventato un compito cruciale nell'ambito dell'informatica forense, della sicurezza informatica e dell'integrità dei media. La ricerca esplora le feature create manualmente come alternativa interpretabile e computazionalmente efficiente ai metodi basati sul deep learning, garantendo robustezza su diversi set di dati, attività di audio sintetico complesse, condizioni di rumore e ambienti di registrazione. Lo studio è strutturato attorno a molteplici attività, tra cui la classificazione binaria di audio reale e falso, l'attribuzione del parlato sintetico (SSA), un'analisi approfondita dei segmenti silenziosi nel rilevamento del parlato sintetico e un'attività di reverse engineering relativa alla generazione di audio sintetico. Un contributo chiave è l'introduzione del dataset Synthetic Obama-Trump Speeches (SOS), progettato per valutare i modelli in condizioni reali e facilitare esperimenti di apprendimento a pochi scatti. Inoltre, sono state sviluppate un'applicazione web e la libreria Python SPAFE per migliorare l'analisi delle feature e l'interoperabilità della ricerca. I risultati sperimentali confermano che le caratteristiche artigianali non solo raggiungono un'elevata accuratezza nel rilevamento del parlato sintetico, ma si generalizzano efficacemente anche tra i vari set di dati. L'analisi dei segmenti silenziosi ne evidenzia il ruolo cruciale nel migliorare le prestazioni di rilevamento, mentre gli esperimenti SSA e l'identificazione dei parametri di generazione del rumore di Barkhausen tramite reverse engineering dimostrano la versatilità della tecnica artigianale. Inoltre, lo studio sottolinea l'importanza della spiegabilità nei sistemi di rilevamento basati sull'intelligenza artificiale, garantendo trasparenza e affidabilità nelle applicazioni reali. Combinando nuovi set di dati, metodologie spiegabili e strumenti pratici, questa tesi contribuisce al progresso della ricerca sull'audio sintetico e fornisce una solida base per ulteriori progressi in tecniche di rilevamento robuste, interpretabili ed efficienti.","This thesis investigates the growing challenges posed by deepfake audio, focusing on the detection and attribution of synthetic speech. With the increasing accessibility and sophistication of voice synthesis technologies, detecting synthetic audio has become a crucial task in digital forensics, cybersecurity, and media integrity. The research explores handcrafted features as an interpretable and computationally efficient alternative to deep learning-based methods, ensuring robustness across diverse datasets, challenging synthetic audio tasks, noise conditions, and recording environments. The study is structured around multiple tasks, including binary classification of real vs. fake audio, Synthetic Speech Attribution (SSA), an in-depth analysis of silent segments in synthetic speech detection and a reverse engineering task related to the generation of synthetic audio. A key contribution is the introduction of the Synthetic Obama-Trump Speeches (SOS) dataset, designed to evaluate models under real-world conditions and facilitate few-shot learning experiments. Additionally, a web application and the SPAFE Python library were developed to enhance feature analysis and research interoperability. Experimental results confirm that handcrafted features not only achieve high accuracy in detecting synthetic speech but also generalize effectively across datasets. The analysis of silent segments highlights their critical role in enhancing detection performance, while SSA experiments and the identification of Barkhausen noise generation parameters through reverse engineering demonstrate the versatility of the handcrafted technique. Furthermore, the study underscores the importance of explainability in AI-driven detection systems, ensuring transparency and reliability in real-world applications. By combining novel datasets, explainable methodologies, and practical tools, this thesis contributes to the advancement of synthetic audio research and provides a solid basis for further progress in robust, interpretable, and efficient detection techniques."],"dc:identifier":["https://hdl.handle.net/20.500.11769/724673"],"dc:language":["eng"],"dc:publisher":["Università degli studi di Catania","place:Catania"],"dc:rights":["info:eu-repo/semantics/openAccess","license:PUBBLICO - Pubblico con Copyright","license uri:iris.PUB02"],"dc:subject":["Deepfake audio","Synthetic speech detection","Voice cloning","Handcrafted feature","Machine Learning","artificial intelligence","Silence analysi","Audio Forensic","Synthetic speech attribution (SSA)","Explainable AI","Deepfake audio detection","Clonazione della voce","intelligenza artificiale","Analisi del silenzio","Audio forense"],"dc:title":["Understanding the Phenomenon of Deepfake Audio: Challenges and Solutions [Comprendere il fenomeno dell'audio deepfake: sfide e soluzioni]"],"dc:type":["info:eu-repo/semantics/doctoralThesis"]},"updated_at":"2026-07-24T01:35:01Z"}