Drift — Emotion-Driven Ambient Music
Installazione di musica generativa che traduce il contenuto emotivo della voce in un paesaggio sonoro ambient in tempo reale. Sviluppato in un team internazionale durante il Generative Music AI workshop della Universitat Pompeu Fabra di Barcellona.
Contesto
Drift nasce durante il workshop di Generative Music AI organizzato dal Music Technology Group dell’Universitat Pompeu Fabra di Barcellona — i massimi esperti europei di generazione musicale con AI. Eravamo 30 partecipanti: 20 tecnologi e 10 musicisti, divisi in team internazionali.
Il progetto è ispirato al concetto di “listening in the ambient mode” di Michael Viega: invece di creare una canzone strutturata, Drift genera un soundscape che è, nelle parole di Brian Eno, “as ignorable as it is interesting”.
Il sistema crea un loop bio-creativo: la tua voce genera musica che riflette il tuo stato emotivo, e questo paesaggio sonoro a sua volta invita alla riflessione e all’introspezione.
Cosa ho fatto io
Ero team leader di un team internazionale (con Jing Yu e Lianne Sánchez-Rodríguez, mentored da Fernando García), lavorando in gruppo con persone di campi diversi — il classico lavoro ibrido tech+musica. Ho contribuito alla progettazione dell’architettura della pipeline e alla parte di analisi delle emozioni e generazione MIDI.
Come funziona
Il sistema processa l’audio attraverso una pipeline multi-stadio:
flowchart LR V["Voce dell'utente"] --> A1["Analisi prosodica<br/>Wav2Vec2<br/>(intonazione, ritmo, timbro)"] V --> A2["Analisi semantica<br/>Whisper + NRC-VAD<br/>(trascrizione + lessico)"] A1 --> F["Fusione pesata<br/>(valenza, arousal)"] A2 --> F F --> M["Modello MIDI-Emotion<br/>(token musicali)"] M --> O["OSC in tempo reale"] O --> X["Max/MSP<br/>sintesi granulare ambient"] X --> S["Paesaggio sonoro<br/>evolutivo"]
Dal parlato al soundscape ambient
-
Analisi dual-path della voce (Python).
- Prosodica: un modello pre-addestrato Wav2Vec2 analizza intonazione, ritmo e timbro per estrarre valenza e arousal.
- Semantica: Whisper trascrive il parlato; il lessico NRC-VAD assegna punteggi valenza/arousal alle parole usate.
- Le due strade vengono fuse con una media pesata per ottenere una coordinata emotiva più robusta.
-
Generazione emozione→MIDI (Python). La coordinata
(valenza, arousal)alimenta il modello generativo midi-emotion, che produce un flusso continuo di eventi musicali simbolici (channel, pitch, velocity) che rappresentano musicalmente l’emozione. -
Trasmissione OSC. Gli eventi MIDI non vengono salvati su file: vengono streammati in tempo reale a Max/MSP via OSC (Open Sound Control) per un’esperienza fluida e a bassa latenza.
-
Sintesi ambient (Max/MSP). Il patch non è un semplice player MIDI ma un sintetizzatore custom:
- Sintesi granulare (
GRANULAR,CLOUD): i note MIDI innescano motori che destrutturano il suono in grani, creando pad evolutivi e nuvole sonore. - Spatializzazione: riverberi profondi (
GIGAVERB) per un soundscape immersivo. - Inviluppi lenti: attacchi e release lunghi (
ADSR) evitano transienti bruschi — tutto fluido, tutto “drifty”.
- Sintesi granulare (
Scelte progettuali
- Dual-path per l’emozione: la sola prosodia non basta (stessa frase detta in modi diversi), la sola semantica non basta (parole senza intonazione). La fusione pesata dà una lettura più robusta.
- MIDI simbolico invece di audio diretto: il modello opera su token musicali (stessa famiglia dei transformer usati nel workshop), e la sintesi finale è demandata a Max/MSP, che è lo strumento giusto per il sound design ambient.
- Streaming via OSC: essenziale per l’interattività: nessun file intermedio, latenza minima.
Collegamento con la tesi
Questo progetto è il complemento pratico della mia tesi magistrale — “Conditioning Sound Generation with Emotions: An Investigation on Generative AI for Controllable Audio Synthesis” (relatore Prof. Antonio Rodà, co-relatore Dott. Matteo Spanio) — che indaga proprio come condizionare la generazione sonora sul contenuto emotivo.
Risultati
Il progetto è stato presentato alla fine del workshop come installazione interattiva funzionante. L’esperienza mi ha dato: lavoro in team internazionali multidisciplinari, leadership, e un’esposizione diretta alla ricerca di frontiera sulla generative music.
- Tesi: PDF
- Repo: Drift-Music-AI su GitHub