[Uni · Multimedia Systems · 2022]
Speaker verification using speech signal processing — extracts acoustic features from .wav recordings and uses Dynamic Time Warping (DTW) to compute similarity distances between speakers.
WAV file
└── Normalize + Trim silence (librosa)
└── Pre-emphasis filter
└── Framing (25ms windows, 10ms hop)
└── Feature extraction per frame:
├── MFCC (Mel-frequency cepstral coefficients)
├── Zero-crossing rate
├── LPC (Linear Predictive Coding, order=16)
└── Energy (sum of squared samples)
└── DTW distance matrix (feature sequence alignment)
└── CSV output
Two classes of recordings in audio_files/:
| Folder | Class |
|---|---|
set_family/ |
Family member recordings (10 speakers × 10 samples) |
set_OtherWords/ |
Other-word recordings for contrast |
Results are written to Family_DataSets_futures.csv — a 10×10 DTW distance matrix between all speaker pairs.
pip install -r requirements.txt
python main.py- Python 3
- librosa — audio loading, MFCC, pre-emphasis, trim
- dtw-python — Dynamic Time Warping distance
- numpy / scipy — signal math