Skip to content

Shhb-Coder-1999/Speech-Signal-Processing-using-python

Repository files navigation

Speech Signal Processing

[Uni · Multimedia Systems · 2022]

Speaker verification using speech signal processing — extracts acoustic features from .wav recordings and uses Dynamic Time Warping (DTW) to compute similarity distances between speakers.

Pipeline

WAV file
  └── Normalize + Trim silence (librosa)
      └── Pre-emphasis filter
          └── Framing (25ms windows, 10ms hop)
              └── Feature extraction per frame:
                  ├── MFCC (Mel-frequency cepstral coefficients)
                  ├── Zero-crossing rate
                  ├── LPC (Linear Predictive Coding, order=16)
                  └── Energy (sum of squared samples)
                      └── DTW distance matrix (feature sequence alignment)
                          └── CSV output

Datasets

Two classes of recordings in audio_files/:

Folder Class
set_family/ Family member recordings (10 speakers × 10 samples)
set_OtherWords/ Other-word recordings for contrast

Results are written to Family_DataSets_futures.csv — a 10×10 DTW distance matrix between all speaker pairs.

Run

pip install -r requirements.txt
python main.py

Stack

  • Python 3
  • librosa — audio loading, MFCC, pre-emphasis, trim
  • dtw-python — Dynamic Time Warping distance
  • numpy / scipy — signal math

About

Uni Multimedia 2022 - MFCC feature extraction and Dynamic Time Warping in Python

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

No releases published

Packages

 
 
 

Contributors

Languages