ГІБРИДИЗАЦІЯ МЕТОДІВ ВИЛУЧЕННЯ ОЗНАК У СИСТЕМІ ГОЛОСОВОЇ ІДЕНТИФІКАЦІЇ КОРИСТУВАЧА

Authors

  • Maksym Bondarenko
  • Heorhii Ivashchenko

DOI:

https://doi.org/10.26906/SUNZ.2026.3.068

Keywords:

біометричні системи голосової ідентифікації, гібридизація методів, вилучення ознак, MFCC, штучні нейронні мережі, згорткова мережа VGGish, навчання проєкційного шару, злиття ознак

Abstract

Актуальність. Практичне застосування систем голосової ідентифікації обумовлює необхідність високої точності розпізнавання, обчислювальної ефективності та стійкості до синтезованих підробок голосу. Статистичні підходи, такі як акустичний аналіз та спектральне порівняння, є невимогливими до апаратних ресурсів, проте поступаються за точністю сучасним глибинним підходам на основі машинного навчання. Штучні нейронні мережі, попри вищу точність, характеризуються значними обчислювальними витратами та чутливістю до викривлень. Одним із можливих шляхів вирішення є гібридизація методів на етапі вилучення ознак, що передбачає поєднання статистичного акустичного аналізу та нейромережевого підходу в єдиному векторному просторі. Об’єкт дослідження: гібридизація методів вилучення ознак у системі голосової ідентифікації на основі поєднання статистичного акустичного аналізу та штучної нейронної мережі. Предмет дослідження: метод гібридного вилучення ознак, що поєднує MFCC-вектори та вектори ознак нейронної мережі в єдиному векторному просторі, із порівняльним аналізом способів їх поєднання. Мета дослідження: розробка та дослідження методу гібридного вилучення ознак для підвищення точності голосової ідентифікації. Завдання дослідження. Реалізувати запропоновані підходи гібридизації статистичних та нейромережевих методів вилучення ознак у єдиному векторному просторі; експериментально оцінити точність ідентифікації у режимах closed-set та open-set; дослідити обчислювальну ефективність і масштабованість запропонованих варіантів. Методи дослідження. Статистичний акустичний аналіз на основі мел-частотних кепстральних коефіцієнтів, згорткова нейронна мережа на основі архітектури VGGish, метод головних компонент для зниження розмірності, навчання проєкційного шару за критерієм кутового відступу, експериментальне порівняння отриманих результатів на наборі даних VoxCeleb1. Результати дослідження. Запропоновано та досліджено три варіанти гібридизації на рівні вилучення ознак, такі як конкатенація нормованих векторів, зважена лінійна комбінація після зниження розмірності та злиття через навчений проєкційний шар. Отримані результати демонструють скорочення EER та підвищення точності ідентифікації порівняно з використанням кожного методу окремо. Висновки. Результати дослідження підтверджують доцільність застосування гібридизації методів на етапі вилучення ознак для підвищення точності ідентифікації мовця. Встановлено, що гібридизація шляхом злиття через навчений проєкційний шар забезпечує найвищу точність, тоді як конкатенація нормованих векторів не потребує додаткового навчання.

Downloads

Download data is not yet available.

References

1. Chung, J.S., Huh, J., Mun, S., Lee, M., Heo, H.-S., Choe, S., Ham, C., Jung, S., Lee, B.-J., and Han, I. (2020), “In Defence of Metric Learning for Speaker Recognition”, Interspeech 2020, Shanghai, China, pp. 2977–2981, doi: https://doi.org/10.21437/Interspeech.2020-1064 DOI: https://doi.org/10.21437/Interspeech.2020-1064

2. Chen, Z. et al. (2022), “Large-Scale Self-Supervised Speech Representation Learning for Automatic Speaker Verification”, ICASSP 2022 – 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Singapore, pp. 6147–6151, doi: https://doi.org/10.1109/ICASSP43922.2022.9747814 DOI: https://doi.org/10.1109/ICASSP43922.2022.9747814

3. Ramzan, H.A., Zahra, S., Ramzan, S., Musa, S.M.A., Kalsum, T., and Jalil, R. (2024), “Speaker Identification Using Convolutional Neural Networks and Mel-Frequency Cepstral Coefficients”, 2024 5th International Conference on Innovative Computing (ICIC), Lahore, Pakistan, pp. 1–6, doi: https://doi.org/10.1109/ICIC63915.2024.11116334 DOI: https://doi.org/10.1109/ICIC63915.2024.11116334

4. Hershey, S., Chaudhuri, S., Ellis, D.P.W., Gemmeke, J.F., Jansen, A., Moore, R.C., Plakal, M., Platt, D., Saurous, R.A., Seybold, B., Slaney, M., Weiss, R.J., and Wilson, K. (2017), “CNN architectures for large-scale audio classification”, 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), New Orleans, LA, USA, pp. 131– 135, doi: https://doi.org/10.1109/ICASSP.2017.7952132 DOI: https://doi.org/10.1109/ICASSP.2017.7952132

5. Snyder, D., Garcia-Romero, D., Sell, G., Povey, D., and Khudanpur, S. (2018), “X-Vectors: Robust DNN Embeddings for Speaker Recognition”, 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Calgary, AB, Canada, pp. 5329–5333, doi: https://doi.org/10.1109/ICASSP.2018.8461375 DOI: https://doi.org/10.1109/ICASSP.2018.8461375

6. Aliaskar, M., Mazakov, T., Mazakova, A., Jomartova, S., and Shormanov, T. (2022), “Human voice identification based on the detection of fundamental harmonics”, 2022 IEEE 7th International Energy Conference (ENERGYCON), Riga, Latvia, pp. 1–4, doi: https://doi.org/10.1109/ENERGYCON53164.2022.9830471 DOI: https://doi.org/10.1109/ENERGYCON53164.2022.9830471

7. Okabe, K., Koshinaka, T., and Shinoda, K. (2018), “Attentive Statistics Pooling for Deep Speaker Embedding”, Interspeech 2018, Hyderabad, India, pp. 2252–2256, doi: https://doi.org/10.21437/Interspeech.2018-993 DOI: https://doi.org/10.21437/Interspeech.2018-993

8. Paszke, A., Gross, S., Massa, F., Lerer, A., Bradbury, J., Chanan, G., Killeen, T., Lin, Z., Gimelshein, N., Antiga, L., Desmaison, A., Köpf, A., Yang, E., DeVito, Z., Raison, M., Tejani, A., Chilamkurthy, S., Steiner, B., Fang, L., Bai, J., and Chintala, S. (2019), “PyTorch: An Imperative Style, High-Performance Deep Learning Library”, Advances in Neural Information Processing Systems 32 (NeurIPS 2019), pp. 8024–8035, URL: https://papers.nips.cc/paper/9015-pytorch-animperative-style-high-performance-deep-learning-library

9. Snyder, D., Garcia-Romero, D., Povey, D., and Khudanpur, S. (2017), “Deep Neural Network Embeddings for TextIndependent Speaker Verification”, Interspeech 2017, Stockholm, Sweden, pp. 999–1003, doi: https://doi.org/10.21437/Interspeech.2017-620 DOI: https://doi.org/10.21437/Interspeech.2017-620

10. Бондаренко М.Є., Іващенко Г.С. Багатовекторна голосова ідентифікація користувача з урахуванням фонетичних варіацій голосу. Системи управління, навігації та зв’язку. Полтава: ПНТУ, 2026. Вип. 1 (83). С. 40–44. doi: https://doi.org/10.26906/SUNZ.2026.1.040 DOI: https://doi.org/10.26906/SUNZ.2026.1.040

11. Бондаренко М.Є., Іващенко Г.С. Методи оновлення профіля користувача в системах багатовекторної голосової ідентифікації. Вісник Хмельницького національного університету. Технічні науки. 2026. № 2 (363). С. 371–378. doi: https://doi.org/10.31891/2307-5732-2026-363-51 DOI: https://doi.org/10.31891/2307-5732-2026-363-51

12. Бондаренко М.Є., Іващенко Г.С. Використання послідовності методів попередньої обробки в системах голосової ідентифікації. Системи управління, навігації та зв’язку. Полтава: ПНТУ, 2025. Вип. 2 (80). С. 90–96. doi: https://doi.org/10.26906/SUNZ.2025.2.090 DOI: https://doi.org/10.26906/SUNZ.2025.2.090

13. Nassif, A.B., Shahin, I., Attili, I., Azzeh, M., and Shaalan, K. (2019), “Speech Recognition Using Deep Neural Networks: A Systematic Review”, IEEE Access, vol. 7, pp. 19143–19165, doi: https://doi.org/10.1109/ACCESS.2019.2896880 DOI: https://doi.org/10.1109/ACCESS.2019.2896880

14. Jahangir, R., Teh, Y.W., Memon, N.A., Mujtaba, G., Zareei, M., Ishtiaq, U., Akhtar, M.Z., and Ali, I. (2020), “TextIndependent Speaker Identification Through Feature Fusion and Deep Neural Network”, IEEE Access, vol. 8, pp. 32187– 32202, doi: https://doi.org/10.1109/ACCESS.2020.2973541 DOI: https://doi.org/10.1109/ACCESS.2020.2973541

15. Bora, B., Emanet, A.E., Elmacı, E., Kandaz, D., and Uçar, M.K. (2023), “Hybrid AI-based Voice Authentication”, Turkish Journal of Forecasting, vol. 7, no. 2, pp. 17–22, doi: https://doi.org/10.34110/forecasting.1260073 DOI: https://doi.org/10.34110/forecasting.1260073

16. Al-Tekreeti, N., and Ibrahim, A. A. (2020), “Speaker Voice Recognition Using A Hybrid PSO/Fuzzy Logic System”, 2020 4th International Symposium on Multidisciplinary Studies and Innovative Technologies (ISMSIT), Istanbul, Turkey, pp. 1–5, doi: https://doi.org/10.1109/ISMSIT50672.2020.9254309 DOI: https://doi.org/10.1109/ISMSIT50672.2020.9254309

17. Shahzad, K., Farhan, S., Yasin-Ul-Haq, Sana, R., and Pathan, S. (2025), “Enhancing Voice Spoofing Detection: A Hybrid Approach With VGGish-LSTM Model for Improved Security in Automatic Speaker Verification Systems”, IEEE Access, vol. 13, pp. 40682–40702, doi: https://doi.org/10.1109/ACCESS.2025.3544639 DOI: https://doi.org/10.1109/ACCESS.2025.3544639

18. Hasan Abdulqader, A., Al-Haddad, S.A.R., Abdo, S., Abdulghani, A., and Natarajan, S. (2022), "Hybrid Feature Extraction MFCC and Feature Selection CNN for Speaker Identification Using CNN: A Comparative Study", 2022 2nd International Conference on Emerging Smart Technologies and Applications (eSmarTA), Marib, Yemen, doi: https://doi.org/10.1109/eSmarTA56775.2022.9935422 DOI: https://doi.org/10.1109/eSmarTA56775.2022.9935422

19. Shen, Q., Guo, M., and Huang, Y. et al. (2024), "Attentional multi-feature fusion for spoofing-aware speaker verification", International Journal of Speech Technology, vol. 27, pp. 377–387, doi: https://doi.org/10.1007/s10772-024-10112-w DOI: https://doi.org/10.1007/s10772-024-10112-w

20. Shah, Z., Jang, G., and Farooq, A. (2024), "Feature Fusion for Performance Enhancement of Text Independent Speaker Identification", ICCK Transactions on Intelligent Systematics, vol. 2, no. 1, pp. 27–37, doi: https://doi.org/10.62762/TIS.2024.649374 DOI: https://doi.org/10.62762/TIS.2024.649374

21. Karthikeyan, V., Priyadharsini, S.S., and Balamurugan, K. (2025), "Attention-based multi dimension fused-feature convolutional neural network framework for speaker recognition", Multimedia Tools and Applications, vol. 84, pp. 38927– 38957, doi: https://doi.org/10.1007/s11042-025-20694-5 DOI: https://doi.org/10.1007/s11042-025-20694-5

22. Variani, E., Lei, X., McDermott, E., Lopez-Moreno, I., and Gonzalez-Dominguez, J. (2014), “Deep neural networks for small footprint text-dependent speaker verification”, 2014 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Florence, Italy, pp. 4052–4056, doi: https://doi.org/10.1109/ICASSP.2014.6854363 DOI: https://doi.org/10.1109/ICASSP.2014.6854363

23. Todisco, M., Wang, X., Vestman, V., Sahidullah, Md., Delgado, H., Nautsch, A., Yamagishi, J., Evans, N., Kinnunen, T., and Lee, K. A. (2019), “ASVspoof 2019: Future Horizons in Spoofed and Fake Audio Detection”, Interspeech 2019, Graz, Austria, pp. 1008–1012, doi: https://doi.org/10.21437/Interspeech.2019-2249 DOI: https://doi.org/10.21437/Interspeech.2019-2249

24. Tak, H., Patino, J., Todisco, M., Nautsch, A., Evans, N., and Larcher, A. (2021), “End-to-End anti-spoofing with RawNet2”, 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Toronto, ON, Canada, pp. 6369–6373, doi: https://doi.org/10.1109/ICASSP39728.2021.9414234 DOI: https://doi.org/10.1109/ICASSP39728.2021.9414234

25. Semenov, S., Davydov, V., and Grynov, D. (2024), “Study of Machine Learning Methods for Voice Biometric Identification in Data Protection Systems”, 2024 14th International Conference on Dependable Systems, Services and Technologies (DESSERT), Athens, Greece, pp. 1–6, doi: https://doi.org/10.1109/DESSERT65323.2024.11122211 DOI: https://doi.org/10.1109/DESSERT65323.2024.11122211

26. Hsu, W.-N., Bolte, B., Tsai, Y.-H. H., Lakhotia, K., Salakhutdinov, R., and Mohamed, A. (2021), “HuBERT: SelfSupervised Speech Representation Learning by Masked Prediction of Hidden Units”, IEEE/ACM Transactions on Audio, Speech, and Language Processing, vol. 29, pp. 3451–3460, doi: https://doi.org/10.1109/TASLP.2021.3122291 DOI: https://doi.org/10.1109/TASLP.2021.3122291

27. Wang, H., Wang, Y., Zhou, Z., Ji, X., Gong, D., Zhou, J., Li, Z., and Liu, W. (2018), “CosFace: Large Margin Cosine Loss for Deep Face Recognition”, 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Salt Lake City, UT, USA, pp. 5265–5274, doi: https://doi.org/10.1109/CVPR.2018.00552 DOI: https://doi.org/10.1109/CVPR.2018.00552

28. Zeghidour, N., Teboul, O., de Chaumont Quitry, F., and Tagliasacchi, M. (2021), “LEAF: A Learnable Frontend for Audio Classification”, International Conference on Learning Representations (ICLR 2021), 16 p., available at: https://openreview.net/pdf?id=jM76BCb6F9m

29. Desplanques, B., Thienpondt, J., and Demuynck, K. (2020), “ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification”, Interspeech 2020, Shanghai, China, pp. 3830–3834, doi: https://doi.org/10.21437/Interspeech.2020-2650 DOI: https://doi.org/10.21437/Interspeech.2020-2650

30. Kurada, S., and Kurada, A. (2020), “Poster: VGGish Embeddings Based Audio Classifiers to Improve Parkinson’s Disease Diagnosis”, 2020 IEEE/ACM International Conference on Connected Health: Applications, Systems and Engineering Technologies (CHASE), Crystal City, VA, USA, pp. 9–11, doi: https://doi.org/10.1145/3384420.3431775

31. Nagrani, A., Chung, J. S., and Zisserman, A. (2017), “VoxCeleb: A Large-Scale Speaker Identification Dataset”, Interspeech 2017, Stockholm, Sweden, pp. 2616–2620, doi: https://doi.org/10.21437/Interspeech.2017-950 DOI: https://doi.org/10.21437/Interspeech.2017-950

32. Chung, J.S., Nagrani, A., and Zisserman, A. (2018), “VoxCeleb2: Deep Speaker Recognition”, Interspeech 2018, Hyderabad, India, pp. 1086–1090, doi: https://doi.org/10.21437/Interspeech.2018-1929 DOI: https://doi.org/10.21437/Interspeech.2018-1929

Downloads

Published

2026-09-18

Most read articles by the same author(s)