LiteASR: Efficient Automatic Speech Recognition with Low-Rank Approximation

Referenceshttps://arxiv.org/abs/2502.20583 LiteASR: Efficient Automatic Speech Recognition with Low-Rank ApproximationModern automatic speech recognition (ASR) models, such as OpenAI's Whisper, rely on deep encoder-decoder architectures, and their encoders are a critical bottleneck for efficient deployment due to high computational intensity. We introduce LiteASR, a low-rarxiv.org Introduction현 ..

Distill-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling

Referenceshttps://arxiv.org/pdf/2311.00430 IntroductionWhisper를 아는가?Speech-to-Text(STT) 분야에서 오늘날 가장 많이 사용되고 있는 모델이 OpenAI에서 2022년 개발한 Whisper라는 모델이다.Whisper는 seq2seq기반 구조를 택한 모델로 강력한 text decoder를 가지고 있고, 680,000시간 분량의 pretrain을 거쳐 아직까지도 이 분야에서 최고 성능을 내는 모델로 남아 있다. 그러나 이로 인해 모델이 너무 무겁다는 단점을 동시에 갖고 있다. 온디바이스 적용과 같은 실용적 접근을 위해선 파라미터 수 절감 및 연산 속도 개선 등 경량화 작업이 필수적인데, 동시에 경량화로 인해 기존 모델의 성능이 너무 떨어지지 ..

[CVPR 2024] VkD: Improving Knowledge Distillation using Orthogonal Projections

Referenceshttps://openaccess.thecvf.com/content/CVPR2024/papers/Miles_VkD_Improving_Knowledge_Distillation_using_Orthogonal_Projections_CVPR_2024_paper.pdf Introduction일반적으로 지식 증류는 소형 모델에서도 대형 모델만큼의 성능을 내고자 하는 의도로 수행하게 된다.그러나 막상 증류를 해보고 나면 생각했던 것만큼 성능이 잘 나오지 않았던 경험이 종종 있었을 것이다.왜일까? 많은 연구에서 다양한 이유를 제시하고 있다. Student - Teacher 간 갭이 너무 크거나, 둘 간의 모델 구조 차이가 너무 많이 나거나,여러 이유가 있지만, 이 논문에서는 작은 모델로의 증류 시..

Knowledge Distillation(지식 증류) - Overview

개요지식 증류는 일반적으로 이미 학습된 큰 모델(Teacher라 부름)에서, 동일 task를 수행하기 위한 더 작은 모델(Student라 부름)을 효율적으로 훈련하기 위해 사용하는 기법이다. 2015년에 제프리 힌튼이 처음으로 제안한 방법이다.(https://arxiv.org/abs/1503.02531) 이 방법론은 말 그대로 Teacher의 지식을 증류하여 Student에게 전달하는 것인데, 큰 메커니즘은 아래와 같다.Teacher와 Student에게 동일한 샘플을 보게 하고,Student는 task로부터의 loss(예를 들어, 분류 문제였으면 통상적으로 Cross-entropy, 회귀면 MSE 등이 사용될 수 있을 것이다.)를 학습함과 동시에,Teacher가 예측한 답안과 오차로부터의 loss(= t..

[202002]A Framework for the Robust Evaluation of Sound Event Detection

Author: Cagdas Bilen, Giacomo Ferroni, Faancesco Tuveri, Juan Azcarreta and Sacha Krstulovic | Arxivhttps://arxiv.org/abs/1910.08440  요약기존의 SED를 평가하는 방식에는 (1) OP 의존성 문제, (2) sound event 정의에 대한 주관성 문제, (3) CT를 고려하지 못하고 있다는 문제 등이 있었다. 그렇기 때문에 단순히 F1-score만을 사용하여 평가하기에는 적절하지 못했고, 이러한 문제를 해결하기 위해 DTC/GTC라는 개념을 활용해 FP/TP를 새롭게 정의하고, 이 과정에서 만들어지는 ROC Curve를 PSD-ROC Curve, 이의 AUC 계산값을 PSDS라고 정의하며 새로운 평가..

[201804]Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised deep learning results

Author: Antti Tarvainen and Harri Valpola | Arxiv, 2018https://arxiv.org/abs/1703.01780 요약 이 논문에서는 unlabeled data를 labeled data와 함께 학습에 활용하기 위한 Semi-supervised model을 소개한다. 제안하는 모델은 Mean Teacher로, 기존에 SSL에 사용되던 gamma-model이나 Temporal ensembling보다 더 우수한 성능을 낸다.  또 이 방법 덕분에 각 에포크 이후 업데이트되던 Temporal Ensembling과 달리, 매 학습 스텝마다 모델의 평균 가중치를 업데이트할 수 있게 되어 더 빠르게 학습할 수 있게 되었다. teacher-student 구조인 이 모델은 st..

[Fundamentals] 논문 2025.01.06 5

Audio & Speech 기본 개념

새로운 거 배울 때마다 그때그때 정리할 예정 Power에너지의 시간에 따른 변화율을 나타낸다. 일반적인 물리에서 사용하는 Power(전력) 개념과 같다. 단위는 W(Watt)이다.물리에서 일반적인 계산은 간단히 P = W/t로 하지만, 음파는 파동이기 때문에(즉 시간에 따라 에너지가 지속적으로 변하기 때문에) Amplitude의 제곱 평균으로 표현한다. 즉,으로 구하고,여기서 제곱을 사용하는 이유는, 음파는 진폭이 양수와 음수로 변동하므로 평균을 구하면 0이 될 가능성이 있기 때문이다. Decibel(dB)신호 크기(Amplitude 또는 Power)나 에너지 비율을 로그 스케일로 표현하는 단위이다.단위 자체는 비율을 나타내므로 절대적인 값을 갖지 않으며, 두 값의 비율을 비교하기 위해 사용된다. dB는..

[NIPS 2024] Neural Analysis and Synthesis: Reconstruction Speech from Self-Supervised Representations

(Reference) Hyeong-Seok, Choi., Juheon, Lee., Wan-Soo, Kim., Jie, Hwan, Lee., Hoon, Heo., Kyogu, Lee. (2021). Neural Analysis and Synthesis: Reconstructing Speech from Self-Supervised Representations.. arXiv: Soundhttps://proceedings.neurips.cc/paper_files/paper/2021/file/87682805257e619d49b8e0dfdc14affa-Paper.pdf  이 논문에서는 neural analysis and synthesis(NANSY)라는, 사람 음성 신호의 voice, pitch, speed을 조절..

[Audio Papers] 2024.05.08 7

자주 쓰이는 Acoustic feature와 추출 방법

오늘은 대중적으로 쓰이는 acoustic feature들에 대해 정리해 보려 한다.간단한 것들은 새로 배울 때마다 그때그때 내용을 추가할 예정이다.librosa : 대표적으로 사용하는 auduio domain 라이브러리이다. MFCC/Mel Spectrogram 등을 추출할 때 사용하며 이외에도 여러 피처를 추출할 때 자주 쓰인다.(Document) https://librosa.org/doc/latest/index.htmlopensmile : pitch, energy, formant 등을 추출할 수 있는 기능을 제공한다. (이러한 피처들이 감정 분석에 중요한 요소라고 한다)(Document) https://audeering.github.io/opensmile/parselmouth : Praat softw..

MFCC(Mel Frequency Cepstral Coefficient) 간단 정리

0. 참고 자료 멜 스펙트로그램(Mel Spectrogram) 간단 정리참고 자료https://en.wikipedia.org/wiki/Mel_scalehttps://m.blog.naver.com/sooftware/221661644808 1. Introduction나는 음성과 인공지능을 결합하는 작업에 관심을 가지고 있다.그래서 그와 관련된 연구/프로젝트를 많이dohyeon-ai.tistory.com(위 글을 읽고 오시면 이해가 수월해집니다.) Speech Processing for Machine Learning: Filter banks, Mel-Frequency Cepstral Coefficients (MFCCs) and What’s In-BetweenUnderstanding and computing ..