본문 바로가기

전체 글

(121)
[화자 인식]Speaker Recognition 원리 및 응용 1. Speaker Recognition화자 인식(Speaker Recognition)은 음성 신호에 포함된 개인 고유의 특징을 분석하여 말하는 사람이 누구인지를 자동으로 판별하는 기술이다. 이는 음성인식이 '무엇을 말하는지'를 이해하는 것과 달리, 화자 인식은 '누가 말하는지'를 식별하거나 검증하는 데 초점을 맞춘다. 📌 화자 인식의 분류화자 식별 (Speaker Identification):등록된 여러 화자 중에서 현재 말하는 사람이 누구인지 찾아내는 과정이다. "지금 말하고 있는 사람은 누구인가?"라는 질문에 답한다.예를 들어, 회의록에서 여러 발언자 중 누가 발언했는지 자동으로 태그를 달거나, 여러 명의 가족 구성원 중 누가 스마트 스피커에 명령했는지 판별하는 데 사용될 수 있다.Closed..
[음성 합성]Voice Conversion 및 감정 표현 TTS 1. 음성 변환 (Voice Conversion)음성 변환은 한 사람의 목소리를 다른 사람의 목소리로 바꾸는 기술이다. 이때, 원본 음성의 내용, 감정, 억양 등은 그대로 유지하면서 목소리의 고유한 특징(음색, 성별, 나이 등)만 변경하는 것이 핵심이다. 📌 작동 원리핵심은 음성의 내용과 화자 특징을 분리한 후, 원하는 화자 특징을 주입하여 다시 합성하는 것이다. 특징 분리 (Feature Disentanglement):소스 음성 입력: 먼저 변환하고자 하는 원본 목소리를 입력받는다.정보 분리: 딥러닝 모델(인코더-디코더)은 이 음성에서 두 가지 핵심 정보를 분리한다.Content Embedding: 말하는 내용(단어, 문장 구조, 억양 등)에 해당하는 정보이다. 이 정보는 화자가 누구인지와 독립..
[음성 합성]WaveNet, HiFi-GAN 1. WaveNetWaveNet은 딥러닝 기반의 오디오 생성 모델이다. 특히 사람의 음성처럼 자연스러운 오디오 파형을 직접 생성하는 데 혁신적인 발전을 가져왔으며, 기존의 음성 합성 기술의 한계를 뛰어넘는 성능을 보여주었다. 📌 특징WaveNet은 raw 오디오 파형(waveform)을 직접 생성하는 최초의 딥러닝 모델이라는 점에서 큰 의의를 가진다. 즉, 음성 신호를 중간 특징으로 변환하지 않고, 수만 개의 오디오 샘플로 이루어진 원본 파형 자체를 예측하는 방식을 취한다. 1. 자기회귀(Autoregressive) 모델WaveNet은 자기회귀 모델이다. 이는 현재 시점의 오디오 샘플 값을 예측할 때, 이전 시점까지의 모든 샘플 값에 조건화되어 예측한다는 의미이다. 즉, 하나의 오디오 샘플을 순차적으..
[음성 합성]병렬 음성 합성 모델(FastSpeech2) 1. FastSpeech2 딥러닝 기반의 TTS는 크게 자기회귀(Autoregressive) 모델과 비자기회귀(Non-Autoregressive) 모델로 나눌 수 있다. 자기회귀 모델 (Tacotron, Tacotron2): 이전 시점의 출력이 다음 시점의 입력으로 사용되는 방식이다. 이 모델들은 매우 자연스러운 음성을 생성할 수 있지만, 음성 생성 속도가 느리다는 단점이 있다. 모든 음성 프레임을 순차적으로 생성해야 하므로 긴 문장일수록 시간이 오래 걸린다. 또한 Attention 메커니즘이 특정 단어를 건너뛰거나 반복하는 등 정렬(alignment) 오류를 일으킬 가능성도 있다.FastSpeech (FastSpeech1): 각 음소(phoneme)가 얼마나 오랫동안 발음되어야 하는지(duration)..
[음성 합성]음성 합성 구조(Text Analysis, Linguistic Processing, Acoustic Modeling, Vocoder, Waveform Generation) 1. 텍스트 분석 (Text Analysis) / 언어학적 처리 (Linguistic Processing)이 단계는 입력된 텍스트를 단순히 글자 덩어리로 보는 것이 아니라, 음성으로 변환하는 데 필요한 모든 언어학적 의미와 구조를 추출하는 과정이다. 텍스트 정규화 (Text Normalization / Pre-processing):목표: 숫자, 약어, 기호, 특수문자 등을 실제 발음되는 완전한 단어 형태로 변환한다.예시:"123" -> "맥이십삼""km" -> "킬로미터""Dr." -> "닥터"문장 분리 (Sentence Segmentation):목표: 입력돈 텍스트를 의미 있는 단위인 문장으로 나눈다.방법: 마침표, 물음표, 느낌표 등 문장 부호를 기준으로 분리하며, 약어 내의 마침표와 같이 문장 구..
[음성 합성]TTS 개념 및 주요 활용 사례 1. TTS (Text-to-Speech)TTS는 사람이 입력한 텍스트를 컴퓨터가 인식하여, 자연스러운 음성으로 출력하는 기술이다. 📌 TTS 구성요소텍스트 분석 (Linguistic Analysis)텍스트를 문장, 단어, 음절 단위로 분리하고 품사를 분석한다.숫자, 기호 등을 정규화한다.발음 정보로 변환한다.한국어: 자모 분리 -> 음소 변환영어: grapheme-to-phoneme 변환음소-프로소디 변환 (Prosody Generation)억양, 강세, 길이 등의 정보를 예측한다.문장의 구조에 따라 적절한 휴지(pause), 높낮이(pitch), 속도(duration) 설정음성 합성 (Speech Synthesis)최종적으로 음성을 생성한다. 📌 TTS 구현 방식규칙 기반 음성합성 (Form..
[음성 인식]실습 정리 1. CTC 기반 ASR: 정렬 없는 시퀀스 레이블링CTC(Connectionist Temporal Classification)은 입력 음성 시퀀스와 출력 텍스트 시퀀스 간의 명확한 정렬 정보가 없을 때 유용한 손실 함수이다. 기존의 음성 인식 모델은 음소 단위의 정렬(alignment) 작업이 필요했지만, CTC는 이러한 제약을 없앴다. 핵심 아이디어빈(Blank) 토큰 활용: CTC는 출력 시퀀스에 "빈(blank)" 토큰을 도입하여, 실제 음성 정보가 없는 부분이나 단어 사이의 간격을 표현한다.모든 경로 합산: 모델은 주어진 음성 입력에 대해 가능한 모든 정렬 경로(예측 시퀀스)를 고려하고, 이들의 확률을 합산하여 최종 손실을 계산한다.압축(Collapsing) 및 빈 토큰 제거: 각 타임스텝의 ..
[음성 인식]ASR 모델 평가(WER, CER, Accuracy) 1. Multi-Head Attention 입력 임베딩 생성각 레이어 내부의 처리 절차레이어 정규화 (Layer Normalization)목적: 신경망 훈련을 안정화하고 속도를 높임.멀티헤드 셀프-어텐션 (Multi-Head Self-Attention)Query, Key, Value 벡터 생성 (병렬 처리)어텐션 스코어 계산 (각 헤드에서 독립적으로):미래 토큰에 대한 정보가 유출되지 않도록 마스킹을 적용하고 마스킹된 스코어에 소프트맥스 함수를 적용하여 어텐션 가중치를 생성한다.가중치 합산 (각 헤드에서 독립적으로)헤드 결합 (Concatenation) 및 선형 변환:여러 헤드가 독립적으로 추출한 다양한 종류의 관계 정보를 통합하고, 이를 다음 레이어의 입력에 적합한 형태로 변환한다.잔차 연결 (Resi..