전체 글 6

6주차

이번에는 만들어진 데이터셋을 토대로 코드를 실행시켜 accuracy와 loss를 알아보려 하였다.하지만 AI hub에서 데이터를 다운 받는 과정에서 오류가 계속 나서 실제로 결과값을 뽑아보진 못했다.코드를 읽어보면서 직접 작성해보면서 해당 오디오 데이터를 진행하면 나오는 결과값에 대해서 알아보았다.다음과 같은 과정을 거친다면 아래와 같은 결과값이 나오게 된다.https://www.aihub.or.kr/aihubdata/data/view.do?currMenu=115&topMenu=100&aihubDataSe=data&dataSetSn=537 AI-Hub샘플 데이터 ? ※샘플데이터는 데이터의 이해를 돕기 위해 별도로 가공하여 제공하는 정보로써 원본 데이터와 차이가 있을 수 있으며, 데이터에 따라서 민감한 정..

카테고리 없음 2024.08.19

5주차

다음과 같이 데이터를 데이터셋을 훈련용(train)과 검증용(val)으로 나누는 비율을 정의합니다. 여기서는 80%를 훈련용, 20%를 검증용으로 나눈다. train_dataset : dataset_pair 리스트의 처음 80% 데이터를 훈련용으로 할당한다.val_dataset : dataset_pair 리스트의 나머지 20% 데이터를 검증용으로 할당한다.그 후 json 파일로 저장을 한뒤 파일들을 불러와 데이터셋의 크기를 출력해 데이터의 크기를 알아본다.  이 클래스는 PyTorch의 Dataset 클래스를 상속받아 새로운 데이터셋 클래스를 정의한다. data_list : 오디오 파일 경로와 레이블 정보를 담은 리스트이다.audio_len : 각 오디오 샘플의 길이 (초 단위)이다.mfcc_transf..

카테고리 없음 2024.08.17

4주차

화자 검증을 진행하기 위해서는 크게 데이터셋 준비 과정과 모델 구조 및 학습 과정으로 나뉠 수 있는데이번 주차에는 데이터셋 준비에 대해서 다뤄볼 예정이다. 데이터 전처리 과정-torch: 기본적인 텐서 연산과 신경망 모델 구현에 필요한 PyTorch의 핵심 라이브러리- torch.nn: 신경망 레이어, 손실 함수 등을 구현하기 위한 모듈- torch.optim: 모델 학습을 위한 최적화 알고리즘을 제공하는 모듈- torch.utils.data: 데이터셋 로더를 만들기 위한 유틸리티를 제공 데이터 처리 관련 및 시각화 관련 라이브러리- numpy: 수치 연산을 위한 Python 라이브러리로, 배열 연산에 유용하다..- pandas: 데이터 프레임을 이용한 데이터 분석에 사용됨- json: JSON 형식의 ..

카테고리 없음 2024.08.17

7/19 3주차

torchaudio와 librosa 라는 라이브러리에 대해서 알아보았다.Torchaudio는 PyTorch의 오디오 관련 패키지로, 화자 검증 작업에 사용될 수 있다. 화자 검증은 주어진 오디오 샘플이 특정 화자의 음성인지 확인하는 작업인데 이 작업에는 일반적으로 음성 신호의 특징 추출, 신경망 기반의 임베딩 생성, 그리고 검증 단계가 포함된다. Librosa는 파이썬 기반의 오디오 및 음악 분석 라이브러리로, 다양한 오디오 파일의 로드, 변환, 특징 추출 등을 지원한다. 특히 음악 정보 검색 분야에서 널리 사용된다. Librosa는 오디오 분석과 처리에 필요한 다양한 기능을 제공하여, 화자 검증(Speaker Verification)에도 유용하게 사용될 수 있다.  이 두개 중 Librosa에 대해서 ..

카테고리 없음 2024.07.22

7/11 2주차

화자 검증(speaker verification)화자 검증은 특정한 화자가 말한 음성인지 확인하는 기술인데 주로 보안 및 인증 시스템에서 사용되며, 화자의 신원을 확인하기 위해 음성을 사용하는 방법이다. 이는 텍스트 종속과 텍스트 독립의 두 가지 유형으로 나뉜다.텍스트 종속 검증은 검증을 위해 특정 구 또는 문장을 사용해야 하는 방식으로 시스템이 요구하는 특정 문장을 말해 학습시킨다. 이는 높은 정확도라는 장점이 있고 시스템이 특정 문구에 대해 훈련되었기 때문에 음성 패턴을 더 정확하게 분석할 수 있다.텍스트 독립 검증은 검증을 위해 특정한 문장을 사용할 필요가 없으며 일반적인 대화나 임의의 문구를 이용한 검증한다. 이는 검증 과정에서의 유연성이 적용되며 사용자가 자유롭게 말을 할 수 있어 편리한 장점이..

카테고리 없음 2024.07.17

7/6 활동 1주차

**화자인식** : 특정 개인이 발성한 음성을 인식하여 그 화자가 누구인가를 알아내는 기술화자인식은 화자식별, 화자검증, 화자분리, 화자분할로 이루어져 있다. 화자 식별은 시스템이 주어진 음성 신호로부터 화자가 누구인지 알아내는 작업이고 화자 검증은 주어진 음성 신호가 특정 화자에 속하는지 여부를 확인하는 작업이다. 화자 분리는 다중 화자가 동시에 말하는 상황에서 각 화자의 음성을 분리하는 것이며, 화자 분할은 단일 오디오 스트림에서 발화 구간을 식별하고 각각의 구간이 어떤 화자에 속하는지 지정하는 작업이다.

카테고리 없음 2024.07.17