AI 에이전트를 위한 음성 코어
음성 인식, 음성 합성, VITS 음성 합성, 오디오 데이터 전처리를 포함한 AI 에이전트 음성을 위한 Virtuals Protocol 음성 코어를 살펴보세요.
Voice Core는 각 VIRTUAL 에이전트에 고유하고 개성에 맞는 목소리를 부여합니다. AI 음성 모델 학습은 각 에이전트와 역할에 대해 사실적이고 일관된 음성을 생성합니다.
AI 에이전트 음성 모듈
음성-텍스트(STT): STT 모듈은 다양한 음성 데이터로 학습합니다. 사용자 시나리오 전반에 걸쳐 억양, 방언, 말하기 패턴을 정확하게 전사합니다.
텍스트-음성(TTS): TTS 모듈은 VITS(Variational Inference for Text-to-Speech) 학습을 사용합니다. VITS는 고품질의 자연스러운 음성을 생성하며, 각 AI 에이전트의 개성에 맞춘 음성 합성을 지원합니다.
음성 모델 학습 전에 오디오 데이터 전처리가 이루어집니다.
음성 모델을 위한 오디오 데이터 전처리
오디오 형식 일관성: 22050Hz의 모노 WAV 파일은 일관된 학습 입력을 생성합니다. 일관된 입력 데이터는 머신러닝 음성 모델이 안정적으로 동작하는 데 도움이 됩니다.
샘플링 레이트 정규화: 22050Hz 샘플링 레이트는 파일 크기를 적절하게 유지하면서 사람의 음성 주파수를 포착합니다. 나이퀴스트 정리에 따라 최대 11025Hz까지의 주파수를 포착합니다.
모노 오디오 채널: 스테레오 또는 다채널 오디오를 모노로 변환하면 음성 모델에 하나의 학습 채널을 제공하고 학습을 단순화합니다.
마지막 업데이트