TTS란 무엇인가요?
문자 음성 변환(TTS) 합성 시스템은 음성 보조 기술에 사용하기 위해 작성된 텍스트를 음성으로 변환합니다. Side에서는 대형 기술 기업 고객들의 TTS 시스템에 사용하기 위한 데이터를 수집하고 관리합니다.
TTS 합성 모델을 구축하는 고객은 오디오, 일치하는 텍스트, 개별 단어의 발음 방법과 같은 텍스트에 대한 추가 정보가 필요합니다. 이러한 모든 데이터 포인트들은 자동으로 음성을 출력하고 텍스트를 정확하게 읽을 수 있는 모델을 훈련시키는데 사용되는 입력값입니다. TTS는 스마트폰과 스마트 스피커, 시각 장애인을 위한 보조 기술, 기차역과 공항, 점점 더 많은 애플리케이션에서 사용되고 있습니다.
인재 채용
문자 음성 변환 데이터 프로젝트의 첫 단계는 자격을 갖춘 링귀스트를 모집하는 것입니다. 지원자의 주요 필수 조건은 음성학과 음운론을 특히 중점적으로 정규 언어학을 전공했어야 한다는 것입니다. 국제 음성 기호(IPA) 또는 이와 유사한 방식을 사용하여 단어의 발음을 전사하는 경험이 있어야 합니다(대학 프로젝트 경험이라도 무방). 또한 링귀스트들은 우리가 모집하고자 하는 언어의 원어민이어야 합니다.
잠재적인 후보자들은 (고객이 설계한) 주로 발음 전사로 구성된 심사 테스트와 면접을 통과해야 합니다.
방언 선정
많은 언어들은 지역에 따라서 매우 다릅니다. 그렇지만 TTS 시스템의 목적을 고려하면, 가능한 한 구체적으로 특정 변종들을 정의해야 합니다. 데이터 수집을 위한 목표 방언을 선택하기 위해 링귀스트들이 고려해야 할 사항은 다음과 같습니다.
- 방송용 뉴스에서 사용하는 방언은 어떤 것인가?
- 수도, 또는 주요 도심에서 사용되는 방언은 어떤 것인가?
- 화자들이 언어를 전환하는가(말을 할 때 둘 이상의 언어를 구사하는가)?
- 해당 언어에서 구어와 문어체 간에 차이가 있는가?
음운 체계 및 어휘
TTS 시스템은 또한 해당 언어에 대한 언어학적 정의가 필요합니다. 우리의 링귀스트들은 해당 언어에서 허용되는 음소(고유한 소리)의 집합과 어떤 소리의 조합이 유효한지(음운론)를 정의하는 것을 돕습니다.
시스템은 이 정보와 훈련 데이터(음성과 일치하는 텍스트)를 사용하여 문자를 음소로 변환하는 방법을 학습하여 텍스트를 음성으로 바꿉니다. 우리의 목표는 모든 단어를 자동으로 발음할 수 있는 모델을 만드는 것입니다. 안타깝지만 작업이 항상 그렇게 단순하지는 않습니다. 링귀스트들은 특히 덜 일반적인 단어, 외래어, 일반적인 발음 규칙을 따르지 않는 단어들의 발음을 명시적으로 표기해야 하는 경우가 많습니다. 이러한 모든 철자와 발음은 발음 사전이라고 하는 특별한 사전에 수록됩니다.
스크립트 큐레이션
TTS 데이터 프로젝트의 다음 단계는 성우가 낭독하고 녹음할 스크립트를 준비하는 것입니다. 이 스크립트의 목표는 해당 언어에서 허용되는 모든 음소 조합을 포함하는 것입니다. 또한 스크립트가 쉽게 읽을 수 있도록 확인합니다. 마지막으로, 모델이 고품질 학습 데이터를 받을 수 있도록 스크립트의 모든 단어의 발음을 확인하고 사전에 기록합니다.
캐스팅 및 녹음
TTS 데이터 프로젝트의 끝에서 두 번째 단계는 오디오 레코딩입니다. 이를 위해 목표 방언을 모국어로 구사하는 성우를 찾아야 합니다. 작성된 스크립트는 사전에 익힐 수 없는 만큼 이를 담당할 성우는 읽는 능력이 뛰어나야 합니다.
선택된 성우는 이전에 준비한 스크립트를 녹음하게 되며, 필요한 경우 사전의 발음을 업데이트합니다(예를 들어, 성우가 특정 단어를 일정한 방식으로 발음하는 경우, 사전의 발음이 최대한 일치하도록 업데이트).
Side는 전 세계에서 TTS 레코딩에 최적화된 스튜디오 및 팀을 구성하는 일에 특화되어 있습니다. 40개 이상의 언어와 지역에서 성우 캐스팅과 녹음을 진행해 왔습니다.
TTS를 위한 캐스팅과 녹음은 다른 유형의 성우 녹음과는 매우 다릅니다. 각 라인은 반드시 균일하고 일관된 톤과 음량으로 읽어야 합니다. 또한 스크립트를 읽을 때 목소리는 자연스러워야 하며, 지나치게 연기톤이 되어선 안 됩니다. 이는 균일한 학습 데이터를 보장하기 위한 것으로, 일반적으로 TTS 음성에서 더 부드러운 합성 음성을 이끌어냅니다.
오디오 평가
그런 다음 링귀스트들은 오디오가 텍스트와 일치하는지, 그리고 성우의 발음이 유효하며 우리의 어휘 사전에 저장된 것과 일치하는지 확인하기 위해 녹음을 평가해야 합니다. 이 단계에서 필요한 경우 어휘 사전 항목을 업데이트할 수 있습니다.
모든 작업이 클라이언트 도구로 이루어지기 때문에 평가 단계가 끝날 때 데이터 전달이 없습니다. 오디오의 품질 및 정확도에 대한 평가가 완료되면, Side는 이 프로세스에서 물러나며, 고객 측 팀에서 새로운 오디오 파일을 사용할 준비를 마칩니다. TTS는 테크 기업들이 접근성 기능을 자신의 제품 또는 업무에 통합하는 과정에서 큰 부분을 차지하고 있으며, Side는 해당 업무를 훌륭히 보조하고 있습니다.
여러분의 사업에 TTS 같은 것을 통합하는 전략의 수립은 까다로울 수 있습니다. Side와 더불어 TTS를 진행하는 경우 어떻게 도움이 될 수 있는지 무료 상담을 받아보세요.