TTS(AI 목소리 · 내레이션)란?

쇼츠스미스 팀 · 마지막 수정

TTS(Text-to-Speech, 음성 합성)는 글자를 입력하면 사람처럼 읽어 주는 기술입니다. 예전의 기계음과 달리 요즘 TTS 는 숨소리 · 억양 · 감정까지 자연스러워, 목소리를 녹음하지 않고도 내레이션이 있는 영상을 만들 수 있습니다.

쇼츠에서는 «상황을 설명해 주는 목소리»가 있으면 처음 보는 사람도 내용을 따라오기 쉬워 정보 · 해설 · 스토리형 채널이 TTS 를 많이 씁니다.

TTS 내레이션이 맞는 영상 · 안 맞는 영상

  • 맞음 — 해설이 필요한 스포츠 분석, 뉴스 요약, 지식 · 정보, 스토리텔링
  • 안 맞음 — 원본의 목소리와 리액션이 재미인 예능 · 라이브(원본 소리를 살리는 편이 낫습니다)

자연스러운 TTS 내레이션 만들기

  • 글말이 아니라 입말로 씁니다 — «~입니다»보다 «~인데요»
  • 숫자 · 영어 약어는 읽히는 대로 적습니다(«NBA» → «엔비에이»)
  • 한 문장을 짧게, 쉼표로 호흡을 줍니다
  • 속도는 1.1~1.2배가 쇼츠 리듬에 맞습니다

쇼츠스미스의 내레이션 옵션

내레이션 양을 없음 · 적게 · 보통 · 많이 중에서 고르고 목소리를 선택합니다. «없음»이면 원본 소리와 자막만으로 만들고, «많이»면 클라이맥스만 원본 소리로 두고 처음부터 끝까지 내레이션이 이끕니다. 무료 요금제는 내레이션 없이, 라이트부터 TTS 를 쓸 수 있습니다.

자주 묻는 질문

TTS 목소리로 만든 영상도 수익창출이 되나요?

됩니다. 다만 유튜브는 «반복적이고 가치가 없는» 대량 생산 콘텐츠를 제한하므로, 원본 영상 위에 실제 설명과 편집이 더해져야 합니다.

내 목소리를 복제할 수 있나요?

쇼츠스미스는 준비된 목소리 중에서 고르는 방식입니다. 목소리 복제는 제공하지 않습니다.

함께 볼 글