쇼츠 내레이션(TTS) 넣는 법

쇼츠스미스 팀 · 마지막 수정

TTS 내레이션은 대본을 AI 목소리로 읽어 영상 위에 얹는 방식입니다. 목소리를 녹음하지 않아도 되고 매번 같은 톤이 유지되어, 얼굴 없는 정보 · 해설 · 스토리 채널이 대부분 이 방식을 씁니다.

순서는 «대본 → 목소리 선택 → 합성 → 장면과 맞추기 → 볼륨 조정»입니다. 도구를 쓰면 합성과 장면 맞춤은 자동이고, 사람이 할 일은 대본 검수와 «어디까지 내레이션을 넣을지» 정하는 것입니다.

내레이션 양부터 정한다

  • 없음 — 원본 소리 + 자막. 예능 · 라이브 · 경기 소리가 재미인 영상
  • 적게 — 시작과 끝에 한 줄씩. 리액션 · 하이라이트 모음
  • 보통 — 장면 사이를 이야기로 잇고 결정적 순간은 원본 소리
  • 많이 — 처음부터 끝까지 내레이션이 이끌고 클라이맥스만 원본 소리. 분석 · 뉴스 · 정보

TTS 가 자연스럽게 읽는 대본 쓰기

  • 입말로 — «~입니다»보다 «~인데요», «~거든요»
  • 숫자 · 약어는 읽히는 대로 — «NBA» → «엔비에이», «3점» → «쓰리점»(채널 표기에 맞게)
  • 한 문장 20자 안팎, 쉼표로 호흡
  • 속도 1.1~1.2배가 쇼츠 리듬에 맞습니다

목소리 고르기

스포츠 · 액션은 중저음, 정보 · 꿀팁은 밝고 빠른 톤, 다큐 · 스토리는 담백한 톤이 무난합니다. 채널 전체에 한 목소리를 고정하면 «채널 목소리»로 기억됩니다.

원본 소리와 섞기

내레이션 구간에서는 원본 소리를 -15~-20dB 로 낮추고, 결정적 장면(골 · 함성 · 결론)에서는 내레이션을 비우고 원본을 100% 살립니다. 배경음악은 내레이션보다 더 작게 둡니다.

쇼츠스미스에서

새로 만들기에서 내레이션 양(없음 · 적게 · 보통 · 많이)과 목소리를 고르면 대본 → TTS → 장면 맞춤 → 렌더가 자동입니다. 검수 화면에서 문장을 고치면 해당 문장만 다시 합성됩니다. 무료 요금제는 내레이션 없이(원본 소리 + 자막) 만들고, 라이트부터 TTS 를 쓸 수 있습니다.

자주 묻는 질문

TTS 영상은 수익창출이 안 된다던데요?

TTS 자체는 문제가 아닙니다. 유튜브가 제한하는 것은 «반복적이고 가치가 없는 대량 콘텐츠»이므로, 편집 · 해설 · 자막으로 실제 가치를 더하면 됩니다.

내레이션이 장면보다 길면 어떻게 되나요?

보통 장면을 느리게 늘리거나 컷을 더 붙입니다. 내레이션을 «적게»로 두면 화면을 늘리는 일이 줄어 자연스럽습니다.

함께 볼 글