iOS 26.6.1 업데이트, 보안 취약점 29개 막은 이유와 지금 해야 할 일
일레브랩스(ElevenLabs) 한국어 목소리 설정과 감정 태그 사용법을 정리했습니다. 자연스러운 한국어 발음 만드는 법, 인기 보이스 찾는 법, 오디오 태그 예시까지 초보자도 이해하기 쉽게 설명합니다.
일레브랩스로 한국어 음성을 만들었는데 어색한 외국인 억양이 섞여 나온 적 있으신가요?
대부분은 모델 선택과 목소리(보이스) 선택 방법을 몰라서 생기는 문제입니다. 감정 태그까지 활용하면 훨씬 자연스러운 음성을 만들 수 있습니다.
커뮤니티 후기나 사용 사례를 보면, 일레브랩스를 처음 쓸 때 기본으로 잡히는 영어 중심 모델로 한국어를 생성했을 때 나오는 부자연스러운 발음을 지적하는 경우가 자주 눈에 띕니다.
2026년 2월 정식 출시된 최신 모델 'Eleven v3'에서는 한국어 성능이 크게 개선된 것으로 알려져 있지만, 그래도 아래 설정을 챙기면 결과물 품질이 눈에 띄게 달라지는 경우가 많습니다.
① 모델을 Multilingual v2 또는 v3로 선택
속도가 빠른 'Turbo' 계열 모델은 저지연이 강점이지만, 자연스러운 억양 표현이 중요한 작업에서는 Multilingual 계열 모델을 선호하는 사용자가 많은 것으로 보입니다. 한국어처럼 억양이 중요한 언어라면 Multilingual v2나 최신 v3를 먼저 시도해보는 것을 권합니다.
② Voice Library에서 언어 필터를 'Korean'으로 설정
목소리 보관함(Voice Library)에서 언어 필터를 한국어로 맞추면, 다른 한국 사용자들이 만들어 공유한 한국어 특화 보이스를 찾을 수 있습니다.
③ 커뮤니티 공유 보이스 활용
한국인 사용자가 직접 학습시켜 공유한 보이스가, 처음부터 영어 기반으로 만들어진 기본 보이스보다 발음이 자연스러운 경우가 많습니다.
일레브랩스에는 기본으로 제공되는 다양한 이름의 보이스가 있고, 이 중 특정 이름(예: Adam)을 검색해서 찾는 사용자가 많습니다.
일레브랩스 v3 모델부터는 대괄호 안에 지시어를 넣으면, 그 부분을 실제 연기처럼 표현해주는 '오디오 태그' 기능을 지원합니다. 이 기능이 바로 '감정태그'로 많이 검색되는 그 기능입니다.
기본 감정 표현
[신남], [긴장], [좌절], [피곤함] 같은 태그로 순간의 감정을 지정할 수 있습니다. [한숨], [속삭임], [소리침] 같은 신체적 반응도 함께 표현됩니다.
예시: "[망설이며] 저... 정말 될지 모르겠어요. [한숨] 그래도 한번 해볼게요."
억양·캐릭터 표현
[프랑스 억양], [미국 남부 억양] 같은 태그로 지역 억양을 지정할 수 있습니다. [해적 목소리], [로봇톤]처럼 캐릭터성을 부여하는 것도 가능합니다. 한 문장 안에서 캐릭터를 바꾸거나, 대화하는 두 사람의 톤을 다르게 표현하는 것도 지원됩니다.
전달 방식(속도·타이밍) 조절
[잠시 멈춤], [급하게], [길게 끎] 같은 태그로 말하는 리듬 자체를 조절할 수 있습니다. 이런 태그들을 조합하면, 스크립트를 다시 쓰지 않고도 같은 문장을 완전히 다른 느낌으로 표현할 수 있습니다.
| 만들고 싶은 결과물 | 추천 태그 조합 |
|---|---|
| 유튜브 내레이션(차분한 설명) | [차분하게], 문장 사이 [잠시 멈춤] |
| 광고·홍보 영상(활기찬 톤) | [신남], [강조하며] |
| 오디오북 대화 장면 | 화자별로 다른 억양 태그 + [속삭임]/[소리침]으로 긴장감 연출 |
| 캐릭터 콘텐츠(게임, 애니메이션) | [해적 목소리] 등 캐릭터 태그 + 감정 태그 조합 |
감이 잘 안 잡힌다면, 아래처럼 문장 단위로 태그를 섞어보는 것부터 시작해보세요.
"[신남] 드디어 완성했어요! [잠시 멈춤] 정말 오래 걸렸네요."
"[속삭임] 조용히 해봐요. [긴장] 누가 오는 것 같아요."
"[차분하게] 오늘은 지난주에 이어서 설명드리겠습니다. [강조하며] 이 부분이 가장 중요합니다."
태그는 문장 앞에 붙이는 것이 기본이지만, 문장 중간에 넣어서 흐름 도중 감정을 바꾸는 것도 가능합니다. 처음에는 태그 한두 개만 넣고 결과물을 들어본 뒤, 조금씩 조합을 늘려가는 방식으로 접근하는 것이 원하는 톤을 찾기에 효율적입니다.
| 구분 | 역할 | 설정 위치 |
|---|---|---|
| 모델 선택(Multilingual v2, v3 등) | 언어·억양 처리 능력 자체를 결정 | 음성 생성 화면 상단 |
| 보이스 선택(Voice Library) | 어떤 목소리로 말할지 결정 | Voice Library 메뉴 |
| 감정·오디오 태그 | 같은 보이스로 어떻게 표현할지 결정 | 텍스트 입력창 안에 대괄호로 직접 입력 |
세 가지는 서로 다른 층위의 설정이라, 원하는 결과가 안 나올 때는 이 셋 중 어디가 문제인지 하나씩 점검해보는 것이 효율적입니다.
| 순서 | 확인할 것 |
|---|---|
| 1 | 모델이 Multilingual v2 또는 v3로 설정되어 있는지 |
| 2 | Voice Library 언어 필터를 Korean으로 맞췄는지 |
| 3 | 원하는 보이스를 미리듣기로 확인했는지 |
| 4 | 감정·억양 태그를 문장 앞에 정확히 넣었는지 |
| 5 | 전문 보이스 클로닝을 쓴다면 태그 없이도 결과물을 먼저 확인했는지 |
Q1. 남자 목소리 중 자연스러운 한국어 발음을 원하면 어떻게 찾나요?
Voice Library에서 언어를 Korean으로 필터링한 뒤, 남성 보이스를 하나씩 미리듣기하면서 비교하는 것이 가장 확실합니다. 커뮤니티가 만든 보이스일수록 실제 한국어 억양에 가까운 경우가 많습니다.
Q2. 감정 태그는 영어로만 써야 하나요?
공식 예시는 영어(예: [excited], [whispers]) 중심으로 제공되는 경우가 많습니다. 일부 환경에서는 한국어 지시어(예: [신남], [속삭임])도 동작한다는 사례가 보고되고 있지만, 공식적으로 보장된 방식은 아닙니다. 원하는 결과가 안 나온다면 영어 태그로 시도해보는 것이 더 안정적입니다.
Q3. 내 목소리를 학습시켜서(보이스 클로닝) 쓸 수 있나요?
가능합니다. 짧은 음성 샘플만으로 복제하는 인스턴트 음성 복제(IVC)와, 더 많은 데이터로 정밀하게 학습시키는 전문 보이스 클로닝(PVC) 두 가지 방식이 있는 것으로 확인됩니다. 다만 PVC는 최신 v3 모델과 완전히 최적화되지 않았을 수 있다는 점을 참고해야 합니다.
Q4. srt·stt 자막 관련 기능도 있나요?
일레브랩스는 음성을 텍스트로 바꾸는 stt(음성 인식) 관련 기능도 제공하는 것으로 확인됩니다. 자막 파일(srt) 자체를 직접 만드는 전용 기능인지는 버전과 플랜에 따라 다를 수 있어, 정확한 지원 범위는 공식 문서에서 확인하는 것이 안전합니다.
일레브랩스로 자연스러운 한국어 음성을 만들려면, 모델을 Multilingual v2나 v3로 맞추고 Voice Library에서 한국어 필터로 보이스를 찾는 것이 첫걸음입니다. 여기에 감정·억양 태그를 조합하면, 단순히 텍스트를 읽는 수준을 넘어 실제 연기에 가까운 결과물을 만들 수 있습니다.
일레브랩스 구독·환불 관련 내용이 궁금하다면 일레브랩스 구독취소·환불방법 총정리도 참고해보세요.
※ 이 글은 2026년 7월 기준 확인 가능한 정보로 작성했으며, 기능과 지원 범위는 이후 달라질 수 있습니다. (ElevenLabs 한국어 설정, ElevenLabs Voice Library, ElevenLabs Multilingual v3)
댓글
댓글 쓰기