如果你需要给视频配音、把文章做成播客、给应用加上真人般的语音,或者干脆克隆一个属于自己的声音,ElevenLabs 是目前绕不开的一个工具——它把文本转语音的自然度、情感表现和多语言(含中文)支持都推到了新的水准。这篇教程带你从注册到实操,一步步把它用起来。

ElevenLabs 是什么

ElevenLabs(官网 elevenlabs.io)是一家专注于 AI 语音的公司,核心能力是把文字变成听起来像真人的语音,同时还提供语音克隆、AI 配音(视频翻译并配音)、语音库、音效生成、语音转文字,以及给开发者用的 API。它最出名的地方在于「自然」:不像早年那种机器腔的 TTS,它能处理停顿、语气、情感,甚至能笑、能叹气、能压低嗓音说话。

它的产品线大致分成几块:

  • Text to Speech(文本转语音):把任意文字读出来,是最基础也最常用的功能。
  • Voice Cloning(语音克隆):用一段录音复刻出某个声音,之后就能用这个声音读任何文字。
  • Dubbing(AI 配音):上传一段视频或音频,自动翻译成另一种语言并配音,还能尽量保留原说话人的音色。
  • Studio / Productions(长音频工作室):面向有声书、播客这类长内容的多段落编辑环境。
  • Voice Library(语音库):官方与社区提供的一万多个现成声音,直接选来用。
  • API:把上面这些能力接入你自己的应用和工作流。

目前旗舰模型是 Eleven v3,支持 70 多种语言(含中文),最大的亮点是「音频标签(Audio Tags)」——可以用 [laughs]、[whispers] 这样的标记直接指挥语气。此外还有主打高质量的 Multilingual v2(29 种语言)和主打低延迟、实时场景的 Flash v2.5(约 75ms 延迟,32 种语言,且每字符价格更低)。具体模型能力以官网为准。

如何开始使用

注册非常快,几分钟就能出第一段音频。

  1. 打开注册页 elevenlabs.io/app/sign-up(或在首页点「Get started free」)。
  2. 选择注册方式:可以用邮箱注册,也可以用 Google、GitHub 等第三方账号一键登录。注意,如果用 Google 登录,账号会和这个 Google 邮箱绑定,之后无法更换邮箱。
  3. 如果用邮箱注册,填写邮箱并设置一个安全的密码。
  4. 去邮箱点开 ElevenLabs 发来的验证链接,完成验证。
  5. 验证后会直接跳转到语音合成(Speech Synthesis)页面,此时你已经在免费额度下,可以立即开始生成语音了。

免费账号每月有 10,000 credits(credit 大致对应字符数,标准模型下 1 字符约等于 1 credit,约 10 分钟语音)。需要提醒的是,免费版不含商用授权,做公开发布或商业用途需要升级到付费版。

核心功能上手

一、文本转语音

这是最快出效果的功能。

  1. 进入左侧的 Text to Speech(文本转语音)。
  2. 在中间的文本框粘贴你要朗读的文字,中英文都可以,也可以中英混排。
  3. 在右侧选一个 Voice(声音)。新账号自带一批预设声音,也可以点进 Voice Library 从上万个声音里挑,用语言、性别、风格筛选。
  4. 选 Model(模型):追求最自然、最有情感就选 Eleven v3;要做实时或大批量、想省 credit 就选 Flash v2.5。
  5. 点 Generate(生成)。生成后可以试听、下载音频文件。

一个实用习惯:先用一小段文字试不同的声音和模型,定下组合后再跑长文本,避免浪费 credit。

二、语音克隆

克隆分两种:Instant Voice Cloning(即时克隆) 只需几秒到几十秒的样本,快但相似度一般;Professional Voice Cloning(专业克隆) 需要更长、更干净的录音,效果最好。即时克隆从 Starter($6/月)套餐起可用,专业克隆需要 Creator($22/月)及以上。

  1. 进入 Voices,点 Add a new voice → 选 Instant Voice Clone 或 Professional Voice Clone。
  2. 上传录音样本(即时克隆一小段即可;专业克隆建议提供数十分钟安静、无背景噪音、单一说话人的高质量录音)。
  3. 按提示确认你拥有该声音的合法授权(克隆别人的声音需要本人同意)。
  4. 等待处理完成,之后这个克隆声音就会出现在你的声音列表里,可以像其他声音一样用于文本转语音。

样本质量直接决定克隆效果:录音越干净、越一致,克隆出来越像。

三、AI 配音(Dubbing)

想把一条中文视频变成英文,或反过来,用 Dubbing。

  1. 进入 Dubbing,新建一个配音项目。
  2. 上传音视频文件,或粘贴视频链接(支持的来源、文件大小与时长上限以官网为准)。
  3. 选择源语言和目标语言。
  4. 生成后,工具会自动转写、翻译并用合成语音配音,并尽量保留原说话人的音色与节奏。
  5. 在配音工作室里可以逐句校对译文和时间轴,满意后导出。

配音结果建议一定要人工过一遍字幕和译文,机器翻译在专有名词、口语和文化梗上仍会出错。

进阶技巧

用音频标签控制情感(Eleven v3):v3 支持在文本里插入方括号标签来指挥语气,例如 [laughs](笑)、[whispers](低语)、[sighs](叹气)、[sarcastic](讽刺)、[curious](好奇)。甚至可以叠加,比如 [sad][whispers] 让角色用悲伤、低语的方式说话。标签效果和你选的声音有关,有些声音对某些标签响应更好,需要多试。

Stability(稳定性)滑块:这是 v3 里最关键的参数,控制生成语音贴近参考声音的程度,通常有三档——Creative(更有情感、更放得开,但偶尔会「跑偏」)、Natural(最贴近原声,均衡自然)、Robust(最稳定,但对指令响应弱)。想让音频标签充分发挥,用 Creative 或 Natural。

控制停顿和节奏:善用标点。逗号、句号、破折号、省略号会自然改变停顿长短;分段、换行也有帮助。与其硬调参数,不如先把文案标点写规范。

中文效果:Eleven v3 支持中文(含对不同地区口音的适配),整体自然度不错,但仍不完美——多音字、数字、生僻词、中英夹杂偶尔会读错。建议把数字尽量写成中文(如「二零二六年」)、给容易读错的地方换个写法、并务必试听后再定稿。

Similarity / Style 等参数:不同模型暴露的可调项略有差异,相似度、风格夸张度等可以微调音色与表现力,小步调整、边听边改比一次性拉满更靠谱。

价格与额度

以下为官网公开的常见套餐(价格为美元/月,credit 大致对应字符数,均以官网实时为准):

  • Free(免费):$0,10,000 credits/月。含文本转语音、语音转文字、音效、语音设计等,不含语音克隆,不含商用授权。
  • Starter:$6,30,000 credits/月。含商用授权、即时语音克隆、Dubbing Studio。
  • Creator:$22,121,000 credits/月(常有首月半价)。新增专业语音克隆。
  • Pro:$99,600,000 credits/月。含更高音质与 API 输出选项。
  • Scale:$299,1,800,000 credits/月。含团队协作、多个专业克隆声音。
  • Business:$990,6,000,000 credits/月。含低延迟 TTS 与更多克隆名额。
  • Enterprise:定制报价,面向大规模与合规需求。

补充几点:Flash、Turbo 等模型每字符消耗约为标准模型的一半,同样额度能出更多内容;付费版未用完的 credit 可结转(通常最多两个月);是否可商用以你所在套餐为准。

常见问题与适用场景

免费版能用来做发布内容吗? 技术上能生成,但免费版不含商用授权,正式对外发布/商业用途请至少升级到 Starter。

中文读得准吗? 大体自然,但多音字、数字、生僻词仍可能出错,务必试听并按需改写文案。

克隆别人的声音合法吗? 需要获得声音所有者的授权,平台在创建克隆时会要求你确认这一点,切勿未经同意克隆他人。

适合谁用:

  • 自媒体 / 短视频作者:快速做旁白、口播、多语言配音。
  • 播客 / 有声书创作者:用 Studio 处理长音频,或克隆自己的声音批量生产。
  • 出海团队:把中文内容用 Dubbing 翻译配音到其他语言。
  • 开发者:通过 API 给 App、客服、语音助手接入实时语音。
  • 教育 / 培训:把课程讲稿转成语音,或做多语言版本。

功能名、价格和额度更新较快,动手前建议以 elevenlabs.io 官网当前信息为准。