Workflow
Artificial Intelligence Speech Technology
icon
搜索文档
ElevenLabs' new v4 speech model supports more expression control and 90 languages
TechCrunch· 2026-09-28 22:00
文章核心观点 - ElevenLabs发布两款全新语音模型ElevenLabs v4和v4 Turbo,在表达控制、语音代理延迟和语言支持方面实现升级 [1] - 公司采用全新架构提升控制力和克隆速度,仅需10秒音频即可克隆声音 [2] - 公司企业级呼叫业务快速增长,超过55%的业务来自大型企业 [5] - 语音模型赛道竞争加剧,初创公司和大型科技公司均在提升语音模型能力 [6] - 公司估值和收入快速增长,并计划在未来几年内IPO [7][8] 新产品发布 - ElevenLabs发布两款新语音模型ElevenLabs v4和v4 Turbo,提供更多表达控制、更低语音代理延迟,并支持超过90种语言 [1] - 公司去年发布v3模型,并在今年早些时候华沙活动中预告该模型 [2] - v4代模型采用新架构,实现更好控制和更快克隆,用户仅需10秒音频即可克隆声音 [2] 创意功能 - 模型在较长文本中更好地处理声音身份一致性 [3] - 模型在朗读时保持文本上下文以改变表达方式 [3] - ElevenLabs在v3中引入内联标签定义表达,v4中扩展这些标签,允许用户堆叠多个标签并让模型遵循序列 [3] 语言支持 - 上一版本支持70种语言,新版本提升至90种语言 [4] - 公司在日语、巴西葡萄牙语、普通话和粤语方面观察到最大质量提升 [4] 企业级语音代理业务 - 公司企业级呼叫业务在过去一年快速扩展,超过55%的业务来自大型企业 [5] - 新模型适用于语音代理,新版本具有更低延迟以实现更流畅对话 [5] - v4可以在其背后的LLM开始生成答案时立即开始生成音频 [5] - 模型可以不同方式处理对抗、升级和保持,以实现更好的问题解决 [5] 行业竞争格局 - 语音模型竞争加剧,Cartesia、Deepgram、Fish Audio、Boson和WellSaid Labs等初创公司创建了表达性语音模型 [6] - Google和OpenAI等大公司也改进了其语音模型 [6] 融资与估值 - 公司今年早些时候从Sequoia融资5亿美元,该轮由Sequoia领投,估值达110亿美元 [7] - 已有传言称后续融资轮将公司估值推至220亿美元 [7] - 公司年化收入运行率从年初约3.3亿美元攀升至超过6亿美元 [7] - 公司在印度、欧洲和巴西等不同市场积极招聘,员工人数已超过800人 [7] IPO计划 - 公司联合创始人兼CEO Mati Staniszewski在近期TechCrunch采访中表示,公司目标是在未来几年内IPO,但未承诺具体时间表 [8]