Fish Audio 获 5000 万美元种子轮,打造创作者与企业级 AI 语音模型
AI 语音模型市场巨大,Fish Audio 凭借开源模型和超 1.5 万种自然语言控制,已获 800 万用户和 2100 万美元年经常性收入,最新融资 5000 万美元将用于开发更先进的语音模型。
AI 语音模型市场巨大。创意用例要求 AI 语音模型更具表现力,而寻求自动化客户支持和销售运营的企业则需要它们更易操控。总部位于帕洛阿尔托的 Fish Audio 希望通过其拥有超过 15,000 种自然语言控制的库来满足所有这些用例。
自去年推出以来,这家初创公司目前已有超过 800 万人使用其模型的开源或托管版本,目前年经常性收入达 2100 万美元。
为了继续巩固这一势头,该公司周二表示,已在由 Coreline Ventures 和 Capital Today 领投的种子轮融资中筹集了 5000 万美元。
参投方还包括 359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 和 HF0。
Fish Audio 最初是前 NVIDIA 研究员廖世佳的一个小项目,他对市场上缺乏表现力的合成语音感到不满,于是在单块 GPU 上训练了一个语音生成模型并将其开源。
GitHub 上的 Fish Speech 仓库现已拥有超过 31,000 颗星,被独立开发者、视频游戏设计师和创作者使用。该公司去年推出了五个模型:四个语音生成模型和一个语音转文本模型。
它开源了其中三个语音生成模型,但其最新的 S2.1 Pro 模型仅通过付费 API 提供。
Fish Audio 提供适合创作者和团队的付费月度计划,解锁固定分钟数的生成以及语音克隆功能。该公司还提供其 API 和平台的企业版,并表示 HeyGen、Sanas 和 Plaud 等组织已在采用。
“每个企业都有不同的用例和偏好。例如,像 HeyGen 这样使用我们的语音驱动 AI 头像的公司希望语音逼真;游戏工作室希望为其角色提供富有表现力的声音;而像 LiveKit 这样的语音智能体公司则希望声音更自然、低延迟且足够富有表现力以用于通话,”Cao 说。
该初创公司构建语音库的一种方式是直接要求用户提交自己的语音用于训练模型,并在使用其语音时给予补偿。然而,几个月前这引发了一些麻烦,因为一些创作者声称他们的语音在未经同意的情况下被上传到 Fish Audio。
该公司制定了 DMCA 内容删除流程来处理此类问题,但删除本身耗时较长。Fish Audio 的 CEO 兼联合创始人 Rissa Cao 告诉 TechCrunch,公司现已自动化了删除流程。
她说,创作者可以轻松提交简短的语音样本或合同来证明上传的语音属于他们,他们的语音将在不到 3 分钟内从该初创公司的平台上移除。
尽管如此,这并不能阻止任何人在不知情的情况下上传艺术家的声音。在艺术家发现之前,他们的声音将继续在平台上使用,直到他们申请删除。Coreline Ventures 的合伙人 Oskue Honda 表示,社区驱动模式只有在创作者信任平台时才有效。
“以社区为中心的方法只有在创作者信任平台时才能成为持久优势。这意味着同意、透明度和归属必须内置于产品中,而不是事后才考虑。
我认为行业需要朝着经过验证的声音所有权、清晰的许可条款、简便的举报和删除流程,以及最终的收入分成模式发展,让创作者在其声音被许可或商业使用时获得经济收益,”他说。Cao 表示,当该初创公司仅以开源项目形式提供产品并面向创作者时,运营效率很高,不需要资金。
但随着投资者兴趣增加,公司希望开发更先进的模型并服务企业,因此寻求资本。展望未来,Fish Audio 计划今年发布一个音频理解模型。它还在构建一个语音到语音模型。
语音生成市场竞争激烈,ElevenLabs、WellSaid、Cartesia、Speechify、Async(前身为 Podcastle)和 Krisp 等公司都在争夺创作者和企业的预算。
据 359 Capital 合伙人 Rico Mallozzi 称,为开发者提供细粒度控制以及高性价比的模型训练将帮助 Fish Audio 更好地与大型 AI 实验室竞争。
“我认为,与其他一些资金充足的 AI 实验室或公司相比,他们凭借现有团队构建出最先进的模型,这令人难以置信。这展示了他们在缩小人工声音与类人声音差距方面的技术敏锐度,”Mallozzi 在电话中告诉 TechCrunch。
本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。