AI 见闻
精选· 重要性 4/5

OpenAI 发布 GPT-Live 语音模型,实现更自然的实时对话

TechCrunch — AI··Ivan Mehta·约 4 分钟阅读
中文导读

OpenAI 推出全双工语音模型 GPT-Live-1 和 GPT-Live-1 mini,支持同时听说、自然打断和实时翻译,旨在让语音成为复杂工作的主要计算界面。

OpenAI 今日发布了名为 GPT-Live-1 和 GPT-Live-1 mini 的新对话模型,声称它们听起来更自然,且能更好地处理话轮转换。这些是全双工模型,意味着它们可以同时说话和聆听,允许用户自然地打断,并支持实时翻译等功能。

该公司还默认将 ChatGPT 中当前的 Advanced Voice Mode 替换为 GPT-Live-1 mini。付费层级用户将能够访问更大的 GPT-Live-1 模型。

之前的模型结合了语音转文本模型来转录语音、大语言模型生成回复,以及文本转语音模型输出最终答案。OpenAI 在新闻发布会上表示,新模型解决了诸如在用户说话时打断用户、以及智能不足无法回答问题等问题。

OpenAI 的新模型会将查询发送到其最新的文本模型(如 GPT-5),以获取搜索、推理或智能体能力,同时保持对话的连续性。OpenAI 还展示,该模型可以长时间保持沉默,吸收对话的上下文,直到被召唤。

此外,由于新的语音模式可以访问更新的 GPT 模型,它还能以视觉格式呈现一些信息。其他初创公司如 Monogram(从 DST 和 Lux Capital 获得了 4000 万美元种子轮融资)也在探索视觉回复,以使助手更具交互性。

该公司表示,ChatGPT 中的新语音模式旨在支持更长时间的对话。在简报会上,ChatGPT Voice 的产品负责人 Atty Eleti 提到,他在散步时曾与语音功能进行过 30 到 40 分钟的对话。

OpenAI 认为,语音可能成为复杂工作的主要计算界面。有报道称,该公司今年可能推出一款具备 AI 能力的耳塞。不过,它并未提供任何关于硬件产品的信息。Eleti 表示:“随着时间的推移,我们认为这将解锁将语音作为计算主要界面的能力,并管理日益复杂的长期智能体工作。

我们看到人们使用 Codex 和 ChatGPT 完成的那些令人惊叹的用例,我们认为语音可以成为未来各种工作的界面。”过去几年,OpenAI 一直致力于增强基于语音的功能,使 ChatGPT 的语音模式听起来更自然。

该公司表示,超过 1.5 亿人使用 Voice 和 Dictation 等功能与 ChatGPT 交谈。竞争对手也在努力让助手更具表现力。苹果和亚马逊都更新了各自的助手,使其更具对话性,并具备更好的上下文处理能力。

由 Oculus 联合创始人 Brendan Iribe 和 Ankit Kumar 创立的 Sesame 等初创公司也推出了 AI 助手,能够在后台完成任务的同时进行更自然的对话。

OpenAI 正朝着同样的方向发展,旨在让用户能够长时间免提地与助手交谈。尽管声称新的语音模式听起来更自然,但该公司强调,其目标并非将其打造成 AI 伴侣。它指出,新模型内置了安全措施,可以为青少年提供适龄的回复,并在对话转向自残等话题时提供资源。

新的语音模式仍需改进。在演示中,当公司展示其印地语实时翻译功能时,助手带有浓重的美国口音,说出的印地语听起来不自然,且略带书卷气。该公司表示,新模式针对“大多数口语”进行了优化,但未具体说明是哪些语言。

原文出处
OpenAI releases new voice models for more natural live conversations

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读