GPT-4o语音模式部分开放,秋季覆盖所有付费用户

seekdeep9个月前AI资讯412

继此前 OpenAI 方面在今年 5 月发布多模态大模型 GPT-4o,原计划今年 6 月开放语音模式的测试,随后以 " 需要改进模型检测和拒绝某些内容的能力 " 为由推迟后。当地时间 7 月 30 日官方已向部分 ChatGPT Plus 订阅用户开放基于 GPT-4o 的高级语音模式(Advanced Voice Mode)测试,并宣布将在今年秋季逐步扩展至所有 ChatGPT Plus 用户。



据悉,ChatGPT 此前的语音模式是基于转录、大语言模型和文生语音 3 个独立模型来实现的语音功能。公开信息显示,GPT-3.5 的平均延迟为 2.8 秒、GPT-4 为 5.4 秒,而 GPT-4o 则能够以平均 320 毫秒的速度回应音频输入,与人类在典型对话中的反应时间相似。


对此 OpenAI 首席技术官 Muri Murati 表示," 在 GPT-4o 中,我们训练了跨文本、视觉和音频的端到端全新统一模型,这意味着所有输入和输出都由同一个神经网络处理 "。


据 OpenAI 方面透露,高级语音模式除了可以提供更自然的实时对话、允许用户随时打断之外,还能够感知或响应用户的情绪语调,包括悲伤、兴奋等。但需要注意的是,该模式目前设置了 Juniper、Breeze、Cove、Ember4 种预设语音,对此 OpenAI 发言人 Lindsay McCallum 曾表示,"ChatGPT 不能冒用他人的声音,包括个人和公众人物的声音,并且会阻止与这些预设声音之一不同的输出 "。


日前 OpenAI 方面还解释了高级语音模式仅向部分用户开放的原因,因此通过逐步推出,其可以密切监控用户的使用情况,并根据反馈不断改进模型的能力和安全性。需要注意的是,这部分用户将在 ChatGPT 应用程序中收到提醒,并收到一封有关如何使用高级语音模式的说明邮件。


相关文章

OpenAI把它放到了机器人上,在GPT-4诞生1年后!

ChatGPT拥有了身体,机器人也有了灵魂。从OpenAI在去年3月14日拿出GPT-4后,已经过了整整一年。显然,在GPT-4诞生之后的这一年,一切都迭代得太快了,从GPT-4展现多模态能力,到千行...

80亿参数、前OpenAI人员经数年打造,机器人ChatGPT来了!

机器人 AI 公司 Covariant CEO Peter Chen坐在一个聊天机器人面前,界面和 ChatGPT 的很像。“给我看看你面前的运送箱,” 他输入一段文本。然后出现了一段视频,一个机械臂...

每年可带来27亿美元营收,消息称ChatGPT付费用户已超过1100万!

9月13日消息,上月底曾有外媒在报道中提到,在生成式人工智能领域走在行业前列的OpenAI,已向部分媒体确认旗下明星产品ChatGPT的周活跃用户超过了2亿,在近10个月的时间里翻了一番,上周又有外媒...

单次输出 64K tokens, OpenAI 测试长输出版 GPT-4o

OpenAI 于 7 月 29 日宣布,正在测试长输出版 GPT-4o(GPT-4o Long Output),每次请求最多可输出 64K tokens。目前该版本仅限 Alpha 测试参与者使用,可...

微软Windows系统出现“史上最大规模IT故障”;OpenAI上线GPT-4o mini

NO.1 OpenAI上线GPT-4o mini7月19日,OpenAI突然官宣并上线了一款“小模型”GPT-4o mini,被团队描述为最智能、最实惠的模型,其性能和价格均已赶超GPT-3.5 Tu...

日耗电量高达50万度 ,GPT成“吃电狂魔”, 马斯克“电荒”预言成真?

最近一段时间,公众开始注意到,当前蓬勃发展的生成式AI技术需要耗费大量的电力。据《纽约客》当时时间9日报道,荷兰国家银行数据专家Alex de Vries估计,OpenAI旗下聊天机器人ChatGPT...