刚刚,GPT 语音模型最大升级来了!能思考、会同传,还能边聊边干活
(来源:AI信息Gap)
GPT 语音模型,终于更新了。
刚刚,OpenAI 一口气发布了三个实时语音模型,全部通过 Realtime API 向开发者开放。
GPT-Realtime-2,第一个带 GPT-5 级别推理能力的语音模型。它在和你聊天的同时能调用工具、处理复杂请求,中途被打断也能继续对话。
GPT-Realtime-Translate,实时翻译模型。支持 70 多种语言,跟着说话者的语速同步翻译(这就是妥妥的「同声传译」啊)。
GPT-Realtime-Whisper,实时转写模型。你一边说,它一边转录成文字。
美国最大的房地产平台 Zillow 已经用上了 GPT-Realtime-2。在最难的对抗性测试中,通话成功率从 69% 飙升到了 95%。
GPT-Realtime-2 是这次的主角。
上一代 GPT-Realtime-1.5 接得住简单问题,但遇到需要调用工具、多步推理的复杂场景就容易掉链子。这次的升级版接入了 GPT-5 级别的推理能力,处理能力完全不在一个量级。
比如你对它说「帮我找一个预算 2000 的房子,避开主干道,周六安排看房」,它能一边和你聊天,一边并行调用搜索、筛选、日历三个工具。处理过程中还会主动说一句「我查一下你的日历」,不会突然沉默让你干等。
你说到一半改了主意,它能及时调整。遇到实在处理不了的请求,它会告诉你「我现在有点困难」,不会直接挂掉或者装没听见。
GPT-Realtime-2 的上下文窗口从 32K token 扩展到了 128K。开发者可以从五档推理强度中选择,从 minimal 到 xhigh,简单问题快速回复,复杂问题深度思考。
Big Bench Audio 语音模型的「智商」测试,GPT-Realtime-2(high)拿到 96.6%,上一代 81.4%。Audio MultiChallenge 指令跟随基准测试,GPT-Realtime-2(xhigh)48.5%,上一代 34.7%。两项都提升了十几个百分点。
Zillow 是第一批用上 GPT-Realtime-2 的公司之一。
Zillow AI 负责人 Josh Weisberg 给出了一组数据。在他们最难的对抗性测试中,经过提示词优化,通话成功率从 69% 提升到了 95%,涨了 26 个百分点。美国公平住房法规的合规性也更稳定,这对 Zillow 来说是硬指标。
这意味着,以前 10 个电话里有 3 个会掉链子,现在基本全能搞定。
在线旅游平台 Priceline 在用它做旅行语音助手。用户可以用语音搜航班、改酒店预订、查航班延误,整套旅行管理全靠对话就能完成。
德国电信在测试 GPT-Realtime-Translate,做跨语言客服。客户用母语说话,客服那边听到的是实时翻译。
Intercom、Glean、Genspark 也都在第一批测试名单里。
GPT-Realtime-Translate 的翻译不是「说完一整句再翻」,是跟着说话者的语速边听边翻译。支持 70 多种语言输入、13 种语言输出,包括中文。
印度 AI 语音公司 BolnaAI 联合创始人兼 CTO Prateek Sachan 说,在他们测试印地语、泰米尔语和泰卢固语的场景中,GPT-Realtime-Translate 的词错误率比他们测过的所有其他模型低 12.5%。
GPT-Realtime-Whisper 是流式转写模型。开会、直播、客服通话,你说话的同时文字就出来了。
划重点,当前这三个新语音模型都只支持 API 调用,ChatGPT 里的语音模式还没有更新。
模型变强了,价格也变高了。
GPT-Realtime-2 每百万音频输入 token 32 美元,缓存输入 0.4 美元,每百万音频输出 token 64 美元。
其他两个模型都是按照时长计费,还是相当有性价比的。
GPT-Realtime-Translate 每分钟 0.034 美元,折合人民币大约两毛钱。
GPT-Realtime-Whisper 每分钟 0.017 美元,大约一毛二。
之前的 Whisper 转写模型是每分钟 0.006 美元。新的流式版本贵了大约 3 倍,换来的是实时性。
对于 ChatGPT,OpenAI 官方还专门澄清了一下。
「We know you're eager for voice updates in ChatGPT. Stay tuned, we're cooking.」
我们知道你们等 ChatGPT 语音更新等得很着急。别急,我们正在做。
语音模型,也「能思考」了。
我是木易,Top2 + 美国 Top10 CS 硕,现在是 AI 产品经理。