OpenAI 于美国时间 9 月 10 日宣布将 GPT-Live-1 开放至 API,开发者可以利用这一能够同时听与说的语音模型构建语音应用与业务流程。定价为前端语音层每分钟 0.05 美元,后端负责推理的模型与代理 harness 另计。GPT-Live-1 先前仅在 ChatGPT 内部使用,它边听边说,并将难题交给背景模型处理,这次同一套能力向外部开发者开放。
OpenAI 说明,传统语音代理把语音转文字、推理模型、文字转语音三段串接,每一次交接都增加延迟,也更容易丢失对话的时机与节奏,开发者还得自己处理使用者打断、停顿或改变话题的情况。 GPT-Live-1 在单一模型内同时推理输入与输出的音讯,可以即时回应打断与简短的附和,并把较深的推理与工具呼叫委托给后端的文字模型,例如GPT-6 Astra 或第三方模型,让对话在背景工作进行时不中断。
开发者可以自行选择对话背后的模型、工具与代理harness。 OpenAI 举例,排程、订单更新这类高量任务可以搭配Luna,需要推理的复杂客服问题则搭配Astra,依任务调配推理深度、速度与成本。这个版本另外加入透过系统提示控制语气、语速与风格,改善背景噪音与沉默的处理,强化长对话的上下文保留,并支援电话应用,从餐厅订位到客服都能部署。模型原生提供语音辨识逐字稿与回应文字,支援关键字偏置与轮次侦测。
OpenAI 表示,在其评测中GPT-Live-1 的Full Duplex Bench 成绩比7 月发布的GPT-Realtime-2.1高出30 个百分点,轮次切换延迟与互动行为都有大幅改善;搭配中等推理强度的GPT-6 Astra 时,在衡量语音代理端到端任务能力的Tau3 排名第一。这些评测涵盖航空、零售、电信的客服任务,银行知识查询,以及含停顿、犹豫与自我修正的工具呼叫。
语言学习服务Speak 在早期评估中发现,GPT-Live-1 让学习者在家教回应前有更多思考时间,打断次数比先前的轮次式系统减少近80%。
OpenAI 列出的早期客户包括Yelp 的Host 与Hatch、Speak 的即时家教课程、Intercom 的客服代理Fin,以及Cognition 把它与AI 工程师Devin 配对使用。 Yelp 技术长Alex Levy 表示,来电者开始说出更完整、更自然的句子,「这告诉我们电话另一端的体验确实不一样了。」
声音选项也从原本少数几种即时语音,扩大到涵盖不同口音、方言与语言的更多选择,OpenAI 表示未来几个月会持续增加语音与语言;客制化声音则需联系销售团队。 GPT-Live-1 即日起在API 提供,前端语音层每分钟0.05 美元。