OpenAI在语音界面进化中迈出了新的一步,发布了GPT-Live——集成于ChatGPT“对话”模式的新一代语音模型。这不仅是更新,更是我们与人工智能交互方式的根本性转变。

关键创新在于全双工架构。与前辈不同,GPT-Live能够同时听和说,无需等待停顿。模型能识别感叹词,自然地停顿,即使用户陷入思考也不会打断。这让与AI的对话更接近人类交流。

架构上实现了分工:GPT-Live维持对话的同时,另一模型(初期为GPT-5.5)在后台处理复杂请求——如网络搜索或计算。这使得AI能实时翻译语音,并在不中断对话的情况下解决问题。

测试证实GPT-Live在科学推理和数据提取方面具有优势。ChatGPT界面还新增了天气、股票行情和体育成绩的视觉卡片——向更多模态体验迈进一步。

OpenAI发布了两个版本:强大的GPT-Live-1和简化的GPT-Live-1 mini。可用性有所不同:付费用户Plus和Pro可使用主模型,免费版ChatGPT则使用mini版本。公司近期将向开发者开放API。

安全性也得到更新:新过滤器可阻止声音模仿,并限制与暴力或自残相关的内容。为青少年提供了家长控制功能。

此次发布是战略性的重要一步。GPT-Live不仅改进了语音界面,更改变了范式本身:AI现在可以成为完整的对话伙伴,而不仅仅是工具。然而,真正的潜力将在API开放后释放——届时开发者可将此技术嵌入产品,可能重新定义语音助手市场。