人工智能行业实现了又一次质的飞跃。OpenAI 正式发布了 GPT-Live——新一代语音模型,现已集成至 ChatGPT 的"对话"模式中。这不仅仅是一次更新,更是我们与神经网络交互方式的根本性转变。

核心创新在于全双工架构。与以往解决方案不同,GPT-Live 能够同时进行听和说。模型不再等待用户说完才开始回应。它能识别语气词,做出自然的停顿,尤其重要的是,当用户只是思考时不会打断对话。这使得与 AI 的对话最大限度地接近人类交流。

系统架构将对话过程与任务执行过程分离。在 GPT-Live 维持活跃对话的同时,后台运行着另一个模型(初期为 GPT-5.5)。该模型负责在互联网上搜索信息或进行复杂计算。这种方法使 AI 能够实时翻译语音,并在不中断对话的情况下处理请求。

根据内部测试结果,GPT-Live 在科学推理和数据分析方面显著优于以往版本。ChatGPT 界面中还新增了可视化卡片——现在无需离开对话即可即时获取天气、股票行情或体育赛事结果等信息。

OpenAI 发布了两个版本:旗舰版 GPT-Live-1 和轻量版 GPT-Live-1 mini。Plus 和 Pro 订阅用户可访问主模型。ChatGPT 免费版用户可以使用 mini 版本。公司计划近期向开发者开放 API,这无疑将推动该技术大规模集成到第三方服务中。

安全性得到了特别关注。系统中引入了新的过滤器,可阻止模仿他人声音的尝试,并限制与暴力或自残相关的内容。针对青少年用户设置了家长控制功能。考虑到人们对语音深度伪造日益增长的担忧,这一举措非常及时。

专家观点。 GPT-Live 不仅仅是语音助手的改进。这是人机交互新范式的转变,模糊了与 AI 对话和与真人交流之间的界限。我们看到的不是进化,而是 AI 产品用户体验设计领域的一场革命。