OpenAI造耳机:语音交互成为新入口的全栈计算棋局
2026/07/30 10:53阅读量 3
OpenAI通过GPT-Live全双工语音技术和计划年产4000-5000万台的Sweet Pea耳机,意图从纯软件公司转向“软件+硬件+生态”的全栈计算平台。但缺乏操作系统层控制力、面临Google和Apple的竞争,以及硬件前车之鉴(Humane AI Pin、Rabbit R1)的教训,使其成败取决于能否在合规前提下实现全天候无感交互。
事件概述
OpenAI正在推动人机交互从屏幕主导向语音主导的结构性转变。核心动作包括:发布全双工语音模型GPT-Live,将语音能力与Codex Agent工作流深度绑定;以约65亿美元收购Jony Ive联合创立的硬件公司io Products;计划于2026年下半年推出内部代号“Sweet Pea”的AI耳机,首年产量目标4000万-5000万台,由富士康代工。
核心信息
- 技术突破:GPT-Live基于全双工架构,支持随时打断、持续后台执行,语音从一问一答升级为持续性工作流指挥。OpenAI数据称每周超1.5亿人使用ChatGPT语音功能;内部97.9%员工已使用Agent模式工作。
- 硬件战略三步走:第一步以ChatGPT Voice培育语音习惯;第二步通过收购获得工业设计能力(io Products团队55人);第三步用Sweet Pea耳机完成软硬件生态闭环。
- 竞争与风险:Google Gemini Live已率先实现实时对话,且Android月活超30亿台;Apple掌握AirPods和iOS生态。OpenAI缺乏操作系统,Sweet Pea需深度调用手机系统级权限,可能重蹈Humane AI Pin和Rabbit R1覆辙。
- 中国企业路径:科大讯飞AIUI平台将语音能力植入存量设备;面壁智能MiniCPM系列端侧模型累计下载量超3800万;腾讯云WorkBuddy与李未可科技合作X-AI记忆眼镜,走“端侧感知+云端执行”的中间路线。
值得关注
- 端侧语音硬件产业链机会:多麦克风阵列、波束成形、低功耗预处理芯片等信号处理链路。
- 常驻Agent后台(个人云端AI工作站)将创造新商业模式,Manus等已探索。
- 合规风险:全双工语音等效于“永远开着的麦克风”,需设计声纹本地识别、差分隐私、硬件物理开关等机制,才能在GDPR和《个人信息保护法》框架下实现全天候体验。
