100万像素的摄像头,为什么是苹果AI最重要的零件?
MacRumors 从 macOS Tahoe 26.7 RC 中挖出苹果宣传视频和系统代码,确认带摄像头的 AirPods 将采用仅 100 万像素的摄像头,服务于 Visual Intelligence 而非拍照。该产品代号 B790,量产版 B798 预计 2027 年登场,苹果计划借此构建跨设备的个人上下文感知网络。
事件概述
MacRumors 从 macOS Tahoe 26.7 RC 中挖出苹果制作的宣传视频,展示用户戴着 AirPods 拿起一本书,Visual Intelligence 识别书名并让 Siri 保存。该产品代号为 B790,按 Mark Gurman 说法原本在苹果 2026 年产品路线图上,量产版本 B798 预计 2027 年登场。最新系统代码显示,AirPods 上的摄像头只有 100 万像素。
核心信息
- 摄像头存在两种工作状态:主动模式下采集 640×640 图像,处理后最高输出 1024×1024;被动模式下采集 320×320,输出 320×320 或 512×512。
- 左右两只 AirPods 可同步获取 RGB 静态图像,通过相同 Frame ID 对齐两个视角,按一定频率持续采集,交给 Visual Intelligence 处理。
- 系统会同时处理环境语音、声音变化、姿态和头部旋转信息;两颗摄像头之间、摄像头与运动传感器之间需要标定。头部运动过于剧烈或镜头被遮挡时,对应画面会被舍弃。
- AccessorySensorManager 中出现“peripheral inference”相关代码,可在设备侧判断画面中是否存在人物。
设计逻辑
对 AI 而言,320×320 像素已足够识别“桌上有一本书”“前面是餐厅”等场景信息。降低分辨率可减少数据量、处理与传输负担,对电池容量有限的耳机设备至关重要。AI 摄像头服务于机器而非人,拍下的画面不需要保存,机器“看懂”后即可删除。
同类尝试包括今年上市的光帆 AI 全感耳机——同样在左右耳机中塞入两颗 200 万像素定焦摄像头用于场景 AI 识别,并在耳机盒中加入 4G eSIM 和 GPS 以减少对手机的依赖;Humane AI Pin 也曾用摄像头为 AI 补上视觉,但需要用户额外佩戴新设备。苹果的优势在于很多人本来就每天佩戴 AirPods,无需重新发明 AI 硬件。
传感器组合与上下文
两只 AirPods 已构成一套传感器组合:摄像头观察眼前场景,陀螺仪记录头部朝向,麦克风收集声音,位置和运动传感器补充位置与动作。例如走进书店拿起一本书问 Siri“这本值得买吗”,AirPods 看到封面、头部朝向书、iPhone 判断你在书店,Siri 才能理解“这本”的指代。若系统掌握你过去的阅读记录,还能给出个人化答案。
这种变化的核心在于:今天使用 AI 需要不断向模型解释“我是谁、我在哪、看到了什么”,而设备传感器正在逐渐省掉这些人工补充的上下文。摄像头 AirPods 提供的正是“属于个人的上下文”。
隐私与提醒
系统代码显示每只 AirPod 似乎都能控制硬件指示灯(开关和亮度)。如果这对应摄像头工作状态,那么 AirPods 获取环境图像时,周围的人可能通过灯光得到提醒,符合苹果一贯的隐私保护策略。
2027 年与苹果 AI 战略
2027 年是 iPhone 发布二十周年,据爆料苹果将推出大幅改变设计的 iPhone,摄像头 AirPods 也可能同期登场。此外,苹果还在推进智能眼镜、可夹在衣服上或作为项链佩戴的 AI 挂饰,以及配备摄像头的 Apple Watch。单独看这些设备彼此独立,但若聚焦传感器,它们分别掌握人的不同切面:手表知道睡眠与运动,手机知道位置与行程,AirPods 贴着耳朵知道正在面对什么,Mac 知道工作内容。协同后即可形成对一个人的全景式了解。
苹果与创业公司的差别在于:行业仍在寻找“AI 时代的 iPhone”,而苹果已经拥有手机、手表、耳机、电脑、平板、头显和家庭设备。下一步是让这些设备获得丰富感知能力,并把不同设备的信息组织起来,构建围绕个人信息的 AI 硬件生态。大模型会持续进步且可替换,但一个人的上下文——过去五年去过哪里、读过什么、身体变化、喜好与习惯——无法通过下载模型获得,只能日积月累。这也让端侧计算、Secure Enclave 和 Private Cloud Compute 变得更重要,回答“谁拥有这些上下文”的问题。如果路线成立,苹果最终建立的将不只是 AI 设备,而是跨越手机、耳机、手表、眼镜和电脑的感知网络。
