Smart Glasses Daily

深度分析 · Alibaba· 中文 — auto

我们解读了Qwen的中文幻灯片:一窥阿里巴巴的Agent智能眼镜

阿里巴巴的Qwen Agent眼镜发布时,展示了大量无人翻译的中文工程幻灯片。我们对所有幻灯片进行了图像识别,因此这里用简单明了的英文呈现了每一个菜单、每一张图表和每一项规格。

S. WHITMAN· American 特派记者·2026年8月10日·7 分钟阅读
Qwen Agent智能眼镜眼动追踪模块幻灯片,显示精度、鲁棒性、功耗和尺寸规格

图片:Qwen (Alibaba)

版权与下架

阿里巴巴的Qwen于2026年7月17日开幕的上海世界人工智能大会上,发布了其下一代显示智能眼镜。其定位不再是“AI眼镜”,而是Agent眼镜:一款由阿里巴巴的旗舰多模态模型Qwen驱动,可按需调用第三方技能和Agent的设备。硬件规格极具竞争力-全双工音频、高精度眼动追踪、以5毫瓦运行的常亮摄像头通路、3DoF空间显示,以及用于持续生命体征监测的PPG和温度传感器。

这是没有人做过的工作。Qwen展示的技术幻灯片全部是中文,充满了框图、模式标签和模拟UI气泡,而目前的英文报道仅重复了新闻摘要。我们对每张幻灯片进行了图像识别,并逐一转录了标签。结果远比公告具体:你可以阅读唤醒层级、音频管线、隐私门,甚至Qwen选择在镜片内渲染的虚假通知。

Qwen眼动追踪模块规格幻灯片
Qwen眼动追踪模块规格,翻译成英文

这意味着:一个小于1.7立方毫米、功耗低于100mW的眼动追踪模块,是决定一项功能能否在眼镜中实现还是只能留在头戴式设备中的关键数字。Meta的Ray-Ban Display完全没有眼动追踪功能,这正是它需要腕上Neural Band来移动光标的原因。开源阵营的Mentra也没有凝视传感器,而是依赖语音和手机触控。Google和Samsung面临着更棘手的问题:Android XR已经假设在Project Moohan上采用凝视加手部输入,这是一款拥有充足功耗和体积的头戴式设备,但与Gentle Monster和Warby Parker合作打造的Galaxy品牌眼镜则两者皆无。如果Qwen真能以这种尺寸和功耗实现凝视追踪,那么阿里巴巴就获得了一个不增加重量的指针,而其竞争对手则仍需为腕带或手机买单。

从语音堆栈开始。幻灯片标题为“免唤醒连续对话的语音全双工架构”,副标题承诺“精准抗干扰、动态判停、实时意图接管”。左半部分标注为“流式AudioLLM预训练”,其中音频编码器通过适配器将音频输入到Qwen LLM,同时还有文本tokens。右半部分的“全双工后训练”是其中有趣的部分。

该后训练面板暴露了一个新闻稿中从未提及的四态分类器。阅读图例:<0>表示噪声或者静音。<1>表示有语音但无实际语义。<2>表示有语义但不完备,语音可打断信号。<3>表示语音语义完备,判停信号。模拟推理显示,tokens“那 北京 明天 的 天气 呢”被标记为<1>、<1>、<2>、<2>、2>、<3>,并注解说明连续两个<2>标签会触发“打断”,而<3>后跟<0>则触发“判停”。这就是Qwen如何在没有唤醒词的情况下实现重叠对话,以及如何声称在嘈杂环境中将误触发降低90%。

Qwen全双工语音架构幻灯片
带有英文标签的Qwen全双工语音架构

这意味着:消除唤醒词是目前最具价值的交互变革,而Qwen正以token级别而非通过更好的触发词来解决这个问题。每一次“Hey Meta”都提醒着眼镜是一个遥控器,而非伴侣,而Meta自身的实时翻译仍是轮流进行的。Google是唯一拥有真正可比资产的竞争对手,因为Gemini Live已经实现了流式传输和可打断性,但将其内置于Samsung眼镜中意味着要克服手机所没有的电池和散热限制。Mentra作为开源项目,很可能会接入最便宜的流媒体模型,并让开发者自行调整插话功能。四态分类器也是针对误触发的诚实回应:除非模型能够区分背景杂音和未完成的、针对它的句子,否则你无法在嘈杂的街道上声称眼镜始终在监听。

麦克风链有自己的幻灯片,标题是“端云协同的全链路拾音架构”,其目标是“缓解端侧算力依赖 提升翻译/听记准确率”:减少对设备端计算的依赖,提高翻译和转录的准确性。端侧链路运行5Mic阵列 + 1VPU,然后进行回声消除,然后进行定向增强,然后进行编码。多声道音频随后通过手机进入云端链路:解码、丢包补偿、增益控制,最后进行大模型语音增强。产品照片的说明文字是骨传导麦克风。五个麦克风加上一个骨传导拾音器,正如Qwen所称,是目前同类产品中最高的麦克风配置。

Qwen端云音频拾取架构幻灯片
带有英文标签的Qwen端云音频拾取架构

这意味着:阿里巴巴承认设备端计算不足,并将语音增强推向云端,这与Meta的策略截然不同。Meta尽可能地将翻译和字幕保持在设备附近,因为延迟和离线行为是其宣传的一部分,而且将原始房间音频发送到服务器在欧洲会引发监管问题,这是它不需要的。对于Samsung和Google来说,相同的架构既更容易也更危险:更容易是因为Gemini已经存在于云端,更危险是因为Galaxy眼镜将在上市第一天就在欧盟销售,而云端音频管道会招致Meta花费两年时间吸收的数据保护问题。与此同时,Mentra的开发者可以获得一个模板,他们可以使用任何托管模型进行复制。五个麦克风加上骨传导是真正的差异化因素,而且这是300美元以下产品中无人愿意支付的硬件成本。

眼动追踪幻灯片是数字隐藏的地方。“高精度眼动追踪系统”面板列出了四项声明:高精度,识别偏差 < 1°;高鲁棒性,0-10万 Lux全场景光照环境可用;低功耗,运行功耗 < 100mW;小体积,眼动模组 < 1.7mm³。第二张幻灯片将该功能分为两部分:眼动交互,口号是“直觉化操控 视线即指令”,以及注视点识别,承诺“实现对复杂环境中单一目标的'即时锁定'”。

第二个面板包含了演示文稿中唯一的真实UI模型,这是一个展示青花瓷的博物馆场景。用户气泡显示“这是什么?”,眼镜回答“你左前方的是...”。结合规格表阅读,意图明确:凝视取代了触摸板,凝视点成为视觉模型的裁剪提示,因此“这是什么”不再意味着“描述整个画面”。阿里巴巴还将凝视硬件用于支付,因为与蚂蚁集团合作构建的虹膜验证利用了相同的光学通路。

Qwen高精度眼动追踪系统幻灯片
Qwen凝视交互和凝视点识别幻灯片英文版

这意味着:“这是什么?”只有在眼镜知道“这个”是什么时才起作用,而凝视是回答这个问题的最经济方式。如今Meta回答的是整个画面,这就是为什么它的视觉回复在杂乱的场景中显得笼统,以及为什么Neural Band作为替代指向设备而存在。Mentra面临同样的构图问题,却没有传感器来解决。Google应该感到紧张,因为凝视加上多模态模型正是大家记忆犹新的Gemini演示,而阿里巴巴可能会在Android XR眼镜上市之前将其佩戴在人们脸上。如果将蚂蚁集团虹膜验证添加到相同的光学通路中,凝视就不再是一种输入方法:它变成了一个身份和支付传感器,这是Meta无法快速复制的业务,也是Samsung必须与各地区的银行谈判才能实现的业务。

常亮摄像头根本不是主摄像头,幻灯片对此作出了异常清晰的说明。在“端侧部署视觉识别模型”下,它指出“低功耗感知芯片 运行功耗 < 5mW”。标记为“分级视觉唤醒机制”的流程是:高清摄像头进入低功耗感知芯片(处理控制/通信/OTA、图像识别、Jpeg/YUV编码和RAW处理),再进入本地服务决策系统。从那里分叉:AON模式导致各场景主动服务完全在设备上运行,而高清模式则唤醒高性能计算芯片。只有经过这个分叉,才会出现标记为“图片/隐私授权/用户上传”的行,之后任何内容才会到达视觉记忆千问大模型和千问AIGC大模型。换句话说,同意门槛位于手机和云之间,而不是传感器和芯片之间。

Qwen分层视觉唤醒机制幻灯片
Qwen分层视觉唤醒机制幻灯片英文版

这意味着:一个5毫瓦的感知芯片全天候监控房间是将助手转变为Agent的功能,同时也将引发下一场隐私大战。请注意此幻灯片中同意门槛的位置:在手机和云之间,而不是在传感器和芯片之间。Meta故意没有推出常亮摄像头通路,其捕捉LED现在已成为其法律辩护的一部分,在一个纽约已经禁止智能眼镜进入法院的市场中。Google和Samsung继承了这一限制,并因欧盟AI法案及其自身企业客户而倍增,因此在西方,如果没有非常明显的硬件指示器,一个持续监控的Galaxy眼镜几乎无法上市。阿里巴巴可以先在中国推出,收集行为数据,让其竞争对手在它学习主动服务实际感受时争论同意问题。

在显示方面,Qwen打破了当前AI眼镜主导的头部锁定面板模式。“3D 空间显示”幻灯片分为3D显示(基于双显双光机、双目视差渲染和亚毫秒级硬同步)和3DoF显示(基于实时精准头部追踪、双芯协同渲染和帧率高至90FPS)。屏幕固定在房间中,而不是固定在你的鼻子上,7.1虚拟环绕音频追踪头部姿态,因此声源保持物理定位。

渲染图中的模拟卡片也值得一读,因为它们预示了发布后的用例:一个日历瓷砖显示“7月 星期五 17”,一个天气瓷砖显示“晴转多云 22°/29°”和“AQI 21 空气优”,一个通知“来自张三 下午4:00开会 会议室2”,一个聊天线程“这是设计稿 / 麻烦审核一下 / 没问题”,以及一个大的浮动面板,上面是Beyond的《海阔天空》歌词。日历、天气、工作IM和歌词:这是一款生产力工具和日常伴侣设备,而不是AR游戏推销。

Qwen 3D空间显示幻灯片
Qwen 3D空间显示幻灯片英文版

这意味着:这是与Meta最明显的差距。Ray-Ban Display是单眼、头部锁定的,一个固定在你鼻尖的通知界面,而Qwen描述的是双光学引擎、双目视差和90FPS的3DoF头部追踪,它将面板锚定在房间中。Viture和XREAL已经销售3DoF产品,但它们是系留式观看器,而非Agent眼镜。对于Samsung来说,赌注是直接的:搭载Gemini的Galaxy眼镜将与此进行比较,Android XR需要一个用于眼镜的空间窗口管理器,而不是缩小的头戴式设备UI。对于Google来说,这是一个平台问题,因为谁定义了浮动面板的位置、它如何跟随你以及可接受的延迟,谁就定义了应用程序模型。模拟卡片也告诉你目标用例:日历、天气、工作聊天和歌词。生产力和日常伴侣,而不是AR游戏。

健康幻灯片,“用户体征实时监测系统”,是每平方厘米工程细节最多的部分。端侧列将AON信号采集、ET(眼动追踪)、PPG和IMU串联到滤波消噪,再到多维度特征提取,并将NTC环温补偿串联到红外测温。App列处理数据融合和统计以及生理指标计算,将HRV和心率传递给云端列,云端列运行多模态生理压力算法、心率/血氧算法和多模态发热风险算法。下方横幅显示Qwen与医疗专家共同构建了“主任医师级”大模型,脚注警告“本功能提供的健康信息仅供日常参考,不构成医疗建议”。

健康模型展示了Qwen真正要销售的互动。用户问道“最近总觉得累,怎么回事呢?”,眼镜回答“今天久坐超过3小时,压力指数也比上周高20%,多户外活动有利于身心平衡”。三个图块标注了支柱:生理压力、体征监测和长期记忆。最后一个比传感器更重要,因为它是一个可穿戴设备不再回答问题,而是开始保存你个人资料的地方。

Qwen实时生命体征监测幻灯片
Qwen实时生命体征监测系统幻灯片英文版

这意味着:健康是Meta最弱、Samsung最强的侧翼。Meta与Oakley合作的运动系列通过合作伙伴计算活动量和心率,Mentra则完全没有传感器故事,因此在显示眼镜中集成PPG加温度加眼疲劳管线,将阿里巴巴置于Meta因监管原因而避免的类别中。另一方面,Samsung已经拥有手表、戒指和Samsung Health,因此读取HRV和疲劳的眼镜将融入其生态系统,而阿里巴巴必须从头开始构建,Google将提供解释这些数据的模型。Qwen自己的脚注中包含了一个警告:这仅供日常参考,不构成医疗建议,“主任医师级”模型是一个营销声明,而非批准。任何试图在欧洲或美国销售疲劳检测产品的人都需要更多的东西而不仅仅是一张幻灯片。

我们的看法:整体来看,这份演示文稿表明,AI眼镜的瓶颈不再是模型本身,而是其周围的传感器和功耗预算。每一张幻灯片都试图以镜框可承受的功耗成本实现常时感知-环境视觉5毫瓦,凝视低于100毫瓦,眼动模块1.7mm³,重负荷任务云端分流。Meta正在通过付费助理和自己的芯片路线图进行同样的竞争,而Samsung则依靠Galaxy生态系统。阿里巴巴的差异化在于,其Agent已经可以在其自身的超级应用经济中实现叫车、送餐、票务和支付等功能,而这正是西方平台所缺乏的基础设施。

两点注意事项。此处的所有数据均为Qwen自家数据,在Qwen的条件下测量,包括误触发减少90%和低于1度的凝视精度,所有这些都尚未经过独立测试。时间表也有所不同:新硬件将在今年晚些时候以旗舰Agent眼镜型号推出,而已经上市的Qwen S1和G1将通过OTA更新获得Agent软件层,但不包括眼动追踪、5毫瓦视觉芯片或3DoF显示。

我们追踪所有型号、规格和发布日期,并在我们的智能眼镜基准测试中记录了Qwen系列,以及Meta、Samsung、XREAL、Rokid等其他产品。

Source: Alibaba Group

Compare every smart glasses model

Interactive guide — prices, displays, cameras, battery.

每周简报

智能眼镜资讯,每周五直送邮箱。.

每周五清晨一封简报。无废话。一键退订。

我们绝不会分享您的邮箱。

相关文章

一副时尚、极简的智能眼镜放在桌子上, 镜片上泛着微弱、隐约的界面光芒, 强调内敛而非张扬的技术。

Analysis

智能眼镜 2026: 仍未满足日常用户的核心需求

尽管向 AI 和更轻盈的外形设计做出了有希望的转变, 智能眼镜行业根本上误解了普通人对信任和实际效用的需求。尤其是摄像头, 仍然是一个无法逾越的社会障碍。

J. MARCHAND·5 min read

Aug 26, 2026

讨论焦点

热议

本周空间计算领域最具争议的文章。

为你精选

为你推荐

从评测、新闻与分析中精选,你可能错过的内容。