手机里的AI助手,终于要从"嘴强王者"进化成"干活能手"了。9月11日,高通正式揭晓第六代骁龙8至尊版系列芯片的NPU底牌——全新Hexagon NPU不再是通用加速器的思路,而是从架构层面就瞄准了一个目标:让AI智能体在手机端真正跑起来。

这次最大的杀手锏是全新的Element Accelerator。它专为Transformer架构打造,集成了向量计算单元和标量计算单元,能精准加速大模型中最吃算力的运算环节。配合大幅扩展的大容量共享内存,多模型状态、上下文信息和KV-cache数据都能就近存储在加速器旁边,从根本上缓解内存瓶颈。这意味着智能体在处理长上下文、调用多个工具、执行并发任务时,不再卡顿掉链子。

更值得关注的是高通在MoE架构上的押注。混合专家模型的核心逻辑是"按需激活"——一个300亿参数的MoE模型,每次推理只需激活约30亿参数,算力消耗大幅降低。结合智能的闪存到内存加载管理机制与缓存技术,手机端有望实现以往只有云端才能支撑的大模型级AI体验,同时兼顾低功耗和隐私保护。

从行业视角看,高通这步棋的意图很清晰:当智能体AI从"能聊天"进化到"能干活",算力需求的重心正在从云端向终端迁移。谁能在端侧提供足够强的推理能力,谁就掌握了下一代AI入口的话语权。高通选择从NPU架构层面重构而非简单堆算力,某种程度上是在为"端侧智能体时代"提前铺路。

AI 生成 · DeepSeek | 搜索综合