高通把新一代手机芯片的卖点,从跑分和影像,明确转向了「本地能跑多大的模型」。

发生了什么

据 TechCrunch 报道,高通发布了两款新的智能手机芯片,主打 AI 能力。高通方面表示,其新的旗舰芯片可以在本地运行 300 亿参数的混合专家(MoE)模型。

这里有两个关键信息点。一是「本地」:模型不经过云端,直接在手机端推理。二是「MoE」:混合专家架构在推理时只激活部分参数,因此参数量大不等于实际计算量大,这正是它能在端侧落地的原因。

为什么重要

过去两年,手机厂商谈 AI,多数停留在把请求转发到云端大模型,端侧只做小模型的分流,比如摘要、翻译、简单问答。真正的旗舰级模型始终在数据中心里。

高通这次的表态,指向的是另一条路径:把有实际能力的大模型搬进设备。这背后是三重推力。

第一是隐私。数据不出设备,是端侧 AI 最直接的叙事,对企业和敏感场景尤其有说服力。

第二是成本与延迟。云端推理按 token 计费,用户规模一大,账单就压不住;而端侧推理的边际成本接近于零,响应也不再受网络波动影响。

第三是离线可用。飞机上、地下车库、弱网地区,云端方案直接失效,端侧模型不受影响。

值得注意的是,MoE 是关键变量。它让「300 亿参数」这个数字在端侧变得可谈——如果换成同等规模的稠密模型,内存占用和功耗都难以承受。换句话说,高通强调的不只是算力,更是架构与硬件的配合。

影响与看点

对开发者而言,端侧能跑 MoE 意味着应用形态会变。此前很多 AI 功能必须依赖联网和 API 调用,现在可以把一部分推理下沉到设备,做出响应更快、不依赖后端成本的体验,比如本地文档理解、离线助手、隐私敏感的输入处理。但也要清醒:本地跑得动,不等于跑得好。量化精度、上下文长度、持续推理的发热与续航,都是实际落地时要面对的问题。

对行业而言,这延续了手机芯片竞争重心迁移的趋势——从 CPU/GPU 峰值性能,转向 NPU 算力、内存带宽和能效比的综合较量。芯片厂商正在把「端侧大模型」当作新的旗舰叙事,而软件生态能否跟上,才是决定这套硬件是否被真正用起来的关键。

对普通用户,短期内更可能看到的是系统级助手变聪明、部分功能不再需要联网,而不是手机里突然多出一个通用大模型。

一个独立判断:端侧大模型的竞争,正在从「能不能跑」转向「跑起来是否划算」——功耗、内存和体验的平衡,会比参数数字更能决定胜负。