ViWANT
16 9 月 2026, 周三

端侧运行30B模型靠什么?

在移动端运行大模型,参数规模与硬件能力之间的矛盾一直是核心瓶颈。当行业普遍认为端侧难以承载超过7B甚至13B的参数规模时,MediaTek天玑9600 Pro直接支持端侧运行高达30B的MoE混合专家模型,这背后靠的是几个关键层面的协同突破,而非单一硬件的堆叠。

首先是制程与架构的底子。天玑9600 Pro基于台积电2nm制程,这为高密度算力单元提供了必要的能效基础。但更关键的是其CPU采用了2+3+3全大核设计,没有使用传统的大小核混合架构来牺牲性能换取续航。4.55GHz的C2-Ultra超大核与34.5MB的大缓存,确保模型推理时数据搬运的延迟尽可能低。配合率先支持的LPDDR6内存和UFS 5.0闪存,内存带宽和存储读取速度足以支撑30B模型在推理过程中频繁的参数加载与中间结果交换。

其次,真正的算力核心在于双NPU架构的设计。天玑9600 Pro集成了一颗超性能NPU 1090和一颗第二代超能效NPU,前者负责处理复杂推理任务,后者则专攻低功耗长续运行与全时感知。对于30B规模的MoE模型,其推理负载并非均匀分布,MoE的稀疏激活特性意味着每次推理只激活部分专家网络。超性能NPU 1090的INT4运算能力翻倍,配合新一代生成式AI引擎3.0支持Hybrid Attention和大模型压缩技术,让量化后的30B模型能够在有限的功耗预算内完成推理。预填充性能提升51%、每瓦特生成词元数提升55%,这些指标直接决定了模型在端侧响应是否可用。

最后,软硬件协同层面,天玑智算融合架构和升级版天玑调度引擎让CPU与NPU深度协同,而非各自为战。这意味着模型推理时,系统可以精准调动算力、电源和内存资源,避免传统架构中某个环节成为瓶颈。加上天玑AI智能体化引擎3.0在系统层面的隐私安全与生态适配,30B模型的端侧运行才从“可能”变为“可行”。所以,端侧跑大模型不是靠某一项指标突破,而是制程、架构、内存、NPU设计以及软硬件调度的系统性工程。