端侧大模型产品战:手机、PC、眼镜谁先跑出杀手级 Agent
高铁上没信号,你让手机总结一份 30 页的 PDF,它转三秒回你一句「网络不可用」。端侧 AI 反复被拿出来讲,就是因为这类场景根本等不到网。2026 年看手机、PC、眼镜三条线,真正卡住的是内存带宽、功耗预算和交互入口,模型参数反而不是最紧的那一环。
先装得下,再谈跑得动
端侧跑模型,第一道关卡是权重能不能塞进内存。以 4-bit 量化为例(目前端侧最常用的精度,再往下压画质掉得厉害):
| 模型规模 | Q4 权重体积 | 现实里能装的设备 |
|---|---|---|
| 1–2B | 0.8–1.5 GB | 眼镜、手表、手机常驻 |
| 3–4B | 2–3 GB | 手机主力、眼镜外挂 |
| 7–8B | 4–5 GB | PC、Mac |
| 13–14B | 7–9 GB | 32GB 内存的 PC/Mac |
| 30B+ | 16 GB 起 | 独显工作站 |
第二道关卡是内存带宽,它比 TOPS 更卡人。解码阶段每一步都要把权重从内存读一遍,NPU 算得再快,带宽喂不饱就是干等。苹果给 M 系列做统一内存,一部分原因就在这里:CPU、GPU、NPU 共用同一块高带宽内存,模型不用来回搬。
第三道是功耗。手机跑 3B 模型,连续生成几分钟机身就热,系统随后降频。眼镜更糟——它的 SoC 通常是手表量级,电池只有几百毫安时,本地跑模型的窗口很窄。
三条线的代表方案
手机:本地做小事,复杂任务混合
苹果在 Apple Intelligence 里放了一个约 30 亿参数的端侧模型,负责摘要、通知归并、写作工具这类任务;不够用的时候走 Private Cloud Compute,把请求交给苹果自研芯片的服务器,官方说法是不落盘、不留存。
高通这边靠骁龙 8 系的 Hexagon NPU 推端侧推理,2024 年之后的旗舰普遍宣传能跑 7B 级别,实际到手稳不稳,取决于厂商有没有把内存和散热留出来。
谷歌的 Gemini Nano 在 Pixel 上做通话防诈和录音摘要,模型随系统更新,用户不用自己下。
手机端 2026 年真能跑顺的任务,大概就这些:
- 通知摘要与优先级排序
- 离线翻译(短句、单词级)
- 相册语义搜索(「找上个月在海边拍的那张」)
- 通话实时转写与要点提取
- 输入法本地纠错与改写
PC:唯一能舒服跑 7B 以上模型的形态
微软给 Copilot+ PC 划了门槛:NPU 算力 40 TOPS 以上、16GB 内存、256GB 存储。对应的芯片是高通骁龙 X 系列(45 TOPS)、AMD Ryzen AI 300 系列(50 TOPS)、Intel Lunar Lake(48 TOPS)。微软自己塞了个 Phi Silica 做系统级生成,比如画图里的重绘、截图里的文字提取。
Mac 走统一内存路线。M 系列芯片 32GB 的机器塞一个 14B Q4 模型没什么压力,Ollama、LM Studio 这类本地推理工具在 Mac 上接 Metal 后端,跑起来比 Windows 顺手一些。
PC 的短板在移动场景。笔记本拔了电源跑本地模型,续航掉得肉眼可见;插着电办公的人则基本无感。这也是 PC 端 Agent 最先在企业办公场景被接受的原因——会议室里电源管够,任务也明确。
眼镜:入口最干净,算力最窘迫
Ray-Ban Meta 的思路是眼镜做采集和唤醒,识别、回答全在云上。2025 年发布的 Meta Ray-Ban Display 加了一块单目显示屏和 Neural Band 腕带,把输入从纯语音扩到手指微动,但推理仍然依赖配对设备。
国内的 Rokid Glasses、雷鸟等产品路线接近:眼镜负责拍摄、显示、收音,手机负责算。眼镜本地能干的活儿,目前集中在 1–2B 模型能覆盖的范围——唤醒词识别、语音降噪、简单意图分类。
| 维度 | 手机 | PC | AI 眼镜 |
|---|---|---|---|
| 端侧可用算力 | 中 | 高 | 低 |
| 内存余量 | 3–4 GB | 8 GB 以上 | 1 GB 级 |
| 典型本地任务 | 摘要、翻译、搜索 | 代码补全、会议纪要 | 唤醒、降噪、意图 |
| 续航压力 | 高 | 中(插电无感) | 极高 |
| 交互入口 | 屏幕 + 语音 | 键鼠 + 窗口 + 语音 | 语音 + 手势/腕带 |
| 云端依赖 | 混合 | 可选 | 强 |
离线、续航、入口这三件事决定了形态
离线隐私:用户不会为它单独买单,但会因为它换设备
端侧处理在隐私上的说服力很直接——数据不出机器。企业采购尤其吃这一套:法务、医疗、财务这几类岗位,文档不能上传第三方服务器,本地摘要和本地检索是刚需。
苹果的 Private Cloud Compute 是个折中方案:能本地做的本地做,做不了的送到自研芯片服务器,用可验证的方式证明不留数据。这个模式目前跑通了,但它依赖苹果自己造芯片、自己控系统,别家很难照搬。
续航:眼镜最紧,PC 最松
眼镜电池容量小,本地推理一开,续航从一天掉到几小时。所以眼镜的方案基本都选了「本地只做唤醒,重活交手机」。
手机介于中间。系统会给本地模型设配额,后台任务和前台任务分优先级,充电时才跑大一点的模型。
PC 相对宽松,插电状态下算力可以放开用。
交互入口:入口决定 Agent 能做什么
手机屏幕小,注意力碎片化,适合短任务、高频次——通知、提醒、查找。让用户在手机上跑一个十分钟的 Agent 流程,不现实。
PC 有键盘、有窗口、能同时开多个应用,适合长流程、多步骤——写代码、整理会议、跨文件检索。这也是 PC 端最可能先跑出真 Agent 的原因。
眼镜的入口最自然,你看到什么就问什么,但输出带宽最窄。它适合一句话能说清的事:这是谁、这多少钱、怎么走。
12 个月内的场景分化
按现在的硬件节奏往后推一年:
手机先落地的是通知链路。系统把杂乱的通知压成一两句摘要,帮你判断哪些现在看。离线翻译会覆盖更多语言对,但长文档翻译还是走云。本地 Agent 更多是「单步助手」,不是多步执行。
PC 的企业办公场景会先出现可用的 Agent。本地跑 7B 级别模型加工具调用,做「会议录音转写 → 要点提取 → 待办生成」这条链路,已经能跑通。代码补全和本地知识库检索也会是高频项。
眼镜的粘性来自翻译和第一视角提醒。翻译延迟能压到接近实时,同声传译是它最容易出圈的功能。第一视角拍照加事后检索,也在慢慢成型。
谁先跑出杀手级 Agent?我的判断是 PC 先跑出「能用」的,眼镜先跑出「离不开」的,手机量最大但最晚成熟。原因是 Agent 需要三样东西——长上下文、多步工具调用、稳定供电——PC 全占了,眼镜占一样,手机一样都占不满。
现在就能做的一件事
装一个 Ollama(Windows / macOS / Linux 都有),拉一个 4B 级别的模型,比如 Qwen3 4B 或 Gemma 3 4B:
ollama run qwen3:4b
跑起来之后盯两个数:第一次响应要等几秒,连续对话十分钟后机器烫不烫。这两个数基本决定了你这台设备能不能承担端侧 Agent 的日常任务。如果十分钟后明显降频,说明散热是短板;如果首次响应超过五秒,说明内存带宽不够,换更大的模型只会更慢。