端侧AI战争:手机、PC、眼镜如何重写人机交互

科技硬件端侧AIAI手机AI PC智能眼镜端云协同NPU2026-09-29

端侧AI战争:手机、PC、眼镜如何重写人机交互

把手机的飞行模式打开,再让它总结一段 20 分钟的会议录音。能跑完,说明模型在设备上;转圈或者直接报错,说明它得连网。这个动作比任何参数表都更能说明一台 2026 年的设备到底有没有端侧 AI。

产品体验向的评测,先盯三个信号

爱范儿、少数派这一路的稿子很少堆跑分,落点通常在“用起来哪里别扭”。端侧 AI 恰好在这类观察下最容易露馅,信号有三个。

第一次响应的时间。 端上跑 3B 到 4B 的量化模型,首 token 常在几十毫秒到两百毫秒之间,波动小;走云要过网络、要排队,300 毫秒到 2 秒都出现过。两台设备并排放在桌上,打字机效果出来的快慢骗不了人。

系统入口的深度。 长按侧键、双击背面、眼镜腿上的触控板、Meta 那根 sEMG 腕带——入口每深一层,使用频次就掉一截。语音助手喊了十年没起色,很大原因是它要求用户先想清楚“我现在要用语音”。

失败时说不说实话。 走端还是走云,很多产品不写。断开网络跑一遍,功能清单会自己招供。

出稿前可以这样过一遍:

  • 飞行模式下逐个跑 AI 功能,记下哪些还能用
  • 连续对话 10 分钟,摸后盖温度,看是否降速
  • 记录 10 分钟推理耗掉的电量百分比
  • 在设置里找“在设备上处理”的开关,关掉再试一次
  • 查看历史记录落在哪:本地、厂商账号,还是两边都有

端侧跑什么、云端跑什么

分流不是技术洁癖,是成本表算出来的结果。

维度端侧(3B–8B 量化)云端(大模型)
首字延迟几十到两百毫秒,负载波动小300 毫秒到 2 秒,受网络与排队影响
单次成本硬件已付,边际成本接近 0按 token 计费,用得越多账单越长
能力上限摘要、改写、分类、意图解析、简单工具调用复杂推理、长文档、多步 agent
上下文手机常做 4K,PC 可到 8K–32K128K 起
知识新鲜度训练截止即冻结,除非外挂检索可联网
离线可用不可用
这里有个容易被忽略的账:KV cache。以 Llama 3 8B 这类 GQA 结构为例,FP16 的 KV cache 每 token 约 128KB,4K 上下文就是 500MB 左右,量化到 INT8 也还有 250MB。权重占 4GB、缓存再吃几百兆,一台 8GB 内存的手机光是装下就已经很紧张——这就是为什么手机上多数厂商停在 3B 到 4B。

一个能直接抄走的路由逻辑:

flowchart TD A[用户请求] --> B{涉及人脸/证件/病历等敏感数据} B -- 是 --> C[端侧模型] B -- 否 --> D{当前是否断网或弱网} D -- 是 --> C D -- 否 --> E{上下文超过 8K 或需要多步工具调用} E -- 是 --> F[云端大模型] E -- 否 --> C C --> G[本地返回结果] F --> H[结果回传并写入本地记录]

注意最后一步:云端结果回传后应该落到本地存一份,否则用户下次断网就查不到历史。很多产品的“云端优先”体验就是在这里断掉的。

芯片、内存、隐私、续航:四个约束互相卡脖子

算力标称值只能当参考

平台厂商公布口径典型设备
Apple A17 Pro / A18 系列35 TOPS(16 核神经引擎)iPhone 15 Pro 起
Apple M438 TOPSiPad Pro、Mac
骁龙 8 Gen 345 TOPS2024 年旗舰 Android
骁龙 8 Elite80 TOPS2024 年末起的旗舰
骁龙 X Elite45 TOPSWindows on Arm 轻薄本
Intel Core Ultra 200VNPU 48 TOPS / 平台 120 TOPS轻薄本
AMD Ryzen AI 300NPU 50 TOPS轻薄本
这些数字的统计口径并不统一:INT8 还是 INT4、是否算上稀疏、是不是把 CPU 和 GPU 一起算进“平台算力”,各家写法不同。跨代跨厂直接比大小没有意义,看实测 token/s 更实在。微软给 Copilot+ PC 划的门槛是 40+ TOPS,这算一条能对齐的线。

真正卡住速度的是内存带宽

大模型解码是 memory-bound 的活儿:每生成一个 token,都要把全部权重从内存里过一遍。7B 模型 INT4 量化后权重约 4GB,手机上的 LPDDR5X 带宽大致在 68–77GB/s 区间,理论天花板差不多就是每秒 17 到 19 个 token,实际还要打七折。M4 的统一内存带宽在 120GB/s 一档,差距不在 NPU 的 TOPS 上,在总线。

所以下一轮硬件升级的重点,很可能不是“NPU 又翻倍了”,而是内存容量和带宽。至于 LPDDR6 什么时候上机、手机旗舰什么时候普遍上 16GB,比 NPU 数字更值得盯。

隐私不等于“本地就安全”

数据不出设备确实能少一条泄露路径,但本地模型也有自己的问题:权重放在 App 沙盒外可被提取,端上模型面对摄像头输入同样会被提示注入,眼镜这种带摄像头的设备还要处理旁观者的隐私——指示灯亮不亮、拍完的照片存哪里,是产品设计问题,不是算法问题。

合规上,《人工智能生成合成内容标识办法》自 2025 年 9 月 1 日起施行,生成内容需要做标识;欧盟 AI 法案对通用模型的透明度义务从 2025 年 8 月起分阶段生效。做端侧产品的团队,这两条得进法务清单。

续航决定交互形态

一块 5000mAh 的电池约 19Wh。如果推理持续跑在 5W 上,撑不到 4 小时——这还是不算屏幕和基带。所以手机上的端侧 AI 是“短时爆发”,不是常驻。眼镜更极端:Ray-Ban Meta 官方口径是连续使用约 4 小时,配合充电盒到 36 小时左右。

这条约束直接决定了眼镜的交互:不能常开唤醒词死听,得靠按键、触控、或者腕带这类明确触发。谁能在低功耗唤醒上抠出 100 毫瓦,谁就能多一种交互。

开发者怎么接,钱从哪来

四条接入路径,按平台分:

  • Apple:iOS 26 / macOS 26 起开放 Foundation Models framework,直接用系统自带的约 30 亿参数模型,本地推理、开发者不需要为 token 付费,支持结构化输出和工具调用。超出能力范围的请求走 Private Cloud Compute,需用户同意。
  • Android:ML Kit 的 GenAI API 加 AICore,底层是 Gemini Nano。问题在于不是所有机型都有 AICore,必须做能力检测和降级。
  • Windows:Copilot+ PC 门槛是 40+ TOPS NPU,Phi Silica 这类系统内置小模型通过 Windows AI APIs / Windows ML 调用,DirectML 和 ONNX Runtime 兜底其他显卡。
  • 跨平台兜底:llama.cpp、MLC-LLM、ONNX Runtime GenAI、ExecuTorch,模型侧可选 Llama 3.2 1B/3B、Qwen3 的 0.6B/1.7B/4B、Gemma 3 1B/4B、Phi-3.5-mini 这一类。
设备分级建议这样定:

设备档位内存建议模型建议上下文
旗舰手机12GB+3B–4B INT44K
中端手机8GB1B–2B INT42K
Copilot+ PC16–32GB7B–14B INT48K–32K
Apple Silicon Mac16GB+ 统一内存7B–14B 4bit32K
智能眼镜2–4GB本地跑不动,靠手机或云—
商业模式上有个变化值得注意:端侧推理的边际成本接近 0,厂商就敢把“不限次数”写进卖点。苹果在 Foundation Models framework 上的做法很直白——不按 token 收费。反过来,云 API 这边即使是最便宜的档位,2025 年前后的公开价也在每百万输入 token 0.1 到 0.2 美元、输出 0.4 到 0.8 美元的区间(具体价格各家会调整,以官方定价页为准)。持续高频调用的产品,账单会自己教团队做端云分流。

硬件这边,眼镜的价格带已经拉到 299 到 799 美元。处方镜片合作、订阅服务、配件,是眼镜厂商比手机厂商多出来的几条收入线。

未来 12 个月盯这六个变量

  • 旗舰手机的内存基线:16GB 会不会成为标配。这直接决定 7B 模型能不能上手机。
  • LPDDR6 的商用节奏:带宽上不去,TOPS 再多也是空转。
  • 系统级 agent API 的开放程度:看第三方 App 有多少真的接了 App Intents 一类的系统行动接口,而不是只在发布会上演示。
  • 眼镜的重量、续航和价格:能不能落到 500 美元以内、连续使用超过 6 小时,这决定它是极客玩具还是大众品类。
  • 4B 级模型的基准曲线:在 IFEval 这类指令跟随测试上追平 2024 年的 70B 还要多久。
  • 合规执行细则:生成内容标识办法在端侧设备上的具体落地方式,以及欧盟对端侧模型的适用解释。

今晚就能做的一件事

拿你手边最常用的那台设备,开飞行模式,把设置里所有带“AI”“智能”“助手”字样的功能点一遍,记下哪些还能用、哪些直接罢工。这份清单比参数页更能告诉你,你买到的到底是端侧 AI,还是一个联网按钮。

关于视频参考:本文不附具体链接,因为视频会下架、链接会失效,转述容易失真。想看实测,可以在 B 站、抖音搜索“端侧大模型 实测”“AI 眼镜 续航 实测”“Copilot+ PC 离线测试”这类关键词,观看时注意区分厂商送测内容和自购实测。

免责声明:文中芯片算力、模型参数、价格与法规时间点均为公开信息整理,厂商口径与定价可能随时调整,下单或立项前请以官方页面和最新法规原文为准。

PREMIUM

需要完整版教程?

包含详细步骤、视频演示、提示词模板和可下载资料包。微信支付即时获取。

购买完整版 ¥29.90