端侧AI战争:手机、PC、眼镜如何重写人机交互
把手机的飞行模式打开,再让它总结一段 20 分钟的会议录音。能跑完,说明模型在设备上;转圈或者直接报错,说明它得连网。这个动作比任何参数表都更能说明一台 2026 年的设备到底有没有端侧 AI。
产品体验向的评测,先盯三个信号
爱范儿、少数派这一路的稿子很少堆跑分,落点通常在“用起来哪里别扭”。端侧 AI 恰好在这类观察下最容易露馅,信号有三个。
第一次响应的时间。 端上跑 3B 到 4B 的量化模型,首 token 常在几十毫秒到两百毫秒之间,波动小;走云要过网络、要排队,300 毫秒到 2 秒都出现过。两台设备并排放在桌上,打字机效果出来的快慢骗不了人。
系统入口的深度。 长按侧键、双击背面、眼镜腿上的触控板、Meta 那根 sEMG 腕带——入口每深一层,使用频次就掉一截。语音助手喊了十年没起色,很大原因是它要求用户先想清楚“我现在要用语音”。
失败时说不说实话。 走端还是走云,很多产品不写。断开网络跑一遍,功能清单会自己招供。
出稿前可以这样过一遍:
- 飞行模式下逐个跑 AI 功能,记下哪些还能用
- 连续对话 10 分钟,摸后盖温度,看是否降速
- 记录 10 分钟推理耗掉的电量百分比
- 在设置里找“在设备上处理”的开关,关掉再试一次
- 查看历史记录落在哪:本地、厂商账号,还是两边都有
端侧跑什么、云端跑什么
分流不是技术洁癖,是成本表算出来的结果。
| 维度 | 端侧(3B–8B 量化) | 云端(大模型) |
|---|---|---|
| 首字延迟 | 几十到两百毫秒,负载波动小 | 300 毫秒到 2 秒,受网络与排队影响 |
| 单次成本 | 硬件已付,边际成本接近 0 | 按 token 计费,用得越多账单越长 |
| 能力上限 | 摘要、改写、分类、意图解析、简单工具调用 | 复杂推理、长文档、多步 agent |
| 上下文 | 手机常做 4K,PC 可到 8K–32K | 128K 起 |
| 知识新鲜度 | 训练截止即冻结,除非外挂检索 | 可联网 |
| 离线 | 可用 | 不可用 |
一个能直接抄走的路由逻辑:
注意最后一步:云端结果回传后应该落到本地存一份,否则用户下次断网就查不到历史。很多产品的“云端优先”体验就是在这里断掉的。
芯片、内存、隐私、续航:四个约束互相卡脖子
算力标称值只能当参考
| 平台 | 厂商公布口径 | 典型设备 |
|---|---|---|
| Apple A17 Pro / A18 系列 | 35 TOPS(16 核神经引擎) | iPhone 15 Pro 起 |
| Apple M4 | 38 TOPS | iPad Pro、Mac |
| 骁龙 8 Gen 3 | 45 TOPS | 2024 年旗舰 Android |
| 骁龙 8 Elite | 80 TOPS | 2024 年末起的旗舰 |
| 骁龙 X Elite | 45 TOPS | Windows on Arm 轻薄本 |
| Intel Core Ultra 200V | NPU 48 TOPS / 平台 120 TOPS | 轻薄本 |
| AMD Ryzen AI 300 | NPU 50 TOPS | 轻薄本 |
真正卡住速度的是内存带宽
大模型解码是 memory-bound 的活儿:每生成一个 token,都要把全部权重从内存里过一遍。7B 模型 INT4 量化后权重约 4GB,手机上的 LPDDR5X 带宽大致在 68–77GB/s 区间,理论天花板差不多就是每秒 17 到 19 个 token,实际还要打七折。M4 的统一内存带宽在 120GB/s 一档,差距不在 NPU 的 TOPS 上,在总线。
所以下一轮硬件升级的重点,很可能不是“NPU 又翻倍了”,而是内存容量和带宽。至于 LPDDR6 什么时候上机、手机旗舰什么时候普遍上 16GB,比 NPU 数字更值得盯。
隐私不等于“本地就安全”
数据不出设备确实能少一条泄露路径,但本地模型也有自己的问题:权重放在 App 沙盒外可被提取,端上模型面对摄像头输入同样会被提示注入,眼镜这种带摄像头的设备还要处理旁观者的隐私——指示灯亮不亮、拍完的照片存哪里,是产品设计问题,不是算法问题。
合规上,《人工智能生成合成内容标识办法》自 2025 年 9 月 1 日起施行,生成内容需要做标识;欧盟 AI 法案对通用模型的透明度义务从 2025 年 8 月起分阶段生效。做端侧产品的团队,这两条得进法务清单。
续航决定交互形态
一块 5000mAh 的电池约 19Wh。如果推理持续跑在 5W 上,撑不到 4 小时——这还是不算屏幕和基带。所以手机上的端侧 AI 是“短时爆发”,不是常驻。眼镜更极端:Ray-Ban Meta 官方口径是连续使用约 4 小时,配合充电盒到 36 小时左右。
这条约束直接决定了眼镜的交互:不能常开唤醒词死听,得靠按键、触控、或者腕带这类明确触发。谁能在低功耗唤醒上抠出 100 毫瓦,谁就能多一种交互。
开发者怎么接,钱从哪来
四条接入路径,按平台分:
- Apple:iOS 26 / macOS 26 起开放 Foundation Models framework,直接用系统自带的约 30 亿参数模型,本地推理、开发者不需要为 token 付费,支持结构化输出和工具调用。超出能力范围的请求走 Private Cloud Compute,需用户同意。
- Android:ML Kit 的 GenAI API 加 AICore,底层是 Gemini Nano。问题在于不是所有机型都有 AICore,必须做能力检测和降级。
- Windows:Copilot+ PC 门槛是 40+ TOPS NPU,Phi Silica 这类系统内置小模型通过 Windows AI APIs / Windows ML 调用,DirectML 和 ONNX Runtime 兜底其他显卡。
- 跨平台兜底:llama.cpp、MLC-LLM、ONNX Runtime GenAI、ExecuTorch,模型侧可选 Llama 3.2 1B/3B、Qwen3 的 0.6B/1.7B/4B、Gemma 3 1B/4B、Phi-3.5-mini 这一类。
| 设备档位 | 内存 | 建议模型 | 建议上下文 |
|---|---|---|---|
| 旗舰手机 | 12GB+ | 3B–4B INT4 | 4K |
| 中端手机 | 8GB | 1B–2B INT4 | 2K |
| Copilot+ PC | 16–32GB | 7B–14B INT4 | 8K–32K |
| Apple Silicon Mac | 16GB+ 统一内存 | 7B–14B 4bit | 32K |
| 智能眼镜 | 2–4GB | 本地跑不动,靠手机或云 | — |
硬件这边,眼镜的价格带已经拉到 299 到 799 美元。处方镜片合作、订阅服务、配件,是眼镜厂商比手机厂商多出来的几条收入线。
未来 12 个月盯这六个变量
- 旗舰手机的内存基线:16GB 会不会成为标配。这直接决定 7B 模型能不能上手机。
- LPDDR6 的商用节奏:带宽上不去,TOPS 再多也是空转。
- 系统级 agent API 的开放程度:看第三方 App 有多少真的接了 App Intents 一类的系统行动接口,而不是只在发布会上演示。
- 眼镜的重量、续航和价格:能不能落到 500 美元以内、连续使用超过 6 小时,这决定它是极客玩具还是大众品类。
- 4B 级模型的基准曲线:在 IFEval 这类指令跟随测试上追平 2024 年的 70B 还要多久。
- 合规执行细则:生成内容标识办法在端侧设备上的具体落地方式,以及欧盟对端侧模型的适用解释。
今晚就能做的一件事
拿你手边最常用的那台设备,开飞行模式,把设置里所有带“AI”“智能”“助手”字样的功能点一遍,记下哪些还能用、哪些直接罢工。这份清单比参数页更能告诉你,你买到的到底是端侧 AI,还是一个联网按钮。
关于视频参考:本文不附具体链接,因为视频会下架、链接会失效,转述容易失真。想看实测,可以在 B 站、抖音搜索“端侧大模型 实测”“AI 眼镜 续航 实测”“Copilot+ PC 离线测试”这类关键词,观看时注意区分厂商送测内容和自购实测。
免责声明:文中芯片算力、模型参数、价格与法规时间点均为公开信息整理,厂商口径与定价可能随时调整,下单或立项前请以官方页面和最新法规原文为准。