端侧AI产品体验评测框架:手机、PC与眼镜

产品评测端侧AI产品评测离线推理手机PC智能眼镜2026-09-19

端侧AI产品体验评测框架:手机、PC与眼镜

发布会演示里那个断网也能对话的助手,真到手里往往是转圈三十秒然后报错。这套评测框架是从这个落差里长出来的:不看发布会上演示了什么,看断网后还剩多少。

适用范围先说清楚。框架用来横向比较手机、PC、智能眼镜三类终端上的端侧 AI 功能,评测对象是某一台设备上的某一版功能,不针对品牌。同一台手机,系统更新前后可以测出两套结果,所以每条数据都要带上版本号和测试日期。下面提到的机型门槛、平台要求,均为 2026 年公开可查的信息,会随系统更新变化。

六维指标:每一项都要能测出数字

离线可用:先断网,再看剩什么

最容易被高估的一项。做法很直接:开飞行模式(iOS 同时关掉 Wi-Fi 通话,Android 直接开飞行模式),把预设任务逐个跑一遍,记三档结果——完成、降级、失败。

任务集建议固定成 10 条,覆盖三种输入类型:

输入类型任务示例观察点
语音会议录音转文字并生成待办是否本地解码,失败时是报错还是转圈
文本网页或文档摘要是否要求联网拉取正文
相机拍菜单翻译、拍白板总结图像是否必须上传
一个常见陷阱:断网时部分功能会排队等网络,界面上只显示一个加载动画,五分钟也不报错。这比直接报错更糟,用户会以为是自己操作错了。测试时给自己设一个 30 秒上限,超时算失败。

参考及格线:10 条任务里至少 4 条断网可用,失败时 3 秒内给出明确提示。

延迟:拆成四段分别测

只测“总共花了多久”意义不大,因为不同环节的瓶颈不一样。拆开看:

  • 唤醒延迟:按下按键或说出唤醒词,到界面可用、开始收音
  • 首字延迟:开始输入到第一个字或第一段声音出现
  • 完整响应:到结果全部输出
  • 端到端:抬手拍照到听到答案这种包含硬件动作的完整链路
测量用 240fps 慢动作视频拍屏幕,再用 ffmpeg 抽帧数帧,比秒表准得多:

# 240fps 视频抽帧,一帧约 4.17ms
ffmpeg -i slowmo.mp4 -vf fps=240 frame_%04d.png

同一个任务拍三次取中位数,别取平均值,偶发长尾会把平均值带偏。

感受区间的参考值(和个人耐受度有关,当校准起点用):语音唤醒 300ms 以内感觉是随叫随到,1 秒以上用户会重复说话;文本首字 500ms 以内比较顺;相机问答 3 秒以内能接受,5 秒以上大多数人会放下设备。

网络分三档测:Wi-Fi、蜂窝、飞行模式。云端模型在弱网下的 P95 延迟和本地差一大截,只测 Wi-Fi 会得出过于乐观的结论。

隐私:抓包看数据去了哪

这一项没法靠感觉,得有证据。抓包工具按平台选:

  • Android:PCAPdroid,免 root,走 VPN 通道
  • macOS:LuLu 或 Little Snitch
  • Windows:GlassWire,或直接开 Wireshark 抓无线网卡
  • 路由器层:OpenWrt 上跑 tcpdump,覆盖所有联网设备
测试时跑三条链路——语音、文字、相机——分别看有没有连接外部推理接口。看域名和连接时机就够了,通常不需要解密内容。

除了抓包,还要检查三处设置:

  • 相机画面和原始录音是否上传(有些功能本地只做唤醒,实际内容还是走云)
  • 历史记录默认开还是关,能不能一键清空
  • 本地缓存放哪、占多大,删掉之后功能还剩多少
系统级的全局记忆类功能要额外看三点:默认状态、打开时的身份验证要求、能不能设置排除的应用和网站。三样缺一样,这个功能就不适合在共用设备上打开。

功耗:单次任务耗电百分比加待机 8 小时

用系统自带的工具最省事:

# Windows:生成 HTML 电池报告
powercfg /batteryreport /output %USERPROFILE%\battery.html
# Android:导出电池统计,再用 Battery Historian 分析
adb shell dumpsys batterystats > batterystats.txt

macOS:实时看各进程能耗

sudo powermetrics --samplers cpu_power,energy

测法:把电量充到固定值(比如 80%),跑 10 次同一任务,看掉几个百分点,换算成单次成本。再单独记一个待机 8 小时的掉电量,用来看后台有没有偷偷跑模型。

眼镜这一类要单独说。电池容量小,摄像头、无线连接和推理同时跑的时候掉电很快,机身发热之后还会降频,延迟跟着往上走。所以眼镜的延迟测试要分冷机和连续使用 5 分钟后两轮,两轮的差距往往比不同品牌之间的差距还大。

模型更新:更新一次,所有旧数据作废

模型换版本,能力跟着变,之前测的分数就不能再用了。评测记录里必须有版本号。

要看四件事:

  • 更新方式:随 App 包更新,还是后台静默下载
  • 更新体积:几百 MB 还是几个 GB(关掉蜂窝,看还能不能更新完成)
  • 支持机型变化:老设备继续支持,还是被砍掉
  • 版本可见性:设置里能不能看到模型版本号,出问题能不能回滚
如果设置里根本没有模型版本号,这个产品的端侧能力基本是个黑盒。退一步,至少记录 App 版本和系统版本。

场景闭环(任务完成度):数人工介入次数

单点能力好,不代表能做完一件事。这一项不看功能列表,看完整链路,数中间需要人接管几次。

三个典型链路:

  • 手机:会议录音 → 转写 → 抽取待办 → 写入日历或提醒事项
  • PC:本地文件或邮件 → 摘要 → 生成大纲 → 导出可交付文档
  • 眼镜:看到路牌或菜单 → 拍照 → 翻译或问答 → 语音输出
判分用介入次数 N:N 小于等于 1 算顺,N 等于 2 算能用但不省事,N 大于等于 3 基本就是演示时好看、日常不会用。

还有一个容易忽略的点——输出格式。结果出来了,但用户需要手动复制到别处整理,那 N 还得再加一次。

权重按场景调

六个维度不是等权的,按使用场景调:

场景高权重维度低权重维度
通勤、户外(手机)延迟、功耗模型更新
办公(PC)任务完成度、模型更新功耗(插电时)
智能眼镜延迟、功耗、隐私模型更新
合规敏感环境隐私、离线可用延迟

三类终端横向对比

手机PC智能眼镜
硬件门槛参考iPhone 15 Pro 及后续机型支持 Apple 智能;Pixel 走 Gemini Nano;国内厂商机型门槛各不相同Copilot+ PC 的 NPU 门槛是 40+ TOPS,对应骁龙 X Elite/X Plus、AMD Ryzen AI 300、Intel Core Ultra 200V 等平台;本地跑 7B 量化模型建议内存 16GB 起步无公开算力门槛,推理多依赖手机或云端
离线可用转写、摘要、部分翻译可用;多模态问答和文生图多数走云用 Ollama、LM Studio 本地跑量化模型,断网可用断网后基本只剩拍照和录像
延迟唤醒最快,端到端通常 1–3 秒首字比手机慢,长文输出更稳受蓝牙和网络影响大,波动最明显
功耗中等,长时间录音转写会发热插电无所谓,离电续航掉得快,风扇会响最大瓶颈,连续使用掉电快并降频
隐私可控性最差,App 生态杂,抓包能抓到不少上传最好,可断网、可管控、可审计最敏感,拍摄他人涉及社交冲突
模型更新随系统或 App 更新,体积大驱动、运行时、模型三层都要更新,兼容问题最多跟着手机 App 走,用户基本无感知
主要短板能力碎片化,同一机型不同 App 各跑各的离电后体验断崖式下降电池和交互时长都不够用
表里的机型门槛和平台信息会随系统更新变化,购买前以厂商官方页面为准。

一套可复用的测试流程

  • 固定 10 条测试任务,三种输入类型都覆盖
  • 记录设备型号、系统版本、App 版本、模型版本号(能看到就记)
  • 三档网络各跑一遍:Wi-Fi、蜂窝、飞行模式
  • 240fps 慢动作拍三次,取中位数
  • 抓包 15 分钟,导出域名列表
  • 记录电池报告里的起止电量
  • 数一遍每条链路的人工介入次数 N
  • 眼镜加测一轮连续使用 5 分钟后的延迟
跑完一台设备大约一个半小时。比看发布会多花时间,但结果能横向比。

哪些方向可能真跑起来

按现在能测到的能力看,三个方向比较有戏。

眼镜上的实时翻译和字幕。 它不需要生成内容,只要 ASR 加翻译,模型可以做得很小;对错用户自己就能判断,不依赖信任。延迟和功耗是仅有的两个障碍,而这两项都有明确的优化路径。

PC 上的本地会议纪要和文件问答。 文件本来就在本地,上传云端的合规成本高,本地推理反而更省事。加上 PC 能插电、内存充足,跑 7B 到 14B 的量化模型没有硬性障碍。

手机上的离线转写加结构化抽取。 记账、记待办、记清单这类任务输入简单、输出格式固定,2–3B 的模型就够用。

哪些做法容易翻车

  • 手机上做端侧文生图。 出图慢、发热大,打开两次就不再用了。这个方向在手机上短期内看不到实用价值。
  • 眼镜上做多轮通用助手。 抬着头对话的耐受度本来就低,电池也撑不住,多轮还没结束就没电了。
  • 系统级记忆功能不讲清楚开关。 只要出一次隐私事件,这个方向就会被整体拖下水。默认关闭、生物识别、排除列表,三样都得有。
  • 端侧版本沿用云端的名字。 用户会拿同一个名字对比,感觉变笨了,口碑反噬比功能缺失更严重。
  • 静默换模型。 用户和评测者都测不到变化点,同一产品的分数纵向不可比,评测也就失去意义。
  • 拿 TOPS 数字当能力指标。 各家算力口径不统一(INT8 还是 INT4、是否含稀疏),数值高低不能直接换算成体验。

今晚就能做的一件事

拿你自己的手机,开飞行模式,跑一条“录音 30 秒 → 转文字 → 生成待办事项”。记录三件事:能不能走完、总共几秒、中间手动操作了几次。

这个数字就是你自己的基准线。下次看新品发布会的时候,把官方演示的延迟和它放在一起比。


关于视频引用:本文不附具体视频链接,因为无法在发布前逐条核验其有效性,也避免推荐已下架或改标题的内容。需要看演示的,按“端侧 AI 断网实测”“Copilot+ PC NPU 测试”这类关键词在 B 站、抖音上自行检索,注意区分厂商发布会剪辑和第三方实测。

免责声明:文中涉及的机型门槛、平台要求、价格和地区可用性会随系统更新变化,请以厂商官方页面为准。本文不构成购买建议,测试结果与设备状态、系统版本强相关。

PREMIUM

需要完整版教程?

包含详细步骤、视频演示、提示词模板和可下载资料包。微信支付即时获取。

购买完整版 ¥29.90