过去提到多模态 Agent,画面往往是「云端大模型 + 一堆 GPU」。但最近社区里一组演示,把这件事的舞台搬到了一块 8GB 的嵌入式开发板上。Google 的 Gemma 4 E2B,正在 Jetson Orin Nano(8GB)上跑通完整的本地「看听说」链路——没有云端、没有付费 API,全开源。

一、8GB 板子上跑通「看听说」全链路

在 NVIDIA 开发者 Asier Arranz 的演示中,Gemma 4 E2B 作为视觉语言助手(VLA)完全运行在 Jetson Orin Nano Super 上:用户说一句带口音的问话,系统先用 Parakeet 做语音识别,再交给量化后的 Gemma 4(E2B)理解并决定「要不要开摄像头看一眼」,最后用 Kokoro 把回答念出来。关键在于,摄像头调用不是靠硬编码关键词触发,而是模型原生的工具调用(tool use)——它自己判断「这个问题需要看图」,才去开摄像头。整个「感知—推理—行动」闭环都在本地完成。

二、开源引擎加持:Little Gemma 支持口型与手势

另一组演示更进一步:Gemma 4 12B 跑在 RTX PRO 4500 Blackwell 上、Gemma 4 E2B 跑在 Jetson Orin NX 16GB 上,借助开源引擎 Cortexist Little Gemma(一个用 C 写的 CUDA 推理引擎),实现了口型同步、表情与手势。换句话说,边缘设备上的 Agent 不再只是「能对话」,而是开始「有表情、有动作」,更接近一个具身化的本地伙伴。所有代码与权重均开源。

三、为什么端侧 Agent 对企业与隐私更友好

把 Agent 放到边缘,核心价值有三层。一是延迟:推理不出本地,响应更快,适合机器人、交互式 kiosk、无障碍设备等实时场景;二是隐私与合规:医疗、金融等强监管行业的数据不必离开内网;三是成本:一次部署、长期运行,不必为每次调用付云端 Token 费。NVIDIA 也在 Gemma 4 的边缘文档中明确把「医疗健康、金融等受严格监管行业的安全要求」列为端侧部署的关键理由。

四、现实约束:量化、显存与可靠性仍是门槛

理想很丰满,工程有边界。8GB 板子上跑多模态,必须靠 Q4_K_M 这类量化、精细的内存管理,以及专门编译的推理引擎(如带 CUDA 的 llama.cpp)才能稳住。Gemma 4 E2B 的有效参数约 23 亿,多模态能力虽强,但复杂推理仍受限于端侧算力;而从「能演示」到「能 7×24 稳定干活」,中间还隔着可靠性、降级策略与运维的一整条鸿沟。

但方向已经清晰:当开源多模态模型能在 8GB 设备上本地看、听、说、做,Agent 的部署重心就不再是「谁有最大的云」,而是「谁能把智能稳稳塞进离用户最近的那块板子」。