NVIDIA博客:Nemotron 3.5 Lightning与Qwen3.8-27B现可本地部署于Jetson,推理性能最高提升 6.28 倍
NVIDIA技术博客介绍了在Jetson AGX Thor和AGX Orin上部署新型开源推理模型的步骤,NVFP4量化与推测解码结合可将解码吞吐量较BF16提升最高 6.28 倍,模型包括Nemotron 3.5 Lightning与Qwen3.8-27B。
AI解读:这条新闻的关键变化是,以前需要数据中心才能运行的推理和智能体模型,现在能直接在Jetson边缘设备上跑,开发者不必再把数据传到云端,从而减少网络依赖和成本。NVIDIA给出的实测数据是,NVFP4量化加推测解码能把解码吞吐量提高最高 6.28 倍,但要达到这个效果,不能随便选配置——Nemotron 3.5 Lightning配合DSpark最佳,输出速度在 123 到 138 token/秒之间,而Qwen3.8-27B则需用DFlash2,速度在 27.7 到 34.4 token/秒之间。实际速度还受任务类型影响,比如RAG和写作类任务增益更大。对开发者的直接影响是:部署前需要针对自己的应用数据和场景进行基准测试,选择匹配的量化模型和草稿模型,否则可能达不到宣传的速度。如果量化导致精度下降,可以用NVIDIA Model Optimizer做量化感知训练或蒸馏来微调;草稿模型接受率低时,也可以按vLLM指南训练自定义推测器,但多数应用直接用现成检查点就足够了。
NVIDIA技术博客于2026年9月4日发布文章,介绍如何在Jetson边缘设备上部署和优化新一代开源推理模型,重点以Nemotron 3.5 Lightning和Qwen3.8-27B为例。文章称,多步推理模型过去因体积过大无法在边缘硬件本地运行,开发者只能将推理路由到数据中心,这增加了网络依赖和成本,并可能暴露本应保留在设备上的数据;而今年夏天发布的多个紧凑型开源模型使这一限制被打破,NVIDIA Jetson目前可以运行它们。
文章提供的测试数据显示,在Jetson上结合NVFP4量化与推测解码,解码吞吐量相比BF16基线最高可提升 6.28 倍(图2)。两个优化方法互补:NVFP4减少每次计算的数据量,推测解码则让主模型一次验证多个草稿token,从而增加单次解码产出的token数。
模型选择:稠密与MoE架构各有适用场景
文章建议开发者根据工作负载选择模型。Nemotron 3.5 Lightning采用混合专家(MoE)架构,总计 30B参数但每个token只激活 3B;Qwen3.8-27B是稠密模型,每个token激活全部 27B参数。因此,前者更适合响应密集型智能体(如实时监控传感器并采取纠正动作),后者更适合需要较少但更复杂决策、允许更长生成时间的工作负载。
文章列出适用平台:Gemma 4 E4B适合作为Jetson Orin Nano的起点;Jetson AGX Orin和Jetson AGX Thor则推荐使用Nemotron 3.5 Lightning和Qwen3.8-27B。部署可通过vLLM和llama.cpp等框架在本地完成。
实测优化配置:两种模型的最佳方法不同
文章强调,推测解码的草稿生成方法包括MTP、DFlash和DSpark,但测试发现不同模型的最佳配置不同:Nemotron 3.5 Lightning在DSpark下表现最好,Qwen3.8-27B则与DFlash2搭配最佳。文章提醒开发者应针对目标模型测试具体方法和草稿检查点,不能假设一种配置适用于所有模型。
文章提供了具体部署命令和环境要求:需要Jetson AGX Thor或AGX Orin,JetPack 7.2并配置NVIDIA Container Runtime和Docker,且需接受NVIDIA Nemotron和Qwen3.8的许可条款。Nemotron 3.5 Lightning的配置示例(在vLLM v0.28.0容器中)包括NVFP4量化、DSpark推测(num_speculative_tokens=5)、kv-cache为fp8等参数;Qwen3.8-27B的配置则使用DFlash2(num_speculative_tokens=7),并设置VLLM_GDN_DECODE_KERNEL=triton。
- Nemotron 3.5 Lightning测试配置:NVFP4 + DSpark,在vLLM v0.28.0容器中使用nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4模型,max-model-len 128000,gpu-memory-utilization 0.7。
- Qwen3.8-27B测试配置:NVFP4 + DFlash2,使用Inferact/Qwen3.8-27B-NVFP4模型,max-model-len 50000,gpu-memory-utilization 0.85。
性能因任务而异:需用代表性基准验证
文章指出,模型级基准测试有助于识别好的推测解码配置,但实际性能会随应用生成文本类型不同而变化。测试固定了每个模型的最佳配置,并跑了SpeedBench的四个类别:写作、推理、摘要和检索增强生成(RAG)。结果显示,RAG和写作类任务受益最大,且尽管每种模型在不同任务中最佳方法保持不变,但吞吐量仍有波动:Nemotron 3.5 Lightning搭配DSpark时输出速度为 123.01 至 138.02 token/秒,Qwen3.8-27B搭配DFlash2时为 27.69 至 34.44 token/秒。
文章建议开发者使用代表实际应用的提示词来验证推测解码配置,而非依赖通用基准。
何时训练自定义检查点:多数应用直接用现成模型
文章表示,对于大多数应用,直接使用现有的量化检查点和草稿模型即可获得不错的效果,无需自行训练。如果量化导致精度下降,可使用NVIDIA Model Optimizer进行量化感知训练(QAT)或量化感知蒸馏(QAD)来微调;若公共草稿检查点加速效果不理想,可按照vLLM Speculators训练指南训练兼容的推测器(支持MTP、EAGLE-3、DFlash、DSpark)。
文章明确指出“大多数应用不需要自定义训练”,建议先测量现有检查点的准确性和性能,仅当结果出现明显差距时才考虑自行训练。