NVIDIA发布TensorRT Model Connect:两条命令将Hugging Face模型部署为原生C++推理应用
NVIDIA推出TensorRT Model Connect参考实现集合,支持从Hugging Face模型ID构建部署包并加载到C++应用,运行时不依赖Python或PyTorch。
AI解读:开发者将开源模型集成到原生应用时,常需为每个模型编写转换、预处理和后处理代码,NVIDIA的TensorRT Model Connect试图用标准化流程消除这一负担。其核心是分两步走:先用Python CLI从Hugging Face模型ID构建包含TensorRT引擎和运行时资产的bundle,再在C++应用中加载该bundle直接执行任务级调用,生产环境无需Python解释器。这意味着C++应用开发者无需精通编译器或模型细节,即可获得TensorRT的GPU加速推理能力。Model Connect提供语义API和模块级API两级接口,前者适合快速上手,后者允许开发者直接操作命名张量进行深度定制。此外,通过TVM FFI可以替换模型部分为自定义GPU内核。项目采用AI原生开发方式并每日发布,以跟上开源模型迭代速度。目前支持的模型列表可从GitHub仓库获取,开发者需根据实际需求验证模型覆盖和性能。
NVIDIA于 2025 年发布TensorRT Model Connect,这是一个开源的参考实现集合,旨在简化将开源AI模型部署到原生C++应用的过程。开发者可以从Hugging Face模型ID或本地检查点构建部署包,并在C++中加载运行,整个流程仅需两条命令。
两条命令完成模型部署
TensorRT Model Connect将部署拆分为两个阶段,中间通过一个bundle文件衔接。第一步使用Python CLI构建部署包,例如:`trtmc build Qwen/Qwen3-0.6B -o qwen3-0.6B.bundle`。该bundle包含TensorRT引擎及运行时所需的模型特定资产(如分词器、配置等)。
第二步,开发者可以在C++应用中加载bundle并直接处理任务级输入输出,例如:`auto pipeline = trtmc::load("qwen3-0.6b.bundle"); auto result = pipeline->generate("Explain why native inference matters.", {.max_new_tokens = 20});`。此过程不需要开发者掌握编译器知识,模型映射、引擎构建、预处理、后处理和运行时编排均由Model Connect自动处理。
值得注意的是,尽管准备阶段使用Python,但部署后的应用完全原生运行,不依赖PyTorch或Python解释器。
两级API与自定义内核支持
Model Connect提供两个层级的C++ API。语义API允许开发者使用熟悉的输入输出(如提示词、图像、音频),由Model Connect处理预处理、推理和后处理;模块级API则允许开发者直接操作命名张量和TensorRT组件,以便对特定部分进行高度定制。两种API共享同一套核心实现,开发者可以从语义API开始,仅在需要时下钻到模块级。
通过TVM FFI(Foreign Function Interface),开发者可以替换模型中特定部分为自定义GPU内核,而TensorRT继续执行其余推理流程。这种方式避免了为集成专用内核而重建整个应用,因为TVM FFI提供了语言无关的接口,不强制调用系统与内核框架绑定。
覆盖开源模型生态,采用AI原生开发
Model Connect旨在成为开源模型与TensorRT之间的桥梁,而非新的推理框架或TensorRT的替代品。每个模型的实现都有三重用途:运行模型、作为学习参考、支持扩展适配。项目采用AI原生软件流程,由编码智能体在人类指导下生成代码、测试和文档,以实现多模型并行开发,并保持架构一致性。
NVIDIA采用每晚发布机制,以缩短新模型支持从开发到发布的周期,自动化验证作为发布门槛。据NVIDIA技术博客,对于支持的模型,Model Connect的推理性能可能优于torch.compile,但这一表述需要具体场景验证。
快速入门与文档
开发者可以从GitHub仓库(NVIDIA/TensorRT-Model-Connect)获取支持的模型列表和构建指南。NVIDIA还提供了一个示例提示词,可输入给编码智能体,自动完成克隆仓库、构建Docker容器、编译CLI和运行Qwen3-0.6B冒烟测试,声称无需复杂设置即可在几分钟内完成部署。更详细的架构和覆盖范围见官方文档。