产品NVIDIA Blog·原文 2026年9月10日

NVIDIA在IBC 2026发布多项实时AI媒体技术,涵盖视频验证、慢动作生成与内容本地化

NVIDIA在IBC 2026上宣布扩展AI for Media产品组合,推出多项新NIM微服务,并与多家合作伙伴将AI集成到广播、体育和流媒体工作流程中。

AI解读:NVIDIA在IBC 2026上放出了一大批针对媒体行业的AI工具,核心是把AI塞进现有广播和流媒体流程里,而不是让用户推翻重来。最实用的可能是视频造假检测(SVD),准确率在文生视频上已达 99.3%,新闻机构能用它快速核实素材真假。

对体育转播来说,Video Frame Generation和 3D Body Pose能做出更流畅的慢动作回放和动作分析,甚至不需要超高速摄像机。而LipSync等本地化工具,让直播节目能实时翻译、配音对口型,方便内容出海。

这些技术大多以微服务或SDK形式提供,像Dalet、Ross Video、Wowza等厂商已经接入。对普通观众,短期内感受最深的是直播画质提升或更多慢动作回放;对媒体公司,这意味着不用为每个功能单独搭基础设施,但效果仍有场景限制,例如SVD难度更高的图生视频准确率稍低,慢动作最高 6 倍速,8 倍还在开发中。

在 9 月 11 日至 14 日于阿姆斯特丹举行的IBC 2026大会上,NVIDIA宣布扩展其NVIDIA AI for Media产品组合,新增多项NIM微服务和技术,覆盖视频真实性验证、人体姿态估计、视频帧生成、超分辨率、HDR转换及内容本地化等环节。NVIDIA称,这些技术旨在帮助媒体公司将AI集成到直播、体育、新闻和流媒体工作流程中,同时不破坏现有广播环境。

SVD视频检测准确率提升,多个合作伙伴集成

NVIDIA Synthetic Video Detector (SVD) NIM微服务最初在SIGGRAPH上发布,用于评估视频是真实拍摄还是AI生成的概率。NVIDIA称,自发布以来,SVD对文本生成视频内容的准确率达到 99.3%,对图像生成视频内容达到 97.7%,在困难的图像转视频案例上提升尤其明显。

Dalet将SVD集成到面向新闻机构的安全云端验证工作流程中,编辑团队可提交视频,并在Dalet界面中检查得分和元数据。TwelveLabs宣布其首个基于视频智能平台的应用Compliance by TwelveLabs全面上市,该方案集成SVD,可在同一合规流程中提供帧级真实性信号并识别潜在合成媒体。Wowza则计划通过其Video Intelligence Framework分发SVD,该方案由NVIDIA加速基础设施驱动,可实时分析直播视频流,检测物体、场景及AI生成迹象,并支持本地、边缘、云端、混合或完全隔离部署。

  • SVD在文生视频检测上达到 99.3% 准确率,图生视频为 97.7%。
  • Dalet、TwelveLabs和Wowza已宣布集成SVD。
  • Wowza的方案可部署在本地、边缘、云或完全气隙环境中。

新增人体姿态估计与视频帧生成技术,运动场景更流畅

NVIDIA 3D Body Pose可从单摄像头视频中估计 2D和 3D人体关节位置及角度,无需标记捕捉系统。体育组织可利用该数据支持运动员动作跟踪、生物力学分析、回放增强、裁判辅助及球员安全应用,也可将动作数据映射到角色骨骼,用于动画预演、数字替身和虚拟制作。Vizrt已在虚拟演播室中使用该技术,通过跟踪身体动作实时驱动 3D光照效果。

Video Frame Generation (VFG) 通过生成中间帧将视频帧率提升 2 倍或 4 倍,同时保持画质和时间一致性。Ross Video将VFG集成到其Rio Replay平台,为体育制作提供AI辅助慢动作。目前该工作支持 6 倍慢动作生成,并正在开发 8 倍插值。NVIDIA称,生成中间帧可以减少对超高速摄像机的依赖。

  • 3D Body Pose支持单摄像头动作捕捉,应用包括运动分析、回放增强、裁判辅助和虚拟制作。
  • VFG可将帧率提升 2x或 4x,Ross Video已集成并支持 6 倍慢动作,8 倍插值正在开发中。

视频增强与本地化工具更新,支持直播和点播流程

NVIDIA Video Super Resolution (VSR) 更新增加了实时流媒体模式,允许开发者权衡性能与画质,并新增 10-bit视频支持。TrueHDR可将SDR视频实时转换为HDR,亮度最高约 2000 nit。这些技术可组合在单一视频处理管线中。

NVIDIA更新了LipSync与Active Speaker Detection NIM微服务。LipSync改进面部遮挡处理,更好地保留牙齿、嘴唇和面部纹理;Active Speaker Detection不再需要多音轨的说话人分离,增加语音活动检测,并扩展了部署支持。NDI已使用LipSync实现实时翻译和唇形同步配音。此外,Studio Voice新增麦克风配置文件,用户可选择不同的音色效果。

NVIDIA还宣布将Content Localization技术引入Holoscan for Media工具包,提供统一的实时本地化参考工作流,可生成字幕、翻译音频、配音并同步画面。相关技术来自AI-Media、CAMB.AI、Chyron和Panjaya,支持文件、流媒体和后期制作应用。

  • VSR新增实时流媒体模式和 10-bit支持;TrueHDR最高约 2000 nit。
  • LipSync和Active Speaker Detection获得更新,NDI已集成用于实时翻译和配音。
  • Content Localization技术现可用于live广播,合作伙伴包括AI-Media、CAMB.AI、Chyron和Panjaya。

体育智能Playbooks提供多模态AI定制框架

NVIDIA发布Sports Intelligence Playbooks,提供框架帮助联赛、媒体公司和技术提供商基于自有体育视频和标注数据微调NVIDIA开放模型,从而创建理解特定体育项目规则、球员、得分和策略的多模态AI。Playbooks覆盖数据准备、微调、推理、评估、优化和部署整个AI生命周期,并集成了Nemotron、NeMo AutoModel、Megatron Bridge和NIM微服务。

早期测试显示,在类似训练中使用的问答格式下,多项选择准确率从约 53% 提升至 94%,开放式问答准确率从约 5.7% 提升至 66%。Machina Sports正在将Playbooks与其体育数据和评估基础设施集成,使版权方能将专有媒体转化为可部署的AI。Wowza也通过Playbooks微调视觉语言模型用于检测体育特定瞬间。

  • Sports Intelligence Playbooks覆盖AI生命周期,集成Nemotron等工具。
  • 测试数据显示,多项选择准确率从约 53% 提升至 94%,开放式问答从 5.7% 提升至 66%。
  • Machina Sports和Wowza已计划采用。

Holoscan for Media集成MXL,提供开放媒体交换层

NVIDIA将Media Exchange Layer (MXL) 集成到Holoscan for Media中,作为开放参考架构和开发者工具包,帮助软件化媒体功能在分布式环境中交换实时视频、音频和数据。NVIDIA称,这有助于媒体公司更高效利用基础设施,更快引入新能力,并减少应用之间的自定义集成工作。相关演示将在IBC的EBU展位 10.D21展出。

  • MXL提供开放交换层,连接不同媒体应用。
  • 该集成支持AI处理、视频应用与传统媒体功能在相同加速基础设施上运行。

信息来源

NVIDIA Blog原始来源