经常在互联网上被AI视频假冒的黄仁勋决定出手了。
近日,英伟达宣布推出Synthetic Video Detector NIM,这套工具号称可以逐帧分析视频,通过生成模型留下的统计与频域痕迹,分析出哪些内容是AI生成的视频,准确率最高可达92%。

(图源:英伟达)
没办法,谁让现在生成假图、做假视频的门槛越来越低。
就拿我前阵子刷到的一个视频为例,内容蛮简单的,一只猫刚把花瓶碰碎,转头就溜得比谁都快,旁边的狗子当场愣住,疯狂挥爪解释,表情像是在说:不是我,真的不是我。

(图源:抖音)
挺好笑的对吧,如果不是AI视频就更好了。
更麻烦的是,以前判断假视频,还能靠一些比较明显的画面破绽,比如说什么嘴型对不上、手指数量不对啊;现在视频生成模型进步速度飞快,很多生成内容已经不会给我们留下这么明显的漏洞,也难怪我家里的长辈能天天上钩。
既然普通人不知道应该怎么辨别,那也是时候该轮到检测工具上场了。
英伟达加入“用AI检测AI视频”大军
先简单介绍一下,英伟达在2024年3月公布了NVIDIA Inference Microservices,简称NIM,这玩意本质上就是把“模型+推理+API接口+运行环境”等打包成一个部署工具,算是一种让开发者快速获得AI服务的办法。
而这次发布的Synthetic Video Detector NIM,可以理解成英伟达在NIM标准下打包的一套AI视频检测服务。
正因为这玩意主要面向的场景是本地部署,目前想要在线使用必须通过英伟达的媒体测试申请,而本地部署又需要Linux系统和兼容NVENC/NVDEC视频编解码的硬件,普通人想用上还挺困难的。

(图源:英伟达)
不过用不上,不影响我们借着目前的资料和演示好好聊一聊。
根据官方介绍,视频上传后,SVD NIM会先把H.264编码的MP4拆成画面帧,再交给DINOv2和DINOv3组成的视觉模型分析,再给每一帧打分并汇总,告诉你整段视频到底有多像AI生成。
重点是,它不会盯着六根手指、人物穿模或者水杯突然消失这种传统艺能。
按照官方说法,SVD NIM识别的是生成和去噪过程中留下的底层统计特征、频率异常,以及正常相机不太容易拍出来的像素规律,即便用户将视频进行压缩和重新编码,也依然能够保证较高的识别概率。

(图源:英伟达)
参考官方提供的案例,可以看到这个视频本身并没有出现早期AI视频特有的各种画面崩坏、前后不一的问题,但SVD NIM却给出了高达99%的综合得分。
当然这视频确实一眼假...毕竟运镜有点太平滑了。

(图源:英伟达)
要我说,英伟达这套思路确实比盯着画面里的破绽要靠谱些。
毕竟要在没有前情提要的情况下,给大伙看下面这段视频,我想至少有八成左右的人看不出这是完全由AI生成的,现在Seedance和Kling的视频生成能力就是有这么恐怖。

(图源:bilibili)
按照英伟达的说法,他们准备了超过4000个视频的内部测试集,SVD NIM检测的成功率居然高达85.64%,未压缩视频的准确率更是高达92%。
当然了,92%的准确率不能理解成一测一个准。
尽管在宣传稿里没说,但英伟达在说明文档里还是有标注的,这么高的准确率是由偏严格的阈值采样的,在真实环境中可能造成大量误判,所以这玩意更适合给视频网站做初筛,出现可疑素材的话,还是应该交给人工继续核实。
而且这个准确率还是基于H.264编码的MP4格式视频得到的,任何转码和压缩都会降低准确率,只能说老黄的免责声明还是太专业了。
反AI实测:朱雀还行,反诈中心不稳定
目前来说,英伟达这套SVD NIM确实离普通用户还有点远。
不过国内其实也有类似定位的检测工具,直接打开就能用,其中一个是腾讯朱雀AI检测助手,另一个是反诈中心App里的“AI内容鉴定”,两款应用均支持文字/图片/视频检测,每天也有一定次数的免费检测。
为了看看AI抓AI到底靠不靠谱,我准备了一组混合测试:
几张由主流模型直接生成的图片、几张手机实拍照片;一段精心挑选的AI视频,再搭配Vlog题材的真实视频,我还把部分素材发过微信、截过图,准备看看它们应对二次压缩的表现怎么样。
第一轮,来点AI视频。

(图源:bilibili)
这段视频本身我觉得是很不错的,略显模糊的分辨率、微微晃动的模拟镜头和角色的动作神态融合在一起,真的很有老电影的感觉,制作者手绘了大量的分镜图供模型参考,可以说完全发挥了Seedance的制作能力。
于是腾讯朱雀第一个就栽了。

(图源:雷科技)
作为对比,我找一个通过了媒体申请的朋友借了腾讯朱雀的账号,可以看到SVD NIM给出了高达93%的综合得分,意味着这个视频高概率是AI合成的,同时逐帧检测的疑点也在坐标系上标注出来了。
就是这个检测速度确实不快,13s的视频检测了两分钟。

(图源:雷科技)
更牛的还是反诈中心内容检测,我愣是试了半个小时没能传上去,最后只能作罢。
第二轮,换上真实视频。

(图源:雷科技)
当然了,不能是那种简单的真实视频,我选了一个很多视频生成模型都喜欢模仿的Vlog视频,制作者用的相机不错,镜头过渡顺滑自然,街头光影也很有质感,属于一眼真假莫辨的水平。
您猜怎么着,咱们腾讯朱雀又翻车了。

(图源:雷科技)
英伟达这边相对还是要强不少的,虽然也给出了34%的综合得分,但这毕竟是个参考数值,这个意味着模型检测到的合成内容证据不多。

(图源:雷科技)
至于反诈中心,我还是没有上传成功,要是有老人家真的想用这功能那就受罪咯。
接下来换图片,这个就不详细介绍了,总之是同一个题材下的真实图片,以及两张由豆包、image 2制作的AI图片,后面两个均通过后期、压缩抹除水印。

(图源:雷科技,从左到右为豆包、image2和真实照片)
结果刚想夸朱雀这次认出AI图了,它就整了一个真实照片也是AI的好活。

(图源:雷科技)
相反,之前折腾了好几次没传上视频的内容检测,这次倒是做到三题全对,看来反诈中心在算法上还是有些优势的。

(图源:雷科技)
最后吐槽一点,这两家给的免费次数都不多,真遇到啥事还不一定够用咧。
AI识别很弱,但总比没有要强一点
这一轮测下来,我对AI检测工具的信心,只能说比没有强一点。
视频这块,英伟达表现还行,腾讯朱雀完全靠不住,居然能得出相反的答案;图片相对会好一些,但是腾讯朱雀依然能整出真图当假图的好活,而反诈中心内容检测的服务器则大部分时候都是爆满的,根本上传不了内容。
这机器自己都拿不准,人就更别急着拿检测截图去评论区断案了。
在我看来,相比事后猜一张图有没有AI味,生成时直接留下水印和来源记录,显然更加靠谱。
如今谷歌已经在用SynthID给生成内容加隐形标记,Adobe等公司也在推动C2PA,希望把文件从生成到修改的过程记录下来。国内也在跟进,网信办已明确要求AI内容添加标识,腾讯、阿里和字节也在检测、数字签名和平台提示上积极补课。

(图源:雷科技)
问题是,目前这套体系还没有完全连起来。
我去部署一个开源模型,生成的内容必然也是没有水印的;你的图片、视频转发几次,元数据可能就没了;至于平台之间能不能互相认出对方的水印,就目前国内各家厂商互相防范的情况来看,同样也是个问题。
那在这些环节真正打通以前,普通人只能自己多长个心眼了。
7月31日,主题为“与AI同游”的ChinaJoy2026重磅启幕。
腾讯、网易、索尼、高通、迈从、清闲等共计 900 家泛娱乐展商,联袂呈现全球娱乐业饕餮盛宴;
AI加持下,终端、外设、机器人、显示、芯片等硬科技品牌,如何与游戏内容业跨界呈现娱乐新体验?
由创始人兼总编辑罗超领衔,雷科技 ChinaJoy 2026 报道团,即将空降上海滩重磅呈现,敬请关注。


雷科技





































