← 返回信息流

Gorden Sun推文

VA-Judger:首个音视频一体的裁判模型

模型开源AI评分:70/100

研究团队发布VA-Judger,首个能同时评估视频画面和声音的裁判模型。它从文字匹配度、声画同步率、画面质量、声音质量和内容完整性五个维度打分,以更符合人类感知的方式指导生成模型改进。团队收集了上万组人类对比数据,并公开测试集,代码和模型完全开源。

译文

VA-Judger:首个音视频一体的裁判模型 平时我们让 AI 同时生成画面和声音时,画面和声音经常各玩各的,比如嘴型对不上台词,或者画面在切菜但配音全是杂音。以往给 AI 打分的机制很死板,只会把画面清晰度、声音质量分开单独算分,最后 AI 就算拿到高分,人眼看起来依然觉得假。这个项目训练了一个更懂人类喜好的裁判模型,能像真人一样把画面、声音以及文字要求放在一起综合评判,并根据打分去指导生成模型改进。 VA-Judger会从文字匹配度、声画同步率、画面质量、声音质量以及内容完整性这几个维度来给视频打分。 研究团队收集整理了上万组人类对比数据,还公开了一套测试集用来验证打分准不准。代码与模型完全开源。 Github:https://github.com/ShareLab-SII/VA-Judger

Gorden Sun

@Gorden_Sun

VA-Judger:首个音视频一体的裁判模型 平时我们让 AI 同时生成画面和声音时,画面和声音经常各玩各的,比如嘴型对不上台词,或者画面在切菜但配音全是杂音。以往给 AI 打分的机制很死板,只会把画面清晰度、声音质量分开单独算分,最后 AI 就算拿到高分,人眼看起来依然觉得假。这个项目训练了一个更懂人类喜好的裁判模型,能像真人一样把画面、声音以及文字要求放在一起综合评判,并根据打分去指导生成模型改进。 VA-Judger会从文字匹配度、声画同步率、画面质量、声音质量以及内容完整性这几个维度来给视频打分。 研究团队收集整理了上万组人类对比数据,还公开了一套测试集用来验证打分准不准。代码与模型完全开源。 Github:https://github.com/ShareLab-SII/VA-Judger

阅读原文