CASE 04 / I2V MODEL EVALUATION

人物情感表达
竞品对标评测

统一测试、统一评分、统一分析,为模型选型与情感电影业务落地提供客观依据。

EVALUATION MAPIMAGE TO VIDEO
OWN PRODUCT目标产品[请替换为目标产品名称]
BENCHMARK 01竞品 A主流 I2V 模型
BENCHMARK 02竞品 B主流 I2V 模型
BENCHMARK 03竞品 C主流 I2V 模型
CORE OBJECTIVE定位能力差距为模型接入与业务落地提供依据

01 / CONTEXT

真正的问题,从来不是哪个视频看起来更炫目。

而是哪个模型,能在统一的测试条件下,稳定完成可信的情感表演。

AI 视频生成正从单点镜头实验,走向连续内容生产。情感类电影的真正难点,不在于“画面能否生成”,而在于人物能否在叙事情境中保持身份稳定,并以可信的表情、情绪和肢体动作完成表演。

为支撑公司 AI 情感电影项目,我建立了人物情感表达 Image-to-Video Benchmark:固定输入图像、Prompt 与测试条件,对目标产品及竞品 A/B/C 进行统一评分与问题归因,最终输出——能力差距、适用边界、接入建议。

  • 测试范围:I2V 图生视频
  • 人物情感表达
  • 交付动作:统一评分
  • 问题归因

02 / FRAMEWORK

四个维度,
彼此隔离。

让每个分数只回答一个明确问题,避免单一优点掩盖关键缺陷,也避免指令、主体、运动和画质相互影响判断。

01

指令遵循

人物、动作、情绪、场景和镜头要求是否被准确执行。

02

人物主体一致性

身份特征、五官、发型、服饰与主体结构在连续画面中是否稳定。

03

运动连续稳定性

表情、肢体与镜头运动是否自然连贯,是否出现跳变、抖动或形变。

04

画面质量与真实感

清晰度、光影、材质、空间关系与物理表现是否可信。

03 / SCORE LAB

三个等级,
逐档查看。

四个维度均采用 0、1、2 三档评分。每个维度独立判断,并记录可观察证据,不以整体“感觉”替代分数。

00 / SCORE
0不可用

核心要求未满足,存在明显偏差或失真。

01 / SCORE
1基本可用

部分达到目标,但仍有可感知问题。

02 / SCORE
2稳定可用

关键要求准确完成,整体表现稳定。

04 / ISSUE TAXONOMY

把“感觉不对”
变成可定位的问题标签。

以下问题标签整理自评测表格。标签与四个评分维度对应,可用于记录失败模式、统计模型差异和复盘具体案例。

01 / ISSUE FAMILY

指令遵循

02

遵循程度

指令未遵循指令部分遵循
02 / ISSUE FAMILY

人物主体一致性

10

人物身份

人脸漂移脸型变化身份不一致

人物外观

发型变化服装变化妆容变化

人体结构

多(少)手多(少)脚身体比例异常身体穿模人体结构错误
03 / ISSUE FAMILY

运动连续稳定性

19

动作连续

动作跳变动作中断动作重复运动不连贯

人物稳定

轮廓抖动局部闪烁前后不一致

动作逻辑

动作错误动作不自然动作幅度异常动作方向异常

手部细节

手指异常手势跳变手部漂移手部变形

身体动作

身体僵硬身体失衡姿态异常比例异常
04 / ISSUE FAMILY

画面质量与真实感

23

人物细节

面部模糊细节缺失皮肤异常头发异常服装材质异常

视频交互及背景质量

画面闪烁色彩变化光影异常噪点明显画面抖动环境异常交互异常

表情变化

表情僵硬表情夸张表情跳变情绪不自然

眼部表现

眼神漂移眼神空洞眨眼异常双眼不同步眼睛变形

嘴部表现

嘴型异常口型不匹配

THE PRINCIPLE

评测的终点不是选出“最炫”的视频,
而是训练出丰富情感叙事的模型。