AI视觉细节控制逻辑表
使用说明:本表格旨在帮助内容创作者理解AI对视觉细节的理解逻辑,掌握正确描述方式,避免常见的生成翻车。表格按维度分类,每个维度都包含"用户常见说法"、"AI实际理解"、"典型翻车场景"、"翻车原因"、"正确描述方式"和"示例对比"六个方面。
操作指南DOCXv1.0
## AI视觉细节控制逻辑表
使用说明:本表格旨在帮助内容创作者理解AI对视觉细节的理解逻辑,掌握正确描述方式,避免常见的生成翻车。表格按维度分类,每个维度都包含“用户常见说法”、“AI实际理解”、“典型翻车场景”、“翻车原因”、“正确描述方式”和“示例对比”六个方面。
一、空间结构理解
1.1 室内空间结构
| 控制维度 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
翻车原因 |
正确描述方式 |
示例对比 |
| 房间布局 |
“客厅里有一张沙发” |
生成一张沙发,可能在房间任何位置,甚至飘在空中或穿透墙壁 |
说“客厅里有沙发”,结果沙发一半在墙里,另一半在门外 |
AI不理解“室内”意味着封闭空间,物体应放在可站立的地面上 |
明确说明家具的具体位置关系:“沙发靠墙摆放,正对着电视墙” |
❌“客厅有沙发” → 沙发飘在空中 ✅“沙发靠北墙摆放,面朝南侧” |
| 门窗位置 |
“窗外是花园” |
可能生成门或窗,但位置随机,或者窗外的景色和实际位置不符 |
说“从窗户看出去是花园”,结果窗户开在厨房墙上,窗外是城市天际线 |
AI不关联“房间功能”和“窗外景色”的逻辑关系 |
用方位+参照物定位:“主卧朝南,窗户面向院子,种着玫瑰花” |
❌“卧室窗户外面是花园” → 窗外是摩天大楼 ✅“主卧朝南窗户,窗外是一片玫瑰花园,阳光照进来” |
| 家具摆放 |
“桌子上放着书” |
桌子可能不存在,书可能放在空中、地上或桌子上但比例失衡 |
说“书桌上放着电脑”,结果电脑比桌子还大,或者书漂浮在桌子上方 |
AI不维护物体与承载面的物理关系 |
描述物体与家具的具体关系:“电脑显示器放在书桌中央,键盘放在显示器前方” |
❌“桌上放着电脑” → 电脑悬浮或比例失调 ✅“27寸显示器摆在书桌正中,键盘紧贴显示器下方” |
| 上下楼层 |
“他在楼上睡觉” |
可能生成人物在某种“楼上”的场景,但不明确是哪一层楼或楼梯关系 |
说“从楼下往楼上看”,结果视角混乱,人物同时出现在多个楼层 |
AI不理解建筑层级的物理连续性 |
明确层级和视角关系:“二楼卧室里,人物躺在床上,镜头从一楼楼梯口向上拍摄” |
❌“人物在楼上” → 视角混乱 ✅“二楼卧室,棕色大床上,男性躺着,面朝镜头,窗外是夜色” |
| 楼梯走廊 |
“走廊尽头是卧室” |
可能生成走廊,但卧室位置随机,走廊可能没有尽头或尽头是墙 |
说“沿着走廊走到尽头”,结果走廊无限延伸或者尽头是悬崖 |
AI不维护空间的连通性和目的性 |
描述具体路线和终点:“长走廊,两侧是白色墙壁,尽头左转是主卧,门半开着” |
❌“走廊尽头是卧室” → 走廊无限延伸 ✅“5米长走廊,墙壁刷白,尽头左转进入主卧,门虚掩着” |
1.2 室外空间结构
| 控制维度 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
翻车原因 |
正确描述方式 |
示例对比 |
| 街道场景 |
“街道上有人走着” |
生成街道,可能有人,但人和街道的位置关系、比例都可能是错的 |
说“街道上有个女人在走”,结果女人比房子还高,或者走在房子上面 |
AI不维护“人在地面上行走”的物理常识 |
描述人的位置和街道的具体特征:“双向车道沥青路面,路边梧桐树,一个穿红裙的女人在人行道上行走” |
❌“街道上有人” → 人比楼高 ✅“沥青双向街道,路边法国梧桐,一个红裙女性在人行道右侧行走,比例正常” |
| 广场空间 |
“广场中央有喷泉” |
可能生成喷泉,但可能在广场边缘、角落,或者喷泉比广场还大 |
说“广场中央有音乐喷泉”,结果喷泉在广场外,广场空无一物 |
AI不理解“中央”的数学概念,容易生成在边缘或随机位置 |
用方位词和参照物:“圆形广场,直径50米,中央是三层叠水喷泉,四周是石雕围栏” |
❌“广场中央有喷泉” → 喷泉在角落 ✅“圆形广场直径50米,阶梯式音乐喷泉在正中心,四周有石凳环绕” |
| 自然地形 |
“小河旁边有棵树” |
可能生成河流和树,但它们的相对位置、水和树的比例关系不确定 |
说“河边有棵垂柳”,结果树长在水里,或者树在水对面,距离很远 |
AI不维护“水边植被”的自然逻辑关系 |
描述具体位置关系和细节:“河岸青石板铺就,水面距岸80厘米,一棵垂柳斜伸向水面,树干直径30厘米” |
❌“河边有树” → 树在水里或距离很远 ✅“石砌河岸,水位距岸约半米,倾斜的垂柳枝条快要触碰水面” |
1.3 建筑结构理解
| 控制维度 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
翻车原因 |
正确描述方式 |
示例对比 |
| 房屋外观 |
“一栋白色的房子” |
生成白色建筑,可能没有门、窗、屋顶比例正确,甚至可能生成抽象白色块 |
说“白色欧式小楼”,结果生成没有门窗的白色方块,或者窗户长在屋顶上 |
AI不维护建筑的基本结构逻辑,不理解“房屋”需要门、窗、屋顶等元素 |
详细描述建筑特征:“独栋二层小楼,奶白色外墙,深蓝色波形瓦屋顶,对开深棕色大门,两侧各一扇拱形落地窗” |
❌“白色房子” → 没有门窗的白色方块 ✅“两层白色小楼,深蓝瓦顶,深棕对开门,拱形窗,门前两级石阶” |
| 内外空间 |
“从门外看屋内” |
可能生成门,或者门不存在,或者门外看到的“屋内”和实际不符 |
说“从门外看进去”,结果门消失了,墙壁变成透明,或者屋内场景在门外 |
AI不区分“门内”和“门外”的视角逻辑 |
明确视角位置和视线方向:“站在玄关处,门半开,向内看,客厅米色沙发,暖黄落地灯” |
❌“从门外看进去” → 墙壁变透明 ✅“门开着一条缝,从门缝向内看,客厅浅灰沙发,角落落地灯亮着” |
| 屋顶墙壁 |
“墙壁上挂着画” |
可能生成画,但画可能挂在空中、地上、墙上但位置不合理 |
说“墙上挂着一幅油画”,结果画悬浮在房屋外面,或者挂在地板上 |
AI不维护“墙上挂画”的物理逻辑 |
描述画的精确位置:“客厅沙发上方墙面中央,挂着一幅60x80厘米的风景油画,画框黑色” |
❌“墙上有画” → 画挂在地板上 ✅“沙发正上方30厘米处,一幅60x80cm风景油画,深木色画框” |
1.4 透视关系理解
| 控制维度 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
翻车原因 |
正确描述方式 |
示例对比 |
| 近大远小 |
“一条长长的路” |
可能生成道路,但道路的透视关系可能混乱,近处和远处物体比例异常 |
说“延伸到远方的小路”,结果近处和远处路面宽度一样,路两边的树也一样高 |
AI不理解透视的数学关系,容易生成“平铺”而非“纵深” |
描述透视特征和消失点:“林荫小路,路面从下往上逐渐变窄,消失在天际线中央,两侧树木近高远低” |
❌“一条长长的路” → 前后一样宽 ✅“透视小路,宽度从前景60%延伸到远景5%,消失在远方地平线” |
| 消失点 |
“铁轨延伸到远方” |
可能生成铁轨,但消失点位置可能不对,或者没有消失效果 |
说“铁轨伸向天边”,结果铁轨是平行线,或者消失在画面顶部而不是中心 |
AI不主动构建符合透视规则的场景 |
明确消失点位置:“两条铁轨在画面中央地平线处交汇,蓝天白云,远方有小镇轮廓” |
❌“铁轨伸向远方” → 铁轨平行 ✅“纵深构图,铁轨在画面中心地平线处交汇成一点,远景有蒸汽火车头” |
1.5 AI空间理解盲区与应对
| 控制维度 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
翻车原因 |
正确描述方式 |
示例对比 |
| 穿墙问题 |
“他走进房间” |
生成人物,但人物可能穿过墙壁、穿过门框、从窗户进入 |
说“他推门进屋”,结果人物从墙壁中间“渗透”进去,或者整个人穿过门框但门没开 |
AI没有“固体碰撞”概念,认为墙壁和人物可以重叠 |
明确门的开关状态和人物的进入方式:“他推开深棕色木门,门向内开,他跨过门槛进入客厅” |
❌“走进房间” → 人穿墙 ✅“木质门向内打开,他抬脚跨过20厘米门槛,完整进入房间” |
| 内外混淆 |
“车内场景” |
生成“车”和“人”,但人可能在车外、车顶、或者车内但比例异常 |
说“车内自拍”,结果人物坐在车顶自拍,或者人物比车还大 |
AI理解“车”和“人”是分开的元素,不理解“人在车内部”的空间包含关系 |
明确车的位置和人物在车内的具体位置:“驾驶座上坐着穿黑色皮夹克的男性,镜头从副驾驶座位置拍摄,方向盘在前景虚化” |
❌“车内场景” → 人坐车顶 ✅“人物坐在汽车主驾驶座,双手握方向盘,镜头从右后座拍摄,透过车窗能看到街景” |
| 前后混淆 |
“他站在我前面” |
可能生成人物,但人物和“我”的位置关系不确定,可能生成背后、侧面 |
说“他面对着我”,结果他背对着镜头/观众,或者两人侧面对视 |
AI不维护观察者和被观察者的相对位置关系 |
明确相对位置和朝向:“男性面对镜头站立,穿蓝色衬衫,双手自然下垂,镜头视角与人物平视” |
❌“他面对着我” → 背对镜头 ✅“男性正面面对镜头,双脚与肩同宽,镜头正对人物面部高度拍摄” |
二、人物动作理解
2.1 基础动作控制
| 控制维度 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
翻车原因 |
正确描述方式 |
示例对比 |
| 站立动作 |
“人物站着” |
生成直立人形,但可能僵硬、不自然,或者手的位置奇怪 |
说“女孩站着”,结果生成僵硬站立的女孩,手臂以不自然的角度伸出 |
AI不理解“自然站立”的人体姿态平衡 |
描述具体姿态:“女性自然站立,重心在右脚,左脚稍向前伸,肩膀放松,手臂自然垂于身体两侧” |
❌“人物站着” → 僵硬直立 ✅“女性双脚分开与肩同宽,重心均匀,双手自然下垂,肩部放松” |
| 坐姿动作 |
“他坐在椅子上” |
生成人物坐在某种椅子上,但椅子可能没有腿、悬浮、或者人物姿势扭曲 |
说“男人坐在椅子上”,结果生成人物坐在没有椅腿的椅子上方,或者椅子比人还小 |
AI不维护“坐”需要支撑面的物理关系 |
描述椅子的具体形态和坐姿:“标准餐椅,木质椅腿,座位高度45厘米,男性臀部完全在椅面上,大腿水平” |
❌“坐在椅子上” → 椅子悬浮 ✅“坐高45cm的木质餐椅,臀部完全接触椅面,大腿与地面平行,小腿自然下垂” |
| 躺卧动作 |
“她躺在床上” |
生成女性和床,但可能女性悬浮在床的上方、或者比例异常、或者姿势扭曲 |
说“女人躺在床上休息”,结果女人平躺在床单上方,像漂浮,或者头和身体连接处扭曲 |
AI不维护“躺”需要身体和支撑面接触的关系 |
描述身体与床的接触关系:“女性侧躺在1.8米双人床上,浅灰色床单,脸枕在枕头上,身体曲线自然贴合床垫” |
❌“躺在床上” → 悬浮或姿势扭曲 ✅“女性侧卧在双人床左侧,脸枕白色枕头,身体线条自然弯曲贴合床垫” |
| 行走动作 |
“他在走路” |
生成直立人形在移动中,但腿部动作可能违反人体工学,或者身体不协调 |
说“男人走路”,结果两条腿以完全不可能的方式交叉,或者身体向后倾斜走路 |
AI不理解行走的生物力学原理 |
描述步态细节:“男性正面向镜头方向行走,左腿向前迈出,脚跟着地,右臂自然摆动,步速中等” |
❌“在走路” → 腿部动作违反人体工学 ✅“正面行走视角,左腿前迈脚跟着地,右腿在后准备离地,对侧手臂摆动” |
2.2 复杂动作理解
| 控制维度 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
翻车原因 |
正确描述方式 |
示例对比 |
| 转身动作 |
“他转过身来” |
可能生成旋转的人形,但旋转的方向、幅度不确定,可能生成扭曲的形态 |
说“男人转过身”,结果生成人体180度扭转但头还在原位,或者身体像麻花一样扭曲 |
AI不理解“转身”是连续动作,有起点和终点 |
描述转动的起点和终点:“男性背对镜头,右侧肩膀向前转30度,正逐渐转向正面,但还未完全转过来” |
❌“转过身来” → 头身分离/麻花扭曲 ✅“男性3/4侧身,背对镜头转为正面的过渡姿态,转动幅度约45度” |
| 推门动作 |
“他推门进入” |
生成人物和门,但可能门不开、人穿门、或者手的位置不对 |
说“男人推门”,结果门没动,人已经进去,或者手穿过门板 |
AI不维护推门需要手接触门把、门向内/外开的逻辑链 |
描述动作的物理过程:“男性右手握住门把手,向内推动,深棕色木门开至90度,他抬左脚跨过门槛” |
❌“推门进入” → 穿门/门不动的穿墙 ✅“右手握住黄铜门把手前推,木门向内开30度,左脚抬起准备跨入” |
| 拿起放下 |
“他拿起苹果” |
生成人物手中有某种物体,但物体可能突然出现、没有拿的动作、或者手和物体关系奇怪 |
说“她拿起桌上的苹果”,结果苹果已经握在手里,没有“拿起”的过程,或者苹果比手还大 |
AI不理解“拿起”是手从空到有的连续动作 |
描述手和物体的接触瞬间:“右手手指正在合拢握住红色苹果,手掌和苹果接触,桌面上的苹果位置已空” |
❌“拿起苹果” → 苹果无中生有 ✅“女性右手手指包裹住红色苹果,苹果完全在掌心范围内,原来的桌面位置空置” |
| 拥抱动作 |
“他们拥抱在一起” |
生成两个人形接触,但拥抱的方式、位置、力度感都不对,可能生成悬浮接触 |
说“情侣拥抱”,结果两人身体悬浮接触,或者头部穿过对方身体,或者只有手指尖接触 |
AI不维护“拥抱”需要身体大面积接触、有力度感、情感表达的关系 |
描述拥抱的具体形态:“两人面对面,男性双臂环抱女性腰背部,女性双手搭在男性肩上,两人胸部紧贴” |
❌“拥抱” → 悬浮/穿身 ✅“女性面部贴靠男性颈侧,双臂环绕男性背部,男性双臂环抱女性腰际,躯干紧贴” |
2.3 动作方向控制(重点!)
| 控制维度 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
翻车原因 |
正确描述方式 |
示例对比 |
| 背对镜头 |
“背对镜头站着” |
可能生成人物,但方向随机,可能正面、侧面,或者身体和脸的方向不一致 |
说“女人背对镜头”,结果生成女人正对镜头,或者头转向后面但身体正对 |
AI不理解“镜头”作为观察者的存在,容易把“背对”理解为“某种方向” |
明确身体轴线和镜头的位置关系:“女性背部完整朝向镜头,长发垂落肩后,镜头视角在她正后方3米,高度1.6米” |
❌“背对镜头” → 正面面对镜头 ✅“女性背影完整呈现在画面中央,头发及腰,镜头在她正后方拍摄她的后背” |
| 面对镜头 |
“面对镜头微笑” |
可能生成面部,但微笑的幅度、眼神方向都不确定,可能斜视、俯视 |
说“他面对镜头”,结果生成人物眼睛看向别处,或者脸部侧向一边 |
AI不维护“面对”和“看”的因果关系 |
精确描述面部朝向和视线:“男性面部正面朝向镜头,眼睛直视镜头中央,双眼瞳孔位于画面1/3水平线” |
❌“面对镜头” → 眼睛看向别处 ✅“男性正脸面对镜头,双眼正视镜头,鼻尖在画面中轴线,两侧对称” |
| 走向镜头 |
“他向镜头走来” |
可能生成移动中的人物,但可能向后走、悬浮走、或者整个人倒退 |
说“男人向镜头走来”,结果男人倒退着走,或者脚向前走但身体后仰 |
AI不理解“向镜头走”的方向性和视角关系 |
描述步伐方向和透视效果:“男性脚尖朝向镜头方向行走,越走越近,近大远小透视明确,步幅正常” |
❌“向镜头走来” → 后退走/悬浮 ✅“男性脚尖朝镜头方向行走,逐渐放大靠近,视距缩短,步态正常” |
| 远离镜头 |
“他离开房间” |
可能生成人物,但可能不是走向门外,或者整个人悬浮着后退 |
说“他走向门口离开”,结果人物向后漂浮,或者穿过墙壁离开 |
AI不维护“离开”的空间逻辑和物理性 |
描述离开的具体路径:“男性背朝门口站立,向后退出房间,左脚先退,跨过门槛,门框逐渐进入画面” |
❌“离开房间” → 悬浮后退/穿墙 ✅“人物背朝门口退去,左脚先退跨过门槛,身影逐渐缩小,门框在身后放大” |
| 进屋方向 |
“他背对镜头进屋” |
这是最容易翻车的描述!AI可能生成面对镜头进屋、侧身进屋、甚至从窗户进屋 |
说“背对镜头进屋”,结果生成男人面对镜头走进来,好像在迎接谁 |
“进”是一个方向性动词,但AI把它当成“进入”这个状态,而不是“进入时的朝向” |
必须同时描述身体朝向和进入动作:“男性背部朝向镜头,正朝门的方向走去,左手已经触及门把手,准备推门进入” |
❌“背对镜头进屋” → 面对镜头进屋 ✅“男性背影朝向镜头,正走向门口,左手触碰门把手,身体前倾即将跨入门内” |
2.4 动作连贯性
| 控制维度 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
翻车原因 |
正确描述方式 |
示例对比 |
| 连续动作 |
“她先坐下然后看书” |
可能生成两个独立状态,但缺少“坐下”到“看书”的过渡,可能直接跳到最终状态 |
说“女人坐下看书”,结果生成女人已经坐好手里已经有书,没有“坐下”的过程 |
AI不维护时间连续性,每帧都是独立生成的 |
分解动作为多个状态,或描述最终状态避免中间态:“女性刚在沙发上坐定,膝盖上放着合起的书,一只手正要翻开封面” |
❌“先坐下再看书” → 直接跳到看书状态 ✅“女性臀部刚接触沙发坐垫,手里拿着合起的书,正准备翻开第一页” |
| 动作逻辑 |
“他拿起刀切菜” |
生成刀和菜,但可能刀不接触菜、刀悬浮、或者切的动作违反物理 |
说“厨师切菜”,结果刀悬浮在菜上方,或者刀穿过砧板,或者菜自己裂开 |
AI不维护工具和对象的物理接触关系 |
描述接触瞬间:“厨师右手握刀,刃口正接触砧板上土豆表面,手腕向下用力,刀身倾斜45度” |
❌“切菜” → 刀不碰菜 ✅“厨师手握菜刀,刀刃斜切进砧板上番茄,切面湿润,刀柄在掌心” |
2.5 AI动作理解核心问题总结
| 问题类型 |
翻车表现 |
根本原因 |
解决策略 |
| 方向性问题 |
“背对进屋”变成“面对进屋” |
AI不理解动作的方向性,“进”是朝里的,但AI更关注“进”这个状态 |
必须同时描述身体朝向和动作方向,不要只说动作 |
| 物体一致性 |
拿起苹果,放下变香蕉 |
AI不维护物体在动作前后的连续性,每帧独立生成 |
在每个场景中单独描述关键物体,必要时重复描述 |
| 物理碰撞 |
穿墙、穿门、人悬浮 |
AI没有重力、碰撞、摩擦等物理概念,物体可以任意重叠 |
明确物体间的接触关系,描述“跨过”“推开”“坐在”等物理过程 |
| 姿态合理性 |
手脚扭曲、关节反向 |
AI不理解人体结构和关节运动范围 |
描述具体姿态时加人体工学限制,如“肘部微弯”“膝盖不反向弯曲” |
三、人物表情与情绪理解
3.1 情绪强度梯度(重点!)
生气系列
| 强度等级 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
正确描述方式 |
| 微怒(1级) |
“他有点生气” |
可能生成眉心微皱,或者完全没表情,甚至生成微笑 |
说“有点生气”,结果出来的是面无表情或者微笑 |
“中年男性眉头微蹙,嘴角平直,眼神略显冷淡,写实风格,微表情” |
| 生气(2级) |
“他生气了” |
可能生成眉头紧锁、嘴角下压,或者生成漫画式愤怒符号 |
说“他生气了”,可能生成眉头紧皱,或者头上冒出小火焰图标 |
“男性眉头内皱,眉间距缩短,嘴唇抿成一条直线,眼神带有压迫感,无夸张特效” |
| 暴怒(3级) |
“他很生气” |
可能生成面部通红、血管暴起,或者火焰、雷电效果 |
说“他火冒三丈”,结果生成真的头上冒火、或者电闪雷鸣的夸张场景 |
“男性面部肌肉紧绷,眉头拧在一起,嘴唇抿紧发白,下颌略微前顶,瞳孔收缩,写实风格” |
| 怒不可遏(4级) |
“他气炸了” |
可能生成人物爆炸、化为火焰、或者全身燃烧的极端场景 |
说“气到爆炸”,AI直接生成人体爆炸或燃烧的恐怖画面 |
“男性面部因愤怒而通红,眉头拧成川字,双眼圆睁,咬牙切齿,面部肌肉颤抖,近景特写” |
开心系列
| 强度等级 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
正确描述方式 |
| 微笑(1级) |
“她微笑” |
可能生成标准8颗牙微笑,或者不对称的笑容 |
说“微笑”,可能生成标准牙科广告式的假笑 |
“女性嘴角上扬约15度,眼睛微眯,眼尾轻微上翘,自然放松的浅笑” |
| 开心(2级) |
“她很开心” |
可能生成张嘴大笑,或者生成爱心符号从头部冒出 |
说“很开心”,可能生成满屏爱心特效或者夸张的大笑 |
“女性露出上排牙齿,嘴角上扬25度,苹果肌轻微隆起,眼睛弯成月牙,自然愉悦” |
| 大笑(3级) |
“她大笑” |
可能生成嘴张到不合理的角度,或者生成漫画式夸张表情 |
说“大笑”,可能生成嘴占整张脸一半的畸形表情 |
“女性张嘴露出上下一排牙齿,嘴角向耳根方向拉伸,面颊肌肉上抬,眼睛眯成缝” |
| 狂喜(4级) |
“她高兴坏了” |
可能生成人物漂浮、心脏变大、或者夸张到失控的表情 |
说“狂喜”,可能生成人物身体扭曲或者抽象表达 |
“女性仰头张嘴大笑,双手举起,双肩耸起,面部肌肉充分拉伸,写实摄影风格” |
悲伤系列
| 强度等级 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
正确描述方式 |
| 失落(1级) |
“她有点难过” |
可能生成面无表情,或者眉毛轻微下压 |
说“有点难过”,结果出来的是完全没表情的扑克脸 |
“女性眉尾轻微下垂,眼睛平视,嘴角微微下撇,眼神空洞,写实风格” |
| 难过(2级) |
“她很难过” |
可能生成眉头皱紧、嘴角严重下压,或者眼泪如水龙头 |
说“难过”,可能生成眼泪成河或者瀑布式流泪 |
“女性眉头内皱上抬,嘴角下压明显,下唇轻微前凸,眼眶泛红但无泪水,写实风格” |
| 哭泣(3级) |
“她在哭” |
可能生成眼睛流水、面部扭曲、或者漫画式泪如雨下 |
说“哭泣”,可能生成眼睛像水龙头一样流水,比例失衡 |
“女性眼泪从眼眶溢出,顺颧骨流下,眉头皱紧,嘴唇微颤,鼻翼轻微翕动” |
| 崩溃(4级) |
“她哭到崩溃” |
可能生成面部扭曲变形、眼睛消失、或者抽象表达悲伤 |
说“崩溃大哭”,可能生成恐怖片级别的扭曲面孔 |
“女性面部肌肉因哭泣而变形,眼泪大颗滚落,嘴唇颤抖,下巴肌肉紧绷,近景写实” |
恐惧系列
| 强度等级 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
正确描述方式 |
| 紧张(1级) |
“她有点紧张” |
可能生成眨眼频繁、手放嘴边等刻板动作 |
说“紧张”,可能生成经典“紧张到咬手指”的刻板画面 |
“女性手指绞在一起,视线闪烁不定,嘴唇轻微抿紧,眉心微蹙,轻度紧张” |
| 害怕(2级) |
“她很害怕” |
可能生成瞪大眼睛、张大嘴巴,或者抽象的恐惧符号 |
说“害怕”,可能生成眼睛占脸一半、瞳孔变成黑色圆点的恐怖效果 |
“女性双眼睁大,瞳孔扩张,眼白露出增多,嘴巴微张,手臂紧缩在胸前,写实风格” |
| 恐惧(3级) |
“她恐惧” |
可能生成身体发抖的抽象表达,或者眼睛变成黑色空洞 |
说“恐惧”,可能生成眼睛变成两个黑洞的恐怖画面 |
“女性面部苍白,双眼圆睁瞳孔放大,嘴巴张开,颈部肌肉紧绷,侧身后退姿态” |
| 绝望(4级) |
“她绝望了” |
可能生成眼神空洞、身体萎缩,或者抽象的死亡符号 |
说“绝望”,可能生成人物化为灰烬或者变成幽灵 |
“女性眼神涣散失去焦点,嘴唇颤抖,面部无血色,身体蜷缩,瘫坐在地,写实摄影” |
3.2 AI情绪强度理解偏差
| 偏差类型 |
具体表现 |
产生原因 |
修正方法 |
| 夸张符号化 |
说“生气”就画火、说“开心”就冒爱心 |
AI训练数据中漫画/表情包风格图片过多,学会了“愤怒=火焰”这种符号映射 |
明确标注“写实摄影风格”“电影质感”“无特效符号”“自然表情” |
| 强度失控 |
“有点生气”变成“暴怒”,“微怒”变成“面无表情” |
AI不理解情绪强度的细微差异,容易滑向极端 |
使用精确的强度描述,如“眉心微蹙”而不是“生气”,避免模糊词汇 |
| 字面理解 |
“火冒三丈”真的画火,“气得冒烟”真的画烟 |
AI对成语的字面理解能力强,不理解这是比喻手法 |
比喻义要明确说“比喻”“形容”,字面意思要说“真实火焰”“实际烟雾” |
| 表情固化 |
所有“开心”都是张嘴大笑,所有“悲伤”都是泪流满面 |
训练数据中的表情被高度标签化,缺乏细腻变化 |
描述具体肌肉动作而非情绪标签,如“眼尾轻微上翘”而非“开心” |
3.3 微表情控制
| 微表情 |
描述方式 |
使用场景 |
正确示例 |
| 眉头微皱 |
“眉头轻微皱起,眉心处有细微褶皱” |
轻微不满、思考、困惑 |
“眉头内角微微上抬并靠拢,形成浅浅的川字纹” |
| 嘴角下压 |
“嘴角向下撇,嘴唇平直或略微下弯” |
不开心、不认同、隐忍 |
“嘴角向下的弧度约10度,嘴唇抿成一条略带弧度的直线” |
| 眼神躲闪 |
“视线快速移开,不敢直视” |
紧张、说谎、心虚 |
“瞳孔快速从对方脸上移开,看向左下方,睫毛轻微颤动” |
| 瞳孔放大 |
“瞳孔扩张,占据虹膜比例增大” |
惊讶、恐惧、兴趣 |
“瞳孔放大至占虹膜80%,眼白露出明显增多” |
| 呼吸急促 |
通过身体语言表现呼吸变化 |
紧张、激动、愤怒 |
“肩膀快速起伏,锁骨区域肌肉随呼吸节奏上下移动” |
3.4 混合情绪表达
| 混合情绪 |
单一描述的问题 |
正确描述方式 |
示例 |
| 又生气又心疼 |
说任何一个都会覆盖另一个 |
分开描述面部不同区域 |
“眉心紧皱(生气),但眼眶泛红嘴角下压(心疼),眼神中同时有凌厉和柔软” |
| 笑着流泪 |
要么只笑要么只哭 |
矛盾表情同时存在 |
“女性嘴角上扬,但眼泪从眼眶溢出,眼神温柔又带着悲伤,笑容和泪水同时存在” |
| 害怕但装镇定 |
要么真害怕要么真镇定 |
表面的镇定和微妙的破绽 |
“双手紧握成拳但表面平静,嘴角努力维持微笑弧度,但眼角肌肉轻微颤抖” |
| 心疼的愤怒 |
愤怒掩盖其他情绪 |
愤怒为主但有裂缝 |
“拳头紧握表情凶狠,但眼眶微红,嘴唇颤抖时露出内心柔软” |
四、人物关系与站位
4.1 两人关系控制
| 关系类型 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
正确描述方式 |
示例 |
| 面对面 |
“他们面对面站着” |
生成两人,但距离可能不对,可能手牵手、可能背对背 |
说“面对面”,结果两人背对背或者侧身对视 |
明确身体朝向和面部朝向:“两人相距1米,正面相对而立,面部正向对方,四目对视” |
✅“两人正面相对站立,相距1米,目光交汇,双手自然下垂于身体两侧” |
| 背对背 |
“他们背对背” |
可能生成两人但朝向随机,可能脸朝外、可能脸朝里 |
说“背对背”,结果两人脸朝外但中间有奇怪的连接 |
明确背部的相对关系:“两人背脊相距30厘米,背部同时朝外,肩胛骨朝向对方,两人看向各自前方” |
✅“两人背对背站立,后背相距30厘米,各自看向相反方向” |
| 并肩站立 |
“他们并肩站着” |
可能生成两人紧贴、距离异常、或者一前一后而非并排 |
说“并肩”,结果两人肩膀重叠或者一前一后距离很远 |
描述并排的具体位置和朝向:“两人肩并肩站立,肩膀连线平行,面向同一方向,左侧人稍前” |
✅“两人肩膀平齐并排,面向正北方,肩膀间距20厘米,左侧人物头部略靠前” |
| 一前一后 |
“他一前一后站着” |
可能生成两个人而非同一人前后,或者前后关系混乱 |
说“一前一后”,结果生成两个人 |
明确描述:“同一人物,前方手撑腰,后方肩靠墙,呈现三维纵深感” |
✅“男性前方侧身,前腿微弓,后方手臂背在身后,肩胛骨处衣服轻贴墙面” |
| 对峙 |
“他们对峙” |
可能生成两人面对面,但气势、距离、姿态都不对 |
说“对峙”,可能生成两人牵手对视的亲密场景 |
描述对峙的物理和气势特征:“两人相距2米,正面相对,重心前倾,肩膀绷紧,目光尖锐,身体略微前探” |
✅“两人相距2米,正面怒视,重心前移,双脚分开与肩同宽,拳头半握” |
| 依偎 |
“她依偎在他怀里” |
可能生成悬浮拥抱,或者身体部位穿插 |
说“依偎”,结果生成女人头穿过男人胸膛的恐怖画面 |
描述身体接触的精确关系:“女性头部侧靠男性胸口位置,男性双臂环抱女性肩背,两人躯干紧贴” |
✅“女性头部贴在男性左侧胸口,左手搭在男性肩上,男性右臂搂住女性腰际” |
4.2 多人关系控制
| 关系类型 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
正确描述方式 |
| 围坐 |
“他们围坐在一起” |
可能生成多人围绕某物,但距离、方向混乱,可能人物重叠 |
描述围坐的具体结构:“5人围坐圆形餐桌,直径1.5米,每人等距分布,肩部间距30厘米,面向桌面” |
✅“5人等距围坐直径1.5米圆桌,每人占据72度弧长,面向桌面中央” |
| 排队 |
“他们在排队” |
可能生成多人但不在一条线上,或者间距不均,或者方向混乱 |
明确排队的位置和方向:“5人站成一列纵队,相邻间距1米,面向服务窗口,背对镜头” |
✅“5人单列纵队,首位距窗口3米,每人前后间距80厘米,背部朝向镜头” |
| 散布 |
“他们在草地上散布” |
可能生成多人挤在一起,或者站成一排 |
描述散布的具体分布:“10人散布在半径20米圆形草坪内,间距2-5米不等,各自面向不同方向” |
✅“10人在草坪上散布,半径20米范围,每两人间距2-5米,方向各异,姿态自然” |
| 对峙双方 |
“两方人对峙” |
可能生成两方人但位置混乱,人物数量不对,或者混在一起 |
描述对峙的空间划分:“两组人对峙,各5人,相距5米,中间有明显分界线,左组面朝右,右组面朝左” |
✅“左右两组各5人,相距5米,中间有明显空地,左组正向右组,右组正向左组,剑拔弩张” |
| 主从站位 |
“老板和员工站着” |
可能生成两人但主次不明显,或者没有通过位置表达权力关系 |
描述权力通过空间的表达:“年长男性居中站立,较年轻女性站在其右后侧0.5米,低头记录,身体微前倾” |
✅“中年男性居画面中央,双手背后,年轻人站在其后右侧1米处,低头呈倾听姿态” |
4.3 权力关系通过站位表达
| 权力暗示 |
位置表现 |
描述方式 |
示例 |
| 主导者居中/居前 |
站在画面中心或最前方 |
“男性站在画面正中央,女性站在左侧后方” |
✅“男性位于画面中心,女性在其左后方1米处” |
| 主导者坐/从属者站 |
坐着表示放松/被动,站表示服务/服从 |
“沙发上男性翘腿坐着,女性站在一旁手持文件” |
✅“男性坐主位沙发,翘右腿,女性立于其右侧,手持文件夹呈汇报姿态” |
| 身高差异 |
高位表示权力,低位表示服从 |
“他站着俯视她” |
✅“男性站立身高1.8米,女性坐姿头部高度1.2米,男性低头看向女性” |
| 占据空间大小 |
主导者占更多空间,从属者收缩身体 |
“他大字型坐着,她缩在角落” |
✅“男性占据沙发3/4空间,双臂展开,女性蜷缩在角落扶手上” |
4.4 AI人物关系理解问题
| 问题类型 |
翻车表现 |
原因分析 |
解决策略 |
| 人物重叠 |
两个人变成一个人,或者身体部位穿插 |
AI不理解“两个人”意味着两个独立的空间实体 |
明确两人间距,如“两人相距1米,中间有清晰空隙” |
| 人物消失 |
三个人变成两个,或者一人凭空消失 |
AI不维护数量恒定性,人物数量可以随意变化 |
精确描述每人位置,如“左侧女子、中间男子、右侧小孩” |
| 人物多出 |
两个人变成三个,或者出现陌生人 |
AI倾向于填充“热闹”场景,不理解用户想要特定人数 |
明确人数和特征,如“仅限两人,中年男性和年轻女性,无其他人” |
| 关系混乱 |
牵手变成打架,对视变成背对 |
AI不理解人际关系的物理表达方式 |
描述具体肢体接触,如“十指相扣”“双臂交叉抱胸” |
4.5 复杂关系描述模板
| 关系描述 |
模板结构 |
示例 |
| 对手但站得近 |
[关系定义]+[距离]+[身体语言]+[眼神] |
“两人是商业对手但私下交好。相距50厘米,肩膀几乎相碰,表面平静对视,但拳头在身侧紧握” |
| 暧昧但未挑明 |
[关系定义]+[距离]+[微妙接触]+[回避] |
“两人暧昧中。相距30厘米,手指偶尔触碰又分开,眼神交汇时迅速移开,轻微侧身” |
| 父母与青春期孩子 |
[关系定义]+[权力位置]+[代际差异] |
“父亲想亲近但女儿疏远。父亲站在中间,女儿在门口保持3米距离,低头玩手机不看他” |
| 闺蜜的复杂情感 |
[关系定义]+[亲密细节]+[微妙张力] |
“闺蜜情但有竞争。勾肩但手指未完全搭上,表面大笑但眼神偶尔闪过审视,笑声略有勉强” |
五、构图与布局
5.1 画面构图法则
| 构图类型 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
正确描述方式 |
示例 |
| 三分法 |
“把她放在画面左边” |
可能生成人物在左边但比例不对,或者整体偏移 |
说“放左边”,结果人物贴着画面边缘,占1/6而非1/3 |
明确三分线的位置:“人物面部位于画面左侧1/3垂直线与上1/3水平线交点处” |
✅“女性位于画面左侧1/3处,面部是视觉中心,右侧留白给环境” |
| 对称构图 |
“左右对称” |
可能生成大致对称但细节不对称,或者轴线位置错误 |
说“对称”,结果两边相似但有微妙差异,或者轴线歪斜 |
描述对称轴和对称元素:“以画面中轴线为准,两侧完全对称布局,建筑大门居中,两侧各有等高立柱” |
✅“画面中轴线居中,左侧立柱与右侧立柱完全对称,中式大门在轴线上” |
| 居中构图 |
“把人放中间” |
可能生成人物在中心但周围留白不对,或者头部冲出画面 |
说“居中”,结果人物头顶切掉一半,或者周围太空 |
描述中心位置和周围关系:“人物面部在画面中心,头顶留白1/5,脚下留白1/3,背景对称分布” |
✅“人物面部在画面正中心,头顶留白20%,脚下留白30%,周围环境等距分布” |
| 对角线构图 |
“用对角线构图” |
可能不知道什么是对角线,或者生成混乱的斜线 |
说“对角线”,结果生成毫无美感的斜线或者人物歪斜 |
描述对角线的具体走向:“从画面左下角到右上角的对角线,楼梯沿这条线分布,人物站在对角线上” |
✅“楼梯从左下向右延伸,人物站在这条视觉引导线上,增强纵深感” |
| 框架式构图 |
“用窗户框住人” |
可能生成窗户和人物,但框架关系不对,透视混乱 |
说“框架构图”,结果人物在窗外而非窗内,或者框架太小人物溢出 |
描述框架和主体的关系:“门框作为前景框架,人物在门框内,距离框边缘20厘米,框架形成视线引导” |
✅“半开木门作为前景框架,女性站立在门框内,人物占门洞80%高度” |
| 留白构图 |
“留点空白” |
可能留白太多或太少,或者留白位置不对 |
说“留白”,结果人物太小只占画面5%,或者留白挤在一角 |
描述留白的位置和比例:“人物位于画面右侧1/3处,左侧2/3留白给天空,营造孤独感” |
✅“人物占据画面右侧1/3,左侧2/3是纯净的湖面和天空,留白处无其他元素” |
5.2 主体位置控制
| 位置描述 |
AI理解偏差 |
正确描述方式 |
示例 |
| 画面左侧 |
可能贴着边缘 |
“人物位于左侧1/3线附近,距边缘至少10%画面宽度” |
✅“人物站在画面左侧1/3处,不贴边,与右侧环境保持平衡” |
| 画面右侧 |
可能位置混乱 |
“人物面部在右侧1/3垂直线上,身体占右侧2/3区域” |
✅“女性位于画面右侧1/3区域,面部是右侧焦点,身体向右微倾” |
| 画面中心 |
可能头顶切边 |
“面部在画面几何中心,头顶留白20%,脚下留白30%” |
✅“人物面部位于画面中心偏上,头顶留白1/5,视野开阔” |
| 前景位置 |
可能和背景混在一起 |
“人物在画面最前景,占画面50%高度,中景是建筑,远景是山脉” |
✅“人物位于最前景,身高占画面50%,中景石桥,远景雪山” |
| 背景位置 |
可能变成主体 |
“人物在背景中,高度占画面20%,前景是占60%的桌面” |
✅“咖啡馆场景,人物在背景中1/5高度,前景虚化木桌占60%” |
5.3 层次结构控制
| 层次 |
常见问题 |
正确描述 |
示例 |
| 前景 |
前景太实或太虚,或者位置奇怪 |
“前景元素占画面30%,轻微虚化,起到框架作用” |
✅“前景虚化的树枝占画面边缘15%,形成自然画框,引导视线到主体” |
| 中景 |
主体位置不对,或者和前后混在一起 |
“主体位于中景,占画面50-70%,清晰呈现” |
✅“女性位于中景,占画面60%高度,服装和表情清晰可见” |
| 背景 |
背景太乱或太实,或者比例失调 |
“背景在主体身后1-2米,略微虚化,高度占画面30%” |
✅“背景是虚化的咖啡馆墙面和吊灯,占画面20%,色调柔和” |
5.4 视觉引导线
| 引导类型 |
描述方式 |
作用 |
示例 |
| 汇聚线 |
“线条从四角向中心汇聚” |
引导视线到焦点 |
“铁轨、公路、走廊两侧墙壁线条向远方消失点汇聚,主体站在汇聚点上” |
| S型曲线 |
“道路/河流呈S形” |
增加画面韵律感 |
“蜿蜒小路呈S形穿过画面,从左下进入右上离开,主体在小路中段” |
| 对角线 |
“沿着对角线分布” |
增加动感 |
“楼梯扶手、对角线树干、人物站位沿对角线分布,画面有张力” |
| C型曲线 |
“元素沿C形弧线” |
柔和引导 |
“书架呈C形围绕空间,人物站在C形开口处,视线沿书柜移动” |
5.5 AI构图能力分析
| 能力维度 |
表现评估 |
优化策略 |
| 位置摆放 |
对精确位置的理解较差,容易偏移 |
用百分比或分数描述,不要用“中间”“旁边”等模糊词 |
| 比例控制 |
对物体间比例关系理解较差 |
明确尺寸对比,如“人物比门高一个头”“桌子是人物身高的一半” |
| 层次分离 |
容易把前后景混在一起 |
明确描述“前景”“中景”“背景”及其虚实关系 |
| 留白控制 |
留白位置和比例不稳定 |
精确描述留白区域,如“右侧留白占2/3” |
六、时间与连续性
6.1 场景一致性维护(重点!)
| 问题类型 |
翻车表现 |
根本原因 |
解决策略 |
| 街景突变 |
第一帧是上海外滩,第二帧变成北京胡同 |
AI每帧独立生成,不维护场景连续性 |
明确标注“同一场景”“保持之前设定”,描述不可变元素 |
| 服装变化 |
上一秒穿红裙,下一秒变蓝裙 |
AI不维护人物服装的一致性 |
每个场景单独描述服装,必要时重复“穿与之前相同的…” |
| 人物消失/多出 |
三个人变成两个人,或者凭空多一人 |
AI不维护人物数量的恒定性 |
明确人数和位置,如“仅这三人,无其他人出现” |
| 道具消失 |
手里拿着书,下一秒书不见了 |
AI不维护道具的一致性 |
每个关键帧重复描述道具,如“手里仍然握着那本…” |
6.2 物体一致性控制
| 用户期望 |
AI实际表现 |
正确控制方式 |
示例 |
| 物体不变 |
苹果变香蕉,水杯变花瓶 |
在每个场景中单独描述关键物体 |
“桌上放着红色苹果(第三帧重复:红色苹果仍在桌上)” |
| 物体变化 |
想让苹果消失,但苹果还在 |
明确物体状态的变化或消失 |
“桌面原本放苹果的位置现在空了(苹果已被拿起)” |
| 物体移动 |
想让人物从左边走到右边,但人直接瞬移 |
描述移动的中间过程 |
“人物从画面左侧1/3处,走到右侧1/3处,脚步连贯” |
| 物体变形 |
想让花从花苞变成绽放,但花突然变成另一朵 |
描述同一物体的渐变过程 |
“同一朵玫瑰,之前是花苞状态,现在花瓣微微张开,枝叶相同” |
6.3 时间流动表达
| 时间段 |
光照特征 |
情绪暗示 |
正确描述方式 |
| 清晨 |
低角度暖光,光线柔和,天空蓝粉色 |
希望、新生、平静 |
“清晨阳光,低角度照射,拉出长影子,色调偏蓝橙,天空粉蓝色” |
| 正午 |
顶光,光线强烈,影子短 |
紧张、炎热、清晰 |
“正午顶光,人物头顶影子短小,光线强烈反差,色调偏白” |
| 傍晚 |
低角度金光,光线斜射,暖色调 |
回忆、结束、浪漫 |
“傍晚时分,金色阳光斜射,暖色调,长影子,天空橙红色” |
| 深夜 |
暗调,只有月光或灯光 |
神秘、孤独、紧张 |
“深夜,月光从窗户斜照,室内暗调,只有一盏台灯亮着” |
| 四季变化 |
通过植物、光照、衣着判断 |
春=希望,秋=萧瑟 |
“深秋场景,树叶枯黄,光线柔和偏黄,人们穿外套,画面有落叶” |
6.4 保持一致性的描述模板
| 场景类型 |
模板结构 |
示例 |
| 连续场景 |
“延续上一场景+变化点” |
“延续上一场景,地点仍是上海外滩,时间过了2小时,服装不变,增加人物:男性从左侧走入画面” |
| 关键元素固定 |
“这些元素必须保持不变” |
“以下元素与上一场景完全一致:女性红裙、黑高跟鞋、珍珠耳环、棕色手提包、手中咖啡杯” |
| 变化点明确 |
“仅以下元素变化” |
“变化点:女性从站立变为坐在长椅上,背景从室内变为公园,阳光角度从左上方变为右上方” |
| 物体追踪 |
“物体状态变化记录” |
“苹果:第一帧-桌上红苹果完整;第二帧-咬了一口;第三帧-只剩核;第四帧-核消失桌面干净” |
6.5 AI一致性维护的根本局限
| 局限类型 |
技术原因 |
目前最优解 |
未来方向 |
| 帧间独立生成 |
Diffusion模型每次生成独立,不携带上一帧信息 |
使用参考图/IP-Adapter等一致性技术,或视频模型的多帧控制 |
更好的时序一致性模型 |
| 物体恒常性缺失 |
训练数据中物体没有“恒定ID”概念 |
为关键物体添加描述标签,每个场景重复描述 |
加入物体追踪机制 |
| 空间逻辑混乱 |
不理解“同一个地方”的概念 |
明确描述空间约束,如“仍在同一房间”“位置相对不变” |
空间推理能力的增强 |
七、天气与景色
7.1 天气系统控制
| 天气类型 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
正确描述方式 |
|
| 晴天 |
“天气很好” |
可能生成过度曝光、刺眼太阳、或者不自然的蓝天 |
说“晴天”,结果太阳占据画面一半,或者光线过曝刺眼 |
“晴朗蓝天,少量白云,阳光明媚但柔和,光比正常,无强烈阴影” |
✅“万里无云,阳光充足但柔和,天空湛蓝色,光比1:2,人物面部光照均匀” |
| 阴天 |
“天气阴沉” |
可能生成过度灰暗、或者不自然的乌云压顶 |
说“阴天”,结果天空全黑像夜晚,或者乌云密布像暴风雨前 |
“阴天散射光,天空灰白色调,无明显阴影,色温偏冷,画面整体柔和” |
✅“阴天,灰白色天空,散射光无方向感,物体无硬阴影,整体色调偏冷灰” |
| 雨天 |
“下雨了” |
可能生成下水管子一样的雨,或者不自然的雨滴大小 |
说“下雨”,可能生成雨滴像竖线均匀分布,或者比例失调像下刀子 |
“细雨绵绵,雨丝倾斜30度,空气中水汽弥漫,地面湿润反光,路人打伞” |
✅“中雨,雨丝倾斜近45度,雨滴中等密度,地面有积水反光,行人撑伞” |
| 雪天 |
“下雪了” |
可能生成雪花像圆点一样悬浮,或者雪的颜色不对 |
说“下雪”,可能生成白色圆点像静电,或者雪是灰色的 |
“鹅毛大雪,雪花大小不一,远景雪花飘落,近景雪花虚化,地面有积雪,建筑顶部白色” |
✅“大雪场景,积雪覆盖地面约10厘米厚,空中雪花纷飞,建筑戴雪帽” |
| 雾天 |
“有雾” |
可能生成完全不透明的白色,或者雾和云混淆 |
说“有雾”,可能生成白色墙壁一样的雾,背景完全消失 |
“薄雾笼罩,能见度约50米,远景隐约可见,色调偏灰蓝,空气有朦胧感” |
✅“晨雾,能见度50米,远景山峦隐约可见,近景清晰,色调偏蓝灰” |
| 风天 |
“风很大” |
可能生成风像条纹一样,或者头发疯狂飞舞违反物理 |
说“大风吹”,可能生成头发像旗帜一样水平飘动,或者吹成奇怪形状 |
“强风环境,头发向左飘动约45度,衣角飞扬,树叶倾斜,物体有动感模糊” |
✅“5级风,头发向后飘,与颈部夹角约30度,衣领被吹起,路人压低帽子” |
| 雷电 |
“暴风雨雷电” |
可能生成卡通闪电符号,或者不自然的电光效果 |
说“雷电”,可能生成锯齿形卡通闪电符号,或者闪电从地面升起 |
“暴风雨中的叉形闪电,照亮云层轮廓,瞬间曝光效果,雨丝被闪电照亮” |
✅“夜间暴风雨,一道白色叉形闪电劈开夜空,云层被瞬间照亮,雨幕中电光闪烁” |
7.2 天气与情绪的配合
| 天气选择 |
情绪效果 |
正确描述方式 |
示例 |
| 阴天+压抑情绪 |
强化悲伤/抑郁 |
“阴天灰雾,细雨不断,色调冷灰偏蓝,无阳光,场景萧瑟” |
✅“灰蒙蒙的天空,细雨绵绵,一人在无人的街道独行,画面色调冷灰” |
| 晴天+开心情绪 |
强化愉快/希望 |
“阳光明媚,光线温暖,色调暖黄,人物在阳光下笑容灿烂” |
✅“金色阳光洒下,人物站在向日葵花田中,暖色调,笑容明媚” |
| 暴雨+紧张场景 |
强化危机/紧迫 |
“暴风雨夜,暴雨如注,电闪雷鸣,树木摇晃,增加紧张感” |
✅“暴雨倾盆,闪电划过夜空,雷声隆隆,一人在空旷野外奔跑,画面暗调” |
| 薄雾+神秘场景 |
增加神秘感 |
“清晨薄雾,能见度低,远景若隐若现,增加悬疑感” |
✅“清晨树林薄雾缭绕,能见度约20米,远景消失,增加神秘悬疑氛围” |
7.3 景色类型与叙事配合
| 景色类型 |
典型叙事配合 |
描述方式 |
示例 |
| 城市夜景 |
现代感、繁华、孤独、欲望 |
“霓虹灯光,车流尾灯,玻璃幕墙反光,行人匆匆,画面有节奏感” |
✅“上海陆家嘴夜景,霓虹灯闪烁,车流形成光轨,摩天大楼灯光璀璨” |
| 海边日落 |
浪漫、告别、新开始 |
“金色夕阳,海面波光粼粼,天空橙红,人物剪影,潮水声感” |
✅“海边日落时分,太阳接近海平线,金色余晖,海面泛金光,天空橙红渐变” |
| 废墟 |
衰败、历史、时间流逝、生命力 |
“残垣断壁,爬山虎覆盖,破碎窗户,光影斑驳,有历史感” |
✅“战后废墟,建筑只剩框架,藤蔓缠绕,夕阳从空洞的窗户照入” |
| 荒漠 |
孤独、冒险、绝境、广阔 |
“无边沙丘,金色沙漠,少量枯草,热浪扭曲,单人足迹延伸” |
✅“戈壁沙漠,一望无际的沙丘,远处有雅丹地貌,热浪造成视线轻微扭曲” |
| 森林 |
原始、神秘、危险、奇遇 |
“密林深处,高大树木遮天,光线斑驳,苔藓覆盖,有神秘感” |
✅“原始森林,高耸松柏遮蔽阳光,林间光线斑驳,地面苔藓,有小径” |
7.4 “荒凉废墟中有一朵花”这类对比场景
| 对比类型 |
AI常见问题 |
正确描述方式 |
示例 |
| 荒凉vs生命力 |
要么只有废墟,要么花太突兀 |
“废墟中有一点生命力,形成对比但不违和” |
“残垣断壁覆盖青苔,裂缝中顽强生长一朵红色野花,花朵大小符合实际” |
| 黑暗vs光明 |
要么全黑要么全亮 |
“明暗对比,但暗中有细节” |
“昏暗房间角落,一束阳光从破洞屋顶照下,照亮漂浮的灰尘” |
| 宏大vs渺小 |
比例失调,要么人太大要么太小 |
“渺小个体在宏大场景中” |
“连绵雪山前,一个小红点是一个人,大小约为雪山的1/100” |
八、说话方式/嘴型
8.1 说话时的表情控制
| 表情类型 |
用户常见说法 |
AI实际理解 |
正确描述方式 |
示例 |
| 边说边笑 |
“她笑着说” |
可能生成正常笑容,或者嘴型夸张 |
“女性说话时嘴角上扬,眼睛弯成月牙,但牙齿不外露,呈现微笑说话状态” |
✅“女性面露微笑,嘴角上扬约20度,牙齿轻合,眼神温柔,呈现交谈中的愉悦状态” |
| 咬牙切齿 |
“他咬牙切齿地说” |
可能生成真的露出牙齿,或者咬合状态不对 |
“上下牙齿紧咬,面部肌肉紧绷,下颌角明显,嘴唇抿成一条线” |
✅“男性下颌紧绷,上下排牙齿紧咬,下颌角肌肉隆起,嘴唇抿成一条直线,面部肌肉紧张” |
| 轻声细语 |
“她轻声说话” |
可能生成小声的表情,或者忽略“说话”这个动作 |
“嘴唇微张,轻微动作,面部放松,音量低的感觉” |
✅“女性嘴唇微张呈小圆形,气声感,眉毛放松,眼睛平视,秘密交谈氛围” |
| 大声喊叫 |
“他大声喊” |
可能生成嘴张太大变形,或者表情失控 |
“嘴巴大张,下巴下垂,面部肌肉用力,身体前倾” |
✅“男性嘴巴大张,下颌下压,颈部肌肉紧绷,双臂张开,身体前倾呈喊叫姿态” |
8.2 AI对嘴型的理解能力
| 能力评估 |
具体表现 |
优化策略 |
| 嘴型识别 |
AI能识别张嘴/闭嘴,但精细嘴型差 |
使用“嘴唇微张”“嘴角上扬”等具体描述 |
| 说话状态 |
能生成“在说话”的感觉,但嘴型可能不自然 |
添加氛围描述,如“交谈中”“轻声”“大声”等 |
| 同步问题 |
视频生成中嘴型和语言不同步 |
目前技术局限,尽量描述“静止说话状态”而非动态变化 |
| 口型细节 |
难以生成精确的音节口型 |
避免描述具体音节,描述整体说话感即可 |
8.3 说话时的肢体语言
| 肢体语言 |
描述方式 |
配合场景 |
示例 |
| 手势配合 |
“说话时有手势” |
描述手的位置和动作 |
“女性一边说话一边用手比划,右手抬起至肩高,手掌张开,呈现解释说明的姿态” |
| 眼神配合 |
“边说边看对方” |
描述眼神方向 |
“男性说话时眼睛看向对方,视线在对方面部停留,偶尔点头配合” |
| 身体朝向 |
“身体朝向说话对象” |
描述身体轴线 |
“女性身体略微前倾朝向对方,肩膀跟随,头部正对,呈现专注交谈姿态” |
九、特效理解
9.1 自然特效
| 特效类型 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
正确描述方式 |
示例 |
| 风 |
“风吹起头发” |
可能生成头发像旗帜一样水平飘,或者违反物理 |
说“风吹头发”,结果头发垂直向上飘,像在太空 |
“5级侧风,头发向风向飘逸,与头部夹角约30度,衣角微扬,树叶晃动” |
✅“微风轻拂,女性长发随风向右飘,与颈部约成15度角,自然飘逸” |
| 雨 |
“下着雨” |
可能生成雨像竖线一样均匀,或者比例失调 |
说“雨景”,可能雨滴像手指粗,或者从下往上落 |
“中雨,雨丝45度倾斜,密度适中,地面湿润反光,路人打伞” |
✅“细雨,雨丝斜落30度,密度适中,空气湿润,地面有小水洼” |
| 火焰 |
“火焰燃烧” |
可能生成真实的物理火焰,或者漫画式火焰 |
说“篝火”,结果生成像蜡烛一样的小火,或者火比人还大失控 |
“篝火火焰,高度约1米,跳跃闪烁,木柴燃烧,火光照亮周围人脸” |
✅“壁炉内木柴燃烧,火苗高约40厘米,火焰跳动,橙红色火光映照人物面部” |
| 烟雾 |
“有烟雾” |
可能生成浓烟滚滚,或者像示例发起人糖一样 |
说“烟雾缭绕”,可能生成完全遮蔽场景的浓烟,或者像云朵 |
“轻烟袅袅,从茶杯上方升起,烟雾稀薄透明,不遮挡人物面容” |
✅“浅灰色烟雾从焚香升起,轻微缭绕,透明度60%,不完全遮挡背景” |
| 光影 |
“光影效果” |
可能生成过曝、或者奇怪的光斑 |
说“光影斑驳”,结果光斑像随机噪点 |
“阳光从树叶缝隙照射,在地面形成斑驳光影,光斑大小不一,形状自然” |
✅“阳光穿过树叶缝隙,在地面形成圆形光斑,大小从硬币到手掌不等,自然分布” |
9.2 超现实特效
| 特效类型 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
正确描述方式 |
示例 |
| 光环 |
“人物头顶有光环” |
可能生成宗教感强金光环,或者和头部分离悬浮 |
说“天使光环”,结果头顶一个金色圆环,像PS贴上去的 |
“人物头部上方有柔和光晕,半径约15厘米,渐变透明,与头发自然融合” |
✅“女性头顶有淡金色光晕,直径30厘米,透明度渐变,像自然发光而非贴图” |
| 能量波 |
“释放能量波” |
可能生成卡通冲击波符号,或者过于夸张 |
说“释放能量”,可能生成像龙珠一样的龟派气功 |
“从手掌向前推出的半透明蓝色能量波动,宽30厘米,向前延伸2米,逐渐消散” |
✅“手掌前方半透明蓝色能量波,呈扇形扩散,宽约半米,渐变透明” |
| 魔法效果 |
“魔法特效” |
可能生成过度花哨、不符合魔幻风格的卡通效果 |
说“魔法”,可能生成五颜六色的星星和心形符号 |
“指尖发出紫色光束,光芒呈丝状向外辐射,空气中有点点星尘漂浮” |
✅“指尖发出淡紫色光丝,向外辐射约20厘米,光丝纤细如发,带有点点星尘” |
| 爆炸 |
“爆炸效果” |
可能生成真实恐怖爆炸,或者卡通爆炸圆圈 |
说“爆炸”,可能生成像漫画的“轰”字圆形,或者过度写实恐怖 |
“中距离爆炸,火光橙色,烟雾灰色向四周扩散,碎片向外飞散,有冲击波感” |
✅“适度写实的爆炸效果,橙红色火光,黑灰色烟雾向外翻腾,碎片四散,不过度恐怖” |
9.3 AI特效理解的核心问题
| 问题类型 |
具体表现 |
产生原因 |
解决策略 |
| 字面vs比喻 |
“火冒三丈”生成真火,“气得冒烟”生成真烟 |
AI不区分比喻和字面意思 |
明确说“比喻义:形容愤怒程度高”或“字面意思:真实火焰” |
| 符号化倾向 |
“愤怒=火焰”“开心=爱心” |
训练数据中漫画/表情包过多 |
说“写实风格”“电影质感”“无符号化表达” |
| 强度失控 |
“有点光”变成“太阳一样亮” |
AI倾向于生成明显效果 |
用精确强度词:“微弱光晕”而不是“发光” |
| 违和感 |
特效和场景风格不统一 |
AI独立生成特效和主体 |
描述特效和场景的整体配合:“淡雅的薄雾笼罩”而不是“浓雾弥漫” |
9.4 隐喻与字面的区分描述
| 表达方式 |
字面意思 |
比喻意思 |
描述示例 |
| 火冒三丈 |
头上真的着火,高度一米 |
极度愤怒 |
✅字面:“人物头顶有真实火焰,高度约30厘米,橙红色燃烧效果” ✅比喻:“人物极度愤怒,眉心紧皱,脸部通红,面部肌肉紧绷,写实风格无火焰” |
| 气得冒烟 |
身体冒烟 |
愤怒到极点 |
✅字面:“从头顶升起灰色烟雾,袅袅上升” ✅比喻:“愤怒值达到顶点,眉头紧锁成川字,嘴唇抿紧发白,无烟雾特效” |
| 眼睛里冒星星 |
眼里真的有星星 |
开心/迷恋 |
✅字面:“瞳孔中有微型星星闪烁” ✅比喻:“眼神明亮闪烁,呈现迷恋/开心的感觉,写实风格” |
| 心在滴血 |
心脏真的流血 |
极度悲伤/心痛 |
✅字面:“胸口有血液流出” ✅比喻:“极度悲伤,眼眶通红,嘴唇颤抖,双手捂住胸口,呈心痛姿态” |
十、人物面部特征
10.1 五官细节控制
| 五官 |
用户常见说法 |
AI实际理解 |
正确描述方式 |
示例 |
| 眼型 |
“大眼睛” |
可能生成不成比例的大眼,或者眼型不符合整体 |
“杏仁眼,眼裂宽度适中,眼尾上翘约15度,黑瞳孔大而有神” |
✅“杏仁形眼睛,眼裂高度约1.5厘米,眼尾上挑,黑瞳孔占眼裂70%” |
| 鼻型 |
“高鼻梁” |
可能生成过于突兀的鼻梁,或者和其他五官不协调 |
“鼻梁挺直,高度约占面部1/3,鼻翼宽度约等于眼距,鼻头圆润” |
✅“鼻梁挺直,从眉间到鼻尖形成柔和弧线,鼻翼宽度与眼距相等” |
| 嘴型 |
“薄嘴唇” |
可能生成几乎消失的嘴唇,或者和其他特征不搭 |
“上唇薄约5毫米,下唇厚约8毫米,嘴角自然平直,微笑时呈弧形” |
✅“女性上唇偏薄约4mm,下唇饱满约9mm,嘴唇呈自然淡粉色” |
| 脸型 |
“瓜子脸” |
可能生成过于夸张的锥子脸,或者脸型不对称 |
“倒三角脸型,颧骨宽度约12厘米,下巴尖但圆润,线条流畅” |
✅“椭圆脸,颧骨微突,下巴圆润与颧骨同宽,轮廓线条柔和” |
| 眉毛 |
“浓眉大眼” |
可能生成过于夸张的粗眉,或者和眼型不搭 |
“剑眉,眉峰明显,眉尾上挑30度,眉毛浓密呈深棕色” |
✅“剑眉,眉峰位于瞳孔正上方,眉头粗眉尾细,呈深褐色,长度约5厘米” |
10.2 年龄感表达
| 年龄段 |
面部特征 |
描述方式 |
示例 |
| 少年感 |
皮肤光滑、眼睛大而亮、轮廓柔和 |
“面部皮肤细腻无瑕,颧骨不高,下巴微尖,眼睛大而清澈,面部轮廓柔和圆润” |
✅“约18岁少年,皮肤光洁无皱纹,婴儿肥未完全褪去,眼神清澈明亮” |
| 青年成熟 |
轮廓分明、眼神沉稳 |
“面部轮廓分明,颧骨明显,眼神沉稳有内容,皮肤略有质感” |
✅“约25-30岁,轮廓清晰,颧骨分明,眼神沉稳自信,皮肤有轻微质感” |
| 中年稳重 |
眼角细纹、气质沉稳 |
“眼角有细微皱纹,轮廓硬朗,气质成熟稳重,眼神深邃” |
✅“约40岁中年,眼角有细纹但保养得当,轮廓硬朗,气质成熟内敛” |
| 老年苍老 |
皱纹、松弛、斑痕 |
“面部皱纹纵横,皮肤松弛有斑点,头发花白,面部轮廓下垂” |
✅“约70岁,面部皱纹深刻,皮肤松弛有老年斑,头发银白,面部轮廓下垂” |
10.3 气质类型控制
| 气质类型 |
面部特征 |
描述方式 |
示例 |
| 英气 |
剑眉、高鼻、轮廓硬朗 |
“剑眉入鬓,鼻梁挺直,下颌角分明,眼神锐利有杀气” |
✅“英气逼人,眉峰锐利,眼窝略深,目光如刀,整体轮廓硬朗” |
| 温柔 |
柳眉、圆润、眼神柔和 |
“眉毛弯弯,眼型圆润,嘴角上扬,皮肤柔和,线条无棱角” |
✅“温柔婉约,弯眉杏眼,嘴角常带笑意,面部线条柔和无棱角” |
| 凌厉 |
细眉、薄唇、眼神冷 |
“眉峰上挑,眼睛细长,眼尾上翘,嘴唇薄紧,表情冷淡” |
✅“眼神凌厉,眉峰上挑如刀,眼尾上挑,薄唇紧抿,整体气场冷峻” |
| 憨厚 |
圆眼、宽鼻、嘴角厚 |
“眼睛圆而大,鼻翼宽厚,嘴唇偏厚,面部圆润” |
✅“憨厚老实,圆眼圆润鼻,嘴角厚实带笑,面部轮廓圆润饱满” |
| 精明 |
狭长眼、高颧、薄唇 |
“眼睛细长有神,颧骨略高,嘴唇薄而紧,法令纹明显” |
✅“精明干练,眼型偏长眼神锐利,颧骨分明,薄唇紧抿” |
10.4 复杂面部特征描述
| 期望效果 |
问题分析 |
描述方式 |
示例 |
| “善良但眼神锐利” |
矛盾特征难以同时表达 |
分开描述面部不同区域 |
“面部整体轮廓柔和,呈现善良感,但眼神锐利,瞳孔小而黑,目光有穿透力” |
| “外表冷酷内心柔软” |
需要微妙的矛盾感 |
用细节暗示内心 |
“面无表情的脸部,紧绷的嘴角,但眼眶微红,眼角有泪光闪动” |
| “年轻的老人” |
矛盾年龄感 |
混合年龄特征 |
“皮肤细腻但有细纹,眼神清澈但有沧桑感,面部既年轻又显老” |
10.5 人物识别一致性
| 问题类型 |
翻车表现 |
解决策略 |
示例 |
| 同一人变脸 |
不同场景中人物长相完全不同 |
详细描述不可变特征 |
“深色皮肤,高颧骨,左眉有疤痕,鼻梁挺直,下巴有颗痣” |
| 只有部分特征保留 |
眼睛像但脸不像 |
列出多个锚定特征 |
“方形脸,眉眼像妈妈,鼻梁直像爸爸,厚嘴唇像爷爷” |
| 风格不一致 |
有时写实有时卡通 |
明确风格要求 |
“全程写实摄影风格,光线自然,无美颜滤镜” |
十一、车辆/交通工具内的场景(用户痛点专项)
11.1 车内视角控制(重点!)
| 场景类型 |
用户常见说法 |
AI实际理解 |
典型翻车场景 |
正确描述方式 |
示例 |
| 驾驶座视角 |
“坐在驾驶座” |
可能生成人在车里但位置错误,或者视角混乱 |
说“驾驶座自拍”,结果人坐在车顶自拍,或者方向盘在奇怪位置 |
“主驾驶座内视角,方向盘在前方约50厘米,双手握住方向盘,人物面部在中央后视镜上方可见” |
✅“镜头置于主驾驶座椅枕高度,向前平视,方向盘在画面下方,双手握在方向盘10点和2点位置” |
| 副驾驶视角 |
“在副驾驶拍” |
可能生成人物在副驾驶但不在车内,或者视角不对 |
说“副驾驶自拍”,结果人物在车外拍车,或者在车内但比例失调 |
“副驾驶座视角,镜头在副驾位置,向主驾驶方向拍摄,主驾驶人物侧脸可见” |
✅“镜头置于副驾驶座椅高度,向驾驶员方向拍摄,女性侧脸在主驾驶座,方向盘虚化在前景” |
| 后座视角 |
“后座场景” |
可能生成人物在车后但不在座位上,或者车外 |
说“后座自拍”,结果人物趴在车后备箱,或者悬浮在后座上方 |
“后座中央视角,镜头在后座中部高度,朝向前方,可以看到前排座椅后部” |
✅“镜头置于后座中间位置,高度1.1米,正对前方副驾驶后脑勺,窗外街景从主驾驶车窗入镜” |
| 透窗拍摄 |
“从车外拍车内” |
这是最容易翻车的!可能生成人在车外、或者车窗变透明 |
说“透过车窗拍车内”,结果车窗变成透明玻璃,人物悬浮在车外 |
“镜头在车外3米处,透过左后车窗拍摄车内,车窗框架在边缘,玻璃有反光” |
✅“相机置于车外左侧2米处,透过半开的车窗拍摄车内,人物在后座,车窗框完整可见” |
11.2 AI车内场景理解的核心问题
| 问题类型 |
翻车表现 |
根本原因 |
解决策略 |
| 人在车外 |
人站在车外面,或者和车没有互动 |
AI理解“车”和“人”是分开的,不理解“在车内”的空间包含关系 |
明确描述“人在车内部”,描述身体和座椅、车窗的接触关系 |
| 穿车问题 |
人从车中间穿出来,或者身体穿过车门 |
AI没有“封闭空间”的概念 |
描述门的开关状态和人的位置:“车门打开,人坐在座位上” |
| 视角混淆 |
车外视角和车内视角混乱 |
AI不理解不同视角的位置关系 |
明确镜头位置和朝向:“镜头在副驾驶,向主驾驶方向拍摄” |
| 比例失调 |
人比车还大,或者手伸出车外比例异常 |
AI不维护人和车的比例关系 |
描述具体比例:“人物头部距车顶约20厘米” |
11.3 车内姿态控制
| 期望姿态 |
AI常见问题 |
正确描述方式 |
示例 |
| 靠着车窗 |
可能生成悬浮的头部,或者头穿过车窗 |
“头部侧倾靠在车窗上,脸颊贴着玻璃,肩膀自然下垂” |
✅“女性头部侧靠左车窗,脸颊贴玻璃,车窗边框在耳后,肩部在座位上” |
| 趴在方向盘 |
可能生成趴在车外发动机盖上 |
“上半身前倾,双手撑在方向盘上,头部下垂靠近方向盘” |
✅“上半身趴在方向盘上,双臂伸直,手掌压在方向盘上,头部下垂靠近双手” |
| 躺在后座 |
可能生成躺在车顶,或者悬浮在后座上方 |
“身体蜷缩躺在后座座椅上,头枕车窗边缘,双腿蜷曲” |
✅“女性侧躺在后座椅垫上,头枕车窗边缘,双腿蜷曲,手臂搭在腹部” |
| 伏在车门上 |
可能生成趴在车外车门上 |
“身体侧面伏在车门内侧,手臂搭在车窗边框,头靠在手臂上” |
✅“身体左侧伏在打开的车门上,手肘撑在门框,头部靠在手背上,面向车外” |
| 风吹头发 |
可能生成头发完全水平飘动,违反物理 |
“侧窗微开,头发被风吹起,向后飘动约20度,自然飘逸” |
✅“左侧车窗开缝,微风把左侧头发吹起约15度,发丝轻扬,未开窗一侧头发静止” |
11.4 车内场景描述模板
| 场景类型 |
模板结构 |
示例 |
| 车内自拍(正常) |
[座位位置]+[身体姿态]+[镜头位置] |
“主驾驶座,女性手握方向盘,眼视前方镜头,镜头在副驾驶位置拍摄” |
| 车内自拍(侧脸) |
[座位位置]+[面部朝向]+[镜头位置] |
“女性坐后座右侧,面朝左车窗,镜头在后座左侧,透过肩膀拍摄侧脸” |
| 透过车窗拍摄 |
[镜头位置]+[车窗状态]+[拍摄内容] |
“镜头在车外左侧2米,透过半开左后车窗拍摄车内,人物在后座中央” |
| 开车门场景 |
[车门状态]+[人物位置]+[身体姿态] |
“左后车门打开,女性身体探出车门,一半在车内一半在车外,手扶车门上框” |
| 多人车内 |
[各人位置]+[相互关系] |
“主驾驶男性目视前方,副驾驶女性侧身向后座说话,后座两人面向对方交谈” |
十二、AI视觉生成的根本性局限
12.1 五大根本局限详解
| 局限类型 |
具体表现 |
产生原因 |
技术背景 |
| 没有物理常识 |
穿墙、穿地、物体悬浮、不受重力 |
Diffusion模型的生成过程是“逐步去噪”,不包含物理引擎 |
AI通过统计学习生成图像,没有“物理世界”的先验知识 |
| 没有空间逻辑 |
前后、内外、远近混淆,透视关系错误 |
训练数据中的空间关系没有被结构化标注 |
AI从2D图像学习,缺乏3D空间理解能力 |
| 没有时间连续性 |
每帧独立生成,街景突变、服装变化、物体消失 |
图像生成模型每次只生成一张,不携带历史信息 |
Diffusion的随机采样过程不支持时序记忆 |
| 没有物体恒常性 |
苹果变香蕉、衣服变色、人物“变脸” |
没有物体ID的概念,每个场景独立生成物体 |
生成结果的物体身份不固定 |
| 字面理解倾向 |
比喻变写实、隐喻变符号 |
训练数据中字面图像多于比喻图像 |
NLP的语义理解能力强,但视觉生成偏向字面 |
12.2 局限的底层原因分析
| 技术层面 |
具体说明 |
局限性 |
| 训练数据偏差 |
AI从互联网图像学习,图像质量参差不齐 |
漫画/表情包风格的夸张表达被大量学习,写实细腻表达相对较少 |
| Diffusion原理 |
逐步从噪声生成图像,依赖语义匹配而非物理逻辑 |
生成过程是“最可能匹配文本的图像”,不检查物理合理性 |
| 注意力机制局限 |
模型对描述词的重要性判断不准确 |
可能过度关注某个词(如“火”)而忽略整体语义(“比喻义”) |
| 缺乏世界模型 |
没有对物理世界的内部表征 |
不理解“固体不可穿透”“重力向下”“光照有方向”等常识 |
| 缺乏推理能力 |
生成是模式匹配,不是逻辑推理 |
不能通过“进屋需要走门”推理出“背对镜头进屋=身体朝外” |
12.3 当前最优应对策略
| 局限类型 |
应对策略 |
具体操作 |
| 物理常识缺失 |
明确描述物理过程 |
不要说“进屋”,说“推门跨过门槛进入” |
| 空间逻辑混乱 |
使用精确位置词 |
用“左侧”“右侧”“前方”“后方”,避免“旁边”“附近” |
| 时间连续性差 |
每个关键帧重复描述 |
关键物体和人物特征在每个场景中重复描述 |
| 物体恒常性差 |
给物体添加标签 |
“那本红色封面的书”而不是“一本书” |
| 字面理解 |
明确区分字面/比喻 |
“写实风格”“无特效”“比喻义:形容愤怒程度” |
12.4 未来技术突破方向
| 方向 |
当前进展 |
预期效果 |
时间预期 |
| 视频一致性模型 |
Runway Gen-2、Pika、Sora等 |
多帧一致性提升,街景/服装变化减少 |
2024-2025年成熟 |
| 3D空间感知 |
NeRF、3D Gaussian Splatting |
更准确的空间关系和透视关系 |
2025-2026年集成 |
| 物理引擎集成 |
Physics-LLM研究 |
AI理解重力、碰撞、摩擦等物理规律 |
2026-2027年突破 |
| 世界模型 |
具身智能研究 |
AI有物理世界的内部表征,理解常识 |
2027-2030年 |
| 物体追踪 |
Object ID技术 |
物体在生成过程中保持ID一致 |
2024-2025年成熟 |
12.5 创作者心态建议
| 心态 |
具体建议 |
理由 |
| 接受不完美 |
AI生成有随机性,不可能100%完美 |
技术局限决定,完美主义会让自己痛苦 |
| 迭代优化 |
先出粗稿再逐步细化描述 |
多次生成比一次到位更有效 |
| 扬长避短 |
AI擅长的风格多做,不擅长的少做 |
比如AI擅长氛围感,弱化精确动作 |
| 工具配合 |
AI生成+人工后期/局部重绘 |
取长补短,不追求AI万能 |
| 保持学习 |
持续关注AI能力提升,及时更新策略 |
AI能力快速进化,昨日局限今日可能突破 |
附录:常用描述模板库
A. 动作描述模板
[人物]+[身体朝向]+[动作类型]+[具体姿态]+[力度/幅度]+[方向]
示例:女性正面面对镜头,双手抬起与肩同高,掌心向上,手臂微弯呈托举状
B. 空间描述模板
[主体位置]+[与参照物的关系]+[距离]+[高度]+[朝向]
示例:人物站在门口左侧,距门框30厘米,面向室内,背对镜头
C. 情绪描述模板
[情绪类型]+[强度]+[面部细节]+[身体语言]+[风格要求]
示例:轻度悲伤,眉头内皱但未完全拧紧,嘴角下撇约10度,双肩轻微下垂,电影写实风格
D. 场景一致性模板
延续之前设定:[不可变元素列表]
变化点:[具体变化内容]
示例:延续上一场景设定:女性穿红色连衣裙、棕色手提包、黑色高跟鞋不变
变化:站立→坐在咖啡馆靠窗位置
E. 车内场景模板
镜头位置:[具体位置]
车内人物位置:[座位+姿态]
车窗状态:[开/关/开缝]
拍摄方向:[朝哪里拍]
示例:镜头置于后座中间高度,向前拍摄主驾驶,副驾驶车窗微开,车内暖光
文档版本:v1.0
最后更新:2024年
适用工具:Midjourney、Stable Diffusion、DALL-E、Sora、Runway等主流AI图像/视频生成工具
核心原则:理解AI的局限,发挥AI的优势,用精确的语言引导AI生成你想要的结果