AI视觉细节控制逻辑表

AI视觉细节控制逻辑表

使用说明:本表格旨在帮助内容创作者理解AI对视觉细节的理解逻辑,掌握正确描述方式,避免常见的生成翻车。表格按维度分类,每个维度都包含"用户常见说法"、"AI实际理解"、"典型翻车场景"、"翻车原因"、"正确描述方式"和"示例对比"六个方面。

操作指南DOCX下载原文件
## AI视觉细节控制逻辑表

使用说明:本表格旨在帮助内容创作者理解AI对视觉细节的理解逻辑,掌握正确描述方式,避免常见的生成翻车。表格按维度分类,每个维度都包含“用户常见说法”、“AI实际理解”、“典型翻车场景”、“翻车原因”、“正确描述方式”和“示例对比”六个方面。


一、空间结构理解

1.1 室内空间结构

控制维度 用户常见说法 AI实际理解 典型翻车场景 翻车原因 正确描述方式 示例对比
房间布局 “客厅里有一张沙发” 生成一张沙发,可能在房间任何位置,甚至飘在空中或穿透墙壁 说“客厅里有沙发”,结果沙发一半在墙里,另一半在门外 AI不理解“室内”意味着封闭空间,物体应放在可站立的地面上 明确说明家具的具体位置关系:“沙发靠墙摆放,正对着电视墙” ❌“客厅有沙发” → 沙发飘在空中
✅“沙发靠北墙摆放,面朝南侧”
门窗位置 “窗外是花园” 可能生成门或窗,但位置随机,或者窗外的景色和实际位置不符 说“从窗户看出去是花园”,结果窗户开在厨房墙上,窗外是城市天际线 AI不关联“房间功能”和“窗外景色”的逻辑关系 用方位+参照物定位:“主卧朝南,窗户面向院子,种着玫瑰花” ❌“卧室窗户外面是花园” → 窗外是摩天大楼
✅“主卧朝南窗户,窗外是一片玫瑰花园,阳光照进来”
家具摆放 “桌子上放着书” 桌子可能不存在,书可能放在空中、地上或桌子上但比例失衡 说“书桌上放着电脑”,结果电脑比桌子还大,或者书漂浮在桌子上方 AI不维护物体与承载面的物理关系 描述物体与家具的具体关系:“电脑显示器放在书桌中央,键盘放在显示器前方” ❌“桌上放着电脑” → 电脑悬浮或比例失调
✅“27寸显示器摆在书桌正中,键盘紧贴显示器下方”
上下楼层 “他在楼上睡觉” 可能生成人物在某种“楼上”的场景,但不明确是哪一层楼或楼梯关系 说“从楼下往楼上看”,结果视角混乱,人物同时出现在多个楼层 AI不理解建筑层级的物理连续性 明确层级和视角关系:“二楼卧室里,人物躺在床上,镜头从一楼楼梯口向上拍摄” ❌“人物在楼上” → 视角混乱
✅“二楼卧室,棕色大床上,男性躺着,面朝镜头,窗外是夜色”
楼梯走廊 “走廊尽头是卧室” 可能生成走廊,但卧室位置随机,走廊可能没有尽头或尽头是墙 说“沿着走廊走到尽头”,结果走廊无限延伸或者尽头是悬崖 AI不维护空间的连通性和目的性 描述具体路线和终点:“长走廊,两侧是白色墙壁,尽头左转是主卧,门半开着” ❌“走廊尽头是卧室” → 走廊无限延伸
✅“5米长走廊,墙壁刷白,尽头左转进入主卧,门虚掩着”

1.2 室外空间结构

控制维度 用户常见说法 AI实际理解 典型翻车场景 翻车原因 正确描述方式 示例对比
街道场景 “街道上有人走着” 生成街道,可能有人,但人和街道的位置关系、比例都可能是错的 说“街道上有个女人在走”,结果女人比房子还高,或者走在房子上面 AI不维护“人在地面上行走”的物理常识 描述人的位置和街道的具体特征:“双向车道沥青路面,路边梧桐树,一个穿红裙的女人在人行道上行走” ❌“街道上有人” → 人比楼高
✅“沥青双向街道,路边法国梧桐,一个红裙女性在人行道右侧行走,比例正常”
广场空间 “广场中央有喷泉” 可能生成喷泉,但可能在广场边缘、角落,或者喷泉比广场还大 说“广场中央有音乐喷泉”,结果喷泉在广场外,广场空无一物 AI不理解“中央”的数学概念,容易生成在边缘或随机位置 用方位词和参照物:“圆形广场,直径50米,中央是三层叠水喷泉,四周是石雕围栏” ❌“广场中央有喷泉” → 喷泉在角落
✅“圆形广场直径50米,阶梯式音乐喷泉在正中心,四周有石凳环绕”
自然地形 “小河旁边有棵树” 可能生成河流和树,但它们的相对位置、水和树的比例关系不确定 说“河边有棵垂柳”,结果树长在水里,或者树在水对面,距离很远 AI不维护“水边植被”的自然逻辑关系 描述具体位置关系和细节:“河岸青石板铺就,水面距岸80厘米,一棵垂柳斜伸向水面,树干直径30厘米” ❌“河边有树” → 树在水里或距离很远
✅“石砌河岸,水位距岸约半米,倾斜的垂柳枝条快要触碰水面”

1.3 建筑结构理解

控制维度 用户常见说法 AI实际理解 典型翻车场景 翻车原因 正确描述方式 示例对比
房屋外观 “一栋白色的房子” 生成白色建筑,可能没有门、窗、屋顶比例正确,甚至可能生成抽象白色块 说“白色欧式小楼”,结果生成没有门窗的白色方块,或者窗户长在屋顶上 AI不维护建筑的基本结构逻辑,不理解“房屋”需要门、窗、屋顶等元素 详细描述建筑特征:“独栋二层小楼,奶白色外墙,深蓝色波形瓦屋顶,对开深棕色大门,两侧各一扇拱形落地窗” ❌“白色房子” → 没有门窗的白色方块
✅“两层白色小楼,深蓝瓦顶,深棕对开门,拱形窗,门前两级石阶”
内外空间 “从门外看屋内” 可能生成门,或者门不存在,或者门外看到的“屋内”和实际不符 说“从门外看进去”,结果门消失了,墙壁变成透明,或者屋内场景在门外 AI不区分“门内”和“门外”的视角逻辑 明确视角位置和视线方向:“站在玄关处,门半开,向内看,客厅米色沙发,暖黄落地灯” ❌“从门外看进去” → 墙壁变透明
✅“门开着一条缝,从门缝向内看,客厅浅灰沙发,角落落地灯亮着”
屋顶墙壁 “墙壁上挂着画” 可能生成画,但画可能挂在空中、地上、墙上但位置不合理 说“墙上挂着一幅油画”,结果画悬浮在房屋外面,或者挂在地板上 AI不维护“墙上挂画”的物理逻辑 描述画的精确位置:“客厅沙发上方墙面中央,挂着一幅60x80厘米的风景油画,画框黑色” ❌“墙上有画” → 画挂在地板上
✅“沙发正上方30厘米处,一幅60x80cm风景油画,深木色画框”

1.4 透视关系理解

控制维度 用户常见说法 AI实际理解 典型翻车场景 翻车原因 正确描述方式 示例对比
近大远小 “一条长长的路” 可能生成道路,但道路的透视关系可能混乱,近处和远处物体比例异常 说“延伸到远方的小路”,结果近处和远处路面宽度一样,路两边的树也一样高 AI不理解透视的数学关系,容易生成“平铺”而非“纵深” 描述透视特征和消失点:“林荫小路,路面从下往上逐渐变窄,消失在天际线中央,两侧树木近高远低” ❌“一条长长的路” → 前后一样宽
✅“透视小路,宽度从前景60%延伸到远景5%,消失在远方地平线”
消失点 “铁轨延伸到远方” 可能生成铁轨,但消失点位置可能不对,或者没有消失效果 说“铁轨伸向天边”,结果铁轨是平行线,或者消失在画面顶部而不是中心 AI不主动构建符合透视规则的场景 明确消失点位置:“两条铁轨在画面中央地平线处交汇,蓝天白云,远方有小镇轮廓” ❌“铁轨伸向远方” → 铁轨平行
✅“纵深构图,铁轨在画面中心地平线处交汇成一点,远景有蒸汽火车头”

1.5 AI空间理解盲区与应对

控制维度 用户常见说法 AI实际理解 典型翻车场景 翻车原因 正确描述方式 示例对比
穿墙问题 “他走进房间” 生成人物,但人物可能穿过墙壁、穿过门框、从窗户进入 说“他推门进屋”,结果人物从墙壁中间“渗透”进去,或者整个人穿过门框但门没开 AI没有“固体碰撞”概念,认为墙壁和人物可以重叠 明确门的开关状态和人物的进入方式:“他推开深棕色木门,门向内开,他跨过门槛进入客厅” ❌“走进房间” → 人穿墙
✅“木质门向内打开,他抬脚跨过20厘米门槛,完整进入房间”
内外混淆 “车内场景” 生成“车”和“人”,但人可能在车外、车顶、或者车内但比例异常 说“车内自拍”,结果人物坐在车顶自拍,或者人物比车还大 AI理解“车”和“人”是分开的元素,不理解“人在车内部”的空间包含关系 明确车的位置和人物在车内的具体位置:“驾驶座上坐着穿黑色皮夹克的男性,镜头从副驾驶座位置拍摄,方向盘在前景虚化” ❌“车内场景” → 人坐车顶
✅“人物坐在汽车主驾驶座,双手握方向盘,镜头从右后座拍摄,透过车窗能看到街景”
前后混淆 “他站在我前面” 可能生成人物,但人物和“我”的位置关系不确定,可能生成背后、侧面 说“他面对着我”,结果他背对着镜头/观众,或者两人侧面对视 AI不维护观察者和被观察者的相对位置关系 明确相对位置和朝向:“男性面对镜头站立,穿蓝色衬衫,双手自然下垂,镜头视角与人物平视” ❌“他面对着我” → 背对镜头
✅“男性正面面对镜头,双脚与肩同宽,镜头正对人物面部高度拍摄”

二、人物动作理解

2.1 基础动作控制

控制维度 用户常见说法 AI实际理解 典型翻车场景 翻车原因 正确描述方式 示例对比
站立动作 “人物站着” 生成直立人形,但可能僵硬、不自然,或者手的位置奇怪 说“女孩站着”,结果生成僵硬站立的女孩,手臂以不自然的角度伸出 AI不理解“自然站立”的人体姿态平衡 描述具体姿态:“女性自然站立,重心在右脚,左脚稍向前伸,肩膀放松,手臂自然垂于身体两侧” ❌“人物站着” → 僵硬直立
✅“女性双脚分开与肩同宽,重心均匀,双手自然下垂,肩部放松”
坐姿动作 “他坐在椅子上” 生成人物坐在某种椅子上,但椅子可能没有腿、悬浮、或者人物姿势扭曲 说“男人坐在椅子上”,结果生成人物坐在没有椅腿的椅子上方,或者椅子比人还小 AI不维护“坐”需要支撑面的物理关系 描述椅子的具体形态和坐姿:“标准餐椅,木质椅腿,座位高度45厘米,男性臀部完全在椅面上,大腿水平” ❌“坐在椅子上” → 椅子悬浮
✅“坐高45cm的木质餐椅,臀部完全接触椅面,大腿与地面平行,小腿自然下垂”
躺卧动作 “她躺在床上” 生成女性和床,但可能女性悬浮在床的上方、或者比例异常、或者姿势扭曲 说“女人躺在床上休息”,结果女人平躺在床单上方,像漂浮,或者头和身体连接处扭曲 AI不维护“躺”需要身体和支撑面接触的关系 描述身体与床的接触关系:“女性侧躺在1.8米双人床上,浅灰色床单,脸枕在枕头上,身体曲线自然贴合床垫” ❌“躺在床上” → 悬浮或姿势扭曲
✅“女性侧卧在双人床左侧,脸枕白色枕头,身体线条自然弯曲贴合床垫”
行走动作 “他在走路” 生成直立人形在移动中,但腿部动作可能违反人体工学,或者身体不协调 说“男人走路”,结果两条腿以完全不可能的方式交叉,或者身体向后倾斜走路 AI不理解行走的生物力学原理 描述步态细节:“男性正面向镜头方向行走,左腿向前迈出,脚跟着地,右臂自然摆动,步速中等” ❌“在走路” → 腿部动作违反人体工学
✅“正面行走视角,左腿前迈脚跟着地,右腿在后准备离地,对侧手臂摆动”

2.2 复杂动作理解

控制维度 用户常见说法 AI实际理解 典型翻车场景 翻车原因 正确描述方式 示例对比
转身动作 “他转过身来” 可能生成旋转的人形,但旋转的方向、幅度不确定,可能生成扭曲的形态 说“男人转过身”,结果生成人体180度扭转但头还在原位,或者身体像麻花一样扭曲 AI不理解“转身”是连续动作,有起点和终点 描述转动的起点和终点:“男性背对镜头,右侧肩膀向前转30度,正逐渐转向正面,但还未完全转过来” ❌“转过身来” → 头身分离/麻花扭曲
✅“男性3/4侧身,背对镜头转为正面的过渡姿态,转动幅度约45度”
推门动作 “他推门进入” 生成人物和门,但可能门不开、人穿门、或者手的位置不对 说“男人推门”,结果门没动,人已经进去,或者手穿过门板 AI不维护推门需要手接触门把、门向内/外开的逻辑链 描述动作的物理过程:“男性右手握住门把手,向内推动,深棕色木门开至90度,他抬左脚跨过门槛” ❌“推门进入” → 穿门/门不动的穿墙
✅“右手握住黄铜门把手前推,木门向内开30度,左脚抬起准备跨入”
拿起放下 “他拿起苹果” 生成人物手中有某种物体,但物体可能突然出现、没有拿的动作、或者手和物体关系奇怪 说“她拿起桌上的苹果”,结果苹果已经握在手里,没有“拿起”的过程,或者苹果比手还大 AI不理解“拿起”是手从空到有的连续动作 描述手和物体的接触瞬间:“右手手指正在合拢握住红色苹果,手掌和苹果接触,桌面上的苹果位置已空” ❌“拿起苹果” → 苹果无中生有
✅“女性右手手指包裹住红色苹果,苹果完全在掌心范围内,原来的桌面位置空置”
拥抱动作 “他们拥抱在一起” 生成两个人形接触,但拥抱的方式、位置、力度感都不对,可能生成悬浮接触 说“情侣拥抱”,结果两人身体悬浮接触,或者头部穿过对方身体,或者只有手指尖接触 AI不维护“拥抱”需要身体大面积接触、有力度感、情感表达的关系 描述拥抱的具体形态:“两人面对面,男性双臂环抱女性腰背部,女性双手搭在男性肩上,两人胸部紧贴” ❌“拥抱” → 悬浮/穿身
✅“女性面部贴靠男性颈侧,双臂环绕男性背部,男性双臂环抱女性腰际,躯干紧贴”

2.3 动作方向控制(重点!)

控制维度 用户常见说法 AI实际理解 典型翻车场景 翻车原因 正确描述方式 示例对比
背对镜头 “背对镜头站着” 可能生成人物,但方向随机,可能正面、侧面,或者身体和脸的方向不一致 说“女人背对镜头”,结果生成女人正对镜头,或者头转向后面但身体正对 AI不理解“镜头”作为观察者的存在,容易把“背对”理解为“某种方向” 明确身体轴线和镜头的位置关系:“女性背部完整朝向镜头,长发垂落肩后,镜头视角在她正后方3米,高度1.6米” ❌“背对镜头” → 正面面对镜头
✅“女性背影完整呈现在画面中央,头发及腰,镜头在她正后方拍摄她的后背”
面对镜头 “面对镜头微笑” 可能生成面部,但微笑的幅度、眼神方向都不确定,可能斜视、俯视 说“他面对镜头”,结果生成人物眼睛看向别处,或者脸部侧向一边 AI不维护“面对”和“看”的因果关系 精确描述面部朝向和视线:“男性面部正面朝向镜头,眼睛直视镜头中央,双眼瞳孔位于画面1/3水平线” ❌“面对镜头” → 眼睛看向别处
✅“男性正脸面对镜头,双眼正视镜头,鼻尖在画面中轴线,两侧对称”
走向镜头 “他向镜头走来” 可能生成移动中的人物,但可能向后走、悬浮走、或者整个人倒退 说“男人向镜头走来”,结果男人倒退着走,或者脚向前走但身体后仰 AI不理解“向镜头走”的方向性和视角关系 描述步伐方向和透视效果:“男性脚尖朝向镜头方向行走,越走越近,近大远小透视明确,步幅正常” ❌“向镜头走来” → 后退走/悬浮
✅“男性脚尖朝镜头方向行走,逐渐放大靠近,视距缩短,步态正常”
远离镜头 “他离开房间” 可能生成人物,但可能不是走向门外,或者整个人悬浮着后退 说“他走向门口离开”,结果人物向后漂浮,或者穿过墙壁离开 AI不维护“离开”的空间逻辑和物理性 描述离开的具体路径:“男性背朝门口站立,向后退出房间,左脚先退,跨过门槛,门框逐渐进入画面” ❌“离开房间” → 悬浮后退/穿墙
✅“人物背朝门口退去,左脚先退跨过门槛,身影逐渐缩小,门框在身后放大”
进屋方向 “他背对镜头进屋” 这是最容易翻车的描述!AI可能生成面对镜头进屋、侧身进屋、甚至从窗户进屋 说“背对镜头进屋”,结果生成男人面对镜头走进来,好像在迎接谁 “进”是一个方向性动词,但AI把它当成“进入”这个状态,而不是“进入时的朝向” 必须同时描述身体朝向和进入动作:“男性背部朝向镜头,正朝门的方向走去,左手已经触及门把手,准备推门进入” ❌“背对镜头进屋” → 面对镜头进屋
✅“男性背影朝向镜头,正走向门口,左手触碰门把手,身体前倾即将跨入门内”

2.4 动作连贯性

控制维度 用户常见说法 AI实际理解 典型翻车场景 翻车原因 正确描述方式 示例对比
连续动作 “她先坐下然后看书” 可能生成两个独立状态,但缺少“坐下”到“看书”的过渡,可能直接跳到最终状态 说“女人坐下看书”,结果生成女人已经坐好手里已经有书,没有“坐下”的过程 AI不维护时间连续性,每帧都是独立生成的 分解动作为多个状态,或描述最终状态避免中间态:“女性刚在沙发上坐定,膝盖上放着合起的书,一只手正要翻开封面” ❌“先坐下再看书” → 直接跳到看书状态
✅“女性臀部刚接触沙发坐垫,手里拿着合起的书,正准备翻开第一页”
动作逻辑 “他拿起刀切菜” 生成刀和菜,但可能刀不接触菜、刀悬浮、或者切的动作违反物理 说“厨师切菜”,结果刀悬浮在菜上方,或者刀穿过砧板,或者菜自己裂开 AI不维护工具和对象的物理接触关系 描述接触瞬间:“厨师右手握刀,刃口正接触砧板上土豆表面,手腕向下用力,刀身倾斜45度” ❌“切菜” → 刀不碰菜
✅“厨师手握菜刀,刀刃斜切进砧板上番茄,切面湿润,刀柄在掌心”

2.5 AI动作理解核心问题总结

问题类型 翻车表现 根本原因 解决策略
方向性问题 “背对进屋”变成“面对进屋” AI不理解动作的方向性,“进”是朝里的,但AI更关注“进”这个状态 必须同时描述身体朝向和动作方向,不要只说动作
物体一致性 拿起苹果,放下变香蕉 AI不维护物体在动作前后的连续性,每帧独立生成 在每个场景中单独描述关键物体,必要时重复描述
物理碰撞 穿墙、穿门、人悬浮 AI没有重力、碰撞、摩擦等物理概念,物体可以任意重叠 明确物体间的接触关系,描述“跨过”“推开”“坐在”等物理过程
姿态合理性 手脚扭曲、关节反向 AI不理解人体结构和关节运动范围 描述具体姿态时加人体工学限制,如“肘部微弯”“膝盖不反向弯曲”

三、人物表情与情绪理解

3.1 情绪强度梯度(重点!)

生气系列

强度等级 用户常见说法 AI实际理解 典型翻车场景 正确描述方式
微怒(1级) “他有点生气” 可能生成眉心微皱,或者完全没表情,甚至生成微笑 说“有点生气”,结果出来的是面无表情或者微笑 “中年男性眉头微蹙,嘴角平直,眼神略显冷淡,写实风格,微表情”
生气(2级) “他生气了” 可能生成眉头紧锁、嘴角下压,或者生成漫画式愤怒符号 说“他生气了”,可能生成眉头紧皱,或者头上冒出小火焰图标 “男性眉头内皱,眉间距缩短,嘴唇抿成一条直线,眼神带有压迫感,无夸张特效”
暴怒(3级) “他很生气” 可能生成面部通红、血管暴起,或者火焰、雷电效果 说“他火冒三丈”,结果生成真的头上冒火、或者电闪雷鸣的夸张场景 “男性面部肌肉紧绷,眉头拧在一起,嘴唇抿紧发白,下颌略微前顶,瞳孔收缩,写实风格”
怒不可遏(4级) “他气炸了” 可能生成人物爆炸、化为火焰、或者全身燃烧的极端场景 说“气到爆炸”,AI直接生成人体爆炸或燃烧的恐怖画面 “男性面部因愤怒而通红,眉头拧成川字,双眼圆睁,咬牙切齿,面部肌肉颤抖,近景特写”

开心系列

强度等级 用户常见说法 AI实际理解 典型翻车场景 正确描述方式
微笑(1级) “她微笑” 可能生成标准8颗牙微笑,或者不对称的笑容 说“微笑”,可能生成标准牙科广告式的假笑 “女性嘴角上扬约15度,眼睛微眯,眼尾轻微上翘,自然放松的浅笑”
开心(2级) “她很开心” 可能生成张嘴大笑,或者生成爱心符号从头部冒出 说“很开心”,可能生成满屏爱心特效或者夸张的大笑 “女性露出上排牙齿,嘴角上扬25度,苹果肌轻微隆起,眼睛弯成月牙,自然愉悦”
大笑(3级) “她大笑” 可能生成嘴张到不合理的角度,或者生成漫画式夸张表情 说“大笑”,可能生成嘴占整张脸一半的畸形表情 “女性张嘴露出上下一排牙齿,嘴角向耳根方向拉伸,面颊肌肉上抬,眼睛眯成缝”
狂喜(4级) “她高兴坏了” 可能生成人物漂浮、心脏变大、或者夸张到失控的表情 说“狂喜”,可能生成人物身体扭曲或者抽象表达 “女性仰头张嘴大笑,双手举起,双肩耸起,面部肌肉充分拉伸,写实摄影风格”

悲伤系列

强度等级 用户常见说法 AI实际理解 典型翻车场景 正确描述方式
失落(1级) “她有点难过” 可能生成面无表情,或者眉毛轻微下压 说“有点难过”,结果出来的是完全没表情的扑克脸 “女性眉尾轻微下垂,眼睛平视,嘴角微微下撇,眼神空洞,写实风格”
难过(2级) “她很难过” 可能生成眉头皱紧、嘴角严重下压,或者眼泪如水龙头 说“难过”,可能生成眼泪成河或者瀑布式流泪 “女性眉头内皱上抬,嘴角下压明显,下唇轻微前凸,眼眶泛红但无泪水,写实风格”
哭泣(3级) “她在哭” 可能生成眼睛流水、面部扭曲、或者漫画式泪如雨下 说“哭泣”,可能生成眼睛像水龙头一样流水,比例失衡 “女性眼泪从眼眶溢出,顺颧骨流下,眉头皱紧,嘴唇微颤,鼻翼轻微翕动”
崩溃(4级) “她哭到崩溃” 可能生成面部扭曲变形、眼睛消失、或者抽象表达悲伤 说“崩溃大哭”,可能生成恐怖片级别的扭曲面孔 “女性面部肌肉因哭泣而变形,眼泪大颗滚落,嘴唇颤抖,下巴肌肉紧绷,近景写实”

恐惧系列

强度等级 用户常见说法 AI实际理解 典型翻车场景 正确描述方式
紧张(1级) “她有点紧张” 可能生成眨眼频繁、手放嘴边等刻板动作 说“紧张”,可能生成经典“紧张到咬手指”的刻板画面 “女性手指绞在一起,视线闪烁不定,嘴唇轻微抿紧,眉心微蹙,轻度紧张”
害怕(2级) “她很害怕” 可能生成瞪大眼睛、张大嘴巴,或者抽象的恐惧符号 说“害怕”,可能生成眼睛占脸一半、瞳孔变成黑色圆点的恐怖效果 “女性双眼睁大,瞳孔扩张,眼白露出增多,嘴巴微张,手臂紧缩在胸前,写实风格”
恐惧(3级) “她恐惧” 可能生成身体发抖的抽象表达,或者眼睛变成黑色空洞 说“恐惧”,可能生成眼睛变成两个黑洞的恐怖画面 “女性面部苍白,双眼圆睁瞳孔放大,嘴巴张开,颈部肌肉紧绷,侧身后退姿态”
绝望(4级) “她绝望了” 可能生成眼神空洞、身体萎缩,或者抽象的死亡符号 说“绝望”,可能生成人物化为灰烬或者变成幽灵 “女性眼神涣散失去焦点,嘴唇颤抖,面部无血色,身体蜷缩,瘫坐在地,写实摄影”

3.2 AI情绪强度理解偏差

偏差类型 具体表现 产生原因 修正方法
夸张符号化 说“生气”就画火、说“开心”就冒爱心 AI训练数据中漫画/表情包风格图片过多,学会了“愤怒=火焰”这种符号映射 明确标注“写实摄影风格”“电影质感”“无特效符号”“自然表情”
强度失控 “有点生气”变成“暴怒”,“微怒”变成“面无表情” AI不理解情绪强度的细微差异,容易滑向极端 使用精确的强度描述,如“眉心微蹙”而不是“生气”,避免模糊词汇
字面理解 “火冒三丈”真的画火,“气得冒烟”真的画烟 AI对成语的字面理解能力强,不理解这是比喻手法 比喻义要明确说“比喻”“形容”,字面意思要说“真实火焰”“实际烟雾”
表情固化 所有“开心”都是张嘴大笑,所有“悲伤”都是泪流满面 训练数据中的表情被高度标签化,缺乏细腻变化 描述具体肌肉动作而非情绪标签,如“眼尾轻微上翘”而非“开心”

3.3 微表情控制

微表情 描述方式 使用场景 正确示例
眉头微皱 “眉头轻微皱起,眉心处有细微褶皱” 轻微不满、思考、困惑 “眉头内角微微上抬并靠拢,形成浅浅的川字纹”
嘴角下压 “嘴角向下撇,嘴唇平直或略微下弯” 不开心、不认同、隐忍 “嘴角向下的弧度约10度,嘴唇抿成一条略带弧度的直线”
眼神躲闪 “视线快速移开,不敢直视” 紧张、说谎、心虚 “瞳孔快速从对方脸上移开,看向左下方,睫毛轻微颤动”
瞳孔放大 “瞳孔扩张,占据虹膜比例增大” 惊讶、恐惧、兴趣 “瞳孔放大至占虹膜80%,眼白露出明显增多”
呼吸急促 通过身体语言表现呼吸变化 紧张、激动、愤怒 “肩膀快速起伏,锁骨区域肌肉随呼吸节奏上下移动”

3.4 混合情绪表达

混合情绪 单一描述的问题 正确描述方式 示例
又生气又心疼 说任何一个都会覆盖另一个 分开描述面部不同区域 “眉心紧皱(生气),但眼眶泛红嘴角下压(心疼),眼神中同时有凌厉和柔软”
笑着流泪 要么只笑要么只哭 矛盾表情同时存在 “女性嘴角上扬,但眼泪从眼眶溢出,眼神温柔又带着悲伤,笑容和泪水同时存在”
害怕但装镇定 要么真害怕要么真镇定 表面的镇定和微妙的破绽 “双手紧握成拳但表面平静,嘴角努力维持微笑弧度,但眼角肌肉轻微颤抖”
心疼的愤怒 愤怒掩盖其他情绪 愤怒为主但有裂缝 “拳头紧握表情凶狠,但眼眶微红,嘴唇颤抖时露出内心柔软”

四、人物关系与站位

4.1 两人关系控制

关系类型 用户常见说法 AI实际理解 典型翻车场景 正确描述方式 示例
面对面 “他们面对面站着” 生成两人,但距离可能不对,可能手牵手、可能背对背 说“面对面”,结果两人背对背或者侧身对视 明确身体朝向和面部朝向:“两人相距1米,正面相对而立,面部正向对方,四目对视” ✅“两人正面相对站立,相距1米,目光交汇,双手自然下垂于身体两侧”
背对背 “他们背对背” 可能生成两人但朝向随机,可能脸朝外、可能脸朝里 说“背对背”,结果两人脸朝外但中间有奇怪的连接 明确背部的相对关系:“两人背脊相距30厘米,背部同时朝外,肩胛骨朝向对方,两人看向各自前方” ✅“两人背对背站立,后背相距30厘米,各自看向相反方向”
并肩站立 “他们并肩站着” 可能生成两人紧贴、距离异常、或者一前一后而非并排 说“并肩”,结果两人肩膀重叠或者一前一后距离很远 描述并排的具体位置和朝向:“两人肩并肩站立,肩膀连线平行,面向同一方向,左侧人稍前” ✅“两人肩膀平齐并排,面向正北方,肩膀间距20厘米,左侧人物头部略靠前”
一前一后 “他一前一后站着” 可能生成两个人而非同一人前后,或者前后关系混乱 说“一前一后”,结果生成两个人 明确描述:“同一人物,前方手撑腰,后方肩靠墙,呈现三维纵深感” ✅“男性前方侧身,前腿微弓,后方手臂背在身后,肩胛骨处衣服轻贴墙面”
对峙 “他们对峙” 可能生成两人面对面,但气势、距离、姿态都不对 说“对峙”,可能生成两人牵手对视的亲密场景 描述对峙的物理和气势特征:“两人相距2米,正面相对,重心前倾,肩膀绷紧,目光尖锐,身体略微前探” ✅“两人相距2米,正面怒视,重心前移,双脚分开与肩同宽,拳头半握”
依偎 “她依偎在他怀里” 可能生成悬浮拥抱,或者身体部位穿插 说“依偎”,结果生成女人头穿过男人胸膛的恐怖画面 描述身体接触的精确关系:“女性头部侧靠男性胸口位置,男性双臂环抱女性肩背,两人躯干紧贴” ✅“女性头部贴在男性左侧胸口,左手搭在男性肩上,男性右臂搂住女性腰际”

4.2 多人关系控制

关系类型 用户常见说法 AI实际理解 典型翻车场景 正确描述方式
围坐 “他们围坐在一起” 可能生成多人围绕某物,但距离、方向混乱,可能人物重叠 描述围坐的具体结构:“5人围坐圆形餐桌,直径1.5米,每人等距分布,肩部间距30厘米,面向桌面” ✅“5人等距围坐直径1.5米圆桌,每人占据72度弧长,面向桌面中央”
排队 “他们在排队” 可能生成多人但不在一条线上,或者间距不均,或者方向混乱 明确排队的位置和方向:“5人站成一列纵队,相邻间距1米,面向服务窗口,背对镜头” ✅“5人单列纵队,首位距窗口3米,每人前后间距80厘米,背部朝向镜头”
散布 “他们在草地上散布” 可能生成多人挤在一起,或者站成一排 描述散布的具体分布:“10人散布在半径20米圆形草坪内,间距2-5米不等,各自面向不同方向” ✅“10人在草坪上散布,半径20米范围,每两人间距2-5米,方向各异,姿态自然”
对峙双方 “两方人对峙” 可能生成两方人但位置混乱,人物数量不对,或者混在一起 描述对峙的空间划分:“两组人对峙,各5人,相距5米,中间有明显分界线,左组面朝右,右组面朝左” ✅“左右两组各5人,相距5米,中间有明显空地,左组正向右组,右组正向左组,剑拔弩张”
主从站位 “老板和员工站着” 可能生成两人但主次不明显,或者没有通过位置表达权力关系 描述权力通过空间的表达:“年长男性居中站立,较年轻女性站在其右后侧0.5米,低头记录,身体微前倾” ✅“中年男性居画面中央,双手背后,年轻人站在其后右侧1米处,低头呈倾听姿态”

4.3 权力关系通过站位表达

权力暗示 位置表现 描述方式 示例
主导者居中/居前 站在画面中心或最前方 “男性站在画面正中央,女性站在左侧后方” ✅“男性位于画面中心,女性在其左后方1米处”
主导者坐/从属者站 坐着表示放松/被动,站表示服务/服从 “沙发上男性翘腿坐着,女性站在一旁手持文件” ✅“男性坐主位沙发,翘右腿,女性立于其右侧,手持文件夹呈汇报姿态”
身高差异 高位表示权力,低位表示服从 “他站着俯视她” ✅“男性站立身高1.8米,女性坐姿头部高度1.2米,男性低头看向女性”
占据空间大小 主导者占更多空间,从属者收缩身体 “他大字型坐着,她缩在角落” ✅“男性占据沙发3/4空间,双臂展开,女性蜷缩在角落扶手上”

4.4 AI人物关系理解问题

问题类型 翻车表现 原因分析 解决策略
人物重叠 两个人变成一个人,或者身体部位穿插 AI不理解“两个人”意味着两个独立的空间实体 明确两人间距,如“两人相距1米,中间有清晰空隙”
人物消失 三个人变成两个,或者一人凭空消失 AI不维护数量恒定性,人物数量可以随意变化 精确描述每人位置,如“左侧女子、中间男子、右侧小孩”
人物多出 两个人变成三个,或者出现陌生人 AI倾向于填充“热闹”场景,不理解用户想要特定人数 明确人数和特征,如“仅限两人,中年男性和年轻女性,无其他人”
关系混乱 牵手变成打架,对视变成背对 AI不理解人际关系的物理表达方式 描述具体肢体接触,如“十指相扣”“双臂交叉抱胸”

4.5 复杂关系描述模板

关系描述 模板结构 示例
对手但站得近 [关系定义]+[距离]+[身体语言]+[眼神] “两人是商业对手但私下交好。相距50厘米,肩膀几乎相碰,表面平静对视,但拳头在身侧紧握”
暧昧但未挑明 [关系定义]+[距离]+[微妙接触]+[回避] “两人暧昧中。相距30厘米,手指偶尔触碰又分开,眼神交汇时迅速移开,轻微侧身”
父母与青春期孩子 [关系定义]+[权力位置]+[代际差异] “父亲想亲近但女儿疏远。父亲站在中间,女儿在门口保持3米距离,低头玩手机不看他”
闺蜜的复杂情感 [关系定义]+[亲密细节]+[微妙张力] “闺蜜情但有竞争。勾肩但手指未完全搭上,表面大笑但眼神偶尔闪过审视,笑声略有勉强”

五、构图与布局

5.1 画面构图法则

构图类型 用户常见说法 AI实际理解 典型翻车场景 正确描述方式 示例
三分法 “把她放在画面左边” 可能生成人物在左边但比例不对,或者整体偏移 说“放左边”,结果人物贴着画面边缘,占1/6而非1/3 明确三分线的位置:“人物面部位于画面左侧1/3垂直线与上1/3水平线交点处” ✅“女性位于画面左侧1/3处,面部是视觉中心,右侧留白给环境”
对称构图 “左右对称” 可能生成大致对称但细节不对称,或者轴线位置错误 说“对称”,结果两边相似但有微妙差异,或者轴线歪斜 描述对称轴和对称元素:“以画面中轴线为准,两侧完全对称布局,建筑大门居中,两侧各有等高立柱” ✅“画面中轴线居中,左侧立柱与右侧立柱完全对称,中式大门在轴线上”
居中构图 “把人放中间” 可能生成人物在中心但周围留白不对,或者头部冲出画面 说“居中”,结果人物头顶切掉一半,或者周围太空 描述中心位置和周围关系:“人物面部在画面中心,头顶留白1/5,脚下留白1/3,背景对称分布” ✅“人物面部在画面正中心,头顶留白20%,脚下留白30%,周围环境等距分布”
对角线构图 “用对角线构图” 可能不知道什么是对角线,或者生成混乱的斜线 说“对角线”,结果生成毫无美感的斜线或者人物歪斜 描述对角线的具体走向:“从画面左下角到右上角的对角线,楼梯沿这条线分布,人物站在对角线上” ✅“楼梯从左下向右延伸,人物站在这条视觉引导线上,增强纵深感”
框架式构图 “用窗户框住人” 可能生成窗户和人物,但框架关系不对,透视混乱 说“框架构图”,结果人物在窗外而非窗内,或者框架太小人物溢出 描述框架和主体的关系:“门框作为前景框架,人物在门框内,距离框边缘20厘米,框架形成视线引导” ✅“半开木门作为前景框架,女性站立在门框内,人物占门洞80%高度”
留白构图 “留点空白” 可能留白太多或太少,或者留白位置不对 说“留白”,结果人物太小只占画面5%,或者留白挤在一角 描述留白的位置和比例:“人物位于画面右侧1/3处,左侧2/3留白给天空,营造孤独感” ✅“人物占据画面右侧1/3,左侧2/3是纯净的湖面和天空,留白处无其他元素”

5.2 主体位置控制

位置描述 AI理解偏差 正确描述方式 示例
画面左侧 可能贴着边缘 “人物位于左侧1/3线附近,距边缘至少10%画面宽度” ✅“人物站在画面左侧1/3处,不贴边,与右侧环境保持平衡”
画面右侧 可能位置混乱 “人物面部在右侧1/3垂直线上,身体占右侧2/3区域” ✅“女性位于画面右侧1/3区域,面部是右侧焦点,身体向右微倾”
画面中心 可能头顶切边 “面部在画面几何中心,头顶留白20%,脚下留白30%” ✅“人物面部位于画面中心偏上,头顶留白1/5,视野开阔”
前景位置 可能和背景混在一起 “人物在画面最前景,占画面50%高度,中景是建筑,远景是山脉” ✅“人物位于最前景,身高占画面50%,中景石桥,远景雪山”
背景位置 可能变成主体 “人物在背景中,高度占画面20%,前景是占60%的桌面” ✅“咖啡馆场景,人物在背景中1/5高度,前景虚化木桌占60%”

5.3 层次结构控制

层次 常见问题 正确描述 示例
前景 前景太实或太虚,或者位置奇怪 “前景元素占画面30%,轻微虚化,起到框架作用” ✅“前景虚化的树枝占画面边缘15%,形成自然画框,引导视线到主体”
中景 主体位置不对,或者和前后混在一起 “主体位于中景,占画面50-70%,清晰呈现” ✅“女性位于中景,占画面60%高度,服装和表情清晰可见”
背景 背景太乱或太实,或者比例失调 “背景在主体身后1-2米,略微虚化,高度占画面30%” ✅“背景是虚化的咖啡馆墙面和吊灯,占画面20%,色调柔和”

5.4 视觉引导线

引导类型 描述方式 作用 示例
汇聚线 “线条从四角向中心汇聚” 引导视线到焦点 “铁轨、公路、走廊两侧墙壁线条向远方消失点汇聚,主体站在汇聚点上”
S型曲线 “道路/河流呈S形” 增加画面韵律感 “蜿蜒小路呈S形穿过画面,从左下进入右上离开,主体在小路中段”
对角线 “沿着对角线分布” 增加动感 “楼梯扶手、对角线树干、人物站位沿对角线分布,画面有张力”
C型曲线 “元素沿C形弧线” 柔和引导 “书架呈C形围绕空间,人物站在C形开口处,视线沿书柜移动”

5.5 AI构图能力分析

能力维度 表现评估 优化策略
位置摆放 对精确位置的理解较差,容易偏移 用百分比或分数描述,不要用“中间”“旁边”等模糊词
比例控制 对物体间比例关系理解较差 明确尺寸对比,如“人物比门高一个头”“桌子是人物身高的一半”
层次分离 容易把前后景混在一起 明确描述“前景”“中景”“背景”及其虚实关系
留白控制 留白位置和比例不稳定 精确描述留白区域,如“右侧留白占2/3”

六、时间与连续性

6.1 场景一致性维护(重点!)

问题类型 翻车表现 根本原因 解决策略
街景突变 第一帧是上海外滩,第二帧变成北京胡同 AI每帧独立生成,不维护场景连续性 明确标注“同一场景”“保持之前设定”,描述不可变元素
服装变化 上一秒穿红裙,下一秒变蓝裙 AI不维护人物服装的一致性 每个场景单独描述服装,必要时重复“穿与之前相同的…”
人物消失/多出 三个人变成两个人,或者凭空多一人 AI不维护人物数量的恒定性 明确人数和位置,如“仅这三人,无其他人出现”
道具消失 手里拿着书,下一秒书不见了 AI不维护道具的一致性 每个关键帧重复描述道具,如“手里仍然握着那本…”

6.2 物体一致性控制

用户期望 AI实际表现 正确控制方式 示例
物体不变 苹果变香蕉,水杯变花瓶 在每个场景中单独描述关键物体 “桌上放着红色苹果(第三帧重复:红色苹果仍在桌上)”
物体变化 想让苹果消失,但苹果还在 明确物体状态的变化或消失 “桌面原本放苹果的位置现在空了(苹果已被拿起)”
物体移动 想让人物从左边走到右边,但人直接瞬移 描述移动的中间过程 “人物从画面左侧1/3处,走到右侧1/3处,脚步连贯”
物体变形 想让花从花苞变成绽放,但花突然变成另一朵 描述同一物体的渐变过程 “同一朵玫瑰,之前是花苞状态,现在花瓣微微张开,枝叶相同”

6.3 时间流动表达

时间段 光照特征 情绪暗示 正确描述方式
清晨 低角度暖光,光线柔和,天空蓝粉色 希望、新生、平静 “清晨阳光,低角度照射,拉出长影子,色调偏蓝橙,天空粉蓝色”
正午 顶光,光线强烈,影子短 紧张、炎热、清晰 “正午顶光,人物头顶影子短小,光线强烈反差,色调偏白”
傍晚 低角度金光,光线斜射,暖色调 回忆、结束、浪漫 “傍晚时分,金色阳光斜射,暖色调,长影子,天空橙红色”
深夜 暗调,只有月光或灯光 神秘、孤独、紧张 “深夜,月光从窗户斜照,室内暗调,只有一盏台灯亮着”
四季变化 通过植物、光照、衣着判断 春=希望,秋=萧瑟 “深秋场景,树叶枯黄,光线柔和偏黄,人们穿外套,画面有落叶”

6.4 保持一致性的描述模板

场景类型 模板结构 示例
连续场景 “延续上一场景+变化点” “延续上一场景,地点仍是上海外滩,时间过了2小时,服装不变,增加人物:男性从左侧走入画面”
关键元素固定 “这些元素必须保持不变” “以下元素与上一场景完全一致:女性红裙、黑高跟鞋、珍珠耳环、棕色手提包、手中咖啡杯”
变化点明确 “仅以下元素变化” “变化点:女性从站立变为坐在长椅上,背景从室内变为公园,阳光角度从左上方变为右上方”
物体追踪 “物体状态变化记录” “苹果:第一帧-桌上红苹果完整;第二帧-咬了一口;第三帧-只剩核;第四帧-核消失桌面干净”

6.5 AI一致性维护的根本局限

局限类型 技术原因 目前最优解 未来方向
帧间独立生成 Diffusion模型每次生成独立,不携带上一帧信息 使用参考图/IP-Adapter等一致性技术,或视频模型的多帧控制 更好的时序一致性模型
物体恒常性缺失 训练数据中物体没有“恒定ID”概念 为关键物体添加描述标签,每个场景重复描述 加入物体追踪机制
空间逻辑混乱 不理解“同一个地方”的概念 明确描述空间约束,如“仍在同一房间”“位置相对不变” 空间推理能力的增强

七、天气与景色

7.1 天气系统控制

天气类型 用户常见说法 AI实际理解 典型翻车场景 正确描述方式
晴天 “天气很好” 可能生成过度曝光、刺眼太阳、或者不自然的蓝天 说“晴天”,结果太阳占据画面一半,或者光线过曝刺眼 “晴朗蓝天,少量白云,阳光明媚但柔和,光比正常,无强烈阴影” ✅“万里无云,阳光充足但柔和,天空湛蓝色,光比1:2,人物面部光照均匀”
阴天 “天气阴沉” 可能生成过度灰暗、或者不自然的乌云压顶 说“阴天”,结果天空全黑像夜晚,或者乌云密布像暴风雨前 “阴天散射光,天空灰白色调,无明显阴影,色温偏冷,画面整体柔和” ✅“阴天,灰白色天空,散射光无方向感,物体无硬阴影,整体色调偏冷灰”
雨天 “下雨了” 可能生成下水管子一样的雨,或者不自然的雨滴大小 说“下雨”,可能生成雨滴像竖线均匀分布,或者比例失调像下刀子 “细雨绵绵,雨丝倾斜30度,空气中水汽弥漫,地面湿润反光,路人打伞” ✅“中雨,雨丝倾斜近45度,雨滴中等密度,地面有积水反光,行人撑伞”
雪天 “下雪了” 可能生成雪花像圆点一样悬浮,或者雪的颜色不对 说“下雪”,可能生成白色圆点像静电,或者雪是灰色的 “鹅毛大雪,雪花大小不一,远景雪花飘落,近景雪花虚化,地面有积雪,建筑顶部白色” ✅“大雪场景,积雪覆盖地面约10厘米厚,空中雪花纷飞,建筑戴雪帽”
雾天 “有雾” 可能生成完全不透明的白色,或者雾和云混淆 说“有雾”,可能生成白色墙壁一样的雾,背景完全消失 “薄雾笼罩,能见度约50米,远景隐约可见,色调偏灰蓝,空气有朦胧感” ✅“晨雾,能见度50米,远景山峦隐约可见,近景清晰,色调偏蓝灰”
风天 “风很大” 可能生成风像条纹一样,或者头发疯狂飞舞违反物理 说“大风吹”,可能生成头发像旗帜一样水平飘动,或者吹成奇怪形状 “强风环境,头发向左飘动约45度,衣角飞扬,树叶倾斜,物体有动感模糊” ✅“5级风,头发向后飘,与颈部夹角约30度,衣领被吹起,路人压低帽子”
雷电 “暴风雨雷电” 可能生成卡通闪电符号,或者不自然的电光效果 说“雷电”,可能生成锯齿形卡通闪电符号,或者闪电从地面升起 “暴风雨中的叉形闪电,照亮云层轮廓,瞬间曝光效果,雨丝被闪电照亮” ✅“夜间暴风雨,一道白色叉形闪电劈开夜空,云层被瞬间照亮,雨幕中电光闪烁”

7.2 天气与情绪的配合

天气选择 情绪效果 正确描述方式 示例
阴天+压抑情绪 强化悲伤/抑郁 “阴天灰雾,细雨不断,色调冷灰偏蓝,无阳光,场景萧瑟” ✅“灰蒙蒙的天空,细雨绵绵,一人在无人的街道独行,画面色调冷灰”
晴天+开心情绪 强化愉快/希望 “阳光明媚,光线温暖,色调暖黄,人物在阳光下笑容灿烂” ✅“金色阳光洒下,人物站在向日葵花田中,暖色调,笑容明媚”
暴雨+紧张场景 强化危机/紧迫 “暴风雨夜,暴雨如注,电闪雷鸣,树木摇晃,增加紧张感” ✅“暴雨倾盆,闪电划过夜空,雷声隆隆,一人在空旷野外奔跑,画面暗调”
薄雾+神秘场景 增加神秘感 “清晨薄雾,能见度低,远景若隐若现,增加悬疑感” ✅“清晨树林薄雾缭绕,能见度约20米,远景消失,增加神秘悬疑氛围”

7.3 景色类型与叙事配合

景色类型 典型叙事配合 描述方式 示例
城市夜景 现代感、繁华、孤独、欲望 “霓虹灯光,车流尾灯,玻璃幕墙反光,行人匆匆,画面有节奏感” ✅“上海陆家嘴夜景,霓虹灯闪烁,车流形成光轨,摩天大楼灯光璀璨”
海边日落 浪漫、告别、新开始 “金色夕阳,海面波光粼粼,天空橙红,人物剪影,潮水声感” ✅“海边日落时分,太阳接近海平线,金色余晖,海面泛金光,天空橙红渐变”
废墟 衰败、历史、时间流逝、生命力 “残垣断壁,爬山虎覆盖,破碎窗户,光影斑驳,有历史感” ✅“战后废墟,建筑只剩框架,藤蔓缠绕,夕阳从空洞的窗户照入”
荒漠 孤独、冒险、绝境、广阔 “无边沙丘,金色沙漠,少量枯草,热浪扭曲,单人足迹延伸” ✅“戈壁沙漠,一望无际的沙丘,远处有雅丹地貌,热浪造成视线轻微扭曲”
森林 原始、神秘、危险、奇遇 “密林深处,高大树木遮天,光线斑驳,苔藓覆盖,有神秘感” ✅“原始森林,高耸松柏遮蔽阳光,林间光线斑驳,地面苔藓,有小径”

7.4 “荒凉废墟中有一朵花”这类对比场景

对比类型 AI常见问题 正确描述方式 示例
荒凉vs生命力 要么只有废墟,要么花太突兀 “废墟中有一点生命力,形成对比但不违和” “残垣断壁覆盖青苔,裂缝中顽强生长一朵红色野花,花朵大小符合实际”
黑暗vs光明 要么全黑要么全亮 “明暗对比,但暗中有细节” “昏暗房间角落,一束阳光从破洞屋顶照下,照亮漂浮的灰尘”
宏大vs渺小 比例失调,要么人太大要么太小 “渺小个体在宏大场景中” “连绵雪山前,一个小红点是一个人,大小约为雪山的1/100”

八、说话方式/嘴型

8.1 说话时的表情控制

表情类型 用户常见说法 AI实际理解 正确描述方式 示例
边说边笑 “她笑着说” 可能生成正常笑容,或者嘴型夸张 “女性说话时嘴角上扬,眼睛弯成月牙,但牙齿不外露,呈现微笑说话状态” ✅“女性面露微笑,嘴角上扬约20度,牙齿轻合,眼神温柔,呈现交谈中的愉悦状态”
咬牙切齿 “他咬牙切齿地说” 可能生成真的露出牙齿,或者咬合状态不对 “上下牙齿紧咬,面部肌肉紧绷,下颌角明显,嘴唇抿成一条线” ✅“男性下颌紧绷,上下排牙齿紧咬,下颌角肌肉隆起,嘴唇抿成一条直线,面部肌肉紧张”
轻声细语 “她轻声说话” 可能生成小声的表情,或者忽略“说话”这个动作 “嘴唇微张,轻微动作,面部放松,音量低的感觉” ✅“女性嘴唇微张呈小圆形,气声感,眉毛放松,眼睛平视,秘密交谈氛围”
大声喊叫 “他大声喊” 可能生成嘴张太大变形,或者表情失控 “嘴巴大张,下巴下垂,面部肌肉用力,身体前倾” ✅“男性嘴巴大张,下颌下压,颈部肌肉紧绷,双臂张开,身体前倾呈喊叫姿态”

8.2 AI对嘴型的理解能力

能力评估 具体表现 优化策略
嘴型识别 AI能识别张嘴/闭嘴,但精细嘴型差 使用“嘴唇微张”“嘴角上扬”等具体描述
说话状态 能生成“在说话”的感觉,但嘴型可能不自然 添加氛围描述,如“交谈中”“轻声”“大声”等
同步问题 视频生成中嘴型和语言不同步 目前技术局限,尽量描述“静止说话状态”而非动态变化
口型细节 难以生成精确的音节口型 避免描述具体音节,描述整体说话感即可

8.3 说话时的肢体语言

肢体语言 描述方式 配合场景 示例
手势配合 “说话时有手势” 描述手的位置和动作 “女性一边说话一边用手比划,右手抬起至肩高,手掌张开,呈现解释说明的姿态”
眼神配合 “边说边看对方” 描述眼神方向 “男性说话时眼睛看向对方,视线在对方面部停留,偶尔点头配合”
身体朝向 “身体朝向说话对象” 描述身体轴线 “女性身体略微前倾朝向对方,肩膀跟随,头部正对,呈现专注交谈姿态”

九、特效理解

9.1 自然特效

特效类型 用户常见说法 AI实际理解 典型翻车场景 正确描述方式 示例
风 “风吹起头发” 可能生成头发像旗帜一样水平飘,或者违反物理 说“风吹头发”,结果头发垂直向上飘,像在太空 “5级侧风,头发向风向飘逸,与头部夹角约30度,衣角微扬,树叶晃动” ✅“微风轻拂,女性长发随风向右飘,与颈部约成15度角,自然飘逸”
雨 “下着雨” 可能生成雨像竖线一样均匀,或者比例失调 说“雨景”,可能雨滴像手指粗,或者从下往上落 “中雨,雨丝45度倾斜,密度适中,地面湿润反光,路人打伞” ✅“细雨,雨丝斜落30度,密度适中,空气湿润,地面有小水洼”
火焰 “火焰燃烧” 可能生成真实的物理火焰,或者漫画式火焰 说“篝火”,结果生成像蜡烛一样的小火,或者火比人还大失控 “篝火火焰,高度约1米,跳跃闪烁,木柴燃烧,火光照亮周围人脸” ✅“壁炉内木柴燃烧,火苗高约40厘米,火焰跳动,橙红色火光映照人物面部”
烟雾 “有烟雾” 可能生成浓烟滚滚,或者像示例发起人糖一样 说“烟雾缭绕”,可能生成完全遮蔽场景的浓烟,或者像云朵 “轻烟袅袅,从茶杯上方升起,烟雾稀薄透明,不遮挡人物面容” ✅“浅灰色烟雾从焚香升起,轻微缭绕,透明度60%,不完全遮挡背景”
光影 “光影效果” 可能生成过曝、或者奇怪的光斑 说“光影斑驳”,结果光斑像随机噪点 “阳光从树叶缝隙照射,在地面形成斑驳光影,光斑大小不一,形状自然” ✅“阳光穿过树叶缝隙,在地面形成圆形光斑,大小从硬币到手掌不等,自然分布”

9.2 超现实特效

特效类型 用户常见说法 AI实际理解 典型翻车场景 正确描述方式 示例
光环 “人物头顶有光环” 可能生成宗教感强金光环,或者和头部分离悬浮 说“天使光环”,结果头顶一个金色圆环,像PS贴上去的 “人物头部上方有柔和光晕,半径约15厘米,渐变透明,与头发自然融合” ✅“女性头顶有淡金色光晕,直径30厘米,透明度渐变,像自然发光而非贴图”
能量波 “释放能量波” 可能生成卡通冲击波符号,或者过于夸张 说“释放能量”,可能生成像龙珠一样的龟派气功 “从手掌向前推出的半透明蓝色能量波动,宽30厘米,向前延伸2米,逐渐消散” ✅“手掌前方半透明蓝色能量波,呈扇形扩散,宽约半米,渐变透明”
魔法效果 “魔法特效” 可能生成过度花哨、不符合魔幻风格的卡通效果 说“魔法”,可能生成五颜六色的星星和心形符号 “指尖发出紫色光束,光芒呈丝状向外辐射,空气中有点点星尘漂浮” ✅“指尖发出淡紫色光丝,向外辐射约20厘米,光丝纤细如发,带有点点星尘”
爆炸 “爆炸效果” 可能生成真实恐怖爆炸,或者卡通爆炸圆圈 说“爆炸”,可能生成像漫画的“轰”字圆形,或者过度写实恐怖 “中距离爆炸,火光橙色,烟雾灰色向四周扩散,碎片向外飞散,有冲击波感” ✅“适度写实的爆炸效果,橙红色火光,黑灰色烟雾向外翻腾,碎片四散,不过度恐怖”

9.3 AI特效理解的核心问题

问题类型 具体表现 产生原因 解决策略
字面vs比喻 “火冒三丈”生成真火,“气得冒烟”生成真烟 AI不区分比喻和字面意思 明确说“比喻义:形容愤怒程度高”或“字面意思:真实火焰”
符号化倾向 “愤怒=火焰”“开心=爱心” 训练数据中漫画/表情包过多 说“写实风格”“电影质感”“无符号化表达”
强度失控 “有点光”变成“太阳一样亮” AI倾向于生成明显效果 用精确强度词:“微弱光晕”而不是“发光”
违和感 特效和场景风格不统一 AI独立生成特效和主体 描述特效和场景的整体配合:“淡雅的薄雾笼罩”而不是“浓雾弥漫”

9.4 隐喻与字面的区分描述

表达方式 字面意思 比喻意思 描述示例
火冒三丈 头上真的着火,高度一米 极度愤怒 ✅字面:“人物头顶有真实火焰,高度约30厘米,橙红色燃烧效果”
✅比喻:“人物极度愤怒,眉心紧皱,脸部通红,面部肌肉紧绷,写实风格无火焰”
气得冒烟 身体冒烟 愤怒到极点 ✅字面:“从头顶升起灰色烟雾,袅袅上升”
✅比喻:“愤怒值达到顶点,眉头紧锁成川字,嘴唇抿紧发白,无烟雾特效”
眼睛里冒星星 眼里真的有星星 开心/迷恋 ✅字面:“瞳孔中有微型星星闪烁”
✅比喻:“眼神明亮闪烁,呈现迷恋/开心的感觉,写实风格”
心在滴血 心脏真的流血 极度悲伤/心痛 ✅字面:“胸口有血液流出”
✅比喻:“极度悲伤,眼眶通红,嘴唇颤抖,双手捂住胸口,呈心痛姿态”

十、人物面部特征

10.1 五官细节控制

五官 用户常见说法 AI实际理解 正确描述方式 示例
眼型 “大眼睛” 可能生成不成比例的大眼,或者眼型不符合整体 “杏仁眼,眼裂宽度适中,眼尾上翘约15度,黑瞳孔大而有神” ✅“杏仁形眼睛,眼裂高度约1.5厘米,眼尾上挑,黑瞳孔占眼裂70%”
鼻型 “高鼻梁” 可能生成过于突兀的鼻梁,或者和其他五官不协调 “鼻梁挺直,高度约占面部1/3,鼻翼宽度约等于眼距,鼻头圆润” ✅“鼻梁挺直,从眉间到鼻尖形成柔和弧线,鼻翼宽度与眼距相等”
嘴型 “薄嘴唇” 可能生成几乎消失的嘴唇,或者和其他特征不搭 “上唇薄约5毫米,下唇厚约8毫米,嘴角自然平直,微笑时呈弧形” ✅“女性上唇偏薄约4mm,下唇饱满约9mm,嘴唇呈自然淡粉色”
脸型 “瓜子脸” 可能生成过于夸张的锥子脸,或者脸型不对称 “倒三角脸型,颧骨宽度约12厘米,下巴尖但圆润,线条流畅” ✅“椭圆脸,颧骨微突,下巴圆润与颧骨同宽,轮廓线条柔和”
眉毛 “浓眉大眼” 可能生成过于夸张的粗眉,或者和眼型不搭 “剑眉,眉峰明显,眉尾上挑30度,眉毛浓密呈深棕色” ✅“剑眉,眉峰位于瞳孔正上方,眉头粗眉尾细,呈深褐色,长度约5厘米”

10.2 年龄感表达

年龄段 面部特征 描述方式 示例
少年感 皮肤光滑、眼睛大而亮、轮廓柔和 “面部皮肤细腻无瑕,颧骨不高,下巴微尖,眼睛大而清澈,面部轮廓柔和圆润” ✅“约18岁少年,皮肤光洁无皱纹,婴儿肥未完全褪去,眼神清澈明亮”
青年成熟 轮廓分明、眼神沉稳 “面部轮廓分明,颧骨明显,眼神沉稳有内容,皮肤略有质感” ✅“约25-30岁,轮廓清晰,颧骨分明,眼神沉稳自信,皮肤有轻微质感”
中年稳重 眼角细纹、气质沉稳 “眼角有细微皱纹,轮廓硬朗,气质成熟稳重,眼神深邃” ✅“约40岁中年,眼角有细纹但保养得当,轮廓硬朗,气质成熟内敛”
老年苍老 皱纹、松弛、斑痕 “面部皱纹纵横,皮肤松弛有斑点,头发花白,面部轮廓下垂” ✅“约70岁,面部皱纹深刻,皮肤松弛有老年斑,头发银白,面部轮廓下垂”

10.3 气质类型控制

气质类型 面部特征 描述方式 示例
英气 剑眉、高鼻、轮廓硬朗 “剑眉入鬓,鼻梁挺直,下颌角分明,眼神锐利有杀气” ✅“英气逼人,眉峰锐利,眼窝略深,目光如刀,整体轮廓硬朗”
温柔 柳眉、圆润、眼神柔和 “眉毛弯弯,眼型圆润,嘴角上扬,皮肤柔和,线条无棱角” ✅“温柔婉约,弯眉杏眼,嘴角常带笑意,面部线条柔和无棱角”
凌厉 细眉、薄唇、眼神冷 “眉峰上挑,眼睛细长,眼尾上翘,嘴唇薄紧,表情冷淡” ✅“眼神凌厉,眉峰上挑如刀,眼尾上挑,薄唇紧抿,整体气场冷峻”
憨厚 圆眼、宽鼻、嘴角厚 “眼睛圆而大,鼻翼宽厚,嘴唇偏厚,面部圆润” ✅“憨厚老实,圆眼圆润鼻,嘴角厚实带笑,面部轮廓圆润饱满”
精明 狭长眼、高颧、薄唇 “眼睛细长有神,颧骨略高,嘴唇薄而紧,法令纹明显” ✅“精明干练,眼型偏长眼神锐利,颧骨分明,薄唇紧抿”

10.4 复杂面部特征描述

期望效果 问题分析 描述方式 示例
“善良但眼神锐利” 矛盾特征难以同时表达 分开描述面部不同区域 “面部整体轮廓柔和,呈现善良感,但眼神锐利,瞳孔小而黑,目光有穿透力”
“外表冷酷内心柔软” 需要微妙的矛盾感 用细节暗示内心 “面无表情的脸部,紧绷的嘴角,但眼眶微红,眼角有泪光闪动”
“年轻的老人” 矛盾年龄感 混合年龄特征 “皮肤细腻但有细纹,眼神清澈但有沧桑感,面部既年轻又显老”

10.5 人物识别一致性

问题类型 翻车表现 解决策略 示例
同一人变脸 不同场景中人物长相完全不同 详细描述不可变特征 “深色皮肤,高颧骨,左眉有疤痕,鼻梁挺直,下巴有颗痣”
只有部分特征保留 眼睛像但脸不像 列出多个锚定特征 “方形脸,眉眼像妈妈,鼻梁直像爸爸,厚嘴唇像爷爷”
风格不一致 有时写实有时卡通 明确风格要求 “全程写实摄影风格,光线自然,无美颜滤镜”

十一、车辆/交通工具内的场景(用户痛点专项)

11.1 车内视角控制(重点!)

场景类型 用户常见说法 AI实际理解 典型翻车场景 正确描述方式 示例
驾驶座视角 “坐在驾驶座” 可能生成人在车里但位置错误,或者视角混乱 说“驾驶座自拍”,结果人坐在车顶自拍,或者方向盘在奇怪位置 “主驾驶座内视角,方向盘在前方约50厘米,双手握住方向盘,人物面部在中央后视镜上方可见” ✅“镜头置于主驾驶座椅枕高度,向前平视,方向盘在画面下方,双手握在方向盘10点和2点位置”
副驾驶视角 “在副驾驶拍” 可能生成人物在副驾驶但不在车内,或者视角不对 说“副驾驶自拍”,结果人物在车外拍车,或者在车内但比例失调 “副驾驶座视角,镜头在副驾位置,向主驾驶方向拍摄,主驾驶人物侧脸可见” ✅“镜头置于副驾驶座椅高度,向驾驶员方向拍摄,女性侧脸在主驾驶座,方向盘虚化在前景”
后座视角 “后座场景” 可能生成人物在车后但不在座位上,或者车外 说“后座自拍”,结果人物趴在车后备箱,或者悬浮在后座上方 “后座中央视角,镜头在后座中部高度,朝向前方,可以看到前排座椅后部” ✅“镜头置于后座中间位置,高度1.1米,正对前方副驾驶后脑勺,窗外街景从主驾驶车窗入镜”
透窗拍摄 “从车外拍车内” 这是最容易翻车的!可能生成人在车外、或者车窗变透明 说“透过车窗拍车内”,结果车窗变成透明玻璃,人物悬浮在车外 “镜头在车外3米处,透过左后车窗拍摄车内,车窗框架在边缘,玻璃有反光” ✅“相机置于车外左侧2米处,透过半开的车窗拍摄车内,人物在后座,车窗框完整可见”

11.2 AI车内场景理解的核心问题

问题类型 翻车表现 根本原因 解决策略
人在车外 人站在车外面,或者和车没有互动 AI理解“车”和“人”是分开的,不理解“在车内”的空间包含关系 明确描述“人在车内部”,描述身体和座椅、车窗的接触关系
穿车问题 人从车中间穿出来,或者身体穿过车门 AI没有“封闭空间”的概念 描述门的开关状态和人的位置:“车门打开,人坐在座位上”
视角混淆 车外视角和车内视角混乱 AI不理解不同视角的位置关系 明确镜头位置和朝向:“镜头在副驾驶,向主驾驶方向拍摄”
比例失调 人比车还大,或者手伸出车外比例异常 AI不维护人和车的比例关系 描述具体比例:“人物头部距车顶约20厘米”

11.3 车内姿态控制

期望姿态 AI常见问题 正确描述方式 示例
靠着车窗 可能生成悬浮的头部,或者头穿过车窗 “头部侧倾靠在车窗上,脸颊贴着玻璃,肩膀自然下垂” ✅“女性头部侧靠左车窗,脸颊贴玻璃,车窗边框在耳后,肩部在座位上”
趴在方向盘 可能生成趴在车外发动机盖上 “上半身前倾,双手撑在方向盘上,头部下垂靠近方向盘” ✅“上半身趴在方向盘上,双臂伸直,手掌压在方向盘上,头部下垂靠近双手”
躺在后座 可能生成躺在车顶,或者悬浮在后座上方 “身体蜷缩躺在后座座椅上,头枕车窗边缘,双腿蜷曲” ✅“女性侧躺在后座椅垫上,头枕车窗边缘,双腿蜷曲,手臂搭在腹部”
伏在车门上 可能生成趴在车外车门上 “身体侧面伏在车门内侧,手臂搭在车窗边框,头靠在手臂上” ✅“身体左侧伏在打开的车门上,手肘撑在门框,头部靠在手背上,面向车外”
风吹头发 可能生成头发完全水平飘动,违反物理 “侧窗微开,头发被风吹起,向后飘动约20度,自然飘逸” ✅“左侧车窗开缝,微风把左侧头发吹起约15度,发丝轻扬,未开窗一侧头发静止”

11.4 车内场景描述模板

场景类型 模板结构 示例
车内自拍(正常) [座位位置]+[身体姿态]+[镜头位置] “主驾驶座,女性手握方向盘,眼视前方镜头,镜头在副驾驶位置拍摄”
车内自拍(侧脸) [座位位置]+[面部朝向]+[镜头位置] “女性坐后座右侧,面朝左车窗,镜头在后座左侧,透过肩膀拍摄侧脸”
透过车窗拍摄 [镜头位置]+[车窗状态]+[拍摄内容] “镜头在车外左侧2米,透过半开左后车窗拍摄车内,人物在后座中央”
开车门场景 [车门状态]+[人物位置]+[身体姿态] “左后车门打开,女性身体探出车门,一半在车内一半在车外,手扶车门上框”
多人车内 [各人位置]+[相互关系] “主驾驶男性目视前方,副驾驶女性侧身向后座说话,后座两人面向对方交谈”

十二、AI视觉生成的根本性局限

12.1 五大根本局限详解

局限类型 具体表现 产生原因 技术背景
没有物理常识 穿墙、穿地、物体悬浮、不受重力 Diffusion模型的生成过程是“逐步去噪”,不包含物理引擎 AI通过统计学习生成图像,没有“物理世界”的先验知识
没有空间逻辑 前后、内外、远近混淆,透视关系错误 训练数据中的空间关系没有被结构化标注 AI从2D图像学习,缺乏3D空间理解能力
没有时间连续性 每帧独立生成,街景突变、服装变化、物体消失 图像生成模型每次只生成一张,不携带历史信息 Diffusion的随机采样过程不支持时序记忆
没有物体恒常性 苹果变香蕉、衣服变色、人物“变脸” 没有物体ID的概念,每个场景独立生成物体 生成结果的物体身份不固定
字面理解倾向 比喻变写实、隐喻变符号 训练数据中字面图像多于比喻图像 NLP的语义理解能力强,但视觉生成偏向字面

12.2 局限的底层原因分析

技术层面 具体说明 局限性
训练数据偏差 AI从互联网图像学习,图像质量参差不齐 漫画/表情包风格的夸张表达被大量学习,写实细腻表达相对较少
Diffusion原理 逐步从噪声生成图像,依赖语义匹配而非物理逻辑 生成过程是“最可能匹配文本的图像”,不检查物理合理性
注意力机制局限 模型对描述词的重要性判断不准确 可能过度关注某个词(如“火”)而忽略整体语义(“比喻义”)
缺乏世界模型 没有对物理世界的内部表征 不理解“固体不可穿透”“重力向下”“光照有方向”等常识
缺乏推理能力 生成是模式匹配,不是逻辑推理 不能通过“进屋需要走门”推理出“背对镜头进屋=身体朝外”

12.3 当前最优应对策略

局限类型 应对策略 具体操作
物理常识缺失 明确描述物理过程 不要说“进屋”,说“推门跨过门槛进入”
空间逻辑混乱 使用精确位置词 用“左侧”“右侧”“前方”“后方”,避免“旁边”“附近”
时间连续性差 每个关键帧重复描述 关键物体和人物特征在每个场景中重复描述
物体恒常性差 给物体添加标签 “那本红色封面的书”而不是“一本书”
字面理解 明确区分字面/比喻 “写实风格”“无特效”“比喻义:形容愤怒程度”

12.4 未来技术突破方向

方向 当前进展 预期效果 时间预期
视频一致性模型 Runway Gen-2、Pika、Sora等 多帧一致性提升,街景/服装变化减少 2024-2025年成熟
3D空间感知 NeRF、3D Gaussian Splatting 更准确的空间关系和透视关系 2025-2026年集成
物理引擎集成 Physics-LLM研究 AI理解重力、碰撞、摩擦等物理规律 2026-2027年突破
世界模型 具身智能研究 AI有物理世界的内部表征,理解常识 2027-2030年
物体追踪 Object ID技术 物体在生成过程中保持ID一致 2024-2025年成熟

12.5 创作者心态建议

心态 具体建议 理由
接受不完美 AI生成有随机性,不可能100%完美 技术局限决定,完美主义会让自己痛苦
迭代优化 先出粗稿再逐步细化描述 多次生成比一次到位更有效
扬长避短 AI擅长的风格多做,不擅长的少做 比如AI擅长氛围感,弱化精确动作
工具配合 AI生成+人工后期/局部重绘 取长补短,不追求AI万能
保持学习 持续关注AI能力提升,及时更新策略 AI能力快速进化,昨日局限今日可能突破

附录:常用描述模板库

A. 动作描述模板

[人物]+[身体朝向]+[动作类型]+[具体姿态]+[力度/幅度]+[方向] 示例:女性正面面对镜头,双手抬起与肩同高,掌心向上,手臂微弯呈托举状

B. 空间描述模板

[主体位置]+[与参照物的关系]+[距离]+[高度]+[朝向] 示例:人物站在门口左侧,距门框30厘米,面向室内,背对镜头

C. 情绪描述模板

[情绪类型]+[强度]+[面部细节]+[身体语言]+[风格要求] 示例:轻度悲伤,眉头内皱但未完全拧紧,嘴角下撇约10度,双肩轻微下垂,电影写实风格

D. 场景一致性模板

延续之前设定:[不可变元素列表] 变化点:[具体变化内容] 示例:延续上一场景设定:女性穿红色连衣裙、棕色手提包、黑色高跟鞋不变 变化:站立→坐在咖啡馆靠窗位置

E. 车内场景模板

镜头位置:[具体位置] 车内人物位置:[座位+姿态] 车窗状态:[开/关/开缝] 拍摄方向:[朝哪里拍] 示例:镜头置于后座中间高度,向前拍摄主驾驶,副驾驶车窗微开,车内暖光


文档版本:v1.0

最后更新:2024年

适用工具:Midjourney、Stable Diffusion、DALL-E、Sora、Runway等主流AI图像/视频生成工具

核心原则:理解AI的局限,发挥AI的优势,用精确的语言引导AI生成你想要的结果