工作流提示词 / 工作流已发布

DeepMind 视觉提示工程(VIPE)自动三阶段工作流

Google DeepMind 提出视觉提示工程(VIPE),将提示词工程从文本扩展至图像重绘领域。该自动化三阶段工作流显著提升了视频大模型在复杂物理与空间推理任务中的准确率。

AI工作流Visual Prompt EngineeringVideo ModelsDeepMind
工作流

核心提示词

你是一个视觉提示词规划器(VLM Planner)。请根据输入的任务图片和视觉推理需求,生成图像修改指令。

输入条件:
1. 原始图像类型:{{image_type}}
2. 目标模型逻辑需求:{{reasoning_task}}
3. 转换策略(自由构思 Free-form 或 原子概念编辑 ACE):{{transformation_strategy}}

生成要求:
- 仅针对图像的视觉表现形式(如质感、光照、写实度)提出重绘指令,绝不能改变图像中的物理几何关系、物体相对位置或空间约束。
- 明确指出需要调整的元素和需要保留的几何边界。

输出格式 JSON:
{
  "rewrite_instruction": "<详细的图像编辑 prompt>",
  "preserved_constraints": "<需要保持绝对不变的空间与几何约束描述>"
}

适用场景

视频大模型在进行物理推理(如预测球体运动轨迹)和空间几何推理时,常因输入草图或线框图过于抽象而出现推理错误。Visual Prompt Engineering (VIPE) 框架通过自动修改任务图像(如将抽象线稿转换为逼真场景),在保持空间约束和任务逻辑不变的前提下提升视频模型的推理表现 [1][3]。

工作流步骤

  1. 规划阶段(Planner):由视觉语言模型(VLM)读取原始抽象图像与任务要求,依据自由构思(Free-form)或原子概念编辑(ACE)策略,生成图像重绘编辑指令,同时明确不可变更的空间约束 [1][2]。
  2. 执行阶段(Editor):图像编辑模型接收重绘指令与原始图像,生成高保真度的逼真视觉图像,确保在增强纹理与光影的同时不破坏原始物理几何关系 [1][3]。
  3. 过滤阶段(Filter):自动评分器对编辑后的图像进行评估与筛选,剔除改变了物理空间或几何结构的无效图像,最终将高质量视觉提示提交给视频大模型(如 Veo 3.1)执行推理 [1][3]。

变量说明

  • image_type:原始任务图像的类型,例如抽象线条画、二维平面草图或示意图。
  • reasoning_task:视频模型需要执行的具体推理任务,例如球体运动轨迹预测、碰撞反射分析等。
  • transformation_strategy:视觉转换策略,可选 Free-form Conceptualization(自由构思)或 Atomic Concept Editing(原子概念编辑 ACE)。

使用方法

将原始任务图片与配置参数输入至 VLM 规划器,获取编辑指令后提交给图像生成/编辑模型。通过评分筛选机制剔除几何失真结果,最后将加工后的逼真图像输入视频大模型进行推理。在物理推理任务中,单样本 Veo 3.1 的准确率可从 41.3% 提升至 59.3%,结合测试时采样更可达 68.0% [1]。

质量检查

  • 几何一致性校验:检查编辑后的图像是否破坏了原始草图中的物体系数、相对位置或空间角度,若发生偏移则判定为失败样本。
  • 模型依赖风险监控:防止图像编辑模型因过度拟合美观度而添加干扰推理的无效视觉元素 [3]。
  • 降级防御:若经过 VIPE 处理后模型推理准确率异常下降,检查是否由于图像编辑阶段改变了物理约束条件 [3]。

参考来源

  • arXiv / Google DeepMind (2026-07-28): Visual prompt engineering for video models [1]
  • Hugging Face (2026-07-29): Visual prompt engineering for video models [2]
  • 36Kr (2026-07-30): Google DeepMind Proposes Visual Prompt Engineering [3]