头版Folia Daily Briefing
← 返回头版
科技人工智能

Google DeepMind提出"视觉提示工程"新方法,性能超越文本指令

Google DeepMind推出了名为"视觉提示工程"(VIPE)的新范式,将提示工程应用从语言模型扩展至视觉领域 [1]。该方法通过将抽象图像转换为更真实的视觉场景来优化视频模型的推理性能 [1]。

在多项性能测试中,视觉提示工程的效果往往超越传统的文本提示工程 [1]。以Veo 3.1为例,其准确率从41.3%提升至59.3% [1];Omni Flash则从56.3%提升到67.5% [1]。在自由形式视觉提示工程的应用中,部分任务的错误率下降超过75% [1]。不过在Sort 3 Numbers任务上呈现不同表现,最优文本提示的准确率达到86%,而最优图像提示为76% [1]。

这一新方法包含构想器、编辑器、筛选器三个步骤 [1]。


视觉提示工程Google DeepMind视频模型提示工程视觉推理