Sep, 2022
视觉-语言模型中零-shot泛化的测试时提示调整
Test-Time Prompt Tuning for Zero-Shot Generalization in Vision-Language
Models
TL;DR本文提出一种叫做测试时提示调整 (TPT) 的方法,可在单个测试样本上实时学习适应性提示,优化提前提供的CLIP模型动态调整提示, 以最小化模型预测时的不确定度,提高CLIP模型的泛化能力。实验结果表明,TPT方法在自然情况下的zero-shot top-1准确率比以往方法的提升3.6%,并达到了使用额外培训数据的最新先进方法的性能水平。