BriefGPT.xyz
Ask
alpha
关键词
region-specific comprehension
搜索结果 - 1
构建大型多模态模型理解任意视觉提示
该研究介绍了一种新颖的多模态模型,可以解码任意视觉提示,通过在 RGB 图像上直接叠加视觉标记的方式,实现了对特定区域的理解,在区域理解任务上取得了最先进的性能,并提出了 ViP-Bench,一个综合评估模型在理解多个维度上的视觉提示能力的
→
PDF
7 months ago
Prev
Next