论文arxiv cs.LG · 2w ago需要关注

CARPRT: Class-Aware Zero-Shot Prompt Reweighting for Black-Box Vision-Language Models

分类释义:学术论文 / 技术报告

TL;DR

CARPRT 提出对 VLM 零样本分类中的 prompt 集成进行类别感知加权,不同于传统方法统一分配权重,它根据每个 prompt 对特定类别的相关性动态调整权重,无需训练。

关键要点

  • 01CARPRT 提出对 VLM 零样本分类中的 prompt 集成进行类别感知加权
  • 02不同于传统方法统一分配权重
  • 03它根据每个 prompt 对特定类别的相关性动态调整权重
为什么值得关注

在 CLIP 等 VLM 的零样本分类场景中,prompt 选择对准确率影响显著但往往被忽视。CARPRT 只需对每个类别统计各 prompt 下的图像-文本相似度均值即可,无需微调或额外数据,工程落地成本极低。可以直接替换现有 CLIP 的零样本分类 pipeline,提升约 2-3 个百分点,适合做 baseline 改进的快速尝试。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead评估将 CARPRT 纳入团队 VLM 分类 pipeline 的可行性,重点关注 2-3% 准确率提升是否满足业务阈值
应用工程师将现有 CLIP zero-shot 分类代码中的 prompt 集成部分替换为类别感知加权实现
运维 / 平台暂无直接影响,了解即可
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.LG

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5