首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

消除档案文物中的算法偏差:对大都会博物馆档案馆视觉语言模型评估的受控审计

摘要

arXiv:2609.17572v1 Announce Type: new Abstract: Auditing vision-language models (VLMs) for societal bias requires distinguishing direct algorithmic valuation disparities from confounders embedded with...

and CLIP zero shot equivalence models bias valuation from archival
2026-09-17 1 阅读 约2分钟阅读 Manpreet Singh, Rhythm Bhatia, Rahul Joshi
分享:
字号:
arXiv:2609.17572v1 公告类型:新 摘要:审计视觉语言模型 (VLM) 的社会偏见需要区分直接算法评估差异和嵌入档案元数据中的混杂因素。在本研究中,我们使用大都会艺术博物馆开放获取收藏中的历史艺术品元数据审核对比语言图像预训练 (CLIP) 模型(N = 1,500 件总物品;N = 743 件归属作品:男性 n = 534,女性 n = 209;n = 618 件匿名作品)。我们建立了一个定量审核框架,评估三个语义提示对(杰作、质量和影响力)的零样本 CLIP logit 差异分数。未经调整的评估表明,在 OpenAI CLIP(mu_F = -0.0067 vs mu_M = -0.0035,p = 0.1829)或 OpenCLIP(mu_F = 0.0171 vs mu_M = 0.0237,p = 0.1224)下,分数收敛,并且没有统计显着的主要性别影响。两个单侧检验 (TOST) 确认 Cohen d >= 0.25 范围内的统计等效性 (pTOST < 0.005)。控制艺术品媒介、创作时代和纵横比的多元 OLS 回归 (R^2 < 0.02) 证实艺术家性别没有统计上显着的条件影响 (p > 0.20)。高残差嵌入方差(R^2 < 2%)表明全局零样本估值指标在嵌入噪声基底附近运行,表明广泛的零样本提示 Logit 差异是一种粗略的测量工具,而不是证明绝对模型公平性。我们强调两个关键警告:(i)宏观层面的分数等价反映了对细粒度视觉语义特征的度量不敏感,并且不排除局部微观层面的视觉偏差,(ii)排除 41.2% 的未归属持有反映了机构生存偏差。这些结果证明了在评估文化遗产收藏中的人工智能公平性时,多元混杂控制、等价性测试和档案来源审计的必要性。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱