智能AI
morning
当基准推论不成立时:人工智能评估中的可预测性
2026-08-01
1 阅读
约1分钟阅读
Brett Reynolds
字号:
arXiv:2607.26159v1 公告类型:新 摘要:人工智能基准测试结果很少能一步达到相应的要求。评估人员将其推广到更多案例,将其解释为能力的证据,将其推断到新任务,将其传输到另一个系统或站点,并将其与有关人工审查和下游后果的假设相结合。以有效性为中心的方法需要为每项主张提供证据。本文指出了一个进一步的认知问题:有保证的链接不会自动形成有保证的链。一项研究的目标可能不是下一项研究的来源;系统、人口、结果或条件可能会在界面发生变化;共享数据或模型谱系可能会使明显独立的支持依赖。可投射性涉及是否有必要从观察到的情况扩展到未观察到的情况。古德曼解决了竞争对手扩展的问题;基于论证的有效性提供了测试它们的架构。该论文的独特主张是非组合原则:只有当端点和假设一致并且依赖和不确定性得到实现时,对相邻预测的支持才能保证其组合。一个法律研究案例展示了基准证据和部署研究如何在保持平行的同时保持合理。重新分析和模拟表明了为什么总体稳定性可以消除以后预测所需的区别。生成的可投影性审核会诊断基准使用参数中不受支持的连接。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱