首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

BrainBench:对大型语言模型进行基准测试以实现全面的脑电图理解

摘要

arXiv:2608.04156v1 Announce Type: new Abstract: Electroencephalography (EEG) analysis extends beyond assigning predefined labels to recordings; it requires workflows connecting natural-language instru...

and EEG with analysis understanding the recordings language comprehensive tasks
2026-08-06 1 阅读 约1分钟阅读 Yangxuan Zhou, Sha Zhao, Yuning Chen, Chen Wu, Jiquan Wang, Shijian Li, Gang Pan
分享:
字号:
arXiv:2608.04156v1 公告类型:新 摘要:脑电图 (EEG) 分析的范围超出了为录音分配预定义标签的范围;它需要连接自然语言指令、信号处理、定量证据和科学解释的工作流程。我们将这种能力称为\emph{全面的脑电图理解}。然而,现有的评估主要针对孤立的解码任务或特定于系统的演示,使得大型语言模型(LLM)的能力没有得到充分量化。我们引入 \benchmarkname{},这是一个用于全面、指令条件脑电图理解的统一基准。它包含四个子集——基础分析、睡眠评估、神经认知评估和生理整合——涵盖 17 个数据集、\numcases{} 任务和超过 \numinstances{} 个真实数据实例。给定指令和带有可选生理信号的脑电图记录,系统必须执行分析并生成有科学依据的报告,并在需要时生成伪影。通过数值、分类、集合、序列、语义和工件验证来评估输出。我们在两种范式下评估了超过 100K 次执行中的 \nummodels{} 代表性 LLM:使用 CodeAct 的自主代码执行和使用 BrainAgent 的结构化代理分析。不同模型、子集、难度级别和执行范例的结果差异很大,这表明脑电图能力取决于模型及其操作。 \benchmarkname{} 提供了一个可重复的测试平台,用于推进基于 LLM 的脑电图理解。代码和基准测试即将发布,评估结果持续更新。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱