首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

GxP-Agent:使用 LLM 代理进行可靠的临床试验编程的 Process-DAG 拓扑

摘要

arXiv:2608.16890v1 Announce Type: new Abstract: Clinical trial programming -- transforming study protocols into analysis-ready datasets under CDISC standards -- is a bottleneck in regulatory submissio...

DAG the under with GxP agent and variables structural match
2026-08-19 1 阅读 约2分钟阅读 Jaime Yan
分享:
字号:
arXiv:2608.16890v1 公告类型:新 摘要:临床试验编程——根据 CDISC 标准将研究方案转化为可供分析的数据集——是监管提交的瓶颈,但基于 LLM 的代码生成在这项任务上遭遇了灾难性的失败:在使用 5 个前沿模型的 11 次单次尝试中,没有一个能够生成有效的受试者级分析数据集。我们引入了 GxP-Agent,这是一个多代理系统,它将监管流程排序编码为有向无环图 (DAG),将整体数据集生成分解为 15 个特定于域的节点,由具有 pharmaverse 技能上下文、验证门和条件重试的工作代理执行。 CDISC-Bench 是根据 FDA 试点提交文件 CDISSCPilot01(254 个受试者,49 个真实 ADSL 变量)构建的新的基于执行的基准,GxP-Agent 与 Claude Sonnet 4.6 在三个独立运行中实现了 100% 结构匹配(49/49 变量,254 个正确记录),而最佳检索增强基线为 59.2%,所有单代理为 0%和扁平多代理方法。 DAG 拓扑还支持较弱的模型:GPT-4.1 在相同 DAG 下实现了 59.2% 的平均结构匹配,而在所有其他架构下得分为 0%。该方法推广到 ADAE(不良事件;9 节点分支 DAG、55 个变量、1,191 条记录),第一次尝试就实现了 100% 的结构匹配。这些结果表明,将领域过程知识编码为图形拓扑(而不是单独依赖 LLM 推理)是可靠、符合 GxP 的临床试验编程的关键推动因素。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱