智能AI
morning
LLM 还是朴素贝叶斯?老宝石还是新方法
摘要
arXiv:2609.13185v1 Announce Type: new Abstract: Large language models (LLMs) prompt a recurring question in research computing: should classical methods like Naive Bayes (NB) be retired? We benchmark ...
the
and
zero
LLM
shot
data
LLMs
model
classification
sentiment
2026-09-15
1 阅读
约2分钟阅读
Mohammad Firas Sada, Dmitry Mishin, John Graham, Seungmin Kim, Mahidhar Tatineni, Frank W\"urthwein
字号:
arXiv:2609.13185v1 公告类型:新 摘要:大型语言模型 (LLM) 提出了研究计算中反复出现的问题:朴素贝叶斯 (NB) 等经典方法是否应该退役?我们将补朴素贝叶斯与跨越四个模型系列和跨文本分类任务的 37 倍规模范围(27B 到 1T 参数专家混合)的零样本和少样本 LLM 进行基准测试。 LLM 仅在零数据制度中占主导地位(在 Amazon Polarity 情绪上为 98.0% vs 88.2%),即使这种胜利也容易受到污染:在低污染情绪任务中 NB 击败了零样本 LLM(81.7% vs 73.0%)。然而,一旦标记数据可用(例如,AG News),NB 的准确率达到 89.1%,在统计上与零样本 27B LLM (89.0%) 没有区别,并且优于 397B 前沿模型 (84.8%),在商用 CPU 上每秒数千个样本。微调后的 DistilBERT 达到 90.6%,但在批量大小为 1 时吞吐量远低于 NB(表 2)。我们测量的 GPU 吞吐量分析显示,小型 LLM 批量推理比 NB CPU 推理慢 40-486 倍(倍数很大程度上取决于主机 CPU),暴露出受内存带宽限制的结构性差距,每个样本的能量大约低两个数量级。对于资源有限的 HPC 从业者使用标记数据执行文本分类来说,NB 仍然是最佳选择。我们展示了决策线是依赖于任务的(NB 在主题分类方面达到了大约 $N \sim 10^4$ 标签的 LLM 同等水平,而零数据情绪在所有 N 个测试中都支持 LLM),并提供了一个 Kubernetes Helm 运算符,该运算符使用可配置的阈值和可验证的 Prometheus 指标来自动选择模型。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱