首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

Token账单异常,可能不只是成本失控

2026-09-15 1 阅读 约7分钟阅读 Akamai
分享:
字号:
随着生成式AI从试验走向规模化部署,企业开始关注模型调用量、推理成本和投资回报率。但在Akamai大中华区副总裁张珂看来,Token成本不应只被视为财务问题,它也可能是识别AI安全事件的重要信号。 在近日的一场分享中,张珂表示,许多企业已经接入第三方大模型,或者建设了自有推理服务,却仍然缺少Token级别的成本观测能力。 当调用量异常增长时,企业往往只能看到月底账单上升,却难以及时判断这些Token究竟来自正常业务增长、低效应用设计,还是API被盗用和恶意攻击。 根据Akamai《2026年AI推理现状报告》,77%的受访企业缺乏一致的推理成本单位经济效益指标,尚未建立按Token、单次查询或具体业务任务统计成本的统一方法。 这种“看不见”,一方面可能使AI项目的真实投入高于预期,另一方面也会削弱企业发现异常调用的能力。 Token异常消耗,可能对应一场安全事件 传统互联网应用遭遇攻击时,异常流量往往首先表现为带宽、请求数或服务器负载上升。进入大模型应用后,每次请求还会触发推理计算,攻击者不仅可以占用网络资源,也可能直接消耗企业购买或部署的模型算力。 张珂重点提到了一种被称为“拒绝钱包攻击”(Denial of Wallet,DoW)的风险。它与传统拒绝服务攻击类似,但目标不是单纯让服务宕机,而是通过大量请求、复杂提示词或反复调用模型,持续推高受害企业的Token消耗和云服务账单。 如果模型API缺乏访问控制,攻击者还可能盗取密钥或Token通道,借用企业账户调用模型。对于电商客服、内容生成和智能搜索等对外开放的AI应用,一旦接口暴露或凭证泄漏,企业购买的推理能力就可能被用于处理与自身业务无关的任务。 AI爬虫也带来了类似变化。传统爬虫主要消耗网站带宽和服务器资源,而具备智能体能力的爬虫可能反复抓取内容、触发检索增强生成流程,甚至与客服机器人连续对话。表面上只是请求数量增加,背后却可能引发多轮模型推理,使单次访问的成本远高于普通网页抓取。 因此,Token消耗异常激增具有双重含义:它既可能代表成本管理失效,也可能是一项安全警报。企业如果只在财务结算时检查账单,就很难在攻击发生期间采取措施。 从月底核算转向实时管控 针对上述问题,张珂认为,Token管理需要从财务统计前移到应用和基础设施架构中。 首先是建立推理可观测性。企业需要为每次模型请求记录模型类型、输入与输出Token数量、调用应用、用户身份及业务场景等元数据,并根据部门、项目和模型分别统计成本。这样才能判断Token具体消耗在哪里,以及调用量增长是否与实际业务相匹配。 其次,可以通过AI网关统一管理不同推理入口。目前,企业内部的AI调用可能分散在第三方模型、自建模型和多个Token平台中。如果缺少统一入口,权限、账单和调用记录就很难形成完整视图。 AI网关可以记录用量、设置调用额度,并通过语义缓存减少内容相近的重复推理。对于员工自行使用外部模型形成的“影子AI”,企业也可以设置身份验证、调用范围和使用上限,避免缺乏授权的应用持续消耗Token或者传输敏感数据。 在身份认证方面,Akamai提出使用Web Bot Auth等机制验证AI Bot和智能体的身份。其基本思路是,不再仅凭User-Agent等容易伪造的信息识别爬虫,而是通过更可靠的身份凭证判断访问者是否为其所声称的Bot,减少仿冒智能体进入模型接口或盗用推理资源的可能性。 不过,技术管控也需要平衡安全性与可用性。过于严格的限额可能影响正常业务,语义缓存则需要处理数据时效性和隐私边界。企业仍需结合业务风险,决定哪些请求可以缓存、哪些操作必须实时推理,以及出现何种异常时自动限流或要求人工确认。 不同任务不一定都要使用GPU 除控制外部模型调用外,Akamai还建议企业评估自建推理能力,以降低对单一Token平台的依赖。 张珂表示,模型部署不应默认等同于使用高端GPU。对于计算量有限、实时性要求不高或处于验证阶段的任务,CPU也可能满足需求;当业务量扩大或者模型复杂度提高后,再切换到GPU。企业需要根据任务规模、时延和成本选择算力,而不是让所有AI工作负载采用同一种配置。 Akamai Cloud目前已引入NVIDIA Blackwell GPU,并针对后训练等场景采用RTX PRO 6000。与此同时,Akamai与NVIDIA推出AI Grid框架,通过编排层决定模型和请求应当运行在哪个节点,尝试将部分推理部署到距离用户更近的位置。 Akamai称,其分布式网络覆盖130多个国家和700个城市,拥有4000多个网络接入点。对于实时交互、内容审核和本地化服务等场景,边缘部署有机会减少数据往返远端数据中心产生的时延,但实际成本仍取决于模型规模、节点利用率和业务请求分布。 Akamai列举的案例显示,专利检索服务商GoVeda在早期使用CPU推理,随后根据需求切换至GPU并采用分布式部署。按照Akamai提供的数据,该方案使性能提高30%、成本降低20%。通信平台SARV迁移部分工作负载后也降低了运营成本,但分享中未披露具体幅度。 从这些实践来看,AI成本管理正在从“选择哪一个模型”扩展为一项系统工程。企业不仅需要比较Token单价,还要追踪调用来源、识别异常消耗,并在模型、CPU、GPU和不同部署位置之间进行调度。 当Token成为企业持续采购的计算资源后,一笔突然增加的账单可能意味着应用增长,也可能意味着接口遭到盗用。能否解释每一个Token从哪里来、由谁调用并服务于什么业务,正在同时成为AI成本治理和安全治理的基础。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱