首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

Qwen 3.8 27B 在 Cerebras 上可用,速度为 1500 个代币/秒

摘要

Models on Cerebras public endpoints are available on the free trial and pay-as-you-go tiers, subject to rate limits and pricing . For additional model families, reserved capacity, higher throughput, a...

are the model models and our public endpoints available for
2026-09-04 1 阅读 约3分钟阅读 altertable
分享:
字号:
Cerebras 公共端点上的模型可在免费试用和即用即付级别上使用,但须遵守速率限制和定价。有关其他型号系列、预留容量、更高吞吐量和生产 SLA,请参阅专用端点。新来的?按照快速入门进行首次 API 调用。要按用例选择模型,请参阅模型选择指南。选择下面的任何型号名称,了解完整规格、功能和每层限制。 ​ 可用型号 型号名称 型号 ID 参数 上下文(免费/付费) 速度(代币/秒) OpenAI GPT OSS gpt-oss-120b 1200 亿 65k / 131k ~3000 Qwen 3.8 27B qwen-3.8-27b 270 亿 64k / 128k ~1500 寻找更多型号?许多其他模型系列可通过专用端点获得。 ​ 模型压缩本节提供有关我们平台上可用的每个模型的压缩状态的透明度。我们托管来自社区的各种开源模型。我们目前不在公共端点上托管修剪后的模型。通过我们的公共端点提供的所有模型都是原始的、未经修剪的版本。虽然我们对 REAP(路由器加权专家激活剪枝)等剪枝技术进行研究,但这些剪枝模型与 Hugging Face 上的研究社区共享,但无法通过我们的共享 API 获得。您可以在我们的研究博客中阅读有关 REAP 的更多信息。我们所有的公共模型都未经修剪。 Cerebras 仅在存储期间使用选择性仅重量量化,以保持最大质量。这意味着权重以部分 16 位/8 位/4 位存储,符合行业标准。为了保证质量,敏感层以全精度存储并动态去量化,因此操作可以高精度完成。激活、注意力和 kv 缓存保持完全精度且未量化。 ​ 常见问题 您会在没有通知的情况下更改模型的架构吗?不会。我们致力于为所有现有端点提供原始模型,无需修改。我们不会通过修剪我们的托管投资组合来改变模型架构。如果我们将来探索其他压缩技术(例如修剪),这些技术将作为具有修剪特定名称的单独端点提供,确保完全透明并允许您选择最适合您需求的版本。我在哪里可以找到你们的 REAP 修剪模型?我们的 REAP 修剪模型可在 Hugging Face 上用于研究和实验目的:Cerebras REAP Collection。这些模型展示了我们的修剪研究,但不通过我们的生产 API 提供服务。什么是压缩、量化和修剪?压缩是减少模型大小或计算要求的技术的总称。常见的压缩技术包括: 量化:降低用于表示模型权重的数字的精度(例如,从 FP16 转换为 FP8)。这可以在不改变模型架构的情况下减少内存使用。修剪:永久删除模型的某些部分,例如图层或专家,以减小模型大小。这改变了模型的架构并创建了不同的模型。此页面有帮助吗? ⌘ 我
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱