首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

基米K3是什么? 2026 年完整开发者指南

2026-08-14 1 阅读 约8分钟阅读 makaimc
分享:
字号:
TL;DR Kimi K3 是 Moonshot AI 的全新 2.8 万亿参数开源模型。截至 2026 年 8 月,它是发布的最大的开放权重模型,每个代币有 104B 个活跃参数,涉及 896 位专家。它支持 1,048,576 个令牌上下文窗口(正好是 Kimi K2.7 代码的 4 倍)。它可以本地处理文本、图像和视频。 Kimi K3 在基准测试中与 Claude Fable 5 和 GPT-5.6 Sol 等前沿专有模型进行了正面交锋。您可以通过 Hugging Face、OpenRouter、Fireworks AI、Baseten、Together AI 或 Moonshot 自己的平台访问它。大多数第一方提供商对每 100 万个代币收取相同的 3 美元/15 美元的费用,而 OpenRouter 的最便宜的路线低于他们。自托管在技术上是可行的,但“可能”意味着至少 8 个企业级加速器和高达六位数的硬件费用。加密矿工甚至没有足够的硬件来运行 K3。我们让 Kimi K3 在 OpenCode 中运行,并使用 Firecrawl MCP 为其提供实时 Web 访问。 Firecrawl MCP 扩展了 Kimi K3 的知识库并使其能够访问实时网络数据。基米K3是什么? Kimi K3 是 Moonshot AI 最新的开放权重模型,也是截至 2026 年 8 月发布的最大模型,参数达 2.8 万亿个。它继承了 Kimi K2.7 Code,可以原生读取文本、图像和视频,并在单个上下文窗口中保存多达 1,048,576 个令牌。 Moonshot于2026年7月16日开放API访问,然后于7月27日发布了完整权重。Kimi K3的规格是什么? Kimi K3 拥有一些令人印象深刻的规格,特别是对于开源型号而言。 Kimi K3 拥有 2.8 万亿个参数。 GLM-5.2 和 Kimi K2.7 Code 等模型的范围从大约 7000 亿到刚刚超过 1 万亿。其架构为Kimi K3在执行不同任务时提供了896个不同的专家。它还拥有超过 1,000,000 个令牌的上下文窗口。 Kimi K2.7 Code 的上下文窗口仅为 262,144,因此 K3 将其增加了四倍。 Kimi K3原生支持文本、图像和视频。参数总数:每个代币 2.8 万亿个激活参数:104B 架构:专家混合 (MoE),稳定 LatentMoE 专家数量:总共 896 个,每个代币选择 16 个,2 个共享层:93(69 KDA + 24 门控 MLA,1 个密集层) 上下文窗口:1,048,576 个代币 量化: MXFP4 MoE 专家权重/MXFP8 激活,从 SFT 开始进行量化感知训练(非专家组件保持更高的精度) 模态:文本、图像和视频(原生);视觉编码器 MoonViT-V2(401M 参数)许可证:自定义“Kimi K3 许可证”(不是普通的 MIT)这些统计数据来自 Kimi K3 的 Hugging Face 页面。 Moonshot 的 Kimi K3 技术报告称赞其架构和训练变化,包括 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE,总体扩展效率比 Kimi K2 提高了约 2.5 倍。 Kimi 的权重于 2026 年 7 月 27 日发布,您可以在下面 Kimi.ai 的 X 帖子中看到。 Kimi K3 编码基准 在 Moonshot AI 的技术博客上,他们浏览了 Kimi K3 的基准,这些基准也与前沿专有模型相当。本节中的每个数字都来自该博客。其中一些在 arXiv 技术报告中略有变化,该报告在发布后进行了修订,因此如果特定分数对您很重要,则值得检查两者。来源:https://www.kimi.com/blog/kimi-k3 DeepSWE:几乎与 GPT-5.5 持平,只是勉强以 67.5 比 67.0 领先。 Kimi K3 仅落后于 GPT-5.6 Sol (73.0) 和 Claude Fable 5 (70.0)。 FrontierSWE:以 81.2 分击败 GPT-5.6 Sol、GLM-5.2、Opus 4.8 和 GPT-5.5,仅次于 Claude Fable 5(86.6)。 Kimi Code Bench 2.0(内部):以 72.9 分排名第二,落后于 Claude Fable 5 (76.9)。 Terminal Bench 2.1:以 88.3 分几乎追平 GPT-5.6 Sol (88.8),位居第二。 Program Bench:以 77.8 的分数击败所有其他模型,包括 GPT-5.6 Sol (77.6)。 SWE Marathon:得分 42.0,击败所有其他测试模型。值得注意的是,《克劳德寓言 5》在其中 35% 的任务中遇到了安全带回退,导致其 35.0 下降。 Kimi K3 总代理性能 来源:https://www.kimi.com/blog/kimi-k3 GDPval-AA V2 Elo :落后于 Fable 5 和 GPT-5.6 Sol,击败所有其他模型。 AA-Briefcase Elo :获得第二名(1548),仅次于克劳德寓言 5(1583)。 Automation Bench:击败所有其他模型(30.8)。最接近的亚军是 GPT-5.6 Sol (29.7)。 JobBench:排名第二(52.9),落后于克劳德寓言 5(57.4)。 SpreadsheetBench 2:以 34.8 的分数击败所有其他模型。克劳德·法布尔以34.7分位居第二。 BrowseComp:以 91.2 的分数优于所有其他模型。 GPT-5.6 Sol 以 90.4 排名第二。 91.2 使用上下文压缩策略;在完整的 1M 窗口和无上下文管理的情况下运行,K3 得分为 90.4,与 Sol 持平。 Kimi K3 视觉代理性能 来源:https://www.kimi.com/blog/kimi-k3 Kimi K3 在两项测试中均落后于 Claude Fable 5,并且两组数字都是 Python 工具辅助运行的。在使用 Python 的 CharXiv (RQ) 上,Kimi K3 得分为 91.3,而《神鬼寓言 5》的得分为 93.5。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱