智能AI
morning
一张3090就能跑!全栈国产模型,把AI办公搬到企业本地
摘要
一张3090就能跑!全栈国产模型,把AI办公搬到企业本地 henry 2026-09-20 20:22:41 来源: 量子位 henry 发自 凹非寺 量子位 | 公众号 QbitAI AI办公这块蛋糕,中国电信可能要先切走一块了。 这个夏天,大厂们集体加注AI办公。卷Agent能力,卷工作入口,卷企业工作流,Coding之后,办公成了Agent的下一个必争之地。 但就在大伙忙着抢入口的时候,还有...
29B
Xing4
henry
量子位
数据全程不用离开企业环境
调用工具
一张3090就能跑
全栈国产模型
把AI办公搬到企业本地
2026
2026-09-20
1 阅读
约9分钟阅读
henry
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 一张3090就能跑!全栈国产模型,把AI办公搬到企业本地 henry 2026-09-20 20:22:41 来源: 量子位 henry 发自 凹非寺 量子位 | 公众号 QbitAI AI办公这块蛋糕,中国电信可能要先切走一块了。 这个夏天,大厂们集体加注AI办公。卷Agent能力,卷工作入口,卷企业工作流,Coding之后,办公成了Agent的下一个必争之地。 但就在大伙忙着抢入口的时候,还有一批企业,连门都没进去。 原因现实得很扎心。他们数据不能出域,模型最好就地部署,手头算力又不算富裕。可偏偏,长文档要读,复杂业务要办,该干的活一样不少。 中国电信AI这次最新开源的 Xing4.0-29B-A4B ,瞄准的就是这批需求。 而且,这次带来的还是一款 全栈国产化的轻量级代码智能体大模型 。从国产芯片、国产训练框架,到模型训练和推理部署,整条技术链路都做了系统适配。 为了尽可能实现本地部署,Xing4.0-29B-A4B采用 MoE 架构, 290亿 的总参数,每次推理只激活约 40亿 参数,经过4-bit量化后,一张 RTX 3090 就能运行。 当然,跑起来只是第一步。 企业真正关心的,还是这张显卡上的模型,到底能干多少活。 比如,处理重要文档时,模型可以直接在本地完成内容理解、指标提取和信息整理,数据全程不用离开企业环境。 再比如,一份200页的投标文件交过来,模型能在本地用约20分钟,完成技术、商务、价格三个方面的初评,并逐条给出评分依据。 更进一步,它对本地部署的考虑,也不只停留在消费级显卡上。 Xing4.0-29B-A4B完全基于 华为昇腾910C算力 训练,并采用国产的 MindSpore/MindFormers训练框架与开发套件 ,真正实现了 国芯训国模 。 在推理部署端,它还完成了昇腾的适配验证。可以说,从训练到落地,国产算力这条路也已经走通。 目前,模型已经在GitHub、Hugging Face、Gitee、魔搭、魔乐等平台开源上线,并同步支持API调用。 值得一提的是,截止发稿,Xing4.0-29B-A4B现在已经冲进HuggingFace模型趋势榜单,位居第四。 感兴趣的朋友,可以直接用起来了。 (相关链接在文末) 既要跑得动,也要真的能干活 老实说,把模型装进一张显卡,和让它稳稳接住企业的日常工作,中间还隔着不少事。 毕竟,企业交过来的任务,很少只有一句问答那么简单。 一份文档读完了,可能还要提取信息、调用工具、核对结果,最后整理成一份能交出去的材料。 更何况,这些活每天都要干,不但要考虑稳定性,还要考虑性价比。 要满足这些要求,既要继续压低部署和运行成本,也得把干活的能力练扎实。后者,正是Xing4.0-29B-A4B这次重点加强Coding和Agent能力的原因。 先说Coding。 过去,百亿参数模型写代码,一个常见的问题就是写个函数、补几行代码还行。 可一旦把整个代码仓库交过去,要求它解决一个真正的工程问题,事情就没那么顺了。 因为它需要先看懂项目结构,跨文件追踪接口调用,再结合文档、日志和历史上下文定位问题。改完之后,还得验证修改有没有用,会不会影响其他地方。 代码只是最后写出来的那一部分,前面还有一长串工作要做。 针对这个老大难问题,Xing4.0-29B-A4B这次把Coding能力,从「写片段」进一步推向了「干工程」。 它原生支持 256K上下文,并可扩展至512K ,让一次任务能够装下更长的代码、文档、日志和历史记录,为理解整个项目提供空间。 比如,要把分散在Excel里的合同台账做成管控大屏,需要的就不只是一个画图函数。 模型还要理解表格里的业务数据,将合同概览、金额分布、风险识别和履约预警等需求,组织到同一个页面中。 这里既涉及数据理解,也涉及代码生成和功能组织,需要结合前后的信息完成开发。 Xing4.0-29B-A4B可以在企业本地,将这些合同台账转化为可视化管控大屏,数据全程不用离开企业环境。 而到了Agent这边,要求还要再往前走一步。 理解需求之后,模型得自己拆解任务、安排执行顺序、调用工具,再根据中间结果决定下一步怎么做。 一路做下去,直到交付一个可以验收的结果。Xing4.0-29B-A4B针对这类长程任务做了专项强化。 比如,用户一次说清需求后,模型可以判断哪些步骤先做、哪些可以并行,再调用天气、日程、提醒、出行等不同工具或Agent,把任务继续推进。 但模型自己会干活了,企业就能直接用起来吗? 还差一步,接进现有工作流。 企业已经在用的开发工具、Agent框架和部署平台,都得接得上。否则,光是换一套环境,就可能先多出一堆工作。 为此,Xing4.0-29B-A4B已经针对OpenCode、Claude Code、OpenClaw、Hermes等主流Agent、Harness框架完成定向适配,同时兼容LLaMA-Factory、MindFormers、SGLang、vLLM、KTransformers等常用工具链,降低接入现有开发环境的门槛。 当然,对于我们开头提到的那批企业来说,还有一个绕不开的现实约束: 数据不能出域,算力也确实有限。 所以除了能力升级,Xing4.0-29B-A4B也在继续把部署门槛往下压。 传统FP16精度下,29B参数模型单卡显存占用约60GB,往往需要多卡或者价格高昂的A卡。 经过4-bit量化后,这部分占用可以压缩至约15GB,降低约75%,让RTX 3090、4090等消费级显卡也能运行。 而这套轻量化私有部署方案,已经进入了真实生产场景。 在智能客服业务中,Xing4.0-29B-A4B已经完成私有化部署,用户通话、身份信息和业务记录全程不出域。 面对复杂诉求,模型需要一路完成意图理解、任务拆解、工具调用、结果整合和合规校验。 据悉,目前这套方案的复杂业务办理成功率已经达到90%以上。 到这里,开头那批企业的需求,才算是终于有了着落: 消费级显卡能跑,复杂任务能接,工具和业务系统也能连起来。 那么问题来了,这究竟是怎么做到的? 架构、数据、训练、部署的全方位优化 前面提到的MoE,是其中一部分答案。 模型有290亿总参数,但每次推理只激活约40亿。这样一来,每次处理任务时,就不必把全部参数都调动一遍,计算开销也随之降低。 但要让它读长文档、写工程代码,再把一个多步骤任务持续做下去,光靠MoE还不够。 背后还有架构、数据、训练和工程优化几方面的配合。 先看架构。 上下文越长,模型能读进去的内容就越多。可问题是,读进去的内容,也要占地方。 模型处理长文档时,会把前文的一部分计算结果存下来,方便后续生成时复用,这就是大家熟悉的KV Cache。 随着上下文变长,缓存也会越积越多,吃掉更多显存,还可能拖慢推理速度。 所以,长上下文要真正用起来,就得先想办法给这份缓存瘦身。 Xing4.0-29B-A4B采用的MLA多头潜变量注意力,做的就是这件事:把需要缓存的信息压
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱