一张3090就能跑!全栈国产模型,把AI办公搬到企业本地 henry 2026-09-20 20:22:41 来源: 量子位 AI办公这块蛋糕,中国电信可能要先切走一块了。
henry 发自 凹非寺 量子位 | 公众号 QbitAI AI办公这块蛋糕,中国电信可能要先切走一块了。这个夏天,大厂们集体加注AI办公。
卷Agent能力,卷工作入口,卷企业工作流,Coding之后,办公成了Agent的下一个必争之地。但就在大伙忙着抢入口的时候,还有一批企业,连门都没进去。
原因现实得很扎心。他们数据不能出域,模型最好就地部署,手头算力又不算富裕。
可偏偏,长文档要读,复杂业务要办,该干的活一样不少。中国电信AI这次最新开源的 Xing4.0-29B-A4B ,瞄准的就是这批需求。
而且,这次带来的还是一款 全栈国产化的轻量级代码智能体大模型 。从国产芯片、国产训练框架,到模型训练和推理部署,整条技术链路都做了系统适配。
为了尽可能实现本地部署,Xing4.0-29B-A4B采用 MoE 架构, 290亿 的总参数,每次推理只激活约 40亿 参数,经过4-bit量化后,一张 RTX 3090 就能运行。当然,跑起来只是第一步。
企业真正关心的,还是这张显卡上的模型,到底能干多少活。比如,处理重要文档时,模型可以直接在本地完成内容理解、指标提取和信息整理,数据全程不用离开企业环境。
再比如,一份200页的投标文件交过来,模型能在本地用约20分钟,完成技术、商务、价格三个方面的初评,并逐条给出评分依据。更进一步,它对本地部署的考虑,也不只停留在消费级显卡上。
Xing4.0-29B-A4B完全基于 华为昇腾910C算力 训练,并采用国产的 MindSpore/MindFormers训练框架与开发套件 ,真正实现了 国芯训国模 。在推理部署端,它还完成了昇腾的适配验证。
可以说,从训练到落地,国产算力这条路也已经走通。目前,模型已经在GitHub、Hugging Face、Gitee、魔搭、魔乐等平台开源上线,并同步支持API调用。
值得一提的是,截止发稿,Xing4.0-29B-A4B现在已经冲进HuggingFace模型趋势榜单,位居第四。感兴趣的朋友,可以直接用起来了。
(相关链接在文末) 既要跑得动,也要真的能干活 老实说,把模型装进一张显卡,和让它稳稳接住企业的日常工作,中间还隔着不少事。毕竟,企业交过来的任务,很少只有一句问答那么简单。
一份文档读完了,可能还要提取信息、调用工具、核对结果,最后整理成一份能交出去的材料。更何况,这些活每天都要干,不但要考虑稳定性,还要考虑性价比。
要满足这些要求,既要继续压低部署和运行成本,也得把干活的能力练扎实。后者,正是Xing4.0-29B-A4B这次重点加强Coding和Agent能力的原因。
先说Coding。过去,百亿参数模型写代码,一个常见的问题就是写个函数、补几行代码还行。
可一旦把整个代码仓库交过去,要求它解决一个真正的工程问题,事情就没那么顺了。因为它需要先看懂项目结构,跨文件追踪接口调用,再结合文档、日志和历史上下文定位问题。
改完之后,还得验证修改有没有用,会不会影响其他地方。代码只是最后写出来的那一部分,前面还有一长串工作要做。
针对这个老大难问题,Xing4.0-29B-A4B这次把Coding能力,从「写片段」进一步推向了「干工程」。它原生支持 256K上下文,并可扩展至512K ,让一次任务能够装下更长的代码、文档、日志和历史记录,为理解整个项目提供空间。
比如,要把分散在Excel里的合同台账做成管控大屏,需要的就不只是一个画图函数。模型还要理解表格里的业务数据,将合同概览、金额分布、风险识别和履约预警等需求,组织到同一个页面中。
这里既涉及数据理解,也涉及代码生成和功能组织,需要结合前后的信息完成开发。 Xing4.0-29B-A4B可以在企业本地,将这些合同台账转化为可视化管控大屏,数据全程不用离开企业环境。
而到了Agent这边,要求还要再往前走一步。理解需求之后,模型得自己拆解任务、安排执行顺序、调用工具,再根据中间结果决定下一步怎么做。
一路做下去,直到交付一个可以验收的结果。 Xing4.0-29B-A4B针对这类长程任务做了专项强化。
比如,用户一次说清需求后,模型可以判断哪些步骤先做、哪些可以并行,再调用天气、日程、提醒、出行等不同工具或Agent,把任务继续推进。但模型自己会干活了,企业就能直接用起来吗?
还差一步,接进现有工作流。企业已经在用的开发工具、Agent框架和部署平台,都得接得上。
否则,光是换一套环境,就可能先多出一堆工作。为此,Xing4.0-29B-A4B已经针对OpenCode、Claude Code、OpenClaw、Hermes等主流Agent、Harness框架完成定向适配,同时兼容LLaMA-Factory、MindFormers、SGLang、vLLM、KTransformers等常用工具链,降低接入现有开发环境的门槛。
当然,对于我们开头提到的那批企业来说,还有一个绕不开的现实约束: 数据不能出域,算力也确实有限。所以除了能力升级,Xing4.0-29B-A4B也在继续把部署门槛往下压。
传统FP16精度下,29B参数模型单卡显存占用约60GB,往往需要多卡或者价格高昂的A卡。经过4-bit量化后,这部分占用可以压缩至约15GB,降低约75%,让RTX 3090、4090等消费级显卡也能运行。
而这套轻量化私有部署方案,已经进入了真实生产场景。在智能客服业务中,Xing4.0-29B-A4B已经完成私有化部署,用户通话、身份信息和业务记录全程不出域。
面对复杂诉求,模型需要一路完成意图理解、任务拆解、工具调用、结果整合和合规校验。据悉,目前这套方案的复杂业务办理成功率已经达到90%以上。
到这里,开头那批企业的需求,才算是终于有了着落: 消费级显卡能跑,复杂任务能接,工具和业务系统也能连起来。那么问题来了,这究竟是怎么做到的?
架构、数据、训练、部署的全方位优化 前面提到的MoE,是其中一部分答案。模型有290亿总参数,但每次推理只激活约40亿。
这样一来,每次处理任务时,就不必把全部参数都调动一遍,计算开销也随之降低。但要让它读长文档、写工程代码,再把一个多步骤任务持续做下去,光靠MoE还不够。
背后还有架构、数据、训练和工程优化几方面的配合。先看架构。
上下文越长,模型能读进去的内容就越多。可问题是,读进去的内容,也要占地方。
模型处理长文档时,会把前文的一部分计算结果存下来,方便后续生成时复用,这就是大家熟悉的KV Cache。随着上下文变长,缓存也会越积越多,吃掉更多显存,还可能拖慢推理速度。
所以,长上下文要真正用起来,就得先想办法给这份缓存瘦身。 Xing4.0-29B-A4B采用的MLA多头潜变量注意力,做的就是这件事:把需要缓存的信息压缩成更紧凑的形式,降低长上下文推理的显存开销。
进一步,读进去的开销降下来了,生成速度也得跟上。在这里,Xing4.0-29B-A4B还采用了MTP,也就是多Token预测。
相比常规训练主要让模型预测下一个Token,MTP则让模型同时学习预测后续多个Token,从中学习更长的前后关联。这些预测还可以在推理时派上用场:先提前生成候选内容,再交给主模型校验,为生成加速提供支持。
此外,模型还引入了DeepSeek同款的mHC流形约束超连接,约束信息在不同层之间的传递,减少信号反复放大带来的训练不稳定。架构搭好了,接下来就看模型学什么。
中国电信这次自建了一套包含数十万亿词元的数据体系。预训练数据经过PB级多源清洗,除了通用内容,还加入了复杂表格、结构化知识图谱和智能体行为轨迹。
其中,行为轨迹和Agent能力的关系尤其直接。因为它记录的,恰好就是一个任务从头到尾怎么做—— 目标是什么,中间调用了哪些工具,工具返回了什么,拿到结果之后,下一步又该如何处理。
这些过程连在一起,模型才能学习如何把前一步的结果,接到下一步的操作上。到了后训练阶段,团队又搭建了支持代码运行、在线搜索和工具调用的高并发沙箱,在其中构造长程Agent任务。
代码能不能跑,工具有没有调对,最后的结果是否符合要求,都通过测试用例和自动化机制校验。这样一来,训练材料该不该留下,就有了实际执行结果作为依据。
在训练阶段,Xing4.0-29B-A4B则随着任务难度逐步展开。预训练从4K序列长度起步,先学习通用知识和基础推理,再逐步提高代码与复杂推理数据的占比。
进入中训练阶段,序列长度依次扩展到32K、128K和256K,同时增加仓库级代码、复杂推理和Agent数据。到了后训练阶段,团队围绕Coding、Agent和Reasoning三个方向,分别开展多专家强化学习,再通过MOPD,把各个方向的专项能力融合起来。
值得一提的是,训练过程中,还用上了Muon和QK-Clip。前者用于优化参数更新,后者控制注意力计算中的数值规模,降低数值异常增长的风险。
最后,在工程优化阶段,电信进一步让模型能够在国产算力上高效完成训练。这也是 全栈国产化 真正落到技术细节的地方。
Xing4.0-29B-A4B基于昇腾910C集群,结合MindSpore/MindFormers,完成了mHC等新特性的适配、跨框架精度对齐及融合算子开发,让模型架构、国产训练框架与国产芯片协同起来。针对计算调度和显存压力,团队通过DVM图算融合、细粒度重计算和Ascend C定制融合算子,减少调度与数据搬运开销,节省显存,并提高执行效率。
据官方介绍,经过模型架构、编译、算子与硬件的多层次协同优化,整网训练吞吐较开箱性能提升约96%,接近翻倍。后训练使用的Slime强化学习框架,也完成了昇腾生态适配。
从训练框架到底层算子,再到强化学习,团队都做了针对性优化。也就是说,国芯训国模背后,是芯片、框架、模型和训练流程的整套配合。
而从架构、数据、训练到部署,这一整套功夫,最终都落到了企业桌上那些已经堆起来的任务上。让企业真正用上AI 最后,为了让企业真正地、丝滑地用上AI办公,电信这次也同步了一个保姆级套餐。
希望尽快用起来的企业,可以选择将Xing4.0-29B-A4B预集成到算网一体机,减少环境搭建和安装配置工作,缩短部署周期。本地算力紧张时,还可以在满足自身数据管理要求的前提下,通过智算专线调用云端算力,完成弹性扩容。
而对于采用国产算力的企业,模型还基于智源FlagOS统一开源AI软件栈,打通了多家国产芯片的适配路径,降低跨硬件平台迁移和部署的成本。可以说,从一张消费级显卡,到算网一体机,再到云端弹性算力,不同规模、不同技术储备的企业,都有相应的部署路径。
说到这,还有最后一个问题。中国电信为什么要专门做这样一款更轻的模型?
把29B放回整个星辰系列里看,答案会更清楚。此前,中国电信已经布局十亿、百亿、千亿参数模型,并开展万亿参数模型,以及语音、语义、多模态等方向的研发。
而Xing4.0-29B-A4B补上的,是其中一类很具体的需求: 本地算力有限,但复杂任务照样要做。对于这类需求,中国电信并不陌生,甚至不夸张地说,这类需求可能也只有电信能看到、满足。
从政务、客服到网络运维,它长期接触大量私有化部署场景。数据能放在哪里,现有设备能承担多少计算,业务流程又有多复杂,都是企业用上模型之前必须解决的问题。
而这,就为这次轻量模型的设计提供了一个具体的出发点。从企业现场的算力成本、数据边界和业务需求出发,确定模型需要多大、哪些能力必须加强,再配上相应的交付方案。
这条从模型走到企业现场的路径,也对应着中国电信正在推进的云改数转智惠战略,以及算力、平台、数据、模型、应用五位一体智能云体系。模型负责理解和执行任务,平台负责接入与编排,算力和网络支撑运行,再由行业应用把这些能力接进具体业务。
Xing4.0-29B-A4B,就是这套布局中面向轻量化私有部署的一步。从国产芯片上训练出来,再适配企业手头的设备和实际工作流,国芯训国模的价值,也就进一步落到了企业能不能用、好不好用上。
也正因如此,后续星辰系列的更新,也有了更具体的看点:更大的模型能处理多复杂的任务,不同模态能覆盖哪些工作,更轻的模型又能进入多少原本受限于设备和部署条件的企业。回到开头,AI办公的竞争还在继续。
而那些数据不能出域、手头算力有限的企业,也一直有文档要读、有材料要交、有业务要办。如今,企业又多了一个把AI用起来的选择。
下一步,可能就从手头这张显卡开始。开源地址: GitHub:/ai-market-guide/ HuggingFace:/ai-market-guide/ 魔搭:/ai-market-guide/ Gitee:/ai-market-guide/ 魔乐:/ai-market-guide/ 版权所有,未经授权不得以任何形式转载及使用,违者必究。