阿里正式开放Qwen3.8-2.4T-A95B模型权重,首次开源旗舰级MoE大模型

阿里巴巴通义千问团队对外放出 Qwen3.8‑2.4T‑A95B 完整模型权重,这是千问产品线当中 Max 级别旗舰模型首次对外开放权重文件36氪。开发者可以在魔搭社区以及 Hugging Face 平台获取模型文件,权重适配主流推理框架,支持 vLLM、SGLang 等工具完成本地部署与二次开发工作。云端版本 Qwen3.8‑Max 已于 8 月 3 日上线,开放 API 调用通道,本次开源的基座权重,和云端版本出自同一套底层架构,部分多模态、工具调用相关能力集中在云端版本当中实现。

该模型采用 MoE 混合专家架构,总参数规模达到 2.4 万亿,单轮 token 推理过程当中仅激活 950 亿参数,依靠专家路由机制控制推理算力消耗,在超大总参数规模之下,把推理负载控制在可落地区间。原生上下文窗口为 262144 token,经过扩展调整之后,可支撑接近 100 万 token 的超长文本输入,适配长文档解析、大规模资料整理、复杂智能体任务等场景NVIDIA。模型在代码生成、专业领域文本处理、多步骤任务执行维度完成训练优化,面向科研、企业开发场景提供基座能力支持。

大规模 MoE 模型对硬件基础设施存在较高门槛。完整权重文件体量庞大,本地运行需要多卡高性能算力集群作为支撑,普通消费级硬件无法完成完整模型的推理工作。行业厂商已经同步开展适配优化,在 FP8 精度模式下,多节点集群环境可以拿到稳定的吞吐表现,企业用户需要配套的数据中心级加速硬件,才能跑通完整模型服务NVIDIA。普通开发者不具备硬件条件的情况下,可以继续选用官方提供的云端 API 服务开展测试。

开源权重释放之后,开发者可以基于基座开展微调、蒸馏等二次处理,产出面向垂直行业的衍生模型。模型支持自定义推理强度,可对思考深度参数做调整,历史推理内容能够保留,便于处理多轮复杂任务,给智能体项目提供底层支撑能力。官方同步预告,轻量化稠密基座 Qwen3.8‑27B 后续也会完成权重开放,覆盖算力有限的部署环境,形成大小模型搭配的开源矩阵36氪。

国内开源大模型赛道持续向超大参数基座延伸,过往多数万亿级能力模型仅提供云端调用接口,不对外释放权重文件。阿里将 Max 级别的基座对外开放,给到机构开发者自主运维、深度改造的选择,不用完全依赖公有云接口完成业务迭代。开源模式会带动社区层面的二次创新,衍生出适配不同行业的微调版本,也方便科研人员开展大模型架构相关的实验工作。

海外开发者可以通过 Hugging Face 仓库直接获取文件,国内开发者优先通过魔搭社区下载,降低跨境访问带来的不稳定问题。官方文档同步放出部署指引,写明硬件配置参考、推理参数设置、环境依赖清单,减少开发者上手调试的障碍。随着权重正式落地,国内开源大模型的能力上限得到进一步抬升,后续社区的衍生项目、评测数据,会持续反映这套基座在真实业务当中的实际表现。