圈小蛙

阿里首次开源2.4万亿参数Qwen旗舰模型,DeepSeek上线V4-Pro并首推“峰谷电价”API

随着大模型商业化竞争步入深水区,算力成本的控制与开发者生态的构建已成为头部厂商博弈的核心杠杆。2026年8月中旬,国内大模型赛道双雄阿里云DeepSeek 同步出招,前者通过“开源旗舰模型”筑高生态壁垒,后者则通过“API 定价机制改革”试图重塑商业算力的供需平衡。

阿里首次开放 Qwen-Max 级别权重:2.4T 参数巨兽走向开源

对于全球开源 AI 社区而言,阿里云魔搭(ModelScope)社区近日公布的一项决定具有里程碑意义。阿里 Qwen 团队宣布,正式向外界开放其最新旗舰模型 Qwen3.8-2.4T-A95B 的模型权重。这是阿里首次将其最核心的 Max 级别大模型开源,赋予了全球开发者自由进行本地复现、微调与二次开发的能力。

从披露的技术细节来看,该模型是一款采用因果语言建模(Causal Language Modeling)的超大型混合专家模型(MoE),总参数量达到了惊人的 2.4 万亿(2.4T)。为了保证推理效率,模型在运行时采用稀疏激活架构,每个 Token 仅会激活其中的 950 亿(95B)参数。在其底层的 MoE 结构中,每一层都包含了 512 个专家,系统会为每个 Token 路由并选择 10 个激活专家,同时还会强制激活 1 个共享专家以保证常识关联。在上下文窗口方面,该模型原生支持 262,144 个 Token 的超长输入,并通过技术优化使其可扩展至 1,010,000 个 Token 的百万级容量。此外,开发团队在训练阶段引入了多步 Multi-Token Prediction 技术,使得模型在处理长逻辑链推理时的生成速度与稳定性大幅提升。

DeepSeek 上线 V4-Pro 并首推 API“峰谷电价”机制

在阿里通过开源技术回馈社区的同时,以极致性价比著称的 DeepSeek 则在商业运营模式上进行了大胆的探索。在其官方 API 文档中,平台已悄然上线了名为“DeepSeek-V4-Pro-0813”的全新模型,该模型全面支持“思考(Reasoning)”与“非思考”双模式切换,以满足开发者在深度推理与快速响应场景下的不同需求。

伴随着新模型的上线,DeepSeek 对其计费模式进行了前所未有的结构性调整。根据DeepSeek官方API最新价格与收费政策公告显示,平台将于北京时间 2026 年 8 月 17 日 00:00 起,正式引入类似于工业电网的“峰谷定价”机制。

具体而言,DeepSeek 将北京时间每日的 9:00 - 12:00 以及 14:00 - 18:00 定义为“高峰时段”(Peak Hours),其余时间则自动归为“空闲时段”(Off-Peak Hours)。在空闲时段,API 调用的单价仅为高峰时段的一半。不过,从整体价格变动来看,此次调整伴随着费率的整体上浮:空闲时段的基础单价较此前版本上涨了约 50%,而高峰时段的单价则直接上浮了 100%。

行业分析人士指出,DeepSeek 此举旨在通过价格杠杆调节算力集群的负载压力。由于大量企业级应用和开发者习惯在白天的工作时段集中调用 API,导致算力集群在特定时间段面临极高的并发压力与服务器过载风险。通过引入峰谷差价,平台能够引导那些对实时性要求不高的批量任务(如大规模数据清洗、离线翻译和模型蒸馏等)转移到夜间或清晨的空闲时段运行,从而在不盲目扩张服务器硬件规模的前提下,极大提升整体算力资源的利用率。


本报道由 圈小蛙(qxwa.com) 科技资讯站特约撰稿。🐸️

Exit mobile version