蚂蚁百灵Ling-3.0-flash发布,124B参数激活仅5.1B

会懂网AI资讯,9月5日,9月4日,蚂蚁集团推出百灵大模型Ling-3.0-flash。该模型采用总参数124B、激活参数5.1B的混合专家(MoE)架构,在长输入场景下首token延迟较上一代降低60%至80%,主打高吞吐、低时延的企业级推理。

蚂蚁百灵Ling-3.0-flash发布,124B参数激活仅5.1B

低成本、高性价比是蚂蚁Ling系列的一贯路线。通过稀疏激活,模型在保持海量参数容量的同时,将每次推理的实际计算量压到很低,显著降低了单位token的算力成本,更适合金融、医疗等对稳定性与成本敏感的行业场景。
新版本延续了蚂蚁在隐私计算与绿色算力上的积累,并强化了在国产软硬件栈上的适配能力。面向私有化部署,Ling-3.0-flash意在降低中小企业使用大模型的门槛,让模型可在本地或专有云中安全运行敏感数据。
从行业背景看,MoE已成为国产大模型的主流技术选择。在参数规模竞赛之外,如何把”能力强”与”用得起”统一起来,正成为厂商竞争的关键分野,蚂蚁此次更新即是这一趋势的典型注脚。
会懂网观察,Ling-3.0-flash把焦点放在”延迟与成本”这一企业落地的真实痛点上。当大模型从演示走向生产系统,性价比往往比纸面参数更决定胜负,而蚂蚁正沿这条务实路线持续下注。
会懂网观察,Ling-3.0-flash把焦点放在延迟与成本这一企业落地的真实痛点上。当大模型从演示走向生产系统,性价比往往比纸面参数更决定胜负。蚂蚁延续低成本高性价比路线,也折射出中国AI公司在算力受限环境下,被迫走出的一条以工程优化取胜的现实路径,这条路反而更可持续。
在高端算力受限的现实环境下,工程层面的精细优化反而锻造出更扎实的竞争力。这种把每一分算力都用在刀刃上的能力,正是中国AI公司的生存之道。

© 版权声明
THE END
喜欢就支持一下吧
点赞8 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容