智通财经APP获悉,蚂蚁百灵新一代原生混合推理模型Ling-3.0-flash已正式开源。Ling-3.0-flash采用124B总参数、5.1B激活参数的MoE架构。它保留了千亿参数模型的知识与能力容量,但在生成每个Token时,只激活其中约5.1B参数,从而降低单次推理的计算开销。

开发者既可以直接调用模型,也可以自由验证、部署和定制模型能力,将Ling-3.0-flash接入自己的业务系统、开发工具链和Agent工作流。据悉,Ling-3.0-flash提供三种不同的落地选择:

API调用,让Agent应用快速上线:面向希望快速接入、无需自建推理服务的开发者,Ling-3.0-flash可通过云端API直接调用;

单机私有化,让数据留在本地:面向数据不能出域的企业和团队,MXFP4与INT4版本可在单台NVIDIA DGX Spark上完成端到端推理;

高性能部署,释放极致单请求速度:面向单请求时延敏感的高性能服务,在指定GPU测试配置下,平均输出速率突破1100 tokens/s。

在AA Intelligence Index 榜单中,Ling-3.0-flash每项任务的加权平均调用成本约为0.04美元,加权平均解码时间约为1.4分钟,同时进入“智能水平—任务成本”和“智能水平—任务耗时”的优势区域。

Ling-3.0-flash 通过单机部署降低了私有化应用的起步门槛;而对于单请求时延更加敏感的实时业务,Ling-3.0-flash通过高性能GPU与推理栈的深度协同,进一步压缩生成等待,为实时Agent、多轮工具调用和连续任务执行提供更低延迟的运行体验。