9月30日,蚂蚁集团旗下 inclusionAI(百灵团队)发布长上下文大模型 Ling-3.1-flash。总参数约560B,混合专家(MoE)架构,每个Token仅激活约25B参数,上下文上限标称100万Token,同步开启两周免费体验。长文档分析、代码库理解、通用智能体这三类高成本场景,多了一个值得认真评估的新选项。
一张参数表看懂定位
先看核心规格:
- 总参数:约560B,MoE混合专家架构
- 激活参数:每Token约25B,与DeepSeek-V3的671B/37B激活同一路线
- 上下文窗口:设计上限100万Token,免费体验期开放256K档位
- 输出上限:单次32,768 Token
- 定位:通用智能体、搜索、日常办公、软件研发,医疗、金融、材料科研场景持续优化
- 开源计划:付费版上线1M上下文后同步开源
25B激活量是关键。推理成本主要由激活参数决定,560B总参数提供知识容量,25B的激活规模让单次调用成本接近中端模型。官方没有公布完整价格表,这一点后面单独说。
100万Token上下文,实际能装什么
256K和1M是两个完全不同的工作负载量级:
- 256K大约能一次塞进一整本300页的技术书,或者一个中型开源项目的核心代码
- 1M大约对应150万字的中文文档,或者一整个大型代码仓库加完整提交历史
典型受益场景很具体。律所审一份千页招股书,传统RAG方案要切块、建索引、再检索召回,跨章节的关联条款容易丢。直接塞进256K以上的窗口,模型通读全文,条款间的交叉引用不会被切断。程序员分析陌生代码库同理,一次读进几十个文件,跨文件的调用关系不用再靠多轮检索拼凑。
官方明确优化了工具调用和多步分析,说明这套长上下文是为Agent工作流设计的。智能体跑长任务需要携带完整的任务历史和中间结果,上下文越长,遗忘越少。
免费两周,但有三个细节要想清楚
体验期内有三条限制,选型前必须对齐预期:
- 上下文被限制在256K(262,144 Token),1M窗口要等付费服务开启后才解锁
- 输出上限32,768 Token,生成超长报告时需要分段
- 权重未发布、许可证未公布、价格未公示,商业项目现在接入要预留切换成本
第三条最容易被忽略。InclusionAI承诺付费版上线后开源,但开源时间、许可证类型(宽松的Apache 2.0还是带条件的协议)都没定。已有Ling系列开源先例,风险不大,可生产环境等许可证落地再动手更稳。
另外要算一笔账:免费期结束后,256K上下文一次调用的Token费用不低。百万Token级别的输入,单价哪怕只差几分钱,乘起来都是真金白银。建议在免费期内用真实业务数据跑压测,把准确率和账单一起量出来。
和主流模型的正面比较
放进行业坐标里看更清楚:
- DeepSeek-V3:671B总参/37B激活,训练成本约557万美元,开源标杆。Ling-3.1-flash激活更小,长上下文档位更高
- GPT-6.1 Sol / Gemini 4 Argon:闭源旗舰,能力上限高,但数据出境和成本约束让国内企业谨慎
- Qwen3.8系列:开源生态最成熟,Hugging Face周榜断层领先,长上下文专项能力各有取舍
Ling-3.1-flash的差异化押注在两点:超长上下文对Agent场景的原生适配,以及免费试用加开源的低门槛策略。蚂蚁自家的支付、理财业务就是天然试验场,金融场景的可信度背书比跑分更实在。
三类人群的行动建议
- 企业开发者:用两周免费期测真实负载,重点记录长文档任务的准确率、延迟和Token消耗,许可证公布后再决定是否签付费
- Agent工程师:拿工具调用和多步任务实测,对比自家RAG方案,能省掉一整层检索基础设施的架构值得认真考虑
- 普通用户:等开源权重发布,用消费级显卡跑量化版本,或者直接用免费API,不必现在投入
大模型竞争已经从”谁的参数大”转向”谁的单次调用更便宜、上下文更长、Agent能力更稳”。Ling-3.1-flash把560B的知识量压进25B的激活成本里,再加免费两周的体验窗口,诚意给足了。值不值得上车,取决于你的业务里有多少”读不完的长文档”和”跑不完的长任务”。
苏公网安备32010502011527号
发表回复