全球首个开源“重思考”模型:美团 LongCat-Flash-Thinking-2601 发布,工具调用能力登顶开源 SOTA

IT之家 1 月 16 日消息,美团 LongCat 团队今日正式发布并开源 LongCat-Flash-Thinking-2601。

据美团介绍,作为 LongCat-Flash-Thinking 模型的升级版,LongCat-Flash-Thinking-2601 在智能体搜索、工具调用、工具交互推理等核心评测基准上均达到开源模型 SOTA 水平。

图片

美团表示,该模型尤其在工具调用上表现出卓越的泛化能力,在依赖工具调用的随机复杂任务中性能超越了 Claude,可大幅度降低真实场景下新工具的适配训练成本;同时它是首个完整开源并支持在线免费体验「重思考模式」的模型,同时启动 8 个大脑飞速运转,确保思考周全、决策可靠。

得益于全新升级的「重思考」模式,遇到高难度问题时,模型会把思考过程拆成并行思考和总结归纳两步来做:

除此之外,美团还专门设计了额外的强化学习环节,针对性打磨模型的总结归纳能力,让 LongCat-Flash-Thinking-2601 真正实现“想清楚再行动”。

图片

美团表示,经过全面严谨的评估显示,LongCat-Flash-Thinking-2601 模型在编程、数学推理、智能体工具调用、智能体搜索维度表现全面领先:

同时,为了更好的测试智能体模型的泛化能力,美团还提出了一种全新的评测方法 —— 通过构建一套自动化任务合成流程,支持用户基于给定关键词,为任意场景随机生成复杂任务。每个生成的任务都配备了对应的工具集与可执行环境。

由于这类环境中的工具配置具有高度随机性,美团通过评估模型在该类环境中的性能表现,来衡量其泛化能力。实验结果表明,LongCat-Flash-Thinking-2601 在绝大多数任务中保持领先性能,印证了其在智能体场景下强大的泛化能力。

IT之家附官方开源地址: