铭鸿体育资讯网

长任务Agent,别只问代码写完没有Laguna S 2.1这两天更新了。它是一

长任务Agent,别只问代码写完没有Laguna S 2.1这两天更新了。它是一个118B总参数、每个token激活8B参数的MoE模型,项目方把它定位在Agentic Coding和长时任务。模型跑分可以参考,但实际用长任务Agent,我更关心四道门。第一道门,任务边界。开始前写清楚允许修改的目录、禁止触碰的系统、验收目标和停止条件。任务越长,模糊边界放大的风险越大。第二道门,中途检查点。不要等到最后才看结果。让Agent在研究、方案、修改和验证阶段分别留下可读状态,方便人在偏航前纠正。第三道门,独立测试。“代码已经生成”不等于“行为已经验证”。至少检查测试结果、关键输出和用户真正会走的流程。第四道门,可撤回。保留变更清单、原始版本和回滚入口。无法解释改了什么、也不能安全撤回的自动化,不适合长时间放手运行。这四道门不是Poolside官方流程,而是我给长任务Agent设计的通用验收框架。Laguna S 2.1模型卡公开了SWE-bench相关结果,但本次没有下载模型,也没有独立复现跑分。你最担心长任务Agent哪一步失控:理解错、改太多、测不全,还是回不去?人工智能AIAgentAI编程效率工具