LongCat-DeepResearch:把深度研究拆成可协作的多智能体流程
导语
深度研究型 AI 的难点,不只是找到更多资料,而是把开放式问题拆解成可执行任务,持续搜集证据,并将不同调查结果组织成逻辑一致的报告。LongCat 团队发布的 LongCat-DeepResearch Technical Report,尝试用多智能体协作解决这一问题:让不同阶段承担不同职责,而不是由一个模型从搜索一路写到成稿。
核心方法
LongCat-DeepResearch 将流程划分为四个主要环节:
- 先规划再研究:多个规划智能体先探索外部来源,互相补充视角,并把问题整理为可执行的 ResearchSpec。它不仅描述报告结构,也为后续调查提供方向。
- 章节级并行调查:研究智能体依据规划分别负责不同章节,在相对独立的上下文中查找证据、分析材料并形成初稿。这种设计有利于同时推进多个研究方向。
- 整合后的全局审阅:各章节汇总后,系统进行整体检查,识别论证衔接、覆盖范围或证据使用方面的问题。
- 局部定向修订:审阅意见被落实到具体章节,而不是反复重写整篇报告。这样既保留全局一致性,也减少了完整重写带来的成本。
除了直接生成报告,这套流程还可产出研究任务和研究轨迹,用于 LongCat 通用模型的中期训练与后训练。换言之,研究系统本身也被用作构建训练数据和改进模型能力的工具。
评测结果与解读
报告显示,LongCat-DeepResearch 在 DeepResearchBench 上得分 55.25,在 DeepResearchBench II 上得分 51.35,在 ResearchRubrics 上得分 79.83;在一项内部基准中得分 76.04,在四个比较系统中排名第二。这些结果说明,规划与分工式流程能够支持较完整、重证据的研究输出,但不能仅凭分数推断其在所有任务或场景中都占优。
开发集分析还提供了两个值得注意的信号。第一,融合多个规划视角通常有益,表明研究任务的早期拆解会影响后续调查质量。第二,继续增加规划 refinement 的效果并不稳定,规划并非越多越好。额外编辑在两个基准上提升了平均自动可读性偏好,但不同基准呈现出不同趋势,说明可读性优化与事实覆盖、论证质量之间仍需要平衡。
意义与局限
LongCat-DeepResearch 的价值在于,它把“深度研究”从单次生成转向可协调、可检查的流程工程。章节级协作适合处理范围广、资料分散的任务,局部修订也为降低长报告迭代成本提供了思路。不过,多智能体架构同时引入了规划协调、证据一致性和流程开销等新问题。当前素材未披露完整的系统成本、响应时延、比较系统细节或人工事实核验结果,因此其实际部署优势仍需结合更完整的报告和独立复现来判断。
评论
正在确认登录状态……
正在加载评论……