아티클 목록으로
AI 에이전트

LongCat-DeepResearch가 제시한 협업형 멀티에이전트 연구 워크플로

약 3분 소요

들어가며

심층 연구형 AI의 과제는 더 많은 자료를 검색하는 데서 끝나지 않는다. 개방형 질문을 실행 가능한 작업으로 나누고, 관련 근거를 수집하며, 서로 다른 조사 결과를 일관된 보고서로 구성해야 한다. LongCat 팀의 기술 보고서에 소개된 LongCat-DeepResearch는 이 문제를 단일 모델의 일괄 생성이 아니라 역할을 나눈 협업형 워크플로로 다룬다.

핵심 워크플로

시스템은 다음과 같은 단계로 구성된다.

  • 조사 전 계획 수립: 여러 계획 에이전트가 외부 자료를 탐색하고 서로 다른 관점에서 질문을 정리한다. 결과는 실행 가능한 연구 계획인 ResearchSpec으로 통합된다.
  • 섹션별 병렬 조사: 연구 에이전트는 계획에 따라 각자 담당 섹션을 맡는다. 독립된 컨텍스트에서 추가 근거를 찾고 분석하며 초안을 작성하므로 여러 조사 방향을 동시에 진행할 수 있다.
  • 통합 후 전역 검토: 섹션을 합친 뒤 보고서 전체를 검토한다. 이 과정에서는 정보의 누락, 논리적 연결, 근거 활용의 문제를 확인한다.
  • 국소적 수정: 전체 보고서를 반복해서 다시 쓰는 대신 문제가 있는 섹션에 수정 지시를 내린다. 전역적인 일관성을 유지하면서 불필요한 재생성 비용을 줄이려는 설계다.

이 워크플로는 보고서 작성 외에도 LongCat 범용 모델의 중간 학습과 후속 학습에 사용할 연구 과제 및 연구 궤적을 만드는 데 활용될 수 있다. 연구 시스템이 실제 응용 계층인 동시에 모델 개선을 위한 데이터 구축 도구가 되는 셈이다.

평가 결과와 해석

LongCat-DeepResearch는 DeepResearchBench에서 55.25점, DeepResearchBench II에서 51.35점, ResearchRubrics에서 79.83점을 기록했다. 내부 벤치마크에서는 76.04점으로 비교 대상 네 시스템 중 2위를 차지했다. 이러한 결과는 계획과 역할 분담이 조사형 출력의 품질을 높이는 데 기여할 수 있음을 보여주지만, 모든 작업과 배포 환경에서 우위에 있다는 뜻은 아니다.

개발 세트 분석에서는 여러 계획 관점을 결합했을 때 이점이 나타났다. 초기 문제 분해가 이후 조사 품질에 영향을 줄 수 있다는 의미다. 반면 계획을 계속 세밀하게 다듬는 것의 효과는 일관되지 않았다. 계획의 양이나 반복 횟수를 늘리는 것만으로는 충분하지 않다. 추가 편집은 두 벤치마크에서 평균 자동 가독성 선호를 높였지만, 벤치마크별 변화 방향은 달랐다. 가독성, 근거의 포괄성, 분석 품질 사이의 균형은 여전히 과제로 남는다.

의미와 한계

이 연구의 핵심 의미는 심층 연구를 일회성 생성에서 분업, 검토, 수정이 가능한 공정으로 전환했다는 데 있다. 근거가 여러 주제에 흩어진 복합 질문에는 섹션 단위 협업이 적합할 수 있으며, 국소 수정은 긴 보고서 편집 비용을 통제하는 방법을 제공한다. 그러나 멀티에이전트 구조는 조정 비용과 섹션 간 사실 불일치 위험도 함께 만든다. 제공된 자료에는 실행 비용, 응답 지연, 비교 시스템의 세부 정보, 사람에 의한 사실 검증 결과가 제시되지 않았다. 실제 도입 효과를 판단하려면 이러한 정보와 독립적인 재현 검증이 필요하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Raven: 진화하는 에이전트 하니스를 조합하는 시스템
AI 에이전트
cctest.ai
AI 에이전트

Raven: 진화하는 에이전트 하니스를 조합하는 시스템

Raven은 모델과 도메인별 전용 에이전트 하니스를 자동으로 만들고 개선한 뒤 서로 조합하는 ‘하니스의 하니스’를 제안합니다. 장기·跨도메인 작업을 단일 에이전트가 아닌 모듈형 협업 문제로 재정의하려는 접근입니다.

더 보기
CCTest · Blog
HybridCUA, GUI와 CLI를 오가는 컴퓨터 사용 에이전트 학습
AI 에이전트
cctest.ai
AI 에이전트

HybridCUA, GUI와 CLI를 오가는 컴퓨터 사용 에이전트 학습

HybridCUA는 그래픽 인터페이스와 명령줄을 함께 사용하고, 작업에 따라 두 방식을 조율하는 컴퓨터 사용 에이전트 학습 방법을 제안한다. 9B 모델은 OSWorld에서 53.6%의 정확도를 기록해 기본 모델보다 14.8%포인트 향상됐다.

더 보기