NexForge: 요구사항 기반 작업 합성으로 LLM Agent 확장
들어가며
LLM Agent의 성능을 높이려면 다양하고 현실적이며 실행 가능한 훈련 작업이 필요합니다. NexForge 논문이 겨냥하는 문제는 바로 이 데이터 확장 병목입니다. 기존의 많은 Agent 작업 합성 방식은 미리 정해진 도구, 코드 저장소, 스킬 그래프 같은 기반에 묶여 있었습니다. 이런 방식은 생성과 검증을 쉽게 만들지만, 새 도메인으로 확장할 때마다 별도 파이프라인과 수작업 기반 설계가 필요합니다. 또한 생성된 작업 분포가 실제 사용자 수요보다는 선택한 환경의 편향을 반영할 위험도 있습니다.
NexForge는 출발점을 바꿉니다. “현재 가진 도구로 어떤 작업을 만들 수 있는가”가 아니라 “Agent에게 어떤 능력을 학습시킬 것인가”를 먼저 묻습니다. 고수준 능력 요구사항을 입력으로 받아 다양한 실행 가능 작업과 전문가 실행 궤적을 합성하고, 이를 감독 미세조정에 활용할 수 있도록 구성합니다.
핵심 내용
- 요구사항 기반 생성: NexForge는 특정 도구, 저장소, 수작업 스킬 그래프에 고정되지 않고 능력 요구사항에서 작업을 설계합니다.
- 현실 수요 조사: 먼저 실제 수요를 분석해 대표 시나리오와 작업 프로파일을 만들고, 실사용에 가까운 분포를 목표로 합니다.
- 분포 인식 컴파일: 작업 프로파일을 구체적인 작업 지시로 변환할 때 능력 범위와 분포를 고려합니다.
- 실행 환경 자동 구성: 각 작업 지시에 필요한 파일, 의존성, 런타임 설정을 자동으로 검색하거나 생성해 텍스트 지시를 실제 실행 가능한 환경으로 바꿉니다.
- 전문가 궤적 생성: 작업별 전문가 rollout을 합성해 SFT에 사용할 수 있는 학습 궤적을 만듭니다.
- 보고된 성능 개선: 논문에 따르면 도메인 특화 인프라 없이 3.6K개의 터미널 작업과 2K개의 오피스 작업을 생성했고, 이를 통해 Qwen3.5-35B-A3B Base는 Terminal-Bench 2.0에서 22.5%에서 52.0%로, GDPval에서 813 Elo에서 1338 Elo로 향상됐습니다. 43.2K개의 터미널 작업으로 확장하면 Terminal-Bench 2.0 성능은 58.4%에 도달합니다.
의미와 영향
NexForge의 의미는 단순히 합성 데이터를 더 많이 만든 데 있지 않습니다. Agent 훈련 데이터를 능력 요구사항에서 시작해 보다 일반적으로 생산하는 절차를 제시했다는 점이 중요합니다. 터미널 Agent, 오피스 자동화 Agent, 그리고 다양한 도구 사용형 Agent에서 어려운 부분은 개별 문제 풀이만이 아닙니다. 수많은 장기 워크플로를 실행 가능하고 검증 가능한 형태로 넓게 포괄하는 것이 핵심 과제입니다.
논문은 NexForge가 Nex-N2-Pro와 Nex-N2-Mini를 포함한 공개 Nex-N2 모델군의 핵심 데이터 엔진이라고 설명합니다. 추가 확장된 NexForge 합성 데이터는 Qwen3.5-35B-A3B를 Terminal-Bench 2.1에서 75.3%, GDPval에서 1585 Elo까지 끌어올리는 훈련에 기여했다고 보고됩니다. 이는 오픈 Agent 모델에서 데이터 합성 파이프라인 자체가 중요한 경쟁력이 될 수 있음을 시사합니다.
다만 전체 평가는 논문 본문에서 더 확인할 필요가 있습니다. 작업 품질을 어떻게 필터링했는지, 전문가 궤적이 얼마나 신뢰할 만한지, 현실 수요를 어떤 방식으로 모델링했는지, 특정 벤치마크에 과도하게 맞춰진 것은 아닌지 등이 주요 검토 지점입니다. 그럼에도 NexForge는 수작업 환경 구축에서 능력 요구사항 기반 자동 환경 합성으로 이동하는 흐름을 잘 보여줍니다.
Source: Hugging Face Daily Papers
댓글
로그인 상태 확인 중…
댓글 불러오는 중…