GraphForge, 증거 그래프로 검증 가능한 업무형 에이전트 학습 구축
배경
업무형 에이전트는 단순히 질문에 답하는 모델이 아닙니다. 다양한 형식의 파일을 읽고, 여러 도구를 조정하며, 여러 단계의 작업을 수행한 뒤 다른 사람이 확인할 수 있는 결과물을 만들어야 합니다. 하지만 이런 능력을 학습시키기 위한 데이터는 만들기 어렵습니다. 모델이 파일을 모두 생성하는 방식은 실제 업무의 복잡성과 다양성이 부족할 수 있고, 실제 파일을 활용하는 방식은 과제별 검증 기준이 빠지기 쉽습니다.
GraphForge는 파일 사이의 증거 관계를 중심에 놓고 이 문제를 다룹니다. 파일, 과제, 평가기를 서로 독립적으로 생성하는 대신 증거 그래프로 연결해 하나의 데이터 제작 흐름으로 구성합니다.
핵심 구성
- 직업 기반 시드: 직업 시나리오와 연결된 시드에서 시작해 과제의 유형을 통제하면서도 다양한 업무를 표현합니다.
- 실제 파일 작업 공간: 각 시드에 맞춰 실제 파일로 구성된 작업 환경을 조립합니다.
- 증거 그래프: 작업 공간에 포함된 파일과 파일 사이의 관계를 그래프로 기록하고, 과제 요구사항의 근거로 사용합니다.
- 추적 가능한 루브릭: 과제 지시는 그래프에서 도출되며, 각 평가 기준은 검증에 필요한 파일에 연결됩니다. 따라서 결과를 어떤 자료로 확인해야 하는지가 분명해집니다.
- 실행과 수정: 에이전트 궤적을 수집하기 전에 초기 실행으로 과제의 실행 가능성을 확인합니다. 원본 파일과 지시문 또는 루브릭이 맞지 않으면 수정 에이전트가 이를 보완합니다.
보고된 실험 결과
논문에 따르면 GraphForge 궤적 2,169개로 Qwen3.6-27B를 미세조정한 결과, OpenHands 환경의 GDPVal 점수는 1,445.7로 기준보다 65.7 높아졌습니다. Claude Code 환경에서는 Workspace-Bench-Lite가 63.7, SpreadsheetBench II가 24.0을 기록했으며, 각각 7.7과 13.7의 향상이 보고됐습니다.
연구진은 미세조정 모델이 직접 생성한 롤아웃에서도 후보를 뽑아 거부 미세조정을 진행했습니다. 이때 파일 근거에 연결된 루브릭을 선택 신호로 사용했고, 세 벤치마크 모두에서 추가 개선이 나타났다고 설명합니다. 이는 근거가 분명한 평가 기준이 결과 평가뿐 아니라 학습 사례 선별에도 활용될 수 있음을 시사합니다.
의미와 과제
GraphForge의 핵심은 현실적인 작업 환경, 실행 가능한 지시, 검증 가능한 결과, 후속 학습 데이터 선별을 한 흐름으로 묶는 데 있습니다. 실제 파일은 업무의 복잡성을 제공하고, 증거 그래프는 과제 요구를 제한하며, 실행 점검은 작동하지 않는 과제를 걸러냅니다. 파일과 연결된 루브릭은 결과를 확인할 경로를 제시합니다.
다만 제공된 자료만으로는 다양한 직업, 파일 형식, 장기 작업으로의 일반화 수준을 판단하기 어렵습니다. 파일의 권리와 개인정보 처리, 증거 그래프 구축 비용, 개방형 산출물에 대한 자동 평가의 안정성도 남은 과제입니다. 그럼에도 이 연구는 에이전트 데이터의 규모만 늘리는 것보다 작업 공간과 지시, 검증 근거가 일관된 고리를 이루는 것이 중요하다는 방향을 보여줍니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…