아티클 목록으로
AI 에이전트

GraphForge, 증거 그래프로 검증 가능한 업무형 에이전트 학습 구축

약 3분 소요

배경

업무형 에이전트는 단순히 질문에 답하는 모델이 아닙니다. 다양한 형식의 파일을 읽고, 여러 도구를 조정하며, 여러 단계의 작업을 수행한 뒤 다른 사람이 확인할 수 있는 결과물을 만들어야 합니다. 하지만 이런 능력을 학습시키기 위한 데이터는 만들기 어렵습니다. 모델이 파일을 모두 생성하는 방식은 실제 업무의 복잡성과 다양성이 부족할 수 있고, 실제 파일을 활용하는 방식은 과제별 검증 기준이 빠지기 쉽습니다.

GraphForge는 파일 사이의 증거 관계를 중심에 놓고 이 문제를 다룹니다. 파일, 과제, 평가기를 서로 독립적으로 생성하는 대신 증거 그래프로 연결해 하나의 데이터 제작 흐름으로 구성합니다.

핵심 구성

  • 직업 기반 시드: 직업 시나리오와 연결된 시드에서 시작해 과제의 유형을 통제하면서도 다양한 업무를 표현합니다.
  • 실제 파일 작업 공간: 각 시드에 맞춰 실제 파일로 구성된 작업 환경을 조립합니다.
  • 증거 그래프: 작업 공간에 포함된 파일과 파일 사이의 관계를 그래프로 기록하고, 과제 요구사항의 근거로 사용합니다.
  • 추적 가능한 루브릭: 과제 지시는 그래프에서 도출되며, 각 평가 기준은 검증에 필요한 파일에 연결됩니다. 따라서 결과를 어떤 자료로 확인해야 하는지가 분명해집니다.
  • 실행과 수정: 에이전트 궤적을 수집하기 전에 초기 실행으로 과제의 실행 가능성을 확인합니다. 원본 파일과 지시문 또는 루브릭이 맞지 않으면 수정 에이전트가 이를 보완합니다.

보고된 실험 결과

논문에 따르면 GraphForge 궤적 2,169개로 Qwen3.6-27B를 미세조정한 결과, OpenHands 환경의 GDPVal 점수는 1,445.7로 기준보다 65.7 높아졌습니다. Claude Code 환경에서는 Workspace-Bench-Lite가 63.7, SpreadsheetBench II가 24.0을 기록했으며, 각각 7.7과 13.7의 향상이 보고됐습니다.

연구진은 미세조정 모델이 직접 생성한 롤아웃에서도 후보를 뽑아 거부 미세조정을 진행했습니다. 이때 파일 근거에 연결된 루브릭을 선택 신호로 사용했고, 세 벤치마크 모두에서 추가 개선이 나타났다고 설명합니다. 이는 근거가 분명한 평가 기준이 결과 평가뿐 아니라 학습 사례 선별에도 활용될 수 있음을 시사합니다.

의미와 과제

GraphForge의 핵심은 현실적인 작업 환경, 실행 가능한 지시, 검증 가능한 결과, 후속 학습 데이터 선별을 한 흐름으로 묶는 데 있습니다. 실제 파일은 업무의 복잡성을 제공하고, 증거 그래프는 과제 요구를 제한하며, 실행 점검은 작동하지 않는 과제를 걸러냅니다. 파일과 연결된 루브릭은 결과를 확인할 경로를 제시합니다.

다만 제공된 자료만으로는 다양한 직업, 파일 형식, 장기 작업으로의 일반화 수준을 판단하기 어렵습니다. 파일의 권리와 개인정보 처리, 증거 그래프 구축 비용, 개방형 산출물에 대한 자동 평가의 안정성도 남은 과제입니다. 그럼에도 이 연구는 에이전트 데이터의 규모만 늘리는 것보다 작업 공간과 지시, 검증 근거가 일관된 고리를 이루는 것이 중요하다는 방향을 보여줍니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
X-Tree: 재사용 가능한 경험을 AI 에이전트 학습에 넣다
AI 에이전트
cctest.ai
AI 에이전트

X-Tree: 재사용 가능한 경험을 AI 에이전트 학습에 넣다

X-Tree는 에이전트 궤적에서 반복적으로 등장하고 성공과 관련된 행동 구간을 자동으로 찾아 재사용 가능한 경험 트리로 구성합니다. 추가적인 LLM 호출 없이 오프라인 강화학습, RLVR, 자기 증류에 활용할 수 있습니다.

더 보기
CCTest · Blog
LLM 에이전트는 왜 철회된 사용자 지시를 계속 따를까
AI 에이전트
cctest.ai
AI 에이전트

LLM 에이전트는 왜 철회된 사용자 지시를 계속 따를까

새 연구는 사용자가 바꾸거나 철회한 요구사항이 최종 답변과 도구 실행에 계속 영향을 미치는 현상을 측정 가능한 ‘의도 드리프트’로 정의했다. IntentFlux와 StateForge 평가 결과, 명시적인 상태 관리는 도움이 되지만 단일 턴 수준을 완전히 회복하지는 못했다.

더 보기
CCTest · Blog
OpenAI의 Dot, 저녁 주문도 가능한 기업용 소프트웨어형 에이전트
AI 에이전트
cctest.ai
AI 에이전트

OpenAI의 Dot, 저녁 주문도 가능한 기업용 소프트웨어형 에이전트

OpenAI의 Dots는 클라우드 컴퓨터와 데스크톱 앱, 음성 입력을 결합한 AI 에이전트다. 실제 사용에서는 웹사이트 개편과 영상 편집처럼 사용자가 통제하는 작업에 강했지만, 인증·로그인·결제 과정에서는 여전히 사람의 개입이 필요했다.

더 보기