아티클 목록으로
AI 에이전트

CaSKG, 반사실 검증으로 LLM 에이전트 스킬 검색 개선

약 4분 소요

들어가며

LLM 에이전트가 행동을 수행하려면 성공 사례를 저장하는 것만으로는 부족합니다. 새로운 작업이 주어졌을 때 필요한 스킬을 찾아내고, 이를 실행 가능한 순서로 결합해야 합니다. 스킬 라이브러리가 커지면 적용 범위는 넓어지지만 검색 난도와 컨텍스트 비용도 함께 증가합니다. CaSKG(Counterfactual-Causal Skill Graphs)는 두 스킬이 문장상 비슷한지를 넘어, 실제 절차에서 한 스킬이 다른 스킬을 얼마나 뒷받침하는지에 주목합니다.

핵심 작동 방식

전체 라이브러리를 프롬프트에 넣는 방식은 높은 커버리지를 제공하지만 컨텍스트 비용이 큽니다. 벡터 검색은 후보를 압축하지만 스킬을 서로 독립적인 텍스트로 다루기 쉽습니다. 그래프 검색은 작업 흐름의 맥락을 복원할 수 있지만, 엣지가 부정확하면 잘못된 관계까지 확장할 수 있습니다. CaSKG는 검색 전에 그래프 엣지의 신뢰도를 보정하는 데 초점을 둡니다.

  • 높은 재현율의 후보 그래프 생성. 의미적·어휘적 단서, 스킬의 입력과 출력, 구조적 증거를 결합해 방향성 후보 관계를 만듭니다. 복구 관련 증거와 선택적 LLM 판정기를 사용해 후보 점수를 추가 조정할 수 있습니다.
  • 반사실 프로브로 관계 검증. 스킬 쌍에서 한 요소를 제거하거나 다른 것으로 바꾸고 순서를 뒤집은 텍스트를 만들어, 어떤 방향의 관계가 절차를 지지하는지 검사합니다. 여러 결과는 베이지안 평활화로 통합됩니다.
  • 상태 필터링 그래프를 실행 시 활용. 그래프는 오프라인에서 구축되며, 실행 중에는 현재 작업과 상태에 따라 검색 범위를 확장합니다. 이 과정에서 하위 에이전트 정책이나 작업 인터페이스를 변경하지 않습니다.

이 접근의 핵심은 “서로 관련되어 보이는 스킬”과 “실행 순서를 실제로 지지하는 스킬”을 구분하는 데 있습니다. 선행 조건, 환경 상태를 바꾸는 행동, 검증 절차, 최종 완료 단계가 방향성 있는 관계로 표현되면 검색 결과에서 중요한 절차가 빠질 가능성을 낮출 수 있습니다.

실험 결과와 의미

논문은 ALFWorld ID-140과 ScienceWorld U211에서 6개의 LLM 백본을 사용해 평가했습니다. 저자들은 CaSKG가 모델과 벤치마크의 12개 조합 모두에서 가장 높은 작업 점수를 달성했다고 보고합니다. Graph-of-Skills와 비교하면 6개 모델의 ScienceWorld 매크로 평균 점수는 72.62에서 80.50으로, ALFWorld 성공률은 80.01%에서 86.79%로 높아졌습니다. 두 벤치마크에서 평균 환경 단계 수도 감소했습니다. 정성 분석과 절제 실험은 보정된 엣지가 선행 조건, 상태 변화, 검증, 완료 절차를 검색 결과에 보존하는 데 도움을 준다는 점을 보여줍니다.

이 연구의 의미는 스킬의 개수보다 스킬을 연결하는 관계의 품질을 검색 문제의 핵심 변수로 본 데 있습니다. 가사 작업, 과학 실험, 도구 호출처럼 여러 단계가 필요한 환경에서는 선행 단계를 건너뛰거나 순서를 뒤집으면 관련 스킬을 검색해도 작업을 끝내기 어렵습니다. 더 작더라도 방향성이 신뢰할 만한 그래프가 단순히 많은 스킬을 추가하는 것보다 유용할 수 있습니다.

다만 결론은 논문이 보고한 두 벤치마크와 오프라인 그래프 구축 범위 안에서 해석해야 합니다. 텍스트 기반 반사실 프로브가 실제 환경의 인과 의존성을 얼마나 안정적으로 포착하는지, 스킬이 계속 변하는 환경에서 그래프를 유지하는 데 어떤 비용이 드는지는 추가 검증이 필요합니다. 그럼에도 CaSKG는 에이전트 정책을 바꾸지 않고 기억 구조를 개선해 실행 가능한 검색을 높이는 실용적인 방향을 제시합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
PILOT, 장기 에이전트에 실행 중 실시간 교정과 자기 진화를 도입
AI 에이전트
cctest.ai
AI 에이전트

PILOT, 장기 에이전트에 실행 중 실시간 교정과 자기 진화를 도입

PILOT은 에이전트의 자기 개선을 작업 종료 후 분석에서 실행 중 제어로 확장하는 감독자-작업자 하니스를 제안한다. 별도의 감독자는 실행 중인 작업자를 전환하거나 중단할 수 있고, 실행 중 얻은 교훈은 재사용 가능한 기술과 메모리로 축적된다.

더 보기
CCTest · Blog
WikiSkill: 에이전트 경험을 지속 지식으로 바꿔 스킬을 진화시키다
AI 에이전트
cctest.ai
AI 에이전트

WikiSkill: 에이전트 경험을 지속 지식으로 바꿔 스킬을 진화시키다

WikiSkill은 에이전트의 실행 경험, 지속 가능한 위키형 지식베이스, 실행 가능한 스킬을 분리한 뒤 함께 진화시키는 프레임워크다. 여러 모델에서 성능 향상을 보였으며 모델 간 스킬 이전 가능성도 제시했다.

더 보기