아티클 목록으로
AI 에이전트

Dr. Claw, 코딩 에이전트를 감사 가능한 AI 연구 워크스페이스로

약 3분 소요

들어가며

명령줄 기반 코딩 에이전트는 이미 파일을 읽고 쓰고, 도구를 실행하며, 긴 세션을 유지할 수 있습니다. 그러나 이러한 기능만으로 전체 연구 과정이 일관되게 연결되지는 않습니다. 연구 계획은 채팅에, 코드와 데이터는 터미널에, 최종 문서는 별도의 작성 환경에 남는 경우가 많습니다. 작업이 중단되면 연구자가 어떤 결정을 내렸는지, AI가 무엇을 실행했는지, 어디에서 다시 시작해야 하는지를 복원하기도 어렵습니다.

Dr. Claw는 이 문제를 새로운 자율 에이전트가 아니라 작업공간 설계로 풀려 합니다. Claude Code, Codex, Gemini CLI 같은 기존 실행기를 연구에 맞는 인간 참여형 workflow 안에 배치해 통제성과 감사 가능성을 높이는 방식입니다.

핵심 내용

  • 기존 실행기를 감싸는 구조: 핵심은 새로운 기반 모델이 아니라 작업을 조직하고 상태를 관리하는 오케스트레이션 계층입니다.
  • 연구 상태의 지속성: 작업 그래프와 영속 상태 객체가 계획, 실행, 검토, 집필을 연결합니다. 진행 상황이 한 번의 대화 문맥에만 남지 않으므로 중단된 작업을 이어갈 수 있습니다.
  • 재사용 가능한 스킬: 스킬 라이브러리는 반복되는 연구 절차와 작업 방식을 정리합니다. 이를 통해 경험을 재사용하고 AI의 실행 범위를 더 쉽게 파악할 수 있습니다.
  • 인간의 판단 유지: 연구자는 작업 분해, 진행 판단, 예외 처리에 참여합니다. 시스템이 전체 과정을 보이지 않는 자율 루프에 맡기는 방식은 아닙니다.
  • 복수 실행기 조정: 여러 실행기를 동일한 workflow에 연결해 역할 분담과 결과 전달을 명확하게 만들 수 있습니다.

평가와 영향

프로젝트는 세 개의 화면으로 구성된 상호작용 시나리오와 실패 복구 과정을 통해 사용 방식을 보여줍니다. 또한 동일한 백엔드 실행기를 사용하는 단순 명령줄 에이전트와 비교했습니다. 따라서 비교 대상은 서로 다른 모델이 아니라 작업 그래프, 상태 객체, 스킬 라이브러리로 구성된 전체 오케스트레이션 계층입니다.

제공된 자료에 따르면 실행기를 동일하게 유지한 비교에서 Dr. Claw는 연구 완성도가 더 높았고, 감사 가능하며 복구할 수 있는 과정 기록을 남겼습니다. 이는 에이전트의 발전이 더 높은 자율성만으로 결정되지 않고, 장기 작업을 관리하는 workflow 설계에도 달려 있음을 보여줍니다.

물론 기록이 남는다고 해서 연구 결과의 정확성이 자동으로 보장되는 것은 아닙니다. 증거를 검증하고 결론을 평가하는 책임은 여전히 연구자에게 있습니다. 그럼에도 AI가 실행과 보조를 담당하고 인간이 목표, 근거, 중요한 판단을 통제하도록 역할을 나누면, AI 지원 연구를 더 쉽게 검토하고 중단 지점에서 복구할 수 있습니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
멀티 에이전트 LLM의 반성을 검증 가능한 개선으로 바꾸기
AI 에이전트
cctest.ai
AI 에이전트

멀티 에이전트 LLM의 반성을 검증 가능한 개선으로 바꾸기

새 연구는 오케스트레이터와 워커의 상호작용을 이중 수준 협력 게임으로 모델링하고, 환경 기반 평가를 통과한 기억만 업데이트하는 방법을 제안했다. 생성된 텍스트만 보는 반성 게이트는 모든 환경에서 개선을 보장할 수 없다는 것이 핵심이다.

더 보기