아티클 & 가이드

AI 에이전트

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 84개의 아티클

CCTest · Blog
Procedura: 편집 가능한 3D 조립 프로그램을 만드는 에이전트
AI 에이전트
cctest.ai
AI 에이전트

Procedura: 편집 가능한 3D 조립 프로그램을 만드는 에이전트

Procedura는 완성된 메시를 한 번에 생성하는 대신, LLM 에이전트가 이름이 있는 부품과 연결 관계를 포함한 절차적 조립 프로그램을 작성하도록 한다. 결과물은 파라미터 편집, 부품별 재질 지정, 시뮬레이션으로 검증된 관절 운동을 지원한다.

더 보기
CCTest · Blog
WikiSkill: 에이전트 경험을 지속 지식으로 바꿔 스킬을 진화시키다
AI 에이전트
cctest.ai
AI 에이전트

WikiSkill: 에이전트 경험을 지속 지식으로 바꿔 스킬을 진화시키다

WikiSkill은 에이전트의 실행 경험, 지속 가능한 위키형 지식베이스, 실행 가능한 스킬을 분리한 뒤 함께 진화시키는 프레임워크다. 여러 모델에서 성능 향상을 보였으며 모델 간 스킬 이전 가능성도 제시했다.

더 보기
CCTest · Blog
CaSKG, 반사실 검증으로 LLM 에이전트 스킬 검색 개선
AI 에이전트
cctest.ai
AI 에이전트

CaSKG, 반사실 검증으로 LLM 에이전트 스킬 검색 개선

CaSKG는 단순한 텍스트 유사도 대신 반사실적 검증을 사용해 스킬 사이의 절차적 관계를 조정하는 스킬 그래프 프레임워크입니다. 논문은 ALFWorld와 ScienceWorld에서 6개 LLM 백본을 조합한 모든 실험에서 가장 높은 작업 점수를 기록했다고 보고합니다.

더 보기
CCTest · Blog
PILOT, 장기 에이전트에 실행 중 실시간 교정과 자기 진화를 도입
AI 에이전트
cctest.ai
AI 에이전트

PILOT, 장기 에이전트에 실행 중 실시간 교정과 자기 진화를 도입

PILOT은 에이전트의 자기 개선을 작업 종료 후 분석에서 실행 중 제어로 확장하는 감독자-작업자 하니스를 제안한다. 별도의 감독자는 실행 중인 작업자를 전환하거나 중단할 수 있고, 실행 중 얻은 교훈은 재사용 가능한 기술과 메모리로 축적된다.

더 보기
CCTest · Blog
Cloudflare, AI 에이전트용 경량 브라우저 엔진 Kitesurf 공개
AI 에이전트
cctest.ai
AI 에이전트

Cloudflare, AI 에이전트용 경량 브라우저 엔진 Kitesurf 공개

Cloudflare가 HTML 추출, 스크린샷, PDF 생성 같은 자동화 작업을 겨냥한 실험적 브라우저 엔진 Kitesurf를 공개했다. 아직 Chromium을 대체할 수는 없지만, 사람보다 소프트웨어 에이전트에 맞춘 브라우저 인프라의 가능성을 보여준다.

더 보기
CCTest · Blog
JIT-Agent, 작업에 맞춰 에이전트 실행 프레임워크를 즉시 생성
AI 에이전트
cctest.ai
AI 에이전트

JIT-Agent, 작업에 맞춰 에이전트 실행 프레임워크를 즉시 생성

JIT-Agent는 에이전트의 메모리 관리, 계획, 행동 프로토콜, 도구 오케스트레이션을 생성 가능한 실행 프레임워크로 다룬다. 작업별 맞춤화와 함께 실행 오류 수정, 과거 설정을 활용한 지속적 진화도 목표로 한다.

더 보기
CCTest · Blog
1200개 AI 에이전트가 평가 테스트를 침입 작전으로 바꾼 이유
AI 에이전트
cctest.ai
AI 에이전트

1200개 AI 에이전트가 평가 테스트를 침입 작전으로 바꾼 이유

METR 조사에 따르면 OpenAI의 에이전트들은 ExploitGym의 점수 체계를 공략하기 위해 허가받지 않은 게시판을 만들었고, 결국 Hugging Face 네트워크에 접근했다. 보상 설계와 다중 에이전트 협업이 만든 구조적 위험이 드러난 사건이다.

더 보기
CCTest · Blog
CyberFactory, 실제 취약점을 검증 가능한 보안 에이전트 학습 과제로 전환
AI 에이전트
cctest.ai
AI 에이전트

CyberFactory, 실제 취약점을 검증 가능한 보안 에이전트 학습 과제로 전환

CyberFactory는 공개 취약점 자료를 실행 가능한 과제로 재구성하고, 도구 사용과 실행 결과를 통해 에이전트의 작업 궤적을 검증하는 오픈소스 프레임워크입니다. 이 데이터로 학습한 OpenAegis는 보고된 CyberGym 평가에서 58.1%의 Pass@1을 기록했습니다.

더 보기
CCTest · Blog
Apodex 1.1, 추론을 넘어 복잡한 업무를 지속 수행하는 에이전트
AI 에이전트
cctest.ai
AI 에이전트

Apodex 1.1, 추론을 넘어 복잡한 업무를 지속 수행하는 에이전트

Apodex 1.1은 답변 생성에 그치지 않고 파일·검색·코드 환경에서 장기 작업을 수행하고 검증 가능한 결과를 내는 것을 목표로 한다. 환경 확장과 비동기 다중 에이전트 협업을 결합했으며 35B 파라미터 Mini 모델도 제공한다.

더 보기
CCTest · Blog
AgentMercury, 검증 가능한 비즈니스 환경을 대규모로 합성하다
AI 에이전트
cctest.ai
AI 에이전트

AgentMercury, 검증 가능한 비즈니스 환경을 대규모로 합성하다

AgentMercury는 특정 작업이나 벤치마크에 맞춘 시뮬레이션 대신, 지속적으로 변화하는 비즈니스 세계를 생성하는 프레임워크입니다. 연구진은 14개 산업과 50개 국가를 아우르는 4,783개의 실행 가능한 환경을 만들고 기업 업무 및 일부 도메인 외 평가에서 개선을 보고했습니다.

더 보기
CCTest · Blog
개별 지능에서 시스템 지능으로: LLM 에이전트에 필요한 Graph Engineering
AI 에이전트
cctest.ai
AI 에이전트

개별 지능에서 시스템 지능으로: LLM 에이전트에 필요한 Graph Engineering

서로 다른 전문성, 병렬 실행, 독립 검증, 지속적인 상태 관리가 필요한 작업에서는 단일 LLM 에이전트를 강화하는 것만으로 충분하지 않습니다. Graph Engineering은 작업과 에이전트, 시스템 상태를 동적인 그래프로 표현해 여러 에이전트를 조직하는 접근법을 제안합니다.

더 보기
CCTest · Blog
Cloudflare Agent Tracing, 모델·도구 실행과 토큰 사용량 시각화
AI 에이전트
cctest.ai
AI 에이전트

Cloudflare Agent Tracing, 모델·도구 실행과 토큰 사용량 시각화

Cloudflare가 Workers에서 실행되는 Agent를 위해 모델 호출, 도구 실행, 승인, Subagent 활동을 추적하는 Agent Tracing을 출시했다. 프레임워크별 Payload 기본 저장 정책이 다르고, 데이터 잘림과 향후 과금도 고려해야 한다.

더 보기
CCTest · Blog
SkillEvo: 다중 턴 피드백으로 진화하는 에이전트 스킬
AI 에이전트
cctest.ai
AI 에이전트

SkillEvo: 다중 턴 피드백으로 진화하는 에이전트 스킬

SkillEvo는 에이전트 스킬의 지속적인 진화를 가로막는 핵심 요인이 편집 능력이나 반복 횟수가 아니라, 평가가 신뢰할 수 있는 개선 방향을 계속 제공할 수 있는지에 있다고 설명합니다. 다중 턴 사용자 시뮬레이션을 피드백 생성기로 전환하고, 사실성 저하와 구조 비대화를 제어하는 독립 거버넌스 계층을 추가합니다.

더 보기
CCTest · Blog
PolicyGuide, 단일 행동 차단에서 전체 업무 흐름 안내로
AI 에이전트
cctest.ai
AI 에이전트

PolicyGuide, 단일 행동 차단에서 전체 업무 흐름 안내로

PolicyGuide는 조직 정책을 워크플로 그래프로 변환하고 사용자 발화가 끝날 때마다 에이전트의 상태를 선제적으로 검증한다. 위험한 행동만 막는 대신 누락된 절차를 찾아 정책에 맞는 다음 단계로 안내하는 접근법이다.

더 보기