아티클 & 가이드

AI 에이전트

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 84개의 아티클

CCTest · Blog
PolicyGuide, 단일 행동 차단에서 전체 업무 흐름 안내로
AI 에이전트
cctest.ai
AI 에이전트

PolicyGuide, 단일 행동 차단에서 전체 업무 흐름 안내로

PolicyGuide는 조직 정책을 워크플로 그래프로 변환하고 사용자 발화가 끝날 때마다 에이전트의 상태를 선제적으로 검증한다. 위험한 행동만 막는 대신 누락된 절차를 찾아 정책에 맞는 다음 단계로 안내하는 접근법이다.

더 보기
CCTest · Blog
Nvidia 연구가 보여준 것: AI 에이전트의 진짜 주역은 모델보다 Harness
AI 에이전트
cctest.ai
AI 에이전트

Nvidia 연구가 보여준 것: AI 에이전트의 진짜 주역은 모델보다 Harness

Nvidia 연구진은 모델 자체를 바꾸지 않고도 주변 소프트웨어 계층을 조정해 장기 과제 성능을 크게 높였습니다. 기억 관리, 도구 사용, 감독 에이전트가 에이전트 시스템의 핵심 요소로 떠오르고 있습니다.

더 보기
CCTest · Blog
바이낸스, AI 에이전트 거래 허용…통제 책임은 결국 사용자에게
AI 에이전트
cctest.ai
AI 에이전트

바이낸스, AI 에이전트 거래 허용…통제 책임은 결국 사용자에게

바이낸스가 ChatGPT, Claude Code, Cursor 같은 AI 도구를 거래·결제·블록체인 인프라에 연결하는 Agent OS를 출시했다. 에이전트는 사용자를 대신해 주문할 수 있지만, 구체적인 위험 통제는 대부분 사용자가 설정해야 한다.

더 보기
CCTest · Blog
월가가 주요 AI 에이전트 8종 실측, Qwen Office 종합 1위
AI 에이전트
cctest.ai
AI 에이전트

월가가 주요 AI 에이전트 8종 실측, Qwen Office 종합 1위

제프리스 애널리스트들이 글로벌 주요 AI 에이전트 8개를 실제 사무 업무로 비교한 결과, 알리바바의 Qwen Office가 종합 1위를 차지했다. 이번 결과는 모델 성능뿐 아니라 실행 구조인 Harness와 작업당 비용이 기업 도입의 핵심 변수가 되고 있음을 보여준다.

더 보기
CCTest · Blog
Agentic ESOpt: 진화 전략으로 장기 작업 LLM 에이전트 미세 조정
AI 에이전트
cctest.ai
AI 에이전트

Agentic ESOpt: 진화 전략으로 장기 작업 LLM 에이전트 미세 조정

Agentic ESOpt는 길고 분기 많은 에이전트 작업을 미세 조정하기 위해 진화 전략을 활용하는 프레임워크를 제안한다. 추론에 가까운 GPU 메모리 사용 방식으로 매개변수를 탐색하고, 모델과 컨텍스트의 공동 최적화를 지향한다.

더 보기
CCTest · Blog
Agent Skills는 왜 효과적이고, 왜 실패하는가
AI 에이전트
cctest.ai
AI 에이전트

Agent Skills는 왜 효과적이고, 왜 실패하는가

여러 벤치마크와 에이전트 프레임워크, LLM을 대상으로 한 연구는 Agent Skills의 핵심 효과가 부족한 지식을 주입하는 데 있지 않고, noisy한 실행 기록을 안정적인 절차의 기준점으로 바꾸는 데 있다고 분석했다. 반면 스킬 풀이 커지면 검색이 새로운 병목으로 떠오른다.

더 보기
CCTest · Blog
데이터베이스 ACID를 AI 에이전트에 적용하다: 장기 작업을 위한 트랜잭션
AI 에이전트
cctest.ai
AI 에이전트

데이터베이스 ACID를 AI 에이전트에 적용하다: 장기 작업을 위한 트랜잭션

새 연구가 추론과 도구 사용, 코드 생성, 작업 공간 조작을 수행하는 LLM 에이전트를 위해 데이터베이스의 ACID 원칙을 재해석한 ‘에이전틱 트랜잭션’을 제안했다. 관련 벤치마크에서 기존 에이전트보다 10.6% 향상된 결과를 보고했다.

더 보기
CCTest · Blog
UI-Mate, 시연을 참고하고 화면에서 재계획하는 오픈 웨이트 GUI 에이전트
AI 에이전트
cctest.ai
AI 에이전트

UI-Mate, 시연을 참고하고 화면에서 재계획하는 오픈 웨이트 GUI 에이전트

UI-Mate는 환경 기반 학습 파이프라인과 문맥 내 시연 학습을 결합해 장기 컴퓨터 작업을 수행하는 GUI 에이전트입니다. 제공된 논문 요약에 따르면 UI-Mate-27B는 OSWorld-Verified에서 77.0%를 기록했습니다.

더 보기
CCTest · Blog
Ouroboros: 리뷰된 커밋으로 스스로 진화하는 코딩 에이전트
AI 에이전트
cctest.ai
AI 에이전트

Ouroboros: 리뷰된 커밋으로 스스로 진화하는 코딩 에이전트

Ouroboros는 도구, 프롬프트, 컨텍스트 조립 방식, 핵심 구현까지 개선 대상으로 삼는 자기 발전형 에이전트 하네스다. 논문은 여러 벤치마크에서 높은 성과를 보고하는 동시에, 자기 수정 에이전트의 안전 거버넌스를 핵심 과제로 제시한다.

더 보기
CCTest · Blog
Video-DeepResearch: 연속 비디오를 위한 차세대 멀티모달 연구 에이전트
AI 에이전트
cctest.ai
AI 에이전트

Video-DeepResearch: 연속 비디오를 위한 차세대 멀티모달 연구 에이전트

Video-DeepResearch는 정적 이미지 중심의 멀티모달 에이전트를 연속 비디오 스트림으로 확장한다. 시각 도구를 건너뛰고 텍스트 검색으로 바로 가는 편향과 내부 기억 의존 문제를 함께 겨냥한다.

더 보기
CCTest · Blog
Skill-α: 강화학습으로 AI 에이전트 스킬을 점진적으로 생성하다
AI 에이전트
cctest.ai
AI 에이전트

Skill-α: 강화학습으로 AI 에이전트 스킬을 점진적으로 생성하다

Skill-α는 에이전트 스킬 생성을 한 번의 작성이 아니라 순차적 편집 과정으로 정의하고, 각 편집이 실제 하위 작업 성능을 높이는지 평가한다. 문서 기반과 경험 기반 스킬 생성 모두에서 기존 휴리스틱 및 파이프라인 방식보다 나은 결과를 보였다.

더 보기