아티클 & 가이드

AI 에이전트

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 105개의 아티클

CCTest · Blog
Iris, SFT와 강화학습의 반복으로 검색 에이전트를 고도화
AI 에이전트
cctest.ai
AI 에이전트

Iris, SFT와 강화학습의 반복으로 검색 에이전트를 고도화

Iris-mini와 Iris-pro는 웹 링크 구조에서 다단계 검색 과제를 만들고, 지도 미세조정과 온라인 강화학습을 번갈아 수행하는 검색 에이전트입니다. 긴 탐색 과정에서 증거를 관리하는 컨텍스트 관리도 핵심 설계 요소로 다뤄집니다.

더 보기
CCTest · Blog
Terminal-Universe: 에이전트 궤적을 재사용 가능한 터미널 환경으로
AI 에이전트
cctest.ai
AI 에이전트

Terminal-Universe: 에이전트 궤적을 재사용 가능한 터미널 환경으로

Terminal-Universe는 터미널 기반 코드 에이전트의 기존 실행 궤적에서 작업공간을 복원하고, 이를 바탕으로 검증 가능한 추가 작업을 생성하는 프레임워크입니다. 하나의 고정된 시연을 원래 작업 재현, 저장소 간 질의, 다중 턴 상호작용에 활용할 수 있는 환경으로 확장합니다.

더 보기
CCTest · Blog
Editable Visual Design: AI 이미지를 편집 가능한 디자인으로
AI 에이전트
cctest.ai
AI 에이전트

Editable Visual Design: AI 이미지를 편집 가능한 디자인으로

Editable Visual Design은 비전 언어 모델, 이미지 생성 모델, Coding Agent를 결합해 생성 이후에도 수정할 수 있는 시각 결과물을 만드는 방법을 제안한다. 최종 이미지를 평면 비트맵으로 내보내는 대신 생성 자산과 HTML/CSS를 구조적으로 결합하는 것이 핵심이다.

더 보기
CCTest · Blog
Open Flow 공개: AI Agent를 위한 워크플로 자동화 플랫폼
AI 에이전트
cctest.ai
AI 에이전트

Open Flow 공개: AI Agent를 위한 워크플로 자동화 플랫폼

OOMOL Lab이 AI Agent를 위한 워크플로 자동화 플랫폼 Open Flow를 오픈소스로 공개했다. 시각화 Workbench, 명령줄 인터페이스, 자체 호스팅 런타임을 통해 Agent가 노드를 만들고 워크플로를 구성·실행할 수 있도록 지원한다.

더 보기
CCTest · Blog
HarnessDev, LLM이 에이전트 실행 프레임워크를 만들고 진화시킬 수 있는지 평가
AI 에이전트
cctest.ai
AI 에이전트

HarnessDev, LLM이 에이전트 실행 프레임워크를 만들고 진화시킬 수 있는지 평가

HarnessDev는 에이전트의 최종 답변뿐 아니라 성능을 결정하는 실행 인프라 자체를 평가하는 벤치마크입니다. 생성된 프레임워크는 코드·검색·연구에서는 성숙한 인간 설계 시스템에 뒤졌지만, 글쓰기와 머신러닝 실험에서는 경쟁력 있는 결과를 보였습니다.

더 보기
CCTest · Blog
UI-Venus-2: 벤치마크를 넘어서는 멀티모달 GUI 에이전트
AI 에이전트
cctest.ai
AI 에이전트

UI-Venus-2: 벤치마크를 넘어서는 멀티모달 GUI 에이전트

UI-Venus-2는 실제 GUI 자동화를 가로막는 좁은 환경 범위, 취약한 작업 구성, 불안정한 결과 검증 문제를 겨냥한 기반 시스템입니다. 모바일·웹·데스크톱을 통합 추론-행동 루프로 다루고, 중요한 작업에는 안전 제어를 적용합니다.

더 보기
CCTest · Blog
CAST, 행동 비평 학습으로 장기 도구 호출 에이전트의 신뢰성 향상
AI 에이전트
cctest.ai
AI 에이전트

CAST, 행동 비평 학습으로 장기 도구 호출 에이전트의 신뢰성 향상

CAST는 작업의 성공·실패처럼 희소한 결과를 개별 행동을 검증하는 감독 신호로 바꾼다. 이를 통해 장기적이고 상태가 변하는 도구 호출 환경에서 실행 전 오류를 찾는 능력을 학습시키려 한다.

더 보기
CCTest · Blog
DS-Lighting, 데이터 과학 에이전트의 실행 하니스를 명시화하다
AI 에이전트
cctest.ai
AI 에이전트

DS-Lighting, 데이터 과학 에이전트의 실행 하니스를 명시화하다

데이터 과학 자동화의 결과는 언어 모델뿐 아니라 작업 표현, 실행 상태 관리, 산출물 제약, 평가 방식에도 좌우됩니다. DS-Lighting은 그동안 암묵적으로 처리되던 에이전트 하니스를 네 개의 계층으로 분리해 다룹니다.

더 보기
CCTest · Blog
EvoUndo: 스스로 진화하는 LLM 에이전트의 안전한 복구 검증
AI 에이전트
cctest.ai
AI 에이전트

EvoUndo: 스스로 진화하는 LLM 에이전트의 안전한 복구 검증

LLM 에이전트는 프롬프트와 도구, 실행 하니스를 직접 바꿀 수 있지만, 성공한 변경이 이후 상태에서도 되돌릴 수 있다는 보장은 없습니다. EvoUndo는 정확한 상태 식별과 복구 언어의 표현력이 검증 가능한 복구에 미치는 영향을 분석합니다.

더 보기
CCTest · Blog
AI 코딩은 빨라졌는데 왜 납품은 빨라지지 않을까: 샤오홍슈 Muse의 Agentic 실험
AI 에이전트
cctest.ai
AI 에이전트

AI 코딩은 빨라졌는데 왜 납품은 빨라지지 않을까: 샤오홍슈 Muse의 Agentic 실험

코드 생성 속도만 높아져서는 기업의 개발 납기가 단축되지 않는다. 샤오홍슈의 Muse는 컨텍스트 공유, Agent 오케스트레이션, 실행 단계 제어를 통해 기획부터 운영 반영까지 연결하려 한다.

더 보기