아티클 & 가이드

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 775개의 아티클

CCTest · Blog
GigaBrain-0.7, 3시스템 구조로 구현 지능의 일반화 확장
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

GigaBrain-0.7, 3시스템 구조로 구현 지능의 일반화 확장

GigaBrain-0.7은 시각·언어 이해, 세계 예측, 로봇 행동을 연결하는 3시스템 구조를 제안한 구현 지능 모델입니다. 3만7,000시간이 넘는 이기종 데이터를 활용해 서로 다른 로봇 본체와 작업으로의 일반화를 노립니다.

더 보기
CCTest · Blog
CyberFactory, 실제 취약점을 검증 가능한 보안 에이전트 학습 과제로 전환
AI 에이전트
cctest.ai
AI 에이전트

CyberFactory, 실제 취약점을 검증 가능한 보안 에이전트 학습 과제로 전환

CyberFactory는 공개 취약점 자료를 실행 가능한 과제로 재구성하고, 도구 사용과 실행 결과를 통해 에이전트의 작업 궤적을 검증하는 오픈소스 프레임워크입니다. 이 데이터로 학습한 OpenAegis는 보고된 CyberGym 평가에서 58.1%의 Pass@1을 기록했습니다.

더 보기
CCTest · Blog
LAION-BVD, 멀티모달 사전학습을 위한 1천만 시간 공개 동영상 데이터셋
멀티모달
cctest.ai
멀티모달

LAION-BVD, 멀티모달 사전학습을 위한 1천만 시간 공개 동영상 데이터셋

LAION-BVD는 웹에서 수집한 동영상 URL을 바탕으로 약 8천만 개의 영상과 총 1천만 시간 분량을 제공하는 공개 데이터셋입니다. 장면 분할, 합성 캡션, 장면 전환 프레임 추출을 통해 영상·음성·이미지 사전학습을 지원합니다.

더 보기
CCTest · Blog
‘보는 것’에서 ‘행동하는 것’으로: 1인칭 지능 플랫폼이 되는 스마트 안경
멀티모달
cctest.ai
멀티모달

‘보는 것’에서 ‘행동하는 것’으로: 1인칭 지능 플랫폼이 되는 스마트 안경

새로운 서베이는 스마트 안경을 단순한 카메라나 디스플레이가 아니라 1인칭 지능 플랫폼으로 재정의한다. 핵심은 인식부터 행동까지의 고리를 실제 제약 속에서도 신뢰성 있고 교정 가능하게 유지하는 데 있다.

더 보기
CCTest · Blog
중앙 지휘자 없이 수학을 탐구하는 AI 에이전트들
AI 과학 연구
cctest.ai
AI 과학 연구

중앙 지휘자 없이 수학을 탐구하는 AI 에이전트들

Station은 서로 다른 모델 계열의 AI 에이전트가 고정된 연구 절차나 중앙 조정자 없이 수학 문제를 함께 탐구하는 오픈월드 환경이다. 논문은 여러 구성 문제에서 기존 문헌 대비 새로운 결과를 보고하고, 대화 기록과 증명, 검증 코드도 공개했다.

더 보기
CCTest · Blog
로보틱스 스타트업 제너럴리스트, 약 2억 달러 추가 조달로 기업가치 30억 달러
비즈니스·투자
cctest.ai
비즈니스·투자

로보틱스 스타트업 제너럴리스트, 약 2억 달러 추가 조달로 기업가치 30억 달러

로봇용 AI 파운데이션 모델을 개발하는 제너럴리스트가 8VC가 주도한 추가 자금 조달을 통해 기업가치 30억 달러에 도달한 것으로 전해졌다. 이번 약 2억 달러 규모의 투자는 지난 6월 발표한 4억 달러 시리즈 B의 연장 라운드다.

더 보기
CCTest · Blog
OpenAI 데이터센터 책임자 퇴사, 고위급 인사 이탈 이어져
업계 동향
cctest.ai
업계 동향

OpenAI 데이터센터 책임자 퇴사, 고위급 인사 이탈 이어져

OpenAI의 전 데이터센터 책임자 크리스 말론이 인프라 조직 개편 이후 회사를 떠났다. 올해 주요 임원들의 연이은 이탈과 맞물리면서 데이터센터 확장 실행력과 조직 안정성, 향후 상장 준비에 대한 관심이 커지고 있다.

더 보기
CCTest · Blog
MobilePA-Bench, 복잡한 실제 작업으로 모바일 에이전트를 검증하다
모델 평가
cctest.ai
모델 평가

MobilePA-Bench, 복잡한 실제 작업으로 모바일 에이전트를 검증하다

MobilePA-Bench는 단순한 화면 조작을 넘어 도구 호출, 장기 계획, 메모리, 복합 스킬, 서브에이전트 협업을 평가하는 인터랙티브 벤치마크입니다. 엄격한 도구 순서와 권한 제한, 실행 중 오류가 발생하면 최신 LLM의 신뢰성이 크게 떨어지는 것으로 나타났습니다.

더 보기
CCTest · Blog
한 번의 성공은 신뢰성이 아니다: Thinkingbox로 업무 에이전트 평가하기
모델 평가
cctest.ai
모델 평가

한 번의 성공은 신뢰성이 아니다: Thinkingbox로 업무 에이전트 평가하기

Thinkingbox는 그럴듯한 답변이나 올바른 도구 호출을 넘어, 업무 흐름이 끝난 뒤 백엔드 상태가 요구사항과 일치하는지 검증합니다. 벤치마크 결과는 우연한 성공과 반복 가능한 실행 능력 사이에 큰 차이가 있음을 보여줍니다.

더 보기
CCTest · Blog
GameXpert-Bench: 게임 생성에서 실제 개발까지 평가하다
모델 평가
cctest.ai
모델 평가

GameXpert-Bench: 게임 생성에서 실제 개발까지 평가하다

GameXpert-Bench는 코딩 에이전트의 게임 개발 능력을 생성, 버그 수정, 다중 턴 최적화의 전체 과정에서 평가한다. 에이전트는 플레이 가능한 기반을 만드는 데는 강하지만, 능동적인 결함 발견과 런타임 검증, 회귀 방지에는 여전히 약점을 보인다.

더 보기
CCTest · Blog
검색은 좋아졌지만 견고성은 약해졌다: 멀티홉 RAG가 ASR 오류를 키우는 방식
RAG·검색
cctest.ai
RAG·검색

검색은 좋아졌지만 견고성은 약해졌다: 멀티홉 RAG가 ASR 오류를 키우는 방식

음성 기반 멀티홉 질의응답에서 더 풍부한 검색 구조가 절대 성능은 높이지만, 상류 음성인식 오류에는 오히려 더 취약할 수 있다는 연구 결과가 나왔다. 특히 질의 속 엔터티가 잘못 인식되는 현상이 오류 전파의 핵심 원인으로 나타났다.

더 보기
CCTest · Blog
RAG 인덱스를 확장하면 답변이 달라지는 이유
모델 평가
cctest.ai
모델 평가

RAG 인덱스를 확장하면 답변이 달라지는 이유

모델과 프롬프트, 검색 정책을 그대로 유지해도 검색 인덱스를 확장하면 같은 질문에 대한 답변이 바뀔 수 있다는 연구 결과가 나왔다. 연구진은 일반적인 생성 변동성과 인덱스 업데이트의 영향을 분리하는 ‘스냅샷 호환성 감사’를 제안했다.

더 보기
CCTest · Blog
RIBOSPAN, 전체 RNA 전사체를 위한 네이티브 장문맥 모델
AI 과학 연구
cctest.ai
AI 과학 연구

RIBOSPAN, 전체 RNA 전사체를 위한 네이티브 장문맥 모델

RIBOSPAN은 최대 10,240개 뉴클레오타이드의 문맥으로 사전학습한 16억 1천만 파라미터 양방향 RNA 파운데이션 모델입니다. 연구진은 짧은 문맥 모델을 추론 단계에서 확장하는 방식보다 네이티브 장문맥 학습이 전체 전사체 표현에 더 안정적일 수 있음을 보였습니다.

더 보기
CCTest · Blog
WorldToken, 시간 중심으로 로봇 모방학습을 설계하다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

WorldToken, 시간 중심으로 로봇 모방학습을 설계하다

WorldToken은 각 정책 시점의 다중 시점 이미지, 고유수용감각, 작업 조건을 하나의 월드 토큰으로 묶고 시간 순서로 모델링합니다. 실험은 목표 도메인 데이터와 긴 시간 문맥이 로봇 조작에 중요하다는 점을 보여줍니다.

더 보기
CCTest · Blog
ReWorld, 인터랙티브 월드 모델에 장기 기억을 더하다
월드 모델
cctest.ai
월드 모델

ReWorld, 인터랙티브 월드 모델에 장기 기억을 더하다

ReWorld는 학습 단계에서 단기 행동 제어와 장기 장면 기억을 분리하고, 추론 단계에서는 제한된 KV 캐시와 카메라 포즈 기반 랜드마크 검색을 결합합니다. 무한히 커지는 문맥 없이도 사용자가 다시 방문한 장소의 정보를 불러오려는 접근입니다.

더 보기