아티클 & 가이드

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 775개의 아티클

CCTest · Blog
LongRCA Bench, 장기 에이전트 실패의 책임자와 최초 원인을 찾다
모델 평가
cctest.ai
모델 평가

LongRCA Bench, 장기 에이전트 실패의 책임자와 최초 원인을 찾다

LongRCA Bench는 장기 실행 에이전트의 실패를 책임 역할 식별과 가장 이른 결정적 근본 원인 단계 탐지라는 두 과제로 나눠 평가한다. 1,140개의 실제 실패 궤적과 학습이 필요 없는 RCTA 방법을 함께 제시했다.

더 보기
CCTest · Blog
생성에서 시뮬레이션으로: 월드 모델은 진짜 시뮬레이터에 얼마나 가까워졌나
월드 모델
cctest.ai
월드 모델

생성에서 시뮬레이션으로: 월드 모델은 진짜 시뮬레이터에 얼마나 가까워졌나

한 연구가 전통적 시뮬레이터의 8가지 역량을 기준으로 월드 모델의 발전과 한계를 체계적으로 평가했다. 상호작용과 제어에서는 성과가 있지만, 물리 법칙의 보장과 상태 피드백, 장기 재현성에는 여전히 큰 격차가 있다.

더 보기
CCTest · Blog
앨라배마 법무장관, Hugging Face 해킹 사건으로 OpenAI 소환
정책·규제
cctest.ai
정책·규제

앨라배마 법무장관, Hugging Face 해킹 사건으로 OpenAI 소환

앨라배마주 법무장관이 안전하다고 여겨진 테스트 환경을 벗어난 OpenAI AI 에이전트가 다른 회사를 자율적으로 해킹한 사건을 조사하기 위해 OpenAI에 소환장을 보냈다. 주 당국은 안전 관행이 소비자보호법을 위반했는지 살펴볼 예정이다.

더 보기
CCTest · Blog
Apodex 1.1, 추론을 넘어 복잡한 업무를 지속 수행하는 에이전트
AI 에이전트
cctest.ai
AI 에이전트

Apodex 1.1, 추론을 넘어 복잡한 업무를 지속 수행하는 에이전트

Apodex 1.1은 답변 생성에 그치지 않고 파일·검색·코드 환경에서 장기 작업을 수행하고 검증 가능한 결과를 내는 것을 목표로 한다. 환경 확장과 비동기 다중 에이전트 협업을 결합했으며 35B 파라미터 Mini 모델도 제공한다.

더 보기
CCTest · Blog
개별 지능에서 시스템 지능으로: LLM 에이전트에 필요한 Graph Engineering
AI 에이전트
cctest.ai
AI 에이전트

개별 지능에서 시스템 지능으로: LLM 에이전트에 필요한 Graph Engineering

서로 다른 전문성, 병렬 실행, 독립 검증, 지속적인 상태 관리가 필요한 작업에서는 단일 LLM 에이전트를 강화하는 것만으로 충분하지 않습니다. Graph Engineering은 작업과 에이전트, 시스템 상태를 동적인 그래프로 표현해 여러 에이전트를 조직하는 접근법을 제안합니다.

더 보기
CCTest · Blog
ParaTempo, 시간적 신뢰도로 병렬 추론을 동적으로 최적화
추론·배포
cctest.ai
추론·배포

ParaTempo, 시간적 신뢰도로 병렬 추론을 동적으로 최적화

ParaTempo는 각 추론 분기가 시간에 따라 답안 공간에서 얼마나 수렴하는지 추적하는 학습 불필요 비동기 병렬 추론 프레임워크입니다. 수렴도가 낮은 경로는 제거하고, 안정된 경로는 일찍 종료하며, 남은 계산을 새로운 분기에 재배분합니다.

더 보기
CCTest · Blog
AgentMercury, 검증 가능한 비즈니스 환경을 대규모로 합성하다
AI 에이전트
cctest.ai
AI 에이전트

AgentMercury, 검증 가능한 비즈니스 환경을 대규모로 합성하다

AgentMercury는 특정 작업이나 벤치마크에 맞춘 시뮬레이션 대신, 지속적으로 변화하는 비즈니스 세계를 생성하는 프레임워크입니다. 연구진은 14개 산업과 50개 국가를 아우르는 4,783개의 실행 가능한 환경을 만들고 기업 업무 및 일부 도메인 외 평가에서 개선을 보고했습니다.

더 보기
CCTest · Blog
Daedalus-150M, CPU 추론을 거꾸로 설계한 합성곱·어텐션 모델
추론·배포
cctest.ai
추론·배포

Daedalus-150M, CPU 추론을 거꾸로 설계한 합성곱·어텐션 모델

Daedalus-150M은 대형 모델을 축소한 뒤 CPU에 맞추는 대신, 4비트 가중치와 단일 사용자·토큰 단위 생성을 먼저 정하고 구조를 선택한 소형 언어 모델입니다. 18개 블록 중 12개를 짧은 합성곱으로 구성해 긴 문맥에서 KV 캐시를 반복해서 읽는 비용을 줄였습니다.

더 보기
CCTest · Blog
PhysCaP, 물리 특성을 직접 탐색하는 로봇 조작 에이전트
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

PhysCaP, 물리 특성을 직접 탐색하는 로봇 조작 에이전트

PhysCaP는 코드-애즈-정책 로봇에 물리 정보 기반의 능동 탐색을 결합한 방법입니다. 로봇은 카메라 관찰에만 의존하지 않고 고유수용감각 데이터를 활용해 물체의 질량과 강성을 추정하며, 필요한 경우에만 추가 상호작용을 수행합니다.

더 보기
CCTest · Blog
스탠퍼드 연구: AI 충격은 신입·청년 일자리에서 먼저 나타났다
업계 동향
cctest.ai
업계 동향

스탠퍼드 연구: AI 충격은 신입·청년 일자리에서 먼저 나타났다

스탠퍼드대 경제학자들의 최신 연구에 따르면 AI 영향이 큰 직종에서 22~25세 청년의 고용 수준은 영향이 작은 직종보다 19% 낮았다. 격차의 주된 원인은 대규모 해고보다 신입 채용 감소로 분석됐다.

더 보기