아티클 & 가이드

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 791개의 아티클

CCTest · Blog
StartupBench, 실제 비즈니스 워크플로로 범용 에이전트를 검증하다
모델 평가
cctest.ai
모델 평가

StartupBench, 실제 비즈니스 워크플로로 범용 에이전트를 검증하다

StartupBench는 연구자가 임의로 고른 과제가 아니라 시장에서 수요가 확인된 AI 스타트업 제품의 워크플로를 기반으로 엔드투엔드 과제를 구성합니다. 평가된 모델 중 가장 강력한 모델도 전체 과제의 약 30%만 성공적으로 완료했습니다.

더 보기
CCTest · Blog
PTXBench, LLM의 아키텍처 특화 GPU 커널 최적화를 검증하다
모델 평가
cctest.ai
모델 평가

PTXBench, LLM의 아키텍처 특화 GPU 커널 최적화를 검증하다

PTXBench는 생성된 커널의 정합성뿐 아니라 목표 PTX 명령이 런타임에 실행되는지, 최첨단 라이브러리보다 실제로 빠른지를 함께 평가한다. 결과는 아키텍처 특화 명령을 사용하는 것과 경쟁력 있는 성능을 내는 것 사이에 여전히 간극이 있음을 보여준다.

더 보기
CCTest · Blog
OpenAI, 고객 데이터 보존 없는 안전 모니터링으로 Anthropic에 도전
AI 안전
cctest.ai
AI 안전

OpenAI, 고객 데이터 보존 없는 안전 모니터링으로 Anthropic에 도전

OpenAI가 일부 고객을 대상으로 여러 대화에 걸친 AI 오용을 탐지하면서도 고객 데이터를 보존하지 않는 Private Safety Processing을 미리 선보인다. 기업용 AI 시장에서 프라이버시와 안전성을 둘러싼 Anthropic과의 경쟁이 한층 치열해지는 모습이다.

더 보기
CCTest · Blog
AI는 확산됐지만 대중의 신뢰는 얻지 못했다
업계 동향
cctest.ai
업계 동향

AI는 확산됐지만 대중의 신뢰는 얻지 못했다

AI가 검색, 이메일, TV 같은 일상 제품에 빠르게 들어가고 있지만 사용 확산이 곧 수용으로 이어지지는 않고 있다. 일자리와 저작권, 데이터센터 비용, 기업 책임에 대한 우려가 AI를 단순한 홍보 문제가 아닌 사업상의 신뢰 위기로 만들고 있다.

더 보기
CCTest · Blog
Meta 광고에 AI ‘탈의’ 앱 등장…여성 정치인 노린 딥페이크 논란
AI 안전
cctest.ai
AI 안전

Meta 광고에 AI ‘탈의’ 앱 등장…여성 정치인 노린 딥페이크 논란

Meta 플랫폼에서 비동의 성적 딥페이크 생성을 조장하는 것으로 보이는 AI 서비스 Kromix의 광고가 노출됐다. 광고 중 하나는 미국의 유명 여성 정치인과 매우 흡사한 얼굴을 포르노 영상에 사용했다.

더 보기
CCTest · Blog
MOSS-VL, 말하면서 계속 보는 실시간 비전언어 모델
멀티모달
cctest.ai
멀티모달

MOSS-VL, 말하면서 계속 보는 실시간 비전언어 모델

MOSS-VL은 비전언어 모델의 핵심 능력으로 ‘말하는 동안에도 보기’를 내세운 오픈 모델군입니다. 게이트형 크로스 어텐션과 상호작용 중심 학습을 통해 새 프레임을 받으면서 발화, 침묵, 답변 수정을 결정하도록 설계됐습니다.

더 보기
CCTest · Blog
HarmProfile: 프런티어 LLM의 유해 출력을 위험 분포로 분석하다
AI 안전
cctest.ai
AI 안전

HarmProfile: 프런티어 LLM의 유해 출력을 위험 분포로 분석하다

HarmProfile은 유해 생성을 단순한 탈옥 공격의 성공 결과가 아니라 분석해야 할 대상으로 다룬다. 연구는 프런티어 모델마다 고유한 위험 프로필이 있으며, 모델 능력이 높아질수록 유해성과 출력 다양성이 커질 수 있음을 보여준다.

더 보기
CCTest · Blog
데이터베이스 ACID를 AI 에이전트에 적용하다: 장기 작업을 위한 트랜잭션
AI 에이전트
cctest.ai
AI 에이전트

데이터베이스 ACID를 AI 에이전트에 적용하다: 장기 작업을 위한 트랜잭션

새 연구가 추론과 도구 사용, 코드 생성, 작업 공간 조작을 수행하는 LLM 에이전트를 위해 데이터베이스의 ACID 원칙을 재해석한 ‘에이전틱 트랜잭션’을 제안했다. 관련 벤치마크에서 기존 에이전트보다 10.6% 향상된 결과를 보고했다.

더 보기