아티클 & 가이드

멀티모달

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 34개의 아티클

CCTest · Blog
JoyAI-Echo-1.5, 지속형 스토리와 인터랙티브 월드를 위한 장기 오디오·비주얼 생성
멀티모달
cctest.ai
멀티모달

JoyAI-Echo-1.5, 지속형 스토리와 인터랙티브 월드를 위한 장기 오디오·비주얼 생성

JoyAI-Echo-1.5는 장편 영상에서 인물의 외모와 목소리를 유지하고, 사용자 조작에 반응하는 인터랙티브 월드 생성을 목표로 하는 통합 오디오·비주얼 시스템입니다.

더 보기
CCTest · Blog
‘보는 것’에서 ‘행동하는 것’으로: 1인칭 지능 플랫폼이 되는 스마트 안경
멀티모달
cctest.ai
멀티모달

‘보는 것’에서 ‘행동하는 것’으로: 1인칭 지능 플랫폼이 되는 스마트 안경

새로운 서베이는 스마트 안경을 단순한 카메라나 디스플레이가 아니라 1인칭 지능 플랫폼으로 재정의한다. 핵심은 인식부터 행동까지의 고리를 실제 제약 속에서도 신뢰성 있고 교정 가능하게 유지하는 데 있다.

더 보기
CCTest · Blog
LAION-BVD, 멀티모달 사전학습을 위한 1천만 시간 공개 동영상 데이터셋
멀티모달
cctest.ai
멀티모달

LAION-BVD, 멀티모달 사전학습을 위한 1천만 시간 공개 동영상 데이터셋

LAION-BVD는 웹에서 수집한 동영상 URL을 바탕으로 약 8천만 개의 영상과 총 1천만 시간 분량을 제공하는 공개 데이터셋입니다. 장면 분할, 합성 캡션, 장면 전환 프레임 추출을 통해 영상·음성·이미지 사전학습을 지원합니다.

더 보기
CCTest · Blog
MOSS-VL, 말하면서 계속 보는 실시간 비전언어 모델
멀티모달
cctest.ai
멀티모달

MOSS-VL, 말하면서 계속 보는 실시간 비전언어 모델

MOSS-VL은 비전언어 모델의 핵심 능력으로 ‘말하는 동안에도 보기’를 내세운 오픈 모델군입니다. 게이트형 크로스 어텐션과 상호작용 중심 학습을 통해 새 프레임을 받으면서 발화, 침묵, 답변 수정을 결정하도록 설계됐습니다.

더 보기
CCTest · Blog
SPARGen: 3D 재구성·조밀 대응·공간 추론을 하나의 멀티모달 생성 모델로 통합
멀티모달
cctest.ai
멀티모달

SPARGen: 3D 재구성·조밀 대응·공간 추론을 하나의 멀티모달 생성 모델로 통합

SPARGen은 공간 지능에 필요한 여러 과제를 지시 조건부 생성 문제로 다시 정의한다. 핵심은 3D 재구성, 조밀 대응, 공간 추론을 별도 모듈이 아니라 하나의 네이티브 멀티모달 생성 프레임워크에서 다루는 것이다.

더 보기
CCTest · Blog
Evidence-RL: VLM이 ‘이미지 증거’를 보고 답하게 만드는 훈련법
멀티모달
cctest.ai
멀티모달

Evidence-RL: VLM이 ‘이미지 증거’를 보고 답하게 만드는 훈련법

Evidence-RL은 비전-언어 모델이 정답을 맞혔더라도 실제로 이미지의 핵심 증거를 사용했는지 검증하려는 연구다. CED는 증거 영역을 반사실적으로 중화해 답변이 해당 시각 증거에 의존하는지를 훈련 중 감사한다.

더 보기
CCTest · Blog
이미지 편집 AI, 이제는 화면을 보고 다음 수정안을 제안해야 한다
멀티모달
cctest.ai
멀티모달

이미지 편집 AI, 이제는 화면을 보고 다음 수정안을 제안해야 한다

이미지 생성 대화에서 유용한 후속 편집 제안은 채팅 텍스트만으로 만들 수 없다. 이 연구는 실제 서비스 데이터와 클릭 피드백, 시각 검증기를 결합해 현재 이미지에 맞는 다음 편집 추천을 개선한다.

더 보기
CCTest · Blog
VAD: 멀티모달 증류에서 교사 보정 속 시각 증거를 분리하다
멀티모달
cctest.ai
멀티모달

VAD: 멀티모달 증류에서 교사 보정 속 시각 증거를 분리하다

VAD는 멀티모달 on-policy 증류에서 교사 모델의 보정이 실제로 이미지 증거에 근거한 것인지 추정하는 방법이다. 전체 교사 신호를 그대로 따르기보다, 시각적으로 귀속 가능한 성분으로 학생 모델의 학습 목표를 재구성한다.

더 보기
CCTest · Blog
Mage-VL: 실시간 영상 이해를 위한 코덱 네이티브 멀티모달 모델
멀티모달
cctest.ai
멀티모달

Mage-VL: 실시간 영상 이해를 위한 코덱 네이티브 멀티모달 모델

Mage-VL은 영상 압축 과정에 이미 존재하는 모션 벡터와 잔차 정보를 활용해 시각 토큰 낭비를 줄이는 스트리밍 멀티모달 모델입니다. 모든 프레임을 균일하게 처리하는 대신, 변화가 크고 정보량이 높은 영역에 계산을 집중합니다.

더 보기