아티클 & 가이드

비전·비디오

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 39개의 아티클

CCTest · Blog
ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해
비전·비디오
cctest.ai
비전·비디오

ShallowStream: 얕은 층으로 색인하고 깊은 층으로 답하는 영상 이해

ShallowStream은 MLLM의 얕은 층을 활용해 스트리밍 영상의 프레임 인코딩과 검색 색인 구축을 수행하고, 질의가 들어올 때만 깊은 층을 사용합니다. 논문은 프레임별 프리필 지연을 최대 52.1배, 10초 엔드투엔드 지연을 최대 11.9배 줄였다고 보고합니다.

더 보기
CCTest · Blog
DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행
비전·비디오
cctest.ai
비전·비디오

DM-Align, 동영상 생성의 증류와 선호 정렬을 한 번에 수행

arXiv 연구가 동영상 생성 모델의 증류와 인간 선호 정렬을 단일 단계에서 결합하는 DM-Align을 제안했다. 샘플 분포 차이로 선호 유도 그래디언트를 구성해 기존 강화학습 파이프라인의 계산량과 불안정성을 줄이는 것이 목표다.

더 보기
CCTest · Blog
장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까
비전·비디오
cctest.ai
비전·비디오

장시간 동영상 모델은 시각 토큰을 어떻게 배분해야 할까

장시간 동영상 멀티모달 모델에서 프레임 선택, 공간 압축, 절약한 예산의 재투자를 분리해 비교한 연구가 나왔다. 결과적으로 중요한 것은 프레임을 무조건 선명하게 만드는 것이 아니라, 질문과 관련된 시간적 증거를 더 넓게 확보하는 것으로 나타났다.

더 보기
CCTest · Blog
Gemini, 볼 곳을 스스로 찾는 에이전틱 동영상 이해 기능 공개
비전·비디오
cctest.ai
비전·비디오

Gemini, 볼 곳을 스스로 찾는 에이전틱 동영상 이해 기능 공개

Google DeepMind가 Gemini에 Agentic Video Understanding을 도입했습니다. 모델이 영상, 오디오, 자막을 상황에 맞게 검색하고 다시 확인하며, 공식 벤치마크에서 토큰 사용량은 최대 88%, 비용은 최대 66% 줄고 정확도는 최대 7% 향상됐다고 밝혔습니다.

더 보기
CCTest · Blog
Luce, 한 장의 이미지로 재조명 가능한 3D 에셋 생성
비전·비디오
cctest.ai
비전·비디오

Luce, 한 장의 이미지로 재조명 가능한 3D 에셋 생성

Luce는 기하 구조와 PBR 재질을 통합한 멀티모달 Gaussian 표현을 제안하고, 단일 이미지에서 재조명 가능한 3D 에셋을 생성합니다. PBR Gaussian과 함께 텍스처 메시 및 탄젠트 공간 노멀 맵도 선택적으로 출력할 수 있습니다.

더 보기
CCTest · Blog
고덕, 12프레임으로 만 프레임급 3D 재구성하는 ABot-Recon 공개
비전·비디오
cctest.ai
비전·비디오

고덕, 12프레임으로 만 프레임급 3D 재구성하는 ABot-Recon 공개

고덕이 최근 12개 프레임만을 국소 문맥으로 활용해 긴 영상의 3D 장면을 순차적으로 재구성하는 모델 ABot-Recon을 공개했다. 장기 메모리 의존을 없애 장거리 시퀀스에서 발생하는 오차 누적, 속도 저하, 메모리 증가 문제를 줄이는 것이 핵심이다.

더 보기
CCTest · Blog
InfinityEdit, 고정 영상 편집을 무한 스트리밍 편집으로 확장
비전·비디오
cctest.ai
비전·비디오

InfinityEdit, 고정 영상 편집을 무한 스트리밍 편집으로 확장

InfinityEdit는 완성된 영상 클립을 프레임 단위로 다시 쓰는 대신, 편집 지시를 반영하면서 앞으로 이어질 영상 구간을 생성하는 방식을 제안합니다. 영상 이력, 시간적 인과성, 편집 텍스트를 연결하는 경량 어댑터로 스트리밍 영상 생성기에 편집 기능을 더합니다.

더 보기
CCTest · Blog
4DAnyone: 일반 단안 영상에서 동적 4D 인물 재구성
비전·비디오
cctest.ai
비전·비디오

4DAnyone: 일반 단안 영상에서 동적 4D 인물 재구성

4DAnyone은 보정되지 않은 단안 인물 영상에서 시점 간 일관성이 높은 다중 시점 영상을 생성한 뒤 이를 4D Gaussian Splatting으로 변환합니다. 늘어나는 참조 정보와 분할된 시점 그룹 사이의 구조적 불일치를 두 가지 컨텍스트 설계로 해결하려 합니다.

더 보기
CCTest · Blog
JoyAI-Video-Edit: 실시간 개방형 비디오 편집을 위한 자기회귀 확산
비전·비디오
cctest.ai
비전·비디오

JoyAI-Video-Edit: 실시간 개방형 비디오 편집을 위한 자기회귀 확산

미래 프레임 없이, 길이도 미리 정하지 않은 상태에서 비디오를 편집하는 것은 쉽지 않습니다. JoyAI-Video-Edit는 자기회귀 확산과 증류 전략을 결합해 실시간성과 원본 보존을 함께 노립니다.

더 보기
CCTest · Blog
InfiniSplat: 단일 이미지 3DGS를 표면 정렬 표현으로 확장하다
비전·비디오
cctest.ai
비전·비디오

InfiniSplat: 단일 이미지 3DGS를 표면 정렬 표현으로 확장하다

InfiniSplat은 한 장의 이미지에서 큰 시점 변화에도 더 일관된 3D Gaussian Splatting 표현을 생성하려는 프레임워크입니다. 픽셀 격자 중심 예측 대신 기하 기반 샘플링과 암시적 가우시안 디코딩을 사용합니다.

더 보기
CCTest · Blog
VideoCoCo: Blender 코드를 비디오 생성의 과정 추론으로 활용하다
비전·비디오
cctest.ai
비전·비디오

VideoCoCo: Blender 코드를 비디오 생성의 과정 추론으로 활용하다

VideoCoCo는 텍스트 프롬프트를 실행 가능한 Blender 프로그램으로 바꾼 뒤, 시뮬레이션 초안을 사실적인 영상으로 편집하는 이중 엔진 프레임워크다. 핵심 목표는 텍스트-비디오 생성에서 부족했던 물리적 일관성을 높이는 것이다.

더 보기
CCTest · Blog
O-VAD, 산업 영상 이상 탐지를 클립 판단에서 객체 상태 추론으로 전환하다
비전·비디오
cctest.ai
비전·비디오

O-VAD, 산업 영상 이상 탐지를 클립 판단에서 객체 상태 추론으로 전환하다

O-VAD는 산업 공정 영상에서 객체를 분할·추적하고 시간에 따른 상태 궤적을 추론해 이상을 찾는 학습 불필요 프레임워크다. 핵심 주장은 프런티어 VLM의 산업 현장 성능 저하가 추론 능력 부족보다 객체 수준 증거 부족에서 비롯된다는 것이다.

더 보기
CCTest · Blog
생성 비디오가 같은 장소를 기억하게 하는 학습 없는 일관성 기법
비전·비디오
cctest.ai
비전·비디오

생성 비디오가 같은 장소를 기억하게 하는 학습 없는 일관성 기법

이 논문은 3D 엔진 조건 기반 장기 비디오 생성에서 카메라가 같은 장소를 다시 방문할 때 외관이 달라지는 문제를 다룬다. 과거 잠재 청크를 KV cache로 되돌리고, 자세와 깊이 재투영으로 attention을 유도해 추가 학습 없이 일관성을 높인다.

더 보기