아티클 & 가이드

멀티모달

Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우

총 34개의 아티클

CCTest · Blog
블랙포레스트랩스, 네이티브 오디오·비디오 생성을 앞세운 Flux3 공개
멀티모달
cctest.ai
멀티모달

블랙포레스트랩스, 네이티브 오디오·비디오 생성을 앞세운 Flux3 공개

독일 AI 스타트업 블랙포레스트랩스가 멀티모달 기반 모델 Flux3를 발표했다. 이 모델은 Self-Flow 아키텍처를 기반으로 이미지, 비디오, 오디오, 액션 정보를 통합적으로 이해하고 생성하는 것을 목표로 한다.

더 보기
CCTest · Blog
KnowAct-GUIClaw: 기억과 스킬로 자기 진화하는 개인 GUI 어시스턴트
멀티모달
cctest.ai
멀티모달

KnowAct-GUIClaw: 기억과 스킬로 자기 진화하는 개인 GUI 어시스턴트

KnowAct-GUIClaw는 “Know Deeply, Act Perfectly” 패러다임을 바탕으로 OpenClaw의 크로스플랫폼 GUI 조작 한계와 자기 진화 메커니즘 부족을 보완하려는 프레임워크다. 경험 기반 메모리, 자기 진화형 스킬 라이브러리, 반성 과정을 결합해 개인 어시스턴트의 실행 능력을 지속적으로 높이는 데 초점을 둔다.

더 보기
CCTest · Blog
Boogu-Image-0.1 공개: 오픈소스 통합 멀티모달 이미지 모델의 도전
멀티모달
cctest.ai
멀티모달

Boogu-Image-0.1 공개: 오픈소스 통합 멀티모달 이미지 모델의 도전

Boogu-Image-0.1은 이미지 생성, 편집, 빠른 추론, 중국어·영어 텍스트 렌더링을 겨냥한 오픈소스 통합 멀티모달 모델 제품군이다. 논문은 제한된 컴퓨팅 환경에서도 데이터, 학습 파이프라인, 추론 시 확장을 최적화하면 폐쇄형 시스템에 가까운 성능을 낼 수 있다고 설명한다.

더 보기
CCTest · Blog
FM²: 이기종 멀티모달 의료영상 연합 기반모델 프레임워크
멀티모달
cctest.ai
멀티모달

FM²: 이기종 멀티모달 의료영상 연합 기반모델 프레임워크

FM²는 의료영상 기반모델이 필요로 하는 다기관 데이터와, 환자 데이터를 중앙에 모으기 어려운 개인정보 보호 제약 사이의 간극을 겨냥한다. 논문은 기관별 영상 모달리티 차이를 핵심 문제로 정의하고 연합학습 기반 해법을 제시한다.

더 보기
CCTest · Blog
CF-Net: 영상 속 망설임을 ‘멀티모달 충돌’로 읽는 모델
멀티모달
cctest.ai
멀티모달

CF-Net: 영상 속 망설임을 ‘멀티모달 충돌’로 읽는 모델

arXiv 논문 CF-Net은 비정형 영상에서 ambivalence/hesitancy, 즉 양가감정과 망설임을 인식하기 위한 멀티모달 모델을 제안한다. 핵심은 표준적인 감정 표현보다 시각·음성·텍스트 사이의 미묘한 불일치를 보는 것이다.

더 보기
CCTest · Blog
슬라이스 단위 추론으로 3D 의료 멀티모달 LLM 강화
멀티모달
cctest.ai
멀티모달

슬라이스 단위 추론으로 3D 의료 멀티모달 LLM 강화

arXiv에 공개된 새 논문은 2D 사전학습 의료 멀티모달 대형언어모델이 3D 체적 영상을 더 잘 이해하도록 슬라이스 단위 데이터 합성 방식을 제안한다. 핵심은 최종 답변이 아니라 진단에 가까운 공간 추론 과정을 학습시키는 것이다.

더 보기