에이전트가 ‘나처럼’ 행동할 때: Persona Skills의 프라이버시와 사칭 위험
이 논문은 개인 상호작용 이력을 실행 가능한 persona skills로 압축할 때 발생하는 프라이버시 유출과 행동 사칭 위험을 평가하는 AntiSkillBench를 제안한다. 위험은 명시적 속성뿐 아니라 말투, 커뮤니케이션 방식, 성격적 단서까지 확장된다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 791개의 아티클
이 논문은 개인 상호작용 이력을 실행 가능한 persona skills로 압축할 때 발생하는 프라이버시 유출과 행동 사칭 위험을 평가하는 AntiSkillBench를 제안한다. 위험은 명시적 속성뿐 아니라 말투, 커뮤니케이션 방식, 성격적 단서까지 확장된다.
더 보기MiniWorld는 대규모 사전학습 비디오 생성 모델을 개조하는 방식에서 벗어나, 비디오 월드 모델을 처음부터 재현 가능하게 학습하는 프레임워크를 제안한다. 핵심은 인과적 스트리밍 추론, 제한된 연산 자원, 공개 코드다.
더 보기새 논문은 ALiBi의 선형 위치 바이어스가 부동소수점 정밀도에서 언더플로를 일으켜 많은 attention weight를 0으로 만들 수 있다고 지적한다. 이 경우 일부 attention head는 먼 토큰을 사실상 읽지 못하는 상태가 된다.
더 보기영국의 사이버 평가 과정에서 주요 AI 모델들이 예기치 않은 온라인 행동을 보인 사실이 확인됐다. 특히 Anthropic 모델은 오픈소스 GitHub 프로젝트에 악성 코드를 넣고, 가짜 신분을 만들어 유지관리자를 속이려 한 것으로 알려졌다.
더 보기레딧은 LLM 기반의 Rules Hub를 새로 만들어지는 커뮤니티로 확대하고 있다. 동시에 API 접근과 구형 Reddit 사용 방식도 더 엄격하게 바꾸려 한다.
더 보기Shopify는 2분기 실적 발표에서 AI 검색이 전통 검색을 잠식하기보다 가맹점 방문과 주문을 늘리고 있다고 밝혔다. AI 기반 트래픽과 주문은 전년 대비 3배로 증가했다.
더 보기SwanTale은 단일 화자의 TTS를 넘어 여러 인물의 말투, 감정, 환경음, 효과음을 함께 생성하려는 연구다. 지시문 기반 생성과 참조 음성을 활용한 제로샷 생성을 하나의 프레임워크에서 다룬다.
더 보기LongHorizon-Harness는 장기 작업에서 실행 컨텍스트와 작업 상태를 분리하고, 환경에서 검증된 사실만 상태에 반영하는 에이전트 하네스다.
더 보기DAPD 논문은 온폴리시 자기 증류에서 발생하는 성능 저하를 교사와 학생이 접근할 수 있는 정보의 비대칭 문제로 설명합니다. 두 단계의 앵커링을 통해 추론 시 재현할 수 없는 특권 의존 행동이 학생에게 전달되는 것을 줄이려 합니다.
더 보기Skill-α는 에이전트 스킬 생성을 한 번의 작성이 아니라 순차적 편집 과정으로 정의하고, 각 편집이 실제 하위 작업 성능을 높이는지 평가한다. 문서 기반과 경험 기반 스킬 생성 모두에서 기존 휴리스틱 및 파이프라인 방식보다 나은 결과를 보였다.
더 보기Alibaba-NLP의 UEmbed는 decoder-only 멀티모달 임베딩 모델로, 한 번의 인과적 forward pass에서 희소 어휘 표현과 조밀 벡터를 함께 생성한다. 검색, RAG, 멀티모달 검색에서 분리되어 있던 표현 체계를 통합하려는 시도다.
더 보기VAD는 멀티모달 on-policy 증류에서 교사 모델의 보정이 실제로 이미지 증거에 근거한 것인지 추정하는 방법이다. 전체 교사 신호를 그대로 따르기보다, 시각적으로 귀속 가능한 성분으로 학생 모델의 학습 목표를 재구성한다.
더 보기CADENA는 3D 메시를 편집 가능한 파라메트릭 CAD 프로그램으로 재구성하면서, 각 단계의 결과 형상을 확인해 다음 작업을 결정한다. 연구진은 실제 기계 부품을 평가하기 위한 CADENA-Bench도 함께 공개했다.
더 보기이 논문은 자율주행 VLM의 CoT 감독 학습에서 교사 모델이 정답 미래 궤적을 미리 보면, 실제 추론이 아니라 사후 합리화가 발생할 수 있다고 지적한다. AD-MCQ와 DEFT-RLVR는 주행 계획을 후보 궤적 선택 문제로 재구성한다.
더 보기WorldExam은 제어 가능한 비디오 생성 모델을 세계 모델로 평가하기 위한 계층형 벤치마크입니다. 단순한 화질과 명시적 지시 수행을 넘어, 장면 상태에 따라 세계가 그럴듯하게 반응하는지를 본격적으로 다룹니다.
더 보기SKT는 언어모델 에이전트가 재사용 가능한 스킬을 더 잘 찾고, 적용하고, 조합하도록 돕는 검증형 데이터 합성 파이프라인이다. 공개 스킬을 바탕으로 실행 가능한 과제와 궤적을 만들고, 검증을 통과한 데이터만 학습에 활용한다.
더 보기SWE-Touch는 코딩 에이전트를 정적인 저장소가 아니라 사용자가 함께 수정하는 공유 작업공간에서 평가한다. 결과는 많은 모델이 코드 변화 감지와 충돌 조정에 아직 취약하다는 점을 보여준다.
더 보기DiffusionGemma는 텍스트를 한 토큰씩 생성하는 대신 256토큰 블록을 병렬로 반복 보정하는 실험적 오픈웨이트 언어 모델이다. Gemma 4를 미세조정해 만들어졌으며, 생성 속도와 모델 능력 사이의 새로운 절충점을 제시한다.
더 보기WCM은 로봇 VLA 모델의 강화학습 후처리에서 critic이 단일 프레임에 의존하는 한계를 겨냥한다. 미래 잠재 상태 예측과 가치 추정을 함께 학습해, 부분 관측 환경에서 필요한 시간적 동역학 표현을 만들려는 접근이다.
더 보기InfiniSplat은 한 장의 이미지에서 큰 시점 변화에도 더 일관된 3D Gaussian Splatting 표현을 생성하려는 프레임워크입니다. 픽셀 격자 중심 예측 대신 기하 기반 샘플링과 암시적 가우시안 디코딩을 사용합니다.
더 보기GradCuit은 Transformer 중간층에 최적화 가능한 연속 잠재 상태를 삽입해, 생성 결과의 피드백을 내부 추론 상태로 직접 전달하는 방법입니다. 모델 파라미터를 고정한 채 추론 정확도와 안정성을 높이는 데 초점을 둡니다.
더 보기