DataPrep-Bench: LLM의 학습 데이터 준비 능력을 평가하다
DataPrep-Bench는 LLM, 에이전트, 데이터 워크플로가 학습 데이터를 얼마나 잘 준비하는지 하위 학습 성능으로 평가하는 벤치마크입니다. 텍스트의 표면적 품질보다 실제 훈련 효용에 초점을 맞춥니다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 795개의 아티클
DataPrep-Bench는 LLM, 에이전트, 데이터 워크플로가 학습 데이터를 얼마나 잘 준비하는지 하위 학습 성능으로 평가하는 벤치마크입니다. 텍스트의 표면적 품질보다 실제 훈련 효용에 초점을 맞춥니다.
더 보기IDEAgent는 LLM 기반 연구 아이디어 생성에서 품질과 다양성을 따로 최적화하는 한계를 겨냥한다. 다중 에이전트 구조와 아이디어 계보, Yield 지표를 통해 유용하면서도 서로 다른 연구 후보군을 만드는 데 초점을 둔다.
더 보기소니 연구진은 확산 모델과 플로 매칭 모델의 추론 과정에서 발생하는 주파수 의존적 오차를 보정하는 Spectral Alignment(SPA)를 제안했다. 이 방법은 사전 계산한 스펙트럼 prior와 FFT 기반 가이던스를 이용해 중간 예측을 보정한다.
더 보기TBSM은 GAN의 판별기나 확산 모델의 고정된 노이즈 제거 경로 대신, 생성 샘플이 실제 데이터 분포로 이동해야 할 방향을 직접 학습하는 접근법입니다.
더 보기이 논문은 Agentic Context Management를 제안하며, 프로덕션 에이전트의 실패 원인이 추론 능력보다 현재 추론 컨텍스트를 관리하지 못하는 데 있는 경우가 많다고 주장한다.
더 보기Netflix 관련 연구 ID-V2V는 편집된 키프레임의 장면, 조명, 스타일 변화를 전체 영상으로 확산시키면서 얼굴 유사도, 표정, 시선, 립싱크를 보존하는 것을 목표로 한다.
더 보기마이크로소프트가 취약점 탐지와 분석, 수정 지원을 위한 MAI-Cyber-1-Flash와 Project Perception을 공개했다. 회사는 경쟁 플랫폼보다 낮은 비용과 높은 성능을 내세우지만, AI 보안 에이전트의 통제 문제는 여전히 남아 있다.
더 보기마이크로소프트 CEO 사티아 나델라는 기업이 데이터, 프롬프트, 맥락, 메모리, 에이전트 도구를 단일 AI 모델 제공사에 넘기는 것은 스스로의 사고 능력을 외주화하는 일이라고 경고했다. 해법은 AI 게이트웨이, 멀티모델 전략, 자체 통제 가능한 인프라에 있다.
더 보기Claude의 일부 공유 채팅과 Artifacts가 Google 검색에서 발견됐다는 보도가 나왔습니다. 의료 기록, 사내 문서, 아동 연락처 등 민감한 정보가 포함됐을 가능성이 제기되며 AI 서비스의 링크 공유 방식이 도마에 올랐습니다.
더 보기Google이 SerpApi의 검색 결과 스크래핑을 막기 위해 DMCA를 활용했지만, 법원은 초기 단계에서 핵심 청구를 받아들이지 않았다. AI 시대의 웹 데이터 접근을 둘러싼 법적 경계가 다시 쟁점이 되고 있다.
더 보기마이크로소프트가 사이버 보안 전용 모델 MAI-Cyber-1-Flash와 에이전트 기반 보안 플랫폼 Perception을 공개했다.
더 보기Ars Technica는 ChatGPT가 유명 작가의 ‘정확한 문체’를 따라 써 달라는 요청을 거부하고 있다고 전했다. 대신 넓은 분위기나 장르적 특성을 살린 독자적 글쓰기를 제안하는 방식이다.
더 보기TechCrunch가 인용한 Similarweb 데이터에 따르면 Google AI Overviews는 이제 검색의 43%에 표시된다. 1년 전 15%에서 크게 늘어나며 AI 생성 답변이 검색 경험의 중심으로 들어오고 있다.
더 보기일리야 수츠케버가 설립한 Safe Superintelligence가 2년간의 조용한 행보 끝에 엔비디아와 장기 파트너십을 맺었다. Vera Rubin GPU 플랫폼 접근권을 확보하면서, 안전 중심의 초지능 연구가 더 큰 컴퓨팅 단계로 이동한다.
더 보기AMD는 MI455X 가속기와 Helios 랙 시스템을 통해 단일 GPU 경쟁을 넘어 랙 단위 AI 인프라 시장으로 전선을 넓히고 있다.
더 보기Cursor는 835쪽짜리 SQLite 매뉴얼만 제공한 에이전트 군집으로 Rust 기반 데이터베이스 엔진을 구현하게 했다. 더 중요한 결과는 구현 자체보다, 계획자와 실행자를 나눴을 때 비용과 품질이 어떻게 달라졌는가다.
더 보기NVIDIA가 수술 로봇용 실시간 액션 조건부 생성 시뮬레이터 Cosmos-H-Dreams를 소개했다. 이 시스템은 Cosmos-H-Surgical-Simulator를 인과적 소수 단계 학생 모델로 증류하고 FlashDreams로 스트리밍 추론한다.
더 보기AWS가 AWS Labs를 통해 오픈소스 참고 플랫폼 Loom을 공개했다. Loom은 기업 규모에서 AI 에이전트의 신원 전파, 권한 제어, 배포, 등록, 승인 흐름을 어떻게 설계할 수 있는지 보여준다.
더 보기Tencent Hunyuan 연구진은 고정된 연산 예산에서 네이티브 멀티모달 사전학습을 어떻게 확장해야 하는지 분석했다. 핵심은 언어 목표와 멀티모달 목표가 서로 다른 스케일링 특성을 보인다는 점이다.
더 보기Skill Self-Play는 검증 가능한 agent 스킬을 중심에 두고 LLM의 자기 진화를 더 안정적으로 만들려는 프레임워크다. 제안자, 해결자, 동적 스킬 컨트롤러가 강화학습 루프 안에서 함께 진화한다.
더 보기Molt는 에이전트형 강화학습 연구에서 반복적인 알고리즘 수정과 rollout 변경에 따른 엔지니어링 부담을 줄이기 위해 설계된 PyTorch 네이티브 프레임워크다. 간결한 코드베이스를 유지하면서 비동기 훈련, 멀티모달 정책, MoE 정책을 지원한다.
더 보기