StartupBench, 실제 비즈니스 워크플로로 범용 에이전트를 검증하다
StartupBench는 연구자가 임의로 고른 과제가 아니라 시장에서 수요가 확인된 AI 스타트업 제품의 워크플로를 기반으로 엔드투엔드 과제를 구성합니다. 평가된 모델 중 가장 강력한 모델도 전체 과제의 약 30%만 성공적으로 완료했습니다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 791개의 아티클
StartupBench는 연구자가 임의로 고른 과제가 아니라 시장에서 수요가 확인된 AI 스타트업 제품의 워크플로를 기반으로 엔드투엔드 과제를 구성합니다. 평가된 모델 중 가장 강력한 모델도 전체 과제의 약 30%만 성공적으로 완료했습니다.
더 보기「Personalized Auto-Research」는 진정한 AI 공동 과학자가 되려면 연구자의 선행 연구, 방법론, 협업 관계와 연구 커뮤니티를 이해해야 한다고 주장한다.
더 보기PTXBench는 생성된 커널의 정합성뿐 아니라 목표 PTX 명령이 런타임에 실행되는지, 최첨단 라이브러리보다 실제로 빠른지를 함께 평가한다. 결과는 아키텍처 특화 명령을 사용하는 것과 경쟁력 있는 성능을 내는 것 사이에 여전히 간극이 있음을 보여준다.
더 보기LEGO-RL은 실제 코딩 에이전트가 사용하는 Harness의 제어 흐름을 바꾸지 않고 정책 경사 강화학습과 연결하는 프레임워크입니다. Qwen3.5-35B-A3B를 세 가지 Harness에서 학습해 SWE-bench Verified 성능을 높였습니다.
더 보기MathForm은 Mathlib 지식 검색, 컴파일러 진단, 의미 일관성 피드백을 결합해 수학 문장을 단계적으로 수정한다. 약 367K개의 검증된 Lean 4 예제로 학습한 8B 모델은 여러 전용 32B 모델을 앞선 것으로 보고됐다.
더 보기EditBridge는 초고해상도 이미지 편집을 위한 확산 브리지 프레임워크다. 저해상도 편집 결과를 별도의 초해상도 모델에 맡기는 대신 원본 고해상도 이미지를 조건으로 사용해 실제 디테일을 보존한다.
더 보기ASI-Bench는 AI가 미지의 문제를 탐색하고 연구 방법을 선택하며 검증 가능한 결과를 만드는 능력을 평가한다. 인간의 방법론적 지침을 줄이자 현재 시스템의 성능은 크게 하락했다.
더 보기Stripe가 여러 AI 모델 사이에서 요청을 중계하는 스타트업 OpenRouter 인수를 확인했다. 보도된 거래 규모는 75억 달러지만, ‘특이점’보다 중요한 목적은 AI 사용량과 비용 관리 영역에 진입하는 데 있다.
더 보기OpenAI가 일부 고객을 대상으로 여러 대화에 걸친 AI 오용을 탐지하면서도 고객 데이터를 보존하지 않는 Private Safety Processing을 미리 선보인다. 기업용 AI 시장에서 프라이버시와 안전성을 둘러싼 Anthropic과의 경쟁이 한층 치열해지는 모습이다.
더 보기구글이 스피릿항공의 대규모 기업 데이터 세트를 1,000만 달러에 낙찰받았다. 제3자 비식별화가 예정됐지만, 승무원 측은 이름을 삭제해도 고용상 기밀과 재식별·추론 위험은 남는다고 주장한다.
더 보기AI가 검색, 이메일, TV 같은 일상 제품에 빠르게 들어가고 있지만 사용 확산이 곧 수용으로 이어지지는 않고 있다. 일자리와 저작권, 데이터센터 비용, 기업 책임에 대한 우려가 AI를 단순한 홍보 문제가 아닌 사업상의 신뢰 위기로 만들고 있다.
더 보기Google이 Search와 Gemini에 대화형 시각 자료, 시뮬레이션, 맞춤형 퀴즈, 학습 문서 생성, 연구 기능을 추가했다. 학생들이 개념 이해부터 복습까지 한 흐름으로 진행하도록 돕는 것이 목표다.
더 보기여러 보안 연구자가 OpenAI의 Trusted Access for Cyber 프로그램에 대한 접근 권한을 갑자기 잃었다고 밝혔습니다. OpenAI는 제한된 사용자에게 영향을 준 기술적 문제라고 설명하며 재신청과 신원 확인을 요청했습니다.
더 보기데이터센터와 GPU 투자가 커지면서 컴퓨팅 자원은 AI 기업의 핵심 비용이 되고 있다. Silicon Data는 GPU 임대 기준가격과 컴퓨팅 선물시장을 만들어 가격 변동 위험을 관리할 수 있도록 하려 한다.
더 보기Meta 플랫폼에서 비동의 성적 딥페이크 생성을 조장하는 것으로 보이는 AI 서비스 Kromix의 광고가 노출됐다. 광고 중 하나는 미국의 유명 여성 정치인과 매우 흡사한 얼굴을 포르노 영상에 사용했다.
더 보기StateM은 모델 가중치를 수정하는 대신 지속 상태와 검증 가능한 실행 전이를 제공하는 런타임으로 장기 작업 에이전트의 신뢰성을 높인다. Terminal-Bench 2.1에서 GPT-5.6 Sol xhigh로 95.3%의 원시 정확도를 기록했다.
더 보기Large Discovery Model은 생성 모델과 베이지안 비모수 보상 대리 모델을 결합해 후보를 만드는 데서 그치지 않고 불확실성을 고려해 다음 탐색 방향을 결정한다.
더 보기MOSS-VL은 비전언어 모델의 핵심 능력으로 ‘말하는 동안에도 보기’를 내세운 오픈 모델군입니다. 게이트형 크로스 어텐션과 상호작용 중심 학습을 통해 새 프레임을 받으면서 발화, 침묵, 답변 수정을 결정하도록 설계됐습니다.
더 보기HarmProfile은 유해 생성을 단순한 탈옥 공격의 성공 결과가 아니라 분석해야 할 대상으로 다룬다. 연구는 프런티어 모델마다 고유한 위험 프로필이 있으며, 모델 능력이 높아질수록 유해성과 출력 다양성이 커질 수 있음을 보여준다.
더 보기새 연구가 추론과 도구 사용, 코드 생성, 작업 공간 조작을 수행하는 LLM 에이전트를 위해 데이터베이스의 ACID 원칙을 재해석한 ‘에이전틱 트랜잭션’을 제안했다. 관련 벤치마크에서 기존 에이전트보다 10.6% 향상된 결과를 보고했다.
더 보기100개의 실제 최전선 연구 과제와 800개의 실행 궤적을 분석한 AutoResearchEval은 연구 에이전트의 핵심 약점이 지식이나 생성 능력보다 자기검증과 자기수정의 부재에 있다고 설명한다.
더 보기