GPU는 상품이 될 수 있을까: AI 인프라의 가격을 바꾸는 컴퓨트 선물
GPU가 부족한 장비에서 시간 단위로 임대되는 생산 자산으로 바뀌면서 컴퓨트 가격 변동을 헤지하려는 수요가 커지고 있다. CME, Silicon Data, CFTC의 움직임은 GPU 선물이 시장 인프라로 발전할 가능성을 보여준다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 791개의 아티클
GPU가 부족한 장비에서 시간 단위로 임대되는 생산 자산으로 바뀌면서 컴퓨트 가격 변동을 헤지하려는 수요가 커지고 있다. CME, Silicon Data, CFTC의 움직임은 GPU 선물이 시장 인프라로 발전할 가능성을 보여준다.
더 보기Pew Research 조사에 따르면 ChatGPT 출시 이후 게시된 영어 웹페이지의 약 35%에서 AI가 작성했거나 크게 편집한 흔적이 발견됐습니다. 다만 AI 탐지 도구는 인간이 쓴 글을 잘못 판정할 수 있다는 한계도 있습니다.
더 보기기업 지출 관리 플랫폼 Ramp가 여러 대규모 언어 모델을 하나의 API로 이용하고 전환할 수 있는 AI 모델 라우팅 서비스 ‘Router’를 출시했다. 현재 미국에서만 제공되며 2026년 남은 기간에는 라우팅 이용료가 면제된다.
더 보기메타가 자연어 프롬프트로 인터랙티브 게임을 만들고 공유할 수 있는 실험적 앱 Pocket을 미국에 선보인다. 브라질에서의 테스트 이후 서비스 지역을 확대하는 것이다.
더 보기연구진은 웹페이지에 숨긴 암호문을 Grok이 스스로 복호화하고 실행하도록 유도해 사용자 정보와 대화 기록을 공격자에게 보낼 수 있는 공격을 공개했다. 기존의 정적 텍스트 필터가 코드 실행 결과와 도구 출력을 충분히 검사하지 않는 점이 핵심 취약점으로 지목됐다.
더 보기슬랙이 개발 과제별로 AI 코딩 에이전트와 팀이 협업할 수 있는 Slack Code를 선보였다. 팀원은 코드 변경 사항과 HTML 결과를 확인하고 출시 전에 피드백과 승인을 남길 수 있다.
더 보기바이낸스가 ChatGPT, Claude Code, Cursor 같은 AI 도구를 거래·결제·블록체인 인프라에 연결하는 Agent OS를 출시했다. 에이전트는 사용자를 대신해 주문할 수 있지만, 구체적인 위험 통제는 대부분 사용자가 설정해야 한다.
더 보기Co-RL은 파라미터를 공유하지 않는 여러 모델이 서로의 피드백에서 보상을 얻도록 하는 다중 에이전트 강화학습 프레임워크입니다. 정답 라벨 없이도 텍스트와 멀티모달 추론 성능을 높이고 자기 보상 학습의 붕괴 위험을 완화합니다.
더 보기FM-Bench는 언어 모델 에이전트에게 축구 구단을 20년간 운영하게 하며 이적, 재계약, 투자, 전술 선택의 장기적 결과를 측정한다. 실험 결과 모델 규모나 토큰 사용량보다 관리 행동의 차이가 성과를 더 잘 설명했다.
더 보기새 연구는 환각을 토큰별 독립 오류가 아니라 문장 안에서 이어지는 구간으로 보고 탐지한다. 텍스트 통계, NLI, 언어 모델 서프라이절을 결합해 모델 내부 정보 없이 성능을 높였다.
더 보기Zetta는 기반 정책을 고정한 상태에서 런타임 크리틱과 복구 스킬을 온라인으로 진화시키는 임바디드 AI 하네스입니다. 행동 수준 개입, 롤아웃 분석, 검증을 거친 업데이트를 서로 다른 시간尺度에서 결합합니다.
더 보기OmniScientist는 텍스트나 사전 계산된 특징에만 의존하지 않고 다양한 원시 데이터를 직접 다루는 엔드투엔드 AI 과학자 시스템입니다. 지각부터 연구 아이디어, 실험, 논문 작성까지 하나의 파이프라인으로 연결합니다.
더 보기제프리스 애널리스트들이 글로벌 주요 AI 에이전트 8개를 실제 사무 업무로 비교한 결과, 알리바바의 Qwen Office가 종합 1위를 차지했다. 이번 결과는 모델 성능뿐 아니라 실행 구조인 Harness와 작업당 비용이 기업 도입의 핵심 변수가 되고 있음을 보여준다.
더 보기FreeToken은 서로 다른 개인용 하드웨어에서 대규모 Mixture-of-Experts 모델을 실행하기 위한 엣지 네이티브 서빙 시스템입니다. PC를 작은 GPU로 보는 대신 CPU, GPU, 메모리와 모델 상태를 통합하는 탄력적 추론 플랫폼으로 다룹니다.
더 보기Agent Lightning v1.0은 도구 호출과 컨텍스트, 제어 흐름을 관리하는 배포 시점의 에이전트 하니스를 모델 후학습에 직접 참여시키는 방식을 제안한다. 6,000개 학습 예제와 비교적 적은 컴퓨팅으로 Qwen3.5-9B의 SWE-bench Verified 점수를 41.8%에서 56.4%로 높였다.
더 보기다양한 메모리 저장 방식을 동일한 조건에서 비교한 연구는 최적의 메모리 기반이 작업, 이력 길이, 운영 비용에 따라 달라진다는 점을 보여준다. 단일 방식을 고르기보다 상황별 메모리 라우팅이 중요해진다.
더 보기HarnessRisk는 개별 공격 기법을 넘어 에이전트 하네스의 6개 운영 단계를 평가하는 벤치마크입니다. 위험을 인식하거나 작업을 높은 수준으로 수행하는 것만으로는 안전한 실행을 보장할 수 없다는 결과를 제시합니다.
더 보기AI-Infra-Guard를 활용한 연구가 DeepSeek Harness를 대상으로 1만4,560회의 통제된 실행을 진행해 간접 프롬프트 인젝션을 평가했다. 숨겨진 유니코드와 가짜 완료 메시지 같은 공격이 조건에 따라 에이전트의 행동에 영향을 줄 수 있음이 확인됐다.
더 보기FAR는 전문가가 하나의 문제를 미리 지정하는 대신 연구 방향을 제시하면, 문헌 검색과 모델의 시도, 자동 선별을 거쳐 검토할 만한 수학 문제를 추천한다. 조합론 파일럿은 제한된 전문가 시간을 더 유망한 후보에 집중할 가능성을 보여준다.
더 보기여러 벤치마크와 에이전트 프레임워크, LLM을 대상으로 한 연구는 Agent Skills의 핵심 효과가 부족한 지식을 주입하는 데 있지 않고, noisy한 실행 기록을 안정적인 절차의 기준점으로 바꾸는 데 있다고 분석했다. 반면 스킬 풀이 커지면 검색이 새로운 병목으로 떠오른다.
더 보기Agentic ESOpt는 길고 분기 많은 에이전트 작업을 미세 조정하기 위해 진화 전략을 활용하는 프레임워크를 제안한다. 추론에 가까운 GPU 메모리 사용 방식으로 매개변수를 탐색하고, 모델과 컨텍스트의 공동 최적화를 지향한다.
더 보기