단일 정답을 넘어: 화학적 타당성을 고려한 역합성 언어 모델
새 연구는 단일 단계 역합성에 Top-K 프롬프트와 학습 방식을 적용해 화학적으로 타당한 여러 반응 후보를 생성하도록 했다. 약 4,560만 건의 검증 반응으로 학습한 C3LM은 OOD URSA-expert-2026 벤치마크에서 강한 경쟁력을 보였다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 775개의 아티클
새 연구는 단일 단계 역합성에 Top-K 프롬프트와 학습 방식을 적용해 화학적으로 타당한 여러 반응 후보를 생성하도록 했다. 약 4,560만 건의 검증 반응으로 학습한 C3LM은 OOD URSA-expert-2026 벤치마크에서 강한 경쟁력을 보였다.
더 보기대규모 언어 모델은 사전학습 데이터에 자주 등장한 사실을 더 깊게 기억할 수 있어, 모든 지식에 동일한 삭제 압력을 적용하는 방식은 한계가 있습니다. AdaPop은 사실의 인기도와 토큰별 확신도를 바탕으로 망각 강도를 조절합니다.
더 보기Ramp의 미국 기업 결제 데이터에서 Anthropic은 여전히 OpenAI를 앞서고 있다. 그러나 현재 분기 기준으로는 OpenAI의 성장 속도가 더 빠르며, 기업 고객이 모델 출시와 가격·데이터 정책에 따라 공급자를 바꾸는 흐름이 나타난다.
더 보기OpenAI가 Apple 메시지와 ChatGPT를 연결하는 플러그인을 공개했다. 사용자가 권한을 부여하면 메시지 검색, 분석, 편집, 답장 작성은 물론 대신 전송하는 작업까지 가능하지만, 기기 권한과 자동 전송에 따른 개인정보 보호 문제가 함께 제기된다.
더 보기Google이 독자가 특정 매체를 우선적으로 볼 수 있도록 하는 ‘Preferred Sources’ 버튼을 출판사 웹사이트에 삽입할 수 있게 했다. AI 검색이 원문 사이트로 향하는 클릭을 줄이는 가운데, 출판사에 새로운 유입 경로를 제공하려는 시도다.
더 보기GPU가 부족한 장비에서 시간 단위로 임대되는 생산 자산으로 바뀌면서 컴퓨트 가격 변동을 헤지하려는 수요가 커지고 있다. CME, Silicon Data, CFTC의 움직임은 GPU 선물이 시장 인프라로 발전할 가능성을 보여준다.
더 보기Pew Research 조사에 따르면 ChatGPT 출시 이후 게시된 영어 웹페이지의 약 35%에서 AI가 작성했거나 크게 편집한 흔적이 발견됐습니다. 다만 AI 탐지 도구는 인간이 쓴 글을 잘못 판정할 수 있다는 한계도 있습니다.
더 보기기업 지출 관리 플랫폼 Ramp가 여러 대규모 언어 모델을 하나의 API로 이용하고 전환할 수 있는 AI 모델 라우팅 서비스 ‘Router’를 출시했다. 현재 미국에서만 제공되며 2026년 남은 기간에는 라우팅 이용료가 면제된다.
더 보기메타가 자연어 프롬프트로 인터랙티브 게임을 만들고 공유할 수 있는 실험적 앱 Pocket을 미국에 선보인다. 브라질에서의 테스트 이후 서비스 지역을 확대하는 것이다.
더 보기연구진은 웹페이지에 숨긴 암호문을 Grok이 스스로 복호화하고 실행하도록 유도해 사용자 정보와 대화 기록을 공격자에게 보낼 수 있는 공격을 공개했다. 기존의 정적 텍스트 필터가 코드 실행 결과와 도구 출력을 충분히 검사하지 않는 점이 핵심 취약점으로 지목됐다.
더 보기슬랙이 개발 과제별로 AI 코딩 에이전트와 팀이 협업할 수 있는 Slack Code를 선보였다. 팀원은 코드 변경 사항과 HTML 결과를 확인하고 출시 전에 피드백과 승인을 남길 수 있다.
더 보기바이낸스가 ChatGPT, Claude Code, Cursor 같은 AI 도구를 거래·결제·블록체인 인프라에 연결하는 Agent OS를 출시했다. 에이전트는 사용자를 대신해 주문할 수 있지만, 구체적인 위험 통제는 대부분 사용자가 설정해야 한다.
더 보기Co-RL은 파라미터를 공유하지 않는 여러 모델이 서로의 피드백에서 보상을 얻도록 하는 다중 에이전트 강화학습 프레임워크입니다. 정답 라벨 없이도 텍스트와 멀티모달 추론 성능을 높이고 자기 보상 학습의 붕괴 위험을 완화합니다.
더 보기FM-Bench는 언어 모델 에이전트에게 축구 구단을 20년간 운영하게 하며 이적, 재계약, 투자, 전술 선택의 장기적 결과를 측정한다. 실험 결과 모델 규모나 토큰 사용량보다 관리 행동의 차이가 성과를 더 잘 설명했다.
더 보기새 연구는 환각을 토큰별 독립 오류가 아니라 문장 안에서 이어지는 구간으로 보고 탐지한다. 텍스트 통계, NLI, 언어 모델 서프라이절을 결합해 모델 내부 정보 없이 성능을 높였다.
더 보기Zetta는 기반 정책을 고정한 상태에서 런타임 크리틱과 복구 스킬을 온라인으로 진화시키는 임바디드 AI 하네스입니다. 행동 수준 개입, 롤아웃 분석, 검증을 거친 업데이트를 서로 다른 시간尺度에서 결합합니다.
더 보기OmniScientist는 텍스트나 사전 계산된 특징에만 의존하지 않고 다양한 원시 데이터를 직접 다루는 엔드투엔드 AI 과학자 시스템입니다. 지각부터 연구 아이디어, 실험, 논문 작성까지 하나의 파이프라인으로 연결합니다.
더 보기제프리스 애널리스트들이 글로벌 주요 AI 에이전트 8개를 실제 사무 업무로 비교한 결과, 알리바바의 Qwen Office가 종합 1위를 차지했다. 이번 결과는 모델 성능뿐 아니라 실행 구조인 Harness와 작업당 비용이 기업 도입의 핵심 변수가 되고 있음을 보여준다.
더 보기FreeToken은 서로 다른 개인용 하드웨어에서 대규모 Mixture-of-Experts 모델을 실행하기 위한 엣지 네이티브 서빙 시스템입니다. PC를 작은 GPU로 보는 대신 CPU, GPU, 메모리와 모델 상태를 통합하는 탄력적 추론 플랫폼으로 다룹니다.
더 보기Agent Lightning v1.0은 도구 호출과 컨텍스트, 제어 흐름을 관리하는 배포 시점의 에이전트 하니스를 모델 후학습에 직접 참여시키는 방식을 제안한다. 6,000개 학습 예제와 비교적 적은 컴퓨팅으로 Qwen3.5-9B의 SWE-bench Verified 점수를 41.8%에서 56.4%로 높였다.
더 보기다양한 메모리 저장 방식을 동일한 조건에서 비교한 연구는 최적의 메모리 기반이 작업, 이력 길이, 운영 비용에 따라 달라진다는 점을 보여준다. 단일 방식을 고르기보다 상황별 메모리 라우팅이 중요해진다.
더 보기