로컬 27B 모델, 복잡한 리버스 엔지니어링 작업을 완수하다
XDA 편집자는 Qwen 3.8 27B에 상용 앱의 라이선스 인증 구조를 완전 오프라인 환경에서 분석하도록 했다. 모델은 숨겨진 검증 정보를 복원하고 첫 결과의 오류를 스스로 수정한 뒤 작동하는 개념 증명까지 만들었다.
더 보기Claude API 중계소 가이드, 검출 원리, LLM API 실측 노하우
총 775개의 아티클
XDA 편집자는 Qwen 3.8 27B에 상용 앱의 라이선스 인증 구조를 완전 오프라인 환경에서 분석하도록 했다. 모델은 숨겨진 검증 정보를 복원하고 첫 결과의 오류를 스스로 수정한 뒤 작동하는 개념 증명까지 만들었다.
더 보기vLLM이 ROCm 기반 AMD Instinct GPU에서 추측 디코딩을 구성하고 조정하는 방법을 소개했습니다. 네이티브 MTP, EAGLE-3, DFlash, DSpark를 비교하며 실제 성능은 수용률과 작업 부하에 따라 달라진다고 설명합니다.
더 보기하버드 비즈니스 스쿨의 HBS Foundry가 HeyGen으로 만든 강사 AI 아바타를 연습 피치와 모의 이사회 회의에 활용한다. 챗봇보다 더 안내적인 학습 경험을 만들려는 시도다.
더 보기런던 스타트업 Inherent는 자사의 연구 에이전트 Faraday가 출판 논문의 결과를 독립적으로 재현하는 과제에서 Anthropic과 OpenAI의 대형 모델을 앞섰다고 밝혔다. 핵심은 단순한 성능 경쟁보다 AI에 연구 판단력을 학습시키려는 접근이다.
더 보기같은 모델 가중치라도 GPU, 양자화, 추론 런타임, 어텐션 커널이 다르면 출력이 달라질 수 있습니다. 성능 저하의 원인은 모델 자체가 아니라 추론 스택일 수 있습니다.
더 보기OpenAI가 캘리포니아의 SB 53에 더 강력한 안전장치를 추가해야 한다고 밝혔다. 학습·평가 중인 프론티어 모델을 모니터링하고 개발 전 과정의 사이버보안을 강화하자는 제안이다.
더 보기주요 AI 연구소의 공개 자료를 평가한 보고서에서 인간의 통제를 우회하려는 모델을 격리하거나 종료하는 구체적 계획이 거의 드러나지 않은 것으로 나타났다. AI 에이전트가 기업 시스템에 접근하는 사례가 늘면서 대응 체계의 투명성이 새로운 쟁점이 되고 있다.
더 보기Cloudflare가 Workers에서 실행되는 Agent를 위해 모델 호출, 도구 실행, 승인, Subagent 활동을 추적하는 Agent Tracing을 출시했다. 프레임워크별 Payload 기본 저장 정책이 다르고, 데이터 잘림과 향후 과금도 고려해야 한다.
더 보기JetBrains는 6개월 동안 개발 관련 AI 지출이 약 10배 늘어난 뒤, 엔지니어가 사용할 도구를 소수로 제한하는 대신 공통 접근·라우팅·회계 계층을 구축했다. Central CLI는 도구 선택권을 유지하면서 사용량과 비용을 관리할 수 있도록 한다.
더 보기EnvHarness는 기존 환경을 처음부터 다시 만드는 대신 플러그인 계층으로 동작을 재구성한다. EnvRigger는 정책의 실행 궤적을 분석해 약점을 겨냥한 환경 구성 요소를 만들고 새로운 롤아웃으로 검증한다.
더 보기SWE-bench Science는 98개 GitHub 저장소와 20개 과학 분야를 대상으로 과학 소프트웨어 공학을 저장소 수준에서 평가합니다. 공개 테스트를 통과하는 것만으로는 과학적 의미를 보존한 수정이라고 볼 수 없다는 점을 보여줍니다.
더 보기FlashPrefill V2는 평균 보정항, GPU 중심의 희소 어텐션 커널, 페이지드 KV 캐시와 연속 배치 지원을 결합해 장문맥 LLM 프리필을 실서비스 환경에 맞게 개선한다. NVIDIA H20의 128K 문맥에서 FP8 기준 FlashAttention-2 대비 최대 47.26배의 속도 향상을 보고했다.
더 보기Hume AI의 연구는 자동 음성 인식 모델이 공개 벤치마크의 정답 문구를 재현하는 경향을 측정하는 방법을 제시했다. 일부 고득점 오픈소스 모델은 음성이 모순되거나 가려졌거나 모호한 상황에서도 참조 문장을 그대로 출력했다.
더 보기PolicyGuide는 조직 정책을 워크플로 그래프로 변환하고 사용자 발화가 끝날 때마다 에이전트의 상태를 선제적으로 검증한다. 위험한 행동만 막는 대신 누락된 절차를 찾아 정책에 맞는 다음 단계로 안내하는 접근법이다.
더 보기τ₀-VLA는 장기 로봇 조작을 위해 세계 모델이 안내하는 테스트 시점 계산을 도입하고, 불확실한 상황에서 여러 하위 작업을 비교한 뒤 다음 행동을 결정합니다.
더 보기37개 과제를 대상으로 한 비교에서 LLM과 전용 임베딩 모델의 종합 성능은 사실상 비슷했습니다. 그러나 비용과 처리 속도는 크게 달라, 전면 교체보다 작업별 분업이 합리적인 선택으로 제시됩니다.
더 보기FACET은 터미널 에이전트 작업의 지시문, 해법, 검증기를 동일한 실행 환경에 기반해 생성하는 프레임워크입니다. 실행 검증과 선택적 수리를 통해 원본 의도를 보존하면서 작업 구성 요소의 불일치를 줄입니다.
더 보기더 많이 기억한다고 해서 언어 모델이 현재 과제를 항상 더 잘 해결하는 것은 아니다. MemTrapBench는 검색된 기억이 추론과 판단을 왜곡하는 두 가지 인지 함정을 측정한다.
더 보기SkillEvo는 에이전트 스킬의 지속적인 진화를 가로막는 핵심 요인이 편집 능력이나 반복 횟수가 아니라, 평가가 신뢰할 수 있는 개선 방향을 계속 제공할 수 있는지에 있다고 설명합니다. 다중 턴 사용자 시뮬레이션을 피드백 생성기로 전환하고, 사실성 저하와 구조 비대화를 제어하는 독립 거버넌스 계층을 추가합니다.
더 보기ForgeWM은 양방향 액션 조건부 비디오 생성기를 게임 상호작용에 적합한 소수 단계 인과 월드 모델로 바꾸는 점진적 학습 프레임워크입니다. 낮은 지연시간을 유지하면서 키보드, 마우스, 게임패드 입력과 화면 변화의 정렬을 개선하는 데 초점을 둡니다.
더 보기그리스어 추론 실험은 정확도가 거의 변하지 않아도 모델의 행동은 크게 달라질 수 있음을 보여준다. SFT는 사용자 언어로 사고하게 만들고, RLVR은 형식 위반과 채널 누출을 고친다.
더 보기