Today

이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준

  • 원문 발행Prism 생성
    Update80

    Google이 Gemini 3.5 Transcribe를 공개 미리보기로 선보였다

    • 실시간 스트리밍용과 사전 녹음 오디오용 전사 모델이 개발자·기업 플랫폼에서 공개 미리보기로 제공된다.
    • 사용자 지정 어휘와 85개 이상 언어의 자동 감지를 지원하며, 사전 녹음 오디오에서는 단어 단위 타임스탬프와 화자 구분도 제공한다.
    • Artificial Analysis 측정 평균 단어 오류율은 스트리밍 4.0%, 비스트리밍 2.6%였다.

    낮은 단어 오류율과 언어 자동 감지, 화자 구분 기능은 실시간 및 사전 녹음 음성의 정돈된 전사 활용도를 높인다.

    모델 릴리스Source quality60%1 source
  • 원문 발행Prism 생성
    Update80

    Google, Gemini Omni 1.1 Flash 공개

    • Google이 Gemini API와 개발자 생태계에 생성형 영상 모델 Gemini Omni 1.1 Flash를 공개했다.
    • 장면 연장, 시작·종료 프레임 제어, 영상 참조와 빠른 360p 초안을 지원한다.
    • 생성 결과는 4K로 업스케일할 수 있다.

    생성형 영상 제작 과정에서 장면과 프레임을 더 세밀하게 제어하고, 빠른 초안부터 고해상도 결과까지 이어갈 수 있게 됐다.

    모델 릴리스Source quality60%1 source
  • 원문 발행Prism 생성
    Update80

    발화 중 영상을 인식하는 MOSS-VL 모델 계열이 공개됐다

    • 발화 중에도 새 영상 프레임을 인식하도록 설계된 MOSS-VL 모델 계열이 공개됐다.
    • 기술 보고서와 함께 체크포인트 5종, 학습 커리큘럼, 실시간 추론 코드가 제공됐다.

    실시간 영상 이해와 발화를 결합한 모델을 체크포인트와 추론 코드로 직접 검토할 수 있게 됐다.

    모델 릴리스Source quality80%1 source
  • 원문 발행Prism 생성
    Research80

    Muse Glimmer가 Ollama의 Apple Silicon 로컬 실행 모델에 합류했다

    • Ollama 0.32.7이 Apple Silicon용 MLX 엔진을 통해 Muse Glimmer의 초기 로컬 실행을 지원한다.
    • 초기 지원 범위에는 이미지 입력과 DFlash가 포함되며, 다른 하드웨어 지원과 최적화는 후속 제공 대상이다.
    • 300억 매개변수 멀티모달 모델을 로컬 코딩 에이전트와 개인 비서의 기반 모델로 활용할 수 있다.

    멀티모달 에이전트 워크로드를 Apple Silicon 기기에서 직접 구동할 수 있는 선택지가 추가됐다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Update80

    FCC가 외국산 첨단 로봇의 신규 장비 인증을 제한했다

    • FCC가 Covered List 적용 대상을 외국산 첨단 로봇 장치로 확대했다.
    • 명시된 허가 절차를 거치지 않은 2kg 초과 신규 이동형 통신 로봇은 일반적으로 장비 인증을 받을 수 없다.

    이동·통신 기능을 갖춘 외국산 첨단 로봇의 미국 내 신규 장비 인증 절차와 AI 안전 거버넌스에 직접 영향을 준다.

    Source quality85%1 source
  • 원문 발행Prism 생성
    Update80

    Gemini Robotics 2가 적응형 로봇 지능 계층으로 공개됐다

    • 적응형 로봇을 위한 지능 계층으로 Gemini Robotics 2가 소개됐다.
    • 전신 제어와 정교한 조작, 다중 로봇 협업 능력이 강조됐다.

    로봇 조작의 범위가 개별 숙련 작업을 넘어 전신 제어와 여러 로봇의 협업으로 확장될 가능성을 보여준다.

    조작모델 릴리스Source quality85%1 source
  • 원문 발행Prism 생성
    Research78

    vLLM 0.21.0이 빌드·의존성 호환 조건을 바꿨다

    • Transformers v4 지원이 폐기 수순에 들어갔다.
    • 소스 빌드에 C++20 호환 컴파일러가 필요해졌다.

    기존 빌드 환경과 Transformers 의존성을 사용하는 배포는 업그레이드 전에 호환성을 점검해야 한다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research75

    vLLM v0.25.0이 밀집 모델의 기본 실행 경로를 전환했다

    • Model Runner V2가 모든 밀집 모델의 기본 실행 경로가 됐다.
    • 기존 PagedAttention 구현이 제거됐다.

    모델 실행 경로와 캐시 처리 기반이 함께 바뀌어 vLLM 기반 서빙 환경의 호환성과 운영 설정에 직접 영향을 줄 수 있다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Update72

    FrontierChallenge가 과학 워크플로 완수 능력을 평가했다

    • 6개 과학 분야에서 공개된 97개 엔드투엔드 워크플로 과제로 12개 프런티어 모델과 3개 에이전트 스캐폴드를 평가했다.
    • 최고 구성도 97개 중 20개만 완전히 수행해 통과율 20.6%를 기록했다.
    • 완전 수행뿐 아니라 부분 진척도 함께 측정한다.

    과학 AI의 성능을 개별 예측 결과가 아니라 여러 단계로 구성된 실제 워크플로의 완수 여부로 점검할 수 있다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update72

    Station, 다섯 수학 문제에서 자율 발견 결과 보고

    • Station의 자율 에이전트들이 수학적 구성과 정리, 분석, 검증 자료를 생성한 결과가 논문으로 발표됐다.
    • 보고된 문제와 사례 연구 가운데 다섯 문제의 결과가 기존 문헌 대비 새로운 것으로 기술됐다.

    과학 AI의 적용 범위가 데이터 분석과 예측을 넘어 자율적인 수학 연구로 확장될 가능성을 보여준다. 동시에 결과의 새로움을 기존 문헌과 대조해 평가하는 과정이 중요해진다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update72

    MCP가 에이전트 위임과 HTTP 전송 통합을 우선 과제로 제시했다

    • MCP 유지관리자들이 향후 규격 개발의 우선순위를 담은 로드맵을 공개했다.
    • 에이전트 메시징과 신원·위임, HTTP 네이티브 전송 통합, 명확한 도구 결과 계약이 주요 과제로 제시됐다.
    • 점진적 도구 탐색과 SDK 개발 경험 개선도 로드맵에 포함됐다.

    이번 로드맵은 MCP 생태계가 에이전트 간 상호작용과 도구 연동을 더 명확하게 다루는 방향으로 확장될 것임을 보여준다.

    모델 컨텍스트 프로토콜Source quality60%1 source
  • 원문 발행Prism 생성
    Research70

    vLLM 0.28.0이 기본 배치 토큰 한도를 두 배로 높였다

    • 기본 max_num_batched_tokens 값이 8192에서 16384로 상향됐다.
    • 기존 기본 설정에 의존하는 배포 환경은 배치 처리 구성을 점검해야 한다.

    기본 배치 토큰 수의 증가는 별도 설정 없이 적용되는 추론 런타임의 배치 처리와 메모리 관리에 직접 영향을 줄 수 있다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Research70

    Ollama에 Claude Desktop용 서드파티 게이트웨이 구성이 추가됐다

    • Claude Desktop에서 Ollama를 서드파티 게이트웨이 제공자로 구성할 수 있게 됐다.
    • 로컬 모델 런타임이 에이전트 클라이언트와 연결되는 공식 구성 경로가 추가됐다.

    로컬 모델 실행 환경인 Ollama를 Claude Desktop의 에이전트 흐름과 연결하는 구성이 명확해졌다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research70

    Anthropic Python SDK 0.124.0이 에이전트 도구 지원을 확대했다

    • Files API와 Skills API가 정식 제공 단계로 전환됐다.
    • 컴퓨터 사용과 브라우저 사용을 위한 도구 모음이 추가됐다.

    에이전트 시스템이 파일과 스킬을 다루고 컴퓨터·브라우저 도구를 사용하는 데 필요한 SDK 기반이 확대됐다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research70

    Ollama가 Apple Silicon에서 Muse Glimmer 지원을 시작했다

    • Ollama 0.32.7이 Apple Silicon용 MLX 엔진을 통해 Muse Glimmer 초기 지원을 추가했다.
    • 300억 파라미터 멀티모달 모델을 로컬에서 실행할 수 있으며 이미지 입력과 DFlash를 지원한다.

    로컬 에이전트 워크로드에서 멀티모달 모델을 Apple Silicon 기기에서 직접 활용할 수 있는 선택지가 늘었다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Update70

    Walden Robotics가 3억 달러 투자와 함께 공개됐다

    • Toyota Research Institute 스핀아웃 Walden Robotics가 스텔스 모드에서 공개됐다.
    • 회사는 3억 달러를 유치했으며, 기업가치는 11억 달러로 전해졌다.
    • 제조·물류용 바퀴형 범용 로봇 개발을 추진한다.

    로봇 조작 기술이 연구·평가를 넘어 제조·물류 현장의 범용 로봇 개발로 이어지는 흐름을 보여준다.

    조작Source quality85%1 source
  • 원문 발행Prism 생성
    Research70

    vLLM 0.26.0이 모델 지원과 캐시·프런트엔드 기능을 확장했다

    • Inkling 모델 계열 지원과 DeepSeek-V4 최적화가 추가됐다.
    • KV 캐시 그룹별 어텐션 백엔드 선택과 확장된 KV 오프로딩을 지원한다.
    • Rust 프런트엔드 기능이 한층 확대됐다.

    모델 호환성부터 어텐션 실행 경로, 캐시 이동, 요청 처리 계층까지 모델 서빙 인프라의 여러 영역이 함께 확장된 릴리스다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Research70

    vLLM v0.25.0이 밀집 모델의 기본 러너를 V2로 전환했다

    • 밀집 모델의 기본 실행 경로가 Model Runner V2로 전환됐다.
    • 기존 PagedAttention 구현이 제거됐다.
    • 모델·파서·추측 디코딩과 하드웨어·분산 서빙 지원이 확대됐다.

    기본 실행 경로와 어텐션 구현의 변화는 vLLM 기반 추론 환경의 호환성과 운영 설정을 점검해야 할 변경이다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Research70

    vLLM 0.23.0이 모델 실행·캐시·파싱 구조를 확장했다

    • DeepSeek-V4 백엔드 지원이 확대됐다.
    • 밀집형 Llama·Mistral 모델에서 Model Runner V2가 기본 실행 경로가 됐다.
    • 실험적 Rust 프런트엔드와 다단계 KV 캐시 오프로딩이 확장되고 추론·도구 호출 파싱이 통합됐다.

    모델 실행 경로와 메모리 관리, 요청 파싱이 함께 바뀌어 LLM 추론·서빙 환경의 구성과 호환성에 영향을 줄 수 있다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research70

    vLLM 0.23, Model Runner V2 기본 적용과 KV 캐시 오프로딩 확대

    • Model Runner V2가 Llama와 Mistral 밀집 모델에서도 기본으로 선택된다.
    • KV 캐시 오프로딩 프레임워크에 객체 저장소 기반 보조 계층이 추가됐다.

    모델 실행 경로의 기본값과 KV 캐시 이동 방식이 함께 바뀌어 vLLM 기반 추론 인프라의 실행 및 캐시 구성을 점검할 필요가 있다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research70

    Anthropic Python SDK가 Claude Opus 4.1을 지원 중단 예정으로 표시했다

    • Anthropic Python SDK 0.106.0이 Claude Opus 4.1을 지원 중단 예정으로 표시했다.
    • SDK 이용자는 Claude Opus 4.1에 대한 의존성을 점검할 필요가 생겼다.

    모델 공개 조건의 변화는 해당 모델을 사용하는 SDK 기반 애플리케이션의 호환성 점검에 영향을 줄 수 있다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Research70

    vLLM 0.20.0이 DeepSeek V4와 CUDA 13을 지원한다

    • DeepSeek V4 초기 지원이 추가됐다.
    • 기본 CUDA 배포판이 13.0으로 바뀌고 PyTorch 2.11로 업그레이드됐다.
    • Python 3.14 지원과 Transformers v5 호환성이 추가됐다.

    모델 서빙 인프라의 모델 호환성과 기본 실행 환경이 함께 갱신돼 배포 환경을 점검할 필요가 있다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Update68

    1천만 시간 규모의 멀티모달 연구 데이터셋 LAION-BVD가 공개됐다

    • Common Crawl에서 수집한 플랫폼별 동영상 URL 13억 개를 바탕으로 구축됐다.
    • 프로젝트는 총 1천만 시간 분량의 동영상 8천만 개를 내려받았다고 보고했다.
    • 멀티모달 사전학습 연구를 위한 연구 전용 공개 자원이다.

    멀티모달 모델 연구가 생성 능력과 평가 방법을 넘어, 대규모 공개 영상 자원을 활용한 사전학습과 비교 평가로 확장될 기반이 마련됐다.

    Source quality60%1 source
  • 원문 발행Prism 생성
    Update68

    Bedrock Robotics가 무인 굴착기를 실제 건설 현장에 배치했다

    • Bedrock Robotics가 완전 자율 굴착기를 텍사스와 네바다의 실제 인프라 건설 현장에 배치했다.
    • 산업용 로봇 인식 기술이 현장 토공 작업을 수행하는 무인 중장비 시스템으로 적용됐다.

    로봇 인식과 자율주행 기술이 실제 건설 현장의 중장비 작업에 적용된 사례다.

    인식Source quality75%1 source
  • 원문 발행Prism 생성
    Update68

    SecOPD가 적응형 프롬프트 인젝션 성공률을 9%로 낮췄다

    • SecOPD는 적응형 프롬프트 인젝션 방어 미세조정에 토큰 수준 피드백을 도입했다.
    • SecOPD를 적용한 Qwen3.6-27B의 PISmith 공격 성공률은 9.0%로, 논문이 인용한 기존 최고 기법의 94.0%보다 낮았다.

    증류가 모델 능력 이전을 넘어 적응형 프롬프트 인젝션에 대응하는 방어 학습에도 활용될 수 있음을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update65

    다중 턴 영상 이해 벤치마크 VideoGAIA가 공개됐다

    • 인간과 모델이 공동 설계한 실제 시나리오 기반 과제 271개로 구성됐다.
    • GPT-5.5와 Kimi-K3를 포함해 논문에서 평가한 모든 멀티모달 대형 언어 모델의 정확도가 60%를 밑돌았다.

    VideoGAIA는 멀티모달 모델의 다중 턴 도구 활용 능력을 비교할 기준을 제시한다. 모든 평가 모델이 60% 미만에 머물러 현재 모델의 개선 여지도 드러냈다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update64

    Amazon, Prime Air를 미국 약 500개 지역으로 확대한다

    • Amazon은 2026년 말까지 Prime Air의 미국 서비스 범위를 약 500개 도시와 마을로 확대할 계획이다.
    • 이는 현재 서비스 범위의 약 여섯 배에 해당하며, 영국 달링턴에서도 서비스를 시작했다.

    온보드 항법과 장애물 감지·회피 시스템을 활용하는 드론 배송의 운영 범위가 크게 넓어진다.

    인식Source quality75%1 source
  • 원문 발행Prism 생성
    Update62

    Video-IFBench가 영상 이해 모델의 지시 이행 능력을 평가한다

    • 32개 영상 이해 과제 유형과 39개 제약 범주를 아우르는 1,500개 샘플 규모의 Video-IFBench가 공개됐다.
    • 20개가 넘는 멀티모달 언어 모델을 평가한 결과, 다수·의미·복잡한 조건부 제약을 따르는 데 지속적인 어려움이 확인됐다.

    영상 내용을 이해하는 능력과 사용자의 복합 지시를 정확히 따르는 능력을 구분해 평가할 수 있다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update62

    Dogotix가 초기 투자 라운드에서 9억 달러 이상을 조달했다

    • Dogotix가 초기 투자 라운드에서 9억 달러 이상을 조달했다.
    • 프리머니 기업가치는 50억 달러로 제시됐다.
    • 조달 자금은 로봇 개발과 데이터 수집, 피지컬 AI 학습, 양산 시설, 글로벌 확장에 투입될 예정이다.

    이번 조달은 Dogotix가 로봇 개발과 피지컬 AI 학습, 양산 확대에 자원을 투입할 기반이 된다.

    조작Source quality75%1 source
  • 원문 발행Prism 생성
    Update62

    Kobo 전자책 단말기용 오픈소스 앱 플랫폼 Cobalt가 공개됐다

    • 최초 설치는 USB로 진행하며, 이후 앱과 플랫폼 업데이트는 Wi-Fi로 관리한다.
    • 런처와 서명된 앱 스토어, Rust SDK, 권한 기반 격리 런타임을 지원한다.

    Kobo 단말에서 애플리케이션을 격리해 실행하고 업데이트하는 기반을 제공한다.

    Source quality60%1 source
  • 원문 발행Prism 생성
    Update60

    FFmpeg VPK 디먹서에서 0 나누기 서비스 거부 결함이 보고됐다

    • 조작된 입력에서 채널 수가 0이면 VPK 디먹서가 0 나누기 충돌을 일으킬 수 있다.
    • 보고된 영향은 재현 가능한 서비스 거부이며, 메모리 손상 가능성은 입증되지 않았다.

    FFmpeg를 사용하는 처리 환경에서 조작된 VPK 입력이 안정적인 서비스 거부로 이어질 수 있다.

    Source quality60%1 source
  • 원문 발행Prism 생성
    Update60

    오픈소스 강화학습 로봇 Microduck가 예약 판매에 들어갔다

    • Pollen Robotics가 25cm 오픈소스 이족보행 로봇 Microduck의 예약 판매를 시작했다.
    • 사용자는 공개된 SDK·시뮬레이션·강화학습 스택으로 로봇 행동을 직접 재학습하고 공유할 수 있다.

    공개된 시뮬레이션과 훈련 도구를 이용해 새로운 로봇 행동을 만들고 실물에 배포하는 실험이 가능해진다.

    조작Source quality60%1 source
  • 원문 발행Prism 생성
    Research60

    자연어로 지리공간 예측을 설계하는 PPE가 발표됐다

    • 자연어 요청에서 지리공간 데이터 탐색·융합과 예측 모델 최적화까지 수행하는 자율 시스템 PPE가 공개됐다.
    • 보건·재난 위험·식량 안보·감염병 나우캐스팅 과제에서 전문가 기준선이나 기존 공개 방법보다 높은 성능이 보고됐다.

    데이터 검색부터 모델 선택까지 하나의 흐름으로 연결해 전문적인 지리공간 분석의 기술적 진입 장벽을 낮출 가능성을 보여준다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research60

    Anthropic Python SDK 1.1.0이 Organization API 지원을 추가했다

    • Organization API 엔드포인트 지원이 추가됐다.
    • 사고 표시 모드와 베타 값이 확장되고, pause_turn 이후에도 도구 실행기가 계속 동작하도록 개선됐다.

    에이전트 시스템에서 조직 단위 API 기능과 pause_turn을 포함한 도구 실행 흐름을 Python SDK로 다룰 수 있는 범위가 넓어졌다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Update60

    IDS Imaging, 산업용 3D 카메라 Nion 양산 공급 시작

    • IDS Imaging이 산업용 ToF 카메라 Nion의 양산 공급을 시작했다.
    • Nion은 120만 화소 해상도와 통합 깊이 처리를 제공한다.

    통합 깊이 처리를 갖춘 고해상도 ToF 카메라를 로봇 인식 시스템에 적용할 수 있는 제품 선택지가 늘었다.

    인식Source quality75%1 source
  • 원문 발행Prism 생성
    Research60

    vLLM v0.28.0, 추측 디코딩과 KV 캐시 운용을 확장

    • DFlash2와 DSpark 신뢰도 기반 검증이 추측 디코딩 경로에 추가됐다.
    • 드래프트 모델의 비동기 스케줄링이 자동으로 활성화된다.
    • Kimi-K3·DeepSeek V4 최적화와 계층형 KV 캐시 오프로딩도 포함됐다.

    추측 디코딩과 캐시·스케줄링 경로의 확장은 대형 언어 모델 추론 성능과 자원 운용에 직접 영향을 준다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Update60

    다중 교사 증류에 동적 도메인 스케줄링이 도입됐다

    • 다중 교사 온폴리시 증류에서 도메인별 표본 비율을 온라인으로 조정하는 D^3-MOPD가 발표됐다.
    • 보고된 네 교사 실험에서 학생과 교사 사이 평균 성능 격차의 97%를 줄였다.
    • 약 3분의 1의 롤아웃 단계로 최고 성능에 도달했다.

    다중 교사 증류에서 학습할 도메인의 비중을 진행 상황에 맞춰 조정해 학생의 성능 격차와 롤아웃 비용을 함께 줄일 가능성을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update60

    Dogotix, 첫 투자 라운드에서 9억 달러 이상 조달

    • Dogotix가 첫 투자 라운드에서 9억 달러 이상을 조달했다.
    • 투자 전 기업가치는 50억 달러로 제시됐다.
    • Dogotix는 휴머노이드·4족·궤도형 로봇을 개발하는 XPeng의 로보틱스 자회사다.

    대규모 자금 조달은 로봇 조작을 포함한 Dogotix의 로봇 개발 역량 확대에 영향을 줄 수 있다.

    조작Source quality75%1 source
  • 원문 발행Prism 생성
    Update60

    FIRM-Video가 체크리스트 기반 영상 평가 체계를 공개했다

    • 점수를 산출하기 전에 시간적 시각 증거로 평가 기준을 확인하는 체크리스트 기반 감독 방식을 제시했다.
    • 250개 영상의 지점별 인간 주석 750개로 구성된 FIRM-Video-Bench를 공개했다.
    • 체크리스트 기반 평가 데이터로 학습한 Qwen3-VL 기반 보상 모델 FIRM-Video-8B를 선보였다.

    텍스트-투-비디오 모델의 결과 점수뿐 아니라 기준별 시각 증거 확인 과정을 평가 감독에 반영할 수 있게 한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update60

    아마존이 Prime Air의 미국 서비스 지역을 약 500곳으로 확대한다

    • 아마존은 Prime Air를 2026년 말까지 미국 약 500개 도시와 지역으로 확대할 계획이다.
    • 영국 달링턴에서도 Prime Air 서비스를 시작했다.

    Prime Air의 확대는 온보드 항법과 장애물 감지·회피를 활용하는 자율 배송 서비스의 운영 범위가 넓어지는 변화다.

    인식Source quality75%1 source
  • 원문 발행Prism 생성
    Research60

    통합 이미지 생성·편집 모델 Swift-Image가 공개됐다

    • 6B 규모의 Swift-Image가 텍스트 이미지 생성과 단일·다중 이미지 편집을 하나의 모델로 통합했다.
    • 논문은 압축된 3B 모델과 가속 변형도 함께 제시했다.

    이미지 생성과 여러 형태의 편집을 하나의 모델로 다룰 수 있어 멀티모달 모델의 통합 범위가 넓어졌다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Update60

    FlowEvo가 성공한 워크플로를 지속 스킬로 전환한다

    • 성공한 에이전트 워크플로를 호출 가능한 실행 스킬로 컴파일해 지속적으로 축적한다.
    • 저장된 스킬은 이후 워크플로 구성이나 직접 실행에 재사용되며, 후속 효용에 따라 부정적 전이를 억제한다.

    에이전트가 별도 학습 없이 과거에 성공한 절차를 다음 과제에 활용하고, 축적된 스킬의 효용까지 관리할 수 있다.

    에이전트 메모리Source quality80%1 source
  • 원문 발행Prism 생성
    Update60

    GOAG가 객체별 학습 없이 다지 파지를 계획한다

    • GOAG는 객체별 학습 데이터에 의존하지 않고, 추론 시점에 객체 특징을 반영하는 생성형 파지 계획 모델이다.
    • MultiDex 데이터셋 객체에서 평균 86.93%의 파지 성공률을 기록했다.

    객체별 학습 데이터에 대한 의존을 줄이면서도 새로운 물체에 적용할 수 있는 다지 파지 계획의 가능성을 보여준다.

    조작Source quality80%1 source
  • 원문 발행Prism 생성
    Research60

    AutoSR이 연구 상태 탐색으로 기호 회귀를 자동화했다

    • AutoSR은 추론과 계산 증거, 독립 검토를 보존하는 연구 상태를 탐색해 기호 관계를 자동으로 찾는다.
    • 제안자·검토자 에이전트와 점진적 확장 몬테카를로 트리 탐색을 결합했다.
    • 선정된 9개 과제 모두에서 대수적으로 동등한 관계를 복원한 것으로 보고됐다.

    에이전트의 다단계 추론과 검토를 과학적 관계 발견에 적용한 사례로, AI 에이전트와 과학 AI의 접점을 보여준다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research60

    체화 에이전트 보안을 신뢰 경계 중심으로 정리한 조사가 나왔다

    • 체화 에이전트의 공격 표면과 방어를 공격자가 처음 침투한 신뢰 경계를 기준으로 체계화했다.
    • 문맥·장기 메모리, 미들웨어, 월드 상태 무결성, 다중 에이전트 신뢰를 상대적으로 연구가 부족한 영역으로 지목했다.

    디지털 입력의 침해가 인식과 추론을 거쳐 물리적 행동으로 이어질 수 있는 만큼, 연구가 부족한 경계와 방어 우선순위를 함께 파악하는 데 도움이 된다.

    인식Source quality95%1 source
  • 원문 발행Prism 생성
    Update60

    초경량 확률적 예측 모델 TinyCast가 공개됐다

    • TinyCast는 우세 주기성을 직접 계산해 예측 분포를 출력하는 어텐션 없는 제로샷 시계열 예측 모델이다.
    • 파라미터 146,505개로 구성됐으며 정적 INT8 내보내기와 임베디드 기기 추론을 지원한다.

    주기 구조를 직접 계산하는 소형 모델 설계가 확률적 제로샷 예측과 온디바이스 배포를 함께 겨냥할 수 있음을 보여준다.

    모델 릴리스Source quality80%1 source
  • 원문 발행Prism 생성
    Update60

    3D 오픈 월드 구축 에이전트를 평가·훈련하는 VibeWorlding이 제시됐다

    • 대화형 3D 오픈 월드를 처음부터 구축하는 멀티모달 에이전트용 평가 체계가 제시됐다.
    • VWE-BENCH와 강화학습 기반 훈련 프레임워크를 함께 공개했다.

    멀티모달 에이전트의 역량을 대화형 3D 환경 구축이라는 복합 과제로 평가하고, 같은 영역의 훈련까지 연결할 수 있는 틀을 제공한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update60

    ForgeWM이 소수 단계 비디오 월드 모델 학습 프레임워크를 제시했다

    • 행동 조건부 비디오 월드 모델을 저지연으로 구현하는 4단계 점진적 프레임워크를 제시했다.
    • 정상상태 디노이징 예산을 1회·2회·4회로 줄인 모델을 지원한다.

    증류의 적용 범위가 저지연 행동 조건부 비디오 생성으로 확장됐다는 점에서 의미가 있다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update60

    일본어 장편 영상 이해를 평가하는 NARU 벤치마크가 나왔다

    • 일본어 장편 영상의 서사 전개와 문화적 맥락 이해를 평가하는 NARU 벤치마크가 제시됐다.
    • NARU는 총 146.8시간의 영상 155개를 바탕으로 한 질문 1,481개로 구성된다.
    • 구축 과정에는 원어민 주석자 68명이 참여한 두 단계의 검증이 포함됐다.

    멀티모달 모델 평가 범위를 개별 품질이나 일반 과제 성능에서 장편 영상의 서사 및 문화 이해로 넓힌다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Research60

    vLLM 0.26.0이 모델 지원과 추론 실행 경로를 확장했다

    • Inkling 모델 지원 스택과 DeepSeek-V4 성능 개선이 추가됐다.
    • KV 캐시 그룹마다 어텐션 백엔드를 선택할 수 있게 됐다.
    • KV 오프로딩·계층형 저장소와 Rust 프런트엔드 기능이 확장됐다.

    모델 지원부터 어텐션 실행과 캐시 저장까지 추론 인프라의 여러 계층을 함께 확장한 릴리스다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research60

    vLLM 0.22.1이 Mellum v2와 AMD Zen 가속을 지원한다

    • Mellum v2 모델 지원과 AMD Zen CPU 가속이 추가됐다.
    • DeepSeek V4 초기화와 멀티노드 Ray 서빙 문제가 수정됐다.
    • 모델 로딩 및 이미지 빌드 회귀가 해결됐다.

    모델 호환성과 하드웨어별 실행 경로, 분산 서빙의 안정성에 영향을 주는 런타임 업데이트다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Research60

    vLLM 0.22.0이 추론 실행·메모리 계층을 확장했다

    • DeepSeek V4 지원을 강화하고 Model Runner V2를 개선했다.
    • 실험적 Rust 프런트엔드와 다중 계층 KV 캐시 오프로딩을 도입했다.
    • 배치 불변 추론을 비롯한 성능을 개선했다.

    모델 실행과 KV 캐시 관리는 대형 언어 모델의 실제 추론·서빙을 떠받치는 핵심 계층이다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research60

    vLLM 0.20이 DeepSeek V4와 CUDA 13 지원을 시작했다

    • DeepSeek V4 초기 지원이 추가됐다.
    • 기본 CUDA 배포판이 CUDA 13.0으로 바뀌고 PyTorch 2.11·Transformers v5로 업그레이드됐다.
    • Python 3.14 지원과 모델·양자화·어텐션·엔진 기능이 확대됐다.

    vLLM 기반 추론 환경은 새 모델 지원과 함께 CUDA·PyTorch·Transformers·Python 호환성을 점검해야 한다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Research60

    vLLM 0.19.1이 Gemma 4 호환성을 개선했다

    • Transformers 의존성을 v5.5.3으로 업그레이드했다.
    • Gemma 4의 스트리밍 도구 호출, 양자화 MoE, Eagle3, LoRA 로딩, 토큰 반복 관련 호환성 문제를 수정했다.

    Gemma 4를 vLLM에서 추론·서빙할 때 주요 실행 경로의 호환성이 개선됐다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research60

    vLLM 0.19.0이 Gemma 4와 비동기 추론 최적화를 지원한다

    • Gemma 4의 MoE·멀티모달·추론·도구 사용 아키텍처를 지원한다.
    • 추측 디코딩과 결합한 제로 버블 비동기 스케줄링과 범용 CPU KV 캐시 오프로딩을 추가했다.
    • 비전 인코더의 전체 CUDA 그래프 캡처와 여러 가속기 플랫폼 지원을 개선했다.

    모델 서빙 환경에서 모델 호환성, 요청 스케줄링, 캐시 이동과 장치별 실행 경로를 함께 개선하는 업데이트다.

    모델 릴리스Source quality95%1 source
  • 원문 발행Prism 생성
    Research58

    TraceML이 인간과 에이전트의 머신러닝 개발 계획을 과정 단위로 비교했다

    • 동일한 Kaggle 대회에서 수집한 인간 4,465개와 에이전트 207개의 머신러닝 개발 궤적을 버전 수준 코퍼스로 정리했다.
    • 전문가는 데이터·검증·모델·앙상블 작업을 오간 반면, 비교된 에이전트는 반복적인 모델 변형과 제출 튜닝 같은 좁은 계획 루프에 머무르는 경향을 보였다.
    • 인간의 작업 방식에서 추출한 계획 프롬프트는 일부 행동과 점수를 개선했지만, 전체 작업 양상은 여전히 에이전트 특성을 유지했다.

    최종 점수뿐 아니라 개발 과정의 선택과 반복 양상을 평가하면 인간과 에이전트 사이의 계획 행동 격차를 구체적으로 살필 수 있다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research56

    멀티모달 지속 사후학습에 시각 의존성 인식 프레임워크가 제안됐다

    • 스트리밍 비라벨 데이터로 멀티모달 모델을 지속 사후학습하는 시각 의존성 인식 프레임워크가 제안됐다.
    • 시각 제약 최적 수송과 시각 조절 적응을 결합해 기존 과제의 안정성과 새 과제의 가소성을 함께 추구한다.

    멀티모달 모델이 스트리밍 비라벨 데이터에서 새 과제를 학습하면서 기존 과제의 성능을 유지하는 방향을 제시한다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Update56

    영상·오디오 생성을 인간 선호로 평가하는 VA-Judger가 공개됐다

    • 영상·오디오 공동 생성 결과를 인간 선호에 맞춰 평가하는 통합 보상 모델 VA-Judger가 제안됐다.
    • 도메인 내·외 비교를 지원하는 VA-Judger-Bench와 인간 선호 데이터셋 VAPref-10K가 함께 공개됐다.
    • 보고된 실험에서 VA-Judger는 개별 지표를 결합한 기준선보다 인간 선호를 더 잘 예측했다.

    개별 품질 지표가 놓칠 수 있는 프롬프트 충실도와 영상·오디오의 의미적·시간적 일관성을 인간 선호에 맞춰 평가할 기반이 마련됐다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update55

    코딩 에이전트가 세계 상태를 관리하는 Code World Model이 제안됐다

    • 코딩 에이전트가 실행 가능한 세계 상태와 규칙에 따른 변화를 관리한다.
    • 비디오 생성 모델은 컴파일된 프록시 표현을 조건으로 시각적 관찰을 렌더링한다.
    • 세계의 변화와 시각적 구현을 분리해 지속적이고 규칙에 맞는 상태를 유지한다.

    장기 시공간 일관성을 다루는 멀티모달 세계 생성에 실행 가능한 상태 관리 구조를 제시한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update55

    게이트 순환 트랜스포머가 깊이 재사용으로 모델 규모와 디코딩 메모리를 줄였다

    • 공유 코어를 반복 적용하고 적응형 게이트로 업데이트를 조절하는 순환 깊이 트랜스포머 구조를 제시했다.
    • isoFLOPS 조건에서 3개 층으로 12층 GPT-2 Small 기준선과 같은 정확도에 도달했다고 보고했다.
    • 대규모 조건에서는 파라미터를 63%, 최대 디코딩 메모리를 59% 줄이는 대신 컴파일 생성 지연이 10% 늘었다.

    모델 구조 자체에서 파라미터와 디코딩 메모리를 줄일 가능성을 보여준다. 다만 생성 지연 증가와의 균형을 함께 평가해야 한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update55

    RubSE가 UI-to-code 자기진화에 루브릭 기반 수리를 도입했다

    • RubSE는 시각 피드백을 루브릭으로 구조화하고, 개선 라운드마다 하나의 수리 대상을 우선한다.
    • 연구진은 6개 비전-언어 모델과 3개 UI-to-code 벤치마크에서 단순 자기진화보다 안정적인 개선 결과를 보고했다.

    UI-to-code 생성에서 반복 개선의 안정성을 평가하고 설계하는 구체적인 방법을 제시한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update55

    Agent-G²가 가우시안 안내 깊이 표본화를 도입했다

    • 과제별 전문가 궤적의 안내 깊이를 가우시안 분포로 표본화하는 Agent-G²가 제안됐다.
    • 기존 정책 최적화 롤아웃에서 얻은 온라인 추정치를 활용한다.
    • ALFWorld에서 표본별 탐색 방식의 3분의 1 미만 롤아웃 비용으로 성능 향상을 보고했다.

    장기 에이전트 과제에서 안내에 필요한 롤아웃 비용과 정책 성능을 함께 다루는 새로운 강화학습 접근이다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Research55

    PROMISE-Net이 프롬프트 기반 의료 영상 분할을 제안했다

    • 의미 프롬프트로 인코더-디코더의 채널 가중치를 조절하는 Prompt-Conditioned Channel Attention이 제안됐다.
    • 이를 적용한 PROMISE-CNN과 PROMISE-Txformer가 네 가지 의료 영상 벤치마크에서 U-Net·UNETR 기준선보다 높은 IoU를 기록했다.

    멀티모달 프롬프트 활용 범위가 이미지 생성의 정체성·레이아웃 제어에서 의료 영상의 계층적 특징 조절로 확장됐다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Update55

    단안 영상에서 4D 인체를 복원하는 4DAnyone이 공개됐다

    • 보정되지 않은 일상 단안 영상에서 사람의 4D 모습을 복원하는 프레임워크가 소개됐다.
    • 다중 시점에서 일관된 영상을 생성한 뒤 4D 가우시안 스플래팅으로 변환한다.
    • 참조 문맥 패킹과 목표 문맥 라우팅으로 다중 시점 일관성을 구현한다.

    멀티모달 모델의 활용 범위가 생성 결과 평가를 넘어 일상 영상 기반의 4D 인체 복원으로 확장됐다는 점에서 의미가 있다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update55

    WithEveryone이 최대 10명의 정체성을 계획해 단체 이미지를 생성한다

    • 최대 10명의 참조 인물을 한 장의 단체 이미지에 생성하는 통합 프레임워크를 제시했다.
    • 정체성 토큰과 구조화된 정체성-레이아웃 계획, 레이아웃 기반 감독으로 각 인물의 배치와 정체성을 연결한다.

    멀티모달 이미지 생성의 초점이 결과 평가를 넘어, 여러 참조 인물의 정체성과 배치를 명시적으로 계획하는 방식으로 확장됐다.

    모델 릴리스Source quality80%1 source
  • 원문 발행Prism 생성
    Update55

    동결된 LLM의 에이전트 하네스를 세 계층에서 진화시키는 HSI가 공개됐다

    • 동결된 LLM 주변의 작업별 에이전트 하네스를 지속적으로 개선하는 프레임워크를 제시했다.
    • 하네스, 이를 재작성하는 진화기, 진화 전략을 바꾸는 메타 진화기의 세 계층으로 구성된다.
    • 여러 중간 난도 BALROG 과제에서 성능 향상을 보고했다.

    기반 LLM을 변경하지 않고도 작업별 에이전트의 동작 구조와 개선 전략을 함께 발전시키는 접근을 제시한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Research52

    수술 영상과 기구 궤적을 함께 예측하는 모델이 제시됐다

    • 미래 수술 영상과 기구 궤적을 함께 예측하는 초기 월드-액션 모델이 제시됐다.
    • 분할 자기회귀 롤아웃은 일괄 예측보다 첫 구간 PSNR을 18.86에서 23.11dB로 높이고 ADE를 45.77에서 22.22픽셀로 줄였다.

    영상과 궤적을 함께 예측하는 접근은 멀티모달 예측과 로봇 인식을 하나의 모델에서 연결한다.

    인식Source quality95%1 source
  • 원문 발행Prism 생성
    Update50

    미국 국립과학재단이 인간·로봇 공동 적응 연구를 포함한 센터 3곳에 9천만 달러를 투자한다

    • 미국 국립과학재단이 신규 과학기술센터 3곳에 5년간 총 9천만 달러를 투자한다.
    • 각 센터에는 초기 5년 동안 연간 600만 달러가 배정된다.
    • 지원 대상에는 텍사스대학교 오스틴이 주도하는 인간과 로봇 공동 적응 센터가 포함됐다.

    사람과 서비스·보조 로봇이 안전하고 효과적으로 서로 적응하는 방법을 장기적으로 연구할 기반이 마련된다.

    조작인식Source quality75%1 source
  • 원문 발행Prism 생성
    Research50

    VBVR-Pro가 네이티브 시각 추론을 위한 300개 검증 가능 과제를 공개했다

    • 300개 절차 생성 시각 추론 과제와 과제별 결정론적 보상 채점기를 제공한다.
    • 30개가 넘는 생성기를 대상으로 이미지·영상·교차 생성 방식을 통제 비교한다.
    • 이미지와 영상을 문제 해결 과정의 상태로 활용하는 폐루프 학습·평가 환경을 제시한다.

    결정론적 채점과 통제 비교를 통해 이미지·영상 생성 기반 시각 추론 능력을 일관된 조건에서 학습하고 평가할 수 있다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    참조 기반 영상 편집 데이터셋 RefVideo-6M이 공개됐다

    • 참조 기반 편집을 위한 비디오 샘플 500만 개와 이미지 샘플 100만 개를 포함한 RefVideo-6M이 공개됐다.
    • 연구진은 Ref-MoT를 학습해 데이터셋의 효과와 확장성을 실험했다.

    멀티모달 영상 편집 모델을 학습하고 평가할 수 있는 새로운 대규모 기반이 제시됐다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    생체역학 기반 동작 평가 벤치마크 MyoMechanix가 공개됐다

    • 중량을 사용하는 20개 동작에서 7,500개 이상의 표본을 수집했다.
    • 영상·포즈·표면근전도·생리 신호와 전문가 지식을 결합해 동작 품질 평가와 코칭을 다룬다.

    멀티모달 평가의 범위가 생성 결과나 개발 과정에서 생체역학적으로 근거를 둔 실제 동작 품질 평가로 확장됐다는 점에서 의미가 있다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    PlanSightRAG가 토목 도면용 시각 우선 RAG와 벤치마크를 공개했다

    • 토목 표준 도면 이미지를 직접 색인하는 시각 우선 멀티모달 RAG 프레임워크를 제시했다.
    • 미국 5개 주 교통부의 표준 도면 1,898쪽에서 4,056쌍 규모의 벤치마크를 구축했다.
    • 다중 벡터 검색과 에이전트형 계획·감사 파이프라인, 근거 히트맵을 결합했다.

    검색 증강 생성의 적용 범위가 텍스트 문서 중심에서 복잡한 토목 도면의 질의응답과 규정 준수 검사로 확장됐다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    중성미자 파운데이션 모델의 잠재 표현이 각도 오차 추정에 활용됐다

    • 희소 오토인코더로 중성미자 파운데이션 모델 내부의 물리 개념 지도를 식별하고 검증했다.
    • 선택된 품질·밝기 특징을 활용한 해석 가능한 불확실성 추정기를 구성했다.
    • 20% 선택 효율에서 중앙값 각도 분해능이 20.2도에서 3.2도로 개선됐다.

    기존 출력 헤드가 충분히 사용하지 않던 내부 정보를 찾아 새로운 다운스트림 과제에 활용할 수 있음을 보여준다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    상관관계를 통제하는 개념 수준 모델 감사법 ICON이 발표됐다

    • 개념과 결과 사이의 상관관계를 함께 통제하는 다변량 개념 수준 모델 감사 방법을 제시했다.
    • 합성 데이터에서 7개 기준 방법보다 개념 중요도를 더 정확히 복원했다고 보고했다.

    모델이 실제로 의존하는 개념을 더 정교하게 살펴보는 해석가능성 연구에 활용될 수 있다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    SwarmWorld, 언어 모델 에이전트 사회의 기술 진화를 입증했다

    • 분산된 언어 모델 에이전트는 공유 환경과 지속되는 인공물을 매개로 진화하는 기술 사회를 형성했다.
    • 이러한 집단은 독립적으로 탐색할 때보다 더 폭넓고 회복력 있는 기술 포트폴리오를 만들었다.

    에이전트의 성과를 개별 능력뿐 아니라 공유 환경과 축적되는 결과물을 통한 집단적 진화 관점에서도 살펴볼 근거를 제시한다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    리 군 제약 MeanFlow로 생성형 로봇 파지를 가속했다

    • SO(3) × R³ 곱 리 군 위에서 MeanFlow를 구성해 로봇 파지 자세를 생성한다.
    • 최대 5회의 네트워크 평가로 파지를 생성하며, 최대 39배 속도 향상을 보고했다.

    로봇 조작의 시간적 추론뿐 아니라 파지 자세 생성 자체를 가속하는 새로운 접근이 추가됐다.

    조작Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    리 군 제약 MeanFlow가 로봇 파지 생성을 가속했다

    • SO(3) × R³ 위에서 파지 자세를 생성하는 리 군 제약 MeanFlow가 발표됐다.
    • 최대 5회의 네트워크 평가로 파지를 생성하며, 최대 39배의 추론 속도 향상을 보고했다.

    주변 형상과 자세 제약을 고려해야 하는 로봇 조작에서 파지 자세를 빠르게 생성할 수 있어, 계획과 제어로 이어지는 처리 시간을 줄이는 데 의미가 있다.

    조작Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    단일 프레임 VLA에 시간적 추론을 더한 StreamPI 논문이 발표됐다

    • 단일 프레임 비전-언어-행동 모델에 추가 파라미터 없이 시간적 추론을 부여하는 StreamPI를 제시했다.
    • 실물 로봇 과제와 LIBERO 시뮬레이션 벤치마크에서 StreamPI를 평가했다.

    StreamPI는 단일 프레임 기반 로봇 조작 모델이 과거 관찰을 활용하도록 확장하는 접근을 제시한다. LIBERO 평가는 이 접근을 기존 로봇 조작 벤치마크에서 검토할 근거를 제공한다.

    조작Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    초음파 지각 평가에서 도메인 백본의 중요성이 확인됐다

    • B-mode 초음파의 지각 유사도 평가를 위한 도메인 지향 LPIPS 지표 라이브러리가 공개됐다.
    • 연구에서는 초음파 백본이 고전적 모델이나 자연 이미지 모델보다 다운스트림 지도학습 성능과 더 높은 상관관계를 보였다.

    B-mode 초음파 평가에서는 LPIPS 백본 선택이 다운스트림 모델 성능을 얼마나 잘 반영하는지에 영향을 주는 설계 요소임을 보여준다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    UGDiff가 불확실성 기반 초해상도 복원을 제안했다

    • 재구성 불확실성을 확산 과정의 지침으로 활용한다.
    • 불확실성이 높은 영역의 고주파 세부 정보를 선택적으로 복원한다.

    이미지 전체를 동일하게 처리하는 대신 불확실한 영역의 세부 복원에 집중하는 접근을 멀티모달 모델의 시각 처리 맥락에 더한다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Update50

    DuckLabs가 AWS 합류 계약을 발표했다

    • DuckLabs가 AWS에 합류하는 계약을 발표했으며, 거래는 2026년 9월 초 발효될 예정이다.
    • 암스테르담 팀은 함께 유지되고 오픈소스 프로젝트는 MIT 라이선스와 DuckDB Foundation 관리 체계를 이어간다.

    AI 인프라 개발 조직의 소속이 바뀌는 가운데, 오픈소스 프로젝트의 라이선스와 재단 관리 체계는 유지된다.

    Source quality60%1 source
  • 원문 발행Prism 생성
    Update50

    게이트 순환 깊이로 트랜스포머 층을 재사용했다

    • 공유 코어를 반복 적용하고 적응형 게이트로 순환 업데이트를 조절하는 트랜스포머 구조를 제시했다.
    • isoFLOPS 조건에서 3개 층으로 12층 GPT-2 Small 기준선과 비슷한 정확도를 보고했다.
    • 대규모 설정에서는 파라미터 수와 최대 디코딩 메모리가 크게 감소했다고 밝혔다.

    모델 품질을 유지하면서 파라미터와 디코딩 메모리를 줄일 수 있는 새로운 구조적 접근을 제시한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    JIT-Agent가 과제 적응형 하네스 진화 모델을 공개했다

    • JIT-Agent는 과제에 맞춰 에이전트 하네스를 생성·수리·진화시키는 모델을 제시했다.
    • JIT-Agent가 보조한 DeepSeek-V4-Flash는 GPT-5.6보다 DeepSearchQA에서 9.1점, OdysseyBench에서 4.3점 높은 성능을 기록했다.

    에이전트 성능이 기반 모델뿐 아니라 과제에 맞게 하네스를 구성하고 진화시키는 방식으로도 개선될 수 있음을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    MA-VLA가 다중 팔 협업을 원자 행동 단위로 재조합한다

    • 협업 행동을 팔별 중간 수준의 원자 행동 프롬프트로 분해하는 다중 팔 비전-언어-행동 모델이다.
    • Arm Shuffle 학습으로 팔의 역할에 종속되지 않은 명령 수행과 학습에서 보지 못한 협업 패턴의 재조합을 지원한다.
    • 새 벤치마크를 통해 미학습 다중 팔 협업 패턴에 대한 조합적 일반화를 평가한다.

    로봇 조작 모델의 평가 범위를 개별 작업 수행에서 학습하지 않은 다중 팔 협업 구성의 일반화까지 넓힌다.

    조작Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    Prefix Sliding이 장기 추론의 메모리 부담을 줄였다

    • 고정된 접두부와 최근 추론 토큰만 유지해 장기 추론의 메모리 사용량을 제한한다.
    • 연구진은 별도 학습 없이 성능을 유지하면서 최대 3배의 속도 향상을 보고했다.
    • 강화학습과 결합하면 제한된 메모리에서 추론을 더 길게 이어 성능을 높일 수 있다고 밝혔다.

    긴 추론에서 메모리 요구량을 제한하면서 처리 속도와 성능을 함께 유지·개선할 가능성을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    다국어 자기대전 평가에서 언어별 모델 기술 불일치가 측정됐다

    • 8개 언어와 6개 텍스트 게임의 다국어 자기대전으로 언어별 모델 성능을 평가했다.
    • 동일한 모델도 상호작용 언어에 따라 게임 수행 능력과 실패 양상이 크게 달라질 수 있다고 보고했다.

    모델 평가에서 하나의 언어로 측정한 성능을 다른 언어의 능력으로 그대로 일반화하기 어려울 수 있음을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    되돌릴 수 있는 효과로 동적 소프트웨어 합성을 형식화했다

    • 되돌릴 수 있는 효과와 반응형 공효과를 결합해 동적 소프트웨어 합성을 형식화했다.
    • 통합 컨텍스트 패러다임을 제안하고 이를 메타프레임워크 Cordis로 구현했다.

    동적으로 구성되는 에이전트와 인프라 소프트웨어를 효과 추적, 구성 조정, 핫 모듈 교체가 가능한 하나의 모델로 다룰 기반을 제시한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    VGI-Bench가 영상 생성 모델의 시각 추론 한계를 드러냈다

    • 영상 생성 모델의 시각 기반 추론을 평가하는 27개 과제·810개 인스턴스 규모의 VGI-Bench가 공개됐다.
    • 평가된 최상위 영상 생성 모델의 성능도 51.0%에 그쳐, 현재 모델의 시각 추론이 아직 안정적이지 않은 것으로 나타났다.

    영상 생성 품질뿐 아니라 모델이 시각적 관계와 변화를 얼마나 일관되게 추론하는지도 별도로 평가해야 함을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    VoiceMem이 정보·감정 기억을 분리한 이중 두뇌 구조를 제안했다

    • VoiceMem은 정보 처리를 담당하는 ‘왼쪽 두뇌’와 감정 처리를 담당하는 ‘오른쪽 두뇌’를 병렬로 구성했다.
    • 실시간 음성 상호작용을 위해 메모리 입출력을 스트리밍 방식으로 설계했다.

    에이전트 메모리의 범위가 저장 자료 검색을 넘어 실시간 상호작용 중 정보와 감정을 함께 처리하는 구조로 확장될 수 있음을 보여준다.

    에이전트 메모리Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    안드로이드 GUI 에이전트의 런타임 이상 대응력을 재는 AnTrap이 공개됐다

    • 에이전트 실행 과정에 동적 교란을 주입하는 안드로이드 GUI 에이전트 벤치마크 AnTrap이 소개됐다.
    • 결과뿐 아니라 실행 중 발생하는 런타임 이상에 대한 에이전트의 강건성을 평가한다.

    에이전트 평가는 정상 환경에서의 성능뿐 아니라 실행 도중 발생하는 예외적 변화에 얼마나 견디는지도 다룰 수 있게 됐다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    코딩 에이전트의 모델 전환에서 ‘인계 비용’이 확인됐다

    • 전체 작업 궤적을 넘기는 상향 전환은 저성능·고성능 모델 간 품질 격차의 절반 미만만 회복하면서 비용을 크게 늘렸다.
    • 고성능 모델에서 저성능 모델로 전환하는 하향 전환은 상향 전환보다 유리한 비용·품질 지점을 보였다.

    장시간 코딩 작업에서 더 강한 모델로 전환하는 것만으로는 품질 격차를 효율적으로 만회하기 어렵다는 점을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    코딩 에이전트의 모델 인계 비용이 실험으로 확인됐다

    • 전체 작업 궤적을 넘겨 고성능 모델로 상향 전환해도 모델 간 품질 격차의 절반 미만만 회복했다.
    • 상향 전환에는 상당한 추가 비용이 들었고, 하향 전환은 비용·품질 측면에서 더 유리한 지점을 보였다.

    에이전트의 모델 전환 전략을 평가할 때는 모델 성능뿐 아니라 이전 작업 궤적을 이어받는 데서 생기는 품질 손실과 비용도 함께 고려해야 한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    학습 데이터 환경에 맞춘 오프폴리시 강화학습 계열 WarpSAC이 공개됐다

    • 데이터 제한형 CPU 학습에는 WarpSAC-L, 데이터가 풍부한 GPU 병렬 학습에는 WarpSAC-A를 제시했다.
    • 논문은 FlashSAC 대비 점수-스텝 AUC가 CPU 환경에서 평균 4.5%, GPU 환경에서 23.1% 개선됐다고 보고했다.
    • Unitree G1 운송 과제의 성공률은 19.8%에서 96.4%로 높아졌고, 시뮬레이션-현실 배포는 36.4% 빨라졌다고 밝혔다.

    오프폴리시 강화학습의 안정화 전략이 데이터 규모와 생성 방식에 따라 달라져야 함을 보여준다. 시뮬레이션 학습부터 실기 로봇 배포까지 같은 구분을 적용할 근거가 된다.

    조작Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    JoyAI-Echo-1.5 월드 모델이 WBench 1위에 올랐다

    • JoyAI-Echo-1.5의 월드 모델 변형이 WBench에서 평균 81.7점을 기록했다.
    • 이 성적으로 WBench 1위에 올랐다.

    상호작용형 세계 생성 모델을 평가하는 WBench에서 JoyAI-Echo-1.5의 성능 수준을 보여주는 결과다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    JoyAI-Echo-1.5가 장편 영상과 상호작용형 세계 생성을 통합했다

    • 장편 영상과 상호작용형 월드 모델 변형을 갖춘 통합 오디오·비주얼 생성 시스템이 소개됐다.
    • 월드 모델 변형은 WBench에서 81.7점을 기록해 1위에 올랐다.

    긴 이야기의 일관성 유지와 상호작용형 세계 생성을 하나의 오디오·비주얼 시스템에서 다루는 모델 공개다.

    모델 릴리스Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    검색 기반 알고리즘 전문가 릴레이 MARS가 공개됐다

    • 검색으로 선택한 알고리즘 전문 에이전트들이 C++17 풀이를 작성·시험·수정·인계하는 릴레이 구조를 제안했다.
    • Gemma 4 기반 CodeContests 테스트 분할에서 과제당 평균 2.3개 파이프라인 단계로 0.624 ± 0.006의 통과율을 기록했다.

    MARS는 검색 증강과 다중 전문가 인계를 결합한 에이전트 구조를 경쟁 프로그래밍 평가 결과와 함께 제시했다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    Mixed SFT가 추론 강화학습보다 높은 성능 상한과 계산 효율을 보였다

    • 통제 실험에서 Mixed SFT의 RLVR 이후 성능 상한이 다음 청크 추론 강화학습보다 높았다.
    • Mixed SFT에 필요한 학습 계산량은 다음 청크 추론 강화학습의 60분의 1 미만이었다.

    추론 중심 데이터의 학습 전략을 선택할 때, RL 방식이 지도 미세조정보다 반드시 더 높은 성능 상한이나 계산 효율을 제공하는 것은 아님을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    SWE Refactor Bench가 전체 저장소 마이그레이션 평가를 도입했다

    • 20개 전체 저장소 마이그레이션 과제를 네 가지 기술 부채 범주에 걸쳐 평가한다.
    • 마이그레이션 감사, 동작 테스트, 독립 에이전트 검증으로 완결성과 정확성을 나눠 확인한다.
    • 8개 프런티어 모델의 520회 실행 중 세 단계를 모두 통과한 실행은 28회였다.

    전체 저장소 마이그레이션에서는 테스트 통과만으로 작업의 완결성을 판단하기 어렵다는 점을 보여준다. 마이그레이션 수행 여부와 동작 정확성을 구별해 평가할 필요가 있다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    GUI 공간 관계 추론을 진단하는 GUI-Primitives가 공개됐다

    • GUI 공간 관계 그라운딩 실패를 분리해 진단하는 994개 항목의 벤치마크가 공개됐다.
    • 평가된 19개 비전-언어 모델의 엄격한 point-in-box 정확도는 최고 32%에 그쳤다.

    최고 성능도 엄격한 위치 정확도 32%에 머물러, 멀티모달 에이전트 평가에서 GUI 요소의 공간 관계를 올바른 위치에 연결하는 능력을 별도로 진단할 필요성을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    터키어 발화권 전환 말뭉치 Real-TurnTurk가 공개됐다

    • 비각본 터키어 대화를 동기화된 영상, 화자별 음성, 정렬 전사문으로 구성한 멀티모달 말뭉치를 소개했다.
    • 이 말뭉치는 대화 중 발화권 전환을 예측하는 연구를 지원한다.

    영상·음성·텍스트를 함께 활용하는 발화권 전환 예측을 공통 말뭉치에서 평가할 수 있는 기반을 제공한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    CT 공간 관계를 단계별로 검증하는 모듈형 에이전트가 발표됐다

    • 언어 분석, 해부학적 구조 탐지, 결정론적 기하 추론을 결합해 축상 CT의 이진 공간 관계를 검증한다.
    • 최상위 하이브리드 구성은 홀드아웃 MIRP 공간 질의응답 벤치마크에서 정확도 94.1%, F1 94.2%를 기록했다.
    • 직접적인 Qwen2-VL 프롬프팅보다 정확도가 42.5%포인트 높았다.

    공간 판단 과정을 사람이 점검할 수 있어 의료 영상 에이전트의 신뢰성과 감사 가능성을 평가하는 구체적인 접근을 제시한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Research50

    최대 10명의 정체성을 보존하는 단체 이미지 생성 프레임워크가 발표됐다

    • 최대 10명의 지정된 참조 정체성을 보존하며 단체 이미지를 생성하는 통합 프레임워크를 제시했다.
    • 주소화된 정체성 토큰과 구조화된 정체성-레이아웃 계획을 결합했다.

    여러 인물이 등장하는 이미지에서 각 참조 정체성과 장면 속 위치를 함께 제어하는 접근을 제시했다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    이동 데이터 수집과 날씨 민감 예측을 잇는 3개 에이전트 워크플로가 제시됐다

    • 대화형 이동 데이터 수집부터 구조화 처리와 행동 모델링까지 연결하는 3개 에이전트 워크플로가 제시됐다.
    • 날씨를 반영한 멀티모달 이동 수요 예측을 포함하고, 각 처리 단계를 감사할 수 있도록 구성했다.

    에이전트 시스템의 적용 범위가 추론 병렬화에서 이동 데이터의 수집·처리·예측을 잇는 단계별 워크플로로 확장됐다는 점에서 의미가 있다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    컴퓨터 사용 기록에서 과제 모델을 복원하는 Task Model Induction이 발표됐다

    • 제약 없는 컴퓨터 사용 기록에서 서로 뒤섞인 잠재 과제를 발견하는 방법을 제시했다.
    • 발견한 과제로부터 재사용 가능한 계층적 목표 모델과 절차 모델을 복원한다.

    에이전트의 자연스러운 사용 기록을 구조화되고 재사용 가능한 과제 모델로 바꾸는 접근을 제공한다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    AI4AI-Bench가 에이전트의 학습 알고리즘 설계 능력을 평가한다

    • 10개의 고정 연구 저장소에서 LLM 에이전트의 학습 알고리즘 재설계 능력을 평가한다.
    • 6개 시스템의 29개 구성을 10개 알고리즘 설계 과제에서 비교했다.

    에이전트 평가 범위가 도구 사용과 행동 관찰을 넘어 학습 알고리즘 자체를 설계하는 능력으로 확장된다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    MidTool이 범용 에이전트 도구 사용을 위한 중간 학습 데이터 파이프라인을 제시했다

    • 실제 도구 API, MCP 스킬, 문서 기반 워크플로를 활용해 범용 에이전트의 도구 사용 중간 학습 코퍼스를 구축하는 파이프라인을 제시했다.
    • MidTool-Mix는 BFCL, tau2-Bench, MCP Universe에서 지도 미세조정과 강화학습 모두의 후속 도구 사용 성능을 일관되게 개선했다.

    도구 사용 데이터를 중간 학습에 활용하면 지도 미세조정과 강화학습 모두에서 후속 도구 사용 성능을 개선할 수 있음을 보여준다.

    모델 컨텍스트 프로토콜Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    DreamHand가 가림에 강한 3D 양손 궤적 복원법을 제시했다

    • 비디오 확산 모델을 결정론적 기하 인코더로 전용해 1인칭 영상의 연속적인 3D 양손 궤적을 복원한다.
    • 가림과 화면 이탈 구간을 다루며, 외부 손 검출기 없이 미터 단위 위치를 추정한다.
    • 다섯 개 벤치마크 평가에서 ARCTIC과 HOT3D의 오차를 줄였다고 보고했다.

    가림으로 끊기기 쉬운 손 움직임을 연속적인 3D 궤적으로 복원하면 로봇 조작용 시연 데이터를 확보하는 데 활용할 수 있다.

    인식조작Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    자기 개선 성과를 측정된 귀무 기준으로 감사하는 방법이 제안됐다

    • 자기 개선의 문제별 전이 결과가 측정 실패로 인해 반대로 해석될 수 있다고 보고했다.
    • 각 통계량을 별도로 측정한 귀무 기준과 대조하는 감사 방법을 제안했다.

    자기 개선 벤치마크의 결과가 실제 향상인지 측정 인공물인지 구분하려면 평가 통계량과 귀무 기준을 함께 점검해야 한다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    수술 장면과 기구 궤적을 함께 예측하는 모델이 제시됐다

    • 수술 장면의 시각 상태와 기구 궤적을 함께 예측하는 구조가 제시됐다.
    • 청크 단위 자기회귀 예측은 일괄 예측 대비 첫 구간 PSNR을 18.86에서 23.11dB로 높이고 ADE를 45.77에서 22.22픽셀로 줄였다.

    시각 상태와 기구 움직임을 함께 예측하면 수술 동작 계획에 필요한 장면 변화와 궤적을 하나의 구조에서 다룰 수 있다.

    인식조작Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    문서 지식을 검색 없이 내재화하는 3단계 사후학습 방법이 발표됐다

    • 한정된 문서 집합의 지식을 모델에 내재화해 검색 없이 질의응답하는 단계적 사후학습 방법이 제시됐다.
    • 프레임워크는 문서 지식 주입, 질의응답 행동 정렬, 일반 능력 회복의 세 단계로 구성된다.

    외부 문서 검색에 의존하는 RAG와 달리, 한정된 문서 지식을 모델 내부에 담아 질의응답하는 접근을 제시했다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Update50

    FlashPrefill V2가 장문맥 LLM 프리필 가속 성능을 공개했다

    • 블록 희소 프리필 어텐션에 FP8 추론, 페이지드 KV 캐시, 연속 배칭 지원을 결합했다.
    • NVIDIA H20의 128K 문맥 평가에서 FlashAttention-2 대비 FP8 기준 최대 47.26배, BF16 기준 최대 27.19배의 속도 향상을 보고했다.

    장문맥 LLM 서빙의 프리필 병목을 줄이면서 페이지드 KV 캐시와 연속 배칭을 함께 지원해, 현대적 추론 프레임워크의 어텐션 백엔드로 활용할 가능성을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    ASR 모델의 벤치마크 조건화 행동을 정량화한 연구가 발표됐다

    • 주요 오픈소스 ASR 모델이 음성이 모순되거나 가려지거나 모호한 상황에서도 벤치마크 참조 전사의 일부를 재현하는 행동이 관찰됐다.
    • 연구진은 행동적·기계론적 프로브를 통해 이러한 벤치마크 조건화 행동을 탐지하고 인과적으로 변화시킬 수 있다고 보고했다.

    높은 벤치마크 점수가 실제 환경에서의 범용 전사 능력 향상을 그대로 뜻하는지 평가할 때, 음향 증거보다 참조 문구를 우선하는 행동도 함께 점검해야 한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    접촉 위상으로 다지 그립을 생성하는 CoToGrasp가 발표됐다

    • 접촉 위상을 조건으로 다양하고 안정적인 다지 그립을 생성하는 CoToGrasp가 발표됐다.
    • 물체별 주석 없이 학습하고, 보지 못한 물체에 제로샷 일반화하는 방식을 제시했다.
    • 생성한 그립의 물리적·운동학적 실행 가능성을 실제 로봇에서 검증했다.

    기능적 의도와 물체 형상을 분리해 학습함으로써, 새로운 물체에도 적용할 수 있는 다지 그립 생성의 가능성을 보여준다.

    조작Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    정적 에이전트 학습 환경을 재구성하는 EnvHarness가 공개됐다

    • EnvHarness는 기존 검증기를 유지하면서 정적인 에이전트 학습 환경을 재구성하는 프로그래밍 가능 계층을 제시했다.
    • EnvRigger는 환경 재구성에 필요한 구성요소를 자동으로 합성한다.

    에이전트 학습의 개선 범위를 추론과 보상 최적화뿐 아니라 환경 구성 자체로 확장한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    다음 패치 임베딩 예측 기반 오디오 학습법 NAPE가 공개됐다

    • 앞선 로그 멜 스펙트로그램 패치로 다음 패치 임베딩을 예측해 오디오 표현을 학습한다.
    • 인과적 트랜스포머를 활용한 간결한 자기지도 학습 방식으로 NAPE를 제시했다.

    멀티모달 모델의 논의 범위를 이미지 생성에서 자기지도 오디오 표현 학습으로 넓힌다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    MemTrapBench가 LLM 기억의 인지적 함정을 평가했다

    • MemTrapBench는 검색된 기억이 LLM의 추론 고착과 믿음 왜곡을 유발하는지를 평가한다.
    • 두 모델 계열과 다섯 기억 프레임워크에서 모든 기억 전략이 무기억 설정보다 낮은 성능을 보였으며, 가장 강한 방법도 10% 넘게 하락했다.
    • 논문은 이러한 인지적 함정을 줄이기 위한 추론 시점 기법 AdaptiveMem도 제시했다.

    기억의 재사용이 항상 추론 성능을 높이는 것은 아니므로, 에이전트 메모리는 저장·검색뿐 아니라 기억이 판단을 왜곡하는지도 함께 평가해야 한다.

    에이전트 메모리Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    PolicyGuide가 에이전트 안전장치를 전체 워크플로로 확장했다

    • PolicyGuide는 도메인 정책을 워크플로 그래프로 바꾸고, 사용자 턴 경계에서 선제적 검증을 수행한다.
    • 항공·소매·통신 평가에서 GPT-5.4 에이전트의 평균 Pass^4가 0.42에서 0.62로 상승했다.
    • 같은 워크플로를 Claude Sonnet 4.6과 Gemini 2.5 Pro 에이전트에도 적용했다.

    다단계 고객 서비스에서는 금지된 행동뿐 아니라 신원 확인이나 사용자 확인 같은 필수 절차의 누락도 정책 위반이 될 수 있다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    Stream4D가 장기 영상 생성을 위한 4D 일관성 보상을 제안했다

    • 피드포워드 4D 재구성 보상으로 장기 자기회귀 영상의 일관성을 높이는 학습 방식을 제안했다.
    • 움직임 사전분포와 지각 앵커를 결합해 자연스러운 움직임과 지각 품질을 보존하도록 했다.

    장기 스트리밍 영상에서 시공간 일관성과 움직임 보존을 함께 최적화하는 구체적인 보상 설계를 제시했다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    과학 소프트웨어 코딩 에이전트를 평가하는 SWE-bench Science가 공개됐다

    • 20개 과학 분야의 GitHub 저장소 98곳에서 수집한 119개 과제로 과학 소프트웨어 엔지니어링 역량을 평가한다.
    • 평가된 최고 성능 조합인 Claude Code와 Opus-5(max)도 pass@1 50%를 넘지 못했다.

    최고 성능 에이전트도 절반 이상의 과제를 해결하지 못해, 과학 지식과 저장소 수준 통합을 함께 다루는 코딩 에이전트의 한계를 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Research50

    Ollama 0.32.15가 데스크톱 온보딩과 모델 메타데이터 캐시를 도입했다

    • 최초 실행 시 데스크톱 온보딩을 제공하고, 해석된 모델 메타데이터를 캐시한다.
    • 스트리밍 도중 파서 오류가 발생한 뒤 응답이 멈추는 문제를 수정했다.
    • Qwen 3.8 시스템 메시지 처리를 정규화하고 MLX·llama.cpp 의존성을 갱신했다.

    로컬 모델 실행 환경의 초기 설정과 반복적인 모델 정보 처리가 간소화되고, 스트리밍 오류 상황의 안정성이 개선된다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Update50

    다중 교사 증류의 역량 불균형을 교정하는 Open-MOPD가 제안됐다

    • 다중 교사 온폴리시 증류에서 발생하는 도메인 간 역량 불균형을 분석했다.
    • 토큰 비중 균형화, 격차 인식 동적 예산 배분, 학생 보상 갱신을 결합한 Open-MOPD를 제안했다.

    증류 과정에서 특정 교사나 도메인의 능력이 불균형하게 이전되는 문제를 다루는 새로운 접근이다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    FACET이 실행 가능한 터미널 에이전트 과제 합성 프레임워크를 제시했다

    • FACET은 공유 컨테이너 상태를 바탕으로 터미널 에이전트 학습 과제를 구성한다.
    • 실행 검증과 표적 수리를 통해 지시문·환경·해답·검증기 사이의 일관성을 유지한다.

    에이전트 평가 과제를 확장할 때 과제 설명과 실제 실행 환경 사이의 불일치를 줄이는 데 의미가 있다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    Open-MOPD가 다중 교사 증류의 역량 불균형 개선 효과를 제시했다

    • 표준 다중 교사 온폴리시 증류는 가용 성능 향상 여지의 35.6%를 회복했다.
    • 토큰 비중 균형화, 격차 인식 동적 예산 배분, 학생 보상 갱신을 적용한 Open-MOPD는 회복률을 83.4%로 높였다.

    여러 교사의 능력을 학생 모델에 이전할 때 도메인 간 역량 불균형을 줄일 수 있는 구체적인 개선 방향을 제시한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    구조화 사전 지식으로 실시간 객체 탐지기의 분포 밖 객체를 판별했다

    • 사전학습 객체 탐지기의 잠재 사전 지식을 해석 가능한 5차원 표현으로 구성해 분포 밖 객체를 탐지한다.
    • 평가된 객체 탐지기 구조와 벤치마크에서 최고 수준의 분포 밖 탐지 성능을 달성했다.

    로봇 인식 시스템이 학습 분포에서 벗어난 객체를 식별하는 능력을 높이면서, 그 판단에 쓰인 사전 지식을 해석할 수 있게 한다.

    인식Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    Ice Dart가 가파른 빙산·빙하 표면 착지 성능을 입증했다

    • 아이슬란드 남동부 현장 시험에서 초속 3m로 접근해 최대 58도 경사의 얼음 표면에 착지·고정했다.
    • 시속 30km의 바람이 부는 조건에서도 착지 성공률 100%를 기록했다.

    가파르고 바람이 부는 얼음 표면에서도 드론을 고정할 수 있음을 보여준 현장 시험 결과다.

    인식Source quality85%1 source
  • 원문 발행Prism 생성
    Update50

    Chain-of-Experience가 추론 중 경험 축적으로 LLM을 지속 개선했다

    • 반복적인 자기 피드백과 환경 피드백으로 경험 기록을 축적해, 모델 가중치 변경 없이 추론 시점에 성능을 개선하는 방식을 연구했다.
    • 수학·코딩·지식 과제에서 전체 성능이 5.6% 향상되고 API 비용은 19% 낮아졌다고 보고했다.

    모델 가중치를 다시 학습하지 않고도 상호작용 과정에서 얻은 경험을 이후 과제 개선에 활용할 가능성을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    음악 편집의 문맥 보존을 평가하는 MuseCPEval이 제안됐다

    • 음악 편집 시스템이 유지해야 할 음악적 요소를 보존하는지 평가하는 다면 프레임워크를 제시했다.
    • 음악 문맥의 여러 측면을 측정하도록 맞춤형 지표를 구성했다.

    벤치마크의 평가 범위를 성능 비교뿐 아니라 음악 편집 과정의 문맥 보존 여부까지 구체적으로 측정하는 방향으로 넓힌다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Research50

    BATON이 하위 과제 탐색과 전환 인식 메모리로 장기 로봇 조작을 구성했다

    • BATON은 장기 로봇 조작을 하위 과제로 나눠 각각 짧은 지평에서 탐색하고 해결책을 메모리에 저장한다.
    • 전환 인식 메모리가 하위 과제 내부의 모델 호출 시점과 과제 사이의 상태 인계를 관리한다.
    • 개별 해결책을 조합해 전체 과제의 탐색 비용을 단계 수에 대해 곱셈적 증가에서 덧셈적 증가로 바꾼다.

    하위 과제별 해결책을 재사용하고 실패를 특정 단계에 귀속할 수 있어 장기 로봇 조작의 탐색과 문제 진단을 더 체계적으로 구성할 수 있다.

    에이전트 메모리조작Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    생성 텍스트에 내부 상태의 출처 증거를 담는 개념증명이 나왔다

    • 인증된 인과적 내부 상태의 증거를 답을 바꾸지 않고 생성 텍스트의 통계적 패턴에 담는 개념증명이 제시됐다.
    • 두 통제 아키텍처는 공개 평가와 별도로 봉인된 보호 평가에서 각각 128개 대응 쌍을 모두 통과했다.

    내부 상태의 출처를 생성 결과에서 확인할 가능성을 보여줘, 상태 출처 추적과 내부 동작 해석 연구에 근거를 보탠다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    규정 준수 탐지기의 ‘규칙 맹목성’이 확인됐다

    • 규정 준수 가드와 활성화 프로브를 감사한 연구가 적용 규칙을 바꿔도 판정이 거의 달라지지 않는 ‘규칙 맹목성’을 보고했다.
    • 연구진은 탐지기가 실제 규칙을 반영하는지 검증하기 위한 반사실적 시험 프로토콜을 공개했다.

    규정 준수 여부를 판정하는 시스템이 실제 적용 규칙을 읽는지 별도로 검증해야 함을 보여준다.

    Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    프로테우스, 긴 문맥에 맞춰 신경망 메모리를 점진적으로 확장

    • 문맥이 길어질수록 신경망 메모리의 유효 용량을 점진적으로 확장하는 증분 메모리 활성화를 제안했다.
    • 여러 신경망 메모리 아키텍처에서 일관된 성능 개선을 보고했으며, 긴 문맥에서 개선 폭이 특히 컸다.

    긴 문맥에서 메모리 용량을 한꺼번에 제공하지 않고 점진적으로 활성화하는 새로운 접근을 제시했다.

    에이전트 메모리Source quality95%1 source
  • 원문 발행Prism 생성
    Research50

    범용 VLA를 휴머노이드 전신 제어에 적응시키는 HAF가 발표됐다

    • HAF는 계층적 행동 흐름 생성으로 이동·허리 자세·양팔 조작의 운동학적 의존성을 유지한다.
    • 기반 VLA를 고정하고 DCT로 축소한 잠재 공간에서 강화학습해 실제 휴머노이드 전신 이동·조작에 적응한다.
    • 일곱 가지 실제 과제에서 단일 단계 VLA 기준선보다 전신 협응과 과제 성능을 개선했다.

    서로 강하게 연결된 휴머노이드의 이동과 조작을 더 일관되게 조정하고, 범용 VLA를 실제 전신 과제에 적응시키는 접근을 제시한다.

    조작Source quality95%1 source
  • 원문 발행Prism 생성
    Update50

    SA-MRPO가 다중 보상 최적화의 포화 목표 비중을 낮췄다

    • SA-MRPO는 보상 목표를 각각 표준화하고, 추정된 포화도에 따라 목표별 기여도를 조절한다.
    • GDPO와 비교한 수학 추론 15개 조건 중 12개에서 더 어려운 정확성 목표가 개선됐으며, 적응형 추론 5개 벤치마크와 코딩 벤치마크에서도 성능 향상이 보고됐다.

    이미 만족된 목표의 성능을 대체로 유지하면서, 개선 여지가 큰 목표에 학습 노력을 집중하는 다중 보상 최적화 방법을 제시했다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    TRACE-Bench가 다중 참조 이미지 생성 능력을 연산자별로 진단한다

    • 다중 참조 이미지 생성을 Anchor, Disentangle, Apply, Compose의 네 연산자로 정식화했다.
    • 631개 수식 템플릿과 약 4,000개 참조 이미지로 약 1,600개 평가 사례를 구성했다.
    • 아홉 모델 평가에서 장면 수준 합성보다 분리와 속성 결합이 주요 병목으로 나타났다.

    단일 종합 점수를 넘어 다중 참조 이미지 생성 모델이 어느 연산 단계에서 실패하는지 구분해 비교할 수 있다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    미래 장면 예측을 학습에 내재화한 영상 추론 방식이 제시됐다

    • 학습 단계에서 부분 영상으로 미래 프레임의 잠재 표현과 텍스트 답변을 함께 예측한다.
    • 추론 단계에서는 미래 프레임을 생성하거나 재인코딩하지 않고 답을 직접 출력한다.
    • 보고된 여섯 평가 조건에서 직접 답변 파인튜닝을 개선하고, 명시적 Visual CoT보다 평균 종단 지연을 5배 넘게 줄였다.

    미래 장면을 활용하는 선제적 영상 추론에서 직접 답변 경로를 유지해 정확도와 지연 사이의 부담을 줄일 수 있다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    UI-Mate가 오픈 웨이트 GUI 에이전트의 새 성능 기준을 제시했다

    • UI-Mate는 환경 기반 학습과 문맥 내 시연을 결합한 오픈 웨이트 GUI 에이전트다.
    • UI-Mate-27B는 OSWorld-Verified 77.0%, WindowsAgentArena 66.2%를 기록했다.
    • OSWorkerBench에서는 엄격 성공률 41.0%, 진행률 76.9%로 기반 모델을 각각 17.7점, 24.5점 앞섰다.

    오픈 웨이트 GUI 에이전트가 일반 컴퓨터 사용과 장기 사무 작업에서 어느 수준까지 도달했는지 비교할 근거를 제공한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    StateM이 실행 하네스 확장에 따른 장기 에이전트 성능 향상을 보고했다

    • StateM은 모델 가중치를 바꾸지 않고 실행 하네스를 확장하는 접근을 제시했다.
    • 지속 실행 상태, 검증된 전환, 재사용 가능한 런북이 여러 모델 계열의 장기 지평 에이전트 성능을 높였다고 보고했다.

    장기 과제의 성능을 높이는 수단이 모델 자체뿐 아니라 실행 상태와 전환, 절차를 관리하는 하네스 설계에도 있음을 보여준다.

    에이전트 메모리Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    ForgeWM이 소수 단계 행동 조건부 비디오 생성을 제시했다

    • ForgeWM은 행동 조건부 비디오 월드 모델을 1·2·4회 디노이징 단계로 구동하는 점진적 프레임워크다.
    • 점진적 인과 학습과 증류를 결합해 제어 가능한 저지연 비디오 생성을 지향한다.

    멀티모달 비디오 모델에서 증류를 활용해 생성 단계를 줄이면서도 행동에 따른 제어 가능성을 다루는 새로운 접근이다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    자율 연구 에이전트의 실패를 전 과정에서 진단하는 AutoResearchEval이 공개됐다

    • 7개 과학 분야의 실제 연구 과제 100개로 자율 연구 에이전트의 전 과정을 평가한다.
    • 8개 하네스-모델 조합에서 수집한 에이전트 궤적 800개를 45개 실패 양상으로 분석했다.
    • 실패 양상은 연구 결과와 경로를 점검·수정·의심하는 메타인지 루프의 부재로 수렴했다.

    최종 성과만 재는 평가를 넘어, 자율 연구 에이전트가 어느 과정에서 실패하는지 진단할 수 있다. 반복된 메타인지 루프의 부재는 향후 에이전트 개선에서 점검·수정 능력이 핵심 과제임을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    시계열 기반모델의 예측 붕괴와 CalibRank가 제시됐다

    • 연구진은 예측 가능성이 낮은 다수의 시계열을 함께 다룰 때 점 예측이 평평해지고 횡단면 순위 성능이 저하되는 ‘예측 붕괴’를 분석했다.
    • 보정된 예측 진폭과 횡단면 순위 성능의 균형을 맞추는 목적함수 CalibRank를 제안했다.
    • Finance1K 평가에서 CalibRank는 예측 진폭을 목표에 가깝게 유지하면서 시험된 모든 모델의 횡단면 상관을 개선했다.

    시계열 모델은 평균 오차만으로 평가할 경우 횡단면의 상대적 순위를 구별하는 능력을 놓칠 수 있다. CalibRank는 보정과 순위 성능을 함께 평가하고 최적화할 수 있는 방향을 제시한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    SimpleOPD가 토크나이저 비종속 온-정책 증류를 제시했다

    • 서로 다른 토크나이저를 쓰는 교사·학생 모델을 공유 텍스트 범위로 정렬하는 온-정책 증류 기법을 제안했다.
    • Qwen3·Qwen3.5·Intern-S2·GLM-4.7·Gemma-4 계열에서 수학 추론 성능이 일관되게 향상됐고 과학 벤치마크에서도 개선이 관찰됐다.

    교사와 학생의 토크나이저가 달라도 증류할 수 있어, 서로 다른 모델 계열 사이에서 추론 능력을 이전하는 데 활용될 수 있다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    에이전트의 대기 시간을 병렬 추론에 쓰는 Second Thought가 발표됐다

    • ReAct 에이전트가 행동과 관찰을 기다리는 동안 네 개의 보조 추론 분기를 병렬로 실행한다.
    • 세 벤치마크와 세 추론 모델을 조합한 아홉 조건 모두에서 평균 턴 수가 감소했다.
    • 일곱 조건에서는 Pass@1의 유의미한 변화가 없었고, 나머지 두 조건에서는 각각 12.4점과 10.2점 상승했다.

    환경 응답을 기다리는 시간을 미래 턴의 추론에 활용해 에이전트의 순차 디코딩과 평균 턴 수를 줄일 가능성을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    LLM과 전용 임베딩 모델의 비용 대비 성능을 비교한 벤치마크가 발표됐다

    • LLM 10종과 전용 임베딩 모델 26종을 통제된 조건에서 비교했다.
    • 분류·유사도·군집화·쌍 분류·검색을 아우르는 37개 과제에서 품질과 비용을 함께 평가했다.

    RAG에 사용할 임베딩 방식을 선택할 때 모델 품질뿐 아니라 비용까지 함께 판단할 근거를 제공한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    일본어 장편 영상의 서사·문화 이해를 평가하는 NARU가 공개됐다

    • NARU는 총 146.8시간의 일본어 장편 영상 155편을 바탕으로 1,481개 문항을 구성했다.
    • 구축 과정에는 68명의 주석자가 참여한 두 단계의 원어민 검증이 포함됐다.
    • 8개 모델 구성을 평가한 결과, 장거리 서사 통합과 문화적 맥락 추론에서 상당한 한계가 확인됐다.

    NARU는 기존 Wiki에서 다루지 않았던 일본어 장편 영상 이해를 평가 대상으로 확장한다. 평가 결과는 현재 모델의 장거리 서사 통합과 문화적 맥락 추론이 여전히 취약함을 보여준다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    QuoteBench가 일치 점수에 가려진 명령 경로 실패를 드러냈다

    • 추가 파서를 거치자 8개 구성의 성공률이 55.4~73.2%포인트 하락했다.
    • 명령 경로의 경계를 공개하자 6개 구성에서 성공률이 30.4~60.7%포인트 회복됐다.
    • 일치 조건에서 얻은 실행 점수만으로는 명령 전달 경로에서 생긴 실패를 발견하기 어려울 수 있다.

    에이전트 벤치마크의 최종 점수가 같더라도 실제 명령 실행 경로의 신뢰성은 다를 수 있다. 평가에서는 모델 성능뿐 아니라 파서와 전달 경계도 함께 살펴야 한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    법률 인용 검증에서 특정 인용면 탐지의 취약성이 확인됐다

    • 통제된 평가에서 모델은 잘못된 판례를 찾는 데 비해 근거가 맞지 않는 특정 인용면을 탐지하는 데 더 취약했다.
    • 법률 인용 검증 성능은 판례 식별과 명제 수준의 인용면 검증을 구분해 평가할 필요가 있음을 보여준다.

    최종 답변의 정확도만으로는 드러나지 않는 인용 근거의 세부 오류를 별도로 측정해야 한다는 평가 과제를 제시한다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    D-SCAN이 문서 수준 어텐션 붕괴로 RAG 오염을 탐지했다

    • D-SCAN은 공격받은 RAG 생성에서 어텐션이 오염 문서에 집중되고 엔트로피가 낮아지는 현상을 탐지 신호로 활용한다.
    • 최종 답을 바꾸지 못한 공격 시도도 문서 수준 어텐션 동역학을 통해 탐지할 수 있다고 보고했다.

    출력만 검사해서 놓칠 수 있는 RAG 오염 시도를 모델 내부의 문서 수준 신호로 포착할 수 있다는 점에서 의미가 있다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update50

    BaguanHR가 초해상도 기반 0.1도 기상 예측 확장법을 제시했다

    • 변수별 초해상도를 이용해 거친 ERA5 재분석 자료에서 0.1도 학습 데이터를 합성하는 방법을 제안했다.
    • 합성한 고해상도 데이터로 머신러닝 기상 예측을 확장하는 BaguanHR 프레임워크를 제시했다.

    고해상도 관측 자료의 제약을 데이터 합성으로 보완해 머신러닝 기상 예측의 해상도를 확장하는 접근이다.

    Source quality80%1 source
  • 원문 발행Prism 생성
    Update40

    Gatik이 무인 화물운송 확대를 위해 2억 달러를 조달했다

    • Gatik이 시리즈 D 투자로 2억 달러를 조달했다.
    • 조달 자금은 무인 상업 화물운송 사업 확대에 투입될 예정이다.

    이번 투자는 Gatik이 무인 상업 화물운송 사업을 확대할 기반을 마련했다.

    Source quality75%1 source

DreamHand가 가림에 강한 3D 양손 궤적 복원법을 제시했다 선택됨