WithEveryone, 최대 10명의 정체성을 단체 이미지에 연결하다

최대 10명의 참조 정체성을 보존하는 단체 이미지 생성 프레임워크 WithEveryone의 구성, 평가 결과와 남은 질문을 정리합니다.

이 화면은 mesh:global · revision revision:0ca60790613807c6e369545d2579851916f6da48ecc718b8f8e40378fd1a8e2d 기준

여러 사람의 참조 이미지를 바탕으로 단체 장면을 생성할 때는 각 인물의 정체성을 유지하면서 올바른 위치에 배치해야 한다. 2026년 8월 20일 발표된 논문은 이 문제를 다루는 통합 프레임워크 WithEveryone을 소개했다. 이 프레임워크가 한 번에 다루는 지정 참조 정체성은 최대 10명이다.1

무엇이 달라졌나

WithEveryone은 여러 인물의 정체성 보존과 장면 배치를 별개의 과정으로 취급하지 않고 하나의 생성 프레임워크 안에서 결합한다. 선택된 정체성을 주소화된 토큰으로 주입하고, 구조화된 정체성-레이아웃 계획을 예측한 다음 이를 시각적 조건으로 렌더링하는 방식이다.1

학습 과정에는 주석이 달린 얼굴 영역을 이용해 의도한 정체성을 직접 감독하는 Layout-Grounded ID Loss가 포함된다. 또한 ID Representation Forcing을 통해 최종 이미지 합성 전에 각 정체성에 대한 예측을 학습한다. 논문은 이러한 구성으로 최대 10명의 지정 인물이 포함된 단체 이미지 생성을 다룬다.1

배경

멀티모달 이미지 생성에서 여러 참조 인물을 한 장면에 넣으려면 누구의 정체성이 어느 사람과 위치에 대응하는지 정확히 연결해야 한다. 인물 수가 늘어날수록 정체성이 서로 섞이거나, 요청한 인물이 빠지거나, 같은 인물이 중복될 가능성을 함께 관리해야 한다. WithEveryone이 제시한 접근은 정체성 표현과 레이아웃 계획을 명시적으로 연결해 이 문제를 다루려는 시도다.1

왜 중요한가

제공된 평가 내용에 따르면, 정체성이 겹치지 않는 벤치마크에서 WithEveryone의 대상 문맥 정체성 유사도는 0.499로 GPT-Image-2의 0.462보다 높았다. 복사·붙여넣기 형태의 아티팩트 지표는 0.169에서 0.055로 낮아졌다. 요청된 정체성의 포함률은 97.3%, 중복률은 2.8%로 보고됐다.1

이 결과는 단체 이미지 생성의 품질을 단순한 시각적 자연스러움만으로 평가하지 않고, 요청한 사람이 실제로 포함됐는지와 서로 구별되는지까지 측정할 수 있음을 보여준다. 특히 여러 지정 인물을 동시에 다루는 작업에서는 정체성 주소화와 공간 계획을 함께 학습하는 설계가 중요한 비교 기준이 될 수 있다.1

한계와 남은 질문

제공된 맥락만으로는 평가 데이터의 규모와 구성, 얼굴 주석 방식, 각 지표의 구체적인 계산 절차를 확인할 수 없다. 10명을 초과하는 경우의 성능, 가려짐이나 극단적인 자세·조명 조건에서의 안정성, 참조 이미지의 품질과 수가 결과에 미치는 영향도 알려지지 않았다.

또한 제시된 수치가 모든 장면 유형과 인구 집단에 일반화되는지는 이 정보만으로 판단할 수 없다. 정체성 보존 기술을 실제 서비스에 적용할 때 필요한 동의, 개인정보 보호, 오용 방지 장치 역시 제공된 논문 요약과 평가 결과만으로는 확인되지 않는다.

관련 지식

  • [[topic:ai/multimodal|멀티모달 모델]]: 이미지·영상·텍스트를 함께 다루는 모델 분야다.
  • [[model:witheveryone|WithEveryone]]: 주소화된 정체성 토큰과 구조화된 레이아웃 계획을 사용하는 단체 이미지 생성 프레임워크다.
  • [[paper:witheveryone|WithEveryone 논문]]: 정체성 토큰 주소화, Layout-Grounded ID Loss, ID Representation Forcing을 제시한다.

출처

각주

  1. 「WithEveryone: Unified Planning and Identity Grounding for Group Image Generation」, arXiv, 2026년 8월 20일. 2 3 4 5 6

이전
여러 참조 인물의 정체성과 위치를 정확히 연결하는 것이 멀티모달 이미지 생성의 과제로 남아 있었다.
현재
정체성 표현과 레이아웃 계획을 결합한 WithEveryone 프레임워크가 논문으로 발표됐다.

관련 지식

model:witheveryone

  • described_inpaper:witheveryone신뢰도 99%마지막 검증 2026-08-20

출처

피드로 돌아가기