단일 인물화에서 고정밀 포즈 추출: ComfyUI 360 Orbit 연계 노드와 워크플로우

단일 인물화에서 360도 주회 영상을 생성하고 24개 시점의 프레임에서 sdpose와 심도 보정을 거쳐 Qwen Image 2.1 포즈 지정 워크플로우로 넘기는 ComfyUI 커스텀 노드가 공개되었습니다.

tau · 2026년 10월 5일

#ComfyUI #MiniMax-H3 #Qwen-Image #포즈추정 #PoseEstimation #AI워크플로우 #sdpose

단일 인물화에서 고정밀 포즈 추출: ComfyUI 360 Orbit 연계 노드와 워크플로우

단일 인물화나 인물 이미지 한 장에서 포즈 좌표를 일관성 있게 추출하는 작업은 AI 이미지 워크플로우에서 까다로운 과제였습니다. AI 워크플로우 개발자 AI Bard Guild(@IsekaiBardGuild)는 2026년 10월 5일, 단일 인물화로부터 생성한 360도 주회(Orbit) 비디오를 활용해 고정밀 포즈와 심도 데이터를 추출하는 오픈소스 ComfyUI 커스텀 노드(ComfyUI-360-Orbit-Pose-Estimation)와 샘플 워크플로우를 공개했습니다.

ComfyUI에서 360도 주회 영상 기반 24개 시점 포즈 추출 및 심도·좌표 보정 워크플로우를 보여주는 화면

이미지 출처: @IsekaiBardGuild via X

이번에 공개된 파이프라인은 단일 정지 화상에서 직접 가려진 부위의 포즈를 유추하는 대신, 피사체 주변을 360도 회전하는 주회 비디오를 거쳐 다각도 프레임을 확보한 뒤 좌표를 보정하는 방식을 채택했습니다. 수작업 포즈 수정에 드는 리소스를 줄이고 후속 이미지 생성 모델에 정확한 포즈 가이드를 전달할 수 있는 실전 노하우를 정리합니다.

360도 궤도 영상과 24개 시점 추출을 통한 다각도 포즈 추정 원리

전통적인 2D 이미지 기반 포즈 추정은 정면이나 특정 각도에서 가려진 신체 부위(오클루전, Occlusion)의 정보를 파악하기 어려워 골격 좌표가 왜곡되는 문제가 빈번했습니다. 이번 워크플로우는 영상 생성 모델을 시점 확장 도구로 활용해 이 한계를 우회합니다.

  1. 주회 영상(Orbit Video) 확보:

    • 단일 원본 인물화 이미지를 입력으로 삼아 피사체를 중심으로 360도 회전하는 주회 영상을 먼저 생성합니다.
    • 원작자는 MiniMax H3 360 Orbit을 사용해 주회 영상을 제작했으나, 반드시 MiniMax H3로 한정할 필요는 없습니다. 피사체 중심의 회전 궤적이라는 요건만 충족한다면 다른 비디오 생성 AI 모델로 만든 영상이나 실사 촬영 클립도 입력 소스로 활용할 수 있습니다.
  2. 24개 시점 프레임 샘플링:

    • 생성된 360도 회전 비디오에서 기본값 기준 총 24개 시점의 프레임을 추출합니다.
    • 주회 영상을 통해 단일 정면 앵글에서 보이지 않던 신체 윤곽이 여러 시점에 걸쳐 노출됩니다.
  3. sdpose 기반 포즈 추정과 심도·좌표 보정:

    • 추출된 다각도 프레임군에 대해 sdpose를 적용하여 시점별 포즈를 추정합니다.
    • 포즈 추정과 더불어 심도 추정(Depth Estimation)과 좌표 보정(Coordinate Correction)을 결합 처리합니다.
    • 개발자는 이 방식을 '힘으로 밀어붙이는 방식(力技)'에 가깝다고 언급하면서도, 사람이 직접 수작업으로 포즈 보정 작업을 하는 것보다 훨씬 낫다고(相当マシ) 평가했습니다.

커스텀 노드 구성과 Qwen Image 2.1 포즈 워크플로우 연동

공개된 리포지토리(hiderminer/ComfyUI-360-Orbit-Pose-Estimation)는 다단계 처리 과정을 ComfyUI 그래프 내에서 활용할 수 있도록 설계되었습니다.

  • 제공되는 구성 요소:

    • 다각도 프레임 추출, sdpose 기반 포즈 추정, 심도 연산 및 좌표 보정 로직을 포함하는 전용 ComfyUI 커스텀 노드
    • 노드 간 입출력 연결이 구성된 샘플 워크플로우
  • 외부 의존성 및 사전 준비 모델:

    • 리포지토리 내부에는 커스텀 노드 코드와 샘플 워크플로우만 포함되어 있습니다.
    • 주회 영상을 생성하기 위한 MiniMax H3, 다운스트림 활용을 위한 Qwen Image 2.1 모델, 그리고 관련 LoRA에 관한 정보나 모델 가중치는 저장소에 포함되어 있지 않으므로 로컬 환경에 별도로 준비해야 합니다.
  • Qwen Image 2.1 포즈 지정 파이프라인 연계:

    • 보정 과정을 거쳐 완성된 포즈 데이터는 Qwen Image 2.1의 포즈 지정 워크플로우(Qwen Image 2.1 のポーズ指定 workflow) 등의 입력으로 연결해 활용할 수 있습니다.

실전 활용 시의 기술적 제약과 환경별 주의사항

실무 작업에 이 워크플로우를 도입할 때는 입력 이미지의 화풍과 영상의 특성에 따른 기술적 제약 사항을 사전에 고려해야 합니다.

  • 시점 샘플링 수 기본값:

    • 커스텀 노드는 기본적으로 주회 영상에서 24개 시점을 추출해 포즈를 추정합니다. 시점 수에 따른 안정성을 묻는 질문에 개발자는 기본 설정이 24시점이라고 확인했습니다.
  • 스타일화된 일러스트와 sdpose의 한계:

    • 일러스트처럼 실사에서 거리가 먼 이미지는 포즈 인식이 어렵습니다.
    • 개발자는 이것이 MiniMax의 문제라기보다는 포즈 추정에 사용한 sdpose의 특성 때문이라며, 일러스트 포즈 인식에 특화된 모델을 사용하면 가능할 수도 있다고 설명했습니다.
  • 핸드헬드 실사 영상 적용 여부:

    • 손으로 들고 찍은 핸디 카메라 실사 영상에도 적용 가능한지에 대해 개발자는 직접 테스트해 보지 않아 알 수 없다고 답했습니다.
    • 다만 핸디 카메라의 가속도 데이터를 취득해 보정하는 식의 개량이 필요할 수 있다고 덧붙였습니다.

원문 출처