테크
13

GPT-6 아스트라의 위엄, 말 한마디 하면 영화 만들어줌

spark_icon5분 지식
  • GPT-6 아스트라가 기획과 도구 조작을 맡고 Higgsfield와 블렌더가 비주얼을 구현하는 방식으로 5분짜리 단편 영화가 완성되었습니다.
  • 핵심은 단순 생성이 아니라 MCP를 통해 프롬프트와 불만 사항을 3D 프리비즈 및 정확한 생성 주문서로 변환하는 피드백 루프입니다.
  • AI 영상 제작의 성패는 자동화 그 자체가 아니라 연출 의도를 정확한 도구 매개변수로 통제하는 디렉팅 능력에 달려 있습니다.

말 한마디로 5분짜리 단편 영화 《데드 머니》를 완성하는 작업이 실제로 가능해졌습니다. 배우도, 세트장도, 촬영 카메라도 없이 오직 마이크를 켜고 구상한 내용을 전달하는 것에서 출발해 한 편의 완성된 영상이 나왔습니다.

여기서 중요한 사실은 GPT-6 아스트라가 화면을 직접 그리는 것이 아니라, 기획을 짜고 블렌더와 Higgsfield 같은 전문 도구를 직접 조작하는 두뇌 역할을 수행했다는 점입니다. 단순한 텍스트 프롬프트 입력을 넘어 실제 제작 도구들을 대화형 에이전트로 제어하는 작업 방식이 구축되었습니다.

말 한마디가 구체적인 씬 계획표로 전환되다

작업의 시작은 거창한 문서 작성이 아니라 코덱스 환경에서 아스트라와 나눈 구두 대화였습니다. 포커판에서 전 재산을 잃은 인물이 주가 조작 조직에 엮이는 기본 줄거리를 던지자, 아스트라는 즉시 《데드 머니》라는 제목과 함께 씬 계획표를 구성해 냈습니다.

단편 영화 제작을 위해 AI가 생성한 8개의 씬 구성표와 영어 대사, 인물 및 장소 목록이 정리된 문서 화면입니다.

사용자가 입력한 줄거리를 바탕으로 AI가 구체적인 씬 계획표와 대사, 촬영 정보를 체계적으로 정리해 냅니다.

이후 원하는 구체적 전개와 대사, 판돈 규모를 전달하자 아스트라는 이를 씬 번호, 런타임, 영어 대사, 필요 인물 및 장소 목록으로 세분화해 정리했습니다. 이 구조가 잡히자 작업자는 특정 씬을 제작하라는 명령만으로도 다음 단계 공정을 호출할 수 있게 되었습니다.

캐릭터 일관성과 역할 분담의 해결

AI 영상 제작에서 가장 까다로운 문제는 인물의 일관성을 유지하는 일입니다. 범용적인 인물 생성을 지시하면 매 컷마다 얼굴이 바뀌거나 AI 특유의 어색한 질감이 두드러지기 마련입니다.

이를 해결하기 위해 기준 캐릭터 시트를 얼굴 클로즈업, 목 아래 의상, 뒷모습 등으로 명확히 분리하여 33장의 참조 이미지로 정립했습니다. 영상 주문 시 1번은 주인공 외형, 2번은 방 구조와 조명, 4번은 주변 인물처럼 이미지별 역할을 엄격히 지정함으로써, 상대 배역이 바뀌어도 주인공의 얼굴과 공간 조명이 흔들리지 않는 몽타주를 완성할 수 있었습니다.

MCP 기반의 도구 연동과 3D 프리비즈 검증

이 파이프라인의 핵심 동력은 모델 컨텍스트 프로토콜(MCP)을 통한 외부 소프트웨어 제어였습니다. 도박 영화의 고증 오류나 카드 피킹 동작의 어색함을 잡기 위해 아스트라는 블렌더 내에 3D 테이블과 카메라 2대를 직접 배치해 정보 누설 여부를 검증했습니다.

두 개의 화면이 나란히 배치된 영상. 왼쪽 v1 화면은 포커 테이블에 앉은 캐릭터들을 멀리서 잡은 와이드샷이며, 오른쪽 v2 화면은 칩을 가까이서 비추는 클로즈업샷이다. 하단에는 대화 내용이 텍스트로 적혀 있다.

모델이 제안한 3D 프리비즈 결과를 확인하고 카메라 구도를 수정하며 완성도를 높여가는 과정입니다.

딜러가 칩을 건네는 비현실적인 동작이 발생했을 때도, 아스트라는 원인을 분석해 손동작을 배제하고 컷 전환마다 칩이 줄어드는 연출로 수정했습니다. 3D 프리비즈로 사전에 타이밍과 앵글을 확정 짓고, 이를 Higgsfield Seedance 2.5의 참조 영상으로 넘겨 불필요한 크레딧 낭비 없이 20초 단위의 정밀한 실사 씬을 렌더링했습니다.

화면 상단에는 시스템 메시지가 표시되어 있고, 왼쪽에는 3D로 모델링된 건물 내부와 동선이 8개 장면으로 나뉘어 있으며, 오른쪽에는 번호가 매겨진 8장의 실사풍 이미지와 3D 구도 참조 이미지가 나열되어 있습니다.

복잡한 3D 동선 설계의 한계를 넘어, 검증된 구도와 실사 에셋을 결합해 시각적 완성도를 끌어올리는 과정입니다.

홍콩 밤거리에서 비밀 카지노로 이어지는 원테이크 씬에서는 3D 동선을 한 장의 보드로 요약하고 8장의 앵글 이미지를 참조로 투입하는 유연한 우회 전략을 통해 서버 실행 제한 문제를 돌파하기도 했습니다.

창작자는 앞으로 무엇을 보아야 하는가

실제 작업 로그를 확인하면 파일 업로드, 견적 확인, 생성 주문, 결과 회수까지의 전 과정이 MCP 도구 호출로 기록되어 있습니다. 창작자의 역할은 일일이 컷을 그리는 노동이 아니라, 연출적 오류를 짚어내고 방향을 수정하는 디렉터의 피드백 루프로 전환되었습니다.

결국 생성형 AI 영상의 성패는 '버튼 하나로 끝내는 자동화'에 있는 것이 아닙니다. 창작자의 불만과 요구사항을 3D 좌표와 정확한 도구 주문서로 번역해 내는 에이전트의 제어력과, 이를 올바르게 이끄는 디렉팅 기준이 향후 제작 환경의 격차를 만들 것입니다.


FAQ

GPT-6 아스트라가 영상을 직접 렌더링한 것인가요?

아닙니다. 아스트라는 전체 기획, 씬 분할, 블렌더 3D 프리비즈 제어, 주문서 작성 등 도구 실행을 총괄했으며, 실제 실사 영상 생성은 Higgsfield의 Seedance 2.5 모델이 담당했습니다.

등장인물의 얼굴이 씬마다 바뀌지 않게 유지한 방법은 무엇인가요?

얼굴, 의상, 뒷모습으로 분리된 캐릭터 시트를 구축하고, 영상 주문서에 각 이미지의 역할(주인공 외형, 조명, 주변 인물 등)을 명확한 번호로 매핑하여 참조하도록 강제했습니다.

블렌더(Blender)를 중간에 활용한 이유는 무엇인가요?

포커 테이블 배치나 카메라 시점 같은 고증 오류를 2D 프롬프트만으로 수정하면 비용과 시간이 과다하게 소모되므로, 3D 공간에서 동선과 앵글을 먼저 확정 짓기 위해 프리비즈 도구로 사용했습니다.


0
0