사진과 촬영 영상이 전혀 없는 상태에서 30초 광고를 만들 수 있을까? 이 질문을 확인하기 위해 숨틈 홈정리라는 가상 업체를 설정하고, 업체가 전달한 이야기가 있다는 가정만으로 세로형 숏폼을 직접 제작했다.
이 글은 실제 고객 성과 사례가 아니다. 내가 AI에게 장면을 요청하고 결과를 검수하면서 실패한 선택과 수정 이유를 기록한 가상 제작 사례다. 완성본만 보면 보이지 않는 시안 선택, 액션 그래픽, 내레이션, 생성 비용과 품질 한계를 함께 공개한다.
사진보다 먼저 필요했던 것은 업체의 이야기였다
홈정리 서비스의 기능을 나열하면 정리해 줍니다, 공간이 깨끗해집니다 정도로 끝나기 쉽다. 이번에는 기능보다 정리를 맡기는 사람의 감정에 집중했다. 어질러진 공간 앞에서 답답함을 느끼고, 혼자 치우려다 추억의 물건 앞에서 멈추고, 결국 도움을 선택한 뒤 여유를 되찾는 흐름이다.
촬영 자료가 없다는 사실은 장면을 만들 수 없다는 뜻이 아니었다. 오히려 어떤 손님이 왜 이 서비스를 찾는지, 서비스 전후에 무엇이 달라지는지를 문장으로 구체화해야 했다. 사진이 있는 경우에도 이야기가 없으면 화면은 예쁘지만 기억에 남기 어렵다.
이번 작업의 핵심 문장은 정리는 물건을 버리는 일이 아니라 내 삶에 여유를 돌려놓는 일이었다. 이 문장을 기준으로 공간, 인물 표정, 손의 움직임, 수납 도구와 마지막 빛의 분위기를 정했다.
A·B·C 시안을 섞으면서 발견한 운영 문제
첫 단계에서는 분위기가 다른 세 가지 시안을 만들었다. 그러나 실제 제작 구성에서는 A의 도입, B의 전개와 C의 결말을 골라 한 영상에 섞었다. 각 부분만 보면 마음에 들었지만, 이것은 고객이 선택한 하나의 시안을 충실히 발전시킨 과정과 다르다.
세 시안이 단지 색이나 문구만 다른 것이 아니라면 각각의 감정과 연출 약속이 있다. 제작자가 임의로 좋은 부분만 섞으면 고객이 무엇을 승인했는지 불분명해진다. 결과적으로 수정 기준도 흔들린다.
앞으로는 세 가지 기준을 적용하기로 했다.
- A·B·C는 첫 장면, 감정 톤, 색, 자막 방식과 결말이 실제로 다르게 보이게 만든다.
- 하나를 선택하면 그 방향 안에서 대본과 화면을 발전시킨다.
- 여러 안을 섞는 것이 낫다면 먼저 동의를 받고
혼합안 M01처럼 새로운 시안 번호를 발급한다.
이 기준은 영상 편집 기술보다 운영에 가깝지만, 고객 검수와 수정 횟수를 줄이는 데 직접 영향을 준다.
설명형 30초 영상에서 일곱 개의 행동 장면으로
처음 만든 30초 버전은 규격과 자막에는 문제가 없었다. 그러나 잔잔한 이미지가 이어져 광고라기보다 슬라이드 설명에 가까웠다. 화면이 조용한 것이 문제라기보다 감정의 변화가 보이지 않는 것이 문제였다.
장면을 다음과 같이 다시 정의했다.
- 어질러진 방 앞에서 한숨이 나오고 답답함이 표정에 보인다.
- 그대로 둘 수 없어 수납 가방을 들며
그래도 치우자고 결심한다. - 정리 중 오래된 물건을 발견하고
이게 왜 여기 있지하며 기억을 떠올린다. - 혼자 끝내려 하지 않고 전문가와 상담한다.
- 물건이 용도와 보관 여부에 따라 분류된다.
- 도우미는 힘든 정리를 맡고, 의뢰인은 잠시 쉬며 호흡을 되찾는다.
- 정돈된 공간에서 집뿐 아니라 자신의 삶도 가벼워졌다고 느낀다.
이 일곱 단계는 자막 문구가 아니라 각 장면에 필요한 표정, 몸의 움직임, 그래픽 효과와 내레이션의 기준이 됐다.
편집형 V1과 생성형 모션 V2의 차이
움직임 방식만 공정하게 비교하기 위해 두 버전에 같은 대본, 장면 길이, 내레이션과 배경음악을 사용했다.
편집형 V1
편집형은 정지 이미지 위에 확대, 이동, 페이드, 자막 애니메이션과 모션 그래픽을 적용했다. 원본 인물과 공간을 유지하므로 예측 가능성이 높다. 생성 요청을 반복하지 않아도 되고, 사진 한 장으로도 화면에 시선의 흐름을 만들 수 있다.
반면 인물이 실제로 몸을 돌리거나 물건을 집는 것처럼 보이게 하는 데는 한계가 있다. 효과를 과하게 사용하면 장면보다 자막과 그래픽만 눈에 들어올 수도 있다.
생성형 모션 V2
생성형 모션은 각 장면을 짧은 AI 영상으로 새로 만들었다. 인물의 호흡, 고개와 손, 옷과 주변 사물이 움직이기 때문에 생동감이 크다. 정지 이미지의 확대만으로 표현하기 어려운 행동을 보여 줄 수 있다.
대신 생성할 때마다 결과가 달라질 수 있다. 손과 물건의 형태, 장면 사이 의상, 공간 배치와 인물의 일관성을 검수해야 한다. 실제로 이번 결과에서도 초반 장면의 옷이 코트, 재킷, 니트로 조금씩 바뀌는 연속성 문제가 남았다.

이 비교를 통해 기본 편집형과 생성형 모션을 같은 상품에 무제한으로 포함하면 안 된다는 결론을 얻었다. 생성형은 선택 옵션으로 분리하고 생성 클립 수, 재시도 횟수와 추가 비용 기준을 계약 전에 알려야 한다.
기호를 움직이는 것과 액션을 만드는 것은 달랐다
첫 액션 보강에서는 체크 표시, 물음표와 말줄임표를 화면에 넣고 움직였다. 기술적으로는 애니메이션이었지만 장면의 행동보다 글자 장식처럼 보였다. 액션이 너무 글자이고 허접하다는 피드백이 나온 이유다.
문제의 원인은 움직임의 양이 아니라 표현 단위였다. 감정은 물음표 한 글자보다 인물과 물건 주변의 시각적 반응으로 보여야 했다.
수정 버전에서는 답답함을 스트레스 방사선과 한숨 곡선으로 표현했다. 수납 가방을 드는 순간에는 충격 파동과 이동 궤적을 넣었다. 추억의 물건에는 포커스 링이 모이고 작은 빛이 반짝이게 했다.

상담에는 음성 파형, 분류에는 방향 화살표, 전문가의 작업에는 속도선을 사용했다. 의뢰인이 쉬는 장면에는 빠른 그래픽 대신 천천히 넓어지는 호흡 링을 넣었다. 결말에서는 밝은 빛이 공간으로 퍼지게 했다.

같은 모션 그래픽도 장면의 역할과 반대로 쓰면 의미가 어긋난다. 속도선은 작업자의 손에는 어울리지만 쉬는 고객에게는 불안처럼 보일 수 있다. 결국 모션 그래픽도 장식이 아니라 이야기의 동사로 설계해야 했다.
음악만으로 부족했던 연결을 TTS 내레이션으로 보완했다
처음에는 저녁 분위기의 잔잔한 음악과 문 여는 소리로 충분할 것이라 생각했다. 그러나 음악은 분위기를 만들 수 있어도 인물이 추억의 물건을 왜 지키려는지, 혼자 정리하다 왜 상담을 선택했는지를 설명하지 못했다.
7개 장면에 맞춰 7문장, 총 183자의 내레이션을 작성하고 Google TTS의 한 목소리로 통일했다. 화면에서 이미 보이는 행동을 반복해서 읽지 않고, 화면만으로 알기 어려운 마음을 연결하도록 문장을 배치했다.
효과음도 크게 넣는다고 좋은 것은 아니었다. 오래된 문이 열리는 듯한 소리가 저음의 우우웅으로 들리면 영상이 지나치게 무거워졌다. 최종적으로 내레이션을 중심에 두고 음악은 분위기를 유지하며, 행동 효과음은 짧고 작게 사용했다.
7개의 4초 클립과 예상 사용 비용
생성형 모션에는 4초 클립 7개를 사용했다. 이번 실행에서는 7개가 모두 첫 시도에 성공해 재시도가 없었다. 생성 당시 계산한 예상 사용 비용은 미화 2.24달러다.
이 수치는 실제 청구 내역으로 확정한 금액이 아니다. 공급자의 무료 크레딧, 모델 단가, 해상도와 정책에 따라 달라진다. 무엇보다 다른 작업에서는 한 장면을 여러 번 생성해야 할 수 있다. 따라서 30초 영상은 항상 2.24달러에 생성된다고 해석하면 안 된다.
실제 서비스에서는 생성 클립 수와 포함된 재생성 횟수를 정하고, 범위를 넘는 시도는 고객 승인 후 추가하는 구조가 필요하다. 이는 무한 수정을 막기 위한 조건이 아니라 예상하지 못한 API 사용 비용을 서로 명확히 알기 위한 조건이다.
최종 영상의 기술 검수와 남은 한계
최종 AI 모션 영상은 1080×1920, 9:16 세로 비율, 30fps, 30초, 900프레임으로 제작했다. 전체 구간 디코딩을 확인했고 플랫폼용 복사본의 해시도 비교했다. 편집형과 생성형을 좌우에 둔 비교본도 별도로 만들었다.
비교 영상에서는 같은 내레이션이 재생되는 동안 장면 자체가 움직이는 정도와 모션 그래픽의 역할을 바로 볼 수 있다.
최종본은 움직임이 풍부하지만 완벽하지 않다. 장면 사이 의상이 바뀌고 생성형 영상 특유의 미세한 물체 변화가 생길 수 있다. 실제 고객 작업에서는 인물 기준 이미지, 의상 색, 공간 구조와 금지 동작을 프롬프트와 검수표에 더 엄격히 고정해야 한다.
사진 없이 시작할 수 있다는 말의 정확한 의미
사진이 없어도 된다는 말은 아무 정보도 필요 없다는 뜻이 아니다. 촬영 자료 대신 업체의 특징, 손님이 서비스를 찾는 순간, 사장님이 중요하게 여기는 가치와 실제로 전하고 싶은 이야기가 필요하다.
이번 가상 사례에서는 그 이야기를 일곱 장면으로 만들고, 짧은 검수와 비교 과정을 거쳐 움직임의 수준을 결정했다. 처음부터 30초 전체를 생성하기보다 대본과 짧은 스타일 화면에서 방향을 확인하면 잘못된 분위기로 전 장면을 만드는 위험을 줄일 수 있다.
내가 이 과정을 통해 확인한 것은 AI의 자동화보다 협업 방식이었다. AI는 이미지를 만들고 목소리를 합성하고 움직임을 생성했지만, 어떤 장면이 답답해 보이는지, 어떤 효과가 허접한지, 고객의 여유가 어떻게 보여야 하는지는 사람이 판단했다.
이제 촬영이 부담스러운 소상공인을 대상으로 이야기만으로 시작하는 AI 숏폼 제작 대행서비스를 준비하려 한다. 내 가게 이야기가 어떤 영상으로 바뀔지 궁금하다면 제작 검토를 의뢰해 볼 수 있다. 구체적인 안내와 신청 링크는 댓글 또는 안내 페이지에서 확인할 수 있도록 제공할 예정이다.
※ 본문과 영상은 실제 업체가 아닌 숨틈 홈정리 가상 업체를 대상으로 만든 AI 제작 사례다.
편집형·생성형을 고를 때 함께 확인한 공개 기준
검증 기준일: 2026년 8월 22일. 움직임이 많다고 더 좋은 방식은 아닙니다. 설명이 정확히 전달되는지, 생성 오류를 사람이 고칠 수 있는지, 실제처럼 보이는 AI 장면을 공개해야 하는지, 음악 사용 조건을 확인할 수 있는지를 함께 비교해야 합니다.
- YouTube 생성형 AI 콘텐츠 공개 안내: 현실적으로 보이는 AI 생성·변형 장면의 공개 기준을 확인했습니다.
- YouTube 초상 관련 청구 안내: AI 공개 표시와 인물 사용 권리는 별개라는 기준을 확인했습니다.
- YouTube 오디오 보관함 안내: 음악·효과음의 라이선스와 Creative Commons 표시 조건을 확인했습니다.
비교 결과를 다른 작업에 적용하는 방법
글자와 도형 중심 안내는 편집형으로 먼저 만들고, 실제 행동을 보여줘야 하는 한두 장면만 생성형으로 시험하면 오류와 비용을 통제하기 쉽습니다. 전체 제작 순서는 30초 숏폼 제작 과정에서, 가상 업체에 적용한 결과는 베이커리 영상 사례에서 비교하세요.
작성·검수: AI 디지털 수익Lab 편집팀. 제작 기록, 비용 추정의 범위와 플랫폼 정책을 사람이 재확인했습니다.



