스테이블 디퓨전(Stable Diffusion)은 독일 뮌헨 대학교
Machine Vision & Learning Group (CompVis) 연구실이
개발한 잠재 확산 모델을 바탕으로 제작되었으며,
Stability AI와 Runway ML 등의 기업으로부터
지원받아 개발된 딥러닝 인공지능 모델이에요.
2022년 8월 22일 오픈소스로 공개되었으며,
사용자가 텍스트 프롬프트를 입력하면
이미지로 결과물을 추출하는
‘text-to-image’ 기반의 생성 AI입니다.
스테이블 디퓨전은 이미지에 점차
노이즈를 주고 노이즈를 다시 제거함으로써
이미지를 완성하는 diffusion 모델을 활용해
고품질의 이미지를 생성합니다.
이에 따라 기존의 text-to-image 모델들이 갖고 있던
저화질 문제와 컴퓨터 리소스 문제를 해결했습니다.
(출처 : 한국저작권위원회 생성형 인공지능 (Generative AI) 산업 현황 보고서)
스테이블 디퓨전이 오픈소스로 공개된 덕분에
사용자들은 일정한 제약사항을 제외하고는
창조적인 용도로 자유롭게 사용하고 있어요.
이 덕분에 스테이블 디퓨전은
그림 인공지능 시대를 열었다는
평을 받고 있습니다.
(출처 : stability AI)
스테이블 디퓨전은 누구나 무료로 사용할 수 있으며,
오픈소스(Open-source)이기에 개발자들이
지속해서 다양한 기능을 선보이고 있어요.
게다가 비교적 큰 해상도의
이미지를 생성함에도
리소스 사용량이 많지 않아
가정용 컴퓨터에서도 실행할 수 있어 생성형 AI의 대표 주자가 되었습니다. 스테이블 디퓨전은 어떻게 사용할까요?
스테이블 디퓨전을 사용하기 위해서는
이미지를 설명하는 텍스트(프롬프트)를 작성해야 합니다.
예를 들어 [헨젤과 그레텔에 나오는 과자집] 이미지를
생성하고 싶다면 다음 프롬프트를 입력하면 됩니다.
gingerbread house, diorama, in focus,
white background, toast, crunch cereal
그럼 스테이블 디퓨전은 해당 프롬프트에 맞춰
텍스트를 이미지로 변환합니다.
(출처 : stable-diffusion-art.com/beginners-guid)
하나의 프롬프트라고 하더라도
원하는 이미지가 나올 때까지
다양한 이미지를 생성할 수 있습니다^_^
또한, 2D, 실사, 풍경화, 판타지,
동물 이미지까지 다양한 화풍을
프롬프트 작성만으로
한 번에 제작할 수 있어요.
이미지를 생성하는 스펙트럼이 넓다 보니
광고, 게임, 건축 디자인 등
다양한 산업군에서 활발하게
활용되고 있습니다.
(출처 : stable-diffusion-art.com/beginners-guid)
원하는 이미지를 얻으려면
프롬프트를 어떻게 작성해야 할까요?
그리고자 하는 이미지의 주제를
가능한 구체적으로 작성하고,
유명인 이름과 그림, 3D 등
생성하고자 하는 키워드를 포함하여
작성하면 원하는 이미지를
더욱 쉽게 생성할 수 있습니다. :)
예를 들어, 식당 밖에 앉아있는 실사의
젊은 여성 이미지를 생성하고 싶다면
다음의 프롬프트를 작성하면 돼요!
Positive prompt : young female, highlights in hair,
sitting outside restaurant, brown eyes,
wearing a dress, side light
Negative prompt : disfigured, ugly, bad, immature
긍정적인 프롬프트로
연령층(young), 성별(female)
머리카락(highlights in hair)
장소(sitting outside restaurant)
얼굴(brown eyes), 옷(wearing a dress)
조명(side light) 등
원하는 이미지를
구체적으로 작성했으며,
부정적인 프롬프트를 함께 작성해
매력적이지 않은 모델 이미지와
뒤틀린 신체 부위가 생성되는 것을
방지할 수 있는 프롬프트를 작성했습니다.