-
DiffDIS : High-Precision Dichotomous Image Segmentation via Probing Diffusion Capacity
2026. 7. 12.
ICLR 2025
Author : Qian Yu, Peng-Tao Jiang, Hao Zhang, Jinwei Chen, Bo Li, Lihe Zhang, Huchuan Lu
Dalian University of Technology, vivo Mobile Communication Co., Ltd
paper : https://proceedings.iclr.cc/paper_files/paper/2025/file/fcefc6e6370d49b9bad4fa4881aa1303-Paper-Conference.pdf
Github : https://github.com/qianyu-dlut/diffdisGitHub - qianyu-dlut/DiffDIS: High-Precision Dichotomous Image Segmentation via Probing Diffusion Capacity (ICLR2025)
High-Precision Dichotomous Image Segmentation via Probing Diffusion Capacity (ICLR2025) - qianyu-dlut/DiffDIS
github.com

1. Introduction
High-accuracy dichotomous image segmentation (DIS, ์ด๋ถ ์ด๋ฏธ์ง ๋ถํ )์ natural scenes ๋ด์์ ์นดํ ๊ณ ๋ฆฌ์ ์๊ด์์ด ์ ๊ฒฝ ๊ฐ์ฒด๋ฅผ ์ ํํ๊ฒ ์๋ณํ๋ ๊ฒ์ ๋ชฉํ๋ก ํ๋ค. DIS๋ ๊ฐ์ฒด์ ํน์ฑ์ ๊ด๊ณ์์ด ๊ณ ํด์๋์ ์ธ๋ฐํ ๊ฐ์ฒด ๋ถํ ์ ์ง์คํ๋ค. ์ด๋ฌํ ๊ฐ์ฒด๋ค์ ์ํด์๋ ๋์ฑ ์ ๊ตํ feature selection๊ณผ ์๊ณ ๋ฆฌ์ฆ์ด ํ์ํ๋ค. ํ์ฌ์ CNN/Transformer ๊ธฐ๋ฐ ๋ฐฉ๋ฒ๋ค์ ๊ฐ๋ ฅํ ํน์ง ์ถ์ถ ๋ฅ๋ ฅ์ ๊ฐ์ถ๊ณ ์์ง๋ง, ๊ณ ํด์๋ ์ด๋ฏธ์ง์์ receptive field (์์ฉ์์ญ) ํ์ฅ๊ณผ ์ธ๋ถ ์ ๋ณด ๋ณด์กด ์ฌ์ด์ ๊ท ํ์ ๋ง์ถ๋๋ฐ ์ด๋ ค์์ ๊ฒช๋๋ค. ์ฆ, ๋์ ๋ฒ์์ ๋ฌธ๋งฅ์ ๋ณด๋ฉด์๋ ์์ ์ธ๋ถ ์ ๋ณด๋ฅผ ์ ์งํ๋ ๊ฒ์ด Trade-off๋ค.
Diffusion probabilistic models (DPMs, ๋ํจ์ ๋ชจ๋ธ)์ ์ด๋ฏธ์ง ์ ์ฒด์ ๊ฑธ์ณ ๋ ธ์ด์ฆ ๋ณ์๋ฅผ ์์ธกํจ์ผ๋ก์จ, ๋ชฉํ ๋ถํฌ๋ฅผ ๋์ฑ ์ ํํ๊ฒ ํ์ตํ๋ฉด์ global receptive field๋ฅผ ์ ์งํ๋๋ฐ ์ ๋งํ๋ค. ๋์ฑ์ด, stable diffusion (SD)์ ์์ญ์ต๊ฐ์ ์ด๋ฏธ์ง๋ก ๊ตฌ์ฑ๋ ๋ฐฉ๋ํ ๋ฐ์ดํฐ์ ์ ํตํด ํ์ต๋์ด, ๋ฐ์ด๋ ์ผ๋ฐํ ๋ฅ๋ ฅ์ ๋ณด์ฌ์ฃผ๋ฉฐ ํ๋ถํ๊ณ ๋ค์ฌ๋ค๋ฅํ image representation์ ์ ๊ณตํ์ฌ ๊ฑฐ์์ ์ธ ๋งฅ๋ฝ๊ณผ ๋ฏธ์์ ์ธ ์ ๋ฐ๋๋ฅผ ๋ชจ๋ ์๊ตฌํ๋ ์์ ์ ์ด์์ ์ธ ํ๋ณด์ด๋ค. ์ต๊ทผ ์ฐ๊ตฌ๋ค์ ๋ฐ์ ์ diffusion์ด ๊ณ ํด์๋ ์ด๋ฏธ์ง ๋ถํ ์ ์ ํ์ฑ๊ณผ ๊ฒฌ๊ณ ์ฑ์ ํฅ์์ํค๋ ๊ฐ๋ ฅํ ๋๊ตฌ๊ฐ ๋ ์ ์์์ ์์ฌํ๋ค.
ํ์ง๋ง, diffusion model์ DIS์ ํ์ฉํ๊ธฐ์๋ ๋ช๊ฐ์ง ์ฑ๋ฆฐ์ง๊ฐ ์๋ค.
(1) : DPM์ ๊ณ ์ ํ ๊ณ ์ฐจ์ ์ฐ์ ํน์ง ๊ณต๊ฐ (high-dimensional continuous feature space)์ ์ด์ง ๋ถํ ์ ์ด์ฐ์ ํน์ฑ๊ณผ ์ถฉ๋ํ์ฌ ์์ธก ๊ณผ์ ์์ ๋ถ์ผ์น๊ฐ ๋ฐ์ํ ์ ์์. (์ฐ์์ ์ธ ๊ฒฐ๊ณผ -> ์ด์ง์ ์ธ mask๋ก์ ๋ณํ ๊ณผ์ ์์์ ๋ถ์ผ์น)
(2) : ํ์ฐ ๋ชจ๋ธ์ ์ถ๋ก ์๊ฐ์ด ์ค๋ ๊ฑธ๋ฆผ. ํ์ฐ ๋ชจ๋ธ์ ๋ฐ๋ณต์ ์ธ ํน์ฑ์ผ๋ก ์ธํด ์ ๋๋ก๋ ๊ฒฐ๊ณผ์๋ ์ผ๋ฐ์ ์ผ๋ก 100 step ์ด์ ์์๋๋ฉฐ, ์ด๋ฏธ ๋ฐ์ดํฐ๊ฐ ๋ฐฉ๋ํด์ ๋๋ฆฐ HR ์์์ ์ถ๋ก ์๋๋ฅผ ๋์ฑ ์ ํ์ํด.
(3) : ํ์ฐ๋ชจ๋ธ์ ํ๋ฅ ์ ์์ฑ๊ณผ ์ด๋ฏธ์ง ์์ธก task์ ๊ฒฐ์ ๋ก ์ ๊ฒฐ๊ณผ ์ฌ์ด์ ์ถฉ๋. (๊ฐ์ ์ ๋ ฅ์ ๋ํด ํญ์ ๊ฒฐ๊ณผ๊ฐ ๋์ผํด์ผ ํจ)
์ ์๋ค์ ์์ ์ธ๊ธํ ๋ฌธ์ ์ ๊ณผ ์์ ๋ณ ๋ณต์ก์ฑ์ ๋ชจ๋ ํด๊ฒฐํ๋ DiffDIS๋ฅผ ์ ์ํ๋ค. DiffDIS๋ ๋ค์ ์ ๋ต๋ค์ ํตํด ์ฒ๋ฆฌ ์๋ ํฅ์, ์ธ๋ถ ์ ๋ณด ์ธ์ ๊ฐํ, ๊ฒฐ์ ์ฑ ์ฆ๋ (higher determinisim)์ ์ด์ ์ ๋ง์ถ๋ค.
1. VAE๋ฅผ latent space <-> binary mask์ ๋ณํ๊ธฐ๋ก ์ฌ์ฉ. (feature space ์๋ง๋ ๋ฌธ์ ํด๊ฒฐ)
2. Stable diffusion ์ฒ๋ผ pixel space๊ฐ ์๋ latent space์์ diffusion ์ํ. (์ฐ์ฐ๋ ๋ฌธ์ ํด๊ฒฐ)
3. pretrained SD-Turbo๋ฅผ ์ด์ฉํ one-step denoising. (๊ธด ์ถ๋ก ์๊ฐ & ์ถ๋ ฅ ๋ณ๋์ฑ ๋ฌธ์ ํด๊ฒฐ)
4. Mask์ edge๋ฅผ ๋์์ ์์ธกํ๋ ์ ๋ต. (edge constraint์ด ์ถ๋ ฅ๋ฒ์๋ฅผ ์ ํ -> ์๊ณ ๋ณต์กํ ๊ฒฝ๊ณ ๊ฒ์ถ์ ํจ๊ณผ์ )
5. RGB latent representation์ ํ์ฐ ๋ชจ๋ธ์ condition์ผ๋ก ์ฌ์ฉ. (RGB ์ด๋ฏธ์ง์์ seg๋ฅผ ๋ง๋๋๊ฑฐ๋๊น... ์ด์ฉ๋ฉด ๋น์ฐํ ์ผ.)
6. Scale-wise Conditional Injection ์ ์. (RGB condition์ network ์ฌ๋ฌ ์ง์ ์ ํด์๋๋ฅผ ๊ณ ๋ คํ์ฌ ์ฃผ์ . -> ํด์๋์ ๋ฐ๋ผ local detail + global structure ๋ ๋ค ํ์ฉ๋จ)
์ฝ๊ฒ ์ ๋ฆฌํ๋ฉด, ๊ณ ํด์๋ RGB ์ด๋ฏธ์ง์ ์ ๋ต binary mask๋ฅผ VAE latent ๊ณต๊ฐ์ผ๋ก ์์ถํ๊ณ , SD-Turbo ๊ธฐ๋ฐ diffusion network๊ฐ RGB ์กฐ๊ฑด์ ์ด์ฉํด mask latent๋ฅผ ํ ๋ฒ์ ์์ธกํ๋๋ก ํ๋ค. ์ด๋ mask๋ฟ ์๋๋ผ edge๋ ํจ๊ป ์์ธกํ๊ณ , ์ฌ๋ฌ ํด์๋์์ RGB ์กฐ๊ฑด์ ์ฃผ์ ํ์ฌ ์ ์ฒด ํํ์ ๋ฏธ์ธ ๊ฒฝ๊ณ๋ฅผ ๋์์ ๋ณด์กดํ๋ค.
์ ์๋ค์ Contribution์ ๋ค์๊ณผ ๊ฐ๋ค.
(1) : ํ์ฐ ๋ชจ๋ธ์ ๊ฐ๋ ฅํ ์ฌ์ ์ง์์ ํ์ฉํ์ฌ DIS ์์ ์ ์ํํ๋ DiffDIS ์ ์. ์ด ๋ชจ๋ธ์ ์์ฉ ์์ญ ํ์ฅ - ์ธ๋ถ ์ ๋ณด ๋ณด์กด ์ฌ์ด์ ๊ท ํ ๋ฌธ์ ๋ฅผ ํด๊ฒฐํจ.
(2) : ํ์ฐ ๋ชจ๋ธ์ ๋ฐ๋ณต์ ์ธ ํน์ฑ์ ๊ฐ๋จํ one-step denoising์ ๊ตฌํํ์ฌ end-to-end framework๋ก ๋ณํํจ์ผ๋ก์จ ์ถ๋ก ์๋๋ฅผ ํฌ๊ฒ ํฅ์์ํด.
(3) : ๋ณด์กฐ edge generation task ๋์ . ์ด๋ ์์ฑ๋ ๋ง์คํฌ์ ๊ฒฐ์ ์ฑ์ ๊ฐํํ๋ฉด์ ์ธ๋ถ ํํ์ ๋ฏธ๋ฌํ ๊ท ํ์ ๋ฌ์ฑํจ.
(4) : DIS ๋ฒค์น๋งํฌ ๋ฐ์ดํฐ์ ์์ ๊ฑฐ์ ๋ชจ๋ ์งํ๋ฅผ ๋ฅ๊ฐํ์ฌ ์๋ก์ด SoTA๋ฅผ ํ๋ฆฝ.
2. Method

2.1 Overall architecture

2.2 Edge-assisted training strategy
๊ณ ํด์๋ ์์ , ํนํ ํ์ฐ ๊ธฐ๋ฐ ๋ชจ๋ธ์ ๊ฒฝ์ฐ ์ ์ฌ๊ณต๊ฐ์ด ์ ๋ ฅ ํฌ๊ธฐ๋ณด๋ค ์๊ฒ ์ถ์๋๊ธฐ ๋๋ฌธ์ ๋ํ ์ผํ ํน์ง์ ์ ํํ ํํํ๋๊ฒ์ ์ด๋ ต๋ค. ๋ช๋ช ์ฐ๊ตฌ๋ค์ ์ถ๊ฐ์ ์ธ edge constraints์ ๋์ ํ์ฌ mask์ boundary segmentation ๋ฅ๋ ฅ์ ํฅ์์์ผฐ๋ค. ์ ์๋ค์ mask์ edge ๋ ๋ค๋ฅผ ์ํ noise๋ฅผ ์์ธกํ๊ฒ ํจ์ผ๋ก์จ, ๋ณด์กฐ์ ์ธ edge ์ ๋ณด๋ก network์ ์ ์ฝ์ ์ค๋ค. ์ด ๋ ๊ฐ์ ์์ธก ์คํธ๋ฆผ์ ๋์ผํ ๋คํธ์ํฌ ๊ตฌ์กฐ ๋ด์์ ์๋ํ๋ฉฐ ํ๋ผ๋ฏธํฐ๋ฅผ ๊ณต์ ํ๊ณ , ์ด๋ค์ ํจ๊ณผ์ ์ผ๋ก ๊ตฌ๋ถํ๊ธฐ ์ํด batch discriminative embedding (BDE) ์ด ์ ์ฉ๋๋ค. U-net ์ํคํ ์ณ, ํนํ semantic information์ด ๊ฐ์ฅ ์ง์ค๋ mid-block์์, ์ ์๋ค์ ๊ธฐ์กด์ attention ๋ชจ๋์ Detail-Balancing Interactive Attention์ผ๋ก ์ ๊ทธ๋ ์ด๋ํ์ฌ ์์ ๋ณ ์ฑ๋ฅ ํฅ์์ ๊ตฌํํ์๋ค. ์ด ๋งค์ปค๋์ฆ์ mask stream๊ณผ edge stream์ attention ์์ญ์ ์ ๋ ฌํ์ฌ, ๋ ์คํธ๋ฆผ ๊ฐ์ ๋ณด๋ค ํจ์จ์ ์ธ ์ํธ ์์ฉ๊ณผ ์ํธ ๋ณด์์ฑ์ ์ด์งํ๋ค.

Batch-Discriminative Embedding (BDE)
์ ์๋ค์ batch ๋ด์ ์ถ๊ฐ์ ์ธ discriminative labels d_lab์ ํตํฉํ์ฌ, single stable diffusion model์ด ์ฌ๋ฌ ํ์ ์ ์ถ๋ ฅ์ ๋์์ ์์ฑํ ์ ์๊ฒํ์๋ค. ์ด๋ ์ํธ๊ฐ์ญ์์ด ์ํํ ๋๋ฉ์ธ ์ฒ๋ฆฌ๋ฅผ ๋ณด์ฅํ๋ค. ๊ตฌ์ฒด์ ์ผ๋ก, d_lab์ ๋จผ์ binary form์ผ๋ก ํํ๋ ๋ค์, positional encoding์ ํตํด ์ธ์ฝ๋ฉ ๋๋ค. ์ดํ learnable projection head๋ฅผ ํต๊ณผํ๊ณ , time embedding๊ณผ element-wise๋ก ๊ฒฐํฉ๋๋ค. ๊ฒฐํฉ๋ embedding์ ResBlocks์ ์ ๋ ฅ๋์ด ๋ชจ๋ธ์ ๋ฐฐ์น๋ณ ์ถ๋ ฅ ์์ฑ ๋ฅ๋ ฅ์ ํฅ์์ํจ๋ค.
๋๋ณด๊ธฐ์ด๋ ๊ธฐ์กด์ ์๋ ๊ธฐ๋ฒ์ ๊ฐ์ ธ์ ์ ์ ํ๊ฒ ํ์ฉํ ๋ถ๋ถ.
- Wonder3D: RGB์ normal ์ค ๋ฌด์์ ์์ฑํ ์ง ์๋ ค์ฃผ๋ domain switcher
- GeoWizard: depth์ normal ์ค ๋ฌด์์ ์์ฑํ ์ง ์๋ ค์ฃผ๋ geometry switcher
- DiffDIS: mask์ edge ์ค ๋ฌด์์ ์์ธกํ ์ง ์๋ ค์ฃผ๋ batch-discriminative embedding
์ฝ๊ฒ ๋งํ์๋ฉด, ํ๋์ ๊ณต์ U-Net์ด mask์ edge๋ฅผ ๊ฐ๊ฐ ๋ณ๋์ batch sample๋ก ๋์์ ์ฒ๋ฆฌํด์ผํ๋๊น, ๊ฐ sample์ด mask์ธ์ง edge์ธ์ง ๊ตฌ๋ถํ ์ ์๋๋ก label embedding์ ์ ๊ณตํ๋ ๊ฒ. ๊ธฐ์กด์ batch = 2๋ผ๋ฉด Image 2์ฅ์ mask 2์ฅ, edge 2์ฅ์ด ์๋ ํํ์ธ๋ฐ mask์ธ์ง edge์ธ์ง ๋ ์ด๋ธ์ ๋ฌ์์ batch = 4๋ก ๋ง๋๋ ์ . (ํ๋์ batch์ mask1, mask2, edge1, edge2)
์ค๊ฐ์ Time embedding์ด ๋ค์ด๊ฐ๋ ์ด์ ๋, ์๋ diffusion condition์ time์ด ๋ค์ด๊ฐ๊ธฐ ๋๋ฌธ.
Learnable projection head๋ ๋ณดํต ์์ ์ ๊ฒฝ๋ง์ธ๋ฐ, label encoding์ U-Net์ด ์ฌ์ฉํ ์ ์๋ ํฌ๊ธฐ์ embedding์ผ๋ก ๋ณํํ๋ ์ญํ ์ ํจ. (์ฌ๊ธฐ์๋ ์๋ง time-embedding๊ณผ ๊ฐ์ ์ฐจ์์ผ๋ก ๋ณํ๋ ๊ฒ)
Detail-Balancing Interactive Attention (DBIA)
Mask์ edge์ ์ฐ์์ฑ๊ณผ ์ ๋ ฌ์ ๋ณด์ฅํ๊ณ , ์ด๋ค์ ์๋ฏธ์ ๋จ์์ attention์ด ์ง์ค๋๋ ์์ญ์ ์กฐํ์ํค๊ธฐ ์ํด, ์ ์๋ค์ DBIA๋ฅผ ๋์ ํ์๋ค. DBIA๋ ๋ ๋๋ฉ์ธ ์ฌ์ด์์ ๋จ์ํ์ง๋ง ํจ๊ณผ์ ์ธ ์ ๋ณด ๊ตํ์ ์ด์งํ๋๋ก ์ค๊ณ๋์์ผ๋ฉฐ, ๊ถ๊ทน์ ์ผ๋ก edge์ ์ธ๋ถ ์ ๋ณด์ ์๋ฏธ์ ๋ด์ฉ ์ธก๋ฉด์์ ๋ชจ๋ ์ ์ ๋ ฌ๋ ์ถ๋ ฅ์ ์์ฑํ๋ ๊ฒ์ ๋ชฉํ๋ก ํ๋ค. ์ฝ๊ฒ๋งํ๋ฉด, DiffDIS๋ ํ๋์ U-Net์ผ๋ก ๋ ์ถ๋ ฅ (edge, mask)์ ๋์์ ์์ธกํ๋๋ฐ, ๋์ ์๋ก ๊ด๋ จ๋์ง๋ง ๊ฐ์กฐํ๋ ์ ๋ณด๊ฐ ๋ค๋ฅด๋ค. (mask - ๊ฐ์ฒด ์ ์ฒด๋ ์ฐพ์ง๋ง ๊ฒฝ๊ณ๊ฐ ๋ญ๊ฐ์ง / edge - ์ธ๋ฐํ ์ ์ ์ฐพ์ง๋ง ์ด๋ค ์ ์ด ์ค์ ๊ฐ์ฒด ๊ฒฝ๊ณ์ธ์ง ์๋ฏธ์ ์ผ๋ก ๋ชจํธํจ) ๊ทธ๋์ ๋ ์ ๋ณด๊ฐ ์ํธ ๋ณด์ํ์ฌ ์๋ก ์ข์์ง๊ฒ ํ๊ณ ์ ํจ.
๊ธฐ์กด์ SD์๋ self-attention, cross-attention์ด ์กด์ฌํ๋๋ฐ, ์ ์๋ค์ ์ฌ๊ธฐ์ mutual cross-domain attention์ ์ถ๊ฐํ๋ค.

(mask๋ edge์์, edge๋ mask์์ ๊ฐ๊ฐ ์ฐธ์กฐํ๊ณ ์์) ์ด ๋ฐฉ๋ฒ์ ๋ ์์ญ๊ฐ์ ์ง์ ์ ์ด๊ณ ํจ์จ์ ์ธ ์ ๋ณด ๊ตํ์ ๋ณด์ฅํ์ฌ, ์ ๋ฐ์ ์ธ ํน์ง ํํ์ ํฅ์์ํค๋ ์ํธ์์ฉ์ ์ด์งํ๋ค.
2.3 Scale-wise conditional injection
Dense prediction task๋ฅผ ์ํ ๊ธฐ์กด ํ์ฐ ๋ชจ๋ธ์์๋ ์ผ๋ฐ์ ์ผ๋ก input ๋จ๊ณ์์ condition์ ์ค๋ค. ์ด๋ฌํ ๋ฐฉ์์ ํ์ ๋จ๊ณ์์ ์ ๋ณด ์์ค์ ์ด๋ํ ์ ์๋ค. ์ฅ๊ธฐ์ ์ด๊ณ ์ฌ์ธต์ ์ธ conditional guidance๋ฅผ ๊ตฌ์ถํ๊ธฐ ์ํด, ์ ์๋ค์ multi-granular perception (๋ค์ํ ์ธ๋ฐ๋ ์์ค์ ์ ๋ณด ์ธ์)์ ํฅ์์ํค๊ณ ์ฌ์ธต์ ์ธ ์๊ฐ์ ์ํธ์์ฉ์ ์ด์งํ๋ SWCI ๊ธฐ๋ฒ์ ๋์ ํ๋ค. ๊ตฌ์ฒด์ ์ผ๋ก, U-Net encoder์ ํด๋น layer์ multi-scale condition์ ํตํฉํ๋ค. ๊ทธ๋ฆฌ๊ณ 3๊ฐ์ injector heads๋ฅผ ์ฌ์ฉํ์ฌ ์ค๊ฐ์ค๊ฐ์ feature ํฌ๊ธฐ ๋ฐ ์ฑ๋ ์๋ฅผ ๋ง์ถฐ์ค๋ค.
3๊ฐ์ Injection heads๋ 1๊ฐ์ simple convolution laeyr์ 2๊ฐ์ zero convolution layers๋ก ๊ตฌ์ฑ๋๋ค. ๊ฐ๊ฐ์ ํค๋๋ ์ ๋ ฅ์ผ๋ก ํด๋น ์ค์ผ์ผ์ ๋ง๊ฒ ํฌ๊ธฐ๊ฐ ์กฐ์ ๋ conditional latent code๋ฅผ ๋ฐ๋๋ค. ์ฌ๊ธฐ์ zero convolution์ ๋ชจ๋ weight, bias๊ฐ 0์ผ๋ก ์ด๊ธฐํ๋ ๋ ์ด์ด๋ก, ControlNet์์ ์ฌ์ฉ๋ ๋ฐฉ์์ด๋ค. ์ด๊ธฐ์ํ์์๋ ๊ฐ์ด 0์ด ๋์ค๋ฏ๋ก feature๋ฅผ ์ฒ์๋ถํฐ ๊ฑด๋๋ฆฌ์ง ์์ง๋ง, ํ์ต์ด ์งํ๋๋ฉด์ weight๊ฐ ์ ๋ฐ์ดํธ ๋์ด RGB conditioning ๊ฒฝ๋ก๋ฅผ ์์ ์ ์ผ๋ก ํ์ตํ๊ฒ ๋๋ค.
2.4 One-step mask sampling (Inference)

Inference ๊ณผ์ ์์, ๋จผ์ RGB image๋ VAE encoder๋ฅผ ํตํด latent space๋ก ์ธ์ฝ๋ฉ๋๋ค. ๋ค์์ผ๋ก, standard gaussian noise์์ ์์ ๋ณ์๋ฅผ ์ํ๋งํ์ฌ, mask์ edge์ ์ด๊ธฐํ๋ก ์ฌ์ฉํ๋ค. (์๋ง ๋ณต์ ํด์ ์ฌ์ฉํ๋๋ฏ?) Training ๋จ๊ณ์ ์ ์ฌํ๊ฒ, ์ด ๋ ๊ตฌ์ฑ์์๋ batch๋ก ์ฐ๊ฒฐ๋๋ฉฐ, batch-discriminative embedding (BDE)๊ฐ ์ ์ฉ๋์ด ํจ๊ณผ์ ์ผ๋ก ๊ตฌ๋ถ๋๋ค. (์ฝ๊ฒ ๋งํด ๊ทธ๋ฅ ๋ ์ด๋ธ์ด ๋ฌ๋ ค์ edge์ธ์ง mask์ธ์ง ๊ตฌ๋ถ์ด ๋๋ค.) RGB latent representation์ ๋ฐ๋ผ ์กฐ๊ฑดํ๋ concatnated components๋ค์ ๋ ธ์ด์ฆ๋ฅผ ์์ธกํ๊ธฐ ์ํด U-net์ ์ ๋ ฅ๋๋ค. ์ดํ ์๊ณ ๋ฆฌ์ฆ 2์ ๋ฐ๋ผ ๊ธฐ์กด DDPM ๋ฐฉ์์ฒ๋ผ ์ํ๋ง ํ๋ก์ธ์ค๊ฐ ์งํ๋๋ค. ๋ง์ง๋ง์ผ๋ก, mask, edge map์ VAE ๋์ฝ๋๋ฅผ ์ฌ์ฉํ์ฌ latent code์์ ๋์ฝ๋ฉ๋๊ณ , channel ํ๊ท ํ๋ฅผ ํตํด ํ์ฒ๋ฆฌ๋๋ค.
3. Experiments
3.1. Dataset, Metrics, and Implementation Details
- ๋ฐ์ดํฐ์
: DIS5K ์ฌ์ฉ
- ํ์ต: 3,000์ฅ, 225๊ฐ ์นดํ ๊ณ ๋ฆฌ
- ๊ฒ์ฆ: DIS-VD
- ํ ์คํธ: DIS-TE1~4, ๊ฐ 500์ฅ
- ํ์ต ํ๊ฒฝ: PyTorch, NVIDIA H800 GPU 1์ฅ
- ์ ๋ ฅ ํฌ๊ธฐ: ๋ชจ๋ ์ด๋ฏธ์ง๋ฅผ 1024×1024๋ก resize
- ๋ชจ๋ธ ์ด๊ธฐํ: SD V2.1์ backbone์ผ๋ก ์ฌ์ฉํ๊ณ , SD-Turbo pretrained parameter๋ก ์ด๊ธฐํ
- ๋ฐ์ดํฐ ์ฆ๊ฐ: horizontal flip, crop, rotation, CutMix
- ํ์ต ์ค์ : Adam, learning rate 3×10^−5, batch size 4, ์ต๋ 90 epoch
- ํ๊ฐ ์ ํ์ฒ๋ฆฌ: ์์ธก ๋งต์ ์ด์งํํ์ฌ ์์ noise๋ฅผ ์ ๊ฑฐํ ๋ค ์ฑ๋ฅ ๊ณ์ฐ
- ํ๊ฐ์งํ

3.2 Comparision


3.3 Ablation
๊ฐ ์ปดํฌ๋ํธ์ effectiveness

์ ์ฉํ ์๋ก ์ ์ง์ ์ผ๋ก ๊ฒฐ๊ณผ๊ฐ ์ข์์ง๊ณ , ๋ค ์ ์ฉํ๋๊น ๊ฒฐ๊ณผ๊ฐ ์ข๋๋ผ.
Pre-trained parameters์ denoising steps์ ๋ค์์ฑ

1, 2, 5ํ์ ๋ดค์ ๋, SD-Turbo ํ๋ผ๋ฏธํฐ ๊ฐ์ ธ๋ค ์ฐ๋๊ฒ ์ ์ผ ์ข์์.
2, 3, 4ํ์ ์๋ก ๋ค๋ฅธ few-step denoising paradigms์ ๋ณด์ฌ์ค. 4ํ์ ์ ํ๋๊ฐ ์กฐ๊ธ ๋ ๋์ง๋ง, ์๊ฐ์ด ๋๋ฐฐ๋ก ์ฆ๊ฐํจ. ์ฆ. step์ ๋๋ฆฐ๋ค๊ณ ๋ฐ๋์ ์ฑ๋ฅ์ด ์ข์์ง์ง๋ ์์.
DBIA์์ ๋ค์ํ ์ํธ์์ฉ ๋ฐฉ๋ฒ ๋น๊ต

DBIA์ ์ถ๊ฐ์ ์ธ cross-attention ๋งค์ปค๋์ฆ์ ์๋ ์ํธ์์ฉ ๋ฐฉ๋ฒ์ Fu et al๊ณผ ์ ์ฌํ fusion-oriented approach๋ก ๋์ฒดํ๋๋ฐ, ์ ์๋ค๊ป ๋ ์ข๋ค๊ณ ํจ.
dichotomous : ์ด๋ถ๋ฒ์ ์ธ
encompass : ํฌํจํ๋ค. ๋๋ฌ์ธ๋ค.
versatile : ๋ค์ฌ๋ค๋ฅํ, ๋ค์ฉ๋์, ๋ค๋ชฉ์
streamline : ์ ์ ํ์ผ๋ก ํ๋ค. ๊ฐ์ํ ํ๋ค.
tough to + v : ~ ํ๊ธฐ ์ด๋ ต๋ค.
seamless : ์ํํ , ์์ฃผ ๋งค๋๋ฌ์ด
'๐PAPER' ์นดํ ๊ณ ๋ฆฌ์ ๋ค๋ฅธ ๊ธ
๋ ผ๋ฌธ์ธ๋ ์๊ฐํด๋ณผ๊ฒ๋ค (0) 2023.08.01 ๋๊ธ