• DiffDIS : High-Precision Dichotomous Image Segmentation via Probing Diffusion Capacity

    2026. 7. 12.

    by. ํ•ด๋Š”์„ 

    ICLR 2025

     

    Author : Qian Yu, Peng-Tao Jiang, Hao Zhang, Jinwei Chen, Bo Li, Lihe Zhang, Huchuan Lu
    Dalian University of Technology, vivo Mobile Communication Co., Ltd

    paper : https://proceedings.iclr.cc/paper_files/paper/2025/file/fcefc6e6370d49b9bad4fa4881aa1303-Paper-Conference.pdf

    Github : https://github.com/qianyu-dlut/diffdis

     

     

    GitHub - qianyu-dlut/DiffDIS: High-Precision Dichotomous Image Segmentation via Probing Diffusion Capacity (ICLR2025)

    High-Precision Dichotomous Image Segmentation via Probing Diffusion Capacity (ICLR2025) - qianyu-dlut/DiffDIS

    github.com

     

    1. Introduction

    High-accuracy dichotomous image segmentation (DIS, ์ด๋ถ„ ์ด๋ฏธ์ง€ ๋ถ„ํ• )์€ natural scenes ๋‚ด์—์„œ ์นดํ…Œ๊ณ ๋ฆฌ์— ์ƒ๊ด€์—†์ด ์ „๊ฒฝ ๊ฐ์ฒด๋ฅผ ์ •ํ™•ํ•˜๊ฒŒ ์‹๋ณ„ํ•˜๋Š” ๊ฒƒ์„ ๋ชฉํ‘œ๋กœ ํ•œ๋‹ค. DIS๋Š” ๊ฐ์ฒด์˜ ํŠน์„ฑ์— ๊ด€๊ณ„์—†์ด ๊ณ ํ•ด์ƒ๋„์˜ ์„ธ๋ฐ€ํ•œ ๊ฐ์ฒด ๋ถ„ํ• ์— ์ง‘์ค‘ํ•œ๋‹ค. ์ด๋Ÿฌํ•œ ๊ฐ์ฒด๋“ค์„ ์œ„ํ•ด์„œ๋Š” ๋”์šฑ ์ •๊ตํ•œ feature selection๊ณผ ์•Œ๊ณ ๋ฆฌ์ฆ˜์ด ํ•„์š”ํ•˜๋‹ค. ํ˜„์žฌ์˜ CNN/Transformer ๊ธฐ๋ฐ˜ ๋ฐฉ๋ฒ•๋“ค์€ ๊ฐ•๋ ฅํ•œ ํŠน์ง• ์ถ”์ถœ ๋Šฅ๋ ฅ์„ ๊ฐ–์ถ”๊ณ  ์žˆ์ง€๋งŒ, ๊ณ ํ•ด์ƒ๋„ ์ด๋ฏธ์ง€์—์„œ receptive field (์ˆ˜์šฉ์˜์—ญ) ํ™•์žฅ๊ณผ ์„ธ๋ถ€ ์ •๋ณด ๋ณด์กด ์‚ฌ์ด์˜ ๊ท ํ˜•์„ ๋งž์ถ”๋Š”๋ฐ ์–ด๋ ค์›€์„ ๊ฒช๋Š”๋‹ค. ์ฆ‰, ๋„“์€ ๋ฒ”์œ„์˜ ๋ฌธ๋งฅ์„ ๋ณด๋ฉด์„œ๋„ ์ž‘์€ ์„ธ๋ถ€ ์ •๋ณด๋ฅผ ์œ ์ง€ํ•˜๋Š” ๊ฒƒ์ด Trade-off๋‹ค.

     

    Diffusion probabilistic models (DPMs, ๋””ํ“จ์ „ ๋ชจ๋ธ)์€ ์ด๋ฏธ์ง€ ์ „์ฒด์— ๊ฑธ์ณ ๋…ธ์ด์ฆˆ ๋ณ€์ˆ˜๋ฅผ ์˜ˆ์ธกํ•จ์œผ๋กœ์จ, ๋ชฉํ‘œ ๋ถ„ํฌ๋ฅผ ๋”์šฑ ์ •ํ™•ํ•˜๊ฒŒ ํ•™์Šตํ•˜๋ฉด์„œ global receptive field๋ฅผ ์œ ์ง€ํ•˜๋Š”๋ฐ ์œ ๋งํ•˜๋‹ค. ๋”์šฑ์ด, stable diffusion (SD)์€ ์ˆ˜์‹ญ์–ต๊ฐœ์˜ ์ด๋ฏธ์ง€๋กœ ๊ตฌ์„ฑ๋œ ๋ฐฉ๋Œ€ํ•œ ๋ฐ์ดํ„ฐ์…‹์„ ํ†ตํ•ด ํ•™์Šต๋˜์–ด, ๋›ฐ์–ด๋‚œ ์ผ๋ฐ˜ํ™” ๋Šฅ๋ ฅ์„ ๋ณด์—ฌ์ฃผ๋ฉฐ ํ’๋ถ€ํ•˜๊ณ  ๋‹ค์žฌ๋‹ค๋Šฅํ•œ image representation์„ ์ œ๊ณตํ•˜์—ฌ ๊ฑฐ์‹œ์ ์ธ ๋งฅ๋ฝ๊ณผ ๋ฏธ์‹œ์ ์ธ ์ •๋ฐ€๋„๋ฅผ ๋ชจ๋‘ ์š”๊ตฌํ•˜๋Š” ์ž‘์—…์— ์ด์ƒ์ ์ธ ํ›„๋ณด์ด๋‹ค. ์ตœ๊ทผ ์—ฐ๊ตฌ๋“ค์˜ ๋ฐœ์ „์€ diffusion์ด ๊ณ ํ•ด์ƒ๋„ ์ด๋ฏธ์ง€ ๋ถ„ํ• ์˜ ์ •ํ™•์„ฑ๊ณผ ๊ฒฌ๊ณ ์„ฑ์„ ํ–ฅ์ƒ์‹œํ‚ค๋Š” ๊ฐ•๋ ฅํ•œ ๋„๊ตฌ๊ฐ€ ๋  ์ˆ˜ ์žˆ์Œ์„ ์‹œ์‚ฌํ•œ๋‹ค.

     

    ํ•˜์ง€๋งŒ, diffusion model์„ DIS์— ํ™œ์šฉํ•˜๊ธฐ์—๋Š” ๋ช‡๊ฐ€์ง€ ์ฑŒ๋ฆฐ์ง€๊ฐ€ ์žˆ๋‹ค. 

    (1) : DPM์˜ ๊ณ ์œ ํ•œ ๊ณ ์ฐจ์› ์—ฐ์† ํŠน์ง• ๊ณต๊ฐ„ (high-dimensional continuous feature space)์€ ์ด์ง„ ๋ถ„ํ• ์˜ ์ด์‚ฐ์  ํŠน์„ฑ๊ณผ ์ถฉ๋Œํ•˜์—ฌ ์˜ˆ์ธก ๊ณผ์ •์—์„œ ๋ถˆ์ผ์น˜๊ฐ€ ๋ฐœ์ƒํ•  ์ˆ˜ ์žˆ์Œ. (์—ฐ์†์ ์ธ ๊ฒฐ๊ณผ -> ์ด์ง„์ ์ธ mask๋กœ์˜ ๋ณ€ํ™˜ ๊ณผ์ •์—์„œ์˜ ๋ถˆ์ผ์น˜)

    (2) : ํ™•์‚ฐ ๋ชจ๋ธ์€ ์ถ”๋ก  ์‹œ๊ฐ„์ด ์˜ค๋ž˜ ๊ฑธ๋ฆผ. ํ™•์‚ฐ ๋ชจ๋ธ์˜ ๋ฐ˜๋ณต์ ์ธ ํŠน์„ฑ์œผ๋กœ ์ธํ•ด ์ œ๋Œ€๋กœ๋œ ๊ฒฐ๊ณผ์—๋Š” ์ผ๋ฐ˜์ ์œผ๋กœ 100 step ์ด์ƒ ์†Œ์š”๋˜๋ฉฐ, ์ด๋ฏธ ๋ฐ์ดํ„ฐ๊ฐ€ ๋ฐฉ๋Œ€ํ•ด์„œ ๋А๋ฆฐ HR ์˜์ƒ์˜ ์ถ”๋ก  ์†๋„๋ฅผ ๋”์šฑ ์•…ํ™”์‹œํ‚ด.

    (3) : ํ™•์‚ฐ๋ชจ๋ธ์˜ ํ™•๋ฅ ์  ์†์„ฑ๊ณผ ์ด๋ฏธ์ง€ ์˜ˆ์ธก task์˜ ๊ฒฐ์ •๋ก ์  ๊ฒฐ๊ณผ ์‚ฌ์ด์˜ ์ถฉ๋Œ. (๊ฐ™์€ ์ž…๋ ฅ์— ๋Œ€ํ•ด ํ•ญ์ƒ ๊ฒฐ๊ณผ๊ฐ€ ๋™์ผํ•ด์•ผ ํ•จ)

     

    ์ €์ž๋“ค์€ ์•ž์„œ ์–ธ๊ธ‰ํ•œ ๋ฌธ์ œ์ ๊ณผ ์ž‘์—…๋ณ„ ๋ณต์žก์„ฑ์„ ๋ชจ๋‘ ํ•ด๊ฒฐํ•˜๋Š” DiffDIS๋ฅผ ์ œ์•ˆํ•œ๋‹ค. DiffDIS๋Š” ๋‹ค์Œ ์ „๋žต๋“ค์„ ํ†ตํ•ด ์ฒ˜๋ฆฌ ์†๋„ ํ–ฅ์ƒ, ์„ธ๋ถ€ ์ •๋ณด ์ธ์‹ ๊ฐ•ํ™”, ๊ฒฐ์ •์„ฑ ์ฆ๋Œ€ (higher determinisim)์— ์ดˆ์ ์„ ๋งž์ถ˜๋‹ค.

     

    1. VAE๋ฅผ latent space <-> binary mask์˜ ๋ณ€ํ™˜๊ธฐ๋กœ ์‚ฌ์šฉ. (feature space ์•ˆ๋งž๋Š” ๋ฌธ์ œ ํ•ด๊ฒฐ)

    2. Stable diffusion ์ฒ˜๋Ÿผ pixel space๊ฐ€ ์•„๋‹Œ latent space์—์„œ diffusion ์ˆ˜ํ–‰. (์—ฐ์‚ฐ๋Ÿ‰ ๋ฌธ์ œ ํ•ด๊ฒฐ)

    3. pretrained SD-Turbo๋ฅผ ์ด์šฉํ•œ one-step denoising. (๊ธด ์ถ”๋ก ์‹œ๊ฐ„ & ์ถœ๋ ฅ ๋ณ€๋™์„ฑ ๋ฌธ์ œ ํ•ด๊ฒฐ)

    4. Mask์™€ edge๋ฅผ ๋™์‹œ์— ์˜ˆ์ธกํ•˜๋Š” ์ „๋žต. (edge constraint์ด ์ถœ๋ ฅ๋ฒ”์œ„๋ฅผ ์ œํ•œ -> ์–‡๊ณ  ๋ณต์žกํ•œ ๊ฒฝ๊ณ„ ๊ฒ€์ถœ์— ํšจ๊ณผ์ )

    5. RGB latent representation์„ ํ™•์‚ฐ ๋ชจ๋ธ์˜ condition์œผ๋กœ ์‚ฌ์šฉ. (RGB ์ด๋ฏธ์ง€์—์„œ seg๋ฅผ ๋งŒ๋“œ๋Š”๊ฑฐ๋‹ˆ๊นŒ... ์–ด์ฉŒ๋ฉด ๋‹น์—ฐํ•œ ์ผ.)

    6. Scale-wise Conditional Injection ์ œ์•ˆ. (RGB condition์„ network ์—ฌ๋Ÿฌ ์ง€์ ์— ํ•ด์ƒ๋„๋ฅผ ๊ณ ๋ คํ•˜์—ฌ ์ฃผ์ž…. -> ํ•ด์ƒ๋„์— ๋”ฐ๋ผ local detail + global structure ๋‘˜ ๋‹ค ํ™œ์šฉ๋จ)

     

    ์‰ฝ๊ฒŒ ์ •๋ฆฌํ•˜๋ฉด, ๊ณ ํ•ด์ƒ๋„ RGB ์ด๋ฏธ์ง€์™€ ์ •๋‹ต binary mask๋ฅผ VAE latent ๊ณต๊ฐ„์œผ๋กœ ์••์ถ•ํ•˜๊ณ , SD-Turbo ๊ธฐ๋ฐ˜ diffusion network๊ฐ€ RGB ์กฐ๊ฑด์„ ์ด์šฉํ•ด mask latent๋ฅผ ํ•œ ๋ฒˆ์— ์˜ˆ์ธกํ•˜๋„๋ก ํ•œ๋‹ค. ์ด๋•Œ mask๋ฟ ์•„๋‹ˆ๋ผ edge๋„ ํ•จ๊ป˜ ์˜ˆ์ธกํ•˜๊ณ , ์—ฌ๋Ÿฌ ํ•ด์ƒ๋„์—์„œ RGB ์กฐ๊ฑด์„ ์ฃผ์ž…ํ•˜์—ฌ ์ „์ฒด ํ˜•ํƒœ์™€ ๋ฏธ์„ธ ๊ฒฝ๊ณ„๋ฅผ ๋™์‹œ์— ๋ณด์กดํ•œ๋‹ค.

     

    ์ €์ž๋“ค์˜ Contribution์€ ๋‹ค์Œ๊ณผ ๊ฐ™๋‹ค.

    (1) : ํ™•์‚ฐ ๋ชจ๋ธ์˜ ๊ฐ•๋ ฅํ•œ ์‚ฌ์ „ ์ง€์‹์„ ํ™œ์šฉํ•˜์—ฌ DIS ์ž‘์—…์„ ์ˆ˜ํ–‰ํ•˜๋Š” DiffDIS ์ œ์•ˆ. ์ด ๋ชจ๋ธ์€ ์ˆ˜์šฉ ์˜์—ญ ํ™•์žฅ - ์„ธ๋ถ€ ์ •๋ณด ๋ณด์กด ์‚ฌ์ด์˜ ๊ท ํ˜• ๋ฌธ์ œ๋ฅผ ํ•ด๊ฒฐํ•จ.

    (2) : ํ™•์‚ฐ ๋ชจ๋ธ์˜ ๋ฐ˜๋ณต์ ์ธ ํŠน์„ฑ์„ ๊ฐ„๋‹จํ•œ one-step denoising์„ ๊ตฌํ˜„ํ•˜์—ฌ end-to-end framework๋กœ ๋ณ€ํ™˜ํ•จ์œผ๋กœ์จ ์ถ”๋ก  ์†๋„๋ฅผ ํฌ๊ฒŒ ํ–ฅ์ƒ์‹œํ‚ด.

    (3) : ๋ณด์กฐ edge generation task ๋„์ž…. ์ด๋Š” ์ƒ์„ฑ๋œ ๋งˆ์Šคํฌ์˜ ๊ฒฐ์ •์„ฑ์„ ๊ฐ•ํ™”ํ•˜๋ฉด์„œ ์„ธ๋ถ€ ํ‘œํ˜„์˜ ๋ฏธ๋ฌ˜ํ•œ ๊ท ํ˜•์„ ๋‹ฌ์„ฑํ•จ.

    (4) : DIS ๋ฒค์น˜๋งˆํฌ ๋ฐ์ดํ„ฐ์…‹์—์„œ ๊ฑฐ์˜ ๋ชจ๋“  ์ง€ํ‘œ๋ฅผ ๋Šฅ๊ฐ€ํ•˜์—ฌ ์ƒˆ๋กœ์šด SoTA๋ฅผ ํ™•๋ฆฝ.

     

    2. Method

    2.1 Overall architecture

    2.2 Edge-assisted training strategy

    ๊ณ ํ•ด์ƒ๋„ ์ž‘์—…, ํŠนํžˆ ํ™•์‚ฐ ๊ธฐ๋ฐ˜ ๋ชจ๋ธ์˜ ๊ฒฝ์šฐ ์ž ์žฌ๊ณต๊ฐ„์ด ์ž…๋ ฅ ํฌ๊ธฐ๋ณด๋‹ค ์ž‘๊ฒŒ ์ถ•์†Œ๋˜๊ธฐ ๋•Œ๋ฌธ์— ๋””ํ…Œ์ผํ•œ ํŠน์ง•์„ ์ •ํ™•ํžˆ ํ‘œํ˜„ํ•˜๋Š”๊ฒƒ์€ ์–ด๋ ต๋‹ค. ๋ช‡๋ช‡ ์—ฐ๊ตฌ๋“ค์€ ์ถ”๊ฐ€์ ์ธ edge constraints์„ ๋„์ž…ํ•˜์—ฌ mask์˜ boundary segmentation ๋Šฅ๋ ฅ์„ ํ–ฅ์ƒ์‹œ์ผฐ๋‹ค. ์ €์ž๋“ค์€ mask์™€ edge ๋‘˜ ๋‹ค๋ฅผ ์œ„ํ•œ noise๋ฅผ ์˜ˆ์ธกํ•˜๊ฒŒ ํ•จ์œผ๋กœ์จ, ๋ณด์กฐ์ ์ธ edge ์ •๋ณด๋กœ network์— ์ œ์•ฝ์„ ์ค€๋‹ค. ์ด ๋‘ ๊ฐœ์˜ ์˜ˆ์ธก ์ŠคํŠธ๋ฆผ์€ ๋™์ผํ•œ ๋„คํŠธ์›Œํฌ ๊ตฌ์กฐ ๋‚ด์—์„œ ์ž‘๋™ํ•˜๋ฉฐ ํŒŒ๋ผ๋ฏธํ„ฐ๋ฅผ ๊ณต์œ ํ•˜๊ณ , ์ด๋“ค์„ ํšจ๊ณผ์ ์œผ๋กœ ๊ตฌ๋ถ„ํ•˜๊ธฐ ์œ„ํ•ด batch discriminative embedding (BDE) ์ด ์ ์šฉ๋œ๋‹ค. U-net ์•„ํ‚คํ…์ณ, ํŠนํžˆ semantic information์ด ๊ฐ€์žฅ ์ง‘์ค‘๋œ mid-block์—์„œ, ์ €์ž๋“ค์€ ๊ธฐ์กด์˜ attention ๋ชจ๋“ˆ์„ Detail-Balancing Interactive Attention์œผ๋กœ ์—…๊ทธ๋ ˆ์ด๋“œํ•˜์—ฌ ์ž‘์—…๋ณ„ ์„ฑ๋Šฅ ํ–ฅ์ƒ์„ ๊ตฌํ˜„ํ•˜์˜€๋‹ค. ์ด ๋งค์ปค๋‹ˆ์ฆ˜์€ mask stream๊ณผ edge stream์˜ attention ์˜์—ญ์„ ์ •๋ ฌํ•˜์—ฌ, ๋‘ ์ŠคํŠธ๋ฆผ ๊ฐ„์˜ ๋ณด๋‹ค ํšจ์œจ์ ์ธ ์ƒํ˜ธ ์ž‘์šฉ๊ณผ ์ƒํ˜ธ ๋ณด์™„์„ฑ์„ ์ด‰์ง„ํ•œ๋‹ค.

     

     

    Batch-Discriminative Embedding (BDE)

    ์ €์ž๋“ค์€ batch ๋‚ด์— ์ถ”๊ฐ€์ ์ธ discriminative labels d_lab์„ ํ†ตํ•ฉํ•˜์—ฌ, single stable diffusion model์ด ์—ฌ๋Ÿฌ ํƒ€์ž…์˜ ์ถœ๋ ฅ์„ ๋™์‹œ์— ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ๊ฒŒํ•˜์˜€๋‹ค. ์ด๋Š” ์ƒํ˜ธ๊ฐ„์„ญ์—†์ด ์›ํ™œํ•œ ๋„๋ฉ”์ธ ์ฒ˜๋ฆฌ๋ฅผ ๋ณด์žฅํ•œ๋‹ค. ๊ตฌ์ฒด์ ์œผ๋กœ, d_lab์€ ๋จผ์ € binary form์œผ๋กœ ํ‘œํ˜„๋œ ๋‹ค์Œ, positional encoding์„ ํ†ตํ•ด ์ธ์ฝ”๋”ฉ ๋œ๋‹ค. ์ดํ›„ learnable projection head๋ฅผ ํ†ต๊ณผํ•˜๊ณ , time embedding๊ณผ element-wise๋กœ ๊ฒฐํ•ฉ๋œ๋‹ค. ๊ฒฐํ•ฉ๋œ embedding์€ ResBlocks์— ์ž…๋ ฅ๋˜์–ด ๋ชจ๋ธ์˜ ๋ฐฐ์น˜๋ณ„ ์ถœ๋ ฅ ์ƒ์„ฑ ๋Šฅ๋ ฅ์„ ํ–ฅ์ƒ์‹œํ‚จ๋‹ค.

    ๋”๋ณด๊ธฐ

    ์ด๋Š” ๊ธฐ์กด์— ์žˆ๋˜ ๊ธฐ๋ฒ•์„ ๊ฐ€์ ธ์™€ ์ ์ ˆํ•˜๊ฒŒ ํ™œ์šฉํ•œ ๋ถ€๋ถ„.

    • Wonder3D: RGB์™€ normal ์ค‘ ๋ฌด์—‡์„ ์ƒ์„ฑํ• ์ง€ ์•Œ๋ ค์ฃผ๋Š” domain switcher
    • GeoWizard: depth์™€ normal ์ค‘ ๋ฌด์—‡์„ ์ƒ์„ฑํ• ์ง€ ์•Œ๋ ค์ฃผ๋Š” geometry switcher
    • DiffDIS: mask์™€ edge ์ค‘ ๋ฌด์—‡์„ ์˜ˆ์ธกํ• ์ง€ ์•Œ๋ ค์ฃผ๋Š” batch-discriminative embedding

     

    ์‰ฝ๊ฒŒ ๋งํ•˜์ž๋ฉด, ํ•˜๋‚˜์˜ ๊ณต์œ  U-Net์ด mask์™€ edge๋ฅผ ๊ฐ๊ฐ ๋ณ„๋„์˜ batch sample๋กœ ๋™์‹œ์— ์ฒ˜๋ฆฌํ•ด์•ผํ•˜๋‹ˆ๊นŒ, ๊ฐ sample์ด mask์ธ์ง€ edge์ธ์ง€ ๊ตฌ๋ถ„ํ•  ์ˆ˜ ์žˆ๋„๋ก label embedding์„ ์ œ๊ณตํ•˜๋Š” ๊ฒƒ. ๊ธฐ์กด์— batch = 2๋ผ๋ฉด Image 2์žฅ์— mask 2์žฅ, edge 2์žฅ์ด ์žˆ๋Š” ํ˜•ํƒœ์ธ๋ฐ mask์ธ์ง€ edge์ธ์ง€ ๋ ˆ์ด๋ธ”์„ ๋‹ฌ์•„์„œ batch = 4๋กœ ๋งŒ๋“œ๋Š” ์…ˆ. (ํ•˜๋‚˜์˜ batch์— mask1, mask2, edge1, edge2)

    ์ค‘๊ฐ„์— Time embedding์ด ๋“ค์–ด๊ฐ€๋Š” ์ด์œ ๋Š”, ์›๋ž˜ diffusion condition์— time์ด ๋“ค์–ด๊ฐ€๊ธฐ ๋•Œ๋ฌธ.

    Learnable projection head๋Š” ๋ณดํ†ต ์ž‘์€ ์‹ ๊ฒฝ๋ง์ธ๋ฐ, label encoding์„ U-Net์ด ์‚ฌ์šฉํ•  ์ˆ˜ ์žˆ๋Š” ํฌ๊ธฐ์˜ embedding์œผ๋กœ ๋ณ€ํ™˜ํ•˜๋Š” ์—ญํ• ์„ ํ•จ. (์—ฌ๊ธฐ์„œ๋Š” ์•„๋งˆ time-embedding๊ณผ ๊ฐ™์€ ์ฐจ์›์œผ๋กœ ๋ณ€ํ™˜๋  ๊ฒƒ)

     

    Detail-Balancing Interactive Attention (DBIA)

    Mask์™€ edge์˜ ์—ฐ์†์„ฑ๊ณผ ์ •๋ ฌ์„ ๋ณด์žฅํ•˜๊ณ , ์ด๋“ค์˜ ์˜๋ฏธ์  ๋‹จ์„œ์™€ attention์ด ์ง‘์ค‘๋˜๋Š” ์˜์—ญ์„ ์กฐํ™”์‹œํ‚ค๊ธฐ ์œ„ํ•ด, ์ €์ž๋“ค์€ DBIA๋ฅผ ๋„์ž…ํ•˜์˜€๋‹ค. DBIA๋Š” ๋‘ ๋„๋ฉ”์ธ ์‚ฌ์ด์—์„œ ๋‹จ์ˆœํ•˜์ง€๋งŒ ํšจ๊ณผ์ ์ธ ์ •๋ณด ๊ตํ™˜์„ ์ด‰์ง„ํ•˜๋„๋ก ์„ค๊ณ„๋˜์—ˆ์œผ๋ฉฐ, ๊ถ๊ทน์ ์œผ๋กœ edge์˜ ์„ธ๋ถ€ ์ •๋ณด์™€ ์˜๋ฏธ์  ๋‚ด์šฉ ์ธก๋ฉด์—์„œ ๋ชจ๋‘ ์ž˜ ์ •๋ ฌ๋œ ์ถœ๋ ฅ์„ ์ƒ์„ฑํ•˜๋Š” ๊ฒƒ์„ ๋ชฉํ‘œ๋กœ ํ•œ๋‹ค. ์‰ฝ๊ฒŒ๋งํ•˜๋ฉด, DiffDIS๋Š” ํ•˜๋‚˜์˜ U-Net์œผ๋กœ ๋‘ ์ถœ๋ ฅ (edge, mask)์„ ๋™์‹œ์— ์˜ˆ์ธกํ•˜๋Š”๋ฐ, ๋‘˜์€ ์„œ๋กœ ๊ด€๋ จ๋˜์ง€๋งŒ ๊ฐ•์กฐํ•˜๋Š” ์ •๋ณด๊ฐ€ ๋‹ค๋ฅด๋‹ค. (mask - ๊ฐ์ฒด ์ „์ฒด๋Š” ์ฐพ์ง€๋งŒ ๊ฒฝ๊ณ„๊ฐ€ ๋ญ‰๊ฐœ์ง / edge -  ์„ธ๋ฐ€ํ•œ ์„ ์€ ์ฐพ์ง€๋งŒ ์–ด๋–ค ์„ ์ด ์‹ค์ œ ๊ฐ์ฒด ๊ฒฝ๊ณ„์ธ์ง€ ์˜๋ฏธ์ ์œผ๋กœ ๋ชจํ˜ธํ•จ) ๊ทธ๋ž˜์„œ ๋‘ ์ •๋ณด๊ฐ€ ์ƒํ˜ธ ๋ณด์™„ํ•˜์—ฌ ์„œ๋กœ ์ข‹์•„์ง€๊ฒŒ ํ•˜๊ณ ์ž ํ•จ.

     

    ๊ธฐ์กด์˜ SD์—๋Š” self-attention, cross-attention์ด ์กด์žฌํ•˜๋Š”๋ฐ, ์ €์ž๋“ค์€ ์—ฌ๊ธฐ์— mutual cross-domain attention์„ ์ถ”๊ฐ€ํ•œ๋‹ค. 

    (mask๋Š” edge์—์„œ, edge๋Š” mask์—์„œ ๊ฐ๊ฐ ์ฐธ์กฐํ•˜๊ณ  ์žˆ์Œ) ์ด ๋ฐฉ๋ฒ•์€ ๋‘ ์˜์—ญ๊ฐ„์˜ ์ง์ ‘์ ์ด๊ณ  ํšจ์œจ์ ์ธ ์ •๋ณด ๊ตํ™˜์„ ๋ณด์žฅํ•˜์—ฌ, ์ „๋ฐ˜์ ์ธ ํŠน์ง• ํ‘œํ˜„์„ ํ–ฅ์ƒ์‹œํ‚ค๋Š” ์ƒํ˜ธ์ž‘์šฉ์„ ์ด‰์ง„ํ•œ๋‹ค.

     

    2.3 Scale-wise conditional injection

    Dense prediction task๋ฅผ ์œ„ํ•œ ๊ธฐ์กด ํ™•์‚ฐ ๋ชจ๋ธ์—์„œ๋Š” ์ผ๋ฐ˜์ ์œผ๋กœ input ๋‹จ๊ณ„์—์„œ condition์„ ์ค€๋‹ค. ์ด๋Ÿฌํ•œ ๋ฐฉ์‹์€ ํ›„์† ๋‹จ๊ณ„์—์„œ ์ •๋ณด ์†์‹ค์„ ์ดˆ๋ž˜ํ•  ์ˆ˜ ์žˆ๋‹ค. ์žฅ๊ธฐ์ ์ด๊ณ  ์‹ฌ์ธต์ ์ธ conditional guidance๋ฅผ ๊ตฌ์ถ•ํ•˜๊ธฐ ์œ„ํ•ด, ์ €์ž๋“ค์€ multi-granular perception (๋‹ค์–‘ํ•œ ์„ธ๋ฐ€๋„ ์ˆ˜์ค€์˜ ์ •๋ณด ์ธ์‹)์„ ํ–ฅ์ƒ์‹œํ‚ค๊ณ  ์‹ฌ์ธต์ ์ธ ์‹œ๊ฐ์  ์ƒํ˜ธ์ž‘์šฉ์„ ์ด‰์ง„ํ•˜๋Š” SWCI ๊ธฐ๋ฒ•์„ ๋„์ž…ํ•œ๋‹ค. ๊ตฌ์ฒด์ ์œผ๋กœ, U-Net encoder์˜ ํ•ด๋‹น layer์— multi-scale condition์„ ํ†ตํ•ฉํ•œ๋‹ค. ๊ทธ๋ฆฌ๊ณ  3๊ฐœ์˜ injector heads๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ์ค‘๊ฐ„์ค‘๊ฐ„์˜ feature ํฌ๊ธฐ ๋ฐ ์ฑ„๋„ ์ˆ˜๋ฅผ ๋งž์ถฐ์ค€๋‹ค.

     

    3๊ฐœ์˜ Injection heads๋Š” 1๊ฐœ์˜ simple convolution laeyr์™€ 2๊ฐœ์˜ zero convolution layers๋กœ ๊ตฌ์„ฑ๋œ๋‹ค. ๊ฐ๊ฐ์˜ ํ—ค๋“œ๋Š” ์ž…๋ ฅ์œผ๋กœ ํ•ด๋‹น ์Šค์ผ€์ผ์— ๋งž๊ฒŒ ํฌ๊ธฐ๊ฐ€ ์กฐ์ •๋œ conditional latent code๋ฅผ ๋ฐ›๋Š”๋‹ค. ์—ฌ๊ธฐ์„œ zero convolution์€ ๋ชจ๋“  weight, bias๊ฐ€ 0์œผ๋กœ ์ดˆ๊ธฐํ™”๋œ ๋ ˆ์ด์–ด๋กœ, ControlNet์—์„œ ์‚ฌ์šฉ๋œ ๋ฐฉ์‹์ด๋‹ค. ์ดˆ๊ธฐ์ƒํƒœ์—์„œ๋Š” ๊ฐ’์ด 0์ด ๋‚˜์˜ค๋ฏ€๋กœ feature๋ฅผ ์ฒ˜์Œ๋ถ€ํ„ฐ ๊ฑด๋“œ๋ฆฌ์ง€ ์•Š์ง€๋งŒ, ํ•™์Šต์ด ์ง„ํ–‰๋˜๋ฉด์„œ weight๊ฐ€ ์—…๋ฐ์ดํŠธ ๋˜์–ด RGB conditioning ๊ฒฝ๋กœ๋ฅผ ์•ˆ์ •์ ์œผ๋กœ ํ•™์Šตํ•˜๊ฒŒ ๋œ๋‹ค.

     

    2.4 One-step mask sampling (Inference)

     

    Inference ๊ณผ์ •์—์„œ, ๋จผ์ € RGB image๋Š” VAE encoder๋ฅผ ํ†ตํ•ด latent space๋กœ ์ธ์ฝ”๋”ฉ๋œ๋‹ค. ๋‹ค์Œ์œผ๋กœ, standard gaussian noise์—์„œ ์‹œ์ž‘ ๋ณ€์ˆ˜๋ฅผ ์ƒ˜ํ”Œ๋งํ•˜์—ฌ, mask์™€ edge์˜ ์ดˆ๊ธฐํ™”๋กœ ์‚ฌ์šฉํ•œ๋‹ค. (์•„๋งˆ ๋ณต์ œํ•ด์„œ ์‚ฌ์šฉํ•˜๋Š”๋“ฏ?) Training ๋‹จ๊ณ„์™€ ์œ ์‚ฌํ•˜๊ฒŒ, ์ด ๋‘ ๊ตฌ์„ฑ์š”์†Œ๋Š” batch๋กœ ์—ฐ๊ฒฐ๋˜๋ฉฐ, batch-discriminative embedding (BDE)๊ฐ€ ์ ์šฉ๋˜์–ด ํšจ๊ณผ์ ์œผ๋กœ ๊ตฌ๋ถ„๋œ๋‹ค. (์‰ฝ๊ฒŒ ๋งํ•ด ๊ทธ๋ƒฅ ๋ ˆ์ด๋ธ”์ด ๋‹ฌ๋ ค์„œ edge์ธ์ง€ mask์ธ์ง€ ๊ตฌ๋ถ„์ด ๋œ๋‹ค.) RGB latent representation์— ๋”ฐ๋ผ ์กฐ๊ฑดํ™”๋œ concatnated components๋“ค์€ ๋…ธ์ด์ฆˆ๋ฅผ ์˜ˆ์ธกํ•˜๊ธฐ ์œ„ํ•ด U-net์— ์ž…๋ ฅ๋œ๋‹ค. ์ดํ›„ ์•Œ๊ณ ๋ฆฌ์ฆ˜ 2์— ๋”ฐ๋ผ ๊ธฐ์กด DDPM ๋ฐฉ์‹์ฒ˜๋Ÿผ ์ƒ˜ํ”Œ๋ง ํ”„๋กœ์„ธ์Šค๊ฐ€ ์ง„ํ–‰๋œ๋‹ค. ๋งˆ์ง€๋ง‰์œผ๋กœ, mask, edge map์€ VAE ๋””์ฝ”๋”๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ latent code์—์„œ ๋””์ฝ”๋”ฉ๋˜๊ณ , channel ํ‰๊ท ํ™”๋ฅผ ํ†ตํ•ด ํ›„์ฒ˜๋ฆฌ๋œ๋‹ค. 

     

    3. Experiments

    3.1. Dataset, Metrics, and Implementation Details

     

    • ๋ฐ์ดํ„ฐ์…‹: DIS5K ์‚ฌ์šฉ
      • ํ•™์Šต: 3,000์žฅ, 225๊ฐœ ์นดํ…Œ๊ณ ๋ฆฌ
      • ๊ฒ€์ฆ: DIS-VD
      • ํ…Œ์ŠคํŠธ: DIS-TE1~4, ๊ฐ 500์žฅ
    • ํ•™์Šต ํ™˜๊ฒฝ: PyTorch, NVIDIA H800 GPU 1์žฅ
    • ์ž…๋ ฅ ํฌ๊ธฐ: ๋ชจ๋“  ์ด๋ฏธ์ง€๋ฅผ 1024×1024๋กœ resize
    • ๋ชจ๋ธ ์ดˆ๊ธฐํ™”: SD V2.1์„ backbone์œผ๋กœ ์‚ฌ์šฉํ•˜๊ณ , SD-Turbo pretrained parameter๋กœ ์ดˆ๊ธฐํ™”
    • ๋ฐ์ดํ„ฐ ์ฆ๊ฐ•: horizontal flip, crop, rotation, CutMix
    • ํ•™์Šต ์„ค์ •: Adam, learning rate 3×10^−5, batch size 4, ์ตœ๋Œ€ 90 epoch
    • ํ‰๊ฐ€ ์‹œ ํ›„์ฒ˜๋ฆฌ: ์˜ˆ์ธก ๋งต์„ ์ด์ง„ํ™”ํ•˜์—ฌ ์ž‘์€ noise๋ฅผ ์ œ๊ฑฐํ•œ ๋’ค ์„ฑ๋Šฅ ๊ณ„์‚ฐ
    • ํ‰๊ฐ€์ง€ํ‘œ

     

    3.2 Comparision

    3.3 Ablation

    ๊ฐ ์ปดํฌ๋„ŒํŠธ์˜ effectiveness

    ์ ์šฉํ• ์ˆ˜๋ก ์ ์ง„์ ์œผ๋กœ ๊ฒฐ๊ณผ๊ฐ€ ์ข‹์•„์ง€๊ณ , ๋‹ค ์ ์šฉํ•˜๋‹ˆ๊นŒ ๊ฒฐ๊ณผ๊ฐ€ ์ข‹๋”๋ผ.

     

     

    Pre-trained parameters์™€ denoising steps์˜ ๋‹ค์–‘์„ฑ

    1, 2, 5ํ–‰์„ ๋ดค์„ ๋•Œ, SD-Turbo ํŒŒ๋ผ๋ฏธํ„ฐ ๊ฐ€์ ธ๋‹ค ์“ฐ๋Š”๊ฒŒ ์ œ์ผ ์ข‹์•˜์Œ.

    2, 3, 4ํ–‰์€ ์„œ๋กœ ๋‹ค๋ฅธ few-step denoising paradigms์„ ๋ณด์—ฌ์คŒ. 4ํ–‰์€ ์ •ํ™•๋„๊ฐ€ ์กฐ๊ธˆ ๋” ๋†’์ง€๋งŒ, ์‹œ๊ฐ„์ด ๋‘๋ฐฐ๋กœ ์ฆ๊ฐ€ํ•จ. ์ฆ‰. step์„ ๋Š˜๋ฆฐ๋‹ค๊ณ  ๋ฐ˜๋“œ์‹œ ์„ฑ๋Šฅ์ด ์ข‹์•„์ง€์ง€๋Š” ์•Š์Œ.

     

     

    DBIA์—์„œ ๋‹ค์–‘ํ•œ ์ƒํ˜ธ์ž‘์šฉ ๋ฐฉ๋ฒ• ๋น„๊ต

    DBIA์˜ ์ถ”๊ฐ€์ ์ธ cross-attention ๋งค์ปค๋‹ˆ์ฆ˜์— ์žˆ๋Š” ์ƒํ˜ธ์ž‘์šฉ ๋ฐฉ๋ฒ•์„ Fu et al๊ณผ ์œ ์‚ฌํ•œ fusion-oriented approach๋กœ ๋Œ€์ฒดํ–ˆ๋Š”๋ฐ, ์ €์ž๋“ค๊ป˜ ๋” ์ข‹๋‹ค๊ณ  ํ•จ.

     


    dichotomous : ์ด๋ถ„๋ฒ•์ ์ธ

    encompass : ํฌํ•จํ•˜๋‹ค. ๋‘˜๋Ÿฌ์‹ธ๋‹ค.

    versatile : ๋‹ค์žฌ๋‹ค๋Šฅํ•œ, ๋‹ค์šฉ๋„์˜, ๋‹ค๋ชฉ์ 

    streamline : ์œ ์„ ํ˜•์œผ๋กœ ํ•˜๋‹ค. ๊ฐ„์†Œํ™” ํ•˜๋‹ค.

    tough to + v : ~ ํ•˜๊ธฐ ์–ด๋ ต๋‹ค.

    seamless : ์›ํ™œํ• , ์•„์ฃผ ๋งค๋„๋Ÿฌ์šด

    '๐Ÿ“ƒPAPER' ์นดํ…Œ๊ณ ๋ฆฌ์˜ ๋‹ค๋ฅธ ๊ธ€

    ๋…ผ๋ฌธ์“ธ๋•Œ ์ƒ๊ฐํ•ด๋ณผ๊ฒƒ๋“ค  (0) 2023.08.01

    ๋Œ“๊ธ€