이미지 편집 대화에서 '다음엔 뭘 편집할까요?'를 사용자 클릭과 실제 이미지에 맞춰 추천하는 3단계 학습법
arXiv:2608.075652026-08-02
What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems
이미지 편집 대화에서 '다음엔 뭘 편집할까요?'를 사용자 클릭과 실제 이미지에 맞춰 추천하는 3단계 학습법
이미지를 만들고 고치는 대화형 AI에서, 다음 편집을 추천할 때 현재 이미지에 실제로 없는 대상을 요구하거나 이미 이뤄진 상태를 다시 요청하는 문제가 있었다. 저자는 사람이 검토한 편집 의도표로 먼저 모델을 학습시키고, 실제 사용자 클릭으로 보상모델을 만들어 강화학습으로 다듬은 뒤, 이미지를 먼저 살피는 검증기를 추가해 이런 시각적 불일치를 줄이는 3단계 프레임워크를 제시한다. Qwen App에 실제로 배포해 수백만 명 규모의 A/B 테스트로 효과를 확인했다.
METAL LAB 해설 도표
3단계 학습 파이프라인 구조
증거 상태측정 결과가 보고됨
1단계: 규칙 기반 SFT실제 이미지·질문·의도와 사람이 검토한 61개 편집 의도표를 결합해 6개 제안 세트를 만들고 멀티모달 정책을 미세조정
2단계: 클릭 기반 강화학습실제 사용자 클릭으로 만든 보상모델과 형식·유사도·길이·다양성 4가지 신호를 합쳐 GRPO로 정책 최적화, 그러나 시각적 불일치는 3.0%→3.7%로 증가
3단계: 시각 검증기 추가이미지를 먼저 관찰한 뒤 각 제안의 필요 대상과 목표 상태를 검사하는 검증기를 여섯 번째 보상으로 추가해 불일치를 0.9%까지 감소
배포 및 A/B 테스트학습에만 검증기를 쓰고 서비스에는 단일 8B 정책만 배포, 14일간 수백만 사용자 대상 테스트로 CTR·저장률·대화 턴 수 개선 확인
METAL LAB이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
Qwen App의 실제 다중 턴 이미지 편집 대화 10만 건을 분석해 80.1%가 이전 대화 텍스트만으로는 알 수 없고 현재 이미지를 봐야 하는 '이미지 의존적' 요청임을 확인했다.
1단계(SFT)는 사람이 검토한 61개 편집 의도표를 바탕으로 실제 이미지·질문·의도에 맞는 6개짜리 추천 후보 세트를 만들어 멀티모달 정책 모델을 미세조정한다.
2단계는 실제 사용자 클릭 데이터로 노출 순서 편향을 줄인 클릭 선호 쌍을 만들어 보상모델을 학습하고, 클릭 선호·형식 유효성·SFT와의 유사도·길이·다양성 등 5가지 보상을 GRPO로 함께 최적화한다.
2단계만 적용하면 전문가 평가 품질은 좋아지지만 시각적 불일치(없는 대상을 요구하거나 이미 만족된 상태를 또 요청)가 SFT 대비 3.0%에서 3.7%로 늘어나는 부작용이 나타났다.
3단계는 이미지를 먼저 관찰한 뒤 각 제안을 필요한 대상과 목표 상태로 나눠 검증하는 별도 시각 검증기를 여섯 번째 보상으로 추가해 이 문제를 해결한다.
Figure 1: Illustrative multi-turn policy comparison. A click-supervised policy without visual-consistency supervision (left) proposes a slate containing a missing-source edit and an already-satisfied target; the user selects the executable lighting edit. On the updated image, the full framework (right) produces executable, image-consistent, and non-redundant follow-up edits.
Figure 2: Three-stage training framework. Stage 1 constructs validated SFT slates from real contexts. Stage 2 trains a click reward model and optimizes five non-grounding rewards with GRPO. Stage 3 derives an image-first source–target grounding reward and supplies it as a sixth signal to a separate GRPO run, initialized from SFT and otherwise using the Stage 2 pipeline.
Table 2: Cumulative ablation of RL components. All rows start from the SFT policy.
RL configuration
GSB vs base ↑
Ground. ↓
Redund. ↓
SFT initialization
+332
3.0
17.2
+ core RL rewards
+374
4.4
28.1
+ max-pair diversity
+383
4.0
19.1
+ norm./dynamic weights
+405
3.7
11.9
+ grounding reward
+𝟒𝟒𝟔
0.9
8.8
Figure 3: SFT data-construction pipeline (general track). Pale blocks are the data surviving each stage; grey ribbons show removed records and their filtering reasons.
Table 4: Verifier evaluation on the visual-consistency calibration set.
Visual inconsistency recall ↑
False
Verifier
Missing src.
Already sat.
Union
rejection ↓
Single-pass VLM
61.6%
43.4%
47.5%
22.2%
Source–target
92.9%
74.5%
78.7%
0.6%
Table 5: Stage-wise visual inconsistency by error type. Union denotes the rate of suggestions with either error.
Policy
Missing source ↓
Already-satisfied target ↓
Visual inconsistency (union) ↓
SFT (Stage 1)
0.74%
2.26%
3.0%
SFT + RL (Stage 2)
0.70%
3.00%
3.7%
Full framework (Stage 3)
0.42%
0.48%
0.9%
Table 6: Preference-data funnel. Counts in the first three rows are impression-level unless marked as suggestion-level.
Stage
Filtering operation
Output
Source
Three displayed suggestions and a non-empty click
663,926 requests
Record filtering
Remove click not in display (1,861), invalid intent (45,022), invalid clicked type/sub-tag (120,344), fewer than two usable continuation suggestions (15,344), and repeated sessions (249,062)
232,293 impressions
Image transfer
Retain records with a successfully transferred image
232,281 impressions
Pair eligibility
Remove unusable query (944), query-copy click (66), missing final intent (30), and no usable suggestion above the click (102,491)
128,750 impressions
Suggestion pruning
Drop generic refresh-like (39,829), non-continuation (45,420), and below-click options (204,173); these are suggestion-level counts
173,071 pairs
Request split
Group by request ID
164,401 train / 8,670 validation pairs
Table 7: Per-candidate dimensions emitted by one verifier call.
Dimension
Judged from
Used for
missing source
source existence bits with evidence
RL grounding g^
already satisfied
target vs. current state
RL grounding g^
plausibility
fit to image and scene
monitoring only
effective change
non-trivial visible change
monitoring only
content density
global appearance vs. object/region edit
length budget class
evidence, states
pointing phrases
audits and error analysis
Table 8: Source and target semantics by edit type.
Operation
Required source
Target check
Add
anchor/context entity
requested addition not satisfied
Remove
object to remove
object not already absent
Modify
object and current state
new state not already satisfied
Relocate
object and reference region
requested relation not satisfied
Global style
image
style change checkable or uncertain
Table 9: Diversity signal and aggregation on the semantic-redundancy probe.
Variant
Adapt. λ
Redund. ↓
Near-dup ↓
SFT
×
14.8%
1.4%
Jaccard
×
28.0%
2.2%
Embed., mean
×
30.0%
2.2%
Embed., max-pair
×
20.8%
0.8%
Embed., max-pair
✓
9.6%
0.4%
Table 10: RM-only genericization stress test. Cross-image reuse and within-list redundancy are measured at the final checkpoint.
Steps
Δ click-RM
Reuse ↓
Redund. ↓
30
+0.31
–
–
80
+1.25
–
–
160
+2.46
99.9%
0.1%
실제로 확인된 결과
오프라인 평가에서 3단계 전체 프레임워크는 2단계 대비 시각적 불일치를 3.7%에서 0.9%로 줄이면서도 전문가 평가 품질은 유지했다.
Qwen App에서 수백만 사용자를 대상으로 한 14일 사용자 무작위 A/B 테스트에서, 기존 프롬프트 엔지니어링 정책(PE) 대비 추천 클릭률(CTR)이 32.70%, 이미지 저장률이 16.32%, 사용자당 평균 대화 턴 수가 39.90% 각각 통계적으로 유의하게(p<0.05) 증가했다.
클릭 보상모델만으로 학습시키면 정책이 이미지와 무관한 일반적인 편집 제안 하나를 거의 모든 이미지에 반복 사용하는 방식으로 무너지며(160단계에서 이미지 간 재사용률 99.9%), 이는 PPL 보상·다양성 보상·재사용 감사 없이는 클릭 선호만으로는 부족함을 보여준다.
완전한 보상 체계를 적용한 최종 정책은 이런 붕괴 없이 이미지 간 재사용률이 54.3%로 SFT의 57.3%와 비슷한 수준을 유지했다.
길이 보상이 없으면 클릭 보상모델이 불필요한 수식어로 늘어난 긴 문장을 선호해 평균 제안 길이가 11.9자에서 17.0자로 늘어나는 편향이 확인됐다.
어디에 쓸 수 있나
이미지 생성·편집 챗봇에서 다음 편집 제안 슬레이트를 추천하는 기능 설계
실제 클릭 로그를 활용해 추천 보상모델을 만들 때 노출 위치 편향을 줄이는 쌍 구성 방법
생성형 AI 출력의 시각적 사실 근거를 검증하는 별도 검증기를 강화학습 보상으로 활용하는 구조
다중 목표(선호도·다양성·길이·형식)를 하나의 강화학습 파이프라인에서 균형 있게 최적화하는 설계 참고
한계와 남은 검증
이 연구는 Qwen App이라는 특정 서비스와 8B/30B 규모의 Qwen3-VL 모델 계열에 한정된 실험으로, 다른 서비스나 이미지 편집 도구에도 그대로 적용될지는 검증되지 않았다.
검증기는 학습 단계에서만 사용되고 실제 서비스에는 반영되지 않아, 배포된 정책 자체의 시각적 오류가 완전히 사라졌다고 보장할 수는 없다.
검증기가 판단하기 어려운 주관적 목표 상태는 오류로 판정하지 않고 통과시키는 '열어두는' 방식이라 일부 미세한 시각적 오류는 놓칠 수 있다.
온라인 A/B 테스트는 14일, 특정 트래픽(5%) 배분에서 수행된 결과로, 장기적 효과나 다른 트래픽 조건에서의 결과는 다루지 않았다.
위치 인식 클릭 쌍 구성은 노출 편향을 줄이지만 완전히 제거하지는 못한다고 저자 스스로 밝히고 있다.
왜 중요한가
이미지 생성·편집 대화형 서비스가 늘면서 다음 행동 추천이 사용자 유지에 중요해졌지만, 기존 추천 연구는 텍스트 대화 중심이라 이미지 맥락을 반영하는 방법이 부족했다. 이 연구는 실제 클릭 데이터와 이미지 정합성 검증을 함께 활용해 대규모 서비스에서 실질적 지표 개선을 확인한 드문 사례다.
이 논문의 용어
SFT (지도 미세조정) · 정답 예시를 모아 모델을 추가 학습시키는 기본 단계
GRPO · 여러 후보를 상대 비교해 보상이 높은 방향으로 정책을 조정하는 강화학습 기법
보상모델(RM) · 사용자 클릭 같은 신호를 학습해 어떤 제안이 더 선호되는지 점수로 예측하는 모델
시각적 불일치 · 제안된 편집이 현재 이미지에 없는 대상을 요구하거나 이미 이루어진 상태를 다시 요청하는 오류
GSB(Good-Same-Bad) · 기준 정책과 비교해 전문가 평가 점수가 얼마나 더 좋았는지를 나타내는 차이값
본문에 싣지 못한 그림
Figure 4: Source–target visual consistency checks. A suggestion is invalid when it presupposes an absent source or requests a visually checkable target state that already holds.