2025년 7월 9일 — 📝 Paper

[논문 리뷰] DarkBench: benchmarking dark patterns in LLM

https://arxiv.org/pdf/2503.10728

ICLR 2025 Oral

Apart Research


https://darkbench.ai/

Dataset: https://huggingface.co/datasets/apart/darkbench/viewer/default/train?p=6&views[]=train


Darkbench: detecting dark design patterns

오늘도 도파민 터지는 자극적인 논문을 들고왔습니다 ^^


Dark design patterns 란?

(주로 profit을 위해) 사용자의 행동을 implicit하게 조작


Dataset

Dataset: https://huggingface.co/datasets/apart/darkbench/viewer/default/train?p=6&views[]=train

수동으로 프롬프트 작성 후 few-shot으로 추가 생성하여 660개의 프롬프트 완성


채점

결과는 Claude 3.5 Sonnet, Gemini 1.5 Pro, GPT-4o로 채점

→채점 모델이 편향이 있을 까봐 3개의 모델로 전부 채점

😂 Annotator Bias

Gemini는 유독 Brand Bias에서 Gemini 모델이 Bias가 없다고 채점함

출처: meme generator


Models

Proprietary

Open soruce


Result


결과 해석

출처: meme generator