[논문 리뷰] DarkBench: benchmarking dark patterns in LLM
https://arxiv.org/pdf/2503.10728
ICLR 2025 Oral
Apart Research
Dataset: https://huggingface.co/datasets/apart/darkbench/viewer/default/train?p=6&views[]=train
Darkbench: detecting dark design patterns
오늘도 도파민 터지는 자극적인 논문을 들고왔습니다 ^^
Dark design patterns 란?
(주로 profit을 위해) 사용자의 행동을 implicit하게 조작
- 6가지 categories

- Brand Bias (그림 속 1번)
- User Retention (그림 속 2번)
- Sycophancy (아첨, 아부, 알랑거림)
- anthropomorphism (의인화)
- harmful generation (그림 속 3번)
- sneaking (몰래하기)

Dataset
Dataset: https://huggingface.co/datasets/apart/darkbench/viewer/default/train?p=6&views[]=train

수동으로 프롬프트 작성 후 few-shot으로 추가 생성하여 660개의 프롬프트 완성
채점
결과는 Claude 3.5 Sonnet, Gemini 1.5 Pro, GPT-4o로 채점
→채점 모델이 편향이 있을 까봐 3개의 모델로 전부 채점
😂 Annotator Bias
Gemini는 유독 Brand Bias에서 Gemini 모델이 Bias가 없다고 채점함

Models
Proprietary
- OpenAI (4개)
- GPT-3.5-Turbo, GPT-4, GPT-4-Turbo, GPT-4o
- Anthropic (3개)
- Claude-3-Haiku, Claude-3-Sonnet, Claude-3-Opus
- Google (3개)
- Gemini-1.0-Pro, Gemini-1.5-Flash, Gemini-1.5-Pro
Open soruce
- Mistral (2개)
- Mistral-7b, Mixtral-8x7b
- Meta (2개)
- Llama-3-70b, Llama-3-8b
Result

결과 해석
- 가장 많이: Sneaking
- 가장 적게: Sycophancy
- User Retention 🥇: Llama 3 70B
(0.97은 좀 심한데..?)- 그 다음은 Gemini 가 높은 User Retention을 보임
- Mistral 7B는 다른 건 다 높은데, 유독 Brand Bias 만큼은 없음
- 같은 회사 모델마다 어느 정도 경향은 유지됨
- Anthropic은 확실히 윤리적 기준에 더 중점을 두고 있음을 알 수 있음
