Claude Code로 오픈소스 만들며 느낀점→
Open Source Contributor Github
Feb 2026
[논문 리뷰] Defending Against Prompt Injection with a Few DefensiveTokens→
📝 Paper PaperSafety / Alignment
Aug 2025
[논문 리뷰] PoisonBench: Assessing LM Vulnerability to Poisoned Preference Data→
📝 Paper PaperSafety / AlignmentBenchmark
Jul 2025
[논문 리뷰] Cheating Automatic LLM Benchmarks: NULL Models Achieve High Win Rates→
📝 Paper PaperSafety / AlignmentBenchmark
Jul 2025
[논문 리뷰] DarkBench: benchmarking dark patterns in LLM→
📝 Paper PaperSafety / AlignmentBenchmark
Jul 2025
헤비 컨트리뷰터 도전기 1. 컨트리뷰터가 되다→
Open Source Contributor Open SourceNeMo
Jul 2025
[논문 리뷰] Backtracking Improves Generation Safety→
📝 Paper Safety / AlignmentPaper
Jun 2025
[논문 리뷰] Safety Alignment Should be made more than just a few tokens deep→
📝 Paper Safety / AlignmentPaper
May 2025
[논문 리뷰] Alignment Faking in LLM→
📝 Paper AnthropicSafety / Alignment
May 2025
[논문 리뷰] Scaling Monosemanticity #1→
📝 Paper AnthropicSafety / Alignment
Apr 2025
수능 국어 1등급에 도달한 인공지능→
📕 Prompt Engineering Open Source
Aug 2023