Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Hiding and Recovering Knowledge in Text-to-Image Diffusion Models via Learnable Prompts Anh Bui, Dinh Phung, Khanh Doan, Paul Montague Published: 2024-03-18Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2024-03-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 6 |
| RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content Bo Li, Dawn Song, Ning Yu, Ruoxi Jia Published: 2024-03-19Area: Adversarial RobustnessCitations: 67 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 67 |
| Securing Large Language Models: Threats, Vulnerabilities and Responsible Practices CJ Barberan, Jia He, Richard Anarfi, Sara Abdali Published: 2024-03-19Area: Surveys & ReviewsCitations: 49 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-03-19 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R4 (98%) | 49 |
| BadEdit: Backdooring Large Language Models by Model Editing Jian Zhang, Kangjie Chen, Shangqing Liu, Tianlin Li Published: 2024-03-20Area: Adversarial RobustnessCitations: 104 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 104 |
| Evaluating Frontier Models for Dangerous Capabilities Albert Webson, Alexandre Kaskasoli, Allan Dafoe, Anca Dragan Published: 2024-03-20Area: Safety EvaluationCitations: 107 Tags: ai-safety, benchmark, safety-evaluation | 2024-03-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 107 |
| FMM-Attack: A Flow-based Multi-modal Adversarial Attack on Video-based LLMs Jingyun Zhang, Jinmin Li, Kuofeng Gao, Shu-tao Xia Published: 2024-03-20Area: Multimodal SafetyCitations: 12 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-03-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (94%) | 12 |
| RewardBench: Evaluating Reward Models for Language Modeling Bill Yuchen Lin, Hannaneh Hajishirzi, Jacob Morrison, Khyathi Chandu Published: 2024-03-20Area: Safety EvaluationCitations: 366 Tags: ai-safety, benchmark, safety-evaluation | 2024-03-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 366 |
| Testing the Limits of Jailbreaking Defenses with the Purple Problem Aditi Raghunathan, Suhas Kotha, Taeyoun Kim Published: 2024-03-20Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 8 |
| Detoxifying Large Language Models via Knowledge Editing Huajun Chen, Jindong Wang, Linyi Yang, Mengru Wang Published: 2024-03-21Area: Model EditingCitations: 93 Tags: ai-safety, empirical, model-editing | 2024-03-21 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 93 |
| On the Conversational Persuasiveness of Large Language Models: A Randomized Controlled Trial Francesco Salvi, Manoel Horta Ribeiro, Riccardo Gallotti, Robert West Published: 2024-03-21Area: Safety EvaluationCitations: 95 Tags: ai-safety, empirical, safety-evaluation | 2024-03-21 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 95 |
| Have Faith in Faithfulness: Going Beyond Circuit Overlap When Finding Model Mechanisms Michael Hanna, Sandro Pezzelle, Yonatan Belinkov Published: 2024-03-26Area: Mechanistic Interp.Citations: 90 Tags: ai-safety, empirical, mechanistic-interp | 2024-03-26 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 90 |
| Optimization-based Prompt Injection Attack to LLM-as-a-Judge Jiawen Shi, Lichao Sun, Neil Zhenqiang Gong, Pan Zhou Published: 2024-03-26Area: Adversarial RobustnessCitations: 132 Tags: adversarial-robustness, ai-safety, empirical | 2024-03-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 132 |
| Mechanisms of Non-Factual Hallucination in Language Models Jackie Chi Kit Cheung, Lei Yu, Meng Cao, Yue Dong Published: 2024-03-27Area: Mechanistic Interp.Citations: 38 Tags: ai-safety, empirical, mechanistic-interp | 2024-03-27 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (95%) | 38 |
| NL-ITI: Optimizing Probing and Intervention for Improvement of ITI Method Adam Cieslak, Adam Wiacek, Artur Janicki, Jakub Hoscilowicz Published: 2024-03-27Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-03-27 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (98%) | 5 |
| Rejection Improves Reliability: Training LLMs to Refuse Unknown Questions Using RL from Knowledge Feedback Da Ma, Hongshen Xu, Kai Yu, Lu Chen Published: 2024-03-27Area: Alignment TrainingCitations: 63 Tags: ai-safety, alignment-training, empirical | 2024-03-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 63 |
| Understanding the Learning Dynamics of Alignment with Human Feedback Shawn Im, Yixuan Li Published: 2024-03-27Area: Alignment TrainingCitations: 18 Tags: ai-safety, alignment-training, theoretical | 2024-03-27 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (95%) | 18 |
| JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Alexander Robey, Edgar Dobriban, Edoardo Debenedetti, Eric Wong Published: 2024-03-28Area: Adversarial RobustnessCitations: 330 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-03-28 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 330 |
| Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models Aaron Mueller, Can Rager, David Bau, Eric J. Michaud Published: 2024-03-28Area: Mechanistic Interp.Citations: 270 Tags: ai-safety, empirical, mechanistic-interp | 2024-03-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 270 |
| Developing Safe and Responsible Large Language Models - A Comprehensive Framework Deepak John Reji, Fatemeh Tavakoli, Oluwanifemi Bamgbose, Shaina Raza Published: 2024-04-01Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2024-04-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 5 |
| Privacy Backdoors: Enhancing Membership Inference through Poisoning Pre-trained Models Jonas Geiping, Leo Marchyok, Nicholas Carlini, Sanghyun Hong Published: 2024-04-01Area: Adversarial RobustnessCitations: 29 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 29 |
| Regularized Best-of-N Sampling to Mitigate Reward Hacking for Language Model Alignment Kaito Ariu, Kenshi Abe, Tetsuro Morimura, Yuu Jinnai Published: 2024-04-01Area: Deception & FailureCitations: 11 Tags: ai-safety, alignment-training, deception-failure, empirical | 2024-04-01 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R3 (97%) | 11 |
| What's in Your "Safe" Data? Identifying Benign Data that Breaks Safety Luxi He, Mengzhou Xia, Peter Henderson Published: 2024-04-01Area: Adversarial RobustnessCitations: 95 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-04-01 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 95 |
| Digital Forgetting in Large Language Models: A Survey of Unlearning Methods Alberto Blanco-Justicia, Benet Manzanares, David S谩nchez, Guillem Collell Published: 2024-04-02Area: Model EditingCitations: 45 Tags: ai-safety, model-editing, safety-evaluation, survey | 2024-04-02 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E5 / R3 (96%) | 45 |
| Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks Francesco Croce, Maksym Andriushchenko, Nicolas Flammarion Published: 2024-04-02Area: Adversarial RobustnessCitations: 407 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (99%) | 407 |
| Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models Anda Cao, Chao Ye, Jiachen Ma, Jie Zhang Published: 2024-04-02Area: Multimodal SafetyCitations: 64 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-04-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (97%) | 64 |
| JailBreakV-28K: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks Chaowei Xiao, Siyuan Ma, Weidi Luo, Xiaogeng Liu Published: 2024-04-03Area: Multimodal SafetyCitations: 182 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2024-04-03 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E4 / R3 (98%) | 182 |
| Locating and Editing Factual Associations in Mamba Arnab Sen Sharma, David Atkinson, David Bau Published: 2024-04-04Area: Model EditingCitations: 37 Tags: ai-safety, empirical, model-editing | 2024-04-04 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 37 |
| ReFT: Representation Finetuning for Language Models Aryaman Arora, Atticus Geiger, Christopher D. Manning, Christopher Potts Published: 2024-04-04Area: Representation AnalysisCitations: 133 Tags: ai-safety, empirical, representation-analysis | 2024-04-04 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 133 |
| Robust Concept Erasure Using Task Vectors Chinmay Hegde, Kelly O. Marshall, Minh Pham, Niv Cohen Published: 2024-04-04Area: Model EditingCitations: 27 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-04-04 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 27 |
| ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming Bo Li, Felix Friedrich, Huu Nguyen, Kristian Kersting Published: 2024-04-06Area: Safety EvaluationCitations: 83 Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-04-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E4 / R3 (96%) | 83 |