Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Rejection Improves Reliability: Training LLMs to Refuse Unknown Questions Using RL from Knowledge Feedback Da Ma, Hongshen Xu, Kai Yu, Lu Chen Published: 2024-03-27Area: Alignment TrainingCitations: 63 Tags: ai-safety, alignment-training, empirical | 2024-03-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 63 |
| Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models Aaron Mueller, Can Rager, David Bau, Eric J. Michaud Published: 2024-03-28Area: Mechanistic Interp.Citations: 270 Tags: ai-safety, empirical, mechanistic-interp | 2024-03-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 270 |
| Developing Safe and Responsible Large Language Models - A Comprehensive Framework Deepak John Reji, Fatemeh Tavakoli, Oluwanifemi Bamgbose, Shaina Raza Published: 2024-04-01Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2024-04-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 5 |
| Privacy Backdoors: Enhancing Membership Inference through Poisoning Pre-trained Models Jonas Geiping, Leo Marchyok, Nicholas Carlini, Sanghyun Hong Published: 2024-04-01Area: Adversarial RobustnessCitations: 29 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 29 |
| Regularized Best-of-N Sampling to Mitigate Reward Hacking for Language Model Alignment Kaito Ariu, Kenshi Abe, Tetsuro Morimura, Yuu Jinnai Published: 2024-04-01Area: Deception & FailureCitations: 11 Tags: ai-safety, alignment-training, deception-failure, empirical | 2024-04-01 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E6 / R3 (97%) | 11 |
| What's in Your "Safe" Data? Identifying Benign Data that Breaks Safety Luxi He, Mengzhou Xia, Peter Henderson Published: 2024-04-01Area: Adversarial RobustnessCitations: 95 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-04-01 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 95 |
| Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks Francesco Croce, Maksym Andriushchenko, Nicolas Flammarion Published: 2024-04-02Area: Adversarial RobustnessCitations: 407 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (99%) | 407 |
| Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models Anda Cao, Chao Ye, Jiachen Ma, Jie Zhang Published: 2024-04-02Area: Multimodal SafetyCitations: 64 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-04-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (97%) | 64 |
| Locating and Editing Factual Associations in Mamba Arnab Sen Sharma, David Atkinson, David Bau Published: 2024-04-04Area: Model EditingCitations: 37 Tags: ai-safety, empirical, model-editing | 2024-04-04 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 37 |
| ReFT: Representation Finetuning for Language Models Aryaman Arora, Atticus Geiger, Christopher D. Manning, Christopher Potts Published: 2024-04-04Area: Representation AnalysisCitations: 133 Tags: ai-safety, empirical, representation-analysis | 2024-04-04 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 133 |
| Robust Concept Erasure Using Task Vectors Chinmay Hegde, Kelly O. Marshall, Minh Pham, Niv Cohen Published: 2024-04-04Area: Model EditingCitations: 27 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-04-04 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 27 |
| Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data Dana Alon, Donald Metzler, Tim Baumg盲rtner, Yang Gao Published: 2024-04-08Area: Adversarial RobustnessCitations: 35 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 35 |
| Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge Cen Chen, Huiping Zhuang, Jianwei Wang, Weikai Lu Published: 2024-04-08Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-04-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 49 |
| Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning Licong Lin, Ruiqi Zhang, Song Mei, Yu Bai Published: 2024-04-08Area: Model EditingCitations: 348 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-04-08 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 348 |
| AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts Christopher Parisien, Erick Galinkin, Prasoon Varshney, Shaona Ghosh Published: 2024-04-09Area: Adversarial RobustnessCitations: 94 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 94 |
| SafeGen: Mitigating Sexually Explicit Content Generation in Text-to-Image Models Chen Yan, Jiangyi Deng, Wenyuan Xu, Xiaoyu Ji Published: 2024-04-10Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 49 |
| AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs Huan Sun, Zeyi Liao Published: 2024-04-11Area: Adversarial RobustnessCitations: 153 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 153 |
| Latent Guard: a Safety Framework for Text-to-image Generation Ashkan Khakzar, Fabio Pizzati, Jindong Gu, Philip Torr Published: 2024-04-11Area: Multimodal SafetyCitations: 56 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-04-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 56 |
| LLM Agents can Autonomously Exploit One-day Vulnerabilities Akul Gupta, Daniel Kang, Richard Fang, Rohan Bindu Published: 2024-04-11Area: Agent SafetyCitations: 125 Tags: agent-safety, ai-safety, empirical | 2024-04-11 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (95%) | 125 |
| LLM Evaluators Recognize and Favor Their Own Generations Arjun Panickssery, Samuel R. Bowman, Shi Feng Published: 2024-04-15Area: Safety EvaluationCitations: 381 Tags: ai-safety, empirical, safety-evaluation | 2024-04-15 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R3 (95%) | 381 |
| Decomposing and Editing Predictions by Modeling Model Computation Aleksander Madry, Andrew Ilyas, Harshay Shah Published: 2024-04-17Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2024-04-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 25 |
| Offset Unlearning for Large Language Models Fei Wang, Fred Morstatter, Hoifung Poon, James Y. Huang Published: 2024-04-17Area: Model EditingCitations: 28 Tags: ai-safety, empirical, model-editing | 2024-04-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 28 |
| Stepwise Alignment for Constrained Language Model Policy Optimization Akifumi Wachi, Rei Sato, Takumi Tanabe, Thien Q Tran Published: 2024-04-17Area: Alignment TrainingCitations: 17 Tags: ai-safety, alignment-training, empirical | 2024-04-17 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 17 |
| Sophon: Non-Fine-Tunable Learning to Restrain Task Transferability For Pre-trained Models Haiqin Weng, Jiangyi Deng, Liangming Xia, Shengyuan Pang Published: 2024-04-19Area: Model EditingCitations: 15 Tags: ai-safety, empirical, model-editing | 2024-04-19 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (93%) | 15 |
| The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions Alex Beutel, Eric Wallace, Johannes Heidecke, Kai Xiao Published: 2024-04-19Area: Adversarial RobustnessCitations: 257 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 257 |
| Trojan Detection in Large Language Models: Insights from The Trojan Detection Challenge Bislan Ashinov, Bulat Nutfullin, Ekansh Verma, Narek Maloyan Published: 2024-04-21Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 18 |
| Automatic Discovery of Visual Circuits Achyuta Rajaram, Antonio Torralba, Jacob Andreas, Neil Chowdhury Published: 2024-04-22Area: Mechanistic Interp.Citations: 10 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-04-22 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 10 |
| Resistance Against Manipulative AI: key factors and possible actions Piotr Wilczy艅ski, Przemys艂aw Biecek, Wiktoria Mieleszczenko-Kowszewicz Published: 2024-04-22Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2024-04-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 7 |
| Improving Dictionary Learning with Gated Sparse Autoencoders Arthur Conmy, J脙隆nos Kram脙隆r, Lewis Smith, Neel Nanda Published: 2024-04-24Area: Mechanistic Interp.Citations: 138 Tags: ai-safety, empirical, mechanistic-interp | 2024-04-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (97%) | 138 |
| Investigating Adversarial Trigger Transfer in Large Language Models Arkil Patel, Nicholas Meade, Siva Reddy Published: 2024-04-24Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |