Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| How to Use and Interpret Activation Patching Neel Nanda, Stefan Heimersheim Published: 2024-04-23Area: Mechanistic Interp.Citations: 109 Tags: ai-safety, interpretability, mechanistic-interp, survey | 2024-04-23 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, survey | E6 / R4 (95%) | 109 |
| Improving Dictionary Learning with Gated Sparse Autoencoders Arthur Conmy, J脙隆nos Kram脙隆r, Lewis Smith, Neel Nanda Published: 2024-04-24Area: Mechanistic Interp.Citations: 138 Tags: ai-safety, empirical, mechanistic-interp | 2024-04-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (97%) | 138 |
| Investigating Adversarial Trigger Transfer in Large Language Models Arkil Patel, Nicholas Meade, Siva Reddy Published: 2024-04-24Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Let's Think Dot by Dot: Hidden Computation in Transformer Language Models Jacob Pfau, Samuel R. Bowman, William Merrill Published: 2024-04-24Area: Mechanistic Interp.Citations: 145 Tags: ai-safety, empirical, mechanistic-interp | 2024-04-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 145 |
| Don't Say No: Jailbreaking LLM by Suppressing Refusal Wenjie Wang, Yukai Zhou Published: 2024-04-25Area: Adversarial RobustnessCitations: 46 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-04-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 46 |
| Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples Jindong Gu, Kuofeng Gao, Philip Torr, Shu-Tao Xia Published: 2024-04-25Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 17 |
| Uncovering Deceptive Tendencies in Language Models: A Simulated Company AI Assistant Evan Hubinger, Olli J盲rviniemi Published: 2024-04-25Area: Deception & FailureCitations: 25 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2024-04-25 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E4 / R3 (98%) | 25 |
| Weak-to-Strong Extrapolation Expedites Alignment Chujie Zheng, Heng Ji, Minlie Huang, Nanyun Peng Published: 2024-04-25Area: Alignment TrainingCitations: 34 Tags: ai-safety, alignment-training, empirical | 2024-04-25 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 34 |
| Talking Nonsense: Probing Large Language Models' Understanding of Adversarial Gibberish Inputs James Zou, Valeriia Cherepanova Published: 2024-04-26Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 9 |
| SOUL: Unlocking the Power of Second-Order Optimization for LLM Unlearning Bharat Runwal, Bhavya Kailkhura, James Diffenderfer, Jiancheng Liu Published: 2024-04-28Area: Model EditingCitations: 98 Tags: ai-safety, empirical, model-editing | 2024-04-28 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 98 |
| More RLHF, More Trust? On The Impact of Preference Alignment On Trustworthiness Aaron J. Li, Himabindu Lakkaraju, Satyapriya Krishna Published: 2024-04-29Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical | 2024-04-29 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (96%) | 10 |
| A Primer on the Inner Workings of Transformer-based Language Models Arianna Bisazza, Gabriele Sarti, Javier Ferrando, Marta R. Costa-juss脿 Published: 2024-04-30Area: Surveys & ReviewsCitations: 80 Tags: ai-safety, interpretability, survey, surveys-reviews | 2024-04-30 | Surveys & Reviews | ai-safety, interpretability, survey, surveys-reviews | E7 / R4 (95%) | 80 |
| Countering Reward Over-optimization in LLM with Demonstration-Guided Reinforcement Learning Emmanuel Dupoux, Florian Strub, Mathieu Rita, Olivier Pietquin Published: 2024-04-30Area: Alignment TrainingCitations: 15 Tags: ai-safety, alignment-training, empirical | 2024-04-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 15 |
| Espresso: Robust Concept Filtering in Text-to-Image Models Anudeep Das, N. Asokan, Rui Zhang, Vasisht Duddu Published: 2024-04-30Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 13 |
| LITO: Learnable Intervention for Truthfulness Optimization Farima Fatahi Bayat, H. V. Jagadish, Lu Wang, Xin Liu Published: 2024-05-01Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2024-05-01 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 3 |
| Can LLMs Deeply Detect Complex Malicious Queries? A Framework for Jailbreaking via Obfuscating Intent Liya Su, Shang Shang, Xiaodan Zhang, Xinqiang Zhao Published: 2024-05-06Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (98%) | 11 |
| To Each (Textual Sequence) Its Own: Improving Memorized-Data Unlearning in Large Language Models George-Octavian B膬rbulescu, Peter Triantafillou Published: 2024-05-06Area: Model EditingCitations: 38 Tags: ai-safety, empirical, model-editing | 2024-05-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (93%) | 38 |
| A Causal Explainable Guardrails for Large Language Models Kui Ren, Longfei Li, Yan Wang, Zhan Qin Published: 2024-05-07Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-05-07 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R3 (94%) | 17 |
| How does GPT-2 Predict Acronyms? Extracting and Understanding a Circuit via Mechanistic Interpretability Alejandro Mat茅, Jorge Garc铆a-Carrasco, Juan Trujillo Published: 2024-05-07Area: Mechanistic Interp.Citations: 13 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-05-07 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (95%) | 13 |
| Language Models can Subtly Deceive Without Lying: A Case Study on Strategic Phrasing in Legislation Aishwarya Balasubramanian Sai, Ameet Deshpande, Ashwin Kalyan, Atharvan Dogra Published: 2024-05-07Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical | 2024-05-07 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (94%) | 7 |
| AirGapAgent: Protecting Privacy-Conscious Conversational Agents Borja Balle, Daniel Ramage, Eugene Bagdasaryan, Marco Gruteser Published: 2024-05-08Area: Agent SafetyCitations: 53 Tags: agent-safety, ai-safety, empirical | 2024-05-08 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R3 (93%) | 53 |
| Poser: Unmasking Alignment Faking LLMs by Manipulating Their Internals Caden Juang, Joshua Clymer, Severin Field Published: 2024-05-08Area: Deception & FailureCitations: 7 Tags: ai-safety, alignment-training, benchmark, deception-failure | 2024-05-08 | Deception & Failure | ai-safety, alignment-training, benchmark, deception-failure | E4 / R3 (96%) | 7 |
| An Assessment of Model-On-Model Deception Julius Heitkoetter, Laker Newhouse, Michael Gerovitch Published: 2024-05-10Area: Deception & FailureCitations: 4 Tags: ai-safety, deception-failure, empirical | 2024-05-10 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 4 |
| LLM-Generated Black-box Explanations Can Be Adversarially Helpful Frank Rudzicz, Rohan Ajwani, Shashidhar Reddy Javaji, Zining Zhu Published: 2024-05-10Area: Deception & FailureCitations: 28 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2024-05-10 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E5 / R3 (95%) | 28 |
| Towards Guaranteed Safe AI: A Framework for Ensuring Robust and Reliable AI Systems Alessandro Abate, Ben Goldhaber, Christian Szegedy, Clark Barrett Published: 2024-05-10Area: Formal/TheoreticalCitations: 102 Tags: ai-safety, formaltheoretical, position | 2024-05-10 | Formal/Theoretical | ai-safety, formaltheoretical, position | E5 / R4 (97%) | 102 |
| Erasing Concepts from Text-to-Image Diffusion Models with Few-shot Unlearning Masane Fuchi, Tomohiro Takagi Published: 2024-05-12Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2024-05-12 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 25 |
| PARDEN, Can You Repeat That? Defending against Jailbreaks via Repetition Jakob Foerster, Qizhen Zhang, Ziyang Zhang Published: 2024-05-13Area: Adversarial RobustnessCitations: 35 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 35 |
| Towards Principled Evaluations of Sparse Autoencoders for Interpretability and Control Aleksandar Makelov, Georg Lange, Neel Nanda Published: 2024-05-14Area: Mechanistic Interp.Citations: 66 Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2024-05-14 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E6 / R3 (95%) | 66 |
| Understanding the Performance Gap Between Online and Offline Alignment Algorithms Bernardo 脕vila Pires, Daniele Calandriello, Daniel Guo, Eugene Tarassov Published: 2024-05-14Area: Alignment TrainingCitations: 99 Tags: ai-safety, alignment-training, empirical | 2024-05-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 99 |
| A Safety Realignment Framework via Subspace-Oriented Model Fusion for Large Language Models Liang He, Linlin Wang, Shunfan Zheng, Xiaoling Wang Published: 2024-05-15Area: Model EditingCitations: 43 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 43 |