Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Let's Think Dot by Dot: Hidden Computation in Transformer Language Models Jacob Pfau, Samuel R. Bowman, William Merrill Published: 2024-04-24Area: Mechanistic Interp.Citations: 145 Tags: ai-safety, empirical, mechanistic-interp | 2024-04-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 145 |
| Don't Say No: Jailbreaking LLM by Suppressing Refusal Wenjie Wang, Yukai Zhou Published: 2024-04-25Area: Adversarial RobustnessCitations: 46 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-04-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 46 |
| Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples Jindong Gu, Kuofeng Gao, Philip Torr, Shu-Tao Xia Published: 2024-04-25Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 17 |
| Uncovering Deceptive Tendencies in Language Models: A Simulated Company AI Assistant Evan Hubinger, Olli J盲rviniemi Published: 2024-04-25Area: Deception & FailureCitations: 25 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2024-04-25 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E4 / R3 (98%) | 25 |
| Weak-to-Strong Extrapolation Expedites Alignment Chujie Zheng, Heng Ji, Minlie Huang, Nanyun Peng Published: 2024-04-25Area: Alignment TrainingCitations: 34 Tags: ai-safety, alignment-training, empirical | 2024-04-25 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 34 |
| Talking Nonsense: Probing Large Language Models' Understanding of Adversarial Gibberish Inputs James Zou, Valeriia Cherepanova Published: 2024-04-26Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 9 |
| SOUL: Unlocking the Power of Second-Order Optimization for LLM Unlearning Bharat Runwal, Bhavya Kailkhura, James Diffenderfer, Jiancheng Liu Published: 2024-04-28Area: Model EditingCitations: 98 Tags: ai-safety, empirical, model-editing | 2024-04-28 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 98 |
| More RLHF, More Trust? On The Impact of Preference Alignment On Trustworthiness Aaron J. Li, Himabindu Lakkaraju, Satyapriya Krishna Published: 2024-04-29Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical | 2024-04-29 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (96%) | 10 |
| Countering Reward Over-optimization in LLM with Demonstration-Guided Reinforcement Learning Emmanuel Dupoux, Florian Strub, Mathieu Rita, Olivier Pietquin Published: 2024-04-30Area: Alignment TrainingCitations: 15 Tags: ai-safety, alignment-training, empirical | 2024-04-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 15 |
| Espresso: Robust Concept Filtering in Text-to-Image Models Anudeep Das, N. Asokan, Rui Zhang, Vasisht Duddu Published: 2024-04-30Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-04-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 13 |
| LITO: Learnable Intervention for Truthfulness Optimization Farima Fatahi Bayat, H. V. Jagadish, Lu Wang, Xin Liu Published: 2024-05-01Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2024-05-01 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 3 |
| Can LLMs Deeply Detect Complex Malicious Queries? A Framework for Jailbreaking via Obfuscating Intent Liya Su, Shang Shang, Xiaodan Zhang, Xinqiang Zhao Published: 2024-05-06Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (98%) | 11 |
| To Each (Textual Sequence) Its Own: Improving Memorized-Data Unlearning in Large Language Models George-Octavian B膬rbulescu, Peter Triantafillou Published: 2024-05-06Area: Model EditingCitations: 38 Tags: ai-safety, empirical, model-editing | 2024-05-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (93%) | 38 |
| A Causal Explainable Guardrails for Large Language Models Kui Ren, Longfei Li, Yan Wang, Zhan Qin Published: 2024-05-07Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-05-07 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R3 (94%) | 17 |
| How does GPT-2 Predict Acronyms? Extracting and Understanding a Circuit via Mechanistic Interpretability Alejandro Mat茅, Jorge Garc铆a-Carrasco, Juan Trujillo Published: 2024-05-07Area: Mechanistic Interp.Citations: 13 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-05-07 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (95%) | 13 |
| Language Models can Subtly Deceive Without Lying: A Case Study on Strategic Phrasing in Legislation Aishwarya Balasubramanian Sai, Ameet Deshpande, Ashwin Kalyan, Atharvan Dogra Published: 2024-05-07Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical | 2024-05-07 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (94%) | 7 |
| AirGapAgent: Protecting Privacy-Conscious Conversational Agents Borja Balle, Daniel Ramage, Eugene Bagdasaryan, Marco Gruteser Published: 2024-05-08Area: Agent SafetyCitations: 53 Tags: agent-safety, ai-safety, empirical | 2024-05-08 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R3 (93%) | 53 |
| An Assessment of Model-On-Model Deception Julius Heitkoetter, Laker Newhouse, Michael Gerovitch Published: 2024-05-10Area: Deception & FailureCitations: 4 Tags: ai-safety, deception-failure, empirical | 2024-05-10 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 4 |
| LLM-Generated Black-box Explanations Can Be Adversarially Helpful Frank Rudzicz, Rohan Ajwani, Shashidhar Reddy Javaji, Zining Zhu Published: 2024-05-10Area: Deception & FailureCitations: 28 Tags: adversarial-robustness, ai-safety, deception-failure, empirical | 2024-05-10 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical | E5 / R3 (95%) | 28 |
| Erasing Concepts from Text-to-Image Diffusion Models with Few-shot Unlearning Masane Fuchi, Tomohiro Takagi Published: 2024-05-12Area: Model EditingCitations: 25 Tags: ai-safety, empirical, model-editing | 2024-05-12 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 25 |
| PARDEN, Can You Repeat That? Defending against Jailbreaks via Repetition Jakob Foerster, Qizhen Zhang, Ziyang Zhang Published: 2024-05-13Area: Adversarial RobustnessCitations: 35 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 35 |
| Understanding the Performance Gap Between Online and Offline Alignment Algorithms Bernardo 脕vila Pires, Daniele Calandriello, Daniel Guo, Eugene Tarassov Published: 2024-05-14Area: Alignment TrainingCitations: 99 Tags: ai-safety, alignment-training, empirical | 2024-05-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 99 |
| A Safety Realignment Framework via Subspace-Oriented Model Fusion for Large Language Models Liang He, Linlin Wang, Shunfan Zheng, Xiaoling Wang Published: 2024-05-15Area: Model EditingCitations: 43 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 43 |
| Efficient LLM Jailbreak via Adaptive Dense-to-sparse Constrained Optimization Kai Chen, Kai Hu, Lijun Yu, Matt Fredrikson Published: 2024-05-15Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 20 |
| Spectral Editing of Activations for Large Language Model Alignment Anna Korhonen, Edoardo M. Ponti, Shay B. Cohen, Yftah Ziser Published: 2024-05-15Area: Model EditingCitations: 43 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 43 |
| Adversarial Robustness for Visual Grounding of Multimodal Large Language Models Jiawang Bai, Kuofeng Gao, Shu-Tao Xia, Yang Bai Published: 2024-05-16Area: Multimodal SafetyCitations: 26 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-16 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (93%) | 26 |
| Learnable Privacy Neurons Localization in Language Models Ruizhe Chen, Tianxiang Hu, Yang Feng, Zuozhu Liu Published: 2024-05-16Area: Mechanistic Interp.Citations: 30 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-05-16 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 30 |
| Identifying Functionally Important Features with End-to-End Sparse Dictionary Learning Dan Braun, Jordan Taylor, Lee Sharkey, Nicholas Goldowsky-Dill Published: 2024-05-17Area: Mechanistic Interp.Citations: 57 Tags: ai-safety, empirical, mechanistic-interp | 2024-05-17 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 57 |
| Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors Changsheng Wang, Chaowei Xiao, Jiachen Sun, Jiongxiao Wang Published: 2024-05-17Area: Multimodal SafetyCitations: 16 Tags: ai-safety, empirical, multimodal-safety | 2024-05-17 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 16 |
| The Local Interaction Basis: Identifying Computationally-Relevant and Sparsely Interacting Features in Neural Networks Avery Griffin, Dan Braun, Jake Mendel, J枚rn St枚hler Published: 2024-05-17Area: Mechanistic Interp.Citations: 6 Tags: ai-safety, empirical, mechanistic-interp | 2024-05-17 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (93%) | 6 |