Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Recovering the Pre-Fine-Tuning Weights of Generative Models Eliahu Horwitz, Jonathan Kahana, Yedid Hoshen Published: 2024-02-15Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 13 |
| Representation Surgery: Theory and Practice of Affine Steering Jonathan Herzig, Ponnurangam Kumaraguru, Roee Aharoni, Ryan Cotterell Published: 2024-02-15Area: Representation AnalysisCitations: 32 Tags: ai-safety, representation-analysis, theoretical | 2024-02-15 | Representation Analysis | ai-safety, representation-analysis, theoretical | E4 / R3 (94%) | 32 |
| Reward Generalization in RLHF: A Topological Perspective Dong Yan, Fanzhi Zeng, Han Yang, Jiaming Ji Published: 2024-02-15Area: Alignment TrainingCitations: 7 Tags: ai-safety, alignment-training, theoretical | 2024-02-15 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (95%) | 7 |
| Towards Safer Large Language Models through Machine Unlearning Guangyao Dou, Meng Jiang, Yijun Tian, Zhaoxuan Tan Published: 2024-02-15Area: Model EditingCitations: 134 Tags: ai-safety, empirical, model-editing | 2024-02-15 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (94%) | 134 |
| UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language Models Hongzhou Lin, Ivan Vulic, Mikhail Belkin, Ramon Huerta Published: 2024-02-15Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2024-02-15 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 23 |
| Interpreting CLIP with Sparse Linear Concept Embeddings (SpLiCE) Alex Oesterling, Flavio P. Calmon, Himabindu Lakkaraju, Suraj Srinivas Published: 2024-02-16Area: Representation AnalysisCitations: 91 Tags: ai-safety, empirical, representation-analysis | 2024-02-16 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (93%) | 91 |
| Robust agents learn causal world models Jonathan Richens, Tom Everitt Published: 2024-02-16Area: Formal/TheoreticalCitations: 67 Tags: ai-safety, formaltheoretical, theoretical | 2024-02-16 | Formal/Theoretical | ai-safety, formaltheoretical, theoretical | E5 / R3 (96%) | 67 |
| Towards Uncovering How Large Language Model Works: An Explainability Perspective Fan Yang, Haiyan Zhao, Himabindu Lakkaraju, Mengnan Du Published: 2024-02-16Area: Surveys & ReviewsCitations: 26 Tags: ai-safety, alignment-training, interpretability, survey, surveys-reviews | 2024-02-16 | Surveys & Reviews | ai-safety, alignment-training, interpretability, survey, surveys-reviews | E5 / R3 (93%) | 26 |
| When "Competency" in Reasoning Opens the Door to Vulnerability: Jailbreaking LLMs via Novel Complex Ciphers Advait Chirmule, Bimal Gajera, Chitta Baral, Divij Handa Published: 2024-02-16Area: Adversarial RobustnessCitations: 33 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 33 |
| Competition of Mechanisms: Tracing How Language Models Handle Facts and Counterfactuals Alberto Cazzaniga, Bernhard Sch枚lkopf, Diego Doimo, Francesco Ortu Published: 2024-02-18Area: Mechanistic Interp.Citations: 35 Tags: ai-safety, empirical, mechanistic-interp | 2024-02-18 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E7 / R3 (95%) | 35 |
| A Mechanistic Analysis of a Transformer Trained on a Symbolic Multi-Step Reasoning Task Abhay Sheshadri, Christian Bartelt, Jannik Brinkmann, Paul Swoboda Published: 2024-02-19Area: Mechanistic Interp.Citations: 48 Tags: ai-safety, empirical, mechanistic-interp | 2024-02-19 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 48 |
| ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs Bhaskar Ramasubramanian, Bo Li, Fengqing Jiang, Luyao Niu Published: 2024-02-19Area: Adversarial RobustnessCitations: 215 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 215 |
| CausalGym: Benchmarking Causal Interpretability Methods on Linguistic Tasks Aryaman Arora, Christopher Potts, Dan Jurafsky Published: 2024-02-19Area: Safety EvaluationCitations: 36 Tags: ai-safety, benchmark, interpretability, safety-evaluation | 2024-02-19 | Safety Evaluation | ai-safety, benchmark, interpretability, safety-evaluation | E5 / R3 (95%) | 36 |
| Dictionary Learning Improves Patch-Free Circuit Discovery in Mechanistic Interpretability: A Case Study on Othello-GPT Qinyuan Cheng, Qiong Tang, Tianxiang Sun, Xipeng Qiu Published: 2024-02-19Area: Mechanistic Interp.Citations: 25 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-02-19 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 25 |
| Emulated Disalignment: Safety Alignment for Large Language Models May Backfire! Chao Yang, Jiaheng Liu, Jie Liu, Wanli Ouyang Published: 2024-02-19Area: Adversarial RobustnessCitations: 35 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 35 |
| Query-Based Adversarial Prompt Generation Ema Borevkovic, Florian Tram猫r, Jonathan Hayase, Milad Nasr Published: 2024-02-19Area: Adversarial RobustnessCitations: 48 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 48 |
| UnlearnCanvas: A Stylized Image Dataset to Benchmark Machine Unlearning for Diffusion Models Jiancheng Liu, Jinghan Jia, Sijia Liu, Xiaoming Liu Published: 2024-02-19Area: Model EditingCitations: 22 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-02-19 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (96%) | 22 |
| Defending Jailbreak Prompts via In-Context Adversarial Game Haomin Zhuang, Hongyan Bao, Kehan Guo, Taicheng Guo Published: 2024-02-20Area: Adversarial RobustnessCitations: 32 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 32 |
| Generative AI Security: Challenges and Countermeasures Banghua Zhu, David Wagner, Jiantao Jiao, Norman Mu Published: 2024-02-20Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, survey | 2024-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (95%) | 14 |
| Is the System Message Really Important to Jailbreaks in Large Language Models? Ke Li, Xiaotian Zou, Yongkang Chen Published: 2024-02-20Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 24 |
| Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive Arka Pal, Colin White, Deep Karkhanis, Manley Roberts Published: 2024-02-20Area: Alignment TrainingCitations: 219 Tags: ai-safety, alignment-training, empirical | 2024-02-20 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 219 |
| The Wolf Within: Covert Injection of Malice into MLLM Societies via an MLLM Operative Chengshuai Zhao, Huan Liu, Raha Moraffah, Tianlong Chen Published: 2024-02-20Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 21 |
| Coercing LLMs to do and reveal (almost) anything Alex Stein, Jonas Geiping, Khalid Saifullah, Manli Shu Published: 2024-02-21Area: Adversarial RobustnessCitations: 86 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 86 |
| Corrective Machine Unlearning Amartya Sanyal, Ameya Prabhu, Philip Torr, Ponnurangam Kumaraguru Published: 2024-02-21Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2024-02-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (92%) | 23 |
| Is LLM-as-a-Judge Robust? Investigating Universal Adversarial Attacks on Zero-shot LLM Assessment Adian Liusie, Mark Gales, Vyas Raina Published: 2024-02-21Area: Adversarial RobustnessCitations: 104 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 104 |
| Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content Federico Bianchi, James Zou Published: 2024-02-21Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 13 |
| Learning to Poison Large Language Models During Instruction Tuning Dongxiao Zhu, Douglas Zytko, Mohammad Amin Roshani, Saleh Zare Zade Published: 2024-02-21Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| LLM Jailbreak Attack versus Defense Techniques -- A Comprehensive Study Gelei Deng, Stjepan Picek, Yi Liu, Yuekang Li Published: 2024-02-21Area: Adversarial RobustnessCitations: 98 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 98 |
| Chain-of-Thought Unfaithfulness as Disguised Accuracy Ana Marasovi膰, Nathan Stringham, Oliver Bentham Published: 2024-02-22Area: Deception & FailureCitations: 25 Tags: ai-safety, deception-failure, empirical | 2024-02-22 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (97%) | 25 |
| Fine-tuning Enhances Existing Mechanisms: A Case Study on Entity Tracking David Bau, Nikhil Prakash, Tal Haklay, Tamar Rott Shaham Published: 2024-02-22Area: Training DynamicsCitations: 101 Tags: ai-safety, empirical, training-dynamics | 2024-02-22 | Training Dynamics | ai-safety, empirical, training-dynamics | E7 / R4 (95%) | 101 |