Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Bergeron: Combating Adversarial Attacks through a Conscience-Based Alignment Framework Abraham Sanders, Bingsheng Yao, Dakuo Wang, Matthew Pisano Published: 2023-11-16Area: Adversarial RobustnessCitations: 33 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (94%) | 33 |
| Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking Bangzheng Li, Ben Zhou, Chaowei Xiao, Fei Wang Published: 2023-11-16Area: Adversarial RobustnessCitations: 90 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R4 (95%) | 90 |
| Hijacking Large Language Models via Adversarial In-Context Learning Dongxiao Zhu, Xiangyu Zhou, Yao Qiang Published: 2023-11-16Area: Adversarial RobustnessCitations: 48 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 48 |
| JAB: Joint Adversarial Prompting and Belief Augmentation Anil Ramakrishna, Aram Galstyan, Jwala Dhamala, Kai-Wei Chang Published: 2023-11-16Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2023-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E6 / R3 (96%) | 8 |
| On the Exploitability of Reinforcement Learning with Human Feedback for Large Language Models Chaowei Xiao, Jiongxiao Wang, Junlin Wu, Muhao Chen Published: 2023-11-16Area: Alignment TrainingCitations: 32 Tags: ai-safety, alignment-training, empirical | 2023-11-16 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 32 |
| Testing Language Model Agents Safely in the Wild Adam Tauman Kalai, Craig Swift, David Atkinson, David Bau Published: 2023-11-17Area: Agent SafetyCitations: 40 Tags: agent-safety, ai-safety, empirical | 2023-11-17 | Agent Safety | agent-safety, ai-safety, empirical | E4 / R2 (95%) | 40 |
| Evil Geniuses: Delving into the Safety of LLM-based Agents Hang Su, Jingyuan Zhang, Xiao Yang, Yinpeng Dong Published: 2023-11-20Area: Agent SafetyCitations: 101 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2023-11-20 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E7 / R4 (95%) | 101 |
| Mechanistically analyzing the effects of fine-tuning on procedurally defined tasks David Krueger, Edward Grefenstette, Ekdeep Singh Lubana, Hidenori Tanaka Published: 2023-11-21Area: Mechanistic Interp.Citations: 99 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2023-11-21 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R3 (92%) | 99 |
| Exploiting Large Language Models (LLMs) through Deception Techniques and Persuasion Principles Akbar Siami Namin, Faranak Abri, Sonali Singh Published: 2023-11-24Area: Adversarial RobustnessCitations: 29 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (96%) | 29 |
| Universal Jailbreak Backdoors from Poisoned Human Feedback Florian Tram猫r, Javier Rando Published: 2023-11-24Area: Adversarial RobustnessCitations: 115 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 115 |
| Localizing Lying in Llama: Understanding Instructed Dishonesty on True-False Questions Through Prompting, Probing, and Patching James Campbell, Phillip Guo, Richard Ren Published: 2023-11-25Area: Mechanistic Interp.Citations: 26 Tags: ai-safety, empirical, mechanistic-interp | 2023-11-25 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (97%) | 26 |
| Exploring the Robustness of Model-Graded Evaluations and Automated Interpretability Ondrej Kvapil, Simon Lermen Published: 2023-11-26Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, interpretability, safety-evaluation | 2023-11-26 | Safety Evaluation | ai-safety, empirical, interpretability, safety-evaluation | E5 / R3 (93%) | 3 |
| Cognitive Dissonance: Why Do Language Model Outputs Disagree with Internal Representations of Truthfulness? Dylan Hadfield-Menell, Jacob Andreas, Kevin Liu, Stephen Casper Published: 2023-11-27Area: Representation AnalysisCitations: 55 Tags: ai-safety, empirical, representation-analysis | 2023-11-27 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (95%) | 55 |
| Is This the Subspace You Are Looking for? An Interpretability Illusion for Subspace Activation Patching Aleksandar Makelov, Georg Lange, Neel Nanda Published: 2023-11-28Area: Mechanistic Interp.Citations: 41 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-11-28 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R3 (93%) | 41 |
| Scalable Extraction of Training Data from (Production) Language Models A. Feder Cooper, Christopher A. Choquette-Choo, Daphne Ippolito, Eric Wallace Published: 2023-11-28Area: Adversarial RobustnessCitations: 495 Tags: adversarial-robustness, ai-safety, empirical | 2023-11-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (94%) | 495 |
| The Philosopher's Stone: Trojaning Plugins of Large Language Models Guoxing Chen, Haojin Zhu, Minhui Xue, Rayne Holland Published: 2023-12-01Area: Adversarial RobustnessCitations: 31 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 31 |
| Eliciting Latent Knowledge from Quirky Language Models Alex Mallen, Nora Belrose Published: 2023-12-02Area: Representation AnalysisCitations: 46 Tags: ai-safety, empirical, representation-analysis | 2023-12-02 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (93%) | 46 |
| The Unlocking Spell on Base LLMs: Rethinking Alignment via In-Context Learning Abhilasha Ravichander, Bill Yuchen Lin, Chandra Bhagavatula, Khyathi Chandu Published: 2023-12-04Area: Alignment TrainingCitations: 276 Tags: ai-safety, alignment-training, empirical | 2023-12-04 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 276 |
| Tree of Attacks: Jailbreaking Black-Box LLMs Automatically Amin Karbasi, Anay Mehrotra, Blaine Nelson, Hyrum Anderson Published: 2023-12-04Area: Adversarial RobustnessCitations: 500 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 500 |
| Generating Interpretable Networks using Hypernetworks Isaac Liao, Max Tegmark, Ziming Liu Published: 2023-12-05Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2023-12-05 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (95%) | 2 |
| Scaling Laws for Adversarial Attacks on Language Model Activations Stanislav Fort Published: 2023-12-05Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (92%) | 20 |
| Improving Activation Steering in Language Models with Mean-Centring Dylan Cope, Murray Shanahan, Nandi Schoots, Ole Jorgensen Published: 2023-12-06Area: Representation AnalysisCitations: 57 Tags: ai-safety, empirical, representation-analysis | 2023-12-06 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 57 |
| Interpretability Illusions in the Generalization of Simplified Models Andrew Lampinen, Asma Ghandeharioun, Dan Friedman, Danqi Chen Published: 2023-12-06Area: Mechanistic Interp.Citations: 20 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-12-06 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | 20 |
| Steering Llama 2 via Contrastive Activation Addition Alexander Matt Turner, Evan Hubinger, Julian Schulz, Meg Tong Published: 2023-12-09Area: Representation AnalysisCitations: 527 Tags: ai-safety, empirical, representation-analysis | 2023-12-09 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 527 |
| Grokking Group Multiplication with Cosets Dashiell Stander, Honglu Fan, Qinan Yu, Stella Biderman Published: 2023-12-11Area: Mechanistic Interp.Citations: 18 Tags: ai-safety, empirical, mechanistic-interp | 2023-12-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 18 |
| AI Control: Improving Safety Despite Intentional Subversion Buck Shlegeris, Fabien Roger, Kshitij Sachan, Ryan Greenblatt Published: 2023-12-12Area: Safety EvaluationCitations: 114 Tags: ai-safety, empirical, safety-evaluation | 2023-12-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 114 |
| Alignment for Honesty Ethan Chern, Graham Neubig, Pengfei Liu, Xipeng Qiu Published: 2023-12-12Area: Alignment TrainingCitations: 63 Tags: ai-safety, alignment-training, empirical | 2023-12-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 63 |
| Divide-and-Conquer Attack: Harnessing the Power of LLM to Bypass the Censorship of Text-to-Image Generation Model Huangxun Chen, Yimo Deng Published: 2023-12-12Area: Multimodal SafetyCitations: 5 Tags: ai-safety, empirical, multimodal-safety | 2023-12-12 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 5 |
| Safety Alignment in NLP Tasks: Weakly Aligned Summarization as an In-Context Attack Cong Liu, Wen Xiao, Yue Dong, Yufei Li Published: 2023-12-12Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-12-12 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (94%) | 10 |
| Forbidden Facts: An Investigation of Competing Objectives in Llama-2 Kaivalya Hariharan, Miles Wang, Nir Shavit, Tony T. Wang Published: 2023-12-14Area: Mechanistic Interp.Citations: 3 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2023-12-14 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 3 |