Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| The Unlocking Spell on Base LLMs: Rethinking Alignment via In-Context Learning Abhilasha Ravichander, Bill Yuchen Lin, Chandra Bhagavatula, Khyathi Chandu Published: 2023-12-04Area: Alignment TrainingCitations: 276 Tags: ai-safety, alignment-training, empirical | 2023-12-04 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 276 |
| Tree of Attacks: Jailbreaking Black-Box LLMs Automatically Amin Karbasi, Anay Mehrotra, Blaine Nelson, Hyrum Anderson Published: 2023-12-04Area: Adversarial RobustnessCitations: 500 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 500 |
| FlexModel: A Framework for Interpretability of Distributed Large Language Models David B. Emerson, John Willes, Matthew Choi, Muhammad Adil Asif Published: 2023-12-05Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2023-12-05 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (95%) | 1 |
| Generating Interpretable Networks using Hypernetworks Isaac Liao, Max Tegmark, Ziming Liu Published: 2023-12-05Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2023-12-05 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (95%) | 2 |
| Scaling Laws for Adversarial Attacks on Language Model Activations Stanislav Fort Published: 2023-12-05Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (92%) | 20 |
| Improving Activation Steering in Language Models with Mean-Centring Dylan Cope, Murray Shanahan, Nandi Schoots, Ole Jorgensen Published: 2023-12-06Area: Representation AnalysisCitations: 57 Tags: ai-safety, empirical, representation-analysis | 2023-12-06 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 57 |
| Interpretability Illusions in the Generalization of Simplified Models Andrew Lampinen, Asma Ghandeharioun, Dan Friedman, Danqi Chen Published: 2023-12-06Area: Mechanistic Interp.Citations: 20 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2023-12-06 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | 20 |
| Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations Brian Fuller, Davide Testuggine, Hakan Inan, Jianfeng Chi Published: 2023-12-07Area: Adversarial RobustnessCitations: 813 Tags: adversarial-robustness, ai-safety, tool | 2023-12-07 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (95%) | 813 |
| Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models Aleksandar Straumann, Cornelius Aschermann, Cyrus Nikolaidis, Daniel Song Published: 2023-12-07Area: Safety EvaluationCitations: 123 Tags: ai-safety, benchmark, safety-evaluation | 2023-12-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 123 |
| Steering Llama 2 via Contrastive Activation Addition Alexander Matt Turner, Evan Hubinger, Julian Schulz, Meg Tong Published: 2023-12-09Area: Representation AnalysisCitations: 527 Tags: ai-safety, empirical, representation-analysis | 2023-12-09 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 527 |
| Grokking Group Multiplication with Cosets Dashiell Stander, Honglu Fan, Qinan Yu, Stella Biderman Published: 2023-12-11Area: Mechanistic Interp.Citations: 18 Tags: ai-safety, empirical, mechanistic-interp | 2023-12-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 18 |
| AI Control: Improving Safety Despite Intentional Subversion Buck Shlegeris, Fabien Roger, Kshitij Sachan, Ryan Greenblatt Published: 2023-12-12Area: Safety EvaluationCitations: 114 Tags: ai-safety, empirical, safety-evaluation | 2023-12-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 114 |
| Alignment for Honesty Ethan Chern, Graham Neubig, Pengfei Liu, Xipeng Qiu Published: 2023-12-12Area: Alignment TrainingCitations: 63 Tags: ai-safety, alignment-training, empirical | 2023-12-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 63 |
| Divide-and-Conquer Attack: Harnessing the Power of LLM to Bypass the Censorship of Text-to-Image Generation Model Huangxun Chen, Yimo Deng Published: 2023-12-12Area: Multimodal SafetyCitations: 5 Tags: ai-safety, empirical, multimodal-safety | 2023-12-12 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 5 |
| Safety Alignment in NLP Tasks: Weakly Aligned Summarization as an In-Context Attack Cong Liu, Wen Xiao, Yue Dong, Yufei Li Published: 2023-12-12Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-12-12 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (94%) | 10 |
| Forbidden Facts: An Investigation of Competing Objectives in Llama-2 Kaivalya Hariharan, Miles Wang, Nir Shavit, Tony T. Wang Published: 2023-12-14Area: Mechanistic Interp.Citations: 3 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2023-12-14 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 3 |
| Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking Adam Fisch, Ahmad Beirami, Alekh Agarwal, Alex D'Amour Published: 2023-12-14Area: Deception & FailureCitations: 147 Tags: ai-safety, deception-failure, empirical | 2023-12-14 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (92%) | 147 |
| Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations Damai Dai, Deli Chen, Lei Li, Peiyi Wang Published: 2023-12-14Area: Alignment TrainingCitations: 725 Tags: ai-safety, alignment-training, empirical | 2023-12-14 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (96%) | 725 |
| Successor Heads: Recurring, Interpretable Attention Heads In The Wild Arthur Conmy, Euan Ong, George Ogden, Rhys Gould Published: 2023-12-14Area: Mechanistic Interp.Citations: 69 Tags: ai-safety, empirical, mechanistic-interp | 2023-12-14 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (97%) | 69 |
| The Earth is Flat because...: Investigating LLMs' Belief towards Misinformation via Persuasive Conversation Brian S. Lin, Han Qiu, Rongwu Xu, Shujian Yang Published: 2023-12-14Area: Deception & FailureCitations: 101 Tags: ai-safety, deception-failure, empirical | 2023-12-14 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 101 |
| Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision Adrien Ecoffet, Bowen Baker, Collin Burns, Ilya Sutskever Published: 2023-12-14Area: Scalable OversightCitations: 409 Tags: ai-safety, empirical, scalable-oversight | 2023-12-14 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 409 |
| Challenges with Unsupervised LLM Knowledge Discovery Johannes Gasteiger, Rohin Shah, Sebastian Farquhar, Vikrant Varma Published: 2023-12-15Area: Representation AnalysisCitations: 35 Tags: ai-safety, empirical, representation-analysis | 2023-12-15 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (98%) | 35 |
| A Mutation-Based Method for Multi-Modal Jailbreaking Attack Detection Cen Zhang, Chao Shen, Tianlin Li, Xiaofei Xie Published: 2023-12-17Area: Adversarial RobustnessCitations: 44 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 44 |
| Evaluating Language-Model Agents on Realistic Autonomous Tasks Aaron Ho, Brian Goodrich, Elizabeth Barnes, Haoxing Du Published: 2023-12-18Area: Safety EvaluationCitations: 101 Tags: ai-safety, benchmark, safety-evaluation | 2023-12-18 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 101 |
| Bypassing the Safety Training of Open-Source LLMs with Priming Attacks Changming Xu, Gagandeep Singh, Isha Chaudhary, Jason Vega Published: 2023-12-19Area: Adversarial RobustnessCitations: 43 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 43 |
| Learning and Forgetting Unsafe Examples in Large Language Models David Madras, James Zou, Jiachen Zhao, Mengye Ren Published: 2023-12-20Area: Alignment TrainingCitations: 25 Tags: ai-safety, alignment-training, empirical | 2023-12-20 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 25 |
| Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models Bin Zhu, Emre Kiciman, Fangzhao Wu, Guangzhong Sun Published: 2023-12-21Area: Adversarial RobustnessCitations: 172 Tags: adversarial-robustness, ai-safety, benchmark | 2023-12-21 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | 172 |
| Exploiting Novel GPT-4 APIs Adam Gleave, Euan McLean, Kellin Pelrine, Micha艂 Zaj膮c Published: 2023-12-21Area: Adversarial RobustnessCitations: 28 Tags: adversarial-robustness, ai-safety, empirical | 2023-12-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 28 |
| Hazards from Increasingly Accessible Fine-Tuning of Downloadable Foundation Models Alan Chan, Ben Bucknall, David Krueger, Herbie Bradley Published: 2023-12-22Area: Safety EvaluationCitations: 7 Tags: ai-safety, position, safety-evaluation | 2023-12-22 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (93%) | 7 |
| Observable Propagation: Uncovering Feature Vectors in Transformers Arman Cohan, Jacob Dunefsky Published: 2023-12-26Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2023-12-26 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 2 |