Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Rethinking harmless refusals when fine-tuning foundation models Diogo Schwerz de Lucena, Florin Pop, Judd Rosenblatt, Michael Vaiana Published: 2024-06-27Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2024-06-27 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 1 |
| The Remarkable Robustness of LLMs: Stages of Inference? Max Tegmark, Vedang Lad, Wes Gurnee Published: 2024-06-27Area: Mechanistic Interp.Citations: 98 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-27 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E7 / R4 (94%) | 98 |
| Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation Alexander Wei, Danny Halawi, Eric Wallace, Jacob Steinhardt Published: 2024-06-28Area: Adversarial RobustnessCitations: 68 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 68 |
| LLM Critics Help Catch LLM Bugs Evgenia Nitishinskaya, Jan Leike, Juan Felipe Ceron Uribe, Maja Trebacz Published: 2024-06-28Area: Scalable OversightCitations: 131 Tags: ai-safety, empirical, scalable-oversight | 2024-06-28 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 131 |
| Virtual Context: Enhancing Jailbreak Attacks with Special Token Injection Hanchi Sun, Lichao Sun, Lin Lu, Pan Zhou Published: 2024-06-28Area: Adversarial RobustnessCitations: 23 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 23 |
| Towards shutdownable agents via stochastic choice Alexander Roman, Christos Ziakas, Elliott Thornley, Leyton Ho Published: 2024-06-30Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, empirical | 2024-06-30 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Badllama 3: removing safety finetuning from Llama 3 in minutes Dmitrii Volkov Published: 2024-07-01Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 6 |
| Enhancing the Capability and Robustness of Large Language Models through Reinforcement Learning-Driven Query Refinement Cenyuan Zhang, Feiran Zhang, Xiaohua Wang, Xiaoqing Zheng Published: 2024-07-01Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks Barbara Di Eugenio, Henry Peng Zou, Yang Zhang, Yue Zhou Published: 2024-07-01Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 13 |
| Purple-teaming LLMs with Adversarial Defender Training Helen Meng, Jiawen Kang, Jingyan Zhou, Junan Li Published: 2024-07-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models Md Montasir Bin Shams, Shaeke Salman, Xiuwen Liu Published: 2024-07-01Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-07-01 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (94%) | 2 |
| SeqAR: Jailbreak LLMs with Sequential Auto-Generated Characters Guanhua Chen, Hailiang Huang, Hongru Wang, Xin Lu Published: 2024-07-02Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 6 |
| Towards More Realistic Extraction Attacks: An Adversarial Perspective Golnoosh Farnadi, Prakhar Ganesh, Yash More Published: 2024-07-02Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 9 |
| From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks Chujie Zheng, Hongning Wang, Junxiao Yang, Minlie Huang Published: 2024-07-03Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 14 |
| Truth is Universal: Robust Detection of Lies in LLMs Boaz Nadler, Fred A. Hamprecht, Lennart B眉rger Published: 2024-07-03Area: Representation AnalysisCitations: 59 Tags: ai-safety, empirical, representation-analysis | 2024-07-03 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (97%) | 59 |
| Automated Progressive Red Teaming Bojian Jiang, Deyi Xiong, Qing Yang, Tianhao Shen Published: 2024-07-04Area: Safety EvaluationCitations: 11 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-07-04 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E8 / R5 (96%) | 11 |
| Functional Faithfulness in the Wild: Circuit Discovery with Differentiable Computation Graph Pruning Gerald Penn, Jingcheng Niu, Lei Yu, Zining Zhu Published: 2024-07-04Area: Mechanistic Interp.Citations: 8 Tags: ai-safety, empirical, mechanistic-interp | 2024-07-04 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (95%) | 8 |
| Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs Arjun Panickssery, Asa Cooper Stickland, Sam Bowman, Sara Price Published: 2024-07-04Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2024-07-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 12 |
| On Scalable Oversight with Weak LLMs Judging Strong LLMs David Lindner, Jannis Bulian, J谩nos Kram谩r, Jonah Brown-Cohen Published: 2024-07-05Area: Scalable OversightCitations: 66 Tags: ai-safety, empirical, scalable-oversight | 2024-07-05 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R3 (95%) | 66 |
| Spontaneous Reward Hacking in Iterative Self-Refinement He He, Jane Pan, Samuel R. Bowman, Shi Feng Published: 2024-07-05Area: Deception & FailureCitations: 18 Tags: ai-safety, deception-failure, empirical | 2024-07-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 18 |
| Composable Interventions for Language Models Anurag Vaidya, Arinbj枚rn Kolbeinsson, Faisal Mahmood, Jonathan Richard Schwarz Published: 2024-07-09Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-07-09 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 5 |
| Flooding Spread of Manipulated Knowledge in LLM-Based Multi-Agent Communities Gongshen Liu, Haodong Zhao, Jian Xie, Lifeng Liu Published: 2024-07-10Area: Agent SafetyCitations: 63 Tags: agent-safety, ai-safety, empirical | 2024-07-10 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R3 (94%) | 63 |
| Multilingual Blending: LLM Safety Alignment Evaluation with Language Mixture Jiayang Song, Lei Ma, Yuheng Huang, Zhehua Zhou Published: 2024-07-10Area: Adversarial RobustnessCitations: 19 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2024-07-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 19 |
| Model Surgery: Modulating LLM's Behavior Via Simple Parameter Editing Andrew Zhao, Gao Huang, Huanqian Wang, Jingxin Shi Published: 2024-07-11Area: Model EditingCitations: 18 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-07-11 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 18 |
| On the (In)Security of LLM App Stores Haoyu Wang, Xinyi Hou, Yanjie Zhao Published: 2024-07-11Area: Safety EvaluationCitations: 21 Tags: ai-safety, empirical, safety-evaluation | 2024-07-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 21 |
| On the Universal Truthfulness Hyperplane Inside LLMs Junteng Liu, Junxian He, Shiqi Chen, Yu Cheng Published: 2024-07-11Area: Representation AnalysisCitations: 16 Tags: ai-safety, empirical, representation-analysis | 2024-07-11 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (93%) | 16 |
| Transformer Circuit Faithfulness Metrics are not Robust Bilal Chughtai, Joseph Miller, William Saunders Published: 2024-07-11Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-07-11 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (95%) | 10 |
| ASTPrompter: Weakly Supervised Automated Language Model Red-Teaming to Identify Likely Toxic Prompts Amelia F. Hardy, Bernard Lange, Houjun Liu, Mykel J. Kochenderfer Published: 2024-07-12Area: Safety EvaluationCitations: 2 Tags: ai-safety, empirical, safety-evaluation | 2024-07-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R3 (97%) | 2 |
| Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training Jen-tse Huang, Jiahao Xu, Pinjia He, Tian Liang Published: 2024-07-12Area: Adversarial RobustnessCitations: 57 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 57 |
| Refusing Safe Prompts for Multi-modal Large Language Models Hongbin Liu, Neil Zhenqiang Gong, Yuepeng Hu, Zedian Shao Published: 2024-07-12Area: Multimodal SafetyCitations: 5 Tags: ai-safety, empirical, multimodal-safety | 2024-07-12 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E7 / R3 (94%) | 5 |