Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Aligning Large Language Models with Representation Editing: A Control Perspective Chao Zhang, Haorui Wang, Kai Wang, Lingkai Kong Published: 2024-06-10Area: Model EditingCitations: 49 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-10 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 49 |
| A Survey of Recent Backdoor Attacks and Defenses in Large Language Models Fengjun Pan, Jie Fu, Leilei Gan, Luu Anh Tuan Published: 2024-06-10Area: Adversarial RobustnessCitations: 32 Tags: adversarial-robustness, ai-safety, survey | 2024-06-10 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E5 / R3 (96%) | 32 |
| Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language Models Chen Wu, Jiaqi Wang, Renze Lou, Xi Li Published: 2024-06-10Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 21 |
| Language Models Resist Alignment Boyuan Chen, Changye Li, Hantao Lou, Jiaming Ji Published: 2024-06-10Area: Alignment TrainingCitations: 20 Tags: ai-safety, alignment-training, empirical | 2024-06-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 20 |
| Safety Alignment Should Be Made More Than Just a Few Tokens Deep Ahmad Beirami, Ashwinee Panda, Kaifeng Lyu, Peter Henderson Published: 2024-06-10Area: Adversarial RobustnessCitations: 315 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 315 |
| The Curse of Popularity: Popular Entities have Catastrophic Side Effects when Deleting Knowledge from Language Models Benjamin Heinzerling, Go Kamoda, Keisuke Sakaguchi, Kentaro Inui Published: 2024-06-10Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2024-06-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| AI Sandbagging: Language Models can Strategically Underperform on Evaluations Felix Hofst脙陇tter, Francis Rhys Ward, Oliver Jaffe, Samuel F. Brown Published: 2024-06-11Area: Deception & FailureCitations: 70 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2024-06-11 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | 70 |
| Dataset and Lessons Learned from the 2024 SaTML LLM Capture-the-Flag Competition Ahmed Salem, Chenhao Li, Daniel Paleka, Dragos Albastroiu Published: 2024-06-12Area: Adversarial RobustnessCitations: 19 Tags: adversarial-robustness, ai-safety, dataset | 2024-06-12 | Adversarial Robustness | adversarial-robustness, ai-safety, dataset | E5 / R3 (97%) | 19 |
| Legend: Leveraging Representation Engineering to Annotate Safety Margin for Preference Datasets Bowen Qin, Chen Huang, Duanyu Feng, Wenqiang Lei Published: 2024-06-12Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2024-06-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 5 |
| Security of AI Agents Ethan Wang, Hao Chen, Yifeng He, Yuyang Rong Published: 2024-06-12Area: Agent SafetyCitations: 21 Tags: agent-safety, ai-safety, empirical | 2024-06-12 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (94%) | 21 |
| Unique Security and Privacy Threats of Large Language Models: A Comprehensive Survey Bo Liu, Dayong Ye, Ming Ding, Philip S. Yu Published: 2024-06-12Area: Surveys & ReviewsCitations: 20 Tags: ai-safety, survey, surveys-reviews | 2024-06-12 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E7 / R3 (97%) | 20 |
| Are we making progress in unlearning? Findings from the first NeurIPS unlearning competition Eleni Triantafillou, Fabian Pedregosa, Gintare Karolina Dziugaite, Ioannis Mitliagkas Published: 2024-06-13Area: Alignment TrainingCitations: 44 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2024-06-13 | Alignment Training | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (94%) | 44 |
| Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs Fan Liu, Hao Liu, Zhao Xu Published: 2024-06-13Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, benchmark | 2024-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E7 / R3 (98%) | 34 |
| GuardAgent: Safeguard LLM Agents by a Guard Agent via Knowledge-Enabled Reasoning Bo Li, Carl Yang, Chulin Xie, Dawn Song Published: 2024-06-13Area: Agent SafetyCitations: 69 Tags: agent-safety, ai-safety, empirical | 2024-06-13 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R4 (97%) | 69 |
| JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models Anyu Wang, Delong Ran, Jingyi Zheng, Jinyuan Liu Published: 2024-06-13Area: Safety EvaluationCitations: 27 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2024-06-13 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R3 (94%) | 27 |
| REVS: Unlearning Sensitive Information in Language Models via Rank Editing in the Vocabulary Space Martin Tutek, Tomer Ashuach, Yonatan Belinkov Published: 2024-06-13Area: Model EditingCitations: 12 Tags: ai-safety, empirical, model-editing | 2024-06-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 12 |
| RL-JACK: Reinforcement Learning-powered Black-box Jailbreaking Attack against LLMs Lu Yan, Wenbo Guo, Xiangyu Zhang, Xuan Chen Published: 2024-06-13Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 20 |
| Talking Heads: Understanding Inter-layer Communication in Transformer Language Models Carsten Eickhoff, Ellie Pavlick, Jack Merullo Published: 2024-06-13Area: Mechanistic Interp.Citations: 36 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-13 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 36 |
| Towards Effective Evaluations and Comparisons for LLM Unlearning Methods Bo Han, Jianing Zhu, Masashi Sugiyama, Puning Yang Published: 2024-06-13Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2024-06-13 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 24 |
| Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models Frauke Kreuter, Nina Rimsky, Sarah Ball Published: 2024-06-13Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (92%) | 30 |
| When LLM Meets DRL: Advancing Jailbreaking Efficiency via DRL-guided Search Wenbo Guo, Xiangyu Zhang, Xuan Chen, Yuzhou Nie Published: 2024-06-13Area: Adversarial RobustnessCitations: 47 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 47 |
| Be like a Goldfish, Don't Memorize! Mitigating Memorization in Generative LLMs Abhimanyu Hans, Abhinav Bhatele, Gowthami Somepalli, Hamid Kazemi Published: 2024-06-14Area: Model EditingCitations: 54 Tags: ai-safety, empirical, model-editing | 2024-06-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 54 |
| Sycophancy to Subterfuge: Investigating Reward Tampering in Language Models Alex Tamkin, Buck Shlegeris, Carson Denison, David Duvenaud Published: 2024-06-14Area: Deception & FailureCitations: 86 Tags: ai-safety, deception-failure, empirical | 2024-06-14 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (97%) | 86 |
| On the Hardness of Faithful Chain-of-Thought Reasoning in Large Language Models Chirag Agarwal, Dan Ley, Himabindu Lakkaraju, Sree Harsha Tanneru Published: 2024-06-15Area: Deception & FailureCitations: 20 Tags: ai-safety, deception-failure, empirical | 2024-06-15 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (93%) | 20 |
| Avoiding Copyright Infringement via Large Language Model Unlearning Eric Wong, Guangyao Dou, Kaize Ding, Qing Lyu Published: 2024-06-16Area: Model EditingCitations: 20 Tags: ai-safety, empirical, model-editing | 2024-06-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 20 |
| Data Shapley in One Training Run Dawn Song, Jiachen T. Wang, Prateek Mittal, Ruoxi Jia Published: 2024-06-16Area: Training DynamicsCitations: 48 Tags: ai-safety, theoretical, training-dynamics | 2024-06-16 | Training Dynamics | ai-safety, theoretical, training-dynamics | E5 / R3 (95%) | 48 |
| garak: A Framework for Security Probing Large Language Models Erick Galinkin, Jeffrey Martin, Leon Derczynski, Nanna Inie Published: 2024-06-16Area: Safety EvaluationCitations: 38 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2024-06-16 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R4 (96%) | 38 |
| RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models Chenhao Wang, Hongbang Yuan, Jiachun Li, Jun Zhao Published: 2024-06-16Area: Model EditingCitations: 57 Tags: adversarial-robustness, ai-safety, benchmark, model-editing | 2024-06-16 | Model Editing | adversarial-robustness, ai-safety, benchmark, model-editing | E5 / R3 (95%) | 57 |
| Towards Understanding Jailbreak Attacks in LLMs: A Representation Space Analysis Han Xu, Hui Liu, Jiliang Tang, Makoto Yamada Published: 2024-06-16Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (94%) | 49 |
| A Survey on Human Preference Learning for Large Language Models Juntao Li, Kehai Chen, Liqiang Nie, Min Zhang Published: 2024-06-17Area: Surveys & ReviewsCitations: 16 Tags: ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | 2024-06-17 | Surveys & Reviews | ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | E5 / R3 (95%) | 16 |