Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Alternate Preference Optimization for Unlearning Factual Knowledge in Large Language Models Abhishek Lalwani, Anmol Mekala, David Koleczek, Elita Lobo Published: 2024-09-20Area: Model EditingCitations: 21 Tags: ai-safety, empirical, model-editing | 2024-09-20 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 21 |
| RRM: Robust Reward Model Training Mitigates Reward Hacking Abe Ittycheriah, Anastasiia Makarova, Aviral Kumar, Bilal Piot Published: 2024-09-20Area: Alignment TrainingCitations: 53 Tags: ai-safety, alignment-training, empirical | 2024-09-20 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 53 |
| A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders David Chanin, Hardik Bhatnagar, James Wilken-Smith, Joseph Bloom Published: 2024-09-22Area: Mechanistic Interp.Citations: 83 Tags: ai-safety, empirical, mechanistic-interp | 2024-09-22 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 83 |
| Backtracking Improves Generation Safety Daniel M. Bikel, Eric Michael Smith, Hailey Nguyen, Jason Weston Published: 2024-09-22Area: Adversarial RobustnessCitations: 25 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (97%) | 25 |
| Effective and Evasive Fuzz Testing-Driven Jailbreaking Attacks against LLMs Chen Chen, Fengyuan Ran, Kwok-Yan Lam, Mingzhe Li Published: 2024-09-23Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 14 |
| Analyzing Probabilistic Methods for Evaluating Agent Capabilities Arjun Panickssery, Axel H酶jmark, Govind Pimpale, J茅r茅my Scheurer Published: 2024-09-24Area: Safety EvaluationCitations: 4 Tags: ai-safety, empirical, safety-evaluation | 2024-09-24 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R4 (93%) | 4 |
| Holistic Automated Red Teaming for Large Language Models through Top-Down Test Case Generation and Multi-turn Interaction Jinchuan Zhang, Songlin Hu, Yan Zhou, Yaxin Liu Published: 2024-09-25Area: Safety EvaluationCitations: 22 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-09-25 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (94%) | 22 |
| Training Language Models to Win Debates with Self-Play Improves Judge Accuracy David Rein, Julian Michael, Samuel Arnesen Published: 2024-09-25Area: Scalable OversightCitations: 10 Tags: adversarial-robustness, ai-safety, empirical, scalable-oversight | 2024-09-25 | Scalable Oversight | adversarial-robustness, ai-safety, empirical, scalable-oversight | E6 / R3 (93%) | 10 |
| An Adversarial Perspective on Machine Unlearning for AI Safety Boyi Wei, Florian Tram猫r, Jakub 艁ucki, Javier Rando Published: 2024-09-26Area: Adversarial RobustnessCitations: 90 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 90 |
| Elephant in the Room: Unveiling the Impact of Reward Model Quality in Alignment Daoguang Zan, Jingwei Yi, Jing Yao, Tsung-Yi Ho Published: 2024-09-26Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2024-09-26 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (97%) | 3 |
| HaloScope: Harnessing Unlabeled LLM Generations for Hallucination Detection Chaowei Xiao, Xuefeng Du, Yixuan Li Published: 2024-09-26Area: Safety EvaluationCitations: 76 Tags: ai-safety, empirical, safety-evaluation | 2024-09-26 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (95%) | 76 |
| RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking Jay Pujara, Kashif Munir, Kriti Aggarwal, Subhabrata Mukherjee Published: 2024-09-26Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | - |
| "Why" Has the Least Side Effect on Model Editing Chung-Chi Chen, Hen-Hsen Huang, Hsin-Hsi Chen, Tsung-Hsuan Pan Published: 2024-09-27Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2024-09-27 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (95%) | 1 |
| Robust LLM Safeguarding via Refusal Feature Adversarial Training Karen Hambardzumyan, Lei Yu, Nicola Cancedda, Virginie Do Published: 2024-09-30Area: Adversarial RobustnessCitations: 47 Tags: adversarial-robustness, ai-safety, empirical | 2024-09-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 47 |
| Sparse Attention Decomposition Applied to Circuit Tracing Gabriel Franco, Mark Crovella Published: 2024-10-01Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-01 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (97%) | 3 |
| VLMGuard: Defending VLMs against Malicious Prompts via Unlabeled Data Ahmed Salem, Emily Lawton, Jack W. Stokes, Reshmi Ghosh Published: 2024-10-01Area: Multimodal SafetyCitations: 16 Tags: ai-safety, empirical, multimodal-safety | 2024-10-01 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E4 / R3 (95%) | 16 |
| Automated Red Teaming with GOAT: the Generative Offensive Agent Tester Aaron Grattafiori, Cristian Canton Ferrer, Erik Brinkman, Hailey Nguyen Published: 2024-10-02Area: Safety EvaluationCitations: 32 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-10-02 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (98%) | 32 |
| Endless Jailbreaks with Bijection Learning Brian R.Y. Huang, Leonard Tang, Maximilian Li Published: 2024-10-02Area: Adversarial RobustnessCitations: 16 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | 16 |
| FlipAttack: Jailbreak LLMs via Flipping Bryan Hooi, Jinlan Fu, Miao Xiong, Shumin Deng Published: 2024-10-02Area: Adversarial RobustnessCitations: 47 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 47 |
| HarmAug: Effective Data Augmentation for Knowledge Distillation of Safety Guard Models Dominik Wagner, Dong Bok Lee, Haebin Seong, Juho Lee Published: 2024-10-02Area: Adversarial RobustnessCitations: 16 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 16 |
| Hidden in Plain Text: Emergence & Mitigation of Steganographic Collusion in LLMs Christian Schroeder de Witt, Dylan Cope, Joan Velja, Nandi Schoots Published: 2024-10-02Area: Deception & FailureCitations: 27 Tags: ai-safety, deception-failure, empirical | 2024-10-02 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (95%) | 27 |
| Inspection and Control of Self-Generated-Text Recognition Ability in Llama3-8b-Instruct Christopher Ackerman, Nina Panickssery Published: 2024-10-02Area: Representation AnalysisCitations: 6 Tags: ai-safety, empirical, representation-analysis | 2024-10-02 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 6 |
| Towards Inference-time Category-wise Safety Steering for Large Language Models Amrita Bhattacharjee, Christopher Parisien, Shaona Ghosh, Traian Rebedea Published: 2024-10-02Area: Model EditingCitations: 15 Tags: ai-safety, empirical, model-editing | 2024-10-02 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 15 |
| AlphaEdit: Null-Space Constrained Knowledge Editing for Language Models Houcheng Jiang, Jie Shi, Junfeng Fang, Kun Wang Published: 2024-10-03Area: Model EditingCitations: 157 Tags: ai-safety, empirical, model-editing | 2024-10-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R2 (97%) | 157 |
| AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs Bo Li, Chaowei Xiao, Edward Suh, Huan Sun Published: 2024-10-03Area: Adversarial RobustnessCitations: 120 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 120 |
| Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient Daniel Murfet, George Wang, Jesse Hoogland, Stan van Wingerden Published: 2024-10-03Area: Training DynamicsCitations: 24 Tags: ai-safety, empirical, training-dynamics | 2024-10-03 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (93%) | 24 |
| Erasing Conceptual Knowledge from Language Models David Bau, Rohit Gandikota, Samuel Marks, Sheridan Feucht Published: 2024-10-03Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing | 2024-10-03 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 24 |
| HiddenGuard: Fine-Grained Safe Generation with Specialized Representation Router Baolong Bi, Lingrui Mei, Ruibin Yuan, Shenghua Liu Published: 2024-10-03Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 10 |
| Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations Anish Kachinthaya, Nick Jiang, Suzie Petryk, Yossi Gandelsman Published: 2024-10-03Area: Multimodal SafetyCitations: 69 Tags: ai-safety, empirical, multimodal-safety | 2024-10-03 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 69 |
| Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models Dongcheng Zhao, Guobin Shen, Xiang He, Yiting Dong Published: 2024-10-03Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 13 |