Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| White-box Multimodal Jailbreaks Against Large Vision-Language Models Chuanjun Ji, Guangnan Ye, Hanxu Zhou, Ruofan Wang Published: 2024-05-28Area: Multimodal SafetyCitations: 47 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-05-28 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 47 |
| Efficient Model-agnostic Alignment via Bayesian Persuasion Boyuan Chen, Fengshuo Bai, Mingzhi Wang, Yaodong Yang Published: 2024-05-29Area: Scalable OversightCitations: 10 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-05-29 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E8 / R4 (93%) | 10 |
| Stress-Testing Capability Elicitation With Password-Locked Models David Krueger, Dmitrii Krasheninnikov, Fabien Roger, Ryan Greenblatt Published: 2024-05-29Area: Safety EvaluationCitations: 26 Tags: ai-safety, empirical, safety-evaluation | 2024-05-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (93%) | 26 |
| Voice Jailbreak Attacks Against GPT-4o Michael Backes, Xinyue Shen, Yang Zhang, Yixin Wu Published: 2024-05-29Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 30 |
| Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks Chen Xiong, Pin-Yu Chen, Tsung-Yi Ho, Xiangyu Qi Published: 2024-05-30Area: Adversarial RobustnessCitations: 36 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 36 |
| Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters Andy Zhou, Haibo Jin, Haohan Wang, Joe D. Menke Published: 2024-05-30Area: Adversarial RobustnessCitations: 43 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 43 |
| Phantom: General Trigger Attacks on Retrieval Augmented Language Generation Alina Oprea, Christopher A. Choquette-Choo, Cristina Nita-Rotaru, Giorgio Severi Published: 2024-05-30Area: Adversarial RobustnessCitations: 45 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 45 |
| Mind the Inconspicuous: Revealing the Hidden Weakness in Aligned LLMs' Refusal Boundaries Han Liu, Haozheng Luo, Jerry Yao-Chieh Hu, Jiahao Yu Published: 2024-05-31Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, empirical | 2024-05-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 24 |
| The Best of Both Worlds: Toward an Honest and Helpful Large Language Model Chujie Gao, Dongping Chen, Lichao Sun, Qihui Zhang Published: 2024-06-01Area: Deception & FailureCitations: 19 Tags: ai-safety, deception-failure, empirical | 2024-06-01 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 19 |
| BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling Cristina G芒rbacea, Lin Gui, Victor Veitch Published: 2024-06-02Area: Alignment TrainingCitations: 102 Tags: ai-safety, alignment-training, empirical | 2024-06-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 102 |
| Evidence of Learned Look-Ahead in a Chess-Playing Neural Network Cameron Allen, Erik Jenner, Scott Emmons, Shreyas Kapur Published: 2024-06-02Area: Mechanistic Interp.Citations: 25 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-02 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 25 |
| Get My Drift? Catching LLM Task Drift with Activation Deltas Ahmed Salem, Aideen Fay, Andrew Paverd, Giovanni Cherubin Published: 2024-06-02Area: Adversarial RobustnessCitations: 38 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 38 |
| Decoupled Alignment for Robust Plug-and-Play Adaptation Han Liu, Haozheng Luo, Jerry Yao-Chieh Hu, Jiahao Yu Published: 2024-06-03Area: Model EditingCitations: 12 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-03 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E4 / R3 (96%) | 12 |
| From Feature Visualization to Visual Circuits: Effect of Adversarial Model Manipulation Eugene Belilovsky, Geraldin Nanfack, Michael Eickenberg Published: 2024-06-03Area: Mechanistic Interp.Citations: 1 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-06-03 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 1 |
| Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses Chao Du, Jing Jiang, Min Lin, Qian Liu Published: 2024-06-03Area: Adversarial RobustnessCitations: 72 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 72 |
| Unelicitable Backdoors in Language Models via Cryptographic Transformer Circuits Andis Draguns, Andrew Gritsevskiy, Charlie Rogers-Smith, Christian Schroeder de Witt Published: 2024-06-03Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, empirical | 2024-06-03 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 5 |
| Dishonesty in Helpful and Harmless Alignment Anthony G. Cohn, Duanyu Feng, Jiancheng Lv, Jingkun Tang Published: 2024-06-04Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2024-06-04 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (92%) | 4 |
| RKLD: Reverse KL-Divergence-based Knowledge Distillation for Unlearning Personal Information in Large Language Models Bichen Wang, Bing Qin, Yanyan Zhao, Yixin Sun Published: 2024-06-04Area: Model EditingCitations: 19 Tags: ai-safety, empirical, model-editing | 2024-06-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 19 |
| Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller Difan Zou, Fan Yin, Min Cai, Shichang Zhang Published: 2024-06-04Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-06-04 | Model Editing | ai-safety, empirical, model-editing | E4 / R4 (96%) | 5 |
| Towards Universal and Black-Box Query-Response Only Attack on LLMs with QROA Hussein Jawad, Nicolas J-B. Brunel Published: 2024-06-04Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 4 |
| Defending Large Language Models Against Attacks With Residual Stream Activation Analysis Amelia Kawasaki, Andrew Davis, Houssam Abbas Published: 2024-06-05Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 4 |
| Improve Mathematical Reasoning in Language Models by Automated Process Supervision Abhinav Rastogi, Harsh Lara, Jiao Sun, Lei Meng Published: 2024-06-05Area: Scalable OversightCitations: 330 Tags: ai-safety, empirical, scalable-oversight | 2024-06-05 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R3 (97%) | 330 |
| Is Free Self-Alignment Possible? Changho Shin, Dyah Adila, Frederic Sala, Yijing Zhang Published: 2024-06-05Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2024-06-05 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R4 (95%) | 3 |
| AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens Hai Yan, Jiawen Shi, Lin Lu, Pan Zhou Published: 2024-06-06Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 13 |
| Improving Alignment and Robustness with Circuit Breakers Andy Zou, Dan Hendrycks, Derek Duenas, Justin Wang Published: 2024-06-06Area: Adversarial RobustnessCitations: 230 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 230 |
| Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt Aishan Liu, Dacheng Tao, Siyuan Liang, Tianyuan Zhang Published: 2024-06-06Area: Multimodal SafetyCitations: 83 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-06-06 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 83 |
| PaCE: Parsimonious Concept Engineering for Large Language Models Aditya Chattopadhyay, Chris Callison-Burch, Darshan Thaker, Jinqi Luo Published: 2024-06-06Area: Model EditingCitations: 16 Tags: ai-safety, empirical, model-editing | 2024-06-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 16 |
| Scaling and Evaluating Sparse Autoencoders Alec Radford, Gabriel Goh, Henk Tillman, Ilya Sutskever Published: 2024-06-06Area: Mechanistic Interp.Citations: 334 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2024-06-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (96%) | 334 |
| The Missing Curve Detectors of InceptionV1: Applying Sparse Autoencoders to InceptionV1 Early Vision Liv Gorton Published: 2024-06-06Area: Mechanistic Interp.Citations: 31 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 31 |
| Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs Fan Liu, Hao Liu, Zhao Xu Published: 2024-06-07Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 30 |