Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Safe Text-to-Image Generation: Simply Sanitize the Prompt Embedding Guanxu Chen, Huming Qiu, Min Yang, Mi Zhang Published: 2024-11-15Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 4 |
| JailbreakLens: Interpreting Jailbreak Mechanism in the Lens of Representation and Circuit Chun Chen, Huiyu Xu, Kui Ren, Rui Zheng Published: 2024-11-17Area: Mechanistic Interp.Citations: 16 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-11-17 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E6 / R3 (93%) | 16 |
| CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization Jun Sun, Long H. Pham, Nay Myat Min, Yige Li Published: 2024-11-18Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 15 |
| Does Unlearning Truly Unlearn? A Black Box Evaluation of LLM Unlearning Methods Asa Cooper Stickland, Jai Doshi Published: 2024-11-18Area: Safety EvaluationCitations: 20 Tags: ai-safety, empirical, safety-evaluation | 2024-11-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | 20 |
| Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment Bo Zheng, Chongjun Wang, Qiushi Cui, Xiangyu Yue Published: 2024-11-18Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-11-18 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| Steering Language Model Refusal with Sparse Autoencoders David Majercak, Dean Carignan, Eric Horvitz, Forough Poursabzi-Sangdeh Published: 2024-11-18Area: Model EditingCitations: 49 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-11-18 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 49 |
| The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models Jizhong Han, Songlin Hu, Xikang Yang, Xuehai Tang Published: 2024-11-18Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 5 |
| ProSec: Fortifying Code LLMs with Proactive Security Alignment Jinyao Guo, Kaiyuan Zhang, Xiangyu Zhang, Xiangzhe Xu Published: 2024-11-19Area: Alignment TrainingCitations: 13 Tags: ai-safety, alignment-training, empirical | 2024-11-19 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 13 |
| When Backdoors Speak: Understanding LLM Backdoor Attacks Through Model-Generated Explanations Huaizhi Ge, Qifan Wang, Ruixiang Tang, Yiming Li Published: 2024-11-19Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 11 |
| A Flexible Large Language Models Guardrail Development Methodology Applied to Off-Topic Prompt Detection Chan Shing Yee, Gabriel Chua, Shaun Khoo Published: 2024-11-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (98%) | 1 |
| Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models Javier Ferrando, Neel Nanda, Oscar Obeso, Senthooran Rajamanoharan Published: 2024-11-21Area: Mechanistic Interp.Citations: 88 Tags: ai-safety, empirical, mechanistic-interp | 2024-11-21 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 88 |
| GASP: Efficient Black-Box Generation of Adversarial Suffixes for Jailbreaking LLMs Advik Raj Basani, Xiao Zhang Published: 2024-11-21Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 12 |
| Devils in Middle Layers of Large Vision-Language Models: Interpreting, Detecting and Mitigating Object Hallucinations via Attention Lens Beier Zhu, Junkai Chen, Tingjin Luo, Xu Yang Published: 2024-11-23Area: Multimodal SafetyCitations: 65 Tags: ai-safety, empirical, multimodal-safety | 2024-11-23 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 65 |
| "Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks Libo Wang Published: 2024-11-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-11-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R2 (96%) | - |
| Steering Away from Harm: An Adaptive Approach to Defending Vision Language Model Against Jailbreaks Gang Wang, Han Wang, Huan Zhang Published: 2024-11-23Area: Multimodal SafetyCitations: 25 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-23 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 25 |
| Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks Hao Chen, Jianda Mao, Kani Chen, Peng Xie Published: 2024-11-24Area: Multimodal SafetyCitations: 14 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-24 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 14 |
| Do Large Language Models Perform Latent Multi-Hop Reasoning without Exploiting Shortcuts? Elena Gribovskaya, Mor Geva, Nora Kassner, Sebastian Riedel Published: 2024-11-25Area: Safety EvaluationCitations: 23 Tags: ai-safety, empirical, safety-evaluation | 2024-11-25 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (93%) | 23 |
| In-Context Experience Replay Facilitates Safety Red-Teaming of Text-to-Image Diffusion Models Kuan-Chen Mu, Mario Fritz, Pin-Yu Chen, Wei-Chen Chiu Published: 2024-11-25Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-25 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R4 (96%) | 2 |
| Adaptive Deployment of Untrusted LLMs Reduces Distributed Threats Akbir Khan, Ansh Radhakrishnan, Aryan Bhatt, Buck Shlegeris Published: 2024-11-26Area: Scalable OversightCitations: 20 Tags: ai-safety, empirical, scalable-oversight | 2024-11-26 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 20 |
| PEFTGuard: Detecting Backdoor Attacks Against Parameter-Efficient Fine-Tuning Chenhao Lin, Rongmao Chen, Tianshuo Cong, Xingshuo Han Published: 2024-11-26Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 18 |
| Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language Models Bryan Hooi, Jun Liu, Kai-Wei Chang, Shuyang Hao Published: 2024-11-27Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-11-27 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 6 |
| Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment Ahmad Beirami, Alvaro Velasquez, Amrit Singh Bedi, Dinesh Manocha Published: 2024-11-27Area: Multimodal SafetyCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2024-11-27 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 18 |
| Neutralizing Backdoors through Information Conflicts for Large Language Models Chen Chen, Jiaxin Gao, Kwok-Yan Lam, Xueluan Gong Published: 2024-11-27Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| UOE: Unlearning one Expert is Enough for Mixture-of-Experts LLMs Gaowen Liu, Haomin Zhuang, Jinghan Jia, Kehan Guo Published: 2024-11-27Area: Model EditingCitations: 10 Tags: ai-safety, empirical, model-editing | 2024-11-27 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 10 |
| DIESEL - Dynamic Inference-Guidance via Evasion of Semantic Embeddings in LLMs Alon Zolfi, Asaf Shabtai, Ben Ganon, Hisashi Kojima Published: 2024-11-28Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-11-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Jailbreak Large Vision-Language Models Through Multi-Modal Linkage Geyuan Zhang, Tianxing He, Xiaofei Zhou, Yichen Wang Published: 2024-11-30Area: Multimodal SafetyCitations: 37 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2024-11-30 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | 37 |
| Linear Probe Penalties Reduce LLM Sycophancy Henry Papadatos, Rachel Freedman Published: 2024-12-01Area: Deception & FailureCitations: 18 Tags: ai-safety, deception-failure, empirical | 2024-12-01 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (95%) | 18 |
| Noise Injection Reveals Hidden Capabilities of Sandbagging Language Models Cameron Tice, Fedor Ryzhenkov, Felix Hofst盲tter, Jacob Haimes Published: 2024-12-02Area: Deception & FailureCitations: 8 Tags: ai-safety, deception-failure, empirical | 2024-12-02 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 8 |
| Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach Ethan Perez, Fazl Barez, Henry Sleight, Jesse Mu Published: 2024-12-03Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 6 |
| Best-of-N Jailbreaking Aengus Lynch, Erik Jones, Ethan Perez, Fazl Barez Published: 2024-12-04Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 34 |