Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Revisiting Who's Harry Potter: Towards Targeted Unlearning from a Causal Intervention Perspective Shiyu Chang, Tommi Jaakkola, Yang Zhang, Yujian Liu Published: 2024-07-24Area: Model EditingCitations: 28 Tags: ai-safety, empirical, model-editing | 2024-07-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 28 |
| Exploring Scaling Trends in LLM Robustness Adam Gleave, Ian McKenzie, Michal Zajac, Nikolaus Howe Published: 2024-07-25Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 11 |
| Learn while Unlearn: An Iterative Unlearning Framework for Generative Language Models Enhong Chen, Haoyu Tang, Kai Zhang, Qi Liu Published: 2024-07-25Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2024-07-25 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 7 |
| Cluster-Norm for Unsupervised Probing of Knowledge Gr茅goire Dhimo茂la, Kaarel H盲nni, Owen Ho Wan Yeung, Sharan Maiya Published: 2024-07-26Area: Representation AnalysisCitations: 5 Tags: ai-safety, empirical, representation-analysis | 2024-07-26 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 5 |
| Detecting and Understanding Vulnerabilities in Language Models via Mechanistic Interpretability Alejandro Mat茅, Jorge Garc铆a-Carrasco, Juan Trujillo Published: 2024-07-29Area: Mechanistic Interp.Citations: 6 Tags: adversarial-robustness, ai-safety, empirical, interpretability, mechanistic-interp | 2024-07-29 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 6 |
| Editing LLMs Can Stealthily Subvert Safety Baixiang Huang, Canyu Chen, Chaowei Xiao, Dawn Song Published: 2024-07-29Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing | 2024-07-29 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (95%) | 24 |
| Breaking Agents: Compromising Autonomous LLM Agents Through Malfunction Amplification Ahmed Salem, Boyang Zhang, Michael Backes, Savvas Zannettou Published: 2024-07-30Area: Agent SafetyCitations: 65 Tags: agent-safety, ai-safety, empirical | 2024-07-30 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R3 (93%) | 65 |
| Cross-modality Information Check for Detecting Jailbreaking in Multimodal Large Language Models Wenjie Wang, Xiuyuan Qi, Yue Xu, Zhan Qin Published: 2024-07-31Area: Multimodal SafetyCitations: 10 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-07-31 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 10 |
| Measuring Progress in Dictionary Learning for Language Model Interpretability with Board Game Models Adam Karvonen, Benjamin Wright, Can Rager, Claudio Mayrink Verdun Published: 2024-07-31Area: Mechanistic Interp.Citations: 49 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-07-31 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 49 |
| Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-to-Image Generation Models Ning Yu, Shanqing Guo, Xiangtao Meng, Yingkai Dong Published: 2024-08-01Area: Adversarial RobustnessCitations: 21 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (98%) | 21 |
| Tamper-Resistant Safeguards for Open-Weight LLMs Alice Gatti, Andy Zhou, Andy Zou, Bhrugu Bharathi Published: 2024-08-01Area: Adversarial RobustnessCitations: 114 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 114 |
| Caution for the Environment: Multimodal Agents are Susceptible to Environmental Distractions Aston Zhang, Hai Zhao, Tongxin Yuan, Xinbei Ma Published: 2024-08-05Area: Agent SafetyCitations: 47 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2024-08-05 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E6 / R3 (95%) | 47 |
| Operationalizing Contextual Integrity in Privacy-Conscious Assistants Aneesh Pappu, Borja Balle, Chongyang Shi, Eugene Bagdasaryan Published: 2024-08-05Area: Agent SafetyCitations: 28 Tags: agent-safety, ai-safety, empirical | 2024-08-05 | Agent Safety | agent-safety, ai-safety, empirical | E4 / R3 (95%) | 28 |
| Why Are My Prompts Leaked? Unraveling Prompt Extraction Threats in Customized Large Language Models Haibo Hu, Haoyang Li, Qingqing Ye, Yaxin Xiao Published: 2024-08-05Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 17 |
| EnJa: Ensemble Jailbreak on Large Language Models Jiahao Zhang, Ruofan Wang, Xingjun Ma, Yu-Gang Jiang Published: 2024-08-07Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | 4 |
| Multi-Turn Context Jailbreak Attack on Large Language Models From First Principles Deyue Zhang, Dongdong Yang, Hui Li, Quanchen Zou Published: 2024-08-08Area: Adversarial RobustnessCitations: 50 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-08-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 50 |
| A Jailbroken GenAI Model Can Cause Substantial Harm: GenAI-powered Applications are Vulnerable to PromptWares Ben Nassi, Ron Bitton, Stav Cohen Published: 2024-08-09Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 11 |
| ConfusedPilot: Confused Deputy Risks in RAG-based LLMs Ayush RoyChowdhury, Mohit Tiwari, Mulong Luo, Prateek Sahu Published: 2024-08-09Area: Adversarial RobustnessCitations: 16 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 16 |
| Get Confused Cautiously: Textual Sequence Memorization Erasure with Selective Entropy Maximization Ioannis Patras, Zhaohan Zhang, Ziquan Liu Published: 2024-08-09Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing | 2024-08-09 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (93%) | 8 |
| Kov: Transferable and Naturalistic Black-Box LLM Attacks using Markov Decision Processes and Tree Search Robert J. Moss Published: 2024-08-11Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 2 |
| On Effects of Steering Latent Representation for Large Language Model Unlearning Dang Huu-Tien, Hoang Thanh-Tung, Naoya Inoue, Trung-Tin Pham Published: 2024-08-12Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2024-08-12 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | - |
| Towards Robust and Parameter-Efficient Knowledge Unlearning for LLMs Dasol Hwang, Moontae Lee, Sungjun Cho, Sungmin Cha Published: 2024-08-13Area: Model EditingCitations: 23 Tags: ai-safety, empirical, model-editing | 2024-08-13 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (97%) | 23 |
| Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inference Andr茅 Freitas, Geonhee Kim, Marco Valentino Published: 2024-08-16Area: Mechanistic Interp.Citations: 13 Tags: ai-safety, empirical, mechanistic-interp | 2024-08-16 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (92%) | 13 |
| Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning Gautam Bhattacharya, Josh Kimball, Ling Liu, Pratik Joshi Published: 2024-08-18Area: Adversarial RobustnessCitations: 55 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-08-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 55 |
| DiffZOO: A Purely Query-Based Black-Box Attack for Red-teaming Text-to-Image Generative Model via Zeroth Order Optimization Dong Li, Kaidi Xu, Pucheng Dang, Qi Guo Published: 2024-08-18Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 15 |
| Ferret: Faster and Effective Automated Red Teaming with Reward-Based Scoring Technique Rishabh Bhardwaj, Soujanya Poria, Tej Deep Pala, Vernon Y.H. Toh Published: 2024-08-20Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-08-20 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E6 / R4 (95%) | 6 |
| MEGen: Generative Backdoor into Large Language Models via Model Editing Hai Zhao, Jiyang Qiu, Qianren Wang, Xinbei Ma Published: 2024-08-20Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (99%) | 7 |
| Perception-guided Jailbreak against Text-to-Image Models Geguang Pu, Le Liang, Run Wang, Tianlin Li Published: 2024-08-20Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, empirical | 2024-08-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (99%) | 27 |
| Recurrent Neural Networks Learn to Store and Generate Sequences using Non-Linear Representations Atticus Geiger, Christopher D. Manning, Christopher Potts, R贸bert Csord谩s Published: 2024-08-20Area: Representation AnalysisCitations: 36 Tags: ai-safety, empirical, representation-analysis | 2024-08-20 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (94%) | 36 |
| Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models Hongbang Yuan, Jun Zhao, Kang Liu, Pengfei Cao Published: 2024-08-20Area: Model EditingCitations: 25 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-08-20 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E6 / R4 (92%) | 25 |