Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| To Err is AI: A Case Study Informing LLM Flaw Reporting Practices Allyson Ettinger, Avijit Ghosh, Christopher Fiorelli, Kavel Rao Published: 2024-10-15Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2024-10-15 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (97%) | 5 |
| Insights from the Inverse: Reconstructing LLM Training Goals Through Inverse Reinforcement Learning Arjun Jagota, Jared Joselowitz, Satyapriya Krishna, Sonali Parbhoo Published: 2024-10-16Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2024-10-16 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 4 |
| Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization Aaquib Syed, Abhay Sheshadri, Aidan Ewart, Gintare Karolina Dziugaite Published: 2024-10-16Area: Model EditingCitations: 19 Tags: ai-safety, empirical, interpretability, model-editing | 2024-10-16 | Model Editing | ai-safety, empirical, interpretability, model-editing | E6 / R3 (96%) | 19 |
| Meta-Unlearning on Diffusion Models: Preventing Relearning Unlearned Concepts Chao Du, Hongcheng Gao, Min Lin, Taihang Hu Published: 2024-10-16Area: Model EditingCitations: 18 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-10-16 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 18 |
| POROver: Improving Safety and Reducing Overrefusal in Large Language Models with Overgeneration and Preference Optimization Alon Benhaim, Batuhan K. Karaman, Ishmam Zabir, Mert R. Sabuncu Published: 2024-10-16Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2024-10-16 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 3 |
| SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation Huaxiu Yao, Jaehong Yoon, Mohit Bansal, Shoubin Yu Published: 2024-10-16Area: Multimodal SafetyCitations: 66 Tags: ai-safety, empirical, multimodal-safety | 2024-10-16 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R4 (94%) | 66 |
| Weak-to-Strong Generalization beyond Accuracy: a Pilot Study in Safety, Toxicity, and Legal Reasoning Bo Hui, Ruimeng Ye, Yang Xiao Published: 2024-10-16Area: Scalable OversightCitations: 5 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-10-16 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E8 / R4 (93%) | 5 |
| Automatically Interpreting Millions of Features in Large Language Models Alex Mallen, Caden Juang, Gon脙搂alo Paulo, Nora Belrose Published: 2024-10-17Area: Mechanistic Interp.Citations: 69 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-17 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | 69 |
| Balancing Label Quantity and Quality for Scalable Elicitation Alex Mallen, Nora Belrose Published: 2024-10-17Area: Scalable OversightCitations: 3 Tags: ai-safety, empirical, scalable-oversight | 2024-10-17 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 3 |
| BiasJailbreak: Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models Haebin Seong, Isack Lee Published: 2024-10-17Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Breaking Chains: Unraveling the Links in Multi-Hop Knowledge Unlearning ChaeHun Park, Dohyun Lee, Jaegul Choo, Minseok Choi Published: 2024-10-17Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2024-10-17 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (96%) | 4 |
| Estimating the Probabilities of Rare Outputs in Language Models Gabriel Wu, Jacob Hilton Published: 2024-10-17Area: Safety EvaluationCitations: 6 Tags: ai-safety, empirical, safety-evaluation | 2024-10-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R5 (96%) | 6 |
| Jailbreaking LLM-Controlled Robots Alexander Robey, George J. Pappas, Hamed Hassani, Vijay Kumar Published: 2024-10-17Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (99%) | 1 |
| Looking Inward: Language Models Can Learn About Themselves by Introspection Ethan Perez, Felix J Binder, Henry Sleight, James Chua Published: 2024-10-17Area: Representation AnalysisCitations: 47 Tags: ai-safety, empirical, representation-analysis | 2024-10-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 47 |
| On the Role of Attention Heads in Large Language Model Safety Fei Huang, Haiyang Yu, Junfeng Fang, Kun Wang Published: 2024-10-17Area: Mechanistic Interp.Citations: 46 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-17 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 46 |
| Persistent Pre-Training Poisoning of LLMs Daphne Ippolito, Eric Michael Smith, Florian Tram猫r, Ivan Evtimov Published: 2024-10-17Area: Adversarial RobustnessCitations: 38 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E8 / R3 (93%) | 38 |
| Decomposing The Dark Matter of Sparse Autoencoders Joshua Engels, Logan Smith, Max Tegmark Published: 2024-10-18Area: Mechanistic Interp.Citations: 33 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-18 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (93%) | 33 |
| Teaching Models to Balance Resisting and Accepting Persuasion Elias Stengel-Eskin, Mohit Bansal, Peter Hase Published: 2024-10-18Area: Deception & FailureCitations: 11 Tags: ai-safety, deception-failure, empirical | 2024-10-18 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | 11 |
| Towards Faithful Natural Language Explanations: A Study Using Activation Patching in Large Language Models Erik Cambria, Ranjan Satapathy, Wei Jie Yeo Published: 2024-10-18Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-18 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 4 |
| Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models Bingze Lee, Jinghao Cui, Qiongxiu Li, Xiao Li Published: 2024-10-20Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 17 |
| Does your LLM truly unlearn? An embarrassingly simple approach to recover unlearned knowledge Fali Wang, Hui Liu, Qi He, Suhang Wang Published: 2024-10-21Area: Model EditingCitations: 51 Tags: ai-safety, empirical, model-editing | 2024-10-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (92%) | 51 |
| Erasing Undesirable Concepts in Diffusion Models with Adversarial Preservation Anh Bui, Dinh Phung, Khanh Doan, Long Vuong Published: 2024-10-21Area: Model EditingCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-10-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 31 |
| NetSafe: Exploring the Topological Safety of Multi-agent Networks Chenlong Yin, Guibin Zhang, Junyuan Mao, Kun Wang Published: 2024-10-21Area: Agent SafetyCitations: 26 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2024-10-21 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (94%) | 26 |
| SMILES-Prompting: A Novel Approach to LLM Jailbreak Attacks in Chemical Synthesis Aidan Wong, He Cao, Yu Li, Zijing Liu Published: 2024-10-21Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 6 |
| Steering Knowledge Selection Behaviours in LLMs via SAE-Based Representation Engineering Alessio Devoto, Aryo Pradipta Gema, Giwon Hong, Hongru Wang Published: 2024-10-21Area: Model EditingCitations: 53 Tags: ai-safety, empirical, model-editing | 2024-10-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 53 |
| AdvWeb: Controllable Black-box Attacks on VLM-powered Web Agents Bo Li, Chejian Xu, Huan Sun, Jiawei Zhang Published: 2024-10-22Area: Adversarial RobustnessCitations: 29 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (95%) | 29 |
| Breaking ReAct Agents: Foot-in-the-Door Attack Will Get You In Ateret Anaby-Tavor, George Kour, Guy Uziel, Itay Nakash Published: 2024-10-22Area: Adversarial RobustnessCitations: 18 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 18 |
| LLMScan: Causal Scan for LLM Misbehavior Detection Jun Sun, Kai Kiat Goh, Mengdi Zhang, Peixin Zhang Published: 2024-10-22Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-10-22 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (96%) | 6 |
| Towards Reliable Evaluation of Behavior Steering Interventions in LLMs David Krueger, Ekdeep Singh Lubana, Itamar Pres, Laura Ruis Published: 2024-10-22Area: Safety EvaluationCitations: 23 Tags: ai-safety, empirical, safety-evaluation | 2024-10-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (96%) | 23 |
| UnStar: Unlearning with Self-Taught Anti-Sample Reasoning for LLMs Mohan Kankanhalli, Murari Mandal, Yash Sinha Published: 2024-10-22Area: Model EditingCitations: 15 Tags: ai-safety, empirical, model-editing | 2024-10-22 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 15 |