Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Security Matrix for Multimodal Agents on Mobile Devices: A Systematic and Proof of Concept Study Chao Shen, Chenhao Lin, Shuaidong Li, Tianwei Zhang Published: 2024-07-12Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2024-07-12 | Agent Safety | agent-safety, ai-safety, empirical | E4 / R3 (97%) | 2 |
| Self-interpreting Adversarial Images Collin Zhang, Eugene Bagdasaryan, John X. Morris, Tingwei Zhang Published: 2024-07-12Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-07-12 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 5 |
| DistillSeq: A Framework for Safety Alignment Testing in Large Language Models using Knowledge Distillation Ling Shi, Mingke Yang, Yi Liu, Yuqi Chen Published: 2024-07-14Area: Safety EvaluationCitations: 9 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2024-07-14 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | 9 |
| Learning to Refuse: Towards Mitigating Privacy Risks in LLMs Chuanyuan Tan, Tong Zhu, Wenliang Chen, Zhenhua Liu Published: 2024-07-14Area: Model EditingCitations: 18 Tags: ai-safety, empirical, model-editing | 2024-07-14 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | 18 |
| On Large Language Model Continual Unlearning Chenkai Weng, Chongyang Gao, Kaize Ding, Lixu Wang Published: 2024-07-14Area: Model EditingCitations: 30 Tags: ai-safety, empirical, model-editing | 2024-07-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 30 |
| LLM Circuit Analyses Are Consistent Across Training and Scale Curt Tigges, Michael Hanna, Qinan Yu, Stella Biderman Published: 2024-07-15Area: Mechanistic Interp.Citations: 42 Tags: ai-safety, empirical, mechanistic-interp | 2024-07-15 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 42 |
| Uncertainty is Fragile: Manipulating Uncertainty in Large Language Models Fan Yang, Felix Juefei-Xu, Guangyan Sun, Kaize Ding Published: 2024-07-15Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 14 |
| Does Refusal Training in LLMs Generalize to the Past Tense? Maksym Andriushchenko, Nicolas Flammarion Published: 2024-07-16Area: Adversarial RobustnessCitations: 70 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 70 |
| Interpretability in Action: Exploratory Analysis of VPT, a Minecraft Agent Artem Zholus, Blake Richards, George Adamopoulos, Irina Rish Published: 2024-07-16Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-07-16 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R4 (97%) | 4 |
| Large Language Models as Misleading Assistants in Conversation Betty Li Hou, James Aung, Jason Phang, Kejian Shi Published: 2024-07-16Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical | 2024-07-16 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (95%) | 7 |
| Preemptive Detection and Correction of Misaligned Actions in LLM Agents Haishuo Fang, Iryna Gurevych, Xiaodan Zhu Published: 2024-07-16Area: Agent SafetyCitations: 6 Tags: agent-safety, ai-safety, empirical | 2024-07-16 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R5 (95%) | 6 |
| Analyzing the Generalization and Reliability of Steering Vectors Adria Garriga-Alonso, Aengus Lynch, Brooks Paige, Daniel Tan Published: 2024-07-17Area: Representation AnalysisCitations: 64 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2024-07-17 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (95%) | 64 |
| Direct Unlearning Optimization for Robust and Safe Text-to-Image Models Gayoung Lee, Geonhui Jang, Jin-Hwa Kim, Junghyo Jo Published: 2024-07-17Area: Model EditingCitations: 42 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-07-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R4 (95%) | 42 |
| The Better Angels of Machine Personality: How Personality Relates to LLM Safety Chen Qian, Dongrui Liu, Jie Zhang, Jing Shao Published: 2024-07-17Area: Safety EvaluationCitations: 21 Tags: ai-safety, empirical, safety-evaluation | 2024-07-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (93%) | 21 |
| Prover-Verifier Games Improve Legibility of LLM Outputs Harri Edwards, Jan Hendrik Kirchner, Jan Leike, Nat McAleese Published: 2024-07-18Area: Scalable OversightCitations: 54 Tags: ai-safety, empirical, scalable-oversight | 2024-07-18 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R4 (95%) | 54 |
| Weak-to-Strong Reasoning Pengfei Liu, Yan Ma, Yuqing Yang Published: 2024-07-18Area: Scalable OversightCitations: 28 Tags: ai-safety, empirical, scalable-oversight | 2024-07-18 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 28 |
| Jumping Ahead: Improving Reconstruction Fidelity with JumpReLU Sparse Autoencoders Arthur Conmy, J脙隆nos Kram脙隆r, Neel Nanda, Nicolas Sonnerat Published: 2024-07-19Area: Mechanistic Interp.Citations: 194 Tags: ai-safety, empirical, mechanistic-interp | 2024-07-19 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 194 |
| Adversarial Circuit Evaluation Adri脿 Garriga-Alonso, Niels uit de Bos Published: 2024-07-21Area: Mechanistic Interp.Citations: 1 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp, safety-evaluation | 2024-07-21 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp, safety-evaluation | E6 / R3 (95%) | 1 |
| Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts Chengjun Cai, Cong Wang, Xiaoli Zhang, Xingliang Yuan Published: 2024-07-21Area: Multimodal SafetyCitations: 38 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | 2024-07-21 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | E5 / R3 (96%) | 38 |
| Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial Hypothesis Guangliang Liu, Haitao Mao, Jiliang Tang, Kristen Marie Johnson Published: 2024-07-21Area: Deception & FailureCitations: 18 Tags: ai-safety, deception-failure, empirical | 2024-07-21 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 18 |
| Trading Devil Final: Backdoor attack via Stock market and Bayesian Optimization Orson Mengara Published: 2024-07-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-07-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Planning in a Recurrent Neural Network that Plays Sokoban Aaron David Tucker, Adam Gleave, Adri脿 Garriga-Alonso, Chris Cundy Published: 2024-07-22Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, empirical, mechanistic-interp | 2024-07-22 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (95%) | 11 |
| Revisiting the Robust Alignment of Circuit Breakers Leo Schwinn, Simon Geisler Published: 2024-07-22Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R2 (93%) | 8 |
| Targeted Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs Abhay Sheshadri, Aengus Lynch, Aidan Ewart, Asa Cooper Stickland Published: 2024-07-22Area: Adversarial RobustnessCitations: 112 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 112 |
| Can Large Language Models Automatically Jailbreak GPT-4V? Lichao Sun, Pan Zhou, Xiang Li, Yixin Liu Published: 2024-07-23Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-07-23 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 3 |
| Course-Correction: Safety Alignment Using Synthetic Preferences Haiqin Weng, Han Qiu, Renjie Gu, Rongwu Xu Published: 2024-07-23Area: Alignment TrainingCitations: 13 Tags: ai-safety, alignment-training, empirical | 2024-07-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 13 |
| Figure it Out: Analyzing-based Jailbreak Attack on Large Language Models Changting Lin, Meng Han, Rongchang Li, Shi Lin Published: 2024-07-23Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 3 |
| PrimeGuard: Safe and Helpful LLMs through Tuning-Free Routing Blazej Manczak, Eliott Zemour, Eric Lin, Vaikkunth Mugunthan Published: 2024-07-23Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 9 |
| RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent Feng Xiao, Huiyu Xu, Kui Ren, Rui Zheng Published: 2024-07-23Area: Safety EvaluationCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-07-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (97%) | 30 |
| FLRT: Fluent Student-Teacher Redteaming Michael Sklar, T. Ben Thompson Published: 2024-07-24Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 10 |