Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends Daizong Liu, Mingyu Yang, Pan Zhou, Wei Hu Published: 2024-07-10Area: Multimodal SafetyCitations: 81 Tags: adversarial-robustness, ai-safety, multimodal-safety, survey | 2024-07-10 | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, survey | E7 / R5 (96%) | 81 |
| Flooding Spread of Manipulated Knowledge in LLM-Based Multi-Agent Communities Gongshen Liu, Haodong Zhao, Jian Xie, Lifeng Liu Published: 2024-07-10Area: Agent SafetyCitations: 63 Tags: agent-safety, ai-safety, empirical | 2024-07-10 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R3 (94%) | 63 |
| Multilingual Blending: LLM Safety Alignment Evaluation with Language Mixture Jiayang Song, Lei Ma, Yuheng Huang, Zhehua Zhou Published: 2024-07-10Area: Adversarial RobustnessCitations: 19 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2024-07-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 19 |
| AIR-Bench 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies Andy Zhou, Bo Li, Dawn Song, Jeffrey Ziwei Tan Published: 2024-07-11Area: Safety EvaluationCitations: 55 Tags: ai-safety, benchmark, safety-evaluation | 2024-07-11 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 55 |
| Model Surgery: Modulating LLM's Behavior Via Simple Parameter Editing Andrew Zhao, Gao Huang, Huanqian Wang, Jingxin Shi Published: 2024-07-11Area: Model EditingCitations: 18 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-07-11 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | 18 |
| On the (In)Security of LLM App Stores Haoyu Wang, Xinyi Hou, Yanjie Zhao Published: 2024-07-11Area: Safety EvaluationCitations: 21 Tags: ai-safety, empirical, safety-evaluation | 2024-07-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 21 |
| On the Universal Truthfulness Hyperplane Inside LLMs Junteng Liu, Junxian He, Shiqi Chen, Yu Cheng Published: 2024-07-11Area: Representation AnalysisCitations: 16 Tags: ai-safety, empirical, representation-analysis | 2024-07-11 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (93%) | 16 |
| Transformer Circuit Faithfulness Metrics are not Robust Bilal Chughtai, Joseph Miller, William Saunders Published: 2024-07-11Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-07-11 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (95%) | 10 |
| ASTPrompter: Weakly Supervised Automated Language Model Red-Teaming to Identify Likely Toxic Prompts Amelia F. Hardy, Bernard Lange, Houjun Liu, Mykel J. Kochenderfer Published: 2024-07-12Area: Safety EvaluationCitations: 2 Tags: ai-safety, empirical, safety-evaluation | 2024-07-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R3 (97%) | 2 |
| Evaluating AI Evaluation: Perils and Prospects John Burden Published: 2024-07-12Area: Safety EvaluationCitations: 16 Tags: ai-safety, position, safety-evaluation | 2024-07-12 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R3 (94%) | 16 |
| Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training Jen-tse Huang, Jiahao Xu, Pinjia He, Tian Liang Published: 2024-07-12Area: Adversarial RobustnessCitations: 57 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 57 |
| Refusing Safe Prompts for Multi-modal Large Language Models Hongbin Liu, Neil Zhenqiang Gong, Yuepeng Hu, Zedian Shao Published: 2024-07-12Area: Multimodal SafetyCitations: 5 Tags: ai-safety, empirical, multimodal-safety | 2024-07-12 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E7 / R3 (94%) | 5 |
| Security Matrix for Multimodal Agents on Mobile Devices: A Systematic and Proof of Concept Study Chao Shen, Chenhao Lin, Shuaidong Li, Tianwei Zhang Published: 2024-07-12Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2024-07-12 | Agent Safety | agent-safety, ai-safety, empirical | E4 / R3 (97%) | 2 |
| Self-interpreting Adversarial Images Collin Zhang, Eugene Bagdasaryan, John X. Morris, Tingwei Zhang Published: 2024-07-12Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-07-12 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 5 |
| DistillSeq: A Framework for Safety Alignment Testing in Large Language Models using Knowledge Distillation Ling Shi, Mingke Yang, Yi Liu, Yuqi Chen Published: 2024-07-14Area: Safety EvaluationCitations: 9 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2024-07-14 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | 9 |
| Learning to Refuse: Towards Mitigating Privacy Risks in LLMs Chuanyuan Tan, Tong Zhu, Wenliang Chen, Zhenhua Liu Published: 2024-07-14Area: Model EditingCitations: 18 Tags: ai-safety, empirical, model-editing | 2024-07-14 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | 18 |
| On Large Language Model Continual Unlearning Chenkai Weng, Chongyang Gao, Kaize Ding, Lixu Wang Published: 2024-07-14Area: Model EditingCitations: 30 Tags: ai-safety, empirical, model-editing | 2024-07-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 30 |
| Learning Dynamics of LLM Finetuning Danica J. Sutherland, Yi Ren Published: 2024-07-15Area: Training DynamicsCitations: 67 Tags: ai-safety, alignment-training, theoretical, training-dynamics | 2024-07-15 | Training Dynamics | ai-safety, alignment-training, theoretical, training-dynamics | E5 / R3 (94%) | 67 |
| LLM Circuit Analyses Are Consistent Across Training and Scale Curt Tigges, Michael Hanna, Qinan Yu, Stella Biderman Published: 2024-07-15Area: Mechanistic Interp.Citations: 42 Tags: ai-safety, empirical, mechanistic-interp | 2024-07-15 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 42 |
| Uncertainty is Fragile: Manipulating Uncertainty in Large Language Models Fan Yang, Felix Juefei-Xu, Guangyan Sun, Kaize Ding Published: 2024-07-15Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 14 |
| Does Refusal Training in LLMs Generalize to the Past Tense? Maksym Andriushchenko, Nicolas Flammarion Published: 2024-07-16Area: Adversarial RobustnessCitations: 70 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 70 |
| Interpretability in Action: Exploratory Analysis of VPT, a Minecraft Agent Artem Zholus, Blake Richards, George Adamopoulos, Irina Rish Published: 2024-07-16Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-07-16 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R4 (97%) | 4 |
| Large Language Models as Misleading Assistants in Conversation Betty Li Hou, James Aung, Jason Phang, Kejian Shi Published: 2024-07-16Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical | 2024-07-16 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (95%) | 7 |
| Preemptive Detection and Correction of Misaligned Actions in LLM Agents Haishuo Fang, Iryna Gurevych, Xiaodan Zhu Published: 2024-07-16Area: Agent SafetyCitations: 6 Tags: agent-safety, ai-safety, empirical | 2024-07-16 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R5 (95%) | 6 |
| Analyzing the Generalization and Reliability of Steering Vectors Adria Garriga-Alonso, Aengus Lynch, Brooks Paige, Daniel Tan Published: 2024-07-17Area: Representation AnalysisCitations: 64 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2024-07-17 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (95%) | 64 |
| Direct Unlearning Optimization for Robust and Safe Text-to-Image Models Gayoung Lee, Geonhui Jang, Jin-Hwa Kim, Junghyo Jo Published: 2024-07-17Area: Model EditingCitations: 42 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-07-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R4 (95%) | 42 |
| The Better Angels of Machine Personality: How Personality Relates to LLM Safety Chen Qian, Dongrui Liu, Jie Zhang, Jing Shao Published: 2024-07-17Area: Safety EvaluationCitations: 21 Tags: ai-safety, empirical, safety-evaluation | 2024-07-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (93%) | 21 |
| Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization Akshay Krishnamurthy, Audrey Huang, Dylan J. Foster, Jason D. Lee Published: 2024-07-18Area: Alignment TrainingCitations: 54 Tags: ai-safety, alignment-training, theoretical | 2024-07-18 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (96%) | 54 |
| Mechanistically Interpreting a Transformer-based 2-SAT Solver: An Axiomatic Approach Corina P膬s膬reanu, Nils Palumbo, Ravi Mangal, Saranya Vijayakumar Published: 2024-07-18Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, mechanistic-interp, theoretical | 2024-07-18 | Mechanistic Interp. | ai-safety, mechanistic-interp, theoretical | E5 / R3 (95%) | 2 |
| NNsight and NDIF: Democratizing Access to Foundation Model Internals Aaron Mueller, Adam Belfki, Alexander R. Loftus, Arjun Guha Published: 2024-07-18Area: Mechanistic Interp.Citations: 23 Tags: ai-safety, mechanistic-interp, tool | 2024-07-18 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (96%) | 23 |