Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 991-1000 of 1000+ papers (page 34 of 34)路 8003 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Does Safety Training of LLMs Generalize to Semantically Related Natural Prompts? Arun Suggala, Karthikeyan Shanmugam, Prateek Jain, Sravanti Addepalli Published: 2024-12-04Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 7 |
| Monet: Mixture of Monosemantic Experts for Transformers Jaewoo Kang, Jungwoo Park, Kee-Eung Kim, Young Jin Ahn Published: 2024-12-05Area: Mechanistic Interp.Citations: 9 Tags: ai-safety, empirical, mechanistic-interp | 2024-12-05 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 9 |
| Safeguarding Text-to-Image Generation via Inference-Time Prompt-Noise Optimization Charles Fleming, Gaowen Liu, Jiangweizhi Peng, Mingyi Hong Published: 2024-12-05Area: Multimodal SafetyCitations: 4 Tags: ai-safety, empirical, multimodal-safety | 2024-12-05 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R4 (96%) | 4 |
| Frontier Models are Capable of In-context Scheming Alexander Meinke, Bronson Schoen, J脙漏r脙漏my Scheurer, Marius Hobbhahn Published: 2024-12-06Area: Deception & FailureCitations: 153 Tags: ai-safety, deception-failure, empirical | 2024-12-06 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R5 (96%) | 153 |
| LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds Amrit Singh Bedi, Furong Huang, James Beetham, Mengdi Wang Published: 2024-12-06Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-12-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage Dawn Song, Wenbo Guo, Xian Wu, Xuandong Zhao Published: 2024-12-07Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 8 |
| Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs Arunesh Sinha, Pradeep Varakantham, Yuxiao Lu Published: 2024-12-07Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2024-12-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 3 |
| Heuristic-Induced Multimodal Risk Distribution Jailbreak Attack for Multimodal Large Language Models Chu Zhixuan, Duan Ranjie, Huang Yihao, Jia Xiaojun Published: 2024-12-08Area: Multimodal SafetyCitations: 21 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-08 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 21 |
| BatchTopK Sparse Autoencoders Bart Bussmann, Neel Nanda, Patrick Leask Published: 2024-12-09Area: Mechanistic Interp.Citations: 64 Tags: ai-safety, empirical, mechanistic-interp | 2024-12-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (97%) | 64 |
| Frontier AI systems have surpassed the self-replicating red line Jiarun Dai, Min Yang, Xudong Pan, Yihe Fan Published: 2024-12-09Area: Safety EvaluationCitations: 15 Tags: ai-safety, empirical, safety-evaluation | 2024-12-09 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 15 |
| Precise, Fast, and Low-cost Concept Erasure in Value Space: Orthogonal Complement Matters Kuien Liu, Ouxiang Li, Tingting Mu, Xiangnan He Published: 2024-12-09Area: Model EditingCitations: 18 Tags: ai-safety, empirical, model-editing | 2024-12-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 18 |
| SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations Bo Li, Francesco Pinto, Minzhou Pan, Zhaorun Chen Published: 2024-12-09Area: Multimodal SafetyCitations: 22 Tags: ai-safety, empirical, multimodal-safety | 2024-12-09 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 22 |
| Buster: Incorporating Backdoor Attacks into Text Encoder to Mitigate NSFW Content Generation Xiaojun Chen, Xin Zhao, Yuexin Xuan, Zhendong Zhao Published: 2024-12-10Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks Bocheng Chen, Hanqing Guo, Qiben Yan Published: 2024-12-10Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 3 |
| Frame Representation Hypothesis: Multi-Token LLM Interpretability and Concept-Guided Text Generation Erica K. Shimomoto, Kazuhiro Fukui, Lincon S. Souza, Pedro H. V. Valois Published: 2024-12-10Area: Representation AnalysisCitations: 2 Tags: ai-safety, empirical, interpretability, representation-analysis | 2024-12-10 | Representation Analysis | ai-safety, empirical, interpretability, representation-analysis | E5 / R3 (95%) | 2 |
| Identifying and Manipulating Personality Traits in LLMs Through Activation Engineering James K. Wiles, Rumi A. Allbert Published: 2024-12-10Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2024-12-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 6 |
| On Evaluating the Durability of Safeguards for Open-Weight LLMs Boyi Wei, Luxi He, Matthew Jagielski, Milad Nasr Published: 2024-12-10Area: Adversarial RobustnessCitations: 42 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 42 |
| PrisonBreak: Jailbreaking Large Language Models with at Most Twenty-Five Targeted Bit-flips Bo Fang, Jeonghyun Woo, Lishan Yang, Prashant Nair Published: 2024-12-10Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models Bo Li, Chejian Xu, Mintong Kang Published: 2024-12-11Area: Multimodal SafetyCitations: 24 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-11 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R5 (95%) | 24 |
| Antelope: Potent and Concealed Jailbreak Attack Strategy Haoyu Gao, Xiaojun Chen, Xin Zhao Published: 2024-12-11Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 3 |
| Underestimated Privacy Risks for Minority Populations in Large Language Model Unlearning Bo Li, Eleonora Krea膷i膰, Eli Chien, Mohsen Ghassemi Published: 2024-12-11Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2024-12-11 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R3 (97%) | 4 |
| Sail into the Headwind: Alignment via Robust Rewards and Dynamic Labels against Reward Hacking Paria Rashidinejad, Yuandong Tian Published: 2024-12-12Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical | 2024-12-12 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (97%) | 10 |
| AdvPrefix: An Objective for Nuanced LLM Jailbreaks Brandon Amos, Chuan Guo, Ivan Evtimov, Sicheng Zhu Published: 2024-12-13Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 12 |
| AlignGuard: Scalable Safety Alignment for Text-to-Image Generation Ashkan Khakzar, Fabio Pizzati, I Chieh Chen, Jindong Gu Published: 2024-12-13Area: Multimodal SafetyCitations: 11 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-12-13 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E6 / R4 (98%) | 11 |
| No Free Lunch for Defending Against Prefilling Attack by In-Context Learning Bocheng Chen, Guangliang Liu, Kristen Marie Johnson, Ramtin Pedarsani Published: 2024-12-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-12-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Towards Action Hijacking of Large Language Model-based Agent Kangjie Chen, Lina Wang, Run Wang, Xudong Jiang Published: 2024-12-14Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (94%) | 5 |
| Stepwise Reasoning Error Disruption Attack of LLMs Jingyu Peng, Kai Zhang, Maolin Wang, Pengyue Jia Published: 2024-12-16Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-12-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 5 |
| Transformers Use Causal World Models in Maze-Solving Tasks Adrians Skapars, Alessandra Russo, Alex F. Spies, Katsumi Inoue Published: 2024-12-16Area: Mechanistic Interp.Citations: 9 Tags: ai-safety, empirical, mechanistic-interp | 2024-12-16 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (94%) | 9 |
| Concept-ROT: Poisoning Concepts in Large Language Models with Model Editing David Shriver, Keltin Grimes, Marco Christiani, Marissa Connor Published: 2024-12-17Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical | 2024-12-17 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (97%) | 6 |
| Defending LVLMs Against Vision Attacks through Partial-Perception Supervision Dongxia Wang, Jin Song Dong, Qing Guo, Qi Zhou Published: 2024-12-17Area: Multimodal SafetyCitations: 5 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-12-17 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (94%) | 5 |