Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| RAG-Pull: Imperceptible Attacks on RAG Systems for Code Generation Aritra Dhar, Lukas Cavigelli, Vasilije Stambolic Published: 2025-10-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | - |
| Safeguarding Efficacy in Large Language Models: Evaluating Resistance to Human-Written and Algorithmic Adversarial Prompts Olamide Jogunola, Oluwaseun Ajao, Tiarnaigh Downey-Webb Published: 2025-10-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R4 (96%) | - |
| ArtPerception: ASCII Art-based Jailbreak on LLMs with Recognition Pre-test Farn Wang, Guan-Yan Yang, Kuo-Hui Yeh, Tzu-Yu Cheng Published: 2025-10-11Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 2 |
| Output Supervision Can Obfuscate the Chain of Thought Alexander Matt Turner, Alex Cloud, Bryce Woodworth, Jacob Drori Published: 2025-10-11Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-10-11 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | - |
| PIXEL: Adaptive Steering Via Position-wise Injection with eXact Estimated Levels under Subspace Calibration Di Wang, Hongji Li, Lijie Hu, Manjiang Yu Published: 2025-10-11Area: Model EditingCitations: 7 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-10-11 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | 7 |
| Scheming Ability in LLM-to-LLM Strategic Interactions Thao Pham Published: 2025-10-11Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-10-11 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | 2 |
| All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language Fabien Roger, Henry Sleight, Shiyuan Guo Published: 2025-10-10Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-10-10 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | 1 |
| Decoupling Safety into Orthogonal Subspace: Cost-Efficient and Performance-Preserving Alignment for Large Language Models Shikun Zhang, Wei Ye, Xiaoling Zhou, Yutao Mou Published: 2025-10-10Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-10-10 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | - |
| LLM Unlearning on Noisy Forget Sets: A Study of Incomplete, Rewritten, and Watermarked Data Changsheng Wang, Dennis Wei, Jinghan Jia, Pin-Yu Chen Published: 2025-10-10Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-10-10 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| Text Prompt Injection of Vision Language Models Ruizhe Zhu Published: 2025-10-10Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-10 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 2 |
| The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against LLM Jailbreaks and Prompt Injections Abhradeep Thakurta, Andreas Terzis, Chawin Sitawarin, Florian Tram猫r Published: 2025-10-10Area: Adversarial RobustnessCitations: 26 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E10 / R3 (99%) | 26 |
| Verifying Chain-of-Thought Reasoning via Its Computational Graph Naila Murray, Nicola Cancedda, Xianjun Yang, Yeskendir Koishekenov Published: 2025-10-10Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2025-10-10 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (97%) | 2 |
| VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search Guangze Zhao, MingSheng Li, Sichen Liu Published: 2025-10-10Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-10-10 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming Hanbo Song, Keqing He, Kongming Liang, Lulu Zhao Published: 2025-10-09Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-10-09 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R4 (97%) | - |
| Contrastive Weak-to-strong Generalization Chen Gao, Houcheng Jiang, Jiaxin Wu, Junfeng Fang Published: 2025-10-09Area: Scalable OversightCitations: - Tags: ai-safety, empirical, scalable-oversight | 2025-10-09 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R3 (95%) | - |
| Energy-Driven Steering: Reducing False Refusals in Large Language Models Eric Hanchen Jiang, Guancheng Wan, Kai-Wei Chang, Ranjie Duan Published: 2025-10-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-09 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | - |
| Fewer Weights, More Problems: A Practical Attack on LLM Pruning Kazuki Egashira, Mark Vero, Martin Vechev, Robin Staab Published: 2025-10-09Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | 2 |
| From Defender to Devil? Unintended Risk Interactions Induced by LLM Defenses Li Wang, Shanqing Guo, Tianshuo Cong, Wenyu Chen Published: 2025-10-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| Kelp: A Streaming Safeguard for Large Models via Latent Dynamics-Guided Risk Detection Cen Chen, Hui Xue, Jianmei Guo, Mengjie Wu Published: 2025-10-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| LLMs Learn to Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions Dongrui Liu, Jing Shao, Peng Wang, Xiaoya Lu Published: 2025-10-09Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-09 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 1 |
| Pattern Enhanced Multi-Turn Jailbreaking: Exploiting Structural Vulnerabilities in Large Language Models Jun Sakuma, Kazuhiro Nakadai, Ragib Amin Nihal, Rui Wen Published: 2025-10-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (96%) | 1 |
| SIMU: Selective Influence Machine Unlearning Anu Agarwal, Dilek Hakkani-Tur, Mihir Pamnani Published: 2025-10-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-09 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | - |
| Stress-Testing Model Specs Reveals Character Differences among Language Models Andi Peng, Esin Durmus, Henry Sleight, Jifan Zhang Published: 2025-10-09Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-10-09 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | 3 |
| The Alignment Waltz: Jointly Training Agents to Collaborate for Safety Amr Sharaf, Benjamin Van Durme, Daniel Khashabi, Eric Michael Smith Published: 2025-10-09Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-10-09 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R5 (94%) | 3 |
| The Unintended Trade-off of AI Alignment: Balancing Hallucination Mitigation and Safety in LLMs Ali Khalil, Buddhika Laknath Semage, Omar Mahmoud, Santu Rana Published: 2025-10-09Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-10-09 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| Time-Aware Feature Selection: Adaptive Temporal Masking for Stable Sparse Autoencoder Training Junyu Ren, T. Ed Li Published: 2025-10-09Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-10-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (97%) | - |
| VisualDAN: Exposing Vulnerabilities in VLMs with Visual-Driven DAN Commands Aofan Liu, Lulu Tang Published: 2025-10-09Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-09 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R5 (97%) | - |
| When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models Gelei Deng, Han Qiu, Haoran Ou, Jie Zhang Published: 2025-10-09Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-10-09 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | 1 |
| BlackboxNLP-2025 MIB Shared Task: Exploring Ensemble Strategies for Circuit Localization Methods Ahmad Dawar Hakimi, Barbara Plank, Hinrich Sch眉tze, Leonor Veloso Published: 2025-10-08Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2025-10-08 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 2 |
| Cross-Modal Attention Guided Unlearning in Vision-Language Models Aneesh Komanduri, Karuna Bhaila, Minh-Hao Van, Xintao Wu Published: 2025-10-08Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-10-08 | Model Editing | ai-safety, empirical, model-editing | E4 / R2 (96%) | - |