Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models Ruofan Wang, Xingjun Ma, Xin Wang, Xuan Tong Published: 2025-08-03Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-08-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 1 |
| Activation-Guided Local Editing for Jailbreaking Attacks Haohua Du, Hao Peng, Haoran Li, Jiecong Wang Published: 2025-08-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | - |
| Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems Hisashi Kashima, Jiyi Li, Koh Takeuchi, Kyohei Atarashi Published: 2025-07-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-07-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| LLMs Can Covertly Sandbag on Capability Evaluations Against Chain-of-Thought Monitoring Chloe Li, Mary Phuong, Noah Y. Siegel Published: 2025-07-31Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-07-31 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (97%) | 6 |
| Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs Aditi Raghunathan, Ziqian Zhong Published: 2025-07-31Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| Universally Unfiltered and Unseen: Input-Agnostic Multimodal Jailbreaks against Text-to-Image Model Safeguards Guoliang Yang, Hui Wei, Jinlong Fei, Song Yan Published: 2025-07-30Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-30 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking Deyue Zhang, Dongdong Yang, Moyang Chen, Quanchen Zou Published: 2025-07-29Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-29 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E16 / R15 (95%) | 3 |
| Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security Hao Sun, Junyu Gao, Muzhi Dai, Shixuan Liu Published: 2025-07-29Area: Multimodal SafetyCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-07-29 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E4 / R3 (96%) | 4 |
| Self-Aware Safety Augmentation: Leveraging Internal Semantic Understanding to Enhance Safety in Vision-Language Models Han Zheng, Mingang Chen, Wanying Wang, Xin Tan Published: 2025-07-29Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-07-29 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E4 / R3 (94%) | - |
| Strategic Deflection: Defending LLMs from Logit Manipulation Amal El Fallah Seghrouchni, Faissal Sehbaoui, Jihad Rbaiti, Yassine Rachidy Published: 2025-07-29Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Training language models to be warm and empathetic makes them less reliable and more sycophantic Franziska Sofia Hafner, Luc Rocher, Lujain Ibrahim Published: 2025-07-29Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2025-07-29 | Deception & Failure | ai-safety, deception-failure, empirical | E7 / R3 (98%) | 12 |
| When Truthful Representations Flip Under Deceptive Instructions? Haotian Yu, Mu Sheng, Pan Li, Runchao Li Published: 2025-07-29Area: Representation AnalysisCitations: 5 Tags: ai-safety, empirical, representation-analysis | 2025-07-29 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 5 |
| Customize Multi-modal RAI Guardrails with Precedent-based predictions Cheng-Fu Yang, Christos Christodoulopoulos, Kai-Wei Chang, Rahul Gupta Published: 2025-07-28Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety | 2025-07-28 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 1 |
| SDD: Self-Degraded Defense against Malicious Fine-tuning Weikai Lu, Xin Lin, Ziqian Zeng, Zixuan Chen Published: 2025-07-27Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 4 |
| The Blessing and Curse of Dimensionality in Safety Alignment Laziz U. Abdullaev, Rachel S.Y. Teo, Tan M. Nguyen Published: 2025-07-27Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 6 |
| Can Small-Scale Data Poisoning Exacerbate Dialect-Linked Biases in Large Language Models? Chaymaa Abbas, Mariette Awad, Razane Tajeddine Published: 2025-07-25Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-07-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| PrompTrend: Continuous Community-Driven Vulnerability Discovery and Assessment for Large Language Models Jihene Bennaceur, Mootez Aloui, Ramzi Guesmi, Tarek Gasmi Published: 2025-07-25Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-07-25 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (97%) | - |
| PurpCode: Reasoning for Safer Code Generation Gang Wang, Hadjer Benkraouda, Haoyu Zhai, Ismini Lourentzou Published: 2025-07-25Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 9 |
| Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes Jinku Li, Rui Jiao, Yue Zhang Published: 2025-07-25Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical, interpretability | 2025-07-25 | Deception & Failure | ai-safety, deception-failure, empirical, interpretability | E5 / R3 (96%) | - |
| BadReasoner: Planting Tunable Backdoors into Large Reasoning Models for Fun or Profit Biao Yi, Jianing Geng, Lihai Nie, Tong Li Published: 2025-07-24Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 4 |
| GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs Archiki Prasad, Duy Nguyen, Elias Stengel-Eskin, Mohit Bansal Published: 2025-07-24Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-07-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 2 |
| Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment Hao Li, Jing Shao, Lei Sha, Lijun Li Published: 2025-07-24Area: Alignment TrainingCitations: 15 Tags: ai-safety, alignment-training, empirical | 2025-07-24 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 15 |
| Specification Self-Correction: Mitigating In-Context Reward Hacking Through Test-Time Refinement V铆ctor Gallego Published: 2025-07-24Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-07-24 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (97%) | 2 |
| Death by a Thousand Directions: Exploring the Geometry of Harmfulness in LLMs through Subconcept Probing Adhitya Rajendra Kumar, Kevin Zhu, McNair Shah, Naitik Chheda Published: 2025-07-23Area: Representation AnalysisCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-07-23 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E6 / R3 (94%) | 3 |
| From Seed to Harvest: Augmenting Human Creativity with AI for Red-teaming Text-to-Image Models Alicia Parrish, Charvi Rastogi, Jessica Quaye, Lora Aroyo Published: 2025-07-23Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-07-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (96%) | - |
| Analysis of Threat-Based Manipulation in Large Language Models: A Dual Perspective on Vulnerabilities and Performance Enhancement Opportunities Atil Samancioglu Published: 2025-07-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (93%) | - |
| Depth Gives a False Sense of Privacy: LLM Internal States Inversion Guoxing Chen, Haojin Zhu, Shaofeng Li, Tian Dong Published: 2025-07-22Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| DREAM: Scalable Red Teaming for Text-to-Image Generative Systems via Distribution Modeling Boheng Li, Han Qiu, Jianshuo Dong, Junjie Wang Published: 2025-07-22Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, red-teaming | 2025-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming | E4 / R3 (96%) | 2 |
| LoRA is All You Need for Safety Alignment of Reasoning LLMs Baharan Mirzasoleiman, Yihao Xue Published: 2025-07-22Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-07-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization Dongyao Zhu, Han Jiang, Xiaoyuan Yi, Xing Xie Published: 2025-07-22Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-07-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |