Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training Jianfeng Si, Lin Sun, Xiangzheng Zhang, Zhewen Tan Published: 2025-08-12Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-08-12 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (95%) | 6 |
| From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training Alec Helyar, Alex Beutel, Andrea Vallone, Anna-Luisa Brakman Published: 2025-08-12Area: Alignment TrainingCitations: 23 Tags: ai-safety, alignment-training, empirical | 2025-08-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | 23 |
| Interpretable Reward Model via Sparse Autoencoder Hengxing Cai, Jiayi Liao, Shuyi Zhang, Sihang Li Published: 2025-08-12Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-08-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 6 |
| Multi-Turn Jailbreaks Are Simpler Than They Seem Anna-Katharina Dick, Diogo Cruz, Fei Xie, Jaeha Lee Published: 2025-08-11Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 6 |
| Towards Effective MLLM Jailbreaking Through Balanced On-Topicness and OOD-Intensity Bernhard Kainz, Jingyuan Zhang, Mengyun Qiao, Shuyuan Zhang Published: 2025-08-11Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-08-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (95%) | - |
| VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models Mansi Phute, Ravi Balakrishnan Published: 2025-08-11Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-08-11 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (94%) | - |
| A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Ivan Zhang Published: 2025-08-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | - |
| SafeGrad: Gradient Surgery for Safe LLM Fine-Tuning Baolei Zhang, Biao Yi, Jiahao Li, Lihai Nie Published: 2025-08-10Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-08-10 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (95%) | 6 |
| Many-Turn Jailbreaking Faisal Ladhak, Hyokun Yun, Linda Ruth Petzold, Liqiang Xiao Published: 2025-08-09Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (97%) | 1 |
| MASteer: Multi-Agent Adaptive Steer Strategy for End-to-End LLM Trustworthiness Repair Aishan Liu, Changqing Li, Li Pan, Tianlin Li Published: 2025-08-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-08-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (99%) | - |
| Who's the Evil Twin? Differential Auditing for Undesired Behavior Greta Kintzley, Ishwar Balappanawar, Ronan Azimi-Mancel, Satvik Golechha Published: 2025-08-09Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-08-09 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | - |
| Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts Bingsheng He, Mingzhe Du, See-Kiong Ng, Zhaomin Wu Published: 2025-08-08Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-08-08 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (93%) | 3 |
| LLM Unlearning using Gradient Ratio-Based Influence Estimation and Noise Injection Ameya Anjarlekar, Sandeep Pombra Published: 2025-08-08Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-08-08 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (96%) | 1 |
| LLM Unlearning Without an Expert Curated Dataset Muru Zhang, Ollie Liu, Robin Jia, Willie Neiswanger Published: 2025-08-08Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-08-08 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (93%) | 2 |
| Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining Bing Han, Dongcheng Zhao, Feifei Zhao, Guobin Shen Published: 2025-08-08Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-08-08 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R3 (95%) | 1 |
| How Do LLMs Persuade? Linear Probes Can Uncover Persuasion Dynamics in Multi-Turn Conversations Brandon Jaipersaud, David Krueger, Ekdeep Singh Lubana Published: 2025-08-07Area: Representation AnalysisCitations: 2 Tags: ai-safety, empirical, representation-analysis | 2025-08-07 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R4 (96%) | 2 |
| JPS: Jailbreak Multimodal Large Language Models with Collaborative Visual Perturbation and Textual Steering Chengwei Pan, Hongning Wang, Minlie Huang, QingLin Zhang Published: 2025-08-07Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-08-07 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (95%) | 3 |
| Automatic LLM Red Teaming Arunesh Sinha, Pradeep Varakantham, Roman Belaire Published: 2025-08-06Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-08-06 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (93%) | 1 |
| Causal Reward Adjustment: Mitigating Reward Hacking in External Reasoning via Backdoor Correction Huijie Guo, Ruike Song, Wenwen Qiang, Zeen Song Published: 2025-08-06Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-08-06 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (97%) | 2 |
| P-Aligner: Enabling Pre-Alignment of Language Models via Principled Instruction Synthesis Bofei Gao, Feifan Song, Guoyin Wang, Houfeng Wang Published: 2025-08-06Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-08-06 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (97%) | 1 |
| Prompt Injection Vulnerability of Consensus Generating Applications in Digital Democracy Cesar A Hidalgo, Cl茅ment Contet, Jairo Gudi帽o, Umberto Grandi Published: 2025-08-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments Geng Hong, Min Yang, Mi Zhang, Xiaoyu You Published: 2025-08-06Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| The Emotional Baby Is Truly Deadly: Does your Multimodal Large Reasoning Model Have Emotional Flattery towards Humans? Hua Zhang, Xiaojun Jia, Xinwei Liu, Yuan Xun Published: 2025-08-06Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-08-06 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E6 / R3 (95%) | - |
| ASTRA: Autonomous Spatial-Temporal Red-teaming for AI Software Assistants Chengpeng Wang, Guangyu Shen, Hanxi Guo, Jiasheng Jiang Published: 2025-08-05Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-08-05 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning Chaozhuo Li, Lirong Qiu, Litian Zhang, Rui Ha Published: 2025-08-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Estimating Worst-Case Frontier Risks of Open-Weight LLMs Chris Koch, Eric Wallace, Kai Chen, Miles Wang Published: 2025-08-05Area: Safety EvaluationCitations: 16 Tags: ai-safety, empirical, safety-evaluation | 2025-08-05 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 16 |
| Large Reasoning Models Are Autonomous Jailbreak Agents Erik Derner, Nuria Oliver, Thilo Hagendorff Published: 2025-08-04Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (96%) | 3 |
| TRACEALIGN - Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs Aman Chadha, Amitava Das, Amit Sheth, S M Mehedi Zaman Published: 2025-08-04Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R5 (98%) | - |
| When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models Di Wang, Jin Li, Keyu Wang, Shu Yang Published: 2025-08-04Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2025-08-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 12 |
| Decomposing Representation Space into Interpretable Subspaces with Unsupervised Learning Michael Hahn, Xinting Huang Published: 2025-08-03Area: Mechanistic Interp.Citations: 3 Tags: ai-safety, empirical, mechanistic-interp | 2025-08-03 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (94%) | 3 |