Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| School of Reward Hacks: Hacking Harmless Tasks Generalizes to Misaligned Behavior in LLMs James Chua, Jan Betley, Johannes Treutlein, Mia Taylor Published: 2025-08-24Area: Deception & FailureCitations: 17 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-24 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 17 |
| Dimensional Collapse in Transformer Attention Outputs: A Challenge for Sparse Dictionary Learning Junxuan Wang, Wentao Shu, Xipeng Qiu, Xuyang Ge Published: 2025-08-23Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-08-23 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (94%) | - |
| POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization Gaojie Jin, Ronghui Mu, Tianjin Huang, Xiaowei Huang Published: 2025-08-23Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 4 |
| ConceptGuard: Neuro-Symbolic Safety Guardrails via Sparse Interpretable Jailbreak Concepts C茅line Hudelot, Darpan Aswal Published: 2025-08-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| HAMSA: Hijacking Aligned Compact Models via Stealthy Automation Alexey Krylov, Azidine Guezzaz, Dmitrii Korzh, Elena V. Tutubalina Published: 2025-08-22Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 2 |
| Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models Bill Byrne, Guangyu Yang, Jingbiao Mei, Jinghong Chen Published: 2025-08-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | - |
| Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders Adri脿 Garriga-Alonso, David Chanin Published: 2025-08-22Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, mechanistic-interp | 2025-08-22 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (94%) | 4 |
| Reliable Unlearning Harmful Information in LLMs with Metamorphosis Representation Projection Chengcan Wu, Huanran Chen, Meng Sun, Yinpeng Dong Published: 2025-08-21Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-08-21 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 3 |
| SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks Jianbing Ni, Qi Li, Rongxing Lu, Xiangman Li Published: 2025-08-21Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-08-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Evaluating Sparse Autoencoders for Monosemantic Representation A.B. Siddique, Moghis Fereidouni, Muhammad Umair Haider, Peizhong Ju Published: 2025-08-20Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-08-20 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | - |
| Universal and Transferable Adversarial Attack on Large Language Models Using Exponentiated Gradient Descent Mao Nishino, Sajib Biswas, Samuel Jacob Chacko, Xiuwen Liu Published: 2025-08-20Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| CCFC: Core & Core-Full-Core Dual-Track Defense for LLM Jailbreak Protection Debarghya Mukherjee, Haoyu Wang, Ioannis Ch. Paschalidis, Jiaming Hu Published: 2025-08-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | - |
| CIA+TA Risk Assessment for AI Reasoning Vulnerabilities Yuksel Aydin Published: 2025-08-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | - |
| CRISP: Persistent Concept Unlearning via Sparse Autoencoders Aaron Mueller, Dana Arad, Martin Tutek, Tomer Ashuach Published: 2025-08-19Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-08-19 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (97%) | 2 |
| LM Agents May Fail to Act on Their Own Risk Knowledge Chris J. Maddison, Elizabeth Li, Honghua Dong, Tianxiao Li Published: 2025-08-19Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2025-08-19 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R4 (95%) | - |
| Mechanistic Exploration of Backdoored Large Language Model Attention Patterns Lakshmi Babu-Saheer, Mohammed Abu Baker Published: 2025-08-19Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-08-19 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (94%) | - |
| Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA Chunyi Li, Dandan Zhu, Guangtao Zhai, Kaiwei Zhang Published: 2025-08-19Area: Deception & FailureCitations: 6 Tags: adversarial-robustness, ai-safety, deception-failure, empirical, safety-evaluation | 2025-08-19 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (95%) | 6 |
| Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation Dongyoon Hahm, Kimin Lee, Taywon Min, Woogyeol Jin Published: 2025-08-19Area: Agent SafetyCitations: 7 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-08-19 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 7 |
| CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features Adriano Koshiyama, Seonglae Cho, Zekun Wu Published: 2025-08-18Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-08-18 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (97%) | 1 |
| RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models Haoyang Chen, Jianhao Chen, Jianjie Huang, Mayi Xu Published: 2025-08-18Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Rethinking Safety in LLM Fine-tuning: An Optimization Perspective Adel Bibi, Bernard Ghanem, David Krueger, Fazl Barez Published: 2025-08-17Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-08-17 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 5 |
| Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position Jun Luo, Xurui Song, Zhixin Xie Published: 2025-08-17Area: Alignment TrainingCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-17 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 6 |
| Invitation Is All You Need! Promptware Attacks Against LLM-Powered Assistants in Production Are Practical and Dangerous Ben Nassi, Or Yair, Stav Cohen Published: 2025-08-16Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 4 |
| Mitigating Jailbreaks with Intent-Aware LLMs Erik Cambria, Ranjan Satapathy, Wei Jie Yeo Published: 2025-08-16Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 1 |
| Too Easily Fooled? Prompt Injection Breaks LLMs on Frustratingly Simple Multiple-Choice Questions Jiahao Zhang, Xuyang Guo, Zekai Huang, Zhao Song Published: 2025-08-16Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 3 |
| Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts Chiyu Zhang, Jiafei Wu, Liming Fang, Lu Zhou Published: 2025-08-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation Huizhen Shu, Mengqiu Tian, Qirui Wang, Xuying Li Published: 2025-08-14Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Searching for Privacy Risks in LLM Agents via Simulation Diyi Yang, Yanzhe Zhang Published: 2025-08-14Area: Agent SafetyCitations: 8 Tags: agent-safety, ai-safety, empirical | 2025-08-14 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R4 (91%) | 8 |
| Amazon Nova AI Challenge - Trusted AI: Advancing secure, AI-assisted software development Anna Gottardi, Desheng Zhang, Hangjie Shi, Lavina Vaz Published: 2025-08-13Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2025-08-13 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs Birong Pan, Jianhao Chen, Mayi Xu, Ming Zhong Published: 2025-08-13Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-08-13 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 1 |