Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Toward Preference-aligned Large Language Models via Residual-based Model Steering Andrea Tagarelli, Lucio La Cava Published: 2025-09-28Area: Representation AnalysisCitations: - Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-09-28 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (94%) | - |
| Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer Elias Kempf, Fazl Barez, Simon Schrodi, Thomas Brox Published: 2025-09-28Area: Deception & FailureCitations: 3 Tags: ai-safety, deception-failure, empirical | 2025-09-28 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 3 |
| A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models Albert No, Dongjae Jeon, Hyesoo Hong, Sangwoo Shin Published: 2025-09-27Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| Cognition-of-Thought Elicits Social-Aligned Reasoning in Large Language Models Min-Hsuan Yeh, Xuanming Zhang, Yixuan Li, Yuxuan Chen Published: 2025-09-27Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-09-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 3 |
| Dual-Space Smoothness for Robust and Balanced LLM Unlearning Han Yan, Meng Jiang, Zheyuan Liu Published: 2025-09-27Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2025-09-27 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E7 / R3 (93%) | 1 |
| Preventing Robotic Jailbreaking via Multimodal Domain Adaptation Alexander Robey, Christopher Agia, Francesco Marchiori, George J. Pappas Published: 2025-09-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Active Attacks: Red-teaming LLMs via Adaptive Environments Jinkyoo Park, Minsu Kim, Pierre-Luc St-Charles, Taeyoung Yun Published: 2025-09-26Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| AI Kill Switch for Malicious Web-based LLM Agents Sangdon Park, Sechan Lee Published: 2025-09-26Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2025-09-26 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R4 (96%) | - |
| Analysis of Variational Sparse Autoencoders Yuxiao Li, Zachary Baker Published: 2025-09-26Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-09-26 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | - |
| Backdoor Attribution: Elucidating and Controlling Backdoor in Language Models Biwei Huang, Kun Wang, Miao Yu, Moayad Aloqaily Published: 2025-09-26Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-09-26 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (98%) | - |
| Can Large Language Models Develop Gambling Addiction? Donghyeon Shin, Seungpil Lee, Sundong Kim, Yunjeong Lee Published: 2025-09-26Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2025-09-26 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (93%) | 2 |
| ChatInject: Abusing Chat Templates for Prompt Injection in LLM Agents Hwan Chang, Hwanhee Lee, Yonghyun Jun Published: 2025-09-26Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 9 |
| Concept-SAE: Active Causal Probing of Visual Model Behavior Chenchen Zhao, Jianrong Ding, Muxi Chen, Qiang Xu Published: 2025-09-26Area: Mechanistic Interp.Citations: - Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2025-09-26 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E6 / R4 (94%) | - |
| Erase or Hide? Suppressing Spurious Unlearning Neurons for Robust Unlearning Dong-Kyum Kim, Jea Kwon, Kyomin Jung, Meeyoung Cha Published: 2025-09-26Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 1 |
| Investigating Faithfulness in Large Audio Language Models Jin Xu, Qian Yang, Yunfei Chu Published: 2025-09-26Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-09-26 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | - |
| Memory Self-Regeneration: Uncovering Hidden Knowledge in Unlearned Models Agnieszka Polowczyk, Alicja Polowczyk, Joanna Waczy艅ska, Piotr Borycki Published: 2025-09-26Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-09-26 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 1 |
| OFMU: Optimization-Driven Framework for Machine Unlearning Mohammad Mohammadi Amiri, Sadia Asif Published: 2025-09-26Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-09-26 | Model Editing | ai-safety, empirical, model-editing | E4 / R2 (96%) | - |
| OpenAI's GPT-OSS-20B Model and Safety Alignment Issues in a Low-Resource Language Isa Inuwa-Dutse Published: 2025-09-26Area: Safety EvaluationCitations: 1 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-09-26 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 1 |
| OrtSAE: Orthogonal Sparse Autoencoders Uncover Atomic Features Alexey Dontsov, Andrey Galichin, Anton Korznikov, Elena Tutubalina Published: 2025-09-26Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2025-09-26 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (95%) | 2 |
| PSRT: Accelerating LRM-based Guard Models via Prefilled Safe Reasoning Traces Jiawei Zhao, Kejiang Chen, Nenghai Yu, Weiming Zhang Published: 2025-09-26Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| The Rogue Scalpel: Activation Steering Compromises LLM Safety Alexey Dontsov, Andrey Galichin, Anton Korznikov, Elena Tutubalina Published: 2025-09-26Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (98%) | 4 |
| We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong Gautam Siddharth Kashyap, Mark Dras, Usman Naseem Published: 2025-09-26Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-09-26 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | 2 |
| Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing Jun Sun, Wei Zhao, Yige Li, Zhe Li Published: 2025-09-26Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-09-26 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (98%) | - |
| You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors Bochuan Cao, Changjiang Li, Jinghui Chen, Ting Wang Published: 2025-09-26Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 5 |
| A Single Neuron Works: Precise Concept Erasure in Text-to-Image Diffusion Models Hui Xue, Jialing Tao, Jiaqi Weng, Qinqin He Published: 2025-09-25Area: Multimodal SafetyCitations: 3 Tags: ai-safety, empirical, multimodal-safety | 2025-09-25 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 3 |
| Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks Dachuan Lin, Dongcheng Zhao, Feifei Zhao, Guobin Shen Published: 2025-09-25Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 1 |
| Binary Autoencoder for Mechanistic Interpretability of Large Language Models Brian M. Kurkoski, Hakaze Cho, Haolin Yang, Naoya Inoue Published: 2025-09-25Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-09-25 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | - |
| Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training Bing Liu, Jaehwan Jeong, Junkai Zhang, Lifeng Jin Published: 2025-09-25Area: Alignment TrainingCitations: 11 Tags: ai-safety, alignment-training, empirical | 2025-09-25 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 11 |
| CLUE: Conflict-guided Localization for LLM Unlearning Framework Hang Chen, Jiaying Zhu, Wenya Wang, Xinyu Yang Published: 2025-09-25Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-09-25 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (93%) | - |
| FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction Adel Bibi, Alasdair Paren, Muyang Li, Philip Torr Published: 2025-09-25Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (94%) | 5 |