Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Interpretable Reward Model via Sparse Autoencoder Hengxing Cai, Jiayi Liao, Shuyi Zhang, Sihang Li Published: 2025-08-12Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-08-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 6 |
| Jinx: Unlimited LLMs for Probing Alignment Failures Jiahao Zhao, Liwei Dong Published: 2025-08-11Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, safety-evaluation, tool | 2025-08-11 | Safety Evaluation | ai-safety, alignment-training, safety-evaluation, tool | E6 / R4 (96%) | - |
| Towards Effective MLLM Jailbreaking Through Balanced On-Topicness and OOD-Intensity Bernhard Kainz, Jingyuan Zhang, Mengyun Qiao, Shuyuan Zhang Published: 2025-08-11Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-08-11 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (95%) | - |
| SafeGrad: Gradient Surgery for Safe LLM Fine-Tuning Baolei Zhang, Biao Yi, Jiahao Li, Lihai Nie Published: 2025-08-10Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2025-08-10 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R3 (95%) | 6 |
| Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining Bing Han, Dongcheng Zhao, Feifei Zhao, Guobin Shen Published: 2025-08-08Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-08-08 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R3 (95%) | 1 |
| Towards Integrated Alignment Ben Y. Reis, William La Cava Published: 2025-08-08Area: Surveys & ReviewsCitations: - Tags: ai-safety, alignment-training, position, surveys-reviews | 2025-08-08 | Surveys & Reviews | ai-safety, alignment-training, position, surveys-reviews | E6 / R4 (93%) | - |
| P-Aligner: Enabling Pre-Alignment of Language Models via Principled Instruction Synthesis Bofei Gao, Feifan Song, Guoyin Wang, Houfeng Wang Published: 2025-08-06Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-08-06 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (97%) | 1 |
| Large Reasoning Models Are Autonomous Jailbreak Agents Erik Derner, Nuria Oliver, Thilo Hagendorff Published: 2025-08-04Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (96%) | 3 |
| TRACEALIGN - Tracing the Drift: Attributing Alignment Failures to Training-Time Belief Sources in LLMs Aman Chadha, Amitava Das, Amit Sheth, S M Mehedi Zaman Published: 2025-08-04Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R5 (98%) | - |
| UnsafeChain: Enhancing Reasoning Model Safety via Hard Cases Preslav Nakov, Raj Vardhan Tomar, Yuxia Wang Published: 2025-07-29Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, dataset | 2025-07-29 | Alignment Training | ai-safety, alignment-training, dataset | E7 / R4 (95%) | 4 |
| The Blessing and Curse of Dimensionality in Safety Alignment Laziz U. Abdullaev, Rachel S.Y. Teo, Tan M. Nguyen Published: 2025-07-27Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (93%) | 6 |
| The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models Xingcheng Xu Published: 2025-07-27Area: Formal/TheoreticalCitations: 4 Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-07-27 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E5 / R4 (96%) | 4 |
| Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment Hao Li, Jing Shao, Lei Sha, Lijun Li Published: 2025-07-24Area: Alignment TrainingCitations: 15 Tags: ai-safety, alignment-training, empirical | 2025-07-24 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 15 |
| LoRA is All You Need for Safety Alignment of Reasoning LLMs Baharan Mirzasoleiman, Yihao Xue Published: 2025-07-22Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-07-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2 |
| PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization Dongyao Zhu, Han Jiang, Xiaoyuan Yi, Xing Xie Published: 2025-07-22Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-07-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Steering Out-of-Distribution Generalization with Concept Ablation Fine-Tuning Adam Karvonen, Caden Juang, Helena Casademunt, Neel Nanda Published: 2025-07-22Area: Model EditingCitations: 13 Tags: ai-safety, alignment-training, empirical, interpretability, model-editing | 2025-07-22 | Model Editing | ai-safety, alignment-training, empirical, interpretability, model-editing | E6 / R3 (93%) | 13 |
| AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning An Zhang, Leheng Sheng, Xiang Wang, XiuYu Zhang Published: 2025-07-20Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2025-07-20 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (96%) | 5 |
| Subliminal Learning: Language models transmit behavioral traits via hidden signals in data Alex Cloud, Anna Sztyber-Betley, Jacob Hilton, James Chua Published: 2025-07-20Area: Deception & FailureCitations: 35 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-07-20 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R4 (96%) | 35 |
| Can We Predict Alignment Before Models Finish Thinking? Towards Monitoring Misaligned Reasoning Models Stephen H. Bach, Yik Siu Chan, Zheng-Xin Yong Published: 2025-07-16Area: Safety EvaluationCitations: 9 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-07-16 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 9 |
| Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities Michael Backes, Yang Zhang, Yiting Qu Published: 2025-07-15Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-07-15 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (98%) | 1 |
| Internal Value Alignment in Large Language Models through Controlled Value Vector Activation Defu Lian, Haoran Jin, Meng Li, Minlie Huang Published: 2025-07-15Area: Model EditingCitations: 3 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-07-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (93%) | 3 |
| The Devil behind the mask: An emergent safety vulnerability of Diffusion LLMs Chaochao Lu, Conghui He, Dongrui Liu, Haoyun Xu Published: 2025-07-15Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-15 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 11 |
| PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training Pengfei Du Published: 2025-07-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, red-teaming | 2025-07-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical, red-teaming | E5 / R3 (95%) | 2 |
| The Non-Linear Representation Dilemma: Is Causal Abstraction Enough for Mechanistic Interpretability? Denis Sutter, Julian Minder, Thomas Hofmann, Tiago Pimentel Published: 2025-07-11Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2025-07-11 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 11 |
| Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Chen Luo, Fali Wang, Hui Liu, Jingying Zeng Published: 2025-07-10Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2025-07-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 4 |
| On the Impossibility of Separating Intelligence from Judgment: The Computational Intractability of Filtering for AI Alignment Frauke Kreuter, Greg Gluch, Guy N. Rothblum, Omer Reingold Published: 2025-07-09Area: Formal/TheoreticalCitations: 4 Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2025-07-09 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E5 / R3 (97%) | 4 |
| Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation Haoyu Wang, Kailong Wang, Ling Shi, Shuai Yuan Published: 2025-07-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R3 (95%) | 1 |
| TuneShield: Mitigating Toxicity in Conversational AI while Fine-tuning on Untrusted Data Aravind Cheruvu, Bimal Viswanath, Daphne Yao, Murtuza Jadliwala Published: 2025-07-08Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-07-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Interpretable Reward Modeling with Active Concept Bottlenecks Julia E. Vogt, Katarzyna Kobalczyk, Mihaela van der Schaar, Sonia Laguna Published: 2025-07-07Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-07-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 1 |
| Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message Li Qian, Wei Duan Published: 2025-07-07Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-07-07 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E4 / R3 (95%) | - |