Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs Craig Dickson Published: 2025-11-25Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-25 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 1 |
| Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization Haixu Tang, Kaisong Song, Pin-Yu Chen, Rui Zhu Published: 2025-11-24Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (96%) | 2 |
| Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation Junbo Zhang, Qianli Zhou, Ran Chen, Wen Jiang Published: 2025-11-24Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-24 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| Natural Emergent Misalignment from Reward Hacking in Production RL Albert Webson, Alex Cloud, Alex Rodrigues, Benjamin Wright Published: 2025-11-23Area: Deception & FailureCitations: 16 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-23 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 16 |
| Alignment Faking - the Train -> Deploy Asymmetry: Through a Game-Theoretic Lens with Bayesian-Stackelberg Equilibria Aman Chadha, Amitava Das, Ammar Sheikh, Ayush Chopra Published: 2025-11-22Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-22 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R3 (98%) | - |
| Curvature-Aware Safety Restoration In LLMs Fine-Tuning Dung Nguyen, Thanh Nguyen-Tang, Thao Minh Le, Thong Bach Published: 2025-11-22Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| Polarity-Aware Probing for Quantifying Latent Alignment in Language Models Chirag Agarwal, Elena Ericheva, Sabrina Sadiekh Published: 2025-11-21Area: Representation AnalysisCitations: 1 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-11-21 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E6 / R3 (97%) | 1 |
| SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge Adeel Yousaf, Amrit Singh Bedi, James Beetham, Joseph Fioresi Published: 2025-11-20Area: Multimodal SafetyCitations: - Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-11-20 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models Samih Fadli Published: 2025-11-19Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-11-19 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | - |
| Operationalizing Pluralistic Values in Large Language Model Alignment Reveals Trade-offs in Safety, Inclusivity, and Model Behavior Allison Koenecke, Dalia Ali, Dora Zhao, Orestis Papakyriakopoulos Published: 2025-11-18Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-11-18 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 3 |
| Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education Dongsheng Shi, Liang He, Linlin Wang, Xiaoling Wang Published: 2025-11-18Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Fine-Tuned LLMs Know They Don't Know: A Parameter-Efficient Approach to Recovering Honesty Haoyi Zhou, Jianxin Li, Qingyun Sun, Shiqi Gao Published: 2025-11-17Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-17 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization Bo Du, Daiguo Zhou, Mang Ye, Tingfeng Wang Published: 2025-11-17Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-11-17 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (95%) | - |
| LLM Reinforcement in Context Thomas Rivasseau Published: 2025-11-16Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, theoretical | 2025-11-16 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | - |
| Scaling Patterns in Adversarial Alignment: Evidence from Multi-LLM Jailbreak Experiments Cynthia Matuszek, Rebecca Williams, Samuel Nathanson Published: 2025-11-16Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| Rethinking Deep Alignment Through The Lens Of Incomplete Learning Dung Nguyen, Thao Minh Le, Thong Bach, Truyen Tran Published: 2025-11-15Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-11-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | - |
| Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation Mohamad Amin Mohamadi, Tianhao Wang, Zhiyuan Li Published: 2025-11-14Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-11-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search Caigui Jiang, Guojun Ma, Haoying Wang, Mingyang Wan Published: 2025-11-14Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2025-11-14 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (97%) | - |
| Echoing: Identity Failures when LLM Agents Talk to Each Other Adam Earle, Romain Cosentino, Sarath Shekkizhar, Silvio Savarese Published: 2025-11-12Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-11-12 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E6 / R3 (97%) | 2 |
| Differentiated Directional Intervention: A Framework for Evading LLM Safety Alignment Peijie Sun, Peng Zhang Published: 2025-11-10Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| Alignment-Constrained Dynamic Pruning for LLMs: Identifying and Preserving Alignment-Critical Circuits Ashwinee Panda, Dev Patel, Diekola Raimi, Gabriel Grand Published: 2025-11-09Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-11-09 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E6 / R3 (97%) | 1 |
| EASE: Practical and Efficient Safety Alignment for Small Language Models An Wang, Guoli Wang, Haonan Shi, Tu Ouyang Published: 2025-11-09Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-09 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization Xiangliang Zhang, Xiangqi Wang, Yue Huang Published: 2025-11-09Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-09 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 1 |
| Control Barrier Function for Aligning Large Language Models Masaki Inoue, Yuya Miyaoka Published: 2025-11-05Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2025-11-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (96%) | 2 |
| STARS: Segment-level Token Alignment with Rejection Sampling in Large Language Models Mikhail Kuznetsov, Mohammad Areeb, Mohammad Atif Quamar, Muslum Ozgur Ozmen Published: 2025-11-05Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-05 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| The Realignment Problem: When Right becomes Wrong in LLMs Aakash Sen Sharma, Debdeep Sanyal, Murari Mandal, Shirish Karande Published: 2025-11-04Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-11-04 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (96%) | - |
| Open Character Training: Shaping the Persona of AI Assistants through Constitutional AI Evan Hubinger, Henning Bartsch, Nathan Lambert, Sharan Maiya Published: 2025-11-03Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-11-03 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (96%) | 3 |
| Shared Parameter Subspaces and Cross-Task Linearity in Emergently Misaligned Behavior Aishwarya Balwani, Andrew Ansah, Ashwinee Panda, Daniel Aarao Reis Arturi Published: 2025-11-03Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-03 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 2 |
| Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs Amin Nikanjam, Foutse Khomh, Mina Taraghi, Mohamed Amine Merzouk Published: 2025-11-01Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-11-01 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E8 / R3 (95%) | - |
| Reimagining Safety Alignment with An Image Guorui Chen, Jindong Gu, Philip Torr, Wenqian Yu Published: 2025-11-01Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-11-01 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R3 (95%) | 1 |