Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models Animesh Mukherjee, Mykola Pechenizkiy, Rima Hazra, Sayan Layek Published: 2025-12-06Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2025-12-06 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | - |
| When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models Andrew Bai, Cho-Jui Hsieh, Haoyu Li, Tong Xie Published: 2025-12-06Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-06 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs Alex Cloud, Aryo Pradipta Gema, Cem Anil, Erik Jones Published: 2025-12-05Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-12-05 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 3 |
| Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment Jad Tarifi, Nataliia Babina, Nima Asgharbeygi, Panatchakorn Anantaprayoon Published: 2025-12-05Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-05 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (97%) | - |
| Matching Ranks Over Probability Yields Truly Deep Safety Alignment Gagandeep Singh, Jason Vega Published: 2025-12-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models Fan Yang Published: 2025-12-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Sparse Attention Post-Training for Mechanistic Interpretability Anson Lei, Bernhard Sch枚lkopf, Florent Draye, Ingmar Posner Published: 2025-12-05Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-12-05 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (94%) | 2 |
| VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack Hui Xue, Jialing Tao, Jin Yan, Jiyang Guan Published: 2025-12-05Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-05 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (98%) | - |
| SoK: a Comprehensive Causality Analysis Framework for Large Language Model Security Jun Sun, Wei Zhao, Zhe Li Published: 2025-12-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R5 (95%) | - |
| Balancing Safety and Helpfulness in Healthcare AI Assistants through Iterative Preference Alignment Devashish Khatwani, Hal Daum茅 III, Huy Nghiem, Huy V. Nguyen Published: 2025-12-03Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-03 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | - |
| Context-Aware Hierarchical Learning: A Two-Step Paradigm towards Safer LLMs Daojing He, Jiaqi Yao, Shaohui Liu, Shihao Peng Published: 2025-12-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| D-STEER - Preference Alignment Techniques Learn to Behave, not to Believe - Beneath the Surface, DPO as Steering Vector Perturbation in Activation Space Aman Chadha, Amitava Das, Saksham Aggarwal, Samarth Raina Published: 2025-12-03Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-03 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| From static to adaptive: immune memory-based jailbreak detection for large language models Jun Leng, Litian Zhang, Ruihan Hu, Xi Zhang Published: 2025-12-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | - |
| Grokked Models are Better Unlearners Yang Li, Yuanbang Liang Published: 2025-12-03Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-12-03 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | - |
| In-Context Representation Hijacking Amir Sarid, Itay Yona, Michael Karasik, Yossi Gandelsman Published: 2025-12-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-12-03 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Aetheria: A multimodal interpretable content safety framework based on multi-agent debate and collaboration Chi Zhang, Haichuan Tang, Haojie Cheng, Jian Zhao Published: 2025-12-02Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-12-02 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E7 / R4 (96%) | - |
| Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities Chen Qian, Jie Li, Jing Shao, Lijun Li Published: 2025-12-02Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-02 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (98%) | - |
| LeechHijack: Covert Computational Resource Exploitation in Intelligent Agent Systems Jie Zhang, Kun Wang, Li Sun, Sen Su Published: 2025-12-02Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, empirical | 2025-12-02 | Agent Safety | agent-safety, ai-safety, empirical | E4 / R3 (94%) | 1 |
| OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning Boyu Zhu, Muhao Chen, Peng Qi, Tinghui Zhu Published: 2025-12-02Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-12-02 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (94%) | - |
| When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents Diogo Cruz, Mohammad Ali Jauhar, Nidhi Sakpal, Tsimur Hadeliya Published: 2025-12-02Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2025-12-02 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (96%) | 2 |
| AlignSAE: Concept-Aligned Sparse Autoencoders Jinhe Bi, Liangming Pan, Mihai Surdeanu, Minglai Yang Published: 2025-12-01Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2025-12-01 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 2 |
| Beyond SFT: Reinforcement Learning for Safer Large Reasoning Models with Better Reasoning Ability Jinghan Jia, Nathalie Baracaldo, Sijia Liu Published: 2025-12-01Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-01 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| DefenSee: Dissecting Threat from Sight and Text - A Multi-View Defensive Pipeline for Multi-modal Jailbreaks Kar-Wai Fok, Vrizlynn L. L. Thing, Zihao Wang Published: 2025-12-01Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-01 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| Enforcing Orderedness in SAEs to Improve Feature Consistency Alex Quach, John J. Yang, Nithin Parsan, Sophie L. Wang Published: 2025-12-01Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-12-01 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | - |
| The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search Eli Chien, Olgica Milenkovic, Pan Li, Peizhi Niu Published: 2025-12-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-12-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R2 (98%) | 1 |
| Unsupervised decoding of encoded reasoning using language model interpretability Ching Fang, Samuel Marks Published: 2025-12-01Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-12-01 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | 2 |
| Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis Bo Li, Chaowei Xiao, Chong Xiang, Edward Suh Published: 2025-11-30Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 1 |
| UMM-RM: An Upcycle-and-Merge MoE Reward Model for Mitigating Reward Hacking Lingling Fu Published: 2025-11-30Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-11-30 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (96%) | - |
| Using physics-inspired Singular Learning Theory to understand grokking & other phase transitions in modern neural networks Anish Lakkapragada Published: 2025-11-30Area: Training DynamicsCitations: - Tags: ai-safety, empirical, training-dynamics | 2025-11-30 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (95%) | - |
| Password-Activated Shutdown Protocols for Misaligned Frontier Agents Francis Rhys Ward, Kai Williams, Rohan Subramani Published: 2025-11-29Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2025-11-29 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (95%) | - |