Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Are LLMs Good Safety Agents or a Propaganda Engine? Alberto Cazzaniga, Bernhard Sch枚lkopf, Francesco Ortu, Jiarui Liu Published: 2025-11-28Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-11-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| Decomposed Trust: Exploring Privacy, Adversarial Robustness, Fairness, and Ethics of Low-Rank LLMs Daniel Agyei Asante, Md Mokarram Chowdhury, Yang Li Published: 2025-11-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (95%) | - |
| Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs Arijit Ghosh Chowdhury, Dongkyu Derek Cho, Hannah Marlowe, Haotian An Published: 2025-11-26Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision Changtao Miao, Haojie Yuan, Junchi Chen, Nenghai Yu Published: 2025-11-26Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-11-26 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | - |
| Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines Dongyuan Lu, Jitao Sang, Yanxu Zhu, Yuhang Wang Published: 2025-11-26Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-26 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| TEAR: Temporal-aware Automated Red-teaming for Text-to-Video Models Guanyu Hou, Guowen Xu, Hongwei Li, Jiaming He Published: 2025-11-26Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-11-26 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E7 / R3 (96%) | - |
| Cross-LLM Generalization of Behavioral Backdoor Detection in AI Agent Supply Chains Arun Chowdary Sanna Published: 2025-11-25Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2025-11-25 | Agent Safety | agent-safety, ai-safety, empirical | E7 / R2 (97%) | - |
| Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models David Mohaisen, Trung Cuong Dang Published: 2025-11-25Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-11-25 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 2 |
| On the Feasibility of Hijacking MLLMs' Decision Chain via One Perturbation Changyue Li, Jiaming He, Jiaying Li, Pinjia He Published: 2025-11-25Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-11-25 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | - |
| Representation Interventions Enable Lifelong Unstructured Knowledge Control Haifeng Chen, Haoyu Wang, Shengyu Chen, Xinshuai Dong Published: 2025-11-25Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-25 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (94%) | - |
| SAGE: An Agentic Explainer Framework for Interpreting SAE Features in Language Models Jiaojiao Han, Mengnan Du, Mingyu Jin, Wujiang Xu Published: 2025-11-25Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-11-25 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (97%) | 1 |
| The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs Craig Dickson Published: 2025-11-25Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-25 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 1 |
| Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning Cees G. M. Snoek, Feng Li, Leijiang Gu, Meng Wang Published: 2025-11-25Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-11-25 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | 1 |
| Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization Haixu Tang, Kaisong Song, Pin-Yu Chen, Rui Zhu Published: 2025-11-24Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (96%) | 2 |
| FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models Enes Altinisik, Husrev Taha Sencar, Masoomali Fatehkia Published: 2025-11-24Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | - |
| Now You See It, Now You Don't - Instant Concept Erasure for Safe Text-to-Image and Video Generation Arani Roy, Kaushik Roy, Shristi Das Biswas Published: 2025-11-24Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-11-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 1 |
| RoguePrompt: Dual-Layer Ciphering for Self-Reconstruction to Circumvent LLM Moderation Benyamin Tafreshian Published: 2025-11-24Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (96%) | - |
| Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation Junbo Zhang, Qianli Zhou, Ran Chen, Wen Jiang Published: 2025-11-24Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-24 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| Natural Emergent Misalignment from Reward Hacking in Production RL Albert Webson, Alex Cloud, Alex Rodrigues, Benjamin Wright Published: 2025-11-23Area: Deception & FailureCitations: 16 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-23 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (95%) | 16 |
| TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization Jinghui Chen, Jinyuan Jia, Minhao Cheng, Runpeng Geng Published: 2025-11-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (98%) | - |
| Alignment Faking - the Train -> Deploy Asymmetry: Through a Game-Theoretic Lens with Bayesian-Stackelberg Equilibria Aman Chadha, Amitava Das, Ammar Sheikh, Ayush Chopra Published: 2025-11-22Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-22 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R3 (98%) | - |
| Curvature-Aware Safety Restoration In LLMs Fine-Tuning Dung Nguyen, Thanh Nguyen-Tang, Thao Minh Le, Thong Bach Published: 2025-11-22Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| Evaluating Adversarial Vulnerabilities in Modern Large Language Models Tom Perel Published: 2025-11-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | - |
| Geometric-disentanglement Unlearning Cheng Qian, Chengxiang Zhai, Duo Zhou, Hanghang Tong Published: 2025-11-21Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-11-21 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | 1 |
| Polarity-Aware Probing for Quantifying Latent Alignment in Language Models Chirag Agarwal, Elena Ericheva, Sabrina Sadiekh Published: 2025-11-21Area: Representation AnalysisCitations: 1 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-11-21 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E6 / R3 (97%) | 1 |
| Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models Joseph Gardiner, Sana Belguith, Stanislav Abaimov, Zhiyuan Xu Published: 2025-11-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| The Impact of Off-Policy Training Data on Probe Generalisation Adrians Skapars, Dmitrii Krasheninnikov, Ekdeep Singh Lubana, Nathalie Kirch Published: 2025-11-21Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2025-11-21 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (95%) | - |
| AutoBackdoor: Automating Backdoor Attacks via LLM Agents Hanxun Huang, Jun Sun, Nay Myat Min, Wei Zhao Published: 2025-11-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-20 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (95%) | 1 |
| Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision-Language Models Chi Harold Liu, Jianping Zhang, Lanqing Hong, Lichao Wang Published: 2025-11-20Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-11-20 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E6 / R3 (98%) | - |
| Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security Jun Sun, Wei Zhao, Yige Li, Zhe Li Published: 2025-11-20Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-11-20 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (97%) | 1 |