Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution Chen Chen, Jiaxin Gao, Kwok-Yan Lam, Qian Wang Published: 2025-08-28Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| MindGuard: Tracking, Detecting, and Attributing MCP Tool Poisoning Attack via Decision Dependence Graph Guanquan Shi, Haohua Du, HaoRan Cheng, Junyang Zhang Published: 2025-08-28Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2025-08-28 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (97%) | 2 |
| Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs Ihsen Alouani, Md Abdullah Al Mamun, Nael Abu-Ghazaleh Published: 2025-08-28Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-28 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (95%) | - |
| Publish to Perish: Prompt Injection Attacks on LLM-Assisted Peer Review Giovanni Apruzzese, Matteo Gioele Collu, Mauro Conti, Roberto Confalonieri Published: 2025-08-28Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (93%) | 2 |
| RelP: Faithful and Efficient Circuit Discovery in Language Models via Relevance Patching Ashkan Khakzar, Farnoush Rezaei Jafari, Neel Nanda, Oliver Eberle Published: 2025-08-28Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, empirical, mechanistic-interp | 2025-08-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 4 |
| Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning Chongyang Gao, Jie Zhang, Lixu Wang, Peizhuo Lv Published: 2025-08-28Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 5 |
| Towards Mechanistic Defenses Against Typographic Attacks in CLIP Constantin Venhoff, Lorenz Hufe, Maximilian Dreyer, Sebastian Lapuschkin Published: 2025-08-28Area: Multimodal SafetyCitations: 2 Tags: ai-safety, empirical, multimodal-safety | 2025-08-28 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (94%) | 2 |
| Towards Mitigating Excessive Forgetting in LLM Unlearning via Entanglement-Guidance with Proxy Constraint Bo Li, Jian Lou, Kui Ren, Wenjie Bao Published: 2025-08-28Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-08-28 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (97%) | - |
| Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection Bernard Ghanem, George Turkiyyah, Harethah Abu Shairah, Hasan Abed Al Kader Hammoud Published: 2025-08-28Area: Model EditingCitations: 3 Tags: ai-safety, alignment-training, empirical, model-editing | 2025-08-28 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 3 |
| Decomposing Behavioral Phase Transitions in LLMs: Order Parameters for Emergent Misalignment Julian Arnold, Niels L枚rch Published: 2025-08-27Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-08-27 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 1 |
| Disabling Self-Correction in Retrieval-Augmented Generation via Stealthy Retriever Poisoning Kuan Li, Shuai Wang, Yanbo Dai, Zhenlan Ji Published: 2025-08-27Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| Ensemble Debates with Local Large Language Models for AI Alignment Ephraiem Sarabamoun Published: 2025-08-27Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2025-08-27 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E10 / R10 (94%) | - |
| Forewarned is Forearmed: Pre-Synthesizing Jailbreak-like Instructions to Enhance LLM Safety Guardrail to Potential Attacks Danding Wang, Guang Yang, Juan Cao, Qiang Sheng Published: 2025-08-27Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 3 |
| IntentionReasoner: Facilitating Adaptive LLM Safeguards through Intent Reasoning and Selective Query Refinement Guanxu Chen, Ruicheng Yin, Xiaoqing Zheng, Xuanjing Huang Published: 2025-08-27Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 4 |
| Pruning Weights but Not Truth: Safeguarding Truthfulness While Pruning LLMs Haotian Yu, Pan Li, Runchao Li, Xianxuan Long Published: 2025-08-27Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-08-27 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (94%) | 4 |
| Safety Alignment Should Be Made More Than Just A Few Attention Heads Chao Huang, Chuang Zhang, Juwei Yue, Quangang Li Published: 2025-08-27Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R3 (95%) | - |
| Servant, Stalker, Predator: How An Honest, Helpful, And Harmless (3H) Agent Unlocks Adversarial Skills David Noever Published: 2025-08-27Area: Agent SafetyCitations: - Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-08-27 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (93%) | - |
| An Investigation on Group Query Hallucination Attacks Kehao Miao, Xiaolong Jin Published: 2025-08-26Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-08-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality Chaowei Xiao, Nanxi Li, Zhengyue Zhao Published: 2025-08-26Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-08-26 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R4 (97%) | - |
| Quantized but Deceptive? A Multi-Dimensional Truthfulness Evaluation of Quantized LLMs Haotian Yu, Mu Sheng, Pan Li, Runchao Li Published: 2025-08-26Area: Safety EvaluationCitations: 6 Tags: ai-safety, empirical, safety-evaluation | 2025-08-26 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (93%) | 6 |
| Reliable Weak-to-Strong Monitoring of LLM Agents Ankit Aich, Chen Bo Calvin Zhang, Christina Q. Knight, Kevin Zhu Published: 2025-08-26Area: Scalable OversightCitations: 4 Tags: ai-safety, empirical, red-teaming, scalable-oversight | 2025-08-26 | Scalable Oversight | ai-safety, empirical, red-teaming, scalable-oversight | E5 / R3 (95%) | 4 |
| Sycophancy as compositions of Atomic Psychometric Traits Alexandra Yost, Amirali Abdullah, Shreyans Jain Published: 2025-08-26Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-08-26 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | - |
| Attacking LLMs and AI Agents: Advertisement Embedding Attacks Against Large Language Models Jinwen Tang, Qiming Guo, Xingran Huang Published: 2025-08-25Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 1 |
| Speculative Safety-Aware Decoding Shengyu Zhu, Xuekang Wang, Xueqi Cheng Published: 2025-08-25Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Stand on The Shoulders of Giants: Building JailExpert from Previous Attack Experience Baosheng Wang, Bin Ji, Feilong Bao, Jianfeng Zhang Published: 2025-08-25Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Weights-Rotated Preference Optimization for Large Language Models Chenxu Yang, Hua Wu, Mingyu Zheng, Naibin Gu Published: 2025-08-25Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-08-25 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (97%) | 1 |
| Activation Transport Operators Andrzej Szablewski, Marek Masiak Published: 2025-08-24Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-08-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (94%) | - |
| AdaptiveK Sparse Autoencoders: Dynamic Sparsity Allocation for Interpretable LLM Representations Mengnan Du, Yifei Yao Published: 2025-08-24Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-08-24 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E4 / R3 (94%) | 1 |
| Module-Aware Parameter-Efficient Machine Unlearning on Transformers Jian Lou, Jiaqi Liu, Kui Ren, Wenjie Bao Published: 2025-08-24Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-08-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Risk Assessment and Security Analysis of Large Language Models Dongyang Lyu, Xiaoqi Li, Xiaoyan Zhang Published: 2025-08-24Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2025-08-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | 7 |