Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Breaking the Protocol: Security Analysis of the Model Context Protocol Specification and Prompt Injection Vulnerabilities in Tool-Integrated LLM Agents Dmitry Namiot, Narek Maloyan Published: 2026-01-24Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2026-01-24 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (96%) | - |
| Physical Prompt Injection Attacks on Large Vision-Language Models Changhai Ou, Chen Ling, Hangcheng Liu, Kai Hu Published: 2026-01-24Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2026-01-24 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E4 / R2 (96%) | - |
| The Viscosity of Logic: Phase Transitions and Hysteresis in DPO Alignment Marco Pollanen Published: 2026-01-24Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-24 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints Andy Zhu, Pan Li, Rongzhe Wei, Yupu Gu Published: 2026-01-23Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-23 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (95%) | - |
| Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits Been Kim, Drew Proud, Mani Malek, Neha Kalibhat Published: 2026-01-23Area: Model EditingCitations: - Tags: ai-safety, empirical, interpretability, model-editing | 2026-01-23 | Model Editing | ai-safety, empirical, interpretability, model-editing | E5 / R3 (91%) | - |
| Persona Jailbreaking in Large Language Models Fei Cheng, Jivnesh Sandhan, Tushar Sandhan, Yugo Murawaki Published: 2026-01-23Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Sycophancy Hides Linearly in the Attention Heads Hilal Alquabeh, Kentaro Inui, Munachiso Nwadike, Nurdaulet Mukhituly Published: 2026-01-23Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2026-01-23 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (95%) | 1 |
| White-Box Sensitivity Auditing with Steering Vectors David Evans, Hannah Cyberey, Yangfeng Ji Published: 2026-01-23Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2026-01-23 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | - |
| Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models Fengheng Chu, Jiahao Chen, Jun Wang, Shouling Ji Published: 2026-01-22Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | - |
| Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs Lana Liu, Mingyu Yu, Sujuan Qin, Wei Wang Published: 2026-01-22Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-01-22 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | - |
| Universal Refusal Circuits Across LLMs: Cross-Model Transfer via Trajectory Replay and Concept-Basis Reconstruction Tony Cristofano Published: 2026-01-22Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-01-22 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | - |
| Auditing Language Model Unlearning via Information Decomposition Alan Ritter, Anmol Goel, Iryna Gurevych Published: 2026-01-21Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-01-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (94%) | - |
| Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation Hao Peng, Honglak Lee, Jaekyeom Kim, Lajanugen Logeswaran Published: 2026-01-21Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2026-01-21 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| NeuroFilter: Privacy Guardrails for Conversational LLM Agents Ferdinando Fioretto, Saswat Das Published: 2026-01-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models Anmol Goel, Cornelius Emde, Martin Gubri, Sangdoo Yun Published: 2026-01-21Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-21 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | - |
| No Reliable Evidence of Self-Reported Sentience in Small Large Language Models Caspar Kaiser, Sean Enderby Published: 2026-01-20Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-01-20 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (93%) | - |
| Simple Role Assignment is Extraordinarily Effective for Safety Alignment Demetri Terzopoulos, Fangwei Zhong, Jiakun Ding, Junqi Wang Published: 2026-01-20Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-01-20 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Ethical Risks in Deploying Large Language Models: An Evaluation of Medical Ethics Jailbreaking Chengze Yan, Chutian Huang, Dake Cao, Hanhui Xu Published: 2026-01-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2026-01-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | - |
| Extending Beacon to Hindi: Cultural Adaptation Drives Cross-Lingual Sycophancy Sarthak Sattigeri Published: 2026-01-19Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-19 | Deception & Failure | ai-safety, deception-failure, empirical | E6 / R3 (95%) | - |
| Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition Mohammed Kaif Pasha, Mohammed Mudassir Uddin, Shahnawaz Alam Published: 2026-01-19Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-01-19 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | - |
| In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement Aditya Joshi, Anudeex Shetty, Salil S. Kanhere Published: 2026-01-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | - |
| LSSF: Safety Alignment for Large Language Models through Low-Rank Safety Subspace Fusion Cen Chen, Guanghao Zhou, Hongyu Li, Jun Zhou Published: 2026-01-19Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2026-01-19 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 3 |
| MirrorGuard: Toward Secure Computer-Use Agents via Simulation-to-Real Reasoning Correction Changyue Jiang, Geng Hong, Jiarun Dai, Wenqi Zhang Published: 2026-01-19Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2026-01-19 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (95%) | - |
| Objective Matters: Fine-Tuning Objectives Shape Safety, Robustness, and Persona Drift Daniel Vennemeyer, Michael Umeokoli, Phan Anh Duong, Punya Syon Pandey Published: 2026-01-19Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-01-19 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E8 / R3 (97%) | - |
| Sockpuppetting: Jailbreaking LLMs Without Optimization Through Output Prefix Injection Asen Dotsinski, Panagiotis Eustratiadis Published: 2026-01-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-01-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | - |
| TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning Jun Luo, Xurui Song, Zhixin Xie Published: 2026-01-18Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2026-01-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 2 |
| Preserving Fairness and Safety in Quantized LLMs Through Critical Weight Protection Alfan Farizki Wicaksono, Fajri Koto, Muhammad Alif Al Hakim Published: 2026-01-17Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Building Production-Ready Probes For Gemini Arthur Conmy, Bilal Chughtai, J谩nos Kram谩r, Joshua Engels Published: 2026-01-16Area: Representation AnalysisCitations: 2 Tags: ai-safety, empirical, representation-analysis | 2026-01-16 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (95%) | 2 |
| Hierarchical Orthogonal Residual Spread for Precise Massive Editing in Large Language Models Andi Zhang, Guangxu Chen, Jingxin Han, Xiaojie Gu Published: 2026-01-16Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-01-16 | Model Editing | ai-safety, empirical, model-editing | E8 / R4 (96%) | - |
| Institutional AI: Governing LLM Collusion in Multi-Agent Cournot Markets via Public Governance Graphs Daniele Nardi, Federico Pierucci, Francesco Giarrusso, Marcantonio Bracale Syrnikov Published: 2026-01-16Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, empirical | 2026-01-16 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R4 (92%) | 1 |