Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Stop Reducing Responsibility in LLM-Powered Multi-Agent Systems to Local Alignment Boxuan Wang, Guangliang Cheng, Jinwei Hu, Lokesh Singh Published: 2025-10-15Area: Agent SafetyCitations: 4 Tags: agent-safety, ai-safety, alignment-training, position | 2025-10-15 | Agent Safety | agent-safety, ai-safety, alignment-training, position | E4 / R3 (92%) | 4 |
| When "Correct" Is Not Safe: Can We Trust Functionally Correct Patches Generated by Code Agents? Beidi Chen, Corina Pasareanu, Haizhong Zheng, James Song Published: 2025-10-15Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2025-10-15 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (97%) | - |
| MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents Dongsen Zhang, Peipei Li, Wenjun Xu, Xuannan Liu Published: 2025-10-14Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, benchmark | 2025-10-14 | Agent Safety | agent-safety, ai-safety, benchmark | E4 / R3 (98%) | 2 |
| A Survey on Agentic Security: Applications, Threats and Defenses Asif Shahriar, Farig Sadeque, Md Nafiu Rahman, Md Rizwan Parvez Published: 2025-10-07Area: Agent SafetyCitations: 6 Tags: adversarial-robustness, agent-safety, ai-safety, survey | 2025-10-07 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, survey | E6 / R4 (96%) | 6 |
| Adapting Insider Risk mitigations for Agentic Misalignment: an empirical study Francesca Gomez Published: 2025-10-06Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-10-06 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E6 / R3 (96%) | - |
| Agentic Misalignment: How LLMs Could Be Insider Threats Aengus Lynch, Benjamin Wright, Caleb Larson, Ethan Perez Published: 2025-10-05Area: Agent SafetyCitations: 55 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-10-05 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 55 |
| Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain Abhay Puri, Alexandre Drouin, Alexandre Lacoste, Chandra Kiran Reddy Evuru Published: 2025-10-03Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, empirical | 2025-10-03 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R4 (95%) | 1 |
| Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness Besmira Nushi, Erfan Shayegani, Keegan Hines, Nael Abu-Ghazaleh Published: 2025-10-02Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, benchmark | 2025-10-02 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (98%) | 1 |
| ToolTweak: An Attack on Tool Selection in LLM-based Agents Adel Bibi, Alasdair Paren, Eric Sommerlade, Jialin Yu Published: 2025-10-02Area: Agent SafetyCitations: 5 Tags: agent-safety, ai-safety, empirical | 2025-10-02 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (95%) | 5 |
| STAC: When Innocent Tools Form Dangerous Chains to Jailbreak LLM Agents Chao Shang, Devang Kulshreshtha, Hang Su, Jianfeng He Published: 2025-09-30Area: Agent SafetyCitations: 2 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-09-30 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (94%) | 2 |
| Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents Boxuan Zhang, Jiaxuan Guo, Jing Shao, Yi Yu Published: 2025-09-29Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, empirical, safety-evaluation | 2025-09-29 | Agent Safety | agent-safety, ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| Takedown: How It's Done in Modern Coding Agent Exploits Donghyeon Kim, Eunkyu Lee, Insu Yun, Wonyoung Kim Published: 2025-09-29Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2025-09-29 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (93%) | 2 |
| SafeSearch: Automated Red-Teaming for the Safety of LLM-Based Search Agents Han Qiu, Hao Wang, Jianshuo Dong, Ke Xu Published: 2025-09-28Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, benchmark | 2025-09-28 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (94%) | - |
| AI Kill Switch for Malicious Web-based LLM Agents Sangdon Park, Sechan Lee Published: 2025-09-26Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2025-09-26 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R4 (96%) | - |
| Regulating the Agency of LLM-based Agents Joshua Joseph, Se谩n Boddy Published: 2025-09-25Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, position | 2025-09-25 | Agent Safety | agent-safety, ai-safety, position | E5 / R3 (95%) | - |
| SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs Haifeng Wang, Hongfei Xiao, Hongru Wang, Qian Yu Published: 2025-09-09Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-09-09 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E4 / R3 (94%) | 1 |
| Mind Your Server: A Systematic Study of Parasitic Toolchain Attacks on the MCP Ecosystem Libo Chen, Qinsheng Hou, Shenghong Li, Shuli Zhao Published: 2025-09-08Area: Agent SafetyCitations: 6 Tags: agent-safety, ai-safety, empirical | 2025-09-08 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (96%) | 6 |
| Collaborate, Deliberate, Evaluate: How LLM Alignment Affects Coordinated Multi-Agent Outcomes Abhijnan Nath, Carine Graff, Nikhil Krishnaswamy Published: 2025-09-07Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-09-07 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 2 |
| MindGuard: Tracking, Detecting, and Attributing MCP Tool Poisoning Attack via Decision Dependence Graph Guanquan Shi, Haohua Du, HaoRan Cheng, Junyang Zhang Published: 2025-08-28Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2025-08-28 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (97%) | 2 |
| Servant, Stalker, Predator: How An Honest, Helpful, And Harmless (3H) Agent Unlocks Adversarial Skills David Noever Published: 2025-08-27Area: Agent SafetyCitations: - Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-08-27 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E5 / R3 (93%) | - |
| Incident Analysis for AI Agents Alan Chan, Carson Ezell, Xavier Roberts-Gaal Published: 2025-08-19Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, theoretical | 2025-08-19 | Agent Safety | agent-safety, ai-safety, theoretical | E5 / R3 (91%) | 2 |
| LM Agents May Fail to Act on Their Own Risk Knowledge Chris J. Maddison, Elizabeth Li, Honghua Dong, Tianxiao Li Published: 2025-08-19Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2025-08-19 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R4 (95%) | - |
| MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers Guanquan Shi, Haifeng Sun, Haohua Du, Haoran Cheng Published: 2025-08-19Area: Agent SafetyCitations: 17 Tags: agent-safety, ai-safety, benchmark | 2025-08-19 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (96%) | 17 |
| Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation Dongyoon Hahm, Kimin Lee, Taywon Min, Woogyeol Jin Published: 2025-08-19Area: Agent SafetyCitations: 7 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-08-19 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 7 |
| Systematic Analysis of MCP Security Peng Di, Puzhuo Liu, Sheng Wen, Wanlun Ma Published: 2025-08-18Area: Agent SafetyCitations: 17 Tags: agent-safety, ai-safety, benchmark | 2025-08-18 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (96%) | 17 |
| Searching for Privacy Risks in LLM Agents via Simulation Diyi Yang, Yanzhe Zhang Published: 2025-08-14Area: Agent SafetyCitations: 8 Tags: agent-safety, ai-safety, empirical | 2025-08-14 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R4 (91%) | 8 |
| Measuring Harmfulness of Computer-Using Agents Aaron Xuxiang Tian, Janet Tang, Jiaxin Wen, Ruofan Zhang Published: 2025-07-31Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, benchmark | 2025-07-31 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (97%) | 1 |
| Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition Alexander Grattan, Andy Zou, Ayla Croft, Dan Hendrycks Published: 2025-07-28Area: Agent SafetyCitations: 10 Tags: agent-safety, ai-safety, benchmark | 2025-07-28 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (98%) | 10 |
| WebGuard: Building a Generalizable Guardrail for Web Agents Boyuan Zheng, Dawn Song, Huan Sun, Michael Lin Published: 2025-07-18Area: Agent SafetyCitations: 7 Tags: agent-safety, ai-safety, dataset | 2025-07-18 | Agent Safety | agent-safety, ai-safety, dataset | E4 / R3 (95%) | 7 |
| Giving AI Agents Access to Cryptocurrency and Smart Contracts Creates New Vectors of AI Harm Ari Juels, Bill Marino Published: 2025-07-11Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, position | 2025-07-11 | Agent Safety | agent-safety, ai-safety, position | E6 / R3 (96%) | 2 |