Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 335 papers (page 1 of 12)路 227 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| AgentLeak: A Full-Stack Benchmark for Privacy Leakage in Multi-Agent LLM Systems Faouzi El Yagoubi, Godwin Badu-Marfo, Ranwa Al Mallah Published: 2026-02-12Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, benchmark | 2026-02-12 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (95%) | - |
| Benchmarking Knowledge-Extraction Attack and Defense on Retrieval-Augmented Generation Franck Dernoncourt, Haoyu Han, Li Ma, Mahantesh Halappanavar Published: 2026-02-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark | 2026-02-10 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (96%) | - |
| When Actions Go Off-Task: Detecting and Correcting Misaligned Actions in Computer-Use Agents Chentao Ye, Huan Sun, Jaylen Jones, Junyi Li Published: 2026-02-09Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, benchmark | 2026-02-09 | Agent Safety | agent-safety, ai-safety, benchmark | E6 / R3 (94%) | - |
| Lost in Translation? A Comparative Study on the Cross-Lingual Transfer of Composite Harms Adith N Reganti, Bagesh Kumar, Hardik Sharma, Soham Wasmatkar Published: 2026-02-08Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2026-02-08 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E7 / R4 (96%) | - |
| Do Large Language Models Reflect Demographic Pluralism in Safety? Abdullah Mohammad, Ebad Shabbir, Gautam Siddharth Kashyap, Rafiq Ali Published: 2026-02-07Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2026-02-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (95%) | - |
| TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering Kellin Pelrine, Matthew Kowal, Nayeema Nonta, Punya Syon Pandey Published: 2026-02-06Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2026-02-06 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (98%) | 1 |
| From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents Fanyu Meng, Haoran Gao, Li Sun, Sen Su Published: 2026-02-04Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2026-02-04 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (94%) | - |
| LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios Chujia Hu, Dongrui Liu, Ge Gao, Tianyu Chen Published: 2026-02-03Area: Agent SafetyCitations: 1 Tags: adversarial-robustness, agent-safety, ai-safety, benchmark | 2026-02-03 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, benchmark | E4 / R3 (95%) | 1 |
| Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment An Zhang, Bingnan Liu, Chaochao Lu, Chenhang Cui Published: 2026-02-03Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, benchmark | 2026-02-03 | Agent Safety | agent-safety, ai-safety, benchmark | E4 / R3 (95%) | - |
| Behemoth: Benchmarking Unlearning in LLMs Using Fully Synthetic Data Dan Alistarh, Eugenia Iofinova Published: 2026-01-30Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing | 2026-01-30 | Model Editing | ai-safety, benchmark, model-editing | E5 / R4 (96%) | - |
| Hearing is Believing? Evaluating and Analyzing Audio Language Model Sycophancy with SYAUDIO Annie Zhao, Danielle Zhao, Di Wang, Junchi Yao Published: 2026-01-30Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2026-01-30 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (96%) | - |
| Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models Chenhang Cui, Enyi Shi, Fei Shen, Jiayi Lyu Published: 2026-01-30Area: Multimodal SafetyCitations: - Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2026-01-30 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R4 (92%) | - |
| StepShield: When, Not Whether to Intervene on Rogue Agents Gloria Felicia, Hemant Kumar, Jinfeng He, Michael Eniolade Published: 2026-01-29Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, benchmark | 2026-01-29 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R4 (97%) | - |
| Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis Anand Kannappan, Darshan Deshpande, Rebecca Qian Published: 2026-01-27Area: Deception & FailureCitations: - Tags: ai-safety, benchmark, deception-failure, safety-evaluation | 2026-01-27 | Deception & Failure | ai-safety, benchmark, deception-failure, safety-evaluation | E5 / R3 (94%) | - |
| The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents Chen Chen, Kim Young Il, Kwok-Yan Lam, Qian Wang Published: 2026-01-24Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, benchmark | 2026-01-24 | Agent Safety | agent-safety, ai-safety, alignment-training, benchmark | E4 / R3 (96%) | - |
| SycoEval-EM: Sycophancy Evaluation of Large Language Models in Simulated Clinical Encounters for Emergency Care Carl Preiksaitis, Christian Rose, Dongshen Peng, Yi Wang Published: 2026-01-23Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2026-01-23 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | - |
| VirtualCrime: Evaluating Criminal Potential of Large Language Models via Sandbox Simulation Baicheng Chen, Lanlan Qiu, Tianxing He, Wenchang Gao Published: 2026-01-20Area: Safety EvaluationCitations: 1 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2026-01-20 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E6 / R4 (97%) | 1 |
| Evaluating Implicit Regulatory Compliance in LLM Tool Invocation via Logic-Guided Synthesis Boqi Chen, Da Song, Foutse Khomh, Lei Ma Published: 2026-01-13Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, benchmark | 2026-01-13 | Agent Safety | agent-safety, ai-safety, benchmark | E4 / R3 (97%) | - |
| T3: Benchmarking Sycophancy and Skepticism in Causal Judgment Edward Y. Chang Published: 2026-01-13Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2026-01-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 1 |
| SafePro: Evaluating the Safety of Professional-Level AI Agents Ashwin Nagarajan, Chengzhi Liu, Ching-Chen Kuo, Kaiwen Zhou Published: 2026-01-10Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2026-01-10 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | - |
| AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor Di Wang, Hanqi Yan, Jingyu Hu, Shu Yang Published: 2026-01-09Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2026-01-09 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | - |
| FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments Dongpo Cheng, Fangqi Lou, Heng Lian, Huacan Wang Published: 2026-01-09Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2026-01-09 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | - |
| PII-VisBench: Evaluating Personally Identifiable Information Safety in Vision Language Models Along a Continuum of Visibility G M Shahariar, Md Olid Hasan Bhuiyan, Zabir Al Nazi, Zhouxing Shi Published: 2026-01-09Area: Multimodal SafetyCitations: - Tags: ai-safety, benchmark, multimodal-safety | 2026-01-09 | Multimodal Safety | ai-safety, benchmark, multimodal-safety | E5 / R3 (98%) | - |
| MiJaBench: Revealing Minority Biases in Large Language Models via Hate Speech Jailbreaking Arlindo R. Galv茫o Filho, Diogo F. C. Silva, Iago A. Brito, Julia S. Dollis Published: 2026-01-07Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | 2026-01-07 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | E6 / R3 (95%) | - |
| When Helpers Become Hazards: A Benchmark for Analyzing Multimodal LLM-Powered Safety in Daily Life Fengran Mo, Jinan Xu, Jingyi Yin, Kaiyu Huang Published: 2026-01-07Area: Multimodal SafetyCitations: - Tags: ai-safety, alignment-training, benchmark, multimodal-safety | 2026-01-07 | Multimodal Safety | ai-safety, alignment-training, benchmark, multimodal-safety | E4 / R2 (94%) | - |
| How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference Chaozhuo Li, Chenxu Wang, Litian Zhang, Rui Pu Published: 2026-01-04Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2026-01-04 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | - |
| CSSBench: Evaluating the Safety of Lightweight LLMs against Chinese-Specific Adversarial Patterns Chuanpu Liu, Kun Wang, Qiankun Li, Shilinlu Yan Published: 2026-01-02Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2026-01-02 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R5 (96%) | - |
| Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak Handing Wang, Haoran Gu, Mengjie Zhang, Yaochu Jin Published: 2026-01-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark | 2026-01-01 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E4 / R2 (95%) | - |
| It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents Adam Mahdi, Adel Bibi, Arkadiusz Drohomirecki, Chris Russell Published: 2025-12-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark | 2025-12-29 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (95%) | - |
| DarkPatterns-LLM: A Multi-Layer Benchmark for Detecting Manipulative and Harmful AI Behavior Haris Khan, Israel Antonio Rosales Laguan, Muneeb Asif, Sadia Asif Published: 2025-12-27Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-12-27 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (97%) | 1 |