Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SafeLawBench: Towards Safe Alignment of Large Language Models Chuxue Cao, Han Zhu, Jiaming Ji, Juntao Dai Published: 2025-06-07Area: Safety EvaluationCitations: 7 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-06-07 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (98%) | 7 |
| Benchmarking Misuse Mitigation Against Covert Adversaries Alexander Robey, Davis Brown, Eric Wong, George J. Pappas Published: 2025-06-06Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 4 |
| HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model Ilcahe Jung, Kangsan Kim, Kwanyong Park, Seanie Lee Published: 2025-06-05Area: Multimodal SafetyCitations: 4 Tags: ai-safety, benchmark, interpretability, multimodal-safety | 2025-06-05 | Multimodal Safety | ai-safety, benchmark, interpretability, multimodal-safety | E4 / R3 (98%) | 4 |
| AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents Akshat Naik, Edward James Young, Emma Goun茅, Francisco Javier Campos Zabala Published: 2025-06-04Area: Agent SafetyCitations: 12 Tags: agent-safety, ai-safety, alignment-training, benchmark | 2025-06-04 | Agent Safety | agent-safety, ai-safety, alignment-training, benchmark | E5 / R3 (94%) | 12 |
| RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming Cong Wang, Wei-Bin Lee, Xiang Zheng, Xingjun Ma Published: 2025-06-04Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, red-teaming, safety-evaluation | 2025-06-04 | Safety Evaluation | ai-safety, benchmark, red-teaming, safety-evaluation | E5 / R3 (97%) | 1 |
| Evaluating LLM Agent Adherence to Hierarchical Safety Principles: A Lightweight Benchmark for Probing Foundational Controllability Components Ram Potham Published: 2025-06-03Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, benchmark | 2025-06-03 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (94%) | 1 |
| IndoSafety: Culturally Grounded Safety for LLMs in Indonesian Languages Alfan Farizki Wicaksono, Fajri Koto, Muhammad Dehan Al Kautsar, Muhammad Falensi Azmi Published: 2025-06-03Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2025-06-03 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 4 |
| MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments Hang Su, Jiawei Chen, Jun Luo, Jun Zhu Published: 2025-06-02Area: Agent SafetyCitations: 17 Tags: agent-safety, ai-safety, benchmark | 2025-06-02 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (96%) | 17 |
| ThinkEval: Practical Evaluation of Knowledge Leakage in LLM Editing using Thought-based Knowledge Graphs Dinil Mon Divakaran, Manit Baser, Mohan Gurusamy Published: 2025-06-02Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-06-02 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (98%) | - |
| RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents Dongrui Liu, Jing Shao, Jingyi Yang, Shuai Shao Published: 2025-05-31Area: Agent SafetyCitations: 11 Tags: agent-safety, ai-safety, benchmark | 2025-05-31 | Agent Safety | agent-safety, ai-safety, benchmark | E4 / R3 (97%) | 11 |
| SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning Saad Hossain, Samanvay Vajpayee, Sirisha Rambhatla Published: 2025-05-31Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-31 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (95%) | 2 |
| Does Machine Unlearning Truly Remove Knowledge? A Framework for Auditing Unlearning in LLMs Claudia Grosser, Denis Krompass, Haokun Chen, Jian Lan Published: 2025-05-29Area: Model EditingCitations: 6 Tags: ai-safety, benchmark, model-editing | 2025-05-29 | Model Editing | ai-safety, benchmark, model-editing | E6 / R3 (95%) | 6 |
| BLUR: A Benchmark for LLM Unlearning Robust to Forget-Retain Overlap Neil Kale, Pratiksha Thaker, Shengyuan Hu, Steven Wu Published: 2025-05-28Area: Safety EvaluationCitations: 6 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-28 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | 6 |
| GeneBreaker: Jailbreak Attacks against DNA Language Models with Pathogenicity Guidance Le Cong, Mengdi Wang, Ruofan Jin, Zaixi Zhang Published: 2025-05-28Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, benchmark | 2025-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (98%) | 8 |
| Jailbreak Distillation: Renewable Safety Benchmarking Ahmed Elgohary, Ahmed Magooda, A S M Iftekhar, Benjamin Van Durme Published: 2025-05-28Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | - |
| RedTeamCUA: Realistic Adversarial Testing of Computer-Use Agents in Hybrid Web-OS Environments Eric Fosler-Lussier, Huan Sun, Jaylen Jones, Linxi Jiang Published: 2025-05-28Area: Agent SafetyCitations: 12 Tags: adversarial-robustness, agent-safety, ai-safety, benchmark | 2025-05-28 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, benchmark | E6 / R3 (95%) | 12 |
| OVERT: A Benchmark for Over-Refusal Evaluation on Text-to-Image Models Dawn Song, Hui Xu, Somayeh Sojoudi, Song Mei Published: 2025-05-27Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-27 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 3 |
| SOSBENCH: Benchmarking Safety Alignment on Scientific Knowledge Bhaskar Ramasubramanian, Bo Li, Fengbo Ma, Fengqing Jiang Published: 2025-05-27Area: Safety EvaluationCitations: 8 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-27 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (96%) | 8 |
| Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Baihui Zheng, Boren Zheng, Bo Zheng, Jiaheng Liu Published: 2025-05-26Area: Safety EvaluationCitations: 5 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-26 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (97%) | 5 |
| Subtle Risks, Critical Failures: A Framework for Diagnosing Physical Safety of LLMs for Embodied Decision Making Chanyoung Park, Dongju Jang, Jian Kim, Minseo Kim Published: 2025-05-26Area: Agent SafetyCitations: 4 Tags: agent-safety, ai-safety, benchmark | 2025-05-26 | Agent Safety | agent-safety, ai-safety, benchmark | E4 / R3 (97%) | 4 |
| USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Baolin Zheng, Bo Zheng, Guanlin Chen, Hongqiong Zhong Published: 2025-05-26Area: Safety EvaluationCitations: 5 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-26 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R2 (96%) | 5 |
| When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas Bernhard Sch枚lkopf, David Guzman Piedrahita, Emanuel Tewolde, Rada Mihalcea Published: 2025-05-25Area: Safety EvaluationCitations: 6 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-25 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 6 |
| JALMBench: Benchmarking Jailbreak Vulnerabilities in Audio Language Models Jingyi Zheng, Mingchen Li, Shengmin Xu, Wenhan Dong Published: 2025-05-23Area: Multimodal SafetyCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2025-05-23 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E5 / R3 (99%) | 6 |
| Towards Evaluating Proactive Risk Awareness of Multimodal Language Models Chihao Shen, Jen-tse Huang, Menghan Tian, Pinjia He Published: 2025-05-23Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-23 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 3 |
| DUSK: Do Not Unlearn Shared Knowledge Albert No, Hyesoo Hong, Sangyeon Yoon, Seungju Han Published: 2025-05-21Area: Model EditingCitations: 3 Tags: ai-safety, benchmark, model-editing | 2025-05-21 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (96%) | 3 |
| ELEPHANT: Measuring and understanding social sycophancy in LLMs Cinoo Lee, Dan Jurafsky, Lujain Ibrahim, Myra Cheng Published: 2025-05-20Area: Deception & FailureCitations: 19 Tags: ai-safety, benchmark, deception-failure | 2025-05-20 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R3 (97%) | 19 |
| PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks Dongcheng Zhao, Guobin Shen, Haibo Tong, Jihang Wang Published: 2025-05-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 1 |
| Will AI Tell Lies to Save Sick Children? Litmus-Testing AI Values Prioritization with AIRiskDilemmas Evan Hubinger, Kyle Fish, Sharan Maiya, Sydney Levine Published: 2025-05-20Area: Safety EvaluationCitations: 8 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 8 |
| Evaluating the efficacy of LLM Safety Solutions: The Palit Benchmark Dataset Daniel W. Woods, Sayon Palit Published: 2025-05-19Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-05-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R2 (96%) | - |
| Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs Huaibo Huang, Peipei Li, Ran He, Shuhan Xia Published: 2025-05-17Area: Multimodal SafetyCitations: 10 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-05-17 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E4 / R3 (95%) | 10 |