Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Large Language Models Often Know When They Are Being Evaluated Giles Edkins, Govind Pimpale, Henning Bartsch, Joe Needham Published: 2025-05-28Area: Deception & FailureCitations: 31 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-05-28 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | 31 |
| Seven Security Challenges That Must be Solved in Cross-domain Multi-agent LLM Systems Chuan Xiao, Jiseong Jeong, Makoto Onizuka, Ronny Ko Published: 2025-05-28Area: Agent SafetyCitations: 10 Tags: agent-safety, ai-safety, position, safety-evaluation | 2025-05-28 | Agent Safety | agent-safety, ai-safety, position, safety-evaluation | E7 / R3 (96%) | 10 |
| OVERT: A Benchmark for Over-Refusal Evaluation on Text-to-Image Models Dawn Song, Hui Xu, Somayeh Sojoudi, Song Mei Published: 2025-05-27Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-27 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 3 |
| SOSBENCH: Benchmarking Safety Alignment on Scientific Knowledge Bhaskar Ramasubramanian, Bo Li, Fengbo Ma, Fengqing Jiang Published: 2025-05-27Area: Safety EvaluationCitations: 8 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-27 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (96%) | 8 |
| The Multilingual Divide and Its Impact on Global AI Safety Aakanksha, Ahmet 脺st眉n, Aidan Peppin, Alice Schoenauer Sebag Published: 2025-05-27Area: Safety EvaluationCitations: 4 Tags: ai-safety, safety-evaluation, survey | 2025-05-27 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (94%) | 4 |
| Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Baihui Zheng, Boren Zheng, Bo Zheng, Jiaheng Liu Published: 2025-05-26Area: Safety EvaluationCitations: 5 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-26 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (97%) | 5 |
| Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs Aashiq Muhamed, Kun Zhang, Lingjing Kong, Mona T. Diab Published: 2025-05-26Area: Mechanistic Interp.Citations: 6 Tags: ai-safety, interpretability, mechanistic-interp, position, safety-evaluation | 2025-05-26 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position, safety-evaluation | E5 / R3 (95%) | 6 |
| USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Baolin Zheng, Bo Zheng, Guanlin Chen, Hongqiong Zhong Published: 2025-05-26Area: Safety EvaluationCitations: 5 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-26 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R2 (96%) | 5 |
| When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas Bernhard Sch枚lkopf, David Guzman Piedrahita, Emanuel Tewolde, Rada Mihalcea Published: 2025-05-25Area: Safety EvaluationCitations: 6 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-25 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 6 |
| An Example Safety Case for Safeguards Against Misuse Jonah Weinbaum, Joshua Clymer, Kimberly Mai, Robert Kirk Published: 2025-05-23Area: Safety EvaluationCitations: 3 Tags: ai-safety, safety-evaluation, theoretical | 2025-05-23 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (94%) | 3 |
| Discovering Forbidden Topics in Language Models Can Rager, Chris Wendler, David Bau, Rohit Gandikota Published: 2025-05-23Area: Safety EvaluationCitations: 4 Tags: ai-safety, empirical, safety-evaluation | 2025-05-23 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (97%) | 4 |
| Dynamic Risk Assessments for Offensive Cybersecurity Agents Benedikt Stroebl, Boyi Wei, Jiacen Xu, Joie Zhang Published: 2025-05-23Area: Safety EvaluationCitations: 4 Tags: ai-safety, empirical, safety-evaluation | 2025-05-23 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 4 |
| Evaluation Faking: Unveiling Observer Effects in Safety Evaluation of Frontier AI Systems Min Yang, Wenqi Zhang, Xudong Pan, Yihe Fan Published: 2025-05-23Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-05-23 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (96%) | 6 |
| Towards Evaluating Proactive Risk Awareness of Multimodal Language Models Chihao Shen, Jen-tse Huang, Menghan Tian, Pinjia He Published: 2025-05-23Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-23 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 3 |
| MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming Daojing He, Jing Li, Jun Yu, Min Zhang Published: 2025-05-22Area: Safety EvaluationCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2025-05-22 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E4 / R3 (94%) | 18 |
| ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models Changyi Li, Geng Hong, Jiayi Wang, Min Yang Published: 2025-05-22Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-05-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | - |
| PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks Dongcheng Zhao, Guobin Shen, Haibo Tong, Jihang Wang Published: 2025-05-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 1 |
| Soft Prompts for Evaluation: Measuring Conditional Distance of Capabilities Ross Nordby Published: 2025-05-20Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-05-20 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| The Hawthorne Effect in Reasoning Models: Evaluating and Steering Test Awareness Ahmed Salem, Sahar Abdelnabi Published: 2025-05-20Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-05-20 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (96%) | 7 |
| Will AI Tell Lies to Save Sick Children? Litmus-Testing AI Values Prioritization with AIRiskDilemmas Evan Hubinger, Kyle Fish, Sharan Maiya, Sydney Levine Published: 2025-05-20Area: Safety EvaluationCitations: 8 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 8 |
| Evaluating the efficacy of LLM Safety Solutions: The Palit Benchmark Dataset Daniel W. Woods, Sayon Palit Published: 2025-05-19Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-05-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R2 (96%) | - |
| Investigating the Vulnerability of LLM-as-a-Judge Architectures to Prompt-Injection Attacks Bislan Ashinov, Dmitry Namiot, Narek Maloyan Published: 2025-05-19Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-05-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R3 (95%) | 7 |
| Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization Dongha Lee, Dongjin Kang, Hyungjoo Chae, Jinyoung Yeo Published: 2025-05-19Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-05-19 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (96%) | 3 |
| Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs Huaibo Huang, Peipei Li, Ran He, Shuhan Xia Published: 2025-05-17Area: Multimodal SafetyCitations: 10 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-05-17 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E4 / R3 (95%) | 10 |
| CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs Chen-Hsiang Yu, Eric Hanchen Jiang, Mengxue Zhang, Qingcheng Zeng Published: 2025-05-16Area: Safety EvaluationCitations: 16 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-16 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 16 |
| Phare: A Safety Probe for Large Language Models Beno卯t Mal茅zieux, Matteo Dora, Pierre Le Jeune, Weixuan Xiao Published: 2025-05-16Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-16 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R5 (95%) | 1 |
| FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning Chandan K. Reddy, Fanyou Wu, Weijie Xu, Zhehao Zhang Published: 2025-05-12Area: Safety EvaluationCitations: 13 Tags: ai-safety, dataset, safety-evaluation | 2025-05-12 | Safety Evaluation | ai-safety, dataset, safety-evaluation | E5 / R3 (95%) | 13 |
| Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model Chi Chen, Jinan Xu, Kaiyu Huang, Xiangyu Shi Published: 2025-05-10Area: Multimodal SafetyCitations: 11 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety, safety-evaluation | 2025-05-10 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 11 |
| Red Teaming the Mind of the Machine: A Systematic Evaluation of Prompt Injection and Jailbreak Vulnerabilities in LLMs Chetan Pathade Published: 2025-05-07Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-05-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E7 / R3 (95%) | 30 |
| REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLMs Madhur Jindal, Saurabh Deshpande Published: 2025-05-07Area: Multimodal SafetyCitations: 3 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-05-07 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E6 / R4 (99%) | 3 |