Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming Daojing He, Jing Li, Jun Yu, Min Zhang Published: 2025-05-22Area: Safety EvaluationCitations: 18 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2025-05-22 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E4 / R3 (94%) | 18 |
| ReasoningShield: Safety Detection over Reasoning Traces of Large Reasoning Models Changyi Li, Geng Hong, Jiayi Wang, Min Yang Published: 2025-05-22Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-05-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | - |
| An Example Safety Case for Safeguards Against Misuse Jonah Weinbaum, Joshua Clymer, Kimberly Mai, Robert Kirk Published: 2025-05-23Area: Safety EvaluationCitations: 3 Tags: ai-safety, safety-evaluation, theoretical | 2025-05-23 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (94%) | 3 |
| Discovering Forbidden Topics in Language Models Can Rager, Chris Wendler, David Bau, Rohit Gandikota Published: 2025-05-23Area: Safety EvaluationCitations: 4 Tags: ai-safety, empirical, safety-evaluation | 2025-05-23 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (97%) | 4 |
| Dynamic Risk Assessments for Offensive Cybersecurity Agents Benedikt Stroebl, Boyi Wei, Jiacen Xu, Joie Zhang Published: 2025-05-23Area: Safety EvaluationCitations: 4 Tags: ai-safety, empirical, safety-evaluation | 2025-05-23 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 4 |
| Evaluation Faking: Unveiling Observer Effects in Safety Evaluation of Frontier AI Systems Min Yang, Wenqi Zhang, Xudong Pan, Yihe Fan Published: 2025-05-23Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-05-23 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (96%) | 6 |
| Towards Evaluating Proactive Risk Awareness of Multimodal Language Models Chihao Shen, Jen-tse Huang, Menghan Tian, Pinjia He Published: 2025-05-23Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-23 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 3 |
| When Ethics and Payoffs Diverge: LLM Agents in Morally Charged Social Dilemmas Bernhard Sch枚lkopf, David Guzman Piedrahita, Emanuel Tewolde, Rada Mihalcea Published: 2025-05-25Area: Safety EvaluationCitations: 6 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-25 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 6 |
| Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Baihui Zheng, Boren Zheng, Bo Zheng, Jiaheng Liu Published: 2025-05-26Area: Safety EvaluationCitations: 5 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-26 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (97%) | 5 |
| Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs Aashiq Muhamed, Kun Zhang, Lingjing Kong, Mona T. Diab Published: 2025-05-26Area: Mechanistic Interp.Citations: 6 Tags: ai-safety, interpretability, mechanistic-interp, position, safety-evaluation | 2025-05-26 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position, safety-evaluation | E5 / R3 (95%) | 6 |
| USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models Baolin Zheng, Bo Zheng, Guanlin Chen, Hongqiong Zhong Published: 2025-05-26Area: Safety EvaluationCitations: 5 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-26 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R2 (96%) | 5 |
| OVERT: A Benchmark for Over-Refusal Evaluation on Text-to-Image Models Dawn Song, Hui Xu, Somayeh Sojoudi, Song Mei Published: 2025-05-27Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-27 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 3 |
| SOSBENCH: Benchmarking Safety Alignment on Scientific Knowledge Bhaskar Ramasubramanian, Bo Li, Fengbo Ma, Fengqing Jiang Published: 2025-05-27Area: Safety EvaluationCitations: 8 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-27 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (96%) | 8 |
| The Multilingual Divide and Its Impact on Global AI Safety Aakanksha, Ahmet 脺st眉n, Aidan Peppin, Alice Schoenauer Sebag Published: 2025-05-27Area: Safety EvaluationCitations: 4 Tags: ai-safety, safety-evaluation, survey | 2025-05-27 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (94%) | 4 |
| BLUR: A Benchmark for LLM Unlearning Robust to Forget-Retain Overlap Neil Kale, Pratiksha Thaker, Shengyuan Hu, Steven Wu Published: 2025-05-28Area: Safety EvaluationCitations: 6 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-28 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | 6 |
| Jailbreak Distillation: Renewable Safety Benchmarking Ahmed Elgohary, Ahmed Magooda, A S M Iftekhar, Benjamin Van Durme Published: 2025-05-28Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | - |
| Large Language Models Often Know When They Are Being Evaluated Giles Edkins, Govind Pimpale, Henning Bartsch, Joe Needham Published: 2025-05-28Area: Deception & FailureCitations: 31 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-05-28 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | 31 |
| Seven Security Challenges That Must be Solved in Cross-domain Multi-agent LLM Systems Chuan Xiao, Jiseong Jeong, Makoto Onizuka, Ronny Ko Published: 2025-05-28Area: Agent SafetyCitations: 10 Tags: agent-safety, ai-safety, position, safety-evaluation | 2025-05-28 | Agent Safety | agent-safety, ai-safety, position, safety-evaluation | E7 / R3 (96%) | 10 |
| CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring Benjamin Arnav, Hannes Whittingham, Mary Phuong, Nathan Helm-Burger Published: 2025-05-29Area: Safety EvaluationCitations: 14 Tags: ai-safety, empirical, safety-evaluation | 2025-05-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 14 |
| EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refusal to Pseudo-Malicious Instructions Chong Teng, Donghong Ji, Fei Li, Li Zheng Published: 2025-05-29Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-05-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R4 (97%) | 3 |
| A Red Teaming Roadmap Towards System-Level Safety Christina Q. Knight, Jeremy Kritz, Julian Michael, Willow E. Primack Published: 2025-05-30Area: Safety EvaluationCitations: 2 Tags: ai-safety, position, red-teaming, safety-evaluation | 2025-05-30 | Safety Evaluation | ai-safety, position, red-teaming, safety-evaluation | E5 / R3 (92%) | 2 |
| Existing Large Language Model Unlearning Evaluations Are Inconclusive Alexander Robey, Avi Schwarzschild, J. Zico Kolter, Robert Kirk Published: 2025-05-31Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-05-31 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E7 / R3 (94%) | 7 |
| SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning Saad Hossain, Samanvay Vajpayee, Sirisha Rambhatla Published: 2025-05-31Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-31 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (95%) | 2 |
| ThinkEval: Practical Evaluation of Knowledge Leakage in LLM Editing using Thought-based Knowledge Graphs Dinil Mon Divakaran, Manit Baser, Mohan Gurusamy Published: 2025-06-02Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-06-02 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (98%) | - |
| IndoSafety: Culturally Grounded Safety for LLMs in Indonesian Languages Alfan Farizki Wicaksono, Fajri Koto, Muhammad Dehan Al Kautsar, Muhammad Falensi Azmi Published: 2025-06-03Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2025-06-03 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 4 |
| RedDebate: Safer Responses through Multi-Agent Red Teaming Debates Ali Asad, Radin Shayanfar, Stephen Obadinma, Xiaodan Zhu Published: 2025-06-04Area: Safety EvaluationCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-06-04 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E7 / R4 (97%) | 3 |
| RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming Cong Wang, Wei-Bin Lee, Xiang Zheng, Xingjun Ma Published: 2025-06-04Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, red-teaming, safety-evaluation | 2025-06-04 | Safety Evaluation | ai-safety, benchmark, red-teaming, safety-evaluation | E5 / R3 (97%) | 1 |
| Watermarking Degrades Alignment in Language Models: Analysis and Mitigation Apurv Verma, NhatHai Phan, Shubhendu Trivedi Published: 2025-06-04Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-06-04 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 2 |
| Control Tax: The Price of Keeping AI in Check Caglar Gulcehre, Mikhail Terekhov, Samuel Albanie, Zhen Ning David Liu Published: 2025-06-05Area: Scalable OversightCitations: 3 Tags: ai-safety, empirical, safety-evaluation, scalable-oversight | 2025-06-05 | Scalable Oversight | ai-safety, empirical, safety-evaluation, scalable-oversight | E5 / R3 (94%) | 3 |
| Evaluating Prompt-Driven Chinese Large Language Models: The Influence of Persona Assignment on Stereotypes and Safeguards Carlo Alberto Bono, Francesco Pierri, Geng Liu, Li Feng Published: 2025-06-05Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-06-05 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 3 |