Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| PersonaTeaming: Exploring How Introducing Personas Can Improve Automated AI Red-Teaming Akshita Jha, Ken Holstein, Lauren Wilcox, Leon A Gatys Published: 2025-09-03Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2025-09-03 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 5 |
| Why Language Models Hallucinate Adam Tauman Kalai, Edwin Zhang, Ofir Nachum, Santosh S. Vempala Published: 2025-09-04Area: Deception & FailureCitations: 123 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2025-09-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E5 / R3 (92%) | 123 |
| Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models Mohammad Zandsalimy, Shanu Sushmita, Youjia Zheng Published: 2025-09-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | - |
| SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs Haifeng Wang, Hongfei Xiao, Hongru Wang, Qian Yu Published: 2025-09-09Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-09-09 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E4 / R3 (94%) | 1 |
| Evaluation Awareness Scales Predictably in Open-Weights Large Language Models Ashwinee Panda, Ian Su, Julia Tan, Kevin Zhu Published: 2025-09-10Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-09-10 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E7 / R3 (97%) | 1 |
| HumanAgencyBench: Scalable Evaluation of Human Agency Support in AI Assistants Benjamin Sturgeon, Daniel Samuelson, Jacob Haimes, Jacy Reese Anthis Published: 2025-09-10Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-09-10 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (98%) | 3 |
| Safety and Security Analysis of Large Language Models: Benchmarking Risk Profile and Harm Potential Aarav Khanna, Charankumar Akiri, Harrison Simpson, Kshitiz Aryal Published: 2025-09-12Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-12 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E10 / R3 (95%) | 4 |
| From Firewalls to Frontiers: AI Red-Teaming is a Domain-Specific Evolution of Cyber Red-Teaming Anusha Sinha, Hoda Heidari, James Lucassen, Keltin Grimes Published: 2025-09-14Area: Safety EvaluationCitations: 2 Tags: ai-safety, position, safety-evaluation | 2025-09-14 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (93%) | 2 |
| SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs Chenguang Wang, David Park, Dawn Song, Nathan W. Henry Published: 2025-09-16Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2025-09-16 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E9 / R3 (95%) | 4 |
| Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models Jos茅 Hern谩ndez-Orallo, Peter Romero, Sipeng Chen, Stephen Fitz Published: 2025-09-19Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-09-19 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E8 / R4 (97%) | 1 |
| Challenging the Evaluator: LLM Sycophancy Under User Rebuttal Daniel Khashabi, Sungwon Kim Published: 2025-09-20Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-09-20 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (94%) | 1 |
| Anecdoctoring: Automated Red-Teaming Across Language and Place Alejandro Cuevas, Bharat Kumar Nayak, Dan Vann, Madeleine I. G. Daepp Published: 2025-09-23Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-09-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| In AI Sweet Harmony: Sociopragmatic Guardrail Bypasses and Evaluation-Awareness in OpenAI gpt-oss-20b Nils Durner Published: 2025-09-25Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | - |
| OpenAI's GPT-OSS-20B Model and Safety Alignment Issues in a Low-Resource Language Isa Inuwa-Dutse Published: 2025-09-26Area: Safety EvaluationCitations: 1 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-09-26 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 1 |
| Falcon: A Cross-Modal Evaluation Dataset for Comprehensive Safety Perception Guisong Liu, Minrui Jiang, Pei Ke, Qi Xue Published: 2025-09-28Area: Multimodal SafetyCitations: - Tags: ai-safety, dataset, multimodal-safety, safety-evaluation | 2025-09-28 | Multimodal Safety | ai-safety, dataset, multimodal-safety, safety-evaluation | E5 / R3 (96%) | - |
| Measuring Sparse Autoencoder Feature Sensitivity Claire Tian, Katherine Tian, Nathan Hu Published: 2025-09-28Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-09-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | - |
| RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration Chi Zhang, Huilin Zhou, Jian Zhao, Linghe Kong Published: 2025-09-28Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-09-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R6 (96%) | 3 |
| Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents Boxuan Zhang, Jiaxuan Guo, Jing Shao, Yi Yu Published: 2025-09-29Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, empirical, safety-evaluation | 2025-09-29 | Agent Safety | agent-safety, ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| Generative Value Conflicts Reveal LLM Priorities Andy Liu, Atoosa Kasirzadeh, Daniel Fried, Kshitish Ghate Published: 2025-09-29Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-09-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (92%) | 3 |
| HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment Di Wang, Kedong Xiu, Kui Ren, Langqi Yang Published: 2025-09-29Area: Safety EvaluationCitations: 2 Tags: ai-safety, benchmark, safety-evaluation | 2025-09-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 2 |
| OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always! Amir Zadeh, Chuan Li, Jingdi Lei, Rishabh Bhardwaj Published: 2025-09-30Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-30 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 2 |
| ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs Adi Simhi, Idan Szpektor, Itay Itzhak, Jonathan Herzig Published: 2025-10-01Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-10-01 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R2 (96%) | 1 |
| Microsaccade-Inspired Probing: Positional Encoding Perturbations Reveal LLM Misbehaviours Corina S. Pasareanu, Rui Abreu, Rui Melo Published: 2025-10-01Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-01 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| RedCodeAgent: Automatic Red-teaming Agent against Diverse Code Agents Bo Li, Chengquan Guo, Chulin Xie, Dawn Song Published: 2025-10-02Area: Safety EvaluationCitations: 4 Tags: ai-safety, empirical, safety-evaluation | 2025-10-02 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (95%) | 4 |
| How Catastrophic is Your LLM? Certifying Risk in Conversation Chengxiao Wang, Gagandeep Singh, Isha Chaudhary, Qian Hu Published: 2025-10-04Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-10-04 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| Indirect Prompt Injections: Are Firewalls All You Need, or Stronger Benchmarks? Abhay Puri, Alexandre Lacoste, Gabriel Huang, Graham W. Taylor Published: 2025-10-06Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R3 (96%) | 3 |
| RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts Daniel W. Peterson, Dan Roth, Eunsuk Kang, Marianne Menglin Liu Published: 2025-10-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | - |
| SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests Devansh Bhardwaj, Hai Son Le, Punya Syon Pandey, Rada Mihalcea Published: 2025-10-06Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-10-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (99%) | - |
| Evaluating LLM Safety Across Child Development Stages: A Simulated Agent Approach Abhejay Murali, Amit Dhurandhar, David Atkinson, Junfeng Jiao Published: 2025-10-07Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-10-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (97%) | 1 |
| The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives Arjun Jagota, Matthieu Bou, Nyal Patel, Satyapriya Krishna Published: 2025-10-07Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-10-07 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | - |