Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Benchmarking and Understanding Safety Risks in AI Character Platforms Gareth Tyson, Peixian Zhang, Yiluo Wei Published: 2025-12-01Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-12-01 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | - |
| When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals Md Labid Al Nahiyan, Md Tanvir Hassan, Riad Ahmed Anonto Published: 2025-11-30Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-11-30 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R2 (96%) | 1 |
| Are LLMs Good Safety Agents or a Propaganda Engine? Alberto Cazzaniga, Bernhard Sch枚lkopf, Francesco Ortu, Jiarui Liu Published: 2025-11-28Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-11-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts Chaojun Xiao, Felix Steffek, Holli Sargeant, Huimin Chen Published: 2025-11-25Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-11-25 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (95%) | - |
| Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models David Mohaisen, Trung Cuong Dang Published: 2025-11-25Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-11-25 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 2 |
| Can LLMs Threaten Human Survival? Benchmarking Potential Existential Threats from LLMs via Prefix Completion Cong Zuo, Haibin Zhang, Hang Fu, Licheng Wang Published: 2025-11-24Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-11-24 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 1 |
| Why Do Language Model Agents Whistleblow? Asa Cooper Stickland, Frank Xiao, Guido Bergman, Kushal Agrawal Published: 2025-11-21Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-11-21 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E6 / R4 (95%) | 1 |
| AssurAI: Experience with Constructing Korean Socio-cultural Datasets to Discover Potential Risks of Generative AI Chae-Gyun Lim, Dasom Choi, Donggyu Yoon, Dongkun Lee Published: 2025-11-20Area: Safety EvaluationCitations: - Tags: ai-safety, dataset, safety-evaluation | 2025-11-20 | Safety Evaluation | ai-safety, dataset, safety-evaluation | E5 / R4 (98%) | - |
| Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models Samih Fadli Published: 2025-11-19Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-11-19 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | - |
| SafeRBench: A Comprehensive Benchmark for Safety Assessment in Large Reasoning Models Chenyang Si, Guanghao Li, Jian Liang, Jianxiong Gao Published: 2025-11-19Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-11-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | - |
| Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks Daoyuan Wu, Pingchuan Ma, Shuai Wang, Tian Tian Published: 2025-11-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-11-19 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, survey | E6 / R3 (95%) | - |
| N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator Hengqi Guo, Jirui Yang, Yao Guan, Yubing Bao Published: 2025-11-18Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-11-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R4 (97%) | - |
| ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models Gaotian Liu, Junhua Liu, Kaishuo Wei, Kejia Zhang Published: 2025-11-17Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-11-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Lingjuan Lyu, Yaochu Jin, Yingchao Yu, Yuanshuai Li Published: 2025-11-13Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-11-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | - |
| Uncovering Strategic Egoism Behaviors in Large Language Models Aishan Liu, Jiangfan Liu, Qihang Zhang, Xianglong Liu Published: 2025-11-13Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-11-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 1 |
| Pluralistic Behavior Suite: Stress-Testing Multi-Turn Adherence to Custom Behavioral Policies Christopher Parisien, Liwei Jiang, Makesh Narsimhan Sreedhar, Prasoon Varshney Published: 2025-11-07Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-11-07 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | - |
| LiveSecBench: A Dynamic and Event-Driven Safety Benchmark for Chinese Language Model Applications Baocheng Chen, Haitian Li, Kecheng Wang, Kejiang Chen Published: 2025-11-04Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-11-04 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | - |
| Optimizing AI Agent Attacks With Synthetic Data Avery Griffin, Chloe Loughridge, Joe Benton, Jon Kutasov Published: 2025-11-04Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-11-04 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 3 |
| Deep Value Benchmark: Measuring Whether Models Generalize Deep Values or Shallow Preferences Ceren Budak, Eric Gilbert, Hua Shen, Joshua Ashkinaze Published: 2025-11-03Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-11-03 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 1 |
| Do Methods to Jailbreak and Defend LLMs Generalize Across Languages? Berk Atil, Fred Morstatter, Rebecca J. Passonneau Published: 2025-11-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs Amin Nikanjam, Foutse Khomh, Mina Taraghi, Mohamed Amine Merzouk Published: 2025-11-01Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-11-01 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E8 / R3 (95%) | - |
| Red-teaming Activation Probes using Prompted LLMs Phil Blandfort, Robert Graham Published: 2025-11-01Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-11-01 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | - |
| SIRAJ: Diverse and Efficient Red-Teaming for LLM Agents via Distilled Structured Reasoning Ahmed Elgohary, Amin Saied, A S M Iftekhar, Kaiwen Zhou Published: 2025-10-30Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-30 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 1 |
| A Pragmatic Way to Measure Chain-of-Thought Monitorability David K. Elson, Rohin Shah, Roland S. Zimmermann, Scott Emmons Published: 2025-10-28Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-10-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | 1 |
| Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges Nahin Anshuman Chhabra, Prasant Mohapatra, Shahriar Kabir, Shrestha Datta Published: 2025-10-27Area: Agent SafetyCitations: 7 Tags: agent-safety, ai-safety, safety-evaluation, survey | 2025-10-27 | Agent Safety | agent-safety, ai-safety, safety-evaluation, survey | E5 / R3 (95%) | 7 |
| Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond) Alon Albalak, Liwei Jiang, Maarten Sap, Margaret Li Published: 2025-10-27Area: Safety EvaluationCitations: 20 Tags: ai-safety, empirical, safety-evaluation | 2025-10-27 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (98%) | 20 |
| EU-Agent-Bench: Measuring Illegal Behavior of LLM Agents Under EU Law Alexander M眉ller, Ilija Lichkovski, Mariam Ibrahim, Tiwai Mhundwa Published: 2025-10-24Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-10-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (98%) | 1 |
| Extracting alignment data in open models Chawin Sitawarin, Christopher A. Choquette-Choo, Federico Barbero, Ilia Shumailov Published: 2025-10-21Area: Safety EvaluationCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-10-21 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 3 |
| Annotating the Chain-of-Thought: A Behavior-Labeled Dataset for AI Safety Antonio-Gabriel Chac贸n Menke, Eiji Kamioka, Phan Xuan Tan Published: 2025-10-20Area: Safety EvaluationCitations: - Tags: ai-safety, dataset, safety-evaluation | 2025-10-20 | Safety Evaluation | ai-safety, dataset, safety-evaluation | E5 / R3 (95%) | - |
| Detecting Adversarial Fine-tuning with Auditing Agents John Schulman, Nicholas Carlini, Sarah Egler Published: 2025-10-17Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-17 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 2 |