Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Pluralistic Behavior Suite: Stress-Testing Multi-Turn Adherence to Custom Behavioral Policies Christopher Parisien, Liwei Jiang, Makesh Narsimhan Sreedhar, Prasoon Varshney Published: 2025-11-07Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-11-07 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | - |
| OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models Lingjuan Lyu, Yaochu Jin, Yingchao Yu, Yuanshuai Li Published: 2025-11-13Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-11-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | - |
| Uncovering Strategic Egoism Behaviors in Large Language Models Aishan Liu, Jiangfan Liu, Qihang Zhang, Xianglong Liu Published: 2025-11-13Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-11-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 1 |
| ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models Gaotian Liu, Junhua Liu, Kaishuo Wei, Kejia Zhang Published: 2025-11-17Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-11-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator Hengqi Guo, Jirui Yang, Yao Guan, Yubing Bao Published: 2025-11-18Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-11-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R4 (97%) | - |
| Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models Samih Fadli Published: 2025-11-19Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-11-19 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | - |
| SafeRBench: A Comprehensive Benchmark for Safety Assessment in Large Reasoning Models Chenyang Si, Guanghao Li, Jian Liang, Jianxiong Gao Published: 2025-11-19Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-11-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | - |
| Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks Daoyuan Wu, Pingchuan Ma, Shuai Wang, Tian Tian Published: 2025-11-19Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-11-19 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, survey | E6 / R3 (95%) | - |
| AssurAI: Experience with Constructing Korean Socio-cultural Datasets to Discover Potential Risks of Generative AI Chae-Gyun Lim, Dasom Choi, Donggyu Yoon, Dongkun Lee Published: 2025-11-20Area: Safety EvaluationCitations: - Tags: ai-safety, dataset, safety-evaluation | 2025-11-20 | Safety Evaluation | ai-safety, dataset, safety-evaluation | E5 / R4 (98%) | - |
| Why Do Language Model Agents Whistleblow? Asa Cooper Stickland, Frank Xiao, Guido Bergman, Kushal Agrawal Published: 2025-11-21Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-11-21 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E6 / R4 (95%) | 1 |
| Can LLMs Threaten Human Survival? Benchmarking Potential Existential Threats from LLMs via Prefix Completion Cong Zuo, Haibin Zhang, Hang Fu, Licheng Wang Published: 2025-11-24Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-11-24 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 1 |
| Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts Chaojun Xiao, Felix Steffek, Holli Sargeant, Huimin Chen Published: 2025-11-25Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-11-25 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (95%) | - |
| Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models David Mohaisen, Trung Cuong Dang Published: 2025-11-25Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-11-25 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 2 |
| Are LLMs Good Safety Agents or a Propaganda Engine? Alberto Cazzaniga, Bernhard Sch枚lkopf, Francesco Ortu, Jiarui Liu Published: 2025-11-28Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-11-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals Md Labid Al Nahiyan, Md Tanvir Hassan, Riad Ahmed Anonto Published: 2025-11-30Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-11-30 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R2 (96%) | 1 |
| Benchmarking and Understanding Safety Risks in AI Character Platforms Gareth Tyson, Peixian Zhang, Yiluo Wei Published: 2025-12-01Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-12-01 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | - |
| Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective Anne Lauscher, Jae Hee Lee, Stefano V. Albrecht Published: 2025-12-04Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, interpretability, position, safety-evaluation | 2025-12-04 | Agent Safety | agent-safety, ai-safety, alignment-training, interpretability, position, safety-evaluation | E5 / R3 (94%) | 1 |
| TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations Chi Zhang, Huilin Zhou, Jian Zhao, Tianle Zhang Published: 2025-12-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-12-05 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 1 |
| OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation Dongxian Wu, Jie Liao, Qi Guo, Ranjie Duan Published: 2025-12-06Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-12-06 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | E4 / R3 (98%) | 3 |
| Training LLMs for Honesty via Confessions Amelia Glaese, Boaz Barak, Gabriel Wu, Jasmine Wang Published: 2025-12-08Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-12-08 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| Challenges of Evaluating LLM Safety for User Welfare Ingmar Weber, Mahalakshmi Raveenthiran, Manon Kempermann, Sai Suresh Macharla Vasu Published: 2025-12-11Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-12-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | - |
| The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior Erik Larsen Published: 2025-12-12Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-12-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R3 (97%) | 1 |
| Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation Richard J. Young Published: 2025-12-15Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-12-15 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R3 (97%) | 2 |
| FAME: Fictional Actors for Multilingual Erasure Alkis Koudounas, Claudio Savelli, Flavio Giobergia, Moreno La Quatra Published: 2025-12-17Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-12-17 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R4 (97%) | - |
| ContextLeak: Auditing Leakage in Private In-Context Learning Methods Jacob Choi, Robin Jia, Sai Praneeth Karimireddy, Shuying Cao Published: 2025-12-18Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-12-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| Monitoring Monitorability Annie Y. Wei, Benjamin Arnav, Bowen Baker, Ian Kivlichan Published: 2025-12-20Area: Scalable OversightCitations: 6 Tags: ai-safety, benchmark, safety-evaluation, scalable-oversight | 2025-12-20 | Scalable Oversight | ai-safety, benchmark, safety-evaluation, scalable-oversight | E5 / R3 (95%) | 6 |
| Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models Chenwei Liang, Chen Yang, Hao Yan, Jiayi Gu Published: 2025-12-21Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-21 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E8 / R2 (94%) | 1 |
| DREAM: Dynamic Red-teaming across Environments for AI Models Jiawei Du, Junyu Huang, Liming Lu, Shuchao Pang Published: 2025-12-22Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-22 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (95%) | - |
| PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models A. B. M. Ashikur Rahman, Ajmal Mian, Irfan Ahmad, Muhammad Usman Published: 2025-12-22Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-12-22 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |
| The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation Hengrui Jia, Jonas Guan, Taoran Li, Varun Chandrasekaran Published: 2025-12-22Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-12-22 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R4 (93%) | - |