Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments Dongpo Cheng, Fangqi Lou, Heng Lian, Huacan Wang Published: 2026-01-09Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2026-01-09 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | - |
| Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defenses Chao Li, Chaozhuo Li, Litian Zhang, Xi Zhang Published: 2026-01-07Area: Surveys & ReviewsCitations: 1 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2026-01-07 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E6 / R4 (97%) | 1 |
| MiJaBench: Revealing Minority Biases in Large Language Models via Hate Speech Jailbreaking Arlindo R. Galv茫o Filho, Diogo F. C. Silva, Iago A. Brito, Julia S. Dollis Published: 2026-01-07Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | 2026-01-07 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, benchmark, safety-evaluation | E6 / R3 (95%) | - |
| RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models Chris Ngo, Quy-Anh Dang, Truong-Son Hy Published: 2026-01-07Area: Safety EvaluationCitations: - Tags: ai-safety, dataset, red-teaming, safety-evaluation | 2026-01-07 | Safety Evaluation | ai-safety, dataset, red-teaming, safety-evaluation | E5 / R4 (95%) | - |
| What Matters For Safety Alignment? Hui-Ling Zhen, Lihao Yin, Mingxuan Yuan, Xianzhi Yu Published: 2026-01-07Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-01-07 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (93%) | - |
| The Anatomy of Conversational Scams: A Topic-Based Red Teaming Analysis of Multi-Turn Interactions in LLMs Haoming Tang, Siying Hu, Xiangzhe Yuan, Zhenhao Zhang Published: 2026-01-06Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2026-01-06 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (93%) | - |
| How Real is Your Jailbreak? Fine-grained Jailbreak Evaluation with Anchored Reference Chaozhuo Li, Chenxu Wang, Litian Zhang, Rui Pu Published: 2026-01-04Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2026-01-04 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | - |
| CSSBench: Evaluating the Safety of Lightweight LLMs against Chinese-Specific Adversarial Patterns Chuanpu Liu, Kun Wang, Qiankun Li, Shilinlu Yan Published: 2026-01-02Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2026-01-02 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R5 (96%) | - |
| The Slow Drift of Support: Boundary Failures in Multi-Turn Mental Health LLM Dialogues Chenyu Sun, Kerry Jiang, Qiyang Pan, Youyou Cheng Published: 2026-01-02Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2026-01-02 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | - |
| Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs Muhammad Abdullahi Said, Muhammad Sammani Sani Published: 2025-12-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | - |
| Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race? Dingfan Chen, Linyi Yang, Michael Backes, Xiao Zhang Published: 2025-12-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | - |
| Adversarial Lens: Exploiting Attention Layers to Generate Adversarial Examples for Evaluation Kaustubh Dhole Published: 2025-12-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (95%) | - |
| Eliciting Behaviors in Multi-Turn Conversations Andrew Hard, Jing Huang, John Lambert, Lun Wang Published: 2025-12-29Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-12-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (95%) | - |
| DarkPatterns-LLM: A Multi-Layer Benchmark for Detecting Manipulative and Harmful AI Behavior Haris Khan, Israel Antonio Rosales Laguan, Muneeb Asif, Sadia Asif Published: 2025-12-27Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-12-27 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (97%) | 1 |
| Beyond Context: Large Language Models Failure to Grasp Users Intent Ahmed M. Hussain, Panos Papadimitratos, Salahuddin Salahuddin Published: 2025-12-24Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-12-24 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 1 |
| A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents Benjamin C. M. Fung, Claude Fachkha, Khalil Al-Hussaeni, Martin Weiss Published: 2025-12-23Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-12-23 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (98%) | 2 |
| DREAM: Dynamic Red-teaming across Environments for AI Models Jiawei Du, Junyu Huang, Liming Lu, Shuchao Pang Published: 2025-12-22Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-22 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (95%) | - |
| PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models A. B. M. Ashikur Rahman, Ajmal Mian, Irfan Ahmad, Muhammad Usman Published: 2025-12-22Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-12-22 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |
| The Erasure Illusion: Stress-Testing the Generalization of LLM Forgetting Evaluation Hengrui Jia, Jonas Guan, Taoran Li, Varun Chandrasekaran Published: 2025-12-22Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-12-22 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R4 (93%) | - |
| Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models Chenwei Liang, Chen Yang, Hao Yan, Jiayi Gu Published: 2025-12-21Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-21 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E8 / R2 (94%) | 1 |
| Monitoring Monitorability Annie Y. Wei, Benjamin Arnav, Bowen Baker, Ian Kivlichan Published: 2025-12-20Area: Scalable OversightCitations: 6 Tags: ai-safety, benchmark, safety-evaluation, scalable-oversight | 2025-12-20 | Scalable Oversight | ai-safety, benchmark, safety-evaluation, scalable-oversight | E5 / R3 (95%) | 6 |
| ContextLeak: Auditing Leakage in Private In-Context Learning Methods Jacob Choi, Robin Jia, Sai Praneeth Karimireddy, Shuying Cao Published: 2025-12-18Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-12-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| FAME: Fictional Actors for Multilingual Erasure Alkis Koudounas, Claudio Savelli, Flavio Giobergia, Moreno La Quatra Published: 2025-12-17Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-12-17 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R4 (97%) | - |
| Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation Richard J. Young Published: 2025-12-15Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-12-15 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R3 (97%) | 2 |
| The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior Erik Larsen Published: 2025-12-12Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-12-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R3 (97%) | 1 |
| Challenges of Evaluating LLM Safety for User Welfare Ingmar Weber, Mahalakshmi Raveenthiran, Manon Kempermann, Sai Suresh Macharla Vasu Published: 2025-12-11Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-12-11 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | - |
| Training LLMs for Honesty via Confessions Amelia Glaese, Boaz Barak, Gabriel Wu, Jasmine Wang Published: 2025-12-08Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-12-08 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation Dongxian Wu, Jie Liao, Qi Guo, Ranjie Duan Published: 2025-12-06Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-12-06 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | E4 / R3 (98%) | 3 |
| TeleAI-Safety: A comprehensive LLM jailbreaking benchmark towards attacks, defenses, and evaluations Chi Zhang, Huilin Zhou, Jian Zhao, Tianle Zhang Published: 2025-12-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-12-05 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 1 |
| Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective Anne Lauscher, Jae Hee Lee, Stefano V. Albrecht Published: 2025-12-04Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, interpretability, position, safety-evaluation | 2025-12-04 | Agent Safety | agent-safety, ai-safety, alignment-training, interpretability, position, safety-evaluation | E5 / R3 (94%) | 1 |