Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SoK: Taxonomy and Evaluation of Prompt Security in Large Language Models Ali Arastehfard, Biying Liu, Hanbin Hong, Heqing Huang Published: 2025-10-17Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, survey | E5 / R4 (97%) | 1 |
| Risk-adaptive Activation Steering for Safe Multimodal Large Language Models Jonghyun Choi, Jonghyun Park, Minhyuk Seo Published: 2025-10-15Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety, safety-evaluation | 2025-10-15 | Multimodal Safety | ai-safety, empirical, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 1 |
| BlackIce: A Containerized Red Teaming Toolkit for AI Security Testing Alexander Warnecke, Caelin Kaplan, Neil Archibald Published: 2025-10-13Area: Safety EvaluationCitations: - Tags: ai-safety, red-teaming, safety-evaluation, tool | 2025-10-13 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, tool | E7 / R4 (98%) | - |
| Generative AI for Biosciences: Emerging Threats and Roadmap to Biosecurity Adji Bousso Dieng, Alex John London, Alvaro Velasquez, Amrit Singh Bedi Published: 2025-10-13Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-10-13 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, survey | E5 / R3 (93%) | 2 |
| Safeguarding Efficacy in Large Language Models: Evaluating Resistance to Human-Written and Algorithmic Adversarial Prompts Olamide Jogunola, Oluwaseun Ajao, Tiarnaigh Downey-Webb Published: 2025-10-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R4 (96%) | - |
| Scheming Ability in LLM-to-LLM Strategic Interactions Thao Pham Published: 2025-10-11Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-10-11 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | 2 |
| All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language Fabien Roger, Henry Sleight, Shiyuan Guo Published: 2025-10-10Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-10-10 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | 1 |
| The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against LLM Jailbreaks and Prompt Injections Abhradeep Thakurta, Andreas Terzis, Chawin Sitawarin, Florian Tram猫r Published: 2025-10-10Area: Adversarial RobustnessCitations: 26 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E10 / R3 (99%) | 26 |
| AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming Hanbo Song, Keqing He, Kongming Liang, Lulu Zhao Published: 2025-10-09Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-10-09 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R4 (97%) | - |
| Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs Chenxuan Zhao, Ercong Nie, Michael F盲rber, Shuzhou Yuan Published: 2025-10-09Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-10-09 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E8 / R3 (96%) | 1 |
| Multimodal Safety Evaluation in Generative Agent Social Simulations Alhim Vera, Bernard Ghanem, Carlos Hinojosa, Donghoon Kim Published: 2025-10-09Area: Multimodal SafetyCitations: 1 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-10-09 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E6 / R3 (96%) | 1 |
| Stress-Testing Model Specs Reveals Character Differences among Language Models Andi Peng, Esin Durmus, Henry Sleight, Jifan Zhang Published: 2025-10-09Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-10-09 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | 3 |
| When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models Gelei Deng, Han Qiu, Haoran Ou, Jie Zhang Published: 2025-10-09Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-10-09 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | 1 |
| Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B Ali Hassan, Gulshan Saleem, Muhammad Imran Zaman, Nisar Ahmed Published: 2025-10-08Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-10-08 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics Changsheng Wang, Chongyu Fan, Sijia Liu, Soumyadeep Pal Published: 2025-10-08Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-10-08 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E7 / R3 (94%) | - |
| Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts Alessandra Russo, Christos Ziakas, Nicholas Loo, Nishita Jain Published: 2025-10-08Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-10-08 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (98%) | - |
| Evaluating LLM Safety Across Child Development Stages: A Simulated Agent Approach Abhejay Murali, Amit Dhurandhar, David Atkinson, Junfeng Jiao Published: 2025-10-07Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-10-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (97%) | 1 |
| The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives Arjun Jagota, Matthieu Bou, Nyal Patel, Satyapriya Krishna Published: 2025-10-07Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-10-07 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | - |
| Indirect Prompt Injections: Are Firewalls All You Need, or Stronger Benchmarks? Abhay Puri, Alexandre Lacoste, Gabriel Huang, Graham W. Taylor Published: 2025-10-06Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R3 (96%) | 3 |
| RAG Makes Guardrails Unsafe? Investigating Robustness of Guardrails under RAG-style Contexts Daniel W. Peterson, Dan Roth, Eunsuk Kang, Marianne Menglin Liu Published: 2025-10-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | - |
| SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests Devansh Bhardwaj, Hai Son Le, Punya Syon Pandey, Rada Mihalcea Published: 2025-10-06Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-10-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (99%) | - |
| How Catastrophic is Your LLM? Certifying Risk in Conversation Chengxiao Wang, Gagandeep Singh, Isha Chaudhary, Qian Hu Published: 2025-10-04Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-10-04 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| RedCodeAgent: Automatic Red-teaming Agent against Diverse Code Agents Bo Li, Chengquan Guo, Chulin Xie, Dawn Song Published: 2025-10-02Area: Safety EvaluationCitations: 4 Tags: ai-safety, empirical, safety-evaluation | 2025-10-02 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (95%) | 4 |
| ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs Adi Simhi, Idan Szpektor, Itay Itzhak, Jonathan Herzig Published: 2025-10-01Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-10-01 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R2 (96%) | 1 |
| Microsaccade-Inspired Probing: Positional Encoding Perturbations Reveal LLM Misbehaviours Corina S. Pasareanu, Rui Abreu, Rui Melo Published: 2025-10-01Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-01 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always! Amir Zadeh, Chuan Li, Jingdi Lei, Rishabh Bhardwaj Published: 2025-09-30Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-30 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 2 |
| Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents Boxuan Zhang, Jiaxuan Guo, Jing Shao, Yi Yu Published: 2025-09-29Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, empirical, safety-evaluation | 2025-09-29 | Agent Safety | agent-safety, ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| Generative Value Conflicts Reveal LLM Priorities Andy Liu, Atoosa Kasirzadeh, Daniel Fried, Kshitish Ghate Published: 2025-09-29Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-09-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (92%) | 3 |
| HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment Di Wang, Kedong Xiu, Kui Ren, Langqi Yang Published: 2025-09-29Area: Safety EvaluationCitations: 2 Tags: ai-safety, benchmark, safety-evaluation | 2025-09-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 2 |
| Falcon: A Cross-Modal Evaluation Dataset for Comprehensive Safety Perception Guisong Liu, Minrui Jiang, Pei Ke, Qi Xue Published: 2025-09-28Area: Multimodal SafetyCitations: - Tags: ai-safety, dataset, multimodal-safety, safety-evaluation | 2025-09-28 | Multimodal Safety | ai-safety, dataset, multimodal-safety, safety-evaluation | E5 / R3 (96%) | - |