Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B Ali Hassan, Gulshan Saleem, Muhammad Imran Zaman, Nisar Ahmed Published: 2025-10-08Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-10-08 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics Changsheng Wang, Chongyu Fan, Sijia Liu, Soumyadeep Pal Published: 2025-10-08Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-10-08 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E7 / R3 (94%) | - |
| Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts Alessandra Russo, Christos Ziakas, Nicholas Loo, Nishita Jain Published: 2025-10-08Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-10-08 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (98%) | - |
| AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming Hanbo Song, Keqing He, Kongming Liang, Lulu Zhao Published: 2025-10-09Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-10-09 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R4 (97%) | - |
| Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs Chenxuan Zhao, Ercong Nie, Michael F盲rber, Shuzhou Yuan Published: 2025-10-09Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-10-09 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E8 / R3 (96%) | 1 |
| Multimodal Safety Evaluation in Generative Agent Social Simulations Alhim Vera, Bernard Ghanem, Carlos Hinojosa, Donghoon Kim Published: 2025-10-09Area: Multimodal SafetyCitations: 1 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-10-09 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E6 / R3 (96%) | 1 |
| Stress-Testing Model Specs Reveals Character Differences among Language Models Andi Peng, Esin Durmus, Henry Sleight, Jifan Zhang Published: 2025-10-09Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-10-09 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | 3 |
| When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models Gelei Deng, Han Qiu, Haoran Ou, Jie Zhang Published: 2025-10-09Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-10-09 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | 1 |
| All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language Fabien Roger, Henry Sleight, Shiyuan Guo Published: 2025-10-10Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-10-10 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | 1 |
| The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against LLM Jailbreaks and Prompt Injections Abhradeep Thakurta, Andreas Terzis, Chawin Sitawarin, Florian Tram猫r Published: 2025-10-10Area: Adversarial RobustnessCitations: 26 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E10 / R3 (99%) | 26 |
| Scheming Ability in LLM-to-LLM Strategic Interactions Thao Pham Published: 2025-10-11Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-10-11 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | 2 |
| Safeguarding Efficacy in Large Language Models: Evaluating Resistance to Human-Written and Algorithmic Adversarial Prompts Olamide Jogunola, Oluwaseun Ajao, Tiarnaigh Downey-Webb Published: 2025-10-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R4 (96%) | - |
| BlackIce: A Containerized Red Teaming Toolkit for AI Security Testing Alexander Warnecke, Caelin Kaplan, Neil Archibald Published: 2025-10-13Area: Safety EvaluationCitations: - Tags: ai-safety, red-teaming, safety-evaluation, tool | 2025-10-13 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, tool | E7 / R4 (98%) | - |
| Generative AI for Biosciences: Emerging Threats and Roadmap to Biosecurity Adji Bousso Dieng, Alex John London, Alvaro Velasquez, Amrit Singh Bedi Published: 2025-10-13Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-10-13 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, survey | E5 / R3 (93%) | 2 |
| Risk-adaptive Activation Steering for Safe Multimodal Large Language Models Jonghyun Choi, Jonghyun Park, Minhyuk Seo Published: 2025-10-15Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety, safety-evaluation | 2025-10-15 | Multimodal Safety | ai-safety, empirical, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 1 |
| Detecting Adversarial Fine-tuning with Auditing Agents John Schulman, Nicholas Carlini, Sarah Egler Published: 2025-10-17Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-17 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 2 |
| SoK: Taxonomy and Evaluation of Prompt Security in Large Language Models Ali Arastehfard, Biying Liu, Hanbin Hong, Heqing Huang Published: 2025-10-17Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, survey | E5 / R4 (97%) | 1 |
| Annotating the Chain-of-Thought: A Behavior-Labeled Dataset for AI Safety Antonio-Gabriel Chac贸n Menke, Eiji Kamioka, Phan Xuan Tan Published: 2025-10-20Area: Safety EvaluationCitations: - Tags: ai-safety, dataset, safety-evaluation | 2025-10-20 | Safety Evaluation | ai-safety, dataset, safety-evaluation | E5 / R3 (95%) | - |
| Extracting alignment data in open models Chawin Sitawarin, Christopher A. Choquette-Choo, Federico Barbero, Ilia Shumailov Published: 2025-10-21Area: Safety EvaluationCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-10-21 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 3 |
| EU-Agent-Bench: Measuring Illegal Behavior of LLM Agents Under EU Law Alexander M眉ller, Ilija Lichkovski, Mariam Ibrahim, Tiwai Mhundwa Published: 2025-10-24Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-10-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (98%) | 1 |
| Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges Nahin Anshuman Chhabra, Prasant Mohapatra, Shahriar Kabir, Shrestha Datta Published: 2025-10-27Area: Agent SafetyCitations: 7 Tags: agent-safety, ai-safety, safety-evaluation, survey | 2025-10-27 | Agent Safety | agent-safety, ai-safety, safety-evaluation, survey | E5 / R3 (95%) | 7 |
| Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond) Alon Albalak, Liwei Jiang, Maarten Sap, Margaret Li Published: 2025-10-27Area: Safety EvaluationCitations: 20 Tags: ai-safety, empirical, safety-evaluation | 2025-10-27 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (98%) | 20 |
| A Pragmatic Way to Measure Chain-of-Thought Monitorability David K. Elson, Rohin Shah, Roland S. Zimmermann, Scott Emmons Published: 2025-10-28Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-10-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | 1 |
| SIRAJ: Diverse and Efficient Red-Teaming for LLM Agents via Distilled Structured Reasoning Ahmed Elgohary, Amin Saied, A S M Iftekhar, Kaiwen Zhou Published: 2025-10-30Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-30 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 1 |
| Do Methods to Jailbreak and Defend LLMs Generalize Across Languages? Berk Atil, Fred Morstatter, Rebecca J. Passonneau Published: 2025-11-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs Amin Nikanjam, Foutse Khomh, Mina Taraghi, Mohamed Amine Merzouk Published: 2025-11-01Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-11-01 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E8 / R3 (95%) | - |
| Red-teaming Activation Probes using Prompted LLMs Phil Blandfort, Robert Graham Published: 2025-11-01Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-11-01 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | - |
| Deep Value Benchmark: Measuring Whether Models Generalize Deep Values or Shallow Preferences Ceren Budak, Eric Gilbert, Hua Shen, Joshua Ashkinaze Published: 2025-11-03Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-11-03 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 1 |
| LiveSecBench: A Dynamic and Event-Driven Safety Benchmark for Chinese Language Model Applications Baocheng Chen, Haitian Li, Kecheng Wang, Kejiang Chen Published: 2025-11-04Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-11-04 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | - |
| Optimizing AI Agent Attacks With Synthetic Data Avery Griffin, Chloe Loughridge, Joe Benton, Jon Kutasov Published: 2025-11-04Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-11-04 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 3 |