Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Measuring Sparse Autoencoder Feature Sensitivity Claire Tian, Katherine Tian, Nathan Hu Published: 2025-09-28Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-09-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | - |
| RADAR: A Risk-Aware Dynamic Multi-Agent Framework for LLM Safety Evaluation via Role-Specialized Collaboration Chi Zhang, Huilin Zhou, Jian Zhao, Linghe Kong Published: 2025-09-28Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-09-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R6 (96%) | 3 |
| OpenAI's GPT-OSS-20B Model and Safety Alignment Issues in a Low-Resource Language Isa Inuwa-Dutse Published: 2025-09-26Area: Safety EvaluationCitations: 1 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-09-26 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 1 |
| In AI Sweet Harmony: Sociopragmatic Guardrail Bypasses and Evaluation-Awareness in OpenAI gpt-oss-20b Nils Durner Published: 2025-09-25Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-09-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | - |
| Anecdoctoring: Automated Red-Teaming Across Language and Place Alejandro Cuevas, Bharat Kumar Nayak, Dan Vann, Madeleine I. G. Daepp Published: 2025-09-23Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-09-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| Challenging the Evaluator: LLM Sycophancy Under User Rebuttal Daniel Khashabi, Sungwon Kim Published: 2025-09-20Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-09-20 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (94%) | 1 |
| Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models Jos茅 Hern谩ndez-Orallo, Peter Romero, Sipeng Chen, Stephen Fitz Published: 2025-09-19Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-09-19 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E8 / R4 (97%) | 1 |
| SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs Chenguang Wang, David Park, Dawn Song, Nathan W. Henry Published: 2025-09-16Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2025-09-16 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E9 / R3 (95%) | 4 |
| From Firewalls to Frontiers: AI Red-Teaming is a Domain-Specific Evolution of Cyber Red-Teaming Anusha Sinha, Hoda Heidari, James Lucassen, Keltin Grimes Published: 2025-09-14Area: Safety EvaluationCitations: 2 Tags: ai-safety, position, safety-evaluation | 2025-09-14 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (93%) | 2 |
| Safety and Security Analysis of Large Language Models: Benchmarking Risk Profile and Harm Potential Aarav Khanna, Charankumar Akiri, Harrison Simpson, Kshitiz Aryal Published: 2025-09-12Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-12 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E10 / R3 (95%) | 4 |
| Evaluation Awareness Scales Predictably in Open-Weights Large Language Models Ashwinee Panda, Ian Su, Julia Tan, Kevin Zhu Published: 2025-09-10Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-09-10 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E7 / R3 (97%) | 1 |
| HumanAgencyBench: Scalable Evaluation of Human Agency Support in AI Assistants Benjamin Sturgeon, Daniel Samuelson, Jacob Haimes, Jacy Reese Anthis Published: 2025-09-10Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-09-10 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (98%) | 3 |
| SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs Haifeng Wang, Hongfei Xiao, Hongru Wang, Qian Yu Published: 2025-09-09Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-09-09 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E4 / R3 (94%) | 1 |
| Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models Mohammad Zandsalimy, Shanu Sushmita, Youjia Zheng Published: 2025-09-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-05 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | - |
| Why Language Models Hallucinate Adam Tauman Kalai, Edwin Zhang, Ofir Nachum, Santosh S. Vempala Published: 2025-09-04Area: Deception & FailureCitations: 123 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2025-09-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E5 / R3 (92%) | 123 |
| PersonaTeaming: Exploring How Introducing Personas Can Improve Automated AI Red-Teaming Akshita Jha, Ken Holstein, Lauren Wilcox, Leon A Gatys Published: 2025-09-03Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2025-09-03 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 5 |
| Unlearning That Lasts: Utility-Preserving, Robust, and Almost Irreversible Forgetting in LLMs Francesco Croce, Matthias Hein, Maximilian M眉ller, Naman Deep Singh Published: 2025-09-02Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-09-02 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 4 |
| Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions Chang Liu, Cheng Wei, Fengxiang Wang, Hui Xue Published: 2025-09-01Area: Safety EvaluationCitations: 7 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-01 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 7 |
| CE-Bench: Towards a Reliable Contrastive Evaluation Benchmark of Interpretability of Sparse Autoencoders Alex Gulko, Sachin Kumar, Yusen Peng Published: 2025-08-31Area: Mechanistic Interp.Citations: - Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2025-08-31 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | - |
| The Resurgence of GCG Adversarial Attacks on Large Language Models Huizhen Shu, Peikang Hu, Xuying Li, Yuting Tan Published: 2025-08-30Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-08-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R4 (96%) | 1 |
| JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring Chao Shen, Chenhao Lin, Junjie Chu, Michael Backes Published: 2025-08-28Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-08-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | 4 |
| Evaluating Language Model Reasoning about Confidential Information Alexander Robey, Andy Zou, Dylan Sam, J. Zico Kolter Published: 2025-08-27Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-08-27 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R3 (93%) | 1 |
| Quantized but Deceptive? A Multi-Dimensional Truthfulness Evaluation of Quantized LLMs Haotian Yu, Mu Sheng, Pan Li, Runchao Li Published: 2025-08-26Area: Safety EvaluationCitations: 6 Tags: ai-safety, empirical, safety-evaluation | 2025-08-26 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (93%) | 6 |
| Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs Daeun Moon, Hyejin Chung, Hyunsoo Yoon, Jiwon Kim Published: 2025-08-23Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-08-23 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | - |
| Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation Chang Liu, Hang Su, Huanran Chen, Jun Zhu Published: 2025-08-21Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | 2025-08-21 | Multimodal Safety | ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 1 |
| AI Testing Should Account for Sophisticated Strategic Behaviour Alexis Ghersengorin, Eric Olav Chen, Sami Petersen, Vincent Conitzer Published: 2025-08-19Area: Safety EvaluationCitations: 3 Tags: ai-safety, safety-evaluation, theoretical | 2025-08-19 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E6 / R3 (96%) | 3 |
| Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA Chunyi Li, Dandan Zhu, Guangtao Zhai, Kaiwei Zhang Published: 2025-08-19Area: Deception & FailureCitations: 6 Tags: adversarial-robustness, ai-safety, deception-failure, empirical, safety-evaluation | 2025-08-19 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (95%) | 6 |
| Amazon Nova AI Challenge - Trusted AI: Advancing secure, AI-assisted software development Anna Gottardi, Desheng Zhang, Hangjie Shi, Lavina Vaz Published: 2025-08-13Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2025-08-13 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| STREAM (ChemBio): A Standard for Transparently Reporting Evaluations in AI Model Reports Chris Painter, Jide Alaga, Luca Righetti, Rishi Bommasani Published: 2025-08-13Area: Safety EvaluationCitations: 5 Tags: ai-safety, safety-evaluation, tool | 2025-08-13 | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R3 (94%) | 5 |
| The PacifAIst Benchmark: Would an Artificial Intelligence Choose to Sacrifice Itself for Human Safety? Manuel Herrador Mu帽oz Published: 2025-08-13Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-08-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | - |