Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| LLM Unlearning Reveals a Stronger-Than-Expected Coreset Effect in Current Benchmarks Bhavya Kailkhura, Changsheng Wang, James Diffenderfer, Sijia Liu Published: 2025-04-14Area: Model EditingCitations: 10 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-04-14 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R4 (95%) | 10 |
| DoomArena: A framework for Testing AI Agents Against Evolving Security Threats Abhay Puri, Alexandre Drouin, Alexandre Lacoste, Avinandan Bose Published: 2025-04-18Area: Agent SafetyCitations: 19 Tags: agent-safety, ai-safety, safety-evaluation, tool | 2025-04-18 | Agent Safety | agent-safety, ai-safety, safety-evaluation, tool | E6 / R4 (97%) | 19 |
| Walk the Talk? Measuring the Faithfulness of Large Language Model Explanations Emre Kiciman, John Guttag, Katie Matton, Robert Osazuwa Ness Published: 2025-04-19Area: Safety EvaluationCitations: 32 Tags: ai-safety, empirical, safety-evaluation | 2025-04-19 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 32 |
| aiXamine: Simplified LLM Safety and Security Dorde Popovic, Euisuh Jeong, Fatih Deniz, Issa Khalil Published: 2025-04-21Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2025-04-21 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R3 (98%) | 2 |
| RainbowPlus: Enhancing Adversarial Prompt Generation via Evolutionary Quality-Diversity Search Chris Ngo, Quy-Anh Dang, Truong-Son Hy Published: 2025-04-21Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-04-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (97%) | 4 |
| RepliBench: Evaluating Autonomous Replication Capabilities of Language Model Agents Alan Cooney, Alex Remedios, Asa Cooper Stickland, Ben Millwood Published: 2025-04-21Area: Agent SafetyCitations: 8 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-04-21 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 8 |
| AI Awareness Haoyuan Shi, Rongwu Xu, Wei Xu, Xiaojian Li Published: 2025-04-25Area: Surveys & ReviewsCitations: 4 Tags: ai-safety, safety-evaluation, survey, surveys-reviews | 2025-04-25 | Surveys & Reviews | ai-safety, safety-evaluation, survey, surveys-reviews | E6 / R5 (97%) | 4 |
| RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models Bang An, Mark Dredze, Shiyue Zhang Published: 2025-04-25Area: Safety EvaluationCitations: 23 Tags: ai-safety, empirical, safety-evaluation | 2025-04-25 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 23 |
| Doxing via the Lens: Revealing Privacy Leakage in Image Geolocation for Agentic Multi-Modal Large Reasoning Model Chaowei Xiao, Qiming Zhang, Tianyu Lu, Weidi Luo Published: 2025-04-27Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2025-04-27 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 7 |
| Investigating task-specific prompts and sparse autoencoders for activation monitoring Dan Mossing, Henk Tillman Published: 2025-04-28Area: Safety EvaluationCitations: 11 Tags: ai-safety, empirical, safety-evaluation | 2025-04-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 11 |
| SAGE: A Generic Framework for LLM Safety Evaluation Hari Shrawgi, Madhur Jindal, Parag Agrawal, Sandipan Dandapat Published: 2025-04-28Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-04-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R4 (96%) | 6 |
| The Automation Advantage in AI Red Teaming Ads Dawson, Brad Palm, Brian Greunke, Nick Landers Published: 2025-04-28Area: Safety EvaluationCitations: 2 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-04-28 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 2 |
| Empirical Evaluation of Progressive Coding for Sparse Autoencoders Anders S酶gaard, Hans Peter Published: 2025-04-30Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-04-30 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | - |
| OET: Optimization-based prompt injection Evaluation Toolkit Chaowei Xiao, Jinsheng Pan, Xiaogeng Liu Published: 2025-05-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2025-05-01 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, tool | E6 / R3 (95%) | - |
| Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation Jie Peng, Mohit Bansal, Peter Hase, Tianlong Chen Published: 2025-05-01Area: Model EditingCitations: 8 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-05-01 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (95%) | 8 |
| Evaluating Frontier Models for Stealth and Situational Awareness Allan Dafoe, David Lindner, Lewis Ho, Mary Phuong Published: 2025-05-02Area: Safety EvaluationCitations: 16 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-02 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 16 |
| Red Teaming the Mind of the Machine: A Systematic Evaluation of Prompt Injection and Jailbreak Vulnerabilities in LLMs Chetan Pathade Published: 2025-05-07Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-05-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E7 / R3 (95%) | 30 |
| REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLMs Madhur Jindal, Saurabh Deshpande Published: 2025-05-07Area: Multimodal SafetyCitations: 3 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-05-07 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E6 / R4 (99%) | 3 |
| Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model Chi Chen, Jinan Xu, Kaiyu Huang, Xiangyu Shi Published: 2025-05-10Area: Multimodal SafetyCitations: 11 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety, safety-evaluation | 2025-05-10 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 11 |
| FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning Chandan K. Reddy, Fanyou Wu, Weijie Xu, Zhehao Zhang Published: 2025-05-12Area: Safety EvaluationCitations: 13 Tags: ai-safety, dataset, safety-evaluation | 2025-05-12 | Safety Evaluation | ai-safety, dataset, safety-evaluation | E5 / R3 (95%) | 13 |
| CARES: Comprehensive Evaluation of Safety and Adversarial Robustness in Medical LLMs Chen-Hsiang Yu, Eric Hanchen Jiang, Mengxue Zhang, Qingcheng Zeng Published: 2025-05-16Area: Safety EvaluationCitations: 16 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-16 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 16 |
| Phare: A Safety Probe for Large Language Models Beno卯t Mal茅zieux, Matteo Dora, Pierre Le Jeune, Weixuan Xiao Published: 2025-05-16Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-16 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R5 (95%) | 1 |
| Video-SafetyBench: A Benchmark for Safety Evaluation of Video LVLMs Huaibo Huang, Peipei Li, Ran He, Shuhan Xia Published: 2025-05-17Area: Multimodal SafetyCitations: 10 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-05-17 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E4 / R3 (95%) | 10 |
| Evaluating the efficacy of LLM Safety Solutions: The Palit Benchmark Dataset Daniel W. Woods, Sayon Palit Published: 2025-05-19Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-05-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R2 (96%) | - |
| Investigating the Vulnerability of LLM-as-a-Judge Architectures to Prompt-Injection Attacks Bislan Ashinov, Dmitry Namiot, Narek Maloyan Published: 2025-05-19Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-05-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R3 (95%) | 7 |
| Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization Dongha Lee, Dongjin Kang, Hyungjoo Chae, Jinyoung Yeo Published: 2025-05-19Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-05-19 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (96%) | 3 |
| PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks Dongcheng Zhao, Guobin Shen, Haibo Tong, Jihang Wang Published: 2025-05-20Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-20 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 1 |
| Soft Prompts for Evaluation: Measuring Conditional Distance of Capabilities Ross Nordby Published: 2025-05-20Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-05-20 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| The Hawthorne Effect in Reasoning Models: Evaluating and Steering Test Awareness Ahmed Salem, Sahar Abdelnabi Published: 2025-05-20Area: Deception & FailureCitations: 7 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-05-20 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (96%) | 7 |
| Will AI Tell Lies to Save Sick Children? Litmus-Testing AI Values Prioritization with AIRiskDilemmas Evan Hubinger, Kyle Fish, Sharan Maiya, Sydney Levine Published: 2025-05-20Area: Safety EvaluationCitations: 8 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 8 |