Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Evaluating Frontier Models for Stealth and Situational Awareness Allan Dafoe, David Lindner, Lewis Ho, Mary Phuong Published: 2025-05-02Area: Safety EvaluationCitations: 16 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-02 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 16 |
| OET: Optimization-based prompt injection Evaluation Toolkit Chaowei Xiao, Jinsheng Pan, Xiaogeng Liu Published: 2025-05-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2025-05-01 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, tool | E6 / R3 (95%) | - |
| Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation Jie Peng, Mohit Bansal, Peter Hase, Tianlong Chen Published: 2025-05-01Area: Model EditingCitations: 8 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-05-01 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (95%) | 8 |
| Empirical Evaluation of Progressive Coding for Sparse Autoencoders Anders S酶gaard, Hans Peter Published: 2025-04-30Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-04-30 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | - |
| Investigating task-specific prompts and sparse autoencoders for activation monitoring Dan Mossing, Henk Tillman Published: 2025-04-28Area: Safety EvaluationCitations: 11 Tags: ai-safety, empirical, safety-evaluation | 2025-04-28 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 11 |
| SAGE: A Generic Framework for LLM Safety Evaluation Hari Shrawgi, Madhur Jindal, Parag Agrawal, Sandipan Dandapat Published: 2025-04-28Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-04-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R4 (96%) | 6 |
| The Automation Advantage in AI Red Teaming Ads Dawson, Brad Palm, Brian Greunke, Nick Landers Published: 2025-04-28Area: Safety EvaluationCitations: 2 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-04-28 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 2 |
| Doxing via the Lens: Revealing Privacy Leakage in Image Geolocation for Agentic Multi-Modal Large Reasoning Model Chaowei Xiao, Qiming Zhang, Tianyu Lu, Weidi Luo Published: 2025-04-27Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2025-04-27 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 7 |
| AI Awareness Haoyuan Shi, Rongwu Xu, Wei Xu, Xiaojian Li Published: 2025-04-25Area: Surveys & ReviewsCitations: 4 Tags: ai-safety, safety-evaluation, survey, surveys-reviews | 2025-04-25 | Surveys & Reviews | ai-safety, safety-evaluation, survey, surveys-reviews | E6 / R5 (97%) | 4 |
| RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models Bang An, Mark Dredze, Shiyue Zhang Published: 2025-04-25Area: Safety EvaluationCitations: 23 Tags: ai-safety, empirical, safety-evaluation | 2025-04-25 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 23 |
| aiXamine: Simplified LLM Safety and Security Dorde Popovic, Euisuh Jeong, Fatih Deniz, Issa Khalil Published: 2025-04-21Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2025-04-21 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R3 (98%) | 2 |
| RainbowPlus: Enhancing Adversarial Prompt Generation via Evolutionary Quality-Diversity Search Chris Ngo, Quy-Anh Dang, Truong-Son Hy Published: 2025-04-21Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-04-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (97%) | 4 |
| RepliBench: Evaluating Autonomous Replication Capabilities of Language Model Agents Alan Cooney, Alex Remedios, Asa Cooper Stickland, Ben Millwood Published: 2025-04-21Area: Agent SafetyCitations: 8 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-04-21 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E4 / R3 (96%) | 8 |
| Walk the Talk? Measuring the Faithfulness of Large Language Model Explanations Emre Kiciman, John Guttag, Katie Matton, Robert Osazuwa Ness Published: 2025-04-19Area: Safety EvaluationCitations: 32 Tags: ai-safety, empirical, safety-evaluation | 2025-04-19 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 32 |
| DoomArena: A framework for Testing AI Agents Against Evolving Security Threats Abhay Puri, Alexandre Drouin, Alexandre Lacoste, Avinandan Bose Published: 2025-04-18Area: Agent SafetyCitations: 19 Tags: agent-safety, ai-safety, safety-evaluation, tool | 2025-04-18 | Agent Safety | agent-safety, ai-safety, safety-evaluation, tool | E6 / R4 (97%) | 19 |
| LLM Unlearning Reveals a Stronger-Than-Expected Coreset Effect in Current Benchmarks Bhavya Kailkhura, Changsheng Wang, James Diffenderfer, Sijia Liu Published: 2025-04-14Area: Model EditingCitations: 10 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-04-14 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R4 (95%) | 10 |
| How to evaluate control measures for LLM agents? A trajectory from today to superintelligence Buck Shlegeris, Geoffrey Irving, Mikita Balesni, Tomek Korbak Published: 2025-04-07Area: Agent SafetyCitations: 11 Tags: agent-safety, ai-safety, safety-evaluation, theoretical | 2025-04-07 | Agent Safety | agent-safety, ai-safety, safety-evaluation, theoretical | E5 / R3 (92%) | 11 |
| Not All Data Are Unlearned Equally Aravind Krishnan, Marius Mosbach, Siva Reddy Published: 2025-04-07Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-04-07 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R3 (94%) | 8 |
| Steering off Course: Reliability Challenges in Steering Language Models Dheeraj Rajagopal, Hannaneh Hajishirzi, Hari Sethuraman, Patrick Queiroz Da Silva Published: 2025-04-06Area: Representation AnalysisCitations: 10 Tags: ai-safety, empirical, representation-analysis, safety-evaluation | 2025-04-06 | Representation Analysis | ai-safety, empirical, representation-analysis, safety-evaluation | E7 / R4 (99%) | 10 |
| The Hidden Space of Safety: Understanding Preference-Tuned LLMs in Multilingual context Manasa Bharadwaj, Nikhil Verma Published: 2025-04-03Area: Safety EvaluationCitations: 4 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-04-03 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E8 / R3 (96%) | 4 |
| Strategize Globally, Adapt Locally: A Multi-Turn Red Teaming Agent with Dual-Level Learning Ninareh Mehrabi, Rahul Gupta, Ruoxi Jia, Si Chen Published: 2025-04-02Area: Safety EvaluationCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-04-02 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 9 |
| Towards Trustworthy GUI Agents: A Survey Ninghao Liu, Wenhao Yu, Wenhu Chen, Wenlin Yao Published: 2025-03-30Area: Agent SafetyCitations: 19 Tags: agent-safety, ai-safety, safety-evaluation, survey | 2025-03-30 | Agent Safety | agent-safety, ai-safety, safety-evaluation, survey | E5 / R3 (93%) | 19 |
| What Makes an Evaluation Useful? Common Pitfalls and Best Practices Dan Lahav, Gil Gekker, Meirav Segal, Omer Nevo Published: 2025-03-30Area: Safety EvaluationCitations: 1 Tags: ai-safety, position, safety-evaluation | 2025-03-30 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (91%) | 1 |
| AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration Andy Zhou, Bo Li, Francesco Pinto, James Zou Published: 2025-03-20Area: Safety EvaluationCitations: 17 Tags: ai-safety, red-teaming, safety-evaluation, tool | 2025-03-20 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, tool | E5 / R3 (96%) | 17 |
| Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings Aishan Liu, Dacheng Tao, Deyue Zhang, Guangyi Zheng Published: 2025-03-19Area: Safety EvaluationCitations: 28 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-03-19 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 28 |
| Measuring AI Ability to Complete Long Tasks Amy Deng, Ben West, Brian Goodrich, Chris Painter Published: 2025-03-18Area: Safety EvaluationCitations: 96 Tags: ai-safety, benchmark, safety-evaluation | 2025-03-18 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R3 (96%) | 96 |
| A Framework for Evaluating Emerging Cyberattack Capabilities of AI Allan Dafoe, Anna Wang, Four Flynn, Lihao Liang Published: 2025-03-14Area: Safety EvaluationCitations: 24 Tags: ai-safety, benchmark, safety-evaluation | 2025-03-14 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 24 |
| Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation Aleksander Madry, Bowen Baker, David Farhi, Jakub Pachocki Published: 2025-03-14Area: Safety EvaluationCitations: 155 Tags: ai-safety, empirical, safety-evaluation | 2025-03-14 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 155 |
| DarkBench: Benchmarking Dark Patterns in Large Language Models Akash Kundu, Esben Kran, Jinsuk Park, Jord Nguyen Published: 2025-03-13Area: Safety EvaluationCitations: 18 Tags: ai-safety, benchmark, safety-evaluation | 2025-03-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R4 (97%) | 18 |
| Red Teaming Contemporary AI Models: Insights from Spanish and Basque Perspectives Aitor Arrieta, Ana B. S谩nchez, Antonia Cazalilla, Jos茅 A. Parejo Published: 2025-03-13Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-03-13 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R4 (97%) | 7 |