Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement Chengwei Pan, Hao Li, Hao Wang, Hongning Wang Published: 2025-02-24Area: Safety EvaluationCitations: 10 Tags: ai-safety, safety-evaluation, tool | 2025-02-24 | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R3 (96%) | 10 |
| FADE: Why Bad Descriptions Happen to Good Features Aakriti Jain, Bruno Puri, Elena Golimblevskaia, Patrick Kahardipraja Published: 2025-02-24Area: Mechanistic Interp.Citations: 6 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-02-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | 6 |
| Forecasting Rare Language Model Behaviors Erik Jones, Ethan Perez, Jan Leike, Jared Kaplan Published: 2025-02-24Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2025-02-24 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (94%) | 7 |
| GuidedBench: Equipping Jailbreak Evaluation with Guidelines Daoyuan Wu, Ruixuan Huang, Shuai Wang, Xunguang Wang Published: 2025-02-24Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-24 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |
| JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models Haoran Bu, Shuyi Liu, Simiao Cui, Xi Zhang Published: 2025-02-26Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-26 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 2 |
| Adaptively profiling models with task elicitation Davis Brown, Eric Wong, Hamed Hassani, Helen Jin Published: 2025-03-03Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-03-03 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| Building Safe GenAI Applications: An End-to-End Overview of Red Teaming for Large Language Models Akshay Gupta, Alberto Purpura, Andy Luo, Jesse Zymet Published: 2025-03-03Area: Safety EvaluationCitations: 7 Tags: ai-safety, red-teaming, safety-evaluation, survey | 2025-03-03 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, survey | E6 / R4 (96%) | 7 |
| From superposition to sparse codes: interpretable representations in neural networks Charles O'Neill, David Klindt, Harald Maurer, Nina Miolane Published: 2025-03-03Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, mechanistic-interp, safety-evaluation, theoretical | 2025-03-03 | Mechanistic Interp. | ai-safety, mechanistic-interp, safety-evaluation, theoretical | E5 / R3 (93%) | 7 |
| LLM-Safety Evaluations Lack Robustness Gauthier Gidel, Leo Schwinn, Simon Geisler, Sophie Xhonneux Published: 2025-03-04Area: Safety EvaluationCitations: 12 Tags: ai-safety, position, safety-evaluation | 2025-03-04 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R3 (94%) | 12 |
| The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems Adam Khoja, Alice Gatti, Arunim Agarwal, Brad Kenstler Published: 2025-03-05Area: Safety EvaluationCitations: 26 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-03-05 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (97%) | 26 |
| SafeArena: Evaluating the Safety of Autonomous Web Agents Ada Defne Tur, Alejandra Zambrano, Arkil Patel, Esin Durmus Published: 2025-03-06Area: Safety EvaluationCitations: 40 Tags: ai-safety, benchmark, safety-evaluation | 2025-03-06 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (98%) | 40 |
| A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of LLMs Daking Rai, Dong Shu, Haiyan Zhao, Mengnan Du Published: 2025-03-07Area: Surveys & ReviewsCitations: 34 Tags: ai-safety, safety-evaluation, survey, surveys-reviews | 2025-03-07 | Surveys & Reviews | ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R3 (94%) | 34 |
| BingoGuard: LLM Content Moderation Tools with Risk Levels Caiming Xiong, Chien-Sheng Wu, Divyansh Agarwal, Fan Yin Published: 2025-03-09Area: Safety EvaluationCitations: 15 Tags: ai-safety, empirical, safety-evaluation | 2025-03-09 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (99%) | 15 |
| Securing External Deeper-than-black-box GPAI Evaluations Alejandro Tlaie, Jimmy Farrell Published: 2025-03-10Area: Safety EvaluationCitations: 3 Tags: ai-safety, position, safety-evaluation | 2025-03-10 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (93%) | 3 |
| AgentDAM: Privacy Leakage Evaluation for Autonomous Web Agents Arman Zharmagambetov, Chuan Guo, Ivan Evtimov, Kamalika Chaudhuri Published: 2025-03-12Area: Agent SafetyCitations: 31 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-03-12 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E6 / R3 (97%) | 31 |
| SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability Adam Karvonen, Arthur Conmy, Callum McDougall, Can Rager Published: 2025-03-12Area: Mechanistic Interp.Citations: 62 Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2025-03-12 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (95%) | 62 |
| DarkBench: Benchmarking Dark Patterns in Large Language Models Akash Kundu, Esben Kran, Jinsuk Park, Jord Nguyen Published: 2025-03-13Area: Safety EvaluationCitations: 18 Tags: ai-safety, benchmark, safety-evaluation | 2025-03-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R4 (97%) | 18 |
| Red Teaming Contemporary AI Models: Insights from Spanish and Basque Perspectives Aitor Arrieta, Ana B. S谩nchez, Antonia Cazalilla, Jos茅 A. Parejo Published: 2025-03-13Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-03-13 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R4 (97%) | 7 |
| A Framework for Evaluating Emerging Cyberattack Capabilities of AI Allan Dafoe, Anna Wang, Four Flynn, Lihao Liang Published: 2025-03-14Area: Safety EvaluationCitations: 24 Tags: ai-safety, benchmark, safety-evaluation | 2025-03-14 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 24 |
| Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation Aleksander Madry, Bowen Baker, David Farhi, Jakub Pachocki Published: 2025-03-14Area: Safety EvaluationCitations: 155 Tags: ai-safety, empirical, safety-evaluation | 2025-03-14 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 155 |
| Measuring AI Ability to Complete Long Tasks Amy Deng, Ben West, Brian Goodrich, Chris Painter Published: 2025-03-18Area: Safety EvaluationCitations: 96 Tags: ai-safety, benchmark, safety-evaluation | 2025-03-18 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R3 (96%) | 96 |
| Towards Understanding the Safety Boundaries of DeepSeek Models: Evaluation and Findings Aishan Liu, Dacheng Tao, Deyue Zhang, Guangyi Zheng Published: 2025-03-19Area: Safety EvaluationCitations: 28 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-03-19 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 28 |
| AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration Andy Zhou, Bo Li, Francesco Pinto, James Zou Published: 2025-03-20Area: Safety EvaluationCitations: 17 Tags: ai-safety, red-teaming, safety-evaluation, tool | 2025-03-20 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, tool | E5 / R3 (96%) | 17 |
| Towards Trustworthy GUI Agents: A Survey Ninghao Liu, Wenhao Yu, Wenhu Chen, Wenlin Yao Published: 2025-03-30Area: Agent SafetyCitations: 19 Tags: agent-safety, ai-safety, safety-evaluation, survey | 2025-03-30 | Agent Safety | agent-safety, ai-safety, safety-evaluation, survey | E5 / R3 (93%) | 19 |
| What Makes an Evaluation Useful? Common Pitfalls and Best Practices Dan Lahav, Gil Gekker, Meirav Segal, Omer Nevo Published: 2025-03-30Area: Safety EvaluationCitations: 1 Tags: ai-safety, position, safety-evaluation | 2025-03-30 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (91%) | 1 |
| Strategize Globally, Adapt Locally: A Multi-Turn Red Teaming Agent with Dual-Level Learning Ninareh Mehrabi, Rahul Gupta, Ruoxi Jia, Si Chen Published: 2025-04-02Area: Safety EvaluationCitations: 9 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-04-02 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (96%) | 9 |
| The Hidden Space of Safety: Understanding Preference-Tuned LLMs in Multilingual context Manasa Bharadwaj, Nikhil Verma Published: 2025-04-03Area: Safety EvaluationCitations: 4 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-04-03 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E8 / R3 (96%) | 4 |
| Steering off Course: Reliability Challenges in Steering Language Models Dheeraj Rajagopal, Hannaneh Hajishirzi, Hari Sethuraman, Patrick Queiroz Da Silva Published: 2025-04-06Area: Representation AnalysisCitations: 10 Tags: ai-safety, empirical, representation-analysis, safety-evaluation | 2025-04-06 | Representation Analysis | ai-safety, empirical, representation-analysis, safety-evaluation | E7 / R4 (99%) | 10 |
| How to evaluate control measures for LLM agents? A trajectory from today to superintelligence Buck Shlegeris, Geoffrey Irving, Mikita Balesni, Tomek Korbak Published: 2025-04-07Area: Agent SafetyCitations: 11 Tags: agent-safety, ai-safety, safety-evaluation, theoretical | 2025-04-07 | Agent Safety | agent-safety, ai-safety, safety-evaluation, theoretical | E5 / R3 (92%) | 11 |
| Not All Data Are Unlearned Equally Aravind Krishnan, Marius Mosbach, Siva Reddy Published: 2025-04-07Area: Model EditingCitations: 8 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-04-07 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R3 (94%) | 8 |