Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| AgentDAM: Privacy Leakage Evaluation for Autonomous Web Agents Arman Zharmagambetov, Chuan Guo, Ivan Evtimov, Kamalika Chaudhuri Published: 2025-03-12Area: Agent SafetyCitations: 31 Tags: agent-safety, ai-safety, benchmark, safety-evaluation | 2025-03-12 | Agent Safety | agent-safety, ai-safety, benchmark, safety-evaluation | E6 / R3 (97%) | 31 |
| SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability Adam Karvonen, Arthur Conmy, Callum McDougall, Can Rager Published: 2025-03-12Area: Mechanistic Interp.Citations: 62 Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2025-03-12 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (95%) | 62 |
| Securing External Deeper-than-black-box GPAI Evaluations Alejandro Tlaie, Jimmy Farrell Published: 2025-03-10Area: Safety EvaluationCitations: 3 Tags: ai-safety, position, safety-evaluation | 2025-03-10 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (93%) | 3 |
| BingoGuard: LLM Content Moderation Tools with Risk Levels Caiming Xiong, Chien-Sheng Wu, Divyansh Agarwal, Fan Yin Published: 2025-03-09Area: Safety EvaluationCitations: 15 Tags: ai-safety, empirical, safety-evaluation | 2025-03-09 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (99%) | 15 |
| A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of LLMs Daking Rai, Dong Shu, Haiyan Zhao, Mengnan Du Published: 2025-03-07Area: Surveys & ReviewsCitations: 34 Tags: ai-safety, safety-evaluation, survey, surveys-reviews | 2025-03-07 | Surveys & Reviews | ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R3 (94%) | 34 |
| SafeArena: Evaluating the Safety of Autonomous Web Agents Ada Defne Tur, Alejandra Zambrano, Arkil Patel, Esin Durmus Published: 2025-03-06Area: Safety EvaluationCitations: 40 Tags: ai-safety, benchmark, safety-evaluation | 2025-03-06 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (98%) | 40 |
| The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems Adam Khoja, Alice Gatti, Arunim Agarwal, Brad Kenstler Published: 2025-03-05Area: Safety EvaluationCitations: 26 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-03-05 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (97%) | 26 |
| LLM-Safety Evaluations Lack Robustness Gauthier Gidel, Leo Schwinn, Simon Geisler, Sophie Xhonneux Published: 2025-03-04Area: Safety EvaluationCitations: 12 Tags: ai-safety, position, safety-evaluation | 2025-03-04 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R3 (94%) | 12 |
| Adaptively profiling models with task elicitation Davis Brown, Eric Wong, Hamed Hassani, Helen Jin Published: 2025-03-03Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-03-03 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| Building Safe GenAI Applications: An End-to-End Overview of Red Teaming for Large Language Models Akshay Gupta, Alberto Purpura, Andy Luo, Jesse Zymet Published: 2025-03-03Area: Safety EvaluationCitations: 7 Tags: ai-safety, red-teaming, safety-evaluation, survey | 2025-03-03 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, survey | E6 / R4 (96%) | 7 |
| From superposition to sparse codes: interpretable representations in neural networks Charles O'Neill, David Klindt, Harald Maurer, Nina Miolane Published: 2025-03-03Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, mechanistic-interp, safety-evaluation, theoretical | 2025-03-03 | Mechanistic Interp. | ai-safety, mechanistic-interp, safety-evaluation, theoretical | E5 / R3 (93%) | 7 |
| JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models Haoran Bu, Shuyi Liu, Simiao Cui, Xi Zhang Published: 2025-02-26Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-26 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 2 |
| AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement Chengwei Pan, Hao Li, Hao Wang, Hongning Wang Published: 2025-02-24Area: Safety EvaluationCitations: 10 Tags: ai-safety, safety-evaluation, tool | 2025-02-24 | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R3 (96%) | 10 |
| FADE: Why Bad Descriptions Happen to Good Features Aakriti Jain, Bruno Puri, Elena Golimblevskaia, Patrick Kahardipraja Published: 2025-02-24Area: Mechanistic Interp.Citations: 6 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-02-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | 6 |
| Forecasting Rare Language Model Behaviors Erik Jones, Ethan Perez, Jan Leike, Jared Kaplan Published: 2025-02-24Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2025-02-24 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (94%) | 7 |
| GuidedBench: Equipping Jailbreak Evaluation with Guidelines Daoyuan Wu, Ruixuan Huang, Shuai Wang, Xunguang Wang Published: 2025-02-24Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-24 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |
| A Comprehensive Survey of Machine Unlearning Techniques for Large Language Models Fakhri Karray, Hans-Arno Jacobsen, Herbert Woisetschl盲ger, Jiahui Geng Published: 2025-02-22Area: Model EditingCitations: 23 Tags: ai-safety, model-editing, safety-evaluation, survey | 2025-02-22 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E6 / R4 (97%) | 23 |
| Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMs Ambrish Rawat, Beat Buesser, Giandomenico Cornacchia, Giulio Zizzo Published: 2025-02-21Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E7 / R3 (97%) | 12 |
| LUME: LLM Unlearning with Multitask Evaluations Anil Ramakrishna, Bhanukiran Vinzamuri, Kai-Wei Chang, Mingyi Hong Published: 2025-02-20Area: Model EditingCitations: 25 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-02-20 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (95%) | 25 |
| Soft Token Attacks Cannot Reliably Audit Unlearning in Large Language Models Haokun Chen, Nageen Himayat, Sebastian Szyller, Weilin Xu Published: 2025-02-20Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-02-20 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| Language Models Can Predict Their Own Behavior Dhananjay Ashok, Jonathan May Published: 2025-02-18Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2025-02-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 5 |
| OCCULT: Evaluating Large Language Models for Offensive Cyber Operation Capabilities Alex Byrne, Dan Martin, Ethan Michalak, Gianpaolo Russo Published: 2025-02-18Area: Safety EvaluationCitations: 15 Tags: ai-safety, benchmark, safety-evaluation | 2025-02-18 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (97%) | 15 |
| Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking Dawei Yin, Junda Zhu, Lei Sha, Lingyong Yan Published: 2025-02-18Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-02-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 27 |
| The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1 Chengzhi Liu, Dawn Song, Gaowen Liu, Jayanth Srinivasa Published: 2025-02-18Area: Safety EvaluationCitations: 80 Tags: ai-safety, empirical, safety-evaluation | 2025-02-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 80 |
| SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities Bill Yuchen Lin, Bo Li, Fengqing Jiang, Luyao Niu Published: 2025-02-17Area: Safety EvaluationCitations: 88 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-17 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 88 |
| SafeDialBench: A Fine-Grained Safety Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks Boyan Wang, Chao Deng, Fan Feng, Fanyu Meng Published: 2025-02-16Area: Safety EvaluationCitations: 18 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-16 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R4 (98%) | 18 |
| Safety Evaluation of DeepSeek Models in Chinese Contexts Chaoyang Ma, Jiaojiao Zhao, Kai Wang, Minjie Hua Published: 2025-02-16Area: Safety EvaluationCitations: 11 Tags: ai-safety, benchmark, safety-evaluation | 2025-02-16 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 11 |
| The Mirage of Model Editing: Revisiting Evaluation in the Wild Dawei Yin, Fei Sun, Huawei Shen, Jiajun Tan Published: 2025-02-16Area: Model EditingCitations: 16 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-02-16 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (94%) | 16 |
| A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations Bo Du, Dacheng Tao, Mang Ye, Nenghai Yu Published: 2025-02-14Area: Multimodal SafetyCitations: 47 Tags: ai-safety, multimodal-safety, safety-evaluation, survey | 2025-02-14 | Multimodal Safety | ai-safety, multimodal-safety, safety-evaluation, survey | E5 / R3 (95%) | 47 |
| Fast Proxies for LLM Robustness Evaluation Jan Schuchardt, Leo Schwinn, Stephan G眉nnemann, Tim Beyer Published: 2025-02-14Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 3 |