Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Towards Evaluations-Based Safety Cases for AI Scheming Alexander Meinke, Bilal Chughtai, Buck Shlegeris, Charlotte Stix Published: 2024-10-29Area: Safety EvaluationCitations: 25 Tags: ai-safety, position, safety-evaluation | 2024-10-29 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R4 (94%) | 25 |
| Desert Camels and Oil Sheikhs: Arab-Centric Red Teaming of Frontier LLMs Elgizouli Mohamed, Muhammad Abdul-Mageed, Muhammed Saeed, Mukhtar Mohamed Published: 2024-10-31Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-10-31 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E6 / R3 (95%) | - |
| RESTOR: Knowledge Recovery through Machine Unlearning Abhilasha Ravichander, Faeze Brahman, Keivan Rezaei, Khyathi Chandu Published: 2024-10-31Area: Model EditingCitations: 2 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-10-31 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E6 / R3 (95%) | 2 |
| Defining and Evaluating Physical Safety for Large Language Models Pin-Yu Chen, Tsung-Yi Ho, Yung-Chen Tang Published: 2024-11-04Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2024-11-04 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 4 |
| Towards Unifying Interpretability and Control: Evaluation via Intervention Asma Ghandeharioun, Himabindu Lakkaraju, Suraj Srinivas, Usha Bhalla Published: 2024-11-07Area: Mechanistic Interp.Citations: 20 Tags: ai-safety, empirical, interpretability, mechanistic-interp, safety-evaluation | 2024-11-07 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp, safety-evaluation | E6 / R3 (94%) | 20 |
| Beyond the Safety Bundle: Auditing the Helpful and Harmless Dataset Golnoosh Farnadi, Jackie CK Cheung, Jonathan Cola莽o Carr, Khaoula Chehbouni Published: 2024-11-12Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2024-11-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 7 |
| RedCode: Risky Code Execution and Generation Benchmark for Code Agents Andy Zhou, Bo Li, Chengquan Guo, Chulin Xie Published: 2024-11-12Area: Safety EvaluationCitations: 59 Tags: ai-safety, benchmark, safety-evaluation | 2024-11-12 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (98%) | 59 |
| Safety case template for frontier AI: A cyber inability argument Arthur Goemans, Benjamin Hilton, Geoffrey Irving, Jessica Wang Published: 2024-11-12Area: Safety EvaluationCitations: 26 Tags: ai-safety, position, safety-evaluation | 2024-11-12 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (96%) | 26 |
| Does Unlearning Truly Unlearn? A Black Box Evaluation of LLM Unlearning Methods Asa Cooper Stickland, Jai Doshi Published: 2024-11-18Area: Safety EvaluationCitations: 20 Tags: ai-safety, empirical, safety-evaluation | 2024-11-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | 20 |
| RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts Aron Lajko, Ben West, Brian Goodrich, Elena Ericheva Published: 2024-11-22Area: Safety EvaluationCitations: 68 Tags: ai-safety, benchmark, safety-evaluation | 2024-11-22 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 68 |
| ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain Arman Cohan, Di Jin, Haochen Zhao, Mark Gerstein Published: 2024-11-23Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-11-23 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 6 |
| Do Large Language Models Perform Latent Multi-Hop Reasoning without Exploiting Shortcuts? Elena Gribovskaya, Mor Geva, Nora Kassner, Sebastian Riedel Published: 2024-11-25Area: Safety EvaluationCitations: 23 Tags: ai-safety, empirical, safety-evaluation | 2024-11-25 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (93%) | 23 |
| What AI evaluations for preventing catastrophic risks can and cannot do Lisa Thiergart, Peter Barnett Published: 2024-11-26Area: Safety EvaluationCitations: 3 Tags: ai-safety, alignment-training, position, safety-evaluation | 2024-11-26 | Safety Evaluation | ai-safety, alignment-training, position, safety-evaluation | E6 / R3 (95%) | 3 |
| Evaluating Sparse Autoencoders on Targeted Concept Erasure Tasks Adam Karvonen, Can Rager, Neel Nanda, Samuel Marks Published: 2024-11-28Area: Mechanistic Interp.Citations: 9 Tags: ai-safety, benchmark, mechanistic-interp, safety-evaluation | 2024-11-28 | Mechanistic Interp. | ai-safety, benchmark, mechanistic-interp, safety-evaluation | E5 / R3 (96%) | 9 |
| Frontier AI systems have surpassed the self-replicating red line Jiarun Dai, Min Yang, Xudong Pan, Yihe Fan Published: 2024-12-09Area: Safety EvaluationCitations: 15 Tags: ai-safety, empirical, safety-evaluation | 2024-12-09 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 15 |
| Knowledge Graph Guided Evaluation of Abstention Techniques Danish Pruthi, Kinshuk Vasisht, Navreet Kaur Published: 2024-12-10Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2024-12-10 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |
| On Evaluating the Durability of Safeguards for Open-Weight LLMs Boyi Wei, Luxi He, Matthew Jagielski, Milad Nasr Published: 2024-12-10Area: Adversarial RobustnessCitations: 42 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 42 |
| Underestimated Privacy Risks for Minority Populations in Large Language Model Unlearning Bo Li, Eleonora Krea膷i膰, Eli Chien, Mohsen Ghassemi Published: 2024-12-11Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2024-12-11 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R3 (97%) | 4 |
| Subversion Strategy Eval: Can language models statelessly strategize to subvert control protocols? Alessandro Abate, Alex Mallen, Buck Shlegeris, Charlie Griffin Published: 2024-12-17Area: Safety EvaluationCitations: 9 Tags: ai-safety, empirical, safety-evaluation | 2024-12-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 9 |
| Clio: Privacy-Preserving Insights into Real-World AI Use Alex Tamkin, Alfred Mountfield, Ankur Rathi, Brian Clarke Published: 2024-12-18Area: Safety EvaluationCitations: 62 Tags: ai-safety, safety-evaluation, tool | 2024-12-18 | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R3 (97%) | 62 |
| LLMs Lost in Translation: M-ALERT uncovers Cross-Linguistic Safety Inconsistencies Bo Li, Felix Friedrich, Huu Nguyen, Kristian Kersting Published: 2024-12-19Area: Safety EvaluationCitations: 2 Tags: ai-safety, benchmark, safety-evaluation | 2024-12-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 2 |
| Quantifying detection rates for dangerous capabilities: a theoretical model of dangerous capability evaluations Alessandro Di Stefano, Paolo Bova, The Anh Han Published: 2024-12-19Area: Safety EvaluationCitations: 3 Tags: ai-safety, safety-evaluation, theoretical | 2024-12-19 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (94%) | 3 |
| OpenAI o1 System Card Aaron Jaech, Adam Kalai, Adam Lerer, Ahmed El-Kishky Published: 2024-12-21Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2024-12-21 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | - |
| Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs Alexander von Recum, Christoph Schnabl, Gabor Hollbeck, Marvin von Hagen Published: 2024-12-22Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2024-12-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 5 |
| Diverse and Effective Red Teaming with Auto-generated Rewards and Multi-step Reinforcement Learning Alex Beutel, Johannes Heidecke, Kai Xiao, Lilian Weng Published: 2024-12-24Area: Safety EvaluationCitations: 22 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2024-12-24 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 22 |
| Libra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and Capability Artem Shelmanov, Bingchen Zhao, Cong Zeng, Donghai Hong Published: 2024-12-24Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2024-12-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 4 |
| CALM: Curiosity-Driven Auditing for Large Language Models Chao Shen, Cong Wang, Longxiang Wang, Xiang Zheng Published: 2025-01-06Area: Safety EvaluationCitations: 6 Tags: ai-safety, empirical, safety-evaluation | 2025-01-06 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 6 |
| Rethinking Evaluation of Sparse Autoencoders through the Representation of Polysemous Words Gouki Minegishi, Hiroki Furuta, Yusuke Iwasawa, Yutaka Matsuo Published: 2025-01-09Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-01-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | 10 |
| Lessons From Red Teaming 100 Generative AI Products Amanda Minnich, Blake Bullwinkel, Bolor-Erdene Jagdagdorj, Chang Kawaguchi Published: 2025-01-13Area: Safety EvaluationCitations: 20 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-01-13 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (97%) | 20 |
| Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models Chao Shen, Erjia Xiao, Hao Cheng, Jindong Gu Published: 2025-01-23Area: Multimodal SafetyCitations: 8 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-01-23 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 8 |