Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 991-1000 of 1000+ papers (page 34 of 34)路 174 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| On Evaluating the Durability of Safeguards for Open-Weight LLMs Boyi Wei, Luxi He, Matthew Jagielski, Milad Nasr Published: 2024-12-10Area: Adversarial RobustnessCitations: 42 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-12-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 42 |
| Frontier AI systems have surpassed the self-replicating red line Jiarun Dai, Min Yang, Xudong Pan, Yihe Fan Published: 2024-12-09Area: Safety EvaluationCitations: 15 Tags: ai-safety, empirical, safety-evaluation | 2024-12-09 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 15 |
| Evaluating Sparse Autoencoders on Targeted Concept Erasure Tasks Adam Karvonen, Can Rager, Neel Nanda, Samuel Marks Published: 2024-11-28Area: Mechanistic Interp.Citations: 9 Tags: ai-safety, benchmark, mechanistic-interp, safety-evaluation | 2024-11-28 | Mechanistic Interp. | ai-safety, benchmark, mechanistic-interp, safety-evaluation | E5 / R3 (96%) | 9 |
| What AI evaluations for preventing catastrophic risks can and cannot do Lisa Thiergart, Peter Barnett Published: 2024-11-26Area: Safety EvaluationCitations: 3 Tags: ai-safety, alignment-training, position, safety-evaluation | 2024-11-26 | Safety Evaluation | ai-safety, alignment-training, position, safety-evaluation | E6 / R3 (95%) | 3 |
| Do Large Language Models Perform Latent Multi-Hop Reasoning without Exploiting Shortcuts? Elena Gribovskaya, Mor Geva, Nora Kassner, Sebastian Riedel Published: 2024-11-25Area: Safety EvaluationCitations: 23 Tags: ai-safety, empirical, safety-evaluation | 2024-11-25 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (93%) | 23 |
| ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain Arman Cohan, Di Jin, Haochen Zhao, Mark Gerstein Published: 2024-11-23Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-11-23 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 6 |
| RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts Aron Lajko, Ben West, Brian Goodrich, Elena Ericheva Published: 2024-11-22Area: Safety EvaluationCitations: 68 Tags: ai-safety, benchmark, safety-evaluation | 2024-11-22 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 68 |
| Does Unlearning Truly Unlearn? A Black Box Evaluation of LLM Unlearning Methods Asa Cooper Stickland, Jai Doshi Published: 2024-11-18Area: Safety EvaluationCitations: 20 Tags: ai-safety, empirical, safety-evaluation | 2024-11-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | 20 |
| Beyond the Safety Bundle: Auditing the Helpful and Harmless Dataset Golnoosh Farnadi, Jackie CK Cheung, Jonathan Cola莽o Carr, Khaoula Chehbouni Published: 2024-11-12Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2024-11-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 7 |
| RedCode: Risky Code Execution and Generation Benchmark for Code Agents Andy Zhou, Bo Li, Chengquan Guo, Chulin Xie Published: 2024-11-12Area: Safety EvaluationCitations: 59 Tags: ai-safety, benchmark, safety-evaluation | 2024-11-12 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (98%) | 59 |
| Safety case template for frontier AI: A cyber inability argument Arthur Goemans, Benjamin Hilton, Geoffrey Irving, Jessica Wang Published: 2024-11-12Area: Safety EvaluationCitations: 26 Tags: ai-safety, position, safety-evaluation | 2024-11-12 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (96%) | 26 |
| Towards Unifying Interpretability and Control: Evaluation via Intervention Asma Ghandeharioun, Himabindu Lakkaraju, Suraj Srinivas, Usha Bhalla Published: 2024-11-07Area: Mechanistic Interp.Citations: 20 Tags: ai-safety, empirical, interpretability, mechanistic-interp, safety-evaluation | 2024-11-07 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp, safety-evaluation | E6 / R3 (94%) | 20 |
| Defining and Evaluating Physical Safety for Large Language Models Pin-Yu Chen, Tsung-Yi Ho, Yung-Chen Tang Published: 2024-11-04Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2024-11-04 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 4 |
| Desert Camels and Oil Sheikhs: Arab-Centric Red Teaming of Frontier LLMs Elgizouli Mohamed, Muhammad Abdul-Mageed, Muhammed Saeed, Mukhtar Mohamed Published: 2024-10-31Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-10-31 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E6 / R3 (95%) | - |
| RESTOR: Knowledge Recovery through Machine Unlearning Abhilasha Ravichander, Faeze Brahman, Keivan Rezaei, Khyathi Chandu Published: 2024-10-31Area: Model EditingCitations: 2 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-10-31 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E6 / R3 (95%) | 2 |
| CFSafety: Comprehensive Fine-grained Safety Assessment for LLMs Chenhui Hu, Zhihao Liu Published: 2024-10-29Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |
| SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt Types Shikun Zhang, Wei Ye, Yutao Mou Published: 2024-10-29Area: Safety EvaluationCitations: 48 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 48 |
| Towards Evaluations-Based Safety Cases for AI Scheming Alexander Meinke, Bilal Chughtai, Buck Shlegeris, Charlotte Stix Published: 2024-10-29Area: Safety EvaluationCitations: 25 Tags: ai-safety, position, safety-evaluation | 2024-10-29 | Safety Evaluation | ai-safety, position, safety-evaluation | E6 / R4 (94%) | 25 |
| Sabotage Evaluations for Frontier Models Buck Shlegeris, Cem Anil, David Duvenaud, Deep Ganguli Published: 2024-10-28Area: Safety EvaluationCitations: 29 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-28 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 29 |
| Safety Cases for Frontier AI Gaurav Sett, Jonas Schuett, Leonie Koessler, Marie Davidsen Buhl Published: 2024-10-28Area: Safety EvaluationCitations: 23 Tags: ai-safety, position, safety-evaluation | 2024-10-28 | Safety Evaluation | ai-safety, position, safety-evaluation | E4 / R3 (96%) | 23 |
| An Auditing Test To Detect Behavioral Shift in Language Models Leo Richter, Matt J. Kusner, Pasquale Minervini, Xuanli He Published: 2024-10-25Area: Safety EvaluationCitations: 2 Tags: ai-safety, empirical, safety-evaluation | 2024-10-25 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (94%) | 2 |
| ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models Bing Wang, Bingyi Jing, Guanhua Chen, Haifeng Bai Published: 2024-10-24Area: Safety EvaluationCitations: 6 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R2 (98%) | 6 |
| SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models Aishan Liu, Dacheng Tao, Jinyang Guo, Lei Huang Published: 2024-10-24Area: Multimodal SafetyCitations: 44 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2024-10-24 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 44 |
| LLMScan: Causal Scan for LLM Misbehavior Detection Jun Sun, Kai Kiat Goh, Mengdi Zhang, Peixin Zhang Published: 2024-10-22Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-10-22 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (96%) | 6 |
| Towards Reliable Evaluation of Behavior Steering Interventions in LLMs David Krueger, Ekdeep Singh Lubana, Itamar Pres, Laura Ruis Published: 2024-10-22Area: Safety EvaluationCitations: 23 Tags: ai-safety, empirical, safety-evaluation | 2024-10-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (96%) | 23 |
| Insights and Current Gaps in Open-Source LLM Vulnerability Scanners: A Comparative Analysis Aishvariya Priya, Amit Giloni, Hisashi Kojima, Inderjeet Singh Published: 2024-10-21Area: Safety EvaluationCitations: 8 Tags: ai-safety, safety-evaluation, survey | 2024-10-21 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R4 (94%) | 8 |
| Estimating the Probabilities of Rare Outputs in Language Models Gabriel Wu, Jacob Hilton Published: 2024-10-17Area: Safety EvaluationCitations: 6 Tags: ai-safety, empirical, safety-evaluation | 2024-10-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R5 (96%) | 6 |
| To Err is AI: A Case Study Informing LLM Flaw Reporting Practices Allyson Ettinger, Avijit Ghosh, Christopher Fiorelli, Kavel Rao Published: 2024-10-15Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2024-10-15 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R4 (97%) | 5 |
| Do Unlearning Methods Remove Information from Language Model Weights? Aghyad Deeb, Fabien Roger Published: 2024-10-11Area: Model EditingCitations: 49 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2024-10-11 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 49 |
| JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework Dawei Yin, Fan Liu, Hao Liu, Lixin Su Published: 2024-10-11Area: Safety EvaluationCitations: 36 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-10-11 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 36 |