Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Evaluating Frontier Models for Dangerous Capabilities Albert Webson, Alexandre Kaskasoli, Allan Dafoe, Anca Dragan Published: 2024-03-20Area: Safety EvaluationCitations: 107 Tags: ai-safety, benchmark, safety-evaluation | 2024-03-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 107 |
| RewardBench: Evaluating Reward Models for Language Modeling Bill Yuchen Lin, Hannaneh Hajishirzi, Jacob Morrison, Khyathi Chandu Published: 2024-03-20Area: Safety EvaluationCitations: 366 Tags: ai-safety, benchmark, safety-evaluation | 2024-03-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 366 |
| JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Alexander Robey, Edgar Dobriban, Edoardo Debenedetti, Eric Wong Published: 2024-03-28Area: Adversarial RobustnessCitations: 330 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-03-28 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 330 |
| JailBreakV-28K: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks Chaowei Xiao, Siyuan Ma, Weidi Luo, Xiaogeng Liu Published: 2024-04-03Area: Multimodal SafetyCitations: 182 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety | 2024-04-03 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety | E4 / R3 (98%) | 182 |
| ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming Bo Li, Felix Friedrich, Huu Nguyen, Kristian Kersting Published: 2024-04-06Area: Safety EvaluationCitations: 83 Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-04-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E4 / R3 (96%) | 83 |
| Rethinking How to Evaluate Language Model Jailbreak Antonio Bianchi, Arjun Arunasalam, Hongyu Cai, Leo Y. Lin Published: 2024-04-09Area: Safety EvaluationCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-04-09 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E7 / R3 (94%) | 12 |
| CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models Cornelius Aschermann, Cyrus Nikolaidis, Daniel Song, David Molnar Published: 2024-04-19Area: Safety EvaluationCitations: 71 Tags: ai-safety, benchmark, safety-evaluation | 2024-04-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 71 |
| Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs Florian Tram猫r, Francesco Croce, Javier Rando, Kry拧tof Mitka Published: 2024-04-22Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, benchmark | 2024-04-22 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E5 / R3 (95%) | 24 |
| Poser: Unmasking Alignment Faking LLMs by Manipulating Their Internals Caden Juang, Joshua Clymer, Severin Field Published: 2024-05-08Area: Deception & FailureCitations: 7 Tags: ai-safety, alignment-training, benchmark, deception-failure | 2024-05-08 | Deception & Failure | ai-safety, alignment-training, benchmark, deception-failure | E4 / R3 (96%) | 7 |
| Towards Principled Evaluations of Sparse Autoencoders for Interpretability and Control Aleksandar Makelov, Georg Lange, Neel Nanda Published: 2024-05-14Area: Mechanistic Interp.Citations: 66 Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2024-05-14 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E6 / R3 (95%) | 66 |
| ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation An Zhang, Han Wang, Jingnan Zheng, Jun Sun Published: 2024-05-23Area: Safety EvaluationCitations: 48 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2024-05-23 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R4 (95%) | 48 |
| S-Eval: Automatic and Adaptive Test Generation for Benchmarking Safety Evaluation of Large Language Models Dongxia Wang, Hui Xue, Jinfeng Li, Jingyi Wang Published: 2024-05-23Area: Safety EvaluationCitations: 21 Tags: ai-safety, benchmark, safety-evaluation | 2024-05-23 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R5 (98%) | 21 |
| OR-Bench: An Over-Refusal Benchmark for Large Language Models Cho-Jui Hsieh, Ion Stoica, Justin Cui, Wei-Lin Chiang Published: 2024-05-31Area: Safety EvaluationCitations: 109 Tags: ai-safety, benchmark, safety-evaluation | 2024-05-31 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 109 |
| BELLS: A Framework Towards Future Proof Benchmarks for the Evaluation of LLM Safeguards Alexandre Variengien, Charbel-Rapha毛l Segerie, Diego Dorn, Vincent Corruble Published: 2024-06-03Area: Safety EvaluationCitations: 14 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-03 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (97%) | 14 |
| CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models Deyi Xiong, Ling Shi Published: 2024-06-07Area: Safety EvaluationCitations: 2 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (99%) | 2 |
| Are we making progress in unlearning? Findings from the first NeurIPS unlearning competition Eleni Triantafillou, Fabian Pedregosa, Gintare Karolina Dziugaite, Ioannis Mitliagkas Published: 2024-06-13Area: Alignment TrainingCitations: 44 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2024-06-13 | Alignment Training | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (94%) | 44 |
| Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs Fan Liu, Hao Liu, Zhao Xu Published: 2024-06-13Area: Adversarial RobustnessCitations: 34 Tags: adversarial-robustness, ai-safety, benchmark | 2024-06-13 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark | E7 / R3 (98%) | 34 |
| RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models Chenhao Wang, Hongbang Yuan, Jiachun Li, Jun Zhao Published: 2024-06-16Area: Model EditingCitations: 57 Tags: adversarial-robustness, ai-safety, benchmark, model-editing | 2024-06-16 | Model Editing | adversarial-robustness, ai-safety, benchmark, model-editing | E5 / R3 (95%) | 57 |
| AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents Edoardo Debenedetti, Florian Tramer, Jie Zhang, Luca Beurer-Kellner Published: 2024-06-19Area: Agent SafetyCitations: 94 Tags: agent-safety, ai-safety, benchmark | 2024-06-19 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (98%) | 94 |
| BeHonest: Benchmarking Honesty in Large Language Models Binjie Wang, Ethan Chern, Jiahe Jin, Pengfei Liu Published: 2024-06-19Area: Safety EvaluationCitations: 12 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 12 |
| Raising the Bar: Investigating the Values of Large Language Models via Generative Evolving Testing Han Jiang, Shu Wang, XiaoYuan Yi, Xing Xie Published: 2024-06-20Area: Safety EvaluationCitations: 16 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2024-06-20 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (95%) | 16 |
| SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal Behaviors Bo Li, Boyi Wei, Dacheng Li, Danqi Chen Published: 2024-06-20Area: Safety EvaluationCitations: 151 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (97%) | 151 |
| Deciphering the Definition of Adversarial Robustness for post-hoc OOD Detectors Jens M眉ller, Mario Fernandez, Peter Lorenz, Ullrich K枚the Published: 2024-06-21Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-06-21 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 1 |
| MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries? Cho-Jui Hsieh, Hengguang Zhou, Minhao Cheng, Ruochen Wang Published: 2024-06-22Area: Safety EvaluationCitations: 23 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-22 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 23 |
| How Data Inter-connectivity Shapes LLMs Unlearning: A Structural Unlearning Perspective Meghdad Kurmanji, Nicholas D. Lane, Nicola Cancedda, Pontus Stenetorp Published: 2024-06-24Area: Model EditingCitations: 1 Tags: ai-safety, benchmark, model-editing | 2024-06-24 | Model Editing | ai-safety, benchmark, model-editing | E6 / R4 (96%) | 1 |
| Evaluating Copyright Takedown Methods for Language Models Boyi Wei, Chiyuan Zhang, Kai Li, Luke Zettlemoyer Published: 2024-06-26Area: Model EditingCitations: 42 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-06-26 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (95%) | 42 |
| ProgressGym: Alignment with a Millennium of Moral Progress Jasmine Xinze Li, Jiaming Ji, Tianyi Qiu, Xuchuan Huang Published: 2024-06-28Area: Alignment TrainingCitations: 9 Tags: ai-safety, alignment-training, benchmark | 2024-06-28 | Alignment Training | ai-safety, alignment-training, benchmark | E7 / R5 (98%) | 9 |
| The Art of Saying No: Contextual Noncompliance in Language Models Abhilasha Ravichander, Faeze Brahman, Hannaneh Hajishirzi, Jack Hessel Published: 2024-07-02Area: Safety EvaluationCitations: 67 Tags: ai-safety, benchmark, safety-evaluation | 2024-07-02 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (94%) | 67 |
| To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Models Bozhong Tian, Dianbo Sui, Huajun Chen, Mengru Wang Published: 2024-07-02Area: Model EditingCitations: 23 Tags: ai-safety, benchmark, model-editing | 2024-07-02 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (95%) | 23 |
| Me, Myself, and AI: The Situational Awareness Dataset (SAD) for LLMs Alexander Meinke, Bilal Chughtai, Jan Betley, J茅r茅my Scheurer Published: 2024-07-05Area: Safety EvaluationCitations: 46 Tags: ai-safety, benchmark, safety-evaluation | 2024-07-05 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 46 |