Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Resistance Against Manipulative AI: key factors and possible actions Piotr Wilczy艅ski, Przemys艂aw Biecek, Wiktoria Mieleszczenko-Kowszewicz Published: 2024-04-22Area: Safety EvaluationCitations: 7 Tags: ai-safety, empirical, safety-evaluation | 2024-04-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 7 |
| Don't Say No: Jailbreaking LLM by Suppressing Refusal Wenjie Wang, Yukai Zhou Published: 2024-04-25Area: Adversarial RobustnessCitations: 46 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-04-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 46 |
| Uncovering Deceptive Tendencies in Language Models: A Simulated Company AI Assistant Evan Hubinger, Olli J盲rviniemi Published: 2024-04-25Area: Deception & FailureCitations: 25 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2024-04-25 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E4 / R3 (98%) | 25 |
| Towards Principled Evaluations of Sparse Autoencoders for Interpretability and Control Aleksandar Makelov, Georg Lange, Neel Nanda Published: 2024-05-14Area: Mechanistic Interp.Citations: 66 Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2024-05-14 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E6 / R3 (95%) | 66 |
| ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation An Zhang, Han Wang, Jingnan Zheng, Jun Sun Published: 2024-05-23Area: Safety EvaluationCitations: 48 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2024-05-23 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R4 (95%) | 48 |
| Lessons from the Trenches on Reproducible Evaluation of Language Models Alham Fikri Aji, Andy Zou, Anthony DiPofi, Aviya Skowron Published: 2024-05-23Area: Safety EvaluationCitations: 119 Tags: ai-safety, safety-evaluation, tool | 2024-05-23 | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R2 (96%) | 119 |
| S-Eval: Automatic and Adaptive Test Generation for Benchmarking Safety Evaluation of Large Language Models Dongxia Wang, Hui Xue, Jinfeng Li, Jingyi Wang Published: 2024-05-23Area: Safety EvaluationCitations: 21 Tags: ai-safety, benchmark, safety-evaluation | 2024-05-23 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R5 (98%) | 21 |
| Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language Models Duen Horng Chau, Matthew Hull, Pin-Yu Chen, ShengYun Peng Published: 2024-05-27Area: Safety EvaluationCitations: 51 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2024-05-27 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (94%) | 51 |
| Stress-Testing Capability Elicitation With Password-Locked Models David Krueger, Dmitrii Krasheninnikov, Fabien Roger, Ryan Greenblatt Published: 2024-05-29Area: Safety EvaluationCitations: 26 Tags: ai-safety, empirical, safety-evaluation | 2024-05-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (93%) | 26 |
| OR-Bench: An Over-Refusal Benchmark for Large Language Models Cho-Jui Hsieh, Ion Stoica, Justin Cui, Wei-Lin Chiang Published: 2024-05-31Area: Safety EvaluationCitations: 109 Tags: ai-safety, benchmark, safety-evaluation | 2024-05-31 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 109 |
| BELLS: A Framework Towards Future Proof Benchmarks for the Evaluation of LLM Safeguards Alexandre Variengien, Charbel-Rapha毛l Segerie, Diego Dorn, Vincent Corruble Published: 2024-06-03Area: Safety EvaluationCitations: 14 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-03 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (97%) | 14 |
| Scaling and Evaluating Sparse Autoencoders Alec Radford, Gabriel Goh, Henk Tillman, Ilya Sutskever Published: 2024-06-06Area: Mechanistic Interp.Citations: 334 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2024-06-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (96%) | 334 |
| CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models Deyi Xiong, Ling Shi Published: 2024-06-07Area: Safety EvaluationCitations: 2 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (99%) | 2 |
| AI Sandbagging: Language Models can Strategically Underperform on Evaluations Felix Hofst脙陇tter, Francis Rhys Ward, Oliver Jaffe, Samuel F. Brown Published: 2024-06-11Area: Deception & FailureCitations: 70 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2024-06-11 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | 70 |
| Are we making progress in unlearning? Findings from the first NeurIPS unlearning competition Eleni Triantafillou, Fabian Pedregosa, Gintare Karolina Dziugaite, Ioannis Mitliagkas Published: 2024-06-13Area: Alignment TrainingCitations: 44 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2024-06-13 | Alignment Training | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (94%) | 44 |
| JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models Anyu Wang, Delong Ran, Jingyi Zheng, Jinyuan Liu Published: 2024-06-13Area: Safety EvaluationCitations: 27 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2024-06-13 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R3 (94%) | 27 |
| Towards Effective Evaluations and Comparisons for LLM Unlearning Methods Bo Han, Jianing Zhu, Masashi Sugiyama, Puning Yang Published: 2024-06-13Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2024-06-13 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 24 |
| garak: A Framework for Security Probing Large Language Models Erick Galinkin, Jeffrey Martin, Leon Derczynski, Nanna Inie Published: 2024-06-16Area: Safety EvaluationCitations: 38 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2024-06-16 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R4 (96%) | 38 |
| A Survey on Human Preference Learning for Large Language Models Juntao Li, Kehai Chen, Liqiang Nie, Min Zhang Published: 2024-06-17Area: Surveys & ReviewsCitations: 16 Tags: ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | 2024-06-17 | Surveys & Reviews | ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | E5 / R3 (95%) | 16 |
| Intrinsic Evaluation of Unlearning Using Parametric Knowledge Traces Haiqin Yang, Lei Yu, Mor Geva, Shauli Ravfogel Published: 2024-06-17Area: Model EditingCitations: 20 Tags: adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | 2024-06-17 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (94%) | 20 |
| STAR: SocioTechnical Approach to Red Teaming Language Models Bernat Guill茅n Pegueroles, Canfer Akbulut, John Mellor, Kristian Lum Published: 2024-06-17Area: Safety EvaluationCitations: 16 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2024-06-17 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 16 |
| BeHonest: Benchmarking Honesty in Large Language Models Binjie Wang, Ethan Chern, Jiahe Jin, Pengfei Liu Published: 2024-06-19Area: Safety EvaluationCitations: 12 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 12 |
| Generative AI Misuse: A Taxonomy of Tactics and Insights from Real-World Data Beth Goldberg, Iason Gabriel, Nahema Marchal, Rachel Xu Published: 2024-06-19Area: Safety EvaluationCitations: 37 Tags: ai-safety, safety-evaluation, survey | 2024-06-19 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (96%) | 37 |
| Raising the Bar: Investigating the Values of Large Language Models via Generative Evolving Testing Han Jiang, Shu Wang, XiaoYuan Yi, Xing Xie Published: 2024-06-20Area: Safety EvaluationCitations: 16 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2024-06-20 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (95%) | 16 |
| SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal Behaviors Bo Li, Boyi Wei, Dacheng Li, Danqi Chen Published: 2024-06-20Area: Safety EvaluationCitations: 151 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (97%) | 151 |
| Deciphering the Definition of Adversarial Robustness for post-hoc OOD Detectors Jens M眉ller, Mario Fernandez, Peter Lorenz, Ullrich K枚the Published: 2024-06-21Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-06-21 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 1 |
| From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking Siyuan Wang, Zhihao Fan, Zhongyu Wei, Zhuohan Long Published: 2024-06-21Area: Surveys & ReviewsCitations: 22 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2024-06-21 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E7 / R4 (95%) | 22 |
| MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries? Cho-Jui Hsieh, Hengguang Zhou, Minhao Cheng, Ruochen Wang Published: 2024-06-22Area: Safety EvaluationCitations: 23 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-22 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 23 |
| Evaluating Copyright Takedown Methods for Language Models Boyi Wei, Chiyuan Zhang, Kai Li, Luke Zettlemoyer Published: 2024-06-26Area: Model EditingCitations: 42 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-06-26 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (95%) | 42 |
| The Art of Saying No: Contextual Noncompliance in Language Models Abhilasha Ravichander, Faeze Brahman, Hannaneh Hajishirzi, Jack Hessel Published: 2024-07-02Area: Safety EvaluationCitations: 67 Tags: ai-safety, benchmark, safety-evaluation | 2024-07-02 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (94%) | 67 |