Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal Behaviors Bo Li, Boyi Wei, Dacheng Li, Danqi Chen Published: 2024-06-20Area: Safety EvaluationCitations: 151 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-20 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (97%) | 151 |
| Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons Jianhui Chen, Juanzi Li, Lei Hou, Xiaozhi Wang Published: 2024-06-20Area: Mechanistic Interp.Citations: 25 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2024-06-20 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R3 (94%) | 25 |
| Deciphering the Definition of Adversarial Robustness for post-hoc OOD Detectors Jens M眉ller, Mario Fernandez, Peter Lorenz, Ullrich K枚the Published: 2024-06-21Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-06-21 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 1 |
| From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking Siyuan Wang, Zhihao Fan, Zhongyu Wei, Zhuohan Long Published: 2024-06-21Area: Surveys & ReviewsCitations: 22 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2024-06-21 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E7 / R4 (95%) | 22 |
| Logicbreaks: A Framework for Understanding Subversion of Rule-based Inference Anton Xue, Avishree Khare, Eric Wong, Rajeev Alur Published: 2024-06-21Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, theoretical | 2024-06-21 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (96%) | 4 |
| Robust Reinforcement Learning from Corrupted Human Feedback Alexander Bukharin, Haoming Jiang, Ilgee Hong, Qingru Zhang Published: 2024-06-21Area: Alignment TrainingCitations: 18 Tags: ai-safety, alignment-training, empirical | 2024-06-21 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 18 |
| Steering Without Side Effects: Improving Post-Deployment Control of Language Models Alexander Lyzhov, Asa Cooper Stickland, Jacob Pfau, Salsabila Mahdi Published: 2024-06-21Area: Model EditingCitations: 41 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2024-06-21 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (96%) | 41 |
| MOSSBench: Is Your Multimodal Language Model Oversensitive to Safe Queries? Cho-Jui Hsieh, Hengguang Zhou, Minhao Cheng, Ruochen Wang Published: 2024-06-22Area: Safety EvaluationCitations: 23 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-22 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 23 |
| Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs Jannik Kossen, Jiatong Han, Lisa Schut, Muhammed Razzak Published: 2024-06-22Area: Representation AnalysisCitations: 138 Tags: ai-safety, empirical, representation-analysis | 2024-06-22 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 138 |
| Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models Jun Zhao, Kang Liu, Pengfei Cao, Tianyi Men Published: 2024-06-23Area: Mechanistic Interp.Citations: 19 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-06-23 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | 19 |
| BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models Bo Li, Dawn Song, Ruoxi Jia, Tran Ngoc Huynh Published: 2024-06-24Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 49 |
| Confidence Regulation Neurons in Language Models Alessandro Stolfo, Ben Wu, Mrinmaya Sachan, Neel Nanda Published: 2024-06-24Area: Mechanistic Interp.Citations: 45 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (94%) | 45 |
| Finding Transformer Circuits with Edge Pruning Adithya Bhaskar, Alexander Wettig, Dan Friedman, Danqi Chen Published: 2024-06-24Area: Mechanistic Interp.Citations: 40 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (97%) | 40 |
| How Data Inter-connectivity Shapes LLMs Unlearning: A Structural Unlearning Perspective Meghdad Kurmanji, Nicholas D. Lane, Nicola Cancedda, Pontus Stenetorp Published: 2024-06-24Area: Model EditingCitations: 1 Tags: ai-safety, benchmark, model-editing | 2024-06-24 | Model Editing | ai-safety, benchmark, model-editing | E6 / R4 (96%) | 1 |
| AI Risk Categorization Decoded (AIR 2024): From Government Regulations to Corporate Policies Andy Zhou, Bo Li, Dawn Song, Kevin Klyman Published: 2024-06-25Area: Surveys & ReviewsCitations: 48 Tags: ai-safety, survey, surveys-reviews | 2024-06-25 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E8 / R4 (99%) | 48 |
| Interpreting Attention Layer Outputs with Sparse Autoencoders Arthur Conmy, Connor Kissane, Joseph Isaac Bloom, Neel Nanda Published: 2024-06-25Area: Mechanistic Interp.Citations: 40 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-25 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 40 |
| Understanding Language Model Circuits through Knowledge Editing Frank Rudzicz, Huaizhi Ge, Zining Zhu Published: 2024-06-25Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-25 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 2 |
| A Closer Look into Mixture-of-Experts in Large Language Models Jie Fu, Ka Man Lo, Zeyu Huang, Zihan Qiu Published: 2024-06-26Area: Mechanistic Interp.Citations: 28 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-26 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 28 |
| AI Alignment through Reinforcement Learning from Human Feedback? Contradictions and Limitations Adam Dahlgren Lindstr枚m, Dimitri Coelho Mollo, 脥帽igo Mart铆nez de Rituerto de Troya, Lea Krause Published: 2024-06-26Area: Alignment TrainingCitations: 8 Tags: ai-safety, alignment-training, position | 2024-06-26 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (95%) | 8 |
| Enhancing Data Privacy in Large Language Models through Private Association Editing Andrea Favalli, Cristina Giannone, Davide Venditti, Elena Sofia Ruzzetti Published: 2024-06-26Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2024-06-26 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 7 |
| Evaluating Copyright Takedown Methods for Language Models Boyi Wei, Chiyuan Zhang, Kai Li, Luke Zettlemoyer Published: 2024-06-26Area: Model EditingCitations: 42 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-06-26 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (95%) | 42 |
| JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models Chonghan Chen, Haibo Jin, Haohan Wang, Jun Zhuang Published: 2024-06-26Area: Adversarial RobustnessCitations: 61 Tags: adversarial-robustness, ai-safety, survey | 2024-06-26 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (97%) | 61 |
| The Multilingual Alignment Prism: Aligning Global and Local Preferences to Reduce Harm Aakanksha, Arash Ahmadian, Beyza Ermis, Julia Kreutzer Published: 2024-06-26Area: Alignment TrainingCitations: 55 Tags: ai-safety, alignment-training, empirical | 2024-06-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 55 |
| WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Allyson Ettinger, Bill Yuchen Lin, Kavel Rao, Liwei Jiang Published: 2024-06-26Area: Adversarial RobustnessCitations: 261 Tags: adversarial-robustness, ai-safety, tool | 2024-06-26 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E6 / R4 (96%) | 261 |
| Fundamental Problems With Model Editing: How Should Rational Belief Revision Work in LLMs? Elias Stengel-Eskin, Mohit Bansal, Peter Hase, Thomas Hofweber Published: 2024-06-27Area: Model EditingCitations: 24 Tags: ai-safety, model-editing, theoretical | 2024-06-27 | Model Editing | ai-safety, model-editing, theoretical | E5 / R3 (96%) | 24 |
| Monitoring Latent World States in Language Models with Propositional Probes Jacob Steinhardt, Jiahai Feng, Stuart Russell Published: 2024-06-27Area: Representation AnalysisCitations: 23 Tags: ai-safety, empirical, representation-analysis | 2024-06-27 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R2 (94%) | 23 |
| Rethinking harmless refusals when fine-tuning foundation models Diogo Schwerz de Lucena, Florin Pop, Judd Rosenblatt, Michael Vaiana Published: 2024-06-27Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2024-06-27 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 1 |
| The Remarkable Robustness of LLMs: Stages of Inference? Max Tegmark, Vedang Lad, Wes Gurnee Published: 2024-06-27Area: Mechanistic Interp.Citations: 98 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-27 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E7 / R4 (94%) | 98 |
| UnUnlearning: Unlearning is not sufficient for content regulation in advanced generative AI Eleni Triantafillou, Eugene Bagdasaryan, Guillermo Ortiz-Jimenez, Heidi Howard Published: 2024-06-27Area: Model EditingCitations: 50 Tags: ai-safety, model-editing, position | 2024-06-27 | Model Editing | ai-safety, model-editing, position | E5 / R3 (95%) | 50 |
| Covert Malicious Finetuning: Challenges in Safeguarding LLM Adaptation Alexander Wei, Danny Halawi, Eric Wallace, Jacob Steinhardt Published: 2024-06-28Area: Adversarial RobustnessCitations: 68 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 68 |