Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| FLIRT: Feedback Loop In-context Red Teaming Aram Galstyan, Christophe Dupuy, Kai-Wei Chang, Ninareh Mehrabi Published: 2023-08-08Area: Safety EvaluationCitations: 93 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2023-08-08 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 93 |
| GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher Jen-tse Huang, Pinjia He, Shuming Shi, Wenxiang Jiao Published: 2023-08-12Area: Adversarial RobustnessCitations: 408 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2023-08-12 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 408 |
| EasyEdit: An Easy-to-use Knowledge Editing Framework for Large Language Models Bozhong Tian, Guozhou Zheng, Huajun Chen, Kangwei Liu Published: 2023-08-14Area: Model EditingCitations: 86 Tags: ai-safety, model-editing, safety-evaluation, tool | 2023-08-14 | Model Editing | ai-safety, model-editing, safety-evaluation, tool | E6 / R4 (97%) | 86 |
| Robustness Over Time: Understanding Adversarial Examples' Effectiveness on Longitudinal Versions of Large Language Models Michael Backes, Tianshuo Cong, Yang Zhang, Yugeng Liu Published: 2023-08-15Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (94%) | 11 |
| Separate the Wheat from the Chaff: Model Deficiency Unlearning via Parameter-Efficient Module Operation Baotian Hu, Dongfang Li, Min Zhang, Xinshuo Hu Published: 2023-08-16Area: Model EditingCitations: 40 Tags: ai-safety, empirical, model-editing | 2023-08-16 | Model Editing | ai-safety, empirical, model-editing | E5 / R2 (94%) | 40 |
| Linearity of Relation Decoding in Transformer Language Models Arnab Sen Sharma, David Bau, Evan Hernandez, Jacob Andreas Published: 2023-08-17Area: Representation AnalysisCitations: 146 Tags: ai-safety, empirical, representation-analysis | 2023-08-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (90%) | 146 |
| Precise Model Editing in a Transformer (PMET) Jie Yu, Jing Yang, Jun Ma, Shasha Li Published: 2023-08-17Area: Model EditingCitations: 190 Tags: ai-safety, empirical, model-editing | 2023-08-17 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (94%) | 190 |
| Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment Rishabh Bhardwaj, Soujanya Poria Published: 2023-08-18Area: Safety EvaluationCitations: 229 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2023-08-18 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | 229 |
| Activation Addition: Steering Language Models Without Optimization Alexander Matt Turner, David Udell, Gavin Leech, Lisa Thiergart Published: 2023-08-20Area: Representation AnalysisCitations: 362 Tags: ai-safety, empirical, representation-analysis | 2023-08-20 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 362 |
| Adversarial Illusions in Multi-Modal Embeddings Eugene Bagdasaryan, Rishi Jha, Tingwei Zhang, Vitaly Shmatikov Published: 2023-08-22Area: Multimodal SafetyCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-08-22 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 30 |
| From Instructions to Intrinsic Human Values - A Survey of Alignment Goals for Big Models Jindong Wang, Jing Yao, Xiaoyuan Yi, Xing Xie Published: 2023-08-23Area: Surveys & ReviewsCitations: 62 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2023-08-23 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E5 / R3 (94%) | 62 |
| The Local Learning Coefficient: A Singularity-Aware Complexity Measure Daniel Murfet, Edmund Lau, George Wang, Susan Wei Published: 2023-08-23Area: Training DynamicsCitations: 34 Tags: ai-safety, theoretical, training-dynamics | 2023-08-23 | Training Dynamics | ai-safety, theoretical, training-dynamics | E5 / R3 (96%) | 34 |
| Use of LLMs for Illicit Purposes: Threats, Prevention Measures, and Vulnerabilities Bennett Kleinberg, Lewis D. Griffin, Maximilian Mozes, Xuanli He Published: 2023-08-24Area: Safety EvaluationCitations: 113 Tags: adversarial-robustness, ai-safety, red-teaming, safety-evaluation, survey | 2023-08-24 | Safety Evaluation | adversarial-robustness, ai-safety, red-teaming, safety-evaluation, survey | E5 / R4 (95%) | 113 |
| Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs Haonan Li, Preslav Nakov, Timothy Baldwin, Xudong Han Published: 2023-08-25Area: Safety EvaluationCitations: 158 Tags: ai-safety, dataset, safety-evaluation | 2023-08-25 | Safety Evaluation | ai-safety, dataset, safety-evaluation | E5 / R3 (95%) | 158 |
| Unified Concept Editing in Diffusion Models David Bau, Hadas Orgad, Joanna Materzy艅ska, Rohit Gandikota Published: 2023-08-25Area: Model EditingCitations: 320 Tags: ai-safety, empirical, model-editing | 2023-08-25 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 320 |
| Adversarial Fine-Tuning of Language Models: An Iterative Optimisation Approach for the Generation and Detection of Problematic Content Charles O'Neill, Ioana Ciuc膬, Jack Miller, Thang Bui Published: 2023-08-26Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-26 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 10 |
| Detecting Language Model Attacks with Perplexity Gabriel Alon, Michael Kamfonas Published: 2023-08-27Area: Adversarial RobustnessCitations: 392 Tags: adversarial-robustness, ai-safety, empirical | 2023-08-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 392 |
| Towards Vision-Language Mechanistic Interpretability: A Causal Tracing Tool for BLIP Aryaman Arora, Paul Pu Liang, Rohan Pandey, Vedant Palit Published: 2023-08-27Area: Mechanistic Interp.Citations: 47 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2023-08-27 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | 47 |
| AI deception: A survey of examples, risks, and potential solutions Aidan O'Gara, Dan Hendrycks, Michael Chen, Peter S. Park Published: 2023-08-28Area: Deception & FailureCitations: 265 Tags: ai-safety, deception-failure, survey | 2023-08-28 | Deception & Failure | ai-safety, deception-failure, survey | E6 / R4 (99%) | 265 |
| Identifying and Mitigating the Security Risks of Generative AI Amrita Roy Chowdhury, Ankur Taly, Anupam Datta, Brad Boyd Published: 2023-08-28Area: Surveys & ReviewsCitations: 126 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2023-08-28 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E6 / R4 (95%) | 126 |
| Benchmarks for Detecting Measurement Tampering Buck Shlegeris, Fabien Roger, Max Nadeau, Nate Thomas Published: 2023-08-29Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2023-08-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (98%) | 4 |
| Baseline Defenses for Adversarial Attacks Against Aligned Language Models Aniruddha Saha, Avi Schwarzschild, Gowthami Somepalli, John Kirchenbauer Published: 2023-09-01Area: Adversarial RobustnessCitations: 612 Tags: adversarial-robustness, ai-safety, empirical | 2023-09-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (93%) | 612 |
| Efficient RLHF: Reducing the Memory Usage of PPO Han Yu, Michael Santacroce, Yadong Lu, Yelong Shen Published: 2023-09-01Area: Alignment TrainingCitations: 42 Tags: ai-safety, alignment-training, empirical | 2023-09-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 42 |
| Image Hijacks: Adversarial Images can Control Generative Models at Runtime Euan Ong, Luke Bailey, Scott Emmons, Stuart Russell Published: 2023-09-01Area: Multimodal SafetyCitations: 146 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2023-09-01 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R5 (99%) | 146 |
| RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback Abhinav Rastogi, Colton Bishop, Ethan Hall, Harrison Lee Published: 2023-09-01Area: Alignment TrainingCitations: 538 Tags: ai-safety, alignment-training, empirical | 2023-09-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 538 |
| Taken out of Context: On Measuring Situational Awareness in LLMs Asa Cooper Stickland, Daniel Kokotajlo, Lukas Berglund, Max Kaufmann Published: 2023-09-01Area: Safety EvaluationCitations: 107 Tags: ai-safety, empirical, safety-evaluation | 2023-09-01 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 107 |
| Open Sesame! Universal Black Box Jailbreaking of Large Language Models Moshe Sipper, Raz Lapid, Ron Langberg Published: 2023-09-04Area: Adversarial RobustnessCitations: 155 Tags: adversarial-robustness, ai-safety, empirical | 2023-09-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 155 |
| Explaining Grokking Through Circuit Efficiency J谩nos Kram谩r, Ramana Kumar, Rohin Shah, Vikrant Varma Published: 2023-09-05Area: Training DynamicsCitations: 80 Tags: ai-safety, empirical, training-dynamics | 2023-09-05 | Training Dynamics | ai-safety, empirical, training-dynamics | E6 / R3 (93%) | 80 |
| Provably safe systems: the only path to controllable AGI Max Tegmark, Steve Omohundro Published: 2023-09-05Area: Formal/TheoreticalCitations: 38 Tags: ai-safety, formaltheoretical, interpretability, position | 2023-09-05 | Formal/Theoretical | ai-safety, formaltheoretical, interpretability, position | E7 / R4 (96%) | 38 |
| Certifying LLM Safety against Adversarial Prompting Aaron Jiaxun Li, Aounon Kumar, Chirag Agarwal, Himabindu Lakkaraju Published: 2023-09-06Area: Adversarial RobustnessCitations: 287 Tags: adversarial-robustness, ai-safety, empirical | 2023-09-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R5 (93%) | 287 |