Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| LLM Critics Help Catch LLM Bugs Evgenia Nitishinskaya, Jan Leike, Juan Felipe Ceron Uribe, Maja Trebacz Published: 2024-06-28Area: Scalable OversightCitations: 131 Tags: ai-safety, empirical, scalable-oversight | 2024-06-28 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 131 |
| ProgressGym: Alignment with a Millennium of Moral Progress Jasmine Xinze Li, Jiaming Ji, Tianyi Qiu, Xuchuan Huang Published: 2024-06-28Area: Alignment TrainingCitations: 9 Tags: ai-safety, alignment-training, benchmark | 2024-06-28 | Alignment Training | ai-safety, alignment-training, benchmark | E7 / R5 (98%) | 9 |
| Virtual Context: Enhancing Jailbreak Attacks with Special Token Injection Hanchi Sun, Lichao Sun, Lin Lu, Pan Zhou Published: 2024-06-28Area: Adversarial RobustnessCitations: 23 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-28 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 23 |
| Towards shutdownable agents via stochastic choice Alexander Roman, Christos Ziakas, Elliott Thornley, Leyton Ho Published: 2024-06-30Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, empirical | 2024-06-30 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Badllama 3: removing safety finetuning from Llama 3 in minutes Dmitrii Volkov Published: 2024-07-01Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 6 |
| Enhancing the Capability and Robustness of Large Language Models through Reinforcement Learning-Driven Query Refinement Cenyuan Zhang, Feiran Zhang, Xiaohua Wang, Xiaoqing Zheng Published: 2024-07-01Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 6 |
| Large Language Models Are Involuntary Truth-Tellers: Exploiting Fallacy Failure for Jailbreak Attacks Barbara Di Eugenio, Henry Peng Zou, Yang Zhang, Yue Zhou Published: 2024-07-01Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 13 |
| Purple-teaming LLMs with Adversarial Defender Training Helen Meng, Jiawen Kang, Jingyan Zhou, Junan Li Published: 2024-07-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models Md Montasir Bin Shams, Shaeke Salman, Xiuwen Liu Published: 2024-07-01Area: Multimodal SafetyCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-07-01 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (94%) | 2 |
| A False Sense of Safety: Unsafe Information Leakage in 'Safe' AI Responses David Glukhov, Ilia Shumailov, Nicolas Papernot, Vardan Papyan Published: 2024-07-02Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, theoretical | 2024-07-02 | Adversarial Robustness | adversarial-robustness, ai-safety, theoretical | E5 / R3 (94%) | 11 |
| A Practical Review of Mechanistic Interpretability for Transformer-Based Language Models Abulhair Saparov, Daking Rai, Shi Feng, Yilun Zhou Published: 2024-07-02Area: Surveys & ReviewsCitations: 91 Tags: ai-safety, interpretability, survey, surveys-reviews | 2024-07-02 | Surveys & Reviews | ai-safety, interpretability, survey, surveys-reviews | E5 / R3 (95%) | 91 |
| SeqAR: Jailbreak LLMs with Sequential Auto-Generated Characters Guanhua Chen, Hailiang Huang, Hongru Wang, Xin Lu Published: 2024-07-02Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (97%) | 6 |
| The Art of Saying No: Contextual Noncompliance in Language Models Abhilasha Ravichander, Faeze Brahman, Hannaneh Hajishirzi, Jack Hessel Published: 2024-07-02Area: Safety EvaluationCitations: 67 Tags: ai-safety, benchmark, safety-evaluation | 2024-07-02 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (94%) | 67 |
| To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Models Bozhong Tian, Dianbo Sui, Huajun Chen, Mengru Wang Published: 2024-07-02Area: Model EditingCitations: 23 Tags: ai-safety, benchmark, model-editing | 2024-07-02 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (95%) | 23 |
| Towards More Realistic Extraction Attacks: An Adversarial Perspective Golnoosh Farnadi, Prakhar Ganesh, Yash More Published: 2024-07-02Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 9 |
| From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks Chujie Zheng, Hongning Wang, Junxiao Yang, Minlie Huang Published: 2024-07-03Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 14 |
| JailbreakHunter: A Visual Analytics Approach for Jailbreak Prompts Discovery From Large-Scale Human-LLM Conversational Datasets Haotian Li, Huamin Qu, Shiyi Liu, Xun Zhao Published: 2024-07-03Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, tool | 2024-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (95%) | 6 |
| Truth is Universal: Robust Detection of Lies in LLMs Boaz Nadler, Fred A. Hamprecht, Lennart B眉rger Published: 2024-07-03Area: Representation AnalysisCitations: 59 Tags: ai-safety, empirical, representation-analysis | 2024-07-03 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (97%) | 59 |
| Automated Progressive Red Teaming Bojian Jiang, Deyi Xiong, Qing Yang, Tianhao Shen Published: 2024-07-04Area: Safety EvaluationCitations: 11 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-07-04 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E8 / R5 (96%) | 11 |
| Functional Faithfulness in the Wild: Circuit Discovery with Differentiable Computation Graph Pruning Gerald Penn, Jingcheng Niu, Lei Yu, Zining Zhu Published: 2024-07-04Area: Mechanistic Interp.Citations: 8 Tags: ai-safety, empirical, mechanistic-interp | 2024-07-04 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (95%) | 8 |
| Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs Arjun Panickssery, Asa Cooper Stickland, Sam Bowman, Sara Price Published: 2024-07-04Area: Deception & FailureCitations: 12 Tags: ai-safety, deception-failure, empirical | 2024-07-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 12 |
| Jailbreak Attacks and Defenses Against Large Language Models: A Survey Jiaxing Song, Ke Xu, Qi Li, Sibo Yi Published: 2024-07-05Area: Surveys & ReviewsCitations: 220 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-07-05 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E8 / R4 (98%) | 220 |
| Me, Myself, and AI: The Situational Awareness Dataset (SAD) for LLMs Alexander Meinke, Bilal Chughtai, Jan Betley, J茅r茅my Scheurer Published: 2024-07-05Area: Safety EvaluationCitations: 46 Tags: ai-safety, benchmark, safety-evaluation | 2024-07-05 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 46 |
| Missed Causes and Ambiguous Effects: Counterfactuals Pose Challenges for Interpreting Neural Networks Aaron Mueller Published: 2024-07-05Area: Mechanistic Interp.Citations: 18 Tags: ai-safety, interpretability, mechanistic-interp, theoretical | 2024-07-05 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, theoretical | E5 / R3 (92%) | 18 |
| On Scalable Oversight with Weak LLMs Judging Strong LLMs David Lindner, Jannis Bulian, J谩nos Kram谩r, Jonah Brown-Cohen Published: 2024-07-05Area: Scalable OversightCitations: 66 Tags: ai-safety, empirical, scalable-oversight | 2024-07-05 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R3 (95%) | 66 |
| Spontaneous Reward Hacking in Iterative Self-Refinement He He, Jane Pan, Samuel R. Bowman, Shi Feng Published: 2024-07-05Area: Deception & FailureCitations: 18 Tags: ai-safety, deception-failure, empirical | 2024-07-05 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 18 |
| AI Safety in Generative AI Large Language Models: A Survey Chen Wang, Jaymari Chua, Lina Yao, Shiyi Yang Published: 2024-07-06Area: Surveys & ReviewsCitations: 38 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2024-07-06 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E6 / R3 (95%) | 38 |
| MUSE: Machine Unlearning Six-Way Evaluation for Language Models Ari Holtzman, Chiyuan Zhang, Daogao Liu, Jaechan Lee Published: 2024-07-08Area: Model EditingCitations: 174 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-07-08 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (97%) | 174 |
| T2VSafetyBench: Evaluating the Safety of Text-to-Video Generative Models Jun Zhu, Lijia Yu, Xiao-Shan Gao, Yibo Miao Published: 2024-07-08Area: Multimodal SafetyCitations: 45 Tags: ai-safety, benchmark, multimodal-safety | 2024-07-08 | Multimodal Safety | ai-safety, benchmark, multimodal-safety | E7 / R3 (98%) | 45 |
| Composable Interventions for Language Models Anurag Vaidya, Arinbj枚rn Kolbeinsson, Faisal Mahmood, Jonathan Richard Schwarz Published: 2024-07-09Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-07-09 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (94%) | 5 |