Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Evidence of Learned Look-Ahead in a Chess-Playing Neural Network Cameron Allen, Erik Jenner, Scott Emmons, Shreyas Kapur Published: 2024-06-02Area: Mechanistic Interp.Citations: 25 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-02 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 25 |
| Get My Drift? Catching LLM Task Drift with Activation Deltas Ahmed Salem, Aideen Fay, Andrew Paverd, Giovanni Cherubin Published: 2024-06-02Area: Adversarial RobustnessCitations: 38 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-02 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 38 |
| BELLS: A Framework Towards Future Proof Benchmarks for the Evaluation of LLM Safeguards Alexandre Variengien, Charbel-Rapha毛l Segerie, Diego Dorn, Vincent Corruble Published: 2024-06-03Area: Safety EvaluationCitations: 14 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-03 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (97%) | 14 |
| Decoupled Alignment for Robust Plug-and-Play Adaptation Han Liu, Haozheng Luo, Jerry Yao-Chieh Hu, Jiahao Yu Published: 2024-06-03Area: Model EditingCitations: 12 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-03 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E4 / R3 (96%) | 12 |
| From Feature Visualization to Visual Circuits: Effect of Adversarial Model Manipulation Eugene Belilovsky, Geraldin Nanfack, Michael Eickenberg Published: 2024-06-03Area: Mechanistic Interp.Citations: 1 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-06-03 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E6 / R3 (95%) | 1 |
| Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses Chao Du, Jing Jiang, Min Lin, Qian Liu Published: 2024-06-03Area: Adversarial RobustnessCitations: 72 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 72 |
| Position: An Inner Interpretability Framework for AI Inspired by Lessons from Cognitive Neuroscience David Poeppel, Federico Adolfi, Gemma Roig, Martina G. Vilas Published: 2024-06-03Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, interpretability, mechanistic-interp, position | 2024-06-03 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E5 / R3 (94%) | 10 |
| Safeguarding Large Language Models: A Survey Changshun Wu, Gaojie Jin, Jie Meng, Jinwei Hu Published: 2024-06-03Area: Surveys & ReviewsCitations: 82 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-06-03 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R4 (97%) | 82 |
| The Geometry of Categorical and Hierarchical Concepts in Large Language Models Kiho Park, Victor Veitch, Yibo Jiang, Yo Joong Choe Published: 2024-06-03Area: Representation AnalysisCitations: 76 Tags: ai-safety, representation-analysis, theoretical | 2024-06-03 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (95%) | 76 |
| Unelicitable Backdoors in Language Models via Cryptographic Transformer Circuits Andis Draguns, Andrew Gritsevskiy, Charlie Rogers-Smith, Christian Schroeder de Witt Published: 2024-06-03Area: Deception & FailureCitations: 5 Tags: ai-safety, deception-failure, empirical | 2024-06-03 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | 5 |
| AI Agents Under Threat: A Survey of Key Security Challenges and Future Pathways Changzhou Han, Junwu Xiong, Sheng Wen, Wanlun Ma Published: 2024-06-04Area: Agent SafetyCitations: 152 Tags: agent-safety, ai-safety, survey | 2024-06-04 | Agent Safety | agent-safety, ai-safety, survey | E5 / R3 (94%) | 152 |
| Dishonesty in Helpful and Harmless Alignment Anthony G. Cohn, Duanyu Feng, Jiancheng Lv, Jingkun Tang Published: 2024-06-04Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2024-06-04 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (92%) | 4 |
| RKLD: Reverse KL-Divergence-based Knowledge Distillation for Unlearning Personal Information in Large Language Models Bichen Wang, Bing Qin, Yanyan Zhao, Yixin Sun Published: 2024-06-04Area: Model EditingCitations: 19 Tags: ai-safety, empirical, model-editing | 2024-06-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | 19 |
| Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller Difan Zou, Fan Yin, Min Cai, Shichang Zhang Published: 2024-06-04Area: Model EditingCitations: 5 Tags: ai-safety, empirical, model-editing | 2024-06-04 | Model Editing | ai-safety, empirical, model-editing | E4 / R4 (96%) | 5 |
| Towards Universal and Black-Box Query-Response Only Attack on LLMs with QROA Hussein Jawad, Nicolas J-B. Brunel Published: 2024-06-04Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 4 |
| Defending Large Language Models Against Attacks With Residual Stream Activation Analysis Amelia Kawasaki, Andrew Davis, Houssam Abbas Published: 2024-06-05Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 4 |
| Improve Mathematical Reasoning in Language Models by Automated Process Supervision Abhinav Rastogi, Harsh Lara, Jiao Sun, Lei Meng Published: 2024-06-05Area: Scalable OversightCitations: 330 Tags: ai-safety, empirical, scalable-oversight | 2024-06-05 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R3 (97%) | 330 |
| Is Free Self-Alignment Possible? Changho Shin, Dyah Adila, Frederic Sala, Yijing Zhang Published: 2024-06-05Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2024-06-05 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R4 (95%) | 3 |
| AutoJailbreak: Exploring Jailbreak Attacks and Defenses through a Dependency Lens Hai Yan, Jiawen Shi, Lin Lu, Pan Zhou Published: 2024-06-06Area: Adversarial RobustnessCitations: 13 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 13 |
| Improving Alignment and Robustness with Circuit Breakers Andy Zou, Dan Hendrycks, Derek Duenas, Justin Wang Published: 2024-06-06Area: Adversarial RobustnessCitations: 230 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 230 |
| Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt Aishan Liu, Dacheng Tao, Siyuan Liang, Tianyuan Zhang Published: 2024-06-06Area: Multimodal SafetyCitations: 83 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-06-06 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (96%) | 83 |
| PaCE: Parsimonious Concept Engineering for Large Language Models Aditya Chattopadhyay, Chris Callison-Burch, Darshan Thaker, Jinqi Luo Published: 2024-06-06Area: Model EditingCitations: 16 Tags: ai-safety, empirical, model-editing | 2024-06-06 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 16 |
| Scaling and Evaluating Sparse Autoencoders Alec Radford, Gabriel Goh, Henk Tillman, Ilya Sutskever Published: 2024-06-06Area: Mechanistic Interp.Citations: 334 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2024-06-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (96%) | 334 |
| The Missing Curve Detectors of InceptionV1: Applying Sparse Autoencoders to InceptionV1 Early Vision Liv Gorton Published: 2024-06-06Area: Mechanistic Interp.Citations: 31 Tags: ai-safety, empirical, mechanistic-interp | 2024-06-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 31 |
| Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs Fan Liu, Hao Liu, Zhao Xu Published: 2024-06-07Area: Adversarial RobustnessCitations: 30 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 30 |
| CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models Deyi Xiong, Ling Shi Published: 2024-06-07Area: Safety EvaluationCitations: 2 Tags: ai-safety, benchmark, safety-evaluation | 2024-06-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (99%) | 2 |
| SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner Daoyuan Wu, Juergen Rahmel, Ning Liu, Pingchuan Ma Published: 2024-06-08Area: Adversarial RobustnessCitations: 39 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (95%) | 39 |
| Information Theoretic Guarantees For Policy Alignment In Large Language Models Youssef Mroueh Published: 2024-06-09Area: Formal/TheoreticalCitations: 19 Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2024-06-09 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E5 / R3 (95%) | 19 |
| Injecting Undetectable Backdoors in Obfuscated Neural Networks and Language Models Alkis Kalavasis, Amin Karbasi, Argyris Oikonomou, Grigoris Velegkas Published: 2024-06-09Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, theoretical | 2024-06-09 | Deception & Failure | ai-safety, deception-failure, theoretical | E5 / R3 (94%) | 2 |
| Machine Against the RAG: Jamming Retrieval-Augmented Generation with Blocker Documents Avital Shafran, Roei Schuster, Vitaly Shmatikov Published: 2024-06-09Area: Adversarial RobustnessCitations: 68 Tags: adversarial-robustness, ai-safety, empirical | 2024-06-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 68 |