Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| LLMs Know More Than They Show: On the Intrinsic Representation of LLM Hallucinations Hadas Kotek, Hadas Orgad, Idan Szpektor, Michael Toker Published: 2024-10-03Area: Representation AnalysisCitations: 134 Tags: ai-safety, empirical, representation-analysis | 2024-10-03 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (94%) | 134 |
| Meta-Models: An Architecture for Decoding LLM Behaviors Through Interpreted Embeddings and Natural Language Anthony Costarelli, Mat Allen, Severin Field Published: 2024-10-03Area: Mechanistic Interp.Citations: 5 Tags: ai-safety, empirical, mechanistic-interp | 2024-10-03 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 5 |
| Mitigating Memorization In Language Models Arham Khan, Aswathy Ajith, Caleb Geniesse, Ian Foster Published: 2024-10-03Area: Model EditingCitations: 10 Tags: ai-safety, empirical, model-editing | 2024-10-03 | Model Editing | ai-safety, empirical, model-editing | E4 / R3 (96%) | 10 |
| Safeguard is a Double-edged Sword: Denial-of-service Attack on Large Language Models Qingzhao Zhang, Ziyang Xiong, Z. Morley Mao Published: 2024-10-03Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| SteerDiff: Steering towards Safe Text-to-Image Diffusion Models Hao Chen, Hongxiang Zhang, Yifeng He Published: 2024-10-03Area: Multimodal SafetyCitations: 7 Tags: ai-safety, empirical, multimodal-safety | 2024-10-03 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (94%) | 7 |
| A Probabilistic Perspective on Unlearning and Alignment for Large Language Models Leo Schwinn, Stephan G眉nnemann, Yan Scholten Published: 2024-10-04Area: Model EditingCitations: 18 Tags: ai-safety, alignment-training, empirical, model-editing, safety-evaluation | 2024-10-04 | Model Editing | ai-safety, alignment-training, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 18 |
| Chain-of-Jailbreak Attack for Image Generation Models via Editing Step by Step Jen-tse Huang, Kuiyi Gao, Qiuzhi Liu, Shuai Wang Published: 2024-10-04Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 8 |
| Gradient-based Jailbreak Images for Multimodal Fusion Models Erik Brinkman, Florian Tram猫r, Hannah Korevaar, Ivan Evtimov Published: 2024-10-04Area: Adversarial RobustnessCitations: 7 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 7 |
| Permissive Information-Flow Analysis for Large Language Models Ahmed Salem, Andrew Paverd, Boris K枚pf, David Krueger Published: 2024-10-04Area: Agent SafetyCitations: 9 Tags: agent-safety, ai-safety, empirical | 2024-10-04 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (94%) | 9 |
| ShieldDiff: Suppressing Sexual Content Generation from Diffusion Models through Reinforcement Learning Dong Han, Salaheldin Mohamed, Yong Li Published: 2024-10-04Area: Adversarial RobustnessCitations: 4 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (96%) | 4 |
| Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation Barbara Plank, Chengzhi Hu, Paul R枚ttger, Xinpeng Wang Published: 2024-10-04Area: Model EditingCitations: 26 Tags: ai-safety, empirical, model-editing | 2024-10-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 26 |
| You Know What I'm Saying: Jailbreak Attack via Implicit Reference Lingrui Mei, Lujun Li, Ruibin Yuan, Tianyu Wu Published: 2024-10-04Area: Adversarial RobustnessCitations: 14 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 14 |
| ASPIRER: Bypassing System Prompts With Permutation-based Backdoors in LLMs Guangyu Shen, Kaiyuan Zhang, Lu Yan, Siyuan Cheng Published: 2024-10-05Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (95%) | 1 |
| Harnessing Task Overload for Scalable Jailbreak Attacks on Large Language Models Dongcheng Zhao, Guobin Shen, Xiang He, Yiting Dong Published: 2024-10-05Area: Adversarial RobustnessCitations: 5 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (95%) | 5 |
| Neuron-Level Sequential Editing for Large Language Models An Zhang, Houcheng Jiang, Junfeng Fang, Ruipeng Wang Published: 2024-10-05Area: Model EditingCitations: 13 Tags: ai-safety, empirical, model-editing | 2024-10-05 | Model Editing | ai-safety, empirical, model-editing | E7 / R3 (95%) | 13 |
| Attention Shift: Steering AI Away from Unsafe Content Manyana Tiwari, Shivank Garg Published: 2024-10-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2024-10-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| Gradient Routing: Masking Gradients to Localize Computation in Neural Networks Alexander Matt Turner, Alex Cloud, Evzen Wybitul, Jacob Goldman-Wetzler Published: 2024-10-06Area: Mechanistic Interp.Citations: 18 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2024-10-06 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (95%) | 18 |
| Activation Scaling for Steering and Interpreting Language Models Aaron Schein, Kevin Du, Niklas Stoehr, Robert West Published: 2024-10-07Area: Model EditingCitations: 21 Tags: ai-safety, empirical, model-editing | 2024-10-07 | Model Editing | ai-safety, empirical, model-editing | E5 / R2 (94%) | 21 |
| AnyAttack: Towards Large-scale Self-supervised Generation of Targeted Adversarial Examples for Vision-Language Models Dit-Yan Yeung, Jiaming Zhang, Jitao Sang, Junhong Ye Published: 2024-10-07Area: Multimodal SafetyCitations: 17 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-10-07 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E7 / R3 (96%) | 17 |
| SecAlign: Defending Against Prompt Injection with Preference Optimization Arman Zharmagambetov, Chuan Guo, Kamalika Chaudhuri, Saeed Mahloujifar Published: 2024-10-07Area: Adversarial RobustnessCitations: 79 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-07 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | 79 |
| SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks Fenia Christopoulou, Gerasimos Lampouras, Haitham Bou-Ammar, Jun Wang Published: 2024-10-07Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2024-10-07 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 6 |
| Superficial Safety Alignment Hypothesis Jianwei Li, Jung-Eun Kim Published: 2024-10-07Area: Alignment TrainingCitations: 6 Tags: ai-safety, alignment-training, empirical | 2024-10-07 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (93%) | 6 |
| Towards Measuring Goal-Directedness in AI Systems Dylan Xu, Juan-Pablo Rivera Published: 2024-10-07Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2024-10-07 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (91%) | 5 |
| Locate-then-edit for Multi-hop Factual Recall under Knowledge Editing Di Wang, Keyuan Cheng, Lijie Hu, Yongxiang Li Published: 2024-10-08Area: Model EditingCitations: 30 Tags: ai-safety, empirical, model-editing | 2024-10-08 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (95%) | 30 |
| Non-Halting Queries: Exploiting Fixed Points in LLMs Berk Sunar, Ghaith Hammouri, Kemal Derya Published: 2024-10-08Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-08 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Dissecting Fine-Tuning Unlearning in Large Language Models Di Wang, Haiqin Yang, Lijie Hu, Yihuai Hong Published: 2024-10-09Area: Model EditingCitations: 17 Tags: ai-safety, empirical, model-editing | 2024-10-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 17 |
| ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time Bolian Li, Ruqi Zhang, Yi Ding Published: 2024-10-09Area: Multimodal SafetyCitations: 44 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-10-09 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (95%) | 44 |
| Instructional Segment Embedding: Improving LLM Safety with Instruction Hierarchy Chong Xiang, Kaiqiang Song, Prateek Mittal, Ravi Agrawal Published: 2024-10-09Area: Adversarial RobustnessCitations: 37 Tags: adversarial-robustness, ai-safety, empirical | 2024-10-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 37 |
| SAGE: Scalable Ground Truth Evaluations for Large Sparse Autoencoders Anisoara Calinescu, Christian Schroeder de Witt, Constantin Venhoff, Philip Torr Published: 2024-10-09Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2024-10-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E6 / R3 (96%) | 1 |
| SEAL: Safety-enhanced Aligned LLM Fine-tuning via Bilevel Data Selection Han Shen, Payel Das, Pin-Yu Chen, Tianyi Chen Published: 2024-10-09Area: Alignment TrainingCitations: 55 Tags: ai-safety, alignment-training, empirical | 2024-10-09 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 55 |