Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Decoupled Alignment for Robust Plug-and-Play Adaptation Han Liu, Haozheng Luo, Jerry Yao-Chieh Hu, Jiahao Yu Published: 2024-06-03Area: Model EditingCitations: 12 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-03 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E4 / R3 (96%) | 12 |
| BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling Cristina G芒rbacea, Lin Gui, Victor Veitch Published: 2024-06-02Area: Alignment TrainingCitations: 102 Tags: ai-safety, alignment-training, empirical | 2024-06-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 102 |
| Efficient Model-agnostic Alignment via Bayesian Persuasion Boyuan Chen, Fengshuo Bai, Mingzhi Wang, Yaodong Yang Published: 2024-05-29Area: Scalable OversightCitations: 10 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-05-29 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E8 / R4 (93%) | 10 |
| One-Shot Safety Alignment for Large Language Models via Optimal Dualization Dongsheng Ding, Edgar Dobriban, Hamed Hassani, Osbert Bastani Published: 2024-05-29Area: Alignment TrainingCitations: 18 Tags: ai-safety, alignment-training, theoretical | 2024-05-29 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 18 |
| A Theoretical Understanding of Self-Correction through In-context Alignment Stefanie Jegelka, Yifei Wang, Yisen Wang, Yuyang Wu Published: 2024-05-28Area: Alignment TrainingCitations: 56 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2024-05-28 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E6 / R4 (93%) | 56 |
| Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack Fatih Ilhan, Ling Liu, Selim Furkan Tekin, Sihao Hu Published: 2024-05-28Area: Adversarial RobustnessCitations: 67 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 67 |
| Cross-Modal Safety Alignment: Is textual unlearning all you need? Amit K. Roy-Chowdhury, Chengyu Song, Erfan Shayegani, M. Salman Asif Published: 2024-05-27Area: Multimodal SafetyCitations: 25 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-05-27 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 25 |
| Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language Models Duen Horng Chau, Matthew Hull, Pin-Yu Chen, ShengYun Peng Published: 2024-05-27Area: Safety EvaluationCitations: 51 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2024-05-27 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (94%) | 51 |
| Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models Chia-Mu Yu, Chia-Yi Hsu, Chih-Hsun Lin, Chun-Ying Huang Published: 2024-05-27Area: Alignment TrainingCitations: 105 Tags: ai-safety, alignment-training, empirical | 2024-05-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 105 |
| Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer Boyi Liu, Hongyi Guo, Jose Blanchet, Miao Lu Published: 2024-05-26Area: Alignment TrainingCitations: 90 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2024-05-26 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (97%) | 90 |
| ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation An Zhang, Han Wang, Jingnan Zheng, Jun Sun Published: 2024-05-23Area: Safety EvaluationCitations: 48 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2024-05-23 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R4 (95%) | 48 |
| SimPO: Simple Preference Optimization with a Reference-Free Reward Danqi Chen, Mengzhou Xia, Yu Meng Published: 2024-05-23Area: Alignment TrainingCitations: 850 Tags: ai-safety, alignment-training, empirical | 2024-05-23 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | 850 |
| ConTrans: Weak-to-Strong Alignment Engineering via Concept Transplantation Deyi Xiong, Renren Jin, Shaoyang Xu, Weilong Dong Published: 2024-05-22Area: Model EditingCitations: 11 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-22 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (96%) | 11 |
| LIRE: Listwise Reward Enhancement for Preference Alignment Junbo Guo, Lei Zhang, Mingye Zhu, Yi Liu Published: 2024-05-22Area: Alignment TrainingCitations: 8 Tags: ai-safety, alignment-training, empirical | 2024-05-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 8 |
| Safety Alignment for Vision Language Models Bo Zheng, Chongjun Wang, Qiushi Cui, Xiangyu Yue Published: 2024-05-22Area: Multimodal SafetyCitations: 20 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-05-22 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E6 / R3 (96%) | 20 |
| Hummer: Towards Limited Competitive Preference Dataset Jingqing Ruan, Junwu Xiong, Jun Zhou, Li Jiang Published: 2024-05-19Area: Alignment TrainingCitations: 10 Tags: adversarial-robustness, ai-safety, alignment-training, dataset | 2024-05-19 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, dataset | E6 / R3 (96%) | 10 |
| A Safety Realignment Framework via Subspace-Oriented Model Fusion for Large Language Models Liang He, Linlin Wang, Shunfan Zheng, Xiaoling Wang Published: 2024-05-15Area: Model EditingCitations: 43 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 43 |
| Spectral Editing of Activations for Large Language Model Alignment Anna Korhonen, Edoardo M. Ponti, Shay B. Cohen, Yftah Ziser Published: 2024-05-15Area: Model EditingCitations: 43 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 43 |
| Understanding the Performance Gap Between Online and Offline Alignment Algorithms Bernardo 脕vila Pires, Daniele Calandriello, Daniel Guo, Eugene Tarassov Published: 2024-05-14Area: Alignment TrainingCitations: 99 Tags: ai-safety, alignment-training, empirical | 2024-05-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 99 |
| Poser: Unmasking Alignment Faking LLMs by Manipulating Their Internals Caden Juang, Joshua Clymer, Severin Field Published: 2024-05-08Area: Deception & FailureCitations: 7 Tags: ai-safety, alignment-training, benchmark, deception-failure | 2024-05-08 | Deception & Failure | ai-safety, alignment-training, benchmark, deception-failure | E4 / R3 (96%) | 7 |
| A Causal Explainable Guardrails for Large Language Models Kui Ren, Longfei Li, Yan Wang, Zhan Qin Published: 2024-05-07Area: Adversarial RobustnessCitations: 17 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-05-07 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E4 / R3 (94%) | 17 |
| Countering Reward Over-optimization in LLM with Demonstration-Guided Reinforcement Learning Emmanuel Dupoux, Florian Strub, Mathieu Rita, Olivier Pietquin Published: 2024-04-30Area: Alignment TrainingCitations: 15 Tags: ai-safety, alignment-training, empirical | 2024-04-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 15 |
| More RLHF, More Trust? On The Impact of Preference Alignment On Trustworthiness Aaron J. Li, Himabindu Lakkaraju, Satyapriya Krishna Published: 2024-04-29Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical | 2024-04-29 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (96%) | 10 |
| Weak-to-Strong Extrapolation Expedites Alignment Chujie Zheng, Heng Ji, Minlie Huang, Nanyun Peng Published: 2024-04-25Area: Alignment TrainingCitations: 34 Tags: ai-safety, alignment-training, empirical | 2024-04-25 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 34 |
| Stepwise Alignment for Constrained Language Model Policy Optimization Akifumi Wachi, Rei Sato, Takumi Tanabe, Thien Q Tran Published: 2024-04-17Area: Alignment TrainingCitations: 17 Tags: ai-safety, alignment-training, empirical | 2024-04-17 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 17 |
| Social Choice Should Guide AI Alignment in Dealing with Diverse Human Feedback Bob M. Jacobs, Emanuel Tewolde, Eric Pacuit, Hailey Schoelkopf Published: 2024-04-16Area: Alignment TrainingCitations: 69 Tags: ai-safety, alignment-training, position | 2024-04-16 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (94%) | 69 |
| Foundational Challenges in Assuring Alignment and Safety of Large Language Models Abulhair Saparov, Alan Chan, Aleksandar Petrov, Alexander Pan Published: 2024-04-15Area: Surveys & ReviewsCitations: 211 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2024-04-15 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E6 / R4 (94%) | 211 |
| RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs Ameet Deshpande, Ashwin Kalyan, Bruno Castro da Silva, Karthik Narasimhan Published: 2024-04-12Area: Alignment TrainingCitations: 105 Tags: ai-safety, alignment-training, survey | 2024-04-12 | Alignment Training | ai-safety, alignment-training, survey | E5 / R4 (95%) | 105 |
| Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge Cen Chen, Huiping Zhuang, Jianwei Wang, Weikai Lu Published: 2024-04-08Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-04-08 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 49 |
| Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning Licong Lin, Ruiqi Zhang, Song Mei, Yu Bai Published: 2024-04-08Area: Model EditingCitations: 348 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-04-08 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 348 |