Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Understanding the Performance Gap Between Online and Offline Alignment Algorithms Bernardo 脕vila Pires, Daniele Calandriello, Daniel Guo, Eugene Tarassov Published: 2024-05-14Area: Alignment TrainingCitations: 99 Tags: ai-safety, alignment-training, empirical | 2024-05-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | 99 |
| A Safety Realignment Framework via Subspace-Oriented Model Fusion for Large Language Models Liang He, Linlin Wang, Shunfan Zheng, Xiaoling Wang Published: 2024-05-15Area: Model EditingCitations: 43 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 43 |
| Spectral Editing of Activations for Large Language Model Alignment Anna Korhonen, Edoardo M. Ponti, Shay B. Cohen, Yftah Ziser Published: 2024-05-15Area: Model EditingCitations: 43 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-15 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (96%) | 43 |
| Hummer: Towards Limited Competitive Preference Dataset Jingqing Ruan, Junwu Xiong, Jun Zhou, Li Jiang Published: 2024-05-19Area: Alignment TrainingCitations: 10 Tags: adversarial-robustness, ai-safety, alignment-training, dataset | 2024-05-19 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, dataset | E6 / R3 (96%) | 10 |
| ConTrans: Weak-to-Strong Alignment Engineering via Concept Transplantation Deyi Xiong, Renren Jin, Shaoyang Xu, Weilong Dong Published: 2024-05-22Area: Model EditingCitations: 11 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-05-22 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R4 (96%) | 11 |
| LIRE: Listwise Reward Enhancement for Preference Alignment Junbo Guo, Lei Zhang, Mingye Zhu, Yi Liu Published: 2024-05-22Area: Alignment TrainingCitations: 8 Tags: ai-safety, alignment-training, empirical | 2024-05-22 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 8 |
| Safety Alignment for Vision Language Models Bo Zheng, Chongjun Wang, Qiushi Cui, Xiangyu Yue Published: 2024-05-22Area: Multimodal SafetyCitations: 20 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-05-22 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E6 / R3 (96%) | 20 |
| ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation An Zhang, Han Wang, Jingnan Zheng, Jun Sun Published: 2024-05-23Area: Safety EvaluationCitations: 48 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2024-05-23 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R4 (95%) | 48 |
| SimPO: Simple Preference Optimization with a Reference-Free Reward Danqi Chen, Mengzhou Xia, Yu Meng Published: 2024-05-23Area: Alignment TrainingCitations: 850 Tags: ai-safety, alignment-training, empirical | 2024-05-23 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (94%) | 850 |
| Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer Boyi Liu, Hongyi Guo, Jose Blanchet, Miao Lu Published: 2024-05-26Area: Alignment TrainingCitations: 90 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2024-05-26 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E5 / R4 (97%) | 90 |
| Cross-Modal Safety Alignment: Is textual unlearning all you need? Amit K. Roy-Chowdhury, Chengyu Song, Erfan Shayegani, M. Salman Asif Published: 2024-05-27Area: Multimodal SafetyCitations: 25 Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2024-05-27 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (94%) | 25 |
| Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language Models Duen Horng Chau, Matthew Hull, Pin-Yu Chen, ShengYun Peng Published: 2024-05-27Area: Safety EvaluationCitations: 51 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2024-05-27 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (94%) | 51 |
| Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models Chia-Mu Yu, Chia-Yi Hsu, Chih-Hsun Lin, Chun-Ying Huang Published: 2024-05-27Area: Alignment TrainingCitations: 105 Tags: ai-safety, alignment-training, empirical | 2024-05-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 105 |
| A Theoretical Understanding of Self-Correction through In-context Alignment Stefanie Jegelka, Yifei Wang, Yisen Wang, Yuyang Wu Published: 2024-05-28Area: Alignment TrainingCitations: 56 Tags: adversarial-robustness, ai-safety, alignment-training, theoretical | 2024-05-28 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, theoretical | E6 / R4 (93%) | 56 |
| Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack Fatih Ilhan, Ling Liu, Selim Furkan Tekin, Sihao Hu Published: 2024-05-28Area: Adversarial RobustnessCitations: 67 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-05-28 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 67 |
| Efficient Model-agnostic Alignment via Bayesian Persuasion Boyuan Chen, Fengshuo Bai, Mingzhi Wang, Yaodong Yang Published: 2024-05-29Area: Scalable OversightCitations: 10 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-05-29 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E8 / R4 (93%) | 10 |
| One-Shot Safety Alignment for Large Language Models via Optimal Dualization Dongsheng Ding, Edgar Dobriban, Hamed Hassani, Osbert Bastani Published: 2024-05-29Area: Alignment TrainingCitations: 18 Tags: ai-safety, alignment-training, theoretical | 2024-05-29 | Alignment Training | ai-safety, alignment-training, theoretical | E5 / R3 (94%) | 18 |
| BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling Cristina G芒rbacea, Lin Gui, Victor Veitch Published: 2024-06-02Area: Alignment TrainingCitations: 102 Tags: ai-safety, alignment-training, empirical | 2024-06-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 102 |
| Decoupled Alignment for Robust Plug-and-Play Adaptation Han Liu, Haozheng Luo, Jerry Yao-Chieh Hu, Jiahao Yu Published: 2024-06-03Area: Model EditingCitations: 12 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-03 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E4 / R3 (96%) | 12 |
| Dishonesty in Helpful and Harmless Alignment Anthony G. Cohn, Duanyu Feng, Jiancheng Lv, Jingkun Tang Published: 2024-06-04Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, empirical | 2024-06-04 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (92%) | 4 |
| Is Free Self-Alignment Possible? Changho Shin, Dyah Adila, Frederic Sala, Yijing Zhang Published: 2024-06-05Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2024-06-05 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R4 (95%) | 3 |
| Improving Alignment and Robustness with Circuit Breakers Andy Zou, Dan Hendrycks, Derek Duenas, Justin Wang Published: 2024-06-06Area: Adversarial RobustnessCitations: 230 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 230 |
| Information Theoretic Guarantees For Policy Alignment In Large Language Models Youssef Mroueh Published: 2024-06-09Area: Formal/TheoreticalCitations: 19 Tags: ai-safety, alignment-training, formaltheoretical, theoretical | 2024-06-09 | Formal/Theoretical | ai-safety, alignment-training, formaltheoretical, theoretical | E5 / R3 (95%) | 19 |
| Aligning Large Language Models with Representation Editing: A Control Perspective Chao Zhang, Haorui Wang, Kai Wang, Lingkai Kong Published: 2024-06-10Area: Model EditingCitations: 49 Tags: ai-safety, alignment-training, empirical, model-editing | 2024-06-10 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (94%) | 49 |
| Language Models Resist Alignment Boyuan Chen, Changye Li, Hantao Lou, Jiaming Ji Published: 2024-06-10Area: Alignment TrainingCitations: 20 Tags: ai-safety, alignment-training, empirical | 2024-06-10 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 20 |
| Safety Alignment Should Be Made More Than Just a Few Tokens Deep Ahmad Beirami, Ashwinee Panda, Kaifeng Lyu, Peter Henderson Published: 2024-06-10Area: Adversarial RobustnessCitations: 315 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-10 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 315 |
| Legend: Leveraging Representation Engineering to Annotate Safety Margin for Preference Datasets Bowen Qin, Chen Huang, Duanyu Feng, Wenqiang Lei Published: 2024-06-12Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2024-06-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 5 |
| Are we making progress in unlearning? Findings from the first NeurIPS unlearning competition Eleni Triantafillou, Fabian Pedregosa, Gintare Karolina Dziugaite, Ioannis Mitliagkas Published: 2024-06-13Area: Alignment TrainingCitations: 44 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2024-06-13 | Alignment Training | ai-safety, alignment-training, benchmark, safety-evaluation | E4 / R3 (94%) | 44 |
| A Survey on Human Preference Learning for Large Language Models Juntao Li, Kehai Chen, Liqiang Nie, Min Zhang Published: 2024-06-17Area: Surveys & ReviewsCitations: 16 Tags: ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | 2024-06-17 | Surveys & Reviews | ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | E5 / R3 (95%) | 16 |
| Is poisoning a real threat to LLM alignment? Maybe more so than you think Furong Huang, Pankayaraj Pathmanathan, Souradip Chakraborty, Xiangyu Liu Published: 2024-06-17Area: Adversarial RobustnessCitations: 28 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-06-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R3 (95%) | 28 |