Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 1000+ papers (page 1 of 34)路 197 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Aligning AI With Shared Human Values Andrew Critch, Collin Burns, Dan Hendrycks, Dawn Song Published: 2020-08-05Area: Safety EvaluationCitations: 810 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2020-08-05 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E7 / R5 (94%) | 810 |
| Learning to summarize from human feedback Alec Radford, Chelsea Voss, Daniel M. Ziegler, Dario Amodei Published: 2020-09-02Area: Alignment TrainingCitations: 2862 Tags: ai-safety, alignment-training, empirical | 2020-09-02 | Alignment Training | ai-safety, alignment-training, empirical | E7 / R4 (98%) | 2862 |
| An Overview of 11 Proposals for Building Safe Advanced AI Evan Hubinger Published: 2020-12-04Area: Surveys & ReviewsCitations: 27 Tags: ai-safety, alignment-training, survey, surveys-reviews | 2020-12-04 | Surveys & Reviews | ai-safety, alignment-training, survey, surveys-reviews | E7 / R3 (97%) | 27 |
| LoRA: Low-Rank Adaptation of Large Language Models Edward J. Hu, Lu Wang, Phillip Wallis, Shean Wang Published: 2021-06-17Area: Alignment TrainingCitations: 16470 Tags: ai-safety, alignment-training, empirical | 2021-06-17 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 16470 |
| Process for Adapting Language Models to Society (PALMS) with Values-Targeted Datasets Christy Dennison, Irene Solaiman Published: 2021-06-18Area: Alignment TrainingCitations: 259 Tags: ai-safety, alignment-training, empirical | 2021-06-18 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 259 |
| Unsolved Problems in ML Safety Dan Hendrycks, Jacob Steinhardt, John Schulman, Nicholas Carlini Published: 2021-09-28Area: Surveys & ReviewsCitations: 359 Tags: ai-safety, alignment-training, position, surveys-reviews | 2021-09-28 | Surveys & Reviews | ai-safety, alignment-training, position, surveys-reviews | E6 / R3 (95%) | 359 |
| Truthful AI: Developing and Governing AI That Does Not Lie Adam Bales, Avital Balwit, Luca Righetti, Lukas Finnveden Published: 2021-10-13Area: Alignment TrainingCitations: 140 Tags: ai-safety, alignment-training, position | 2021-10-13 | Alignment Training | ai-safety, alignment-training, position | E5 / R3 (93%) | 140 |
| Can Machines Learn Morality? The Delphi Experiment Chandra Bhagavatula, Jena D. Hwang, Jenny Liang, Jesse Dodge Published: 2021-10-14Area: Alignment TrainingCitations: 157 Tags: ai-safety, alignment-training, empirical | 2021-10-14 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (95%) | 157 |
| A General Language Assistant as a Laboratory for Alignment Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2021-12-01Area: Alignment TrainingCitations: 1016 Tags: ai-safety, alignment-training, empirical | 2021-12-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 1016 |
| WebGPT: Browser-assisted question-answering with human feedback Benjamin Chess, Christina Kim, Christopher Hesse, Gretchen Krueger Published: 2021-12-17Area: Alignment TrainingCitations: 1672 Tags: ai-safety, alignment-training, empirical | 2021-12-17 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (98%) | 1672 |
| Training Language Models to Follow Instructions with Human Feedback Alex Ray, Amanda Askell, Carroll L. Wainwright, Chong Zhang Published: 2022-03-04Area: Alignment TrainingCitations: 18538 Tags: ai-safety, alignment-training, empirical | 2022-03-04 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (98%) | 18538 |
| Uncertainty Estimation for Language Reward Models Adam Gleave, Geoffrey Irving Published: 2022-03-14Area: Alignment TrainingCitations: 36 Tags: ai-safety, alignment-training, empirical | 2022-03-14 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (93%) | 36 |
| Teaching Language Models to Support Answers with Verified Quotes Francis Song, Geoffrey Irving, Jacob Menick, John Aslanides Published: 2022-03-21Area: Alignment TrainingCitations: 314 Tags: ai-safety, alignment-training, empirical | 2022-03-21 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R4 (95%) | 314 |
| Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback Amanda Askell, Andy Jones, Anna Chen, Ben Mann Published: 2022-04-12Area: Alignment TrainingCitations: 3637 Tags: ai-safety, alignment-training, empirical | 2022-04-12 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 3637 |
| Quark: Controllable Text Generation with Reinforced Unlearning Jack Hessel, Lianhui Qin, Liwei Jiang, Peter West Published: 2022-05-26Area: Alignment TrainingCitations: 261 Tags: ai-safety, alignment-training, empirical | 2022-05-26 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 261 |
| Is Power-Seeking AI an Existential Risk? Joseph Carlsmith Published: 2022-06-16Area: Deception & FailureCitations: 129 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2022-06-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E4 / R3 (94%) | 129 |
| The Alignment Problem from a Deep Learning Perspective Lawrence Chan, Richard Ngo, S枚ren Mindermann Published: 2022-08-30Area: Deception & FailureCitations: 263 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2022-08-30 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (93%) | 263 |
| Analyzing Transformers in Embedding Space Ankit Gupta, Guy Dar, Jonathan Berant, Mor Geva Published: 2022-09-06Area: Mechanistic Interp.Citations: 127 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2022-09-06 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E5 / R3 (96%) | 127 |
| Improving alignment of dialogue agents via targeted human judgements Abigail See, Amelia Glaese, Boxi Wu, Charlie Chen Published: 2022-09-28Area: Alignment TrainingCitations: 649 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2022-09-28 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 649 |
| Is Reinforcement Learning (Not) for Natural Language Processing?: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization Christian Bauckhage, Hannaneh Hajishirzi, Jack Hessel, Kiant茅 Brantley Published: 2022-10-03Area: Alignment TrainingCitations: 283 Tags: ai-safety, alignment-training, benchmark | 2022-10-03 | Alignment Training | ai-safety, alignment-training, benchmark | E5 / R3 (96%) | 283 |
| Scaling Laws for Reward Model Overoptimization Jacob Hilton, John Schulman, Leo Gao Published: 2022-10-19Area: Alignment TrainingCitations: 848 Tags: ai-safety, alignment-training, empirical | 2022-10-19 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (93%) | 848 |
| Constitutional AI: Harmlessness from AI Feedback Amanda Askell, Andy Jones, Anna Chen, Anna Goldie Published: 2022-12-15Area: Alignment TrainingCitations: 2490 Tags: ai-safety, alignment-training, empirical | 2022-12-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 2490 |
| On Second Thought, Let's Not Think Step by Step! Bias and Toxicity in Zero-Shot Reasoning Diyi Yang, Hongxin Zhang, Michael Bernstein, Omar Shaikh Published: 2022-12-15Area: Safety EvaluationCitations: 249 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2022-12-15 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (98%) | 249 |
| Conditioning Predictive Models: Risks and Strategies Adam S. Jermyn, Evan Hubinger, Johannes Treutlein, Kate Woolverton Published: 2023-02-02Area: Deception & FailureCitations: 8 Tags: ai-safety, alignment-training, deception-failure, theoretical | 2023-02-02 | Deception & Failure | ai-safety, alignment-training, deception-failure, theoretical | E5 / R3 (94%) | 8 |
| The Capacity for Moral Self-Correction in Large Language Models Amanda Askell, Anna Chen, Anna Goldie, Azalia Mirhoseini Published: 2023-02-15Area: Alignment TrainingCitations: 196 Tags: ai-safety, alignment-training, empirical | 2023-02-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 196 |
| Aligning Language Models with Preferences through f-divergence Minimization Dongyoung Go, Germ谩n Kruszewski, Jos Rozen, Marc Dymetman Published: 2023-02-16Area: Alignment TrainingCitations: 114 Tags: ai-safety, alignment-training, empirical | 2023-02-16 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 114 |
| Pretraining Language Models with Human Preferences Angelica Chen, Christopher L. Buckley, Ethan Perez, Jason Phang Published: 2023-02-16Area: Alignment TrainingCitations: 280 Tags: ai-safety, alignment-training, empirical | 2023-02-16 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (96%) | 280 |
| Finding Alignments Between Interpretable Causal Variables and Distributed Neural Representations Atticus Geiger, Christopher Potts, Noah D. Goodman, Thomas Icard Published: 2023-03-05Area: Mechanistic Interp.Citations: 147 Tags: ai-safety, alignment-training, empirical, mechanistic-interp | 2023-03-05 | Mechanistic Interp. | ai-safety, alignment-training, empirical, mechanistic-interp | E4 / R2 (94%) | 147 |
| RRHF: Rank Responses to Align Language Models with Human Feedback without tears Chuanqi Tan, Fei Huang, Hongyi Yuan, Songfang Huang Published: 2023-04-11Area: Alignment TrainingCitations: 489 Tags: ai-safety, alignment-training, empirical | 2023-04-11 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 489 |
| RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment Deepanshu Goyal, Hanze Dong, Jipeng Zhang, Kashun Shum Published: 2023-04-13Area: Alignment TrainingCitations: 666 Tags: ai-safety, alignment-training, empirical | 2023-04-13 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 666 |