Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 66 papers (page 1 of 3)路 39 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Recursively Summarizing Books with Human Feedback Daniel M. Ziegler, Jan Leike, Jeff Wu, Long Ouyang Published: 2021-09-22Area: Scalable OversightCitations: 349 Tags: ai-safety, empirical, scalable-oversight | 2021-09-22 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R4 (95%) | 349 |
| Single-Turn Debate Does Not Help Humans Answer Hard Reading-Comprehension Questions Alicia Parrish, Angelica Chen, Ethan Perez, Harsh Trivedi Published: 2022-04-11Area: Scalable OversightCitations: 19 Tags: ai-safety, empirical, scalable-oversight | 2022-04-11 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (97%) | 19 |
| Self-critiquing models for assisting human evaluators Catherine Yeh, Jan Leike, Jeff Wu, Jonathan Ward Published: 2022-06-12Area: Scalable OversightCitations: 380 Tags: ai-safety, empirical, scalable-oversight | 2022-06-12 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 380 |
| Two-Turn Debate Doesn't Help Humans Answer Hard Reading Comprehension Questions Alicia Parrish, Amanpreet Singh Saimbhi, Harsh Trivedi, Jason Phang Published: 2022-10-19Area: Scalable OversightCitations: 15 Tags: ai-safety, empirical, scalable-oversight | 2022-10-19 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 15 |
| Measuring Progress on Scalable Oversight for Large Language Models Amanda Askell, Andy Jones, Anna Chen, Anna Goldie Published: 2022-11-04Area: Scalable OversightCitations: 180 Tags: ai-safety, empirical, scalable-oversight | 2022-11-04 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 180 |
| Solving Math Word Problems with Process- and Outcome-Based Feedback Antonia Creswell, Francis Song, Geoffrey Irving, Irina Higgins Published: 2022-11-25Area: Scalable OversightCitations: 591 Tags: ai-safety, empirical, scalable-oversight | 2022-11-25 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (94%) | 591 |
| Evaluating Superhuman Models with Consistency Checks Daniel Paleka, Florian Tram猫r, Lukas Fluri Published: 2023-06-16Area: Scalable OversightCitations: 49 Tags: ai-safety, empirical, scalable-oversight | 2023-06-16 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (97%) | 49 |
| Question Decomposition Improves the Faithfulness of Model-Generated Reasoning Anna Chen, Ansh Radhakrishnan, Carol Chen, Carson Denison Published: 2023-07-17Area: Scalable OversightCitations: 111 Tags: ai-safety, empirical, scalable-oversight | 2023-07-17 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 111 |
| Generalization Analogies: A Testbed for Generalizing AI Oversight to Hard-To-Measure Domains Garrett Baker, Joshua Clymer, Rohan Subramani, Sam Wang Published: 2023-11-13Area: Scalable OversightCitations: 8 Tags: ai-safety, benchmark, scalable-oversight | 2023-11-13 | Scalable Oversight | ai-safety, benchmark, scalable-oversight | E7 / R3 (94%) | 8 |
| Debate Helps Supervise Unreliable Experts David Rein, Jackson Petty, Julian Michael, Julien Dirani Published: 2023-11-15Area: Scalable OversightCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, scalable-oversight | 2023-11-15 | Scalable Oversight | adversarial-robustness, ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 31 |
| GPQA: A Graduate-Level Google-Proof Q&A Benchmark Asa Cooper Stickland, Betty Li Hou, David Rein, Jackson Petty Published: 2023-11-20Area: Scalable OversightCitations: 2009 Tags: ai-safety, benchmark, scalable-oversight | 2023-11-20 | Scalable Oversight | ai-safety, benchmark, scalable-oversight | E6 / R4 (98%) | 2009 |
| Scalable AI Safety via Doubly-Efficient Debate Geoffrey Irving, Georgios Piliouras, Jonah Brown-Cohen Published: 2023-11-23Area: Scalable OversightCitations: 40 Tags: ai-safety, scalable-oversight, theoretical | 2023-11-23 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E5 / R3 (94%) | 40 |
| Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision Adrien Ecoffet, Bowen Baker, Collin Burns, Ilya Sutskever Published: 2023-12-14Area: Scalable OversightCitations: 409 Tags: ai-safety, empirical, scalable-oversight | 2023-12-14 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 409 |
| The Unreasonable Effectiveness of Easy Training Data for Hard Tasks Mohit Bansal, Peter Clark, Peter Hase, Sarah Wiegreffe Published: 2024-01-12Area: Scalable OversightCitations: 47 Tags: ai-safety, empirical, scalable-oversight | 2024-01-12 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 47 |
| Debating with More Persuasive LLMs Leads to More Truthful Answers Akbir Khan, Ansh Radhakrishnan, Dan Valentine, Edward Grefenstette Published: 2024-02-09Area: Scalable OversightCitations: 215 Tags: ai-safety, empirical, scalable-oversight | 2024-02-09 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 215 |
| Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision Chuang Gan, Longhui Yu, Sean Welleck, Weiyang Liu Published: 2024-03-14Area: Scalable OversightCitations: 103 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-03-14 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (95%) | 103 |
| A statistical framework for weak-to-strong generalization Felipe Maia Polo, Mikhail Yurochkin, Moulinath Banerjee, Seamus Somerstep Published: 2024-05-25Area: Scalable OversightCitations: 8 Tags: ai-safety, scalable-oversight, theoretical | 2024-05-25 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E5 / R3 (95%) | 8 |
| Efficient Model-agnostic Alignment via Bayesian Persuasion Boyuan Chen, Fengshuo Bai, Mingzhi Wang, Yaodong Yang Published: 2024-05-29Area: Scalable OversightCitations: 10 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-05-29 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E8 / R4 (93%) | 10 |
| Improve Mathematical Reasoning in Language Models by Automated Process Supervision Abhinav Rastogi, Harsh Lara, Jiao Sun, Lei Meng Published: 2024-06-05Area: Scalable OversightCitations: 330 Tags: ai-safety, empirical, scalable-oversight | 2024-06-05 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R3 (97%) | 330 |
| Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization Guangyao Shen, Shiqi Shen, Wenkai Yang, Yankai Lin Published: 2024-06-17Area: Scalable OversightCitations: 20 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-06-17 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E6 / R3 (92%) | 20 |
| LLM Critics Help Catch LLM Bugs Evgenia Nitishinskaya, Jan Leike, Juan Felipe Ceron Uribe, Maja Trebacz Published: 2024-06-28Area: Scalable OversightCitations: 131 Tags: ai-safety, empirical, scalable-oversight | 2024-06-28 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 131 |
| On Scalable Oversight with Weak LLMs Judging Strong LLMs David Lindner, Jannis Bulian, J谩nos Kram谩r, Jonah Brown-Cohen Published: 2024-07-05Area: Scalable OversightCitations: 66 Tags: ai-safety, empirical, scalable-oversight | 2024-07-05 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R3 (95%) | 66 |
| Prover-Verifier Games Improve Legibility of LLM Outputs Harri Edwards, Jan Hendrik Kirchner, Jan Leike, Nat McAleese Published: 2024-07-18Area: Scalable OversightCitations: 54 Tags: ai-safety, empirical, scalable-oversight | 2024-07-18 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R4 (95%) | 54 |
| Weak-to-Strong Reasoning Pengfei Liu, Yan Ma, Yuqing Yang Published: 2024-07-18Area: Scalable OversightCitations: 28 Tags: ai-safety, empirical, scalable-oversight | 2024-07-18 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 28 |
| Games for AI Control: Models of Safety Evaluations of AI Deployment Protocols Alessandro Abate, Buck Shlegeris, Charlie Griffin, Louis Thomson Published: 2024-09-12Area: Scalable OversightCitations: 17 Tags: ai-safety, safety-evaluation, scalable-oversight, theoretical | 2024-09-12 | Scalable Oversight | ai-safety, safety-evaluation, scalable-oversight, theoretical | E5 / R3 (94%) | 17 |
| Training Language Models to Win Debates with Self-Play Improves Judge Accuracy David Rein, Julian Michael, Samuel Arnesen Published: 2024-09-25Area: Scalable OversightCitations: 10 Tags: adversarial-robustness, ai-safety, empirical, scalable-oversight | 2024-09-25 | Scalable Oversight | adversarial-robustness, ai-safety, empirical, scalable-oversight | E6 / R3 (93%) | 10 |
| Provable Weak-to-Strong Generalization via Benign Overfitting Anant Sahai, David X. Wu Published: 2024-10-06Area: Scalable OversightCitations: 15 Tags: ai-safety, scalable-oversight, theoretical | 2024-10-06 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E5 / R3 (95%) | 15 |
| Weak-to-Strong Generalization beyond Accuracy: a Pilot Study in Safety, Toxicity, and Legal Reasoning Bo Hui, Ruimeng Ye, Yang Xiao Published: 2024-10-16Area: Scalable OversightCitations: 5 Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2024-10-16 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E8 / R4 (93%) | 5 |
| Balancing Label Quantity and Quality for Scalable Elicitation Alex Mallen, Nora Belrose Published: 2024-10-17Area: Scalable OversightCitations: 3 Tags: ai-safety, empirical, scalable-oversight | 2024-10-17 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 3 |
| Adaptive Deployment of Untrusted LLMs Reduces Distributed Threats Akbir Khan, Ansh Radhakrishnan, Aryan Bhatt, Buck Shlegeris Published: 2024-11-26Area: Scalable OversightCitations: 20 Tags: ai-safety, empirical, scalable-oversight | 2024-11-26 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (95%) | 20 |