Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 66 papers (page 1 of 3)路 30 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Basic Legibility Protocols Improve Trusted Monitoring Ashwin Sreevatsa, Cody Rushing, Sebastian Prasanna Published: 2026-02-09Area: Scalable OversightCitations: - Tags: ai-safety, empirical, scalable-oversight | 2026-02-09 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R4 (96%) | - |
| Steering LLMs via Scalable Interactive Oversight Enyu Zhou, Guoteng Wang, Hang Yan, Long Ma Published: 2026-02-04Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2026-02-04 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (94%) | - |
| Truthfulness Despite Weak Supervision: Evaluating and Training LLMs Using Peer Prediction Cameron Allen, Micah Carroll, Tianyi Alex Qiu Published: 2026-01-28Area: Scalable OversightCitations: - Tags: ai-safety, empirical, safety-evaluation, scalable-oversight | 2026-01-28 | Scalable Oversight | ai-safety, empirical, safety-evaluation, scalable-oversight | E5 / R3 (95%) | - |
| Monitoring Monitorability Annie Y. Wei, Benjamin Arnav, Bowen Baker, Ian Kivlichan Published: 2025-12-20Area: Scalable OversightCitations: 6 Tags: ai-safety, benchmark, safety-evaluation, scalable-oversight | 2025-12-20 | Scalable Oversight | ai-safety, benchmark, safety-evaluation, scalable-oversight | E5 / R3 (95%) | 6 |
| AI & Human Co-Improvement for Safer Co-Superintelligence Jakob Foerster, Jason Weston Published: 2025-12-05Area: Scalable OversightCitations: 4 Tags: ai-safety, position, scalable-oversight | 2025-12-05 | Scalable Oversight | ai-safety, position, scalable-oversight | E5 / R4 (96%) | 4 |
| W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search Caigui Jiang, Guojun Ma, Haoying Wang, Mingyang Wan Published: 2025-11-14Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2025-11-14 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (97%) | - |
| Measuring Chain-of-Thought Monitorability Through Faithfulness and Verbosity Austin J. Brockmeier, Austin Meek, Eitan Sprejer, Iv谩n Arcuschin Published: 2025-10-31Area: Scalable OversightCitations: 1 Tags: ai-safety, empirical, scalable-oversight | 2025-10-31 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E7 / R4 (97%) | 1 |
| Human-AI Complementarity: A Goal for Amplified Oversight Lili Janzer, Rishub Jain, Rory Greig, Sophie Bridgers Published: 2025-10-30Area: Scalable OversightCitations: 4 Tags: ai-safety, empirical, scalable-oversight | 2025-10-30 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (93%) | 4 |
| Scalable Oversight via Partitioned Human Supervision Masashi Sugiyama, Ren Yin, Takashi Ishida Published: 2025-10-26Area: Scalable OversightCitations: - Tags: ai-safety, scalable-oversight, theoretical | 2025-10-26 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E5 / R3 (96%) | - |
| Weak-to-Strong Generalization under Distribution Shifts Jan Sobotka, Maria Brbi膰, Myeongho Jeon, Suhwan Choi Published: 2025-10-24Area: Scalable OversightCitations: - Tags: ai-safety, empirical, scalable-oversight | 2025-10-24 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R4 (94%) | - |
| Towards Scalable Oversight with Collaborative Multi-Agent Debate in Error Detection Bo Han, Gang Niu, James Cheng, Masashi Sugiyama Published: 2025-10-23Area: Scalable OversightCitations: - Tags: ai-safety, empirical, scalable-oversight | 2025-10-23 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | - |
| A Concrete Roadmap towards Safety Cases based on Chain-of-Thought Monitoring Julian Schulz Published: 2025-10-22Area: Scalable OversightCitations: - Tags: ai-safety, scalable-oversight, theoretical | 2025-10-22 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E7 / R3 (94%) | - |
| AI Debaters are More Persuasive when Arguing in Alignment with Their Own Beliefs Denise Alejandra Mester, Eitan Sprejer, Facundo Nieto, Francisca Gauna Selasco Published: 2025-10-15Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2025-10-15 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (93%) | - |
| Contrastive Weak-to-strong Generalization Chen Gao, Houcheng Jiang, Jiaxin Wu, Junfeng Fang Published: 2025-10-09Area: Scalable OversightCitations: - Tags: ai-safety, empirical, scalable-oversight | 2025-10-09 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R3 (95%) | - |
| Ensemble Debates with Local Large Language Models for AI Alignment Ephraiem Sarabamoun Published: 2025-08-27Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2025-08-27 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E10 / R10 (94%) | - |
| Reliable Weak-to-Strong Monitoring of LLM Agents Ankit Aich, Chen Bo Calvin Zhang, Christina Q. Knight, Kevin Zhu Published: 2025-08-26Area: Scalable OversightCitations: 4 Tags: ai-safety, empirical, red-teaming, scalable-oversight | 2025-08-26 | Scalable Oversight | ai-safety, empirical, red-teaming, scalable-oversight | E5 / R3 (95%) | 4 |
| Chain-of-Thought Monitorability: A New and Fragile Opportunity for AI Safety Alan Cooney, Aleksander Madry, Allan Dafoe, Anca Dragan Published: 2025-07-15Area: Scalable OversightCitations: 88 Tags: ai-safety, position, scalable-oversight | 2025-07-15 | Scalable Oversight | ai-safety, position, scalable-oversight | E5 / R4 (95%) | 88 |
| Avoiding Obfuscation with Prover-Estimator Debate Geoffrey Irving, Georgios Piliouras, Jonah Brown-Cohen Published: 2025-06-16Area: Scalable OversightCitations: 6 Tags: ai-safety, scalable-oversight, theoretical | 2025-06-16 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E5 / R3 (94%) | 6 |
| Control Tax: The Price of Keeping AI in Check Caglar Gulcehre, Mikhail Terekhov, Samuel Albanie, Zhen Ning David Liu Published: 2025-06-05Area: Scalable OversightCitations: 3 Tags: ai-safety, empirical, safety-evaluation, scalable-oversight | 2025-06-05 | Scalable Oversight | ai-safety, empirical, safety-evaluation, scalable-oversight | E5 / R3 (94%) | 3 |
| On the Emergence of Weak-to-Strong Generalization: A Bias-Variance Perspective Gengze Xu, Wei Yao, Yong Liu, Ziqiao Wang Published: 2025-05-30Area: Scalable OversightCitations: 1 Tags: ai-safety, scalable-oversight, theoretical | 2025-05-30 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E4 / R3 (93%) | 1 |
| An Alignment Safety Case Sketch Based on Debate Benjamin Hilton, Geoffrey Irving, Jacob Pfau, Marie Davidsen Buhl Published: 2025-05-06Area: Scalable OversightCitations: 8 Tags: ai-safety, alignment-training, scalable-oversight, theoretical | 2025-05-06 | Scalable Oversight | ai-safety, alignment-training, scalable-oversight, theoretical | E5 / R3 (94%) | 8 |
| Scaling Laws For Scalable Oversight David D. Baek, Joshua Engels, Max Tegmark, Subhash Kantamneni Published: 2025-04-25Area: Scalable OversightCitations: 4 Tags: ai-safety, scalable-oversight, theoretical | 2025-04-25 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E7 / R3 (97%) | 4 |
| Super Co-alignment of Human and AI for Sustainable Symbiotic Society Bing Han, Boyuan Chen, Chao Liu, Dongcheng Zhao Published: 2025-04-24Area: Scalable OversightCitations: 3 Tags: ai-safety, alignment-training, position, scalable-oversight | 2025-04-24 | Scalable Oversight | ai-safety, alignment-training, position, scalable-oversight | E5 / R3 (94%) | 3 |
| Mechanistic Anomaly Detection for "Quirky" Language Models Arkajyoti Chakraborty, David O. Johnston, Nora Belrose Published: 2025-04-09Area: Scalable OversightCitations: 2 Tags: ai-safety, empirical, scalable-oversight | 2025-04-09 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 2 |
| A Benchmark for Scalable Oversight Protocols Abhimanyu Pallavi Sudhir, Arjun Panickssery, Jackson Kaunismaa Published: 2025-03-31Area: Scalable OversightCitations: 1 Tags: ai-safety, benchmark, scalable-oversight | 2025-03-31 | Scalable Oversight | ai-safety, benchmark, scalable-oversight | E6 / R3 (95%) | 1 |
| FindTheFlaws: Annotated Errors for Detecting Flawed Reasoning and Scalable Oversight Research Chatrik Singh Mangat, Gabriel Recchia, Gayatri Krishnakumar, Issac Li Published: 2025-03-29Area: Scalable OversightCitations: - Tags: ai-safety, dataset, scalable-oversight | 2025-03-29 | Scalable Oversight | ai-safety, dataset, scalable-oversight | E6 / R4 (93%) | - |
| Research Superalignment Should Advance Now with Alternating Competence and Conformity Optimization HyunJin Kim, James Evans, Jing Yao, JinYeong Bak Published: 2025-03-08Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, position, scalable-oversight | 2025-03-08 | Scalable Oversight | ai-safety, alignment-training, position, scalable-oversight | E6 / R3 (93%) | - |
| Scalable Oversight for Superhuman AI via Recursive Self-Critiquing Debing Zhang, Jie Lou, Junjie Yang, XingYu Published: 2025-02-07Area: Scalable OversightCitations: 4 Tags: ai-safety, empirical, scalable-oversight | 2025-02-07 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (97%) | 4 |
| Safety Cases: A Scalable Approach to Frontier AI Safety Benjamin Hilton, Geoffrey Irving, Marie Davidsen Buhl, Tomek Korbak Published: 2025-02-05Area: Scalable OversightCitations: 10 Tags: ai-safety, position, scalable-oversight | 2025-02-05 | Scalable Oversight | ai-safety, position, scalable-oversight | E5 / R3 (93%) | 10 |
| Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions Baharan Mirzasoleiman, Jiping Li, Yihao Xue Published: 2025-02-02Area: Scalable OversightCitations: 5 Tags: ai-safety, scalable-oversight, theoretical | 2025-02-02 | Scalable Oversight | ai-safety, scalable-oversight, theoretical | E5 / R3 (94%) | 5 |