Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 33 papers (page 1 of 2)路 43 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Generalization to Political Beliefs from Fine-Tuning on Sports Team Preferences Owen Terry Published: 2026-01-07Area: Training DynamicsCitations: - Tags: ai-safety, empirical, training-dynamics | 2026-01-07 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (93%) | - |
| Learning from Negative Examples: Why Warning-Framed Training Data Teaches What It Warns Against Tsogt-Ochir Enkhbayar Published: 2025-12-25Area: Training DynamicsCitations: - Tags: ai-safety, empirical, training-dynamics | 2025-12-25 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | - |
| Using physics-inspired Singular Learning Theory to understand grokking & other phase transitions in modern neural networks Anish Lakkapragada Published: 2025-11-30Area: Training DynamicsCitations: - Tags: ai-safety, empirical, training-dynamics | 2025-11-30 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (95%) | - |
| Compressibility Measures Complexity: Minimum Description Length Meets Singular Learning Theory Daniel Murfet, Edmund Lau, Einar Urdshals, Jesse Hoogland Published: 2025-10-14Area: Training DynamicsCitations: 3 Tags: ai-safety, empirical, training-dynamics | 2025-10-14 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (95%) | 3 |
| Evolution of Concepts in Language Model Pre-Training Jiaxing Wu, Wentao Shu, Xipeng Qiu, Xuyang Ge Published: 2025-09-21Area: Training DynamicsCitations: 2 Tags: ai-safety, empirical, training-dynamics | 2025-09-21 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (94%) | 2 |
| Let Me Grok for You: Accelerating Grokking via Embedding Transfer from a Weaker Model Wei Hu, Yixin Wang, Zhiwei Xu, Zhiyu Ni Published: 2025-04-17Area: Training DynamicsCitations: 6 Tags: ai-safety, empirical, training-dynamics | 2025-04-17 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (95%) | 6 |
| Learning and Unlearning of Fabricated Knowledge in Language Models Andrey Zhmoginov, Chen Sun, Mark Sandler, Max Vladymyrov Published: 2024-10-29Area: Training DynamicsCitations: 5 Tags: ai-safety, empirical, training-dynamics | 2024-10-29 | Training Dynamics | ai-safety, empirical, training-dynamics | E4 / R3 (94%) | 5 |
| Differentiation and Specialization of Attention Heads via the Refined Local Learning Coefficient Daniel Murfet, George Wang, Jesse Hoogland, Stan van Wingerden Published: 2024-10-03Area: Training DynamicsCitations: 24 Tags: ai-safety, empirical, training-dynamics | 2024-10-03 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (93%) | 24 |
| Learning Dynamics of LLM Finetuning Danica J. Sutherland, Yi Ren Published: 2024-07-15Area: Training DynamicsCitations: 67 Tags: ai-safety, alignment-training, theoretical, training-dynamics | 2024-07-15 | Training Dynamics | ai-safety, alignment-training, theoretical, training-dynamics | E5 / R3 (94%) | 67 |
| Data Shapley in One Training Run Dawn Song, Jiachen T. Wang, Prateek Mittal, Ruoxi Jia Published: 2024-06-16Area: Training DynamicsCitations: 48 Tags: ai-safety, theoretical, training-dynamics | 2024-06-16 | Training Dynamics | ai-safety, theoretical, training-dynamics | E5 / R3 (95%) | 48 |
| Fine-tuning Enhances Existing Mechanisms: A Case Study on Entity Tracking David Bau, Nikhil Prakash, Tal Haklay, Tamar Rott Shaham Published: 2024-02-22Area: Training DynamicsCitations: 101 Tags: ai-safety, empirical, training-dynamics | 2024-02-22 | Training Dynamics | ai-safety, empirical, training-dynamics | E7 / R4 (95%) | 101 |
| The Developmental Landscape of In-Context Learning Daniel Murfet, George Wang, Jesse Hoogland, Liam Carroll Published: 2024-02-04Area: Training DynamicsCitations: 19 Tags: ai-safety, empirical, training-dynamics | 2024-02-04 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | 19 |
| Dynamical versus Bayesian Phase Transitions in a Toy Model of Superposition Daniel Murfet, Edmund Lau, Jake Mendel, Susan Wei Published: 2023-10-10Area: Training DynamicsCitations: 22 Tags: ai-safety, theoretical, training-dynamics | 2023-10-10 | Training Dynamics | ai-safety, theoretical, training-dynamics | E5 / R3 (95%) | 22 |
| The Reversal Curse: LLMs trained on 'A is B' fail to learn 'B is A' Asa Cooper Stickland, Lukas Berglund, Max Kaufmann, Meg Tong Published: 2023-09-21Area: Training DynamicsCitations: 425 Tags: ai-safety, empirical, training-dynamics | 2023-09-21 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | 425 |
| Sudden Drops in the Loss: Syntax Acquisition, Phase Transitions, and Simplicity Bias in MLMs Angelica Chen, Kyunghyun Cho, Matthew L. Leavitt, Naomi Saphra Published: 2023-09-13Area: Training DynamicsCitations: 109 Tags: ai-safety, empirical, training-dynamics | 2023-09-13 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (97%) | 109 |
| Explaining Grokking Through Circuit Efficiency J谩nos Kram谩r, Ramana Kumar, Rohin Shah, Vikrant Varma Published: 2023-09-05Area: Training DynamicsCitations: 80 Tags: ai-safety, empirical, training-dynamics | 2023-09-05 | Training Dynamics | ai-safety, empirical, training-dynamics | E6 / R3 (93%) | 80 |
| The Local Learning Coefficient: A Singularity-Aware Complexity Measure Daniel Murfet, Edmund Lau, George Wang, Susan Wei Published: 2023-08-23Area: Training DynamicsCitations: 34 Tags: ai-safety, theoretical, training-dynamics | 2023-08-23 | Training Dynamics | ai-safety, theoretical, training-dynamics | E5 / R3 (96%) | 34 |
| Studying Large Language Model Generalization with Influence Functions Alex Tamkin, Amirhossein Tajdini, Benoit Steiner, Cem Anil Published: 2023-08-07Area: Training DynamicsCitations: 286 Tags: ai-safety, empirical, training-dynamics | 2023-08-07 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (94%) | 286 |
| AI Models Collapse When Trained on Recursively Generated Data Ilia Shumailov, Nicolas Papernot, Ross Anderson, Yarin Gal Published: 2023-05-27Area: Training DynamicsCitations: 427 Tags: ai-safety, empirical, training-dynamics | 2023-05-27 | Training Dynamics | ai-safety, empirical, training-dynamics | E6 / R3 (97%) | 427 |
| Are Emergent Abilities of Large Language Models a Mirage? Brando Miranda, Rylan Schaeffer, Sanmi Koyejo Published: 2023-04-28Area: Training DynamicsCitations: 591 Tags: ai-safety, empirical, training-dynamics | 2023-04-28 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | 591 |
| Emergent and Predictable Memorization in Large Language Models Edward Raff, Hailey Schoelkopf, Lintang Sutawika, Quentin Anthony Published: 2023-04-21Area: Training DynamicsCitations: 173 Tags: ai-safety, empirical, training-dynamics | 2023-04-21 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | 173 |
| Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling Aviya Skowron, Edward Raff, Eric Hallahan, Hailey Schoelkopf Published: 2023-04-03Area: Training DynamicsCitations: 1708 Tags: ai-safety, interpretability, tool, training-dynamics | 2023-04-03 | Training Dynamics | ai-safety, interpretability, tool, training-dynamics | E5 / R3 (99%) | 1708 |
| Progress Measures for Grokking via Mechanistic Interpretability Jacob Steinhardt, Jess Smith, Lawrence Chan, Neel Nanda Published: 2023-01-12Area: Training DynamicsCitations: 680 Tags: ai-safety, empirical, interpretability, training-dynamics | 2023-01-12 | Training Dynamics | ai-safety, empirical, interpretability, training-dynamics | E5 / R3 (95%) | 680 |
| Transformers Learn In-Context by Gradient Descent Alexander Mordvintsev, Andrey Zhmoginov, Ettore Randazzo, Eyvind Niklasson Published: 2022-12-15Area: Training DynamicsCitations: 677 Tags: ai-safety, theoretical, training-dynamics | 2022-12-15 | Training Dynamics | ai-safety, theoretical, training-dynamics | E5 / R3 (95%) | 677 |
| Inverse Scaling Can Become U-Shaped Jason Wei, Najoung Kim, Quoc V. Le, Yi Tay Published: 2022-11-03Area: Training DynamicsCitations: 79 Tags: ai-safety, empirical, training-dynamics | 2022-11-03 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (95%) | 79 |
| Emergent Abilities of Large Language Models Barret Zoph, Colin Raffel, Dani Yogatama, Denny Zhou Published: 2022-06-15Area: Training DynamicsCitations: 3244 Tags: ai-safety, empirical, training-dynamics | 2022-06-15 | Training Dynamics | ai-safety, empirical, training-dynamics | E7 / R3 (96%) | 3244 |
| Scaling Laws and Interpretability of Learning from Repeated Data Ben Mann, Catherine Olsson, Chris Olah, Danny Hernandez Published: 2022-05-21Area: Training DynamicsCitations: 148 Tags: ai-safety, empirical, interpretability, training-dynamics | 2022-05-21 | Training Dynamics | ai-safety, empirical, interpretability, training-dynamics | E5 / R3 (94%) | 148 |
| Towards Understanding Grokking: An Effective Theory of Representation Learning Eric J. Michaud, Max Tegmark, Mike Williams, Niklas Nolte Published: 2022-05-20Area: Training DynamicsCitations: 217 Tags: ai-safety, theoretical, training-dynamics | 2022-05-20 | Training Dynamics | ai-safety, theoretical, training-dynamics | E5 / R4 (94%) | 217 |
| Training Compute-Optimal Large Language Models Aidan Clark, Arthur Mensch, Aurelia Guy, Bogdan Damoc Published: 2022-03-29Area: Training DynamicsCitations: 2817 Tags: ai-safety, empirical, training-dynamics | 2022-03-29 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | 2817 |
| Quantifying Memorization Across Neural Language Models Chiyuan Zhang, Daphne Ippolito, Florian Tramer, Katherine Lee Published: 2022-02-15Area: Training DynamicsCitations: 805 Tags: ai-safety, empirical, training-dynamics | 2022-02-15 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R4 (96%) | 805 |