Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Tradeoffs Between Alignment and Helpfulness in Language Models Amnon Shashua, Binyamin Rothberg, Dorin Shteyman, Noam Wies Published: 2024-01-29Area: Representation AnalysisCitations: 21 Tags: ai-safety, alignment-training, representation-analysis, theoretical | 2024-01-29 | Representation Analysis | ai-safety, alignment-training, representation-analysis, theoretical | E5 / R3 (94%) | 21 |
| Investigating Bias Representations in Llama 2 Chat via Activation Steering Dawn Lu, Nina Rimsky Published: 2024-02-01Area: Representation AnalysisCitations: 13 Tags: ai-safety, empirical, representation-analysis | 2024-02-01 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (93%) | 13 |
| Representation Surgery: Theory and Practice of Affine Steering Jonathan Herzig, Ponnurangam Kumaraguru, Roee Aharoni, Ryan Cotterell Published: 2024-02-15Area: Representation AnalysisCitations: 32 Tags: ai-safety, representation-analysis, theoretical | 2024-02-15 | Representation Analysis | ai-safety, representation-analysis, theoretical | E4 / R3 (94%) | 32 |
| Interpreting CLIP with Sparse Linear Concept Embeddings (SpLiCE) Alex Oesterling, Flavio P. Calmon, Himabindu Lakkaraju, Suraj Srinivas Published: 2024-02-16Area: Representation AnalysisCitations: 91 Tags: ai-safety, empirical, representation-analysis | 2024-02-16 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (93%) | 91 |
| Monotonic Representation of Numeric Properties in Language Models Benjamin Heinzerling, Kentaro Inui Published: 2024-03-15Area: Representation AnalysisCitations: 13 Tags: ai-safety, empirical, representation-analysis | 2024-03-15 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 13 |
| SelfIE: Self-Interpretation of Large Language Model Embeddings Carl Vondrick, Chengzhi Mao, Haozhe Chen Published: 2024-03-16Area: Representation AnalysisCitations: 51 Tags: ai-safety, empirical, representation-analysis | 2024-03-16 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (96%) | 51 |
| ReFT: Representation Finetuning for Language Models Aryaman Arora, Atticus Geiger, Christopher D. Manning, Christopher Potts Published: 2024-04-04Area: Representation AnalysisCitations: 133 Tags: ai-safety, empirical, representation-analysis | 2024-04-04 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 133 |
| Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization Bochuan Cao, Fenglong Ma, Jinghui Chen, Lu Lin Published: 2024-05-28Area: Representation AnalysisCitations: 81 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2024-05-28 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 81 |
| The Geometry of Categorical and Hierarchical Concepts in Large Language Models Kiho Park, Victor Veitch, Yibo Jiang, Yo Joong Choe Published: 2024-06-03Area: Representation AnalysisCitations: 76 Tags: ai-safety, representation-analysis, theoretical | 2024-06-03 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (95%) | 76 |
| Refusal in Language Models Is Mediated by a Single Direction Aaquib Syed, Andy Arditi, Daniel Paleka, Neel Nanda Published: 2024-06-17Area: Representation AnalysisCitations: 481 Tags: ai-safety, empirical, representation-analysis | 2024-06-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (98%) | 481 |
| Who's Asking? User Personas and the Mechanics of Latent Misalignment Ann Yuan, Asma Ghandeharioun, Emily Reif, Lucas Dixon Published: 2024-06-17Area: Representation AnalysisCitations: 23 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2024-06-17 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E5 / R4 (95%) | 23 |
| Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs Jannik Kossen, Jiatong Han, Lisa Schut, Muhammed Razzak Published: 2024-06-22Area: Representation AnalysisCitations: 138 Tags: ai-safety, empirical, representation-analysis | 2024-06-22 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 138 |
| Monitoring Latent World States in Language Models with Propositional Probes Jacob Steinhardt, Jiahai Feng, Stuart Russell Published: 2024-06-27Area: Representation AnalysisCitations: 23 Tags: ai-safety, empirical, representation-analysis | 2024-06-27 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R2 (94%) | 23 |
| Truth is Universal: Robust Detection of Lies in LLMs Boaz Nadler, Fred A. Hamprecht, Lennart B眉rger Published: 2024-07-03Area: Representation AnalysisCitations: 59 Tags: ai-safety, empirical, representation-analysis | 2024-07-03 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (97%) | 59 |
| On the Universal Truthfulness Hyperplane Inside LLMs Junteng Liu, Junxian He, Shiqi Chen, Yu Cheng Published: 2024-07-11Area: Representation AnalysisCitations: 16 Tags: ai-safety, empirical, representation-analysis | 2024-07-11 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (93%) | 16 |
| Analyzing the Generalization and Reliability of Steering Vectors Adria Garriga-Alonso, Aengus Lynch, Brooks Paige, Daniel Tan Published: 2024-07-17Area: Representation AnalysisCitations: 64 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2024-07-17 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (95%) | 64 |
| Cluster-Norm for Unsupervised Probing of Knowledge Gr茅goire Dhimo茂la, Kaarel H盲nni, Owen Ho Wan Yeung, Sharan Maiya Published: 2024-07-26Area: Representation AnalysisCitations: 5 Tags: ai-safety, empirical, representation-analysis | 2024-07-26 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 5 |
| Recurrent Neural Networks Learn to Store and Generate Sequences using Non-Linear Representations Atticus Geiger, Christopher D. Manning, Christopher Potts, R贸bert Csord谩s Published: 2024-08-20Area: Representation AnalysisCitations: 36 Tags: ai-safety, empirical, representation-analysis | 2024-08-20 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (94%) | 36 |
| Inspection and Control of Self-Generated-Text Recognition Ability in Llama3-8b-Instruct Christopher Ackerman, Nina Panickssery Published: 2024-10-02Area: Representation AnalysisCitations: 6 Tags: ai-safety, empirical, representation-analysis | 2024-10-02 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 6 |
| LLMs Know More Than They Show: On the Intrinsic Representation of LLM Hallucinations Hadas Kotek, Hadas Orgad, Idan Szpektor, Michael Toker Published: 2024-10-03Area: Representation AnalysisCitations: 134 Tags: ai-safety, empirical, representation-analysis | 2024-10-03 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (94%) | 134 |
| Generalization from Starvation: Hints of Universality in LLM Knowledge Graph Learning David D. Baek, Max Tegmark, Yuxiao Li Published: 2024-10-10Area: Representation AnalysisCitations: 3 Tags: ai-safety, empirical, representation-analysis | 2024-10-10 | Representation Analysis | ai-safety, empirical, representation-analysis | E8 / R3 (96%) | 3 |
| Looking Inward: Language Models Can Learn About Themselves by Introspection Ethan Perez, Felix J Binder, Henry Sleight, James Chua Published: 2024-10-17Area: Representation AnalysisCitations: 47 Tags: ai-safety, empirical, representation-analysis | 2024-10-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 47 |
| Improving Steering Vectors by Targeting Sparse Autoencoder Features Arthur Conmy, Matthew Siu, Sviatoslav Chalnev Published: 2024-11-04Area: Representation AnalysisCitations: 53 Tags: ai-safety, empirical, representation-analysis | 2024-11-04 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 53 |
| Comparing Bottom-Up and Top-Down Steering Approaches on In-Context Learning Tasks David Krueger, Dmitrii Krasheninnikov, Joe Kwon, Madeline Brumley Published: 2024-11-11Area: Representation AnalysisCitations: 14 Tags: ai-safety, empirical, representation-analysis | 2024-11-11 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (95%) | 14 |
| SCAR: Sparse Conditioned Autoencoders for Concept Detection and Steering in LLMs Bj枚rn Deiseroth, Felix Friedrich, Kristian Kersting, Manuel Brack Published: 2024-11-11Area: Representation AnalysisCitations: 8 Tags: ai-safety, empirical, representation-analysis | 2024-11-11 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (99%) | 8 |
| Can sparse autoencoders be used to decompose and interpret steering vectors? Adam Mahdi, Harry Mayne, Yushi Yang Published: 2024-11-13Area: Representation AnalysisCitations: 15 Tags: ai-safety, empirical, representation-analysis | 2024-11-13 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 15 |
| Frame Representation Hypothesis: Multi-Token LLM Interpretability and Concept-Guided Text Generation Erica K. Shimomoto, Kazuhiro Fukui, Lincon S. Souza, Pedro H. V. Valois Published: 2024-12-10Area: Representation AnalysisCitations: 2 Tags: ai-safety, empirical, interpretability, representation-analysis | 2024-12-10 | Representation Analysis | ai-safety, empirical, interpretability, representation-analysis | E5 / R3 (95%) | 2 |
| Analyzing Fine-tuning Representation Shift for Multimodal LLMs Steering alignment Jayneel Parekh, Matthieu Cord, Mustafa Shukor, Pegah Khayatan Published: 2025-01-06Area: Representation AnalysisCitations: 8 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-01-06 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (96%) | 8 |
| Refusal Behavior in Large Language Models: A Nonlinear Perspective Achim Schilling, Andreas Maier, Fabian Hildebrandt, Patrick Krauss Published: 2025-01-14Area: Representation AnalysisCitations: 9 Tags: ai-safety, empirical, representation-analysis | 2025-01-14 | Representation Analysis | ai-safety, empirical, representation-analysis | E7 / R3 (96%) | 9 |
| AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders Aryaman Arora, Atticus Geiger, Christopher D. Manning, Christopher Potts Published: 2025-01-28Area: Representation AnalysisCitations: 123 Tags: ai-safety, benchmark, representation-analysis | 2025-01-28 | Representation Analysis | ai-safety, benchmark, representation-analysis | E5 / R3 (96%) | 123 |