Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| LLMs Encode Harmfulness and Refusal Separately David Bau, Jiachen Zhao, Jing Huang, Weiyan Shi Published: 2025-07-16Area: Representation AnalysisCitations: 10 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-07-16 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R4 (94%) | 10 |
| Linearly Decoding Refused Knowledge in Aligned Language Models Ari Holtzman, Aryan Shrivastava Published: 2025-06-30Area: Representation AnalysisCitations: 2 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-06-30 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E6 / R4 (92%) | 2 |
| A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks Ahmed Salem, Amanda Minnich, Blake Bullwinkel, Daniel Jones Published: 2025-06-29Area: Representation AnalysisCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-06-29 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 2 |
| Convergent Linear Representations of Emergent Misalignment Anna Soligo, Edward Turner, Neel Nanda, Senthooran Rajamanoharan Published: 2025-06-13Area: Representation AnalysisCitations: 22 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-06-13 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E4 / R3 (95%) | 22 |
| Structure before the Machine: Input Space is the Prerequisite for Concepts Ang Li, Bowei Tian, Hongyi Wang, Meng Liu Published: 2025-06-10Area: Representation AnalysisCitations: - Tags: ai-safety, representation-analysis, theoretical | 2025-06-10 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (94%) | - |
| Probing Neural Topology of Large Language Models Paolo Santi, Yong Li, Yuan Yuan, Yu Zheng Published: 2025-06-01Area: Representation AnalysisCitations: 3 Tags: ai-safety, empirical, representation-analysis | 2025-06-01 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 3 |
| Probing the Geometry of Truth: Consistency and Generalization of Truth Directions in LLMs Across Logical Transformations and Question Answering Tasks Hao Peng, Jianwei Yin, Tianyu Du, Xinkui Zhao Published: 2025-06-01Area: Representation AnalysisCitations: 7 Tags: ai-safety, empirical, representation-analysis | 2025-06-01 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 7 |
| Linear Representation Transferability Hypothesis: Leveraging Small Models to Steer Large Models Anubrata Das, Fangcong Yin, Fanzhi Zeng, Femi Bello Published: 2025-05-31Area: Representation AnalysisCitations: 2 Tags: ai-safety, empirical, representation-analysis | 2025-05-31 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (91%) | 2 |
| COSMIC: Generalized Refusal Direction Identification in LLM Activations Chenguang Wang, Dawn Song, Nicholas Crispino, Sam Pan Published: 2025-05-30Area: Representation AnalysisCitations: 5 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2025-05-30 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (95%) | 5 |
| Understanding (Un)Reliability of Steering Vectors in Language Models Carsten Eickhoff, David Krueger, Dmitrii Krasheninnikov, Joschka Braun Published: 2025-05-28Area: Representation AnalysisCitations: 8 Tags: ai-safety, empirical, representation-analysis | 2025-05-28 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 8 |
| From Directions to Cones: Exploring Multidimensional Representations of Propositional Facts in LLMs Clayton Lau, Cole Blondin, Kevin Zhu, Oscar Yasunaga Published: 2025-05-27Area: Representation AnalysisCitations: 2 Tags: ai-safety, empirical, representation-analysis | 2025-05-27 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 2 |
| Improved Representation Steering for Language Models Aryaman Arora, Christopher D. Manning, Christopher Potts, Qinan Yu Published: 2025-05-27Area: Representation AnalysisCitations: 6 Tags: ai-safety, empirical, representation-analysis | 2025-05-27 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 6 |
| The Origins of Representation Manifolds in Large Language Models Alexander Modell, Nick Whiteley, Patrick Rubin-Delanchy Published: 2025-05-23Area: Representation AnalysisCitations: 11 Tags: ai-safety, representation-analysis, theoretical | 2025-05-23 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (93%) | 11 |
| Refusal Direction is Universal Across Safety-Aligned Languages Barbara Plank, Hinrich Sch眉tze, Mingyang Wang, Xinpeng Wang Published: 2025-05-22Area: Representation AnalysisCitations: 5 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-05-22 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E6 / R3 (94%) | 5 |
| Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering Bo Shen, Fan Yang, Haiyan Zhao, Mengnan Du Published: 2025-05-21Area: Representation AnalysisCitations: 4 Tags: ai-safety, empirical, representation-analysis | 2025-05-21 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 4 |
| Language Models Are Capable of Metacognitive Monitoring and Control of Their Internal Activations Hua-Dong Xiong, Li Ji-An, Marcelo G. Mattar, Marcus K. Benna Published: 2025-05-19Area: Representation AnalysisCitations: 16 Tags: ai-safety, empirical, representation-analysis | 2025-05-19 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (93%) | 16 |
| Exploring the generalization of LLM truth directions on conversational formats David Martens, Timour Ichmoukhamedov Published: 2025-05-14Area: Representation AnalysisCitations: 1 Tags: ai-safety, empirical, representation-analysis | 2025-05-14 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 1 |
| Concept-Level Explainability for Auditing & Steering LLM Responses Kenza Amara, Mennatallah El-Assady, Rita Sevastjanova Published: 2025-05-12Area: Representation AnalysisCitations: 6 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-05-12 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E6 / R3 (94%) | 6 |
| On the Limitations of Steering in Language Model Alignment Chebrolu Niranjan, Gerard Christopher Yeo, Kokil Jaidka Published: 2025-05-02Area: Representation AnalysisCitations: 3 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-05-02 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E4 / R3 (94%) | 3 |
| Steering the CensorShip: Uncovering Representation Vectors for LLM "Thought" Control David Evans, Hannah Cyberey Published: 2025-04-23Area: Representation AnalysisCitations: 10 Tags: ai-safety, empirical, representation-analysis | 2025-04-23 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 10 |
| Steering off Course: Reliability Challenges in Steering Language Models Dheeraj Rajagopal, Hannaneh Hajishirzi, Hari Sethuraman, Patrick Queiroz Da Silva Published: 2025-04-06Area: Representation AnalysisCitations: 10 Tags: ai-safety, empirical, representation-analysis, safety-evaluation | 2025-04-06 | Representation Analysis | ai-safety, empirical, representation-analysis, safety-evaluation | E7 / R4 (99%) | 10 |
| Why Representation Engineering Works: A Theoretical and Empirical Study in Vision-Language Models Ang Li, Bowei Tian, Hongyi Wang, Meng Liu Published: 2025-03-25Area: Representation AnalysisCitations: 3 Tags: ai-safety, empirical, representation-analysis | 2025-03-25 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 3 |
| Calibrating Verbal Uncertainty as a Linear Feature to Reduce Hallucinations Alan Schelten, Anthony Hartshorn, Cheng Zhang, Lei Yu Published: 2025-03-18Area: Representation AnalysisCitations: 23 Tags: ai-safety, empirical, representation-analysis | 2025-03-18 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (92%) | 23 |
| Aligned Probing: Relating Toxic Behavior and Model Internals Andreas Waldis, Anne Lauscher, Dietrich Klakow, Iryna Gurevych Published: 2025-03-17Area: Representation AnalysisCitations: 3 Tags: ai-safety, empirical, representation-analysis | 2025-03-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (93%) | 3 |
| Probing Latent Subspaces in LLM for AI Security: Identifying and Manipulating Adversarial States Chia, Jonathan, Pan, Xin Wei Published: 2025-03-12Area: Representation AnalysisCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-03-12 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 4 |
| One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs Arman Cohan, Jacob Dunefsky Published: 2025-02-26Area: Representation AnalysisCitations: 9 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2025-02-26 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E6 / R3 (94%) | 9 |
| The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence Jannes Elstner, Johannes Gasteiger, Simon Geisler, Stephan G眉nnemann Published: 2025-02-24Area: Representation AnalysisCitations: 37 Tags: ai-safety, empirical, representation-analysis | 2025-02-24 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (93%) | 37 |
| Toward a Flexible Framework for Linear Representation Hypothesis Using Maximum Likelihood Estimation Trung Nguyen, Yan Leng Published: 2025-02-22Area: Representation AnalysisCitations: 1 Tags: ai-safety, representation-analysis, theoretical | 2025-02-22 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (94%) | 1 |
| Can Role Vectors Affect LLM Behaviour? Andrea Seveso, Daniele Potert矛, Fabio Mercorio Published: 2025-02-17Area: Representation AnalysisCitations: 3 Tags: ai-safety, empirical, representation-analysis | 2025-02-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 3 |
| Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring Dongrui Liu, Guanxu Chen, Jing Shao, Lijie Hu Published: 2025-02-07Area: Representation AnalysisCitations: 2 Tags: ai-safety, empirical, representation-analysis | 2025-02-07 | Representation Analysis | ai-safety, empirical, representation-analysis | E7 / R3 (94%) | 2 |