Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 124 papers (page 1 of 5)路 155 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| A Behavioral Fingerprint for Large Language Models: Provenance Tracking via Refusal Vectors Victor S. Sheng, Zhenyu Xu Published: 2026-02-10Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-02-10 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | - |
| The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models Adriano Koshiyama, Kleyton Da Costa, Seonglae Cho, Zekun Wu Published: 2026-02-08Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-02-08 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (94%) | - |
| From Directions to Regions: Decomposing Activations in Language Models via Local Geometry Atticus Geiger, Mor Geva, Omri Fahn, Or Shafran Published: 2026-02-02Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-02-02 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | - |
| Mechanistic Indicators of Steering Effectiveness in Large Language Models Flora Salim, Hao Xue, Mehdi Jafari Published: 2026-02-02Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-02-02 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (93%) | - |
| There Is More to Refusal in Large Language Models than a Single Direction Faaiz Joad, Husrev Taha Sencar, Majd Hawasly, Nadir Durrani Published: 2026-02-02Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-02-02 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | - |
| Towards Understanding Steering Strength Damien Garreau, Magamed Taimeskhanov, Samuel Vaiter Published: 2026-02-02Area: Representation AnalysisCitations: - Tags: ai-safety, representation-analysis, theoretical | 2026-02-02 | Representation Analysis | ai-safety, representation-analysis, theoretical | E5 / R3 (96%) | - |
| Building Better Deception Probes Using Targeted Instruction Pairs Devina Jain, Joseph Bloom, Satvik Golechha, Shivam Arora Published: 2026-02-01Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-02-01 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | - |
| Efficient and accurate steering of Large Language Models through attention-guided feature learning Adityanarayanan Radhakrishnan, Ashia Wilson, Parmida Davarmanesh Published: 2026-01-30Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-01-30 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | - |
| No Reliable Evidence of Self-Reported Sentience in Small Large Language Models Caspar Kaiser, Sean Enderby Published: 2026-01-20Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-01-20 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (93%) | - |
| Building Production-Ready Probes For Gemini Arthur Conmy, Bilal Chughtai, J谩nos Kram谩r, Joshua Engels Published: 2026-01-16Area: Representation AnalysisCitations: 2 Tags: ai-safety, empirical, representation-analysis | 2026-01-16 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (95%) | 2 |
| The Straight and Narrow: Do LLMs Possess an Internal Moral Path? Hongfei Lin, Jingjie Zeng, Liang Yang, Luoming Hu Published: 2026-01-15Area: Representation AnalysisCitations: - Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2026-01-15 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (95%) | - |
| YaPO: Learnable Sparse Activation Steering Vectors for Domain Adaptation Abdelaziz Bounhar, Guokan Shang, Hadi Abdine, Michalis Vazirgiannis Published: 2026-01-13Area: Representation AnalysisCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | 2026-01-13 | Representation Analysis | adversarial-robustness, ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (98%) | - |
| AntiPaSTO: Self-Supervised Honesty Steering via Anti-Parallel Representations Michael J. Clark Published: 2026-01-12Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-01-12 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | - |
| Emergent Introspective Awareness in Large Language Models Jack Lindsey Published: 2026-01-05Area: Representation AnalysisCitations: 24 Tags: ai-safety, empirical, representation-analysis | 2026-01-05 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 24 |
| The Deleuzian Representation Hypothesis Cl茅ment Cornet, Herv茅 Le Borgne, Romaric Besan莽on Published: 2025-12-17Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2025-12-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R4 (95%) | - |
| Investigating Training and Generalization in Faithful Self-Explanations of Large Language Models Hitomi Yanaka, Masaru Isonuma, Tomoki Doi Published: 2025-12-08Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2025-12-08 | Representation Analysis | ai-safety, empirical, representation-analysis | E7 / R3 (97%) | - |
| Polarity-Aware Probing for Quantifying Latent Alignment in Language Models Chirag Agarwal, Elena Ericheva, Sabrina Sadiekh Published: 2025-11-21Area: Representation AnalysisCitations: 1 Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-11-21 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E6 / R3 (97%) | 1 |
| The Impact of Off-Policy Training Data on Probe Generalisation Adrians Skapars, Dmitrii Krasheninnikov, Ekdeep Singh Lubana, Nathalie Kirch Published: 2025-11-21Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2025-11-21 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R3 (95%) | - |
| LLM Probing with Contrastive Eigenproblems: Improving Understanding and Applicability of CCS Peter Bloem, Stefan F. Schouten Published: 2025-11-03Area: Representation AnalysisCitations: - Tags: ai-safety, representation-analysis, theoretical | 2025-11-03 | Representation Analysis | ai-safety, representation-analysis, theoretical | E4 / R2 (93%) | - |
| Belief Dynamics Reveal the Dual Nature of In-Context Learning and Activation Steering Daniel Wurgaft, Ekdeep Singh Lubana, Eric Bigelow, Hidenori Tanaka Published: 2025-11-01Area: Representation AnalysisCitations: 6 Tags: ai-safety, empirical, representation-analysis | 2025-11-01 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (94%) | 6 |
| Emergence of Linear Truth Encodings in Language Models Alberto Bietti, Gilad Yehudai, Joan Bruna, Shauli Ravfogel Published: 2025-10-17Area: Representation AnalysisCitations: 4 Tags: ai-safety, empirical, representation-analysis | 2025-10-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (93%) | 4 |
| LLM Knowledge is Brittle: Truthfulness Representations Rely on Superficial Resemblance Levent Sagun, Mark Ibrahim, Patrick Haller, Polina Kirichenko Published: 2025-10-13Area: Representation AnalysisCitations: 1 Tags: ai-safety, empirical, representation-analysis | 2025-10-13 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 1 |
| Enhancing LLM Steering through Sparse Autoencoder-Based Vector Refinement Anyi Wang, Dong Shu, Ninghao Liu, Xuansheng Wu Published: 2025-09-28Area: Representation AnalysisCitations: 1 Tags: ai-safety, empirical, representation-analysis | 2025-09-28 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 1 |
| Toward Preference-aligned Large Language Models via Residual-based Model Steering Andrea Tagarelli, Lucio La Cava Published: 2025-09-28Area: Representation AnalysisCitations: - Tags: ai-safety, alignment-training, empirical, representation-analysis | 2025-09-28 | Representation Analysis | ai-safety, alignment-training, empirical, representation-analysis | E5 / R3 (94%) | - |
| Mechanistic Interpretability with SAEs: Probing Religion, Violence, and Geography in Large Language Models Katharina Simbeck, Mariam Mahran Published: 2025-09-22Area: Representation AnalysisCitations: 2 Tags: ai-safety, empirical, interpretability, representation-analysis | 2025-09-22 | Representation Analysis | ai-safety, empirical, interpretability, representation-analysis | E5 / R3 (95%) | 2 |
| DISCO: Disentangled Communication Steering for Large Language Models Aria Masoomi, Jennifer Dy, Masih Eskandar, Max Torop Published: 2025-09-20Area: Representation AnalysisCitations: 1 Tags: ai-safety, empirical, representation-analysis | 2025-09-20 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (97%) | 1 |
| RepIt: Representing Isolated Targets to Steer Language Models Chenguang Wang, Dawn Song, Nathan W. Henry, Nicholas Crispino Published: 2025-09-16Area: Representation AnalysisCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-09-16 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 4 |
| How Do LLMs Persuade? Linear Probes Can Uncover Persuasion Dynamics in Multi-Turn Conversations Brandon Jaipersaud, David Krueger, Ekdeep Singh Lubana Published: 2025-08-07Area: Representation AnalysisCitations: 2 Tags: ai-safety, empirical, representation-analysis | 2025-08-07 | Representation Analysis | ai-safety, empirical, representation-analysis | E6 / R4 (96%) | 2 |
| When Truthful Representations Flip Under Deceptive Instructions? Haotian Yu, Mu Sheng, Pan Li, Runchao Li Published: 2025-07-29Area: Representation AnalysisCitations: 5 Tags: ai-safety, empirical, representation-analysis | 2025-07-29 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 5 |
| Death by a Thousand Directions: Exploring the Geometry of Harmfulness in LLMs through Subconcept Probing Adhitya Rajendra Kumar, Kevin Zhu, McNair Shah, Naitik Chheda Published: 2025-07-23Area: Representation AnalysisCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, representation-analysis | 2025-07-23 | Representation Analysis | adversarial-robustness, ai-safety, empirical, representation-analysis | E6 / R3 (94%) | 3 |