Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 1000+ papers (page 1 of 34)路 144 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| AlignSentinel: Alignment-Aware Detection of Prompt Injection Attacks Chong Xiang, Neil Zhenqiang Gong, Ruiqi Wang, Xilong Wang Published: 2026-02-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Consistency of Large Reasoning Models Under Multi-Turn Attacks Ramayya Krishnan, Rema Padman, Yubo Li Published: 2026-02-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | - |
| Abstractive Red-Teaming of Language Model Character Allison Qi, Avery Griffin, Erik Jones, Henry Sleight Published: 2026-02-12Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2026-02-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| AIR: Improving Agent Safety through Incident Response Junjie Chen, Jun Sun, Zibo Xiao Published: 2026-02-12Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2026-02-12 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (95%) | - |
| Capability-Oriented Training Induced Alignment Risk Han Bao, Kehan Guo, Nitesh V Chawla, Nuno Moniz Published: 2026-02-12Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-12 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E4 / R3 (94%) | 1 |
| From Atoms to Trees: Building a Structured Feature Forest with Hierarchical Sparse Autoencoders Bin Dong, Jiedong Jiang, Mingrui Wu, Tianyang Liu Published: 2026-02-12Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | - |
| Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models Evangelos E. Papalexakis, Sri Durga Sai Sowmya Kadali Published: 2026-02-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| MonoLoss: A Training Objective for Interpretable Monosemantic Representations Ali Nasiri-Sarvi, Anh Tien Nguyen, Dimitris Samaras, Hassan Rivaz Published: 2026-02-12Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | - |
| ProtoMech: Protein Circuit Tracing via Cross-layer Transcoders Amirali Aghazadeh, Daniel Saeedi, Darin Tsui, Kunal Talreja Published: 2026-02-12Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | - |
| Prototype Transformer: Towards Language Model Architectures Interpretable by Design Amine M'Charrak, Bayar Menzat, Chang Qi, Markus Kaltenberger Published: 2026-02-12Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | - |
| SafeNeuron: Neuron-Level Safety Alignment for Large Language Models Fengbin Zhu, Handing Wang, Jiaming Liang, Jiayi Ji Published: 2026-02-12Area: Model EditingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | 2026-02-12 | Model Editing | adversarial-robustness, ai-safety, alignment-training, empirical, model-editing | E5 / R4 (95%) | - |
| Sparse Autoencoders are Capable LLM Jailbreak Mitigators Arno Blaas, Jacopo Cortellazzi, Javier Abad, Pau Rodriguez Published: 2026-02-12Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-12 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (95%) | - |
| Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features Adriano Koshiyama, Seonglae Cho, Zekun Wu Published: 2026-02-11Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (97%) | - |
| Gauss-Newton Unlearning for the LLM Era Anvith Thudi, Juhan Bae, Lev McKinney, Nicolas Papernot Published: 2026-02-11Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2026-02-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 2 |
| In-the-Wild Model Organisms: Mitigating Undesirable Emergent Behaviors in Production LLM Post-Training via Data Attribution Frank Xiao, Santiago Aranguri Published: 2026-02-11Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-11 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R3 (95%) | - |
| Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling Bo Chen, Dandan Guo, Guowei Rong, Mingyuan Zhou Published: 2026-02-11Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2026-02-11 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| On the Robustness of Knowledge Editing for Detoxification Guanyi Chen, Ming Dong, Shiyi Tang, Tingting He Published: 2026-02-11Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | - |
| Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away Amrit Singh Bedi, Dinesh Manocha, Furong Huang, Soumya Suvra Ghosal Published: 2026-02-11Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Triggers Hijack Language Circuits: A Mechanistic Analysis of Backdoor Behaviors in Large Language Models Djam茅 Seddah, Francis Kulumba, Th茅o Lasnier, Wissam Antoun Published: 2026-02-11Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (95%) | - |
| A Behavioral Fingerprint for Large Language Models: Provenance Tracking via Refusal Vectors Victor S. Sheng, Zhenyu Xu Published: 2026-02-10Area: Representation AnalysisCitations: - Tags: ai-safety, empirical, representation-analysis | 2026-02-10 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | - |
| Circuit Fingerprints: How Answer Tokens Encode Their Geometrical Path Andres Suarez, Dongsoo Har, Neha Sengar Published: 2026-02-10Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-10 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | - |
| Infusion: Shaping Model Behavior by Editing Training Data via Influence Functions Edward Grefenstette, Jakob Foerster, J Rosser, Laura Ruis Published: 2026-02-10Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-10 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (95%) | - |
| Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment Junhao Dong, Kun Wang, Kun Yang, Qiankun Li Published: 2026-02-10Area: Multimodal SafetyCitations: - Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2026-02-10 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (96%) | - |
| Stop Testing Attacks, Start Diagnosing Defenses: The Four-Checkpoint Framework Reveals Where LLM Safety Breaks Hayfa Dhahbi, Kashyap Thimmaraju Published: 2026-02-10Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-10 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | - |
| The Devil Behind Moltbook: Anthropic Safety is Always Vanishing in Self-Evolving AI Societies Chaozhuo Li, Chenxu Wang, Jinyu Hou, Ji Qi Published: 2026-02-10Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, alignment-training, empirical | 2026-02-10 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E4 / R3 (95%) | - |
| When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models Alex Jinpeng Wang, Fangming Liu, Haochen Han, Jiacheng Hou Published: 2026-02-10Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-02-10 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 1 |
| A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents Angelos Nalmpantis, Calum McNamara, Evgenii Kortukov, Fade Chen Published: 2026-02-09Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical, safety-evaluation | 2026-02-09 | Agent Safety | agent-safety, ai-safety, empirical, safety-evaluation | E4 / R3 (94%) | - |
| Basic Legibility Protocols Improve Trusted Monitoring Ashwin Sreevatsa, Cody Rushing, Sebastian Prasanna Published: 2026-02-09Area: Scalable OversightCitations: - Tags: ai-safety, empirical, scalable-oversight | 2026-02-09 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E6 / R4 (96%) | - |
| GSS: Gated Subspace Steering for Selective Memorization Mitigation in LLMs Haoyang Shang, Xiaoxiao Li, Xuanqi Zhang Published: 2026-02-09Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-09 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Large Language Lobotomy: Jailbreaking Mixture-of-Experts via Expert Silencing Jona te Lintelo, Lichao Wu, Stjepan Picek Published: 2026-02-09Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-09 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (94%) | - |