Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization Haibo Jin, Haohan Wang, Jiwei Guan Published: 2026-01-05Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2026-01-05 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R4 (98%) | - |
| Emergent Introspective Awareness in Large Language Models Jack Lindsey Published: 2026-01-05Area: Representation AnalysisCitations: 24 Tags: ai-safety, empirical, representation-analysis | 2026-01-05 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (95%) | 24 |
| Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance Jian Liu, Jian Lou, Jiawen Zhang, Kejia Chen Published: 2026-01-05Area: Model EditingCitations: 1 Tags: ai-safety, alignment-training, empirical, model-editing | 2026-01-05 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (97%) | 1 |
| Structural Representations for Cross-Attack Generalization in AI Agent Threat Detection Vignesh Iyer Published: 2026-01-05Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2026-01-05 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (96%) | - |
| Steerability of Instrumental-Convergence Tendencies in LLMs Jakub Hoscilowicz Published: 2026-01-04Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-01-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | - |
| The Slow Drift of Support: Boundary Failures in Multi-Turn Mental Health LLM Dialogues Chenyu Sun, Kerry Jiang, Qiyang Pan, Youyou Cheng Published: 2026-01-02Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2026-01-02 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | - |
| ActErase: A Training-Free Paradigm for Precise Concept Erasure via Activation Patching Bin Chen, Hongyan Li, Junhao Li, Xinhao Zhong Published: 2026-01-01Area: Model EditingCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, model-editing | 2026-01-01 | Model Editing | adversarial-robustness, ai-safety, empirical, model-editing | E5 / R3 (95%) | 1 |
| Attribution-Guided Distillation of Matryoshka Sparse Autoencoders Cristina P. Martin-Linares, Jonathan P. Ling Published: 2025-12-31Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-12-31 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 1 |
| On the geometry and topology of representations: the manifolds of modular addition Colin Daniels, Doina Precup, Gabriela Moisescu-Pareja, Gavin McCracken Published: 2025-12-31Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-12-31 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R3 (94%) | - |
| Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs Muhammad Abdullahi Said, Muhammad Sammani Sani Published: 2025-12-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (96%) | - |
| The Trojan in the Vocabulary: Stealthy Sabotage of LLM Composition Jing Gao, Matt Fredrikson, Weichen Yu, Xiaoqian Wang Published: 2025-12-31Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-12-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment Huizhong Song, Jiye Liang, Jun Wang, Lijun Zhang Published: 2025-12-30Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race? Dingfan Chen, Linyi Yang, Michael Backes, Xiao Zhang Published: 2025-12-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | - |
| Adversarial Lens: Exploiting Attention Layers to Generate Adversarial Examples for Evaluation Kaustubh Dhole Published: 2025-12-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-12-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (95%) | - |
| Eliciting Behaviors in Multi-Turn Conversations Andrew Hard, Jing Huang, John Lambert, Lun Wang Published: 2025-12-29Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-12-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (95%) | - |
| Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance Anningzhe Gao, Erchao Zhao, Feifei Tong, Guanjun Jiang Published: 2025-12-29Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-12-29 | Alignment Training | ai-safety, alignment-training, empirical | E6 / R3 (97%) | 1 |
| EquaCode: A Multi-Strategy Jailbreak Approach for Large Language Models via Equation Solving and Code Completion Hai Huang, Zhengkui Chen, Zhen Liang Published: 2025-12-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-12-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation Dianyun Wang, Huijia Wu, Lechen Ning, Qingsen Ma Published: 2025-12-29Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (98%) | - |
| Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization Kerem Zaman, Shashank Srivastava Published: 2025-12-28Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-12-28 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E7 / R3 (97%) | - |
| Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs Anastasia Giachanou, Hadi Mohammadi, Tam谩s Koz谩k Published: 2025-12-27Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-27 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Few Tokens Matter: Entropy Guided Attacks on Vision-Language Models Jing Zhang, Jinhong Ni, Mengqi He, Shu Zou Published: 2025-12-26Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | - |
| Look Closer! An Adversarial Parametric Editing Framework for Hallucination Mitigation in VLMs Beibei Li, Bing Ji, Jiangwei Xia, Jiayu Hu Published: 2025-12-26Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-12-26 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (98%) | - |
| Can We Trust AI Explanations? Evidence of Systematic Underreporting in Chain-of-Thought Reasoning Deep Pankajbhai Mehta Published: 2025-12-25Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2025-12-25 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (95%) | - |
| Learning from Negative Examples: Why Warning-Framed Training Data Teaches What It Warns Against Tsogt-Ochir Enkhbayar Published: 2025-12-25Area: Training DynamicsCitations: - Tags: ai-safety, empirical, training-dynamics | 2025-12-25 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | - |
| Beyond Context: Large Language Models Failure to Grasp Users Intent Ahmed M. Hussain, Panos Papadimitratos, Salahuddin Salahuddin Published: 2025-12-24Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-12-24 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 1 |
| Casting a SPELL: Sentence Pairing Exploration for LLM Limitation-breaking Chong Wang, Wenbo Guo, Xiaojun Jia, Yang Liu Published: 2025-12-24Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-12-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 1 |
| GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs Ahmad-Reza Sadeghi, Lichao Wu, Mohamadreza Rostami, Sasha Behrouzi Published: 2025-12-24Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-12-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | 2 |
| Can LLMs Predict Their Own Failures? Self-Awareness via Internal Circuits Amirhosein Ghasemabadi, Di Niu Published: 2025-12-23Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-12-23 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E6 / R4 (96%) | - |
| Investigating Model Editing for Unlearning in Large Language Models Lalana Kagal, Shariqah Hossain Published: 2025-12-23Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing | 2025-12-23 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 4 |
| Offline Safe Policy Optimization From Heterogeneous Feedback Akshat Kumar, Pradeep Varakantham, Ze Gong Published: 2025-12-23Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-12-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |