Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| TrajAD: Trajectory Anomaly Detection for Trustworthy LLM Agents Chong Zhang, Hansong Liu, Xiaoyan Wang, Yang Yu Published: 2026-02-06Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2026-02-06 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (96%) | - |
| TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking Ee-Chien Chang, Gang Yang, Han Fang, Haokai Ma Published: 2026-02-06Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (96%) | - |
| Your Language Model Secretly Contains Personality Subnetworks Bo Hui, Manling Li, Ruimeng Ye, Xiaolong Ma Published: 2026-02-06Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | - |
| Among Us: Measuring and Mitigating Malicious Contributions in Model Collaboration Systems Shangbin Feng, Wenxuan Ding, Yulia Tsvetkov, Ziyuan Yang Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (93%) | - |
| BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models Guowen Xu, Hongwei Li, Rui Zhang, Wenbo Jiang Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| Clouding the Mirror: Stealthy Prompt Injection Attacks Targeting LLM-based Phishing Detection Daiki Chiba, Hiroki Nakano, Takashi Koide Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (95%) | - |
| Correctness-Optimized Residual Activation Lens (CORAL): Transferrable and Calibration-Aware Inference-Time Steering Lyle Ungar, Miranda Muqing Miao, Young-Min Cho Published: 2026-02-05Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-05 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders Baosong Yang, Bingqing Jiang, Difan Zou, Lingpeng Kong Published: 2026-02-05Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2026-02-05 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (97%) | - |
| GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt Ahmed Salem, Blake Bullwinkel, Giorgio Severi, Keegan Hines Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (96%) | - |
| Learning to Inject: Automated Prompt Injection via Reinforcement Learning Florian Tram猫r, Jie Zhang, Xin Chen Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | - |
| REBEL: Hidden Knowledge Recovery via Evolutionary-Based Evaluation Loop Patryk Rybak, Paul Swoboda, Pawe艂 Batorski, Przemys艂aw Spurek Published: 2026-02-05Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2026-02-05 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | - |
| Split Personality Training: Revealing Latent Knowledge Through Alternate Personalities Dietrich Klakow, Felix Michalak, Florian Dietz, Gustavo Ewbank Rodrigues Danon Published: 2026-02-05Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-05 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (97%) | - |
| Surgery: Mitigating Harmful Fine-Tuning for Large Language Models via Attention Sink Guozhi Liu, Li Shen, Qi Mu, Ruichao Mo Published: 2026-02-05Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | - |
| Attack Selection Reduces Safety in Concentrated AI Control Settings against Trusted Monitoring Arjun Khandelwal, Joachim Schaeffer, Tyler Tracy Published: 2026-02-04Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2026-02-04 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | - |
| Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks Jafar Isbarov, Murat Kantarcioglu Published: 2026-02-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| CoT is Not the Chain of Truth: An Empirical Internal Analysis of Reasoning LLMs for Fake News Generation Chunlin Gong, Haichao Shi, Qiang Liu, Shu Wu Published: 2026-02-04Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-04 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R2 (96%) | - |
| C-螖螛: Circuit-Restricted Weight Arithmetic for Selective Refusal Aditya Kasliwal, Pratinav Seth, Vinay Kumar Sankarapu Published: 2026-02-04Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (96%) | - |
| Decomposing Query-Key Feature Interactions Using Contrastive Covariances Andrew Lee, Fernanda Vi茅gas, Martin Wattenberg, Yonatan Belinkov Published: 2026-02-04Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-04 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (96%) | - |
| Fine-Grained Activation Steering: Steering Less, Achieving More Gee Wah Ng, Hanzhang Zhou, Jia Jim Deryl Chua, Junlang Qian Published: 2026-02-04Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2026-02-04 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | - |
| From Data to Behavior: Predicting Unintended Model Behaviors Before Training Huajun Chen, Junfeng Fang, Mengru Wang, Ningyu Zhang Published: 2026-02-04Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2026-02-04 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks Jingjing He, Shuaishuai Yang, Tong Yang, Yanshu Wang Published: 2026-02-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2026-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R2 (93%) | - |
| Identifying Intervenable and Interpretable Features via Orthogonality Regularization Bernhard Sch枚lkopf, Florent Draye, Moritz Miller Published: 2026-02-04Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2026-02-04 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (95%) | 1 |
| MaMa: A Game-Theoretic Approach for Designing Safe Agentic Systems Adish Singla, Goran Radanovic, Jonathan N枚ther Published: 2026-02-04Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2026-02-04 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R4 (93%) | - |
| Mechanistic Evidence for Faithfulness Decay in Chain-of-Thought Reasoning Donald Ye, Linus Wong, Max Loffgren, Om Kotadia Published: 2026-02-04Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2026-02-04 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E7 / R4 (97%) | - |
| Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models Binghai Wang, Bowen Yu, Chang Gao, Chujie Zheng Published: 2026-02-04Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2026-02-04 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (96%) | 1 |
| RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning Qiaosheng Zhang, Xia Hu, Xingcheng Xu, Zeming Wei Published: 2026-02-04Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-04 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models Jiacheng Liang, Tanqiu Jiang, Ting Wang, Yuhui Wang Published: 2026-02-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2026-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| Steering LLMs via Scalable Interactive Oversight Enyu Zhou, Guoteng Wang, Hang Yan, Long Ma Published: 2026-02-04Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2026-02-04 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (94%) | - |
| The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment Fandong Meng, Hao Zhou, Hongning Wang, Jie Zhou Published: 2026-02-04Area: Deception & FailureCitations: - Tags: ai-safety, deception-failure, empirical | 2026-02-04 | Deception & Failure | ai-safety, deception-failure, empirical | E4 / R2 (94%) | - |
| Trust The Typical Alan Luo, Biyao Zhang, Debargha Ganguly, Harshini Kavuru Published: 2026-02-04Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2026-02-04 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |