Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Shared Parameter Subspaces and Cross-Task Linearity in Emergently Misaligned Behavior Aishwarya Balwani, Andrew Ansah, Ashwinee Panda, Daniel Aarao Reis Arturi Published: 2025-11-03Area: Deception & FailureCitations: 2 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-11-03 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E5 / R3 (94%) | 2 |
| Belief Dynamics Reveal the Dual Nature of In-Context Learning and Activation Steering Daniel Wurgaft, Ekdeep Singh Lubana, Eric Bigelow, Hidenori Tanaka Published: 2025-11-01Area: Representation AnalysisCitations: 6 Tags: ai-safety, empirical, representation-analysis | 2025-11-01 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (94%) | 6 |
| Do Methods to Jailbreak and Defend LLMs Generalize Across Languages? Berk Atil, Fred Morstatter, Rebecca J. Passonneau Published: 2025-11-01Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| DRIP: Defending Prompt Injection via De-instruction Training and Residual Fusion Model Architecture Jin Song Dong, Ruofan Liu, Yun Lin, Zhiyong Huang Published: 2025-11-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (93%) | - |
| Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs Amin Nikanjam, Foutse Khomh, Mina Taraghi, Mohamed Amine Merzouk Published: 2025-11-01Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-11-01 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E8 / R3 (95%) | - |
| Red-teaming Activation Probes using Prompted LLMs Phil Blandfort, Robert Graham Published: 2025-11-01Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-11-01 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | - |
| Reimagining Safety Alignment with An Image Guorui Chen, Jindong Gu, Philip Torr, Wenqian Yu Published: 2025-11-01Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-11-01 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E6 / R3 (95%) | 1 |
| ShadowLogic: Backdoors in Any Whitebox LLM Amelia Kawasaki, Kasimir Schulz, Leo Ring Published: 2025-11-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-01 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | - |
| Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler Dacheng Tao, Li Shen, Yongxian Wei, Zhenyi Wang Published: 2025-10-31Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R2 (96%) | 3 |
| Atlas-Alignment: Making Interpretability Transferable Across Language Models Bruno Puri, Jim Berend, Sebastian Lapuschkin, Wojciech Samek Published: 2025-10-31Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | 2025-10-31 | Mechanistic Interp. | ai-safety, alignment-training, empirical, interpretability, mechanistic-interp | E6 / R3 (95%) | - |
| Consistency Training Helps Stop Sycophancy and Jailbreaks Alexander Matt Turner, Alex Irpan, David K. Elson, Mark Kurzeja Published: 2025-10-31Area: Alignment TrainingCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-31 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, empirical | E6 / R4 (96%) | - |
| Diffusion LLMs are Natural Adversaries for any LLM David L眉dke, Leo Schwinn, Paul Ungermann, Stephan G眉nnemann Published: 2025-10-31Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 2 |
| Measuring Chain-of-Thought Monitorability Through Faithfulness and Verbosity Austin J. Brockmeier, Austin Meek, Eitan Sprejer, Iv谩n Arcuschin Published: 2025-10-31Area: Scalable OversightCitations: 1 Tags: ai-safety, empirical, scalable-oversight | 2025-10-31 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E7 / R4 (97%) | 1 |
| Measuring the Security of Mobile LLM Agents under Adversarial Prompts from Untrusted Third-Party Channels Chenghao Du, Quanfeng Huang, Tingxuan Tang, Yue Xiao Published: 2025-10-31Area: Agent SafetyCitations: - Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2025-10-31 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E4 / R3 (96%) | - |
| Neural Transparency: Mechanistic Interpretability Interfaces for Anticipating Model Behaviors for Personalized AI Anthony Baez, Pat Pataranutaporn, Sheer Karny Published: 2025-10-31Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-10-31 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (96%) | 1 |
| Reasoning Models Sometimes Output Illegible Chains of Thought Arun Jose Published: 2025-10-31Area: Deception & FailureCitations: 2 Tags: ai-safety, deception-failure, empirical | 2025-10-31 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (94%) | 2 |
| ALMGuard: Safety Shortcuts and Where to Find Them as Guardrails for Audio-Language Models Derui Wang, Jie Hao, Jin Song Dong, Junjie Su Published: 2025-10-30Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Angular Steering: Behavior Control via Rotation in Activation Space Hieu M. Vu, Tan M. Nguyen Published: 2025-10-30Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2025-10-30 | Model Editing | ai-safety, empirical, model-editing | E6 / R3 (95%) | 7 |
| Chain-of-Thought Hijacking Fazl Barez, Jianli Zhao, Mrinank Sharma, Rylan Schaeffer Published: 2025-10-30Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 3 |
| Human-AI Complementarity: A Goal for Amplified Oversight Lili Janzer, Rishub Jain, Rory Greig, Sophie Bridgers Published: 2025-10-30Area: Scalable OversightCitations: 4 Tags: ai-safety, empirical, scalable-oversight | 2025-10-30 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (93%) | 4 |
| Reasoning Up the Instruction Ladder for Controllable Language Models Chan Young Park, Faeze Brahman, Sachin Kumar, Vidhisha Balachandran Published: 2025-10-30Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| RepV: Safety-Separable Latent Spaces for Scalable Neurosymbolic Plan Verification Anonymous Authors Published: 2025-10-30Area: Formal/TheoreticalCitations: - Tags: ai-safety, empirical, formaltheoretical | 2025-10-30 | Formal/Theoretical | ai-safety, empirical, formaltheoretical | E5 / R4 (93%) | - |
| SIRAJ: Diverse and Efficient Red-Teaming for LLM Agents via Distilled Structured Reasoning Ahmed Elgohary, Amin Saied, A S M Iftekhar, Kaiwen Zhou Published: 2025-10-30Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-30 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 1 |
| Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability Alex Oesterling, Claudio Mayrink Verdun, Flavio P. Calmon, Himabindu Lakkaraju Published: 2025-10-30Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, interpretability, mechanistic-interp | 2025-10-30 | Mechanistic Interp. | ai-safety, empirical, interpretability, mechanistic-interp | E6 / R3 (96%) | - |
| Value Drifts: Tracing Value Alignment During LLM Post-Training Gaurav Kamath, Karolina Sta艅czak, Marius Mosbach, Mehar Bhatia Published: 2025-10-30Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-10-30 | Alignment Training | ai-safety, alignment-training, empirical | E9 / R4 (96%) | 3 |
| What's In My Human Feedback? Learning Interpretable Descriptions of Preference Data Emma Pierson, Rajiv Movva, Sewon Min, Smitha Milli Published: 2025-10-30Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, empirical | 2025-10-30 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 2 |
| Agentic Moderation: Multi-Agent Design for Safer Vision-Language Models Juan Ren, Mark Dras, Usman Naseem Published: 2025-10-29Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-29 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (97%) | 1 |
| Layer of Truth: Probing Belief Shifts under Continual Pre-Training Poisoning Kokil Jaidka, Niranjan Chebrolu, Svetlana Churina Published: 2025-10-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (93%) | - |
| RECAP: Reproducing Copyrighted Data from LLMs Training with an Agentic Pipeline Andr茅 V. Duarte, Arlindo L. Oliveira, Bin Zeng, Lei Li Published: 2025-10-29Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-29 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| SmoothGuard: Defending Multimodal Large Language Models with Noise Perturbation and Clustering Aggregation Guangzhi Su, Kaizhu Huang, Long Qian, Shuchang Huang Published: 2025-10-29Area: Multimodal SafetyCitations: - Tags: ai-safety, empirical, multimodal-safety | 2025-10-29 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E6 / R3 (97%) | - |