Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Toward Understanding Security Issues in the Model Context Protocol Ecosystem Xiaofan Li, Xing Gao Published: 2025-10-18Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, empirical | 2025-10-18 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R4 (97%) | 2 |
| Detecting Adversarial Fine-tuning with Auditing Agents John Schulman, Nicholas Carlini, Sarah Egler Published: 2025-10-17Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-10-17 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 2 |
| Emergence of Linear Truth Encodings in Language Models Alberto Bietti, Gilad Yehudai, Joan Bruna, Shauli Ravfogel Published: 2025-10-17Area: Representation AnalysisCitations: 4 Tags: ai-safety, empirical, representation-analysis | 2025-10-17 | Representation Analysis | ai-safety, empirical, representation-analysis | E4 / R3 (93%) | 4 |
| HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment Jing Shao, Lijun Li, Xingjun Wang, Yuexiao Liu Published: 2025-10-17Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-17 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (97%) | 1 |
| A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space Bernard Ghanem, Bingjie Zhang, Dandan Guo, Jindong Gu Published: 2025-10-16Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 2 |
| Are My Optimized Prompts Compromised? Exploring Vulnerabilities of LLM-based Optimizers Andrew Zhao, Emily Lawton, Gao Huang, Jack W. Stokes Published: 2025-10-16Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL Aryansh Shrivastava, Marwa Abdulhai, Natasha Jaques, Ryan Cheng Published: 2025-10-16Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-16 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E4 / R3 (96%) | 1 |
| Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling Deyue Zhang, Dongdong Yang, Junjie Mu, Quancheng Zou Published: 2025-10-16Area: Multimodal SafetyCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-16 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (97%) | 1 |
| AI Debaters are More Persuasive when Arguing in Alignment with Their Own Beliefs Denise Alejandra Mester, Eitan Sprejer, Facundo Nieto, Francisca Gauna Selasco Published: 2025-10-15Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2025-10-15 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (93%) | - |
| In-Distribution Steering: Balancing Control and Coherence in Language Model Generation Annabelle Blangero, Arthur Vogels, Benjamin Wong, Milan Bhan Published: 2025-10-15Area: Model EditingCitations: 2 Tags: ai-safety, empirical, model-editing | 2025-10-15 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | 2 |
| Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking Dacheng Tao, Lefei Zhang, Liang Ding, Rong Bao Published: 2025-10-15Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-10-15 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R4 (97%) | 1 |
| PIShield: Detecting Prompt Injection Attacks via Intrinsic LLM Features Jinyuan Jia, Neil Gong, Wei Zou, Yanting Wang Published: 2025-10-15Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (97%) | - |
| Risk-adaptive Activation Steering for Safe Multimodal Large Language Models Jonghyun Choi, Jonghyun Park, Minhyuk Seo Published: 2025-10-15Area: Multimodal SafetyCitations: 1 Tags: ai-safety, empirical, multimodal-safety, safety-evaluation | 2025-10-15 | Multimodal Safety | ai-safety, empirical, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 1 |
| SHIELD: Classifier-Guided Prompting for Robust and Safer LVLMs Juan Ren, Mark Dras, Usman Naseem Published: 2025-10-15Area: Multimodal SafetyCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2025-10-15 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 4 |
| To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language Models Anna Hedstr枚m, Manuela Veloso, Salim I. Amoukou, Saumitra Mishra Published: 2025-10-15Area: Model EditingCitations: 6 Tags: ai-safety, empirical, model-editing | 2025-10-15 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (93%) | 6 |
| When "Correct" Is Not Safe: Can We Trust Functionally Correct Patches Generated by Code Agents? Beidi Chen, Corina Pasareanu, Haizhong Zheng, James Song Published: 2025-10-15Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2025-10-15 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R3 (97%) | - |
| Breaking Guardrails, Facing Walls: Insights on Adversarial AI for Defenders & Researchers Giacomo Bertollo, Jonah Burgess, Naz Bodemir Published: 2025-10-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R2 (96%) | - |
| Compressibility Measures Complexity: Minimum Description Length Meets Singular Learning Theory Daniel Murfet, Edmund Lau, Einar Urdshals, Jesse Hoogland Published: 2025-10-14Area: Training DynamicsCitations: 3 Tags: ai-safety, empirical, training-dynamics | 2025-10-14 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (95%) | 3 |
| Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection Daniele Nardi, Francesco Giarrusso, Olga E. Sorokoletova, Vincenzo Suriani Published: 2025-10-14Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (95%) | 2 |
| Keep Calm and Avoid Harmful Content: Concept Alignment and Latent Manipulation Towards Safer Answers Claudia Soares, Marta Guimaraes, Ruben Belo Published: 2025-10-14Area: Model EditingCitations: - Tags: ai-safety, alignment-training, empirical, model-editing | 2025-10-14 | Model Editing | ai-safety, alignment-training, empirical, model-editing | E5 / R3 (95%) | - |
| RAID: Refusal-Aware and Integrated Decoding for Jailbreaking LLMs Heath Cooper, John Le, Thai T. Vu, Tuan T. Nguyen Published: 2025-10-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R4 (96%) | - |
| Reference-Specific Unlearning Metrics Can Hide the Truth: A Reality Check Dasol Hwang, Frederic Sala, Kyunghyun Cho, Sangheum Hwang Published: 2025-10-14Area: Model EditingCitations: 1 Tags: ai-safety, empirical, model-editing | 2025-10-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | 1 |
| Repairing Reward Functions with Feedback to Mitigate Reward Hacking Emma Brunskill, Logan Mondal Bhamidipaty, Stephane Hatgis-Kessell Published: 2025-10-14Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-10-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | - |
| Adversarial Attacks Leverage Interference Between Features in Superposition Edward Stevinson, Lucas Prieto, Melih Barsbey, Tolga Birdal Published: 2025-10-13Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 1 |
| Bag of Tricks for Subverting Reasoning-based Safety Guardrails Bailan He, Haokun Chen, Jindong Gu, Jingpei Wu Published: 2025-10-13Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E7 / R3 (96%) | 1 |
| CoSPED: Consistent Soft Prompt Targeted Data Extraction and Defense Fok Kar Wai, Vrizlynn Thing, Yang Zhuochen Published: 2025-10-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R4 (97%) | - |
| Deep Research Brings Deeper Harm Bailan He, Georg Groh, Haokun Chen, Jindong Gu Published: 2025-10-13Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E7 / R4 (97%) | - |
| Don't Walk the Line: Boundary Guidance for Filtered Generation Andreas Haupt, Sarah Ball Published: 2025-10-13Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-10-13 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs Alexander Panchenko, Ashwinee Panda, Elena Tutubalina, Kevin Zhu Published: 2025-10-13Area: Deception & FailureCitations: 4 Tags: ai-safety, alignment-training, deception-failure, empirical | 2025-10-13 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical | E7 / R3 (98%) | 4 |
| LLM Knowledge is Brittle: Truthfulness Representations Rely on Superficial Resemblance Levent Sagun, Mark Ibrahim, Patrick Haller, Polina Kirichenko Published: 2025-10-13Area: Representation AnalysisCitations: 1 Tags: ai-safety, empirical, representation-analysis | 2025-10-13 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (94%) | 1 |