Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge Adeel Yousaf, Amrit Singh Bedi, James Beetham, Joseph Fioresi Published: 2025-11-20Area: Multimodal SafetyCitations: - Tags: ai-safety, alignment-training, empirical, multimodal-safety | 2025-11-20 | Multimodal Safety | ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (97%) | - |
| Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models D. Nardi, F. Giarrusso, F. Pierucci, F. Sartore Published: 2025-11-19Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-19 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (94%) | 8 |
| Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models Samih Fadli Published: 2025-11-19Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-11-19 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | - |
| From Competition to Coordination: Market Making as a Scalable Framework for Safe and Aligned Multi-Agent LLM Systems Afnan Shaik, Archana Vaidheeswaran, Brendan Gho, James Begin Published: 2025-11-18Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | 2025-11-18 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R3 (95%) | - |
| N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator Hengqi Guo, Jirui Yang, Yao Guan, Yubing Bao Published: 2025-11-18Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-11-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R4 (97%) | - |
| Operationalizing Pluralistic Values in Large Language Model Alignment Reveals Trade-offs in Safety, Inclusivity, and Model Behavior Allison Koenecke, Dalia Ali, Dora Zhao, Orestis Papakyriakopoulos Published: 2025-11-18Area: Alignment TrainingCitations: 3 Tags: ai-safety, alignment-training, empirical | 2025-11-18 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 3 |
| Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education Dongsheng Shi, Liang He, Linlin Wang, Xiaoling Wang Published: 2025-11-18Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-18 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (95%) | 1 |
| Fine-Tuned LLMs Know They Don't Know: A Parameter-Efficient Approach to Recovering Honesty Haoyi Zhou, Jianxin Li, Qingyun Sun, Shiqi Gao Published: 2025-11-17Area: Alignment TrainingCitations: 1 Tags: ai-safety, alignment-training, empirical | 2025-11-17 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models Gaotian Liu, Junhua Liu, Kaishuo Wei, Kejia Zhang Published: 2025-11-17Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-11-17 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| GrOCE: Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models Chengqing Li, Feng Han, Jingjing Chen, Ning Han Published: 2025-11-17Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-17 | Model Editing | ai-safety, empirical, model-editing | E5 / R4 (96%) | - |
| SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization Bo Du, Daiguo Zhou, Mang Ye, Tingfeng Wang Published: 2025-11-17Area: Multimodal SafetyCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | 2025-11-17 | Multimodal Safety | adversarial-robustness, ai-safety, alignment-training, empirical, multimodal-safety | E5 / R3 (95%) | - |
| Weight-Sparse Transformers Have Interpretable Circuits Achyuta Rajaram, Bowen Baker, Dan Mossing, Jacob Coxon Published: 2025-11-17Area: Mechanistic Interp.Citations: 14 Tags: ai-safety, empirical, mechanistic-interp | 2025-11-17 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 14 |
| Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs Jie Li, Juncheng Li, Xingjun Ma, Xin Wang Published: 2025-11-16Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | 1 |
| Scaling Patterns in Adversarial Alignment: Evidence from Multi-LLM Jailbreak Experiments Cynthia Matuszek, Rebecca Williams, Samuel Nathanson Published: 2025-11-16Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2025-11-16 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R3 (94%) | 1 |
| AlignTree: Efficient Defense Against LLM Jailbreak Attacks Gil Goren, Lior Wolf, Shahar Katz Published: 2025-11-15Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-15 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 1 |
| Rethinking Deep Alignment Through The Lens Of Incomplete Learning Dung Nguyen, Thao Minh Le, Thong Bach, Truyen Tran Published: 2025-11-15Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-11-15 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R4 (95%) | - |
| Forgetting-MarI: LLM Unlearning via Marginal Information Regularization Shizhou Xu, Stefan Broecker, Thomas Strohmer, Yuan Ni Published: 2025-11-14Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-14 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation Mohamad Amin Mohamadi, Tianhao Wang, Zhiyuan Li Published: 2025-11-14Area: Alignment TrainingCitations: - Tags: ai-safety, alignment-training, empirical | 2025-11-14 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | - |
| NegBLEURT Forest: Leveraging Inconsistencies for Detecting Jailbreak Attacks Jerome Francois, Lama Sleem, Lujun Li, Nathan Foucher Published: 2025-11-14Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2025-11-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (96%) | - |
| W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search Caigui Jiang, Guojun Ma, Haoying Wang, Mingyang Wan Published: 2025-11-14Area: Scalable OversightCitations: - Tags: ai-safety, alignment-training, empirical, scalable-oversight | 2025-11-14 | Scalable Oversight | ai-safety, alignment-training, empirical, scalable-oversight | E5 / R3 (97%) | - |
| Decomposition of Small Transformer Models Casper L. Christensen, Logan Riggs Smith Published: 2025-11-12Area: Mechanistic Interp.Citations: - Tags: ai-safety, empirical, mechanistic-interp | 2025-11-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E4 / R3 (94%) | - |
| Echoing: Identity Failures when LLM Agents Talk to Each Other Adam Earle, Romain Cosentino, Sarath Shekkizhar, Silvio Savarese Published: 2025-11-12Area: Agent SafetyCitations: 2 Tags: agent-safety, ai-safety, alignment-training, empirical | 2025-11-12 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E6 / R3 (97%) | 2 |
| Which Sparse Autoencoder Features Are Real? Model-X Knockoffs for False Discovery Rate Control Tsogt-Ochir Enkhbayar Published: 2025-11-12Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp | 2025-11-12 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (98%) | 1 |
| Beyond Superficial Forgetting: Thorough Unlearning through Knowledge Density Estimation and Block Re-insertion Feng Guo, Junshuo Zhang, Shen Gao, Shuo Shang Published: 2025-11-11Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-11 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (95%) | - |
| Continual Unlearning for Text-to-Image Diffusion Models: A Regularization Perspective Cheng Zhang, Chongyu Fan, Jinsu Yoo, Justin Lee Published: 2025-11-11Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-11 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (95%) | - |
| Investigating CoT Monitorability in Large Reasoning Models Derek Wong, Di Wang, Junchao Wu, Ninhao Liu Published: 2025-11-11Area: Deception & FailureCitations: 1 Tags: ai-safety, deception-failure, empirical | 2025-11-11 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (93%) | 1 |
| Patching LLM Like Software: A Lightweight Method for Improving Safety Policy in Large Language Models Alex Gittens, Ching-Yun Ko, Huzaifa Arif, Keerthiram Murugesan Published: 2025-11-11Area: Model EditingCitations: - Tags: ai-safety, empirical, model-editing | 2025-11-11 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (94%) | - |
| SALT: Steering Activations towards Leakage-free Thinking in Chain of Thought Ashwinee Panda, Kevin Zhu, Maheep Chaudhary, Pierce Tillman Published: 2025-11-11Area: Model EditingCitations: 3 Tags: ai-safety, empirical, model-editing | 2025-11-11 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 3 |
| SOM Directions are Better than One: Multi-Directional Refusal Suppression in Language Models Battista Biggio, Fabio Brau, Fabio Roli, Giorgio Piras Published: 2025-11-11Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2025-11-11 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | 3 |
| Training Language Models to Explain Their Own Computations Belinda Z. Li, Jacob Andreas, Jacob Steinhardt, Vincent Huang Published: 2025-11-11Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, empirical, mechanistic-interp | 2025-11-11 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (93%) | 7 |