Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| ROSE: Toward Reality-Oriented Safety Evaluation of Large Language Models Cong Wang, Jiale Ding, Wei-Bin Lee, Xiang Zheng Published: 2025-06-17Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-06-17 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| Calibrated Predictive Lower Bounds on Time-to-Unsafe-Sampling in LLMs Gilad Freidkin, Hen Davidov, Shai Feldman, Yaniv Romano Published: 2025-06-16Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, theoretical | 2025-06-16 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (95%) | - |
| ContextBench: Modifying Contexts for Targeted Latent Activation Alexander Chia, Edward Stevinson, Joseph Isaac Bloom, Joseph Miller Published: 2025-06-15Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-06-15 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (96%) | - |
| OpenUnlearning: Accelerating LLM Unlearning via Unified Benchmarking of Methods and Metrics Andrew McCallum, Anmol Mekala, J. Zico Kolter, Pratyush Maini Published: 2025-06-14Area: Model EditingCitations: 21 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-06-14 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R4 (99%) | 21 |
| Detecting High-Stakes Interactions with Activation Probes Alex McKenzie, David Krueger, Dmitrii Krasheninnikov, Ekdeep Singh Lubana Published: 2025-06-12Area: Safety EvaluationCitations: 13 Tags: ai-safety, empirical, safety-evaluation | 2025-06-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 13 |
| SoK: Machine Unlearning for Large Language Models Charu C. Aggarwal, Hui Liu, Jie Ren, Yingqian Cui Published: 2025-06-10Area: Model EditingCitations: 5 Tags: ai-safety, model-editing, safety-evaluation, survey | 2025-06-10 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E6 / R3 (96%) | 5 |
| QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA Aswin RRV, Ben Zhou, Chitta Baral, Jacob Dineen Published: 2025-06-09Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-06-09 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R4 (96%) | 10 |
| Evaluating and Improving Robustness in Large Language Models: A Survey and Future Directions Dacao Zhang, Guangyi Lv, Kui Yu, Kun Zhang Published: 2025-06-08Area: Surveys & ReviewsCitations: 1 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2025-06-08 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R3 (95%) | 1 |
| Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs Di Wang, Lijie Hu, Qingsong Yang, Shu Yang Published: 2025-06-08Area: Safety EvaluationCitations: 10 Tags: ai-safety, benchmark, safety-evaluation | 2025-06-08 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (97%) | 10 |
| Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models Chao Qian, Hao-Tian Li, Ke Xue, Ren-Jian Wang Published: 2025-06-08Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-06-08 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 4 |
| Reward Model Interpretability via Optimal and Pessimal Tokens Brian Christian, Christopher Summerfield, Hannah Rose Kirk, Jessica A.F. Thompson Published: 2025-06-08Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical, interpretability, safety-evaluation | 2025-06-08 | Alignment Training | ai-safety, alignment-training, empirical, interpretability, safety-evaluation | E5 / R3 (96%) | 10 |
| SafeLawBench: Towards Safe Alignment of Large Language Models Chuxue Cao, Han Zhu, Jiaming Ji, Juntao Dai Published: 2025-06-07Area: Safety EvaluationCitations: 7 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-06-07 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (98%) | 7 |
| Benchmarking Misuse Mitigation Against Covert Adversaries Alexander Robey, Davis Brown, Eric Wong, George J. Pappas Published: 2025-06-06Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 4 |
| Evaluating Neuron Explanations: A Unified Framework with Sanity Checks Ge Yan, Tsui-Wei Weng, Tuomas Oikarinen Published: 2025-06-06Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-06-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (99%) | 7 |
| The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs Chaozhuo Li, Feiran Huang, Jiameng Qiu, Litian Zhang Published: 2025-06-06Area: Safety EvaluationCitations: 23 Tags: ai-safety, safety-evaluation, survey | 2025-06-06 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (94%) | 23 |
| Unintended Harms of Value-Aligned LLMs: Psychological and Empirical Insights Jaehyeok Lee, Jing Yao, JinYeong Bak, Sooyung Choi Published: 2025-06-06Area: Safety EvaluationCitations: 2 Tags: ai-safety, empirical, safety-evaluation | 2025-06-06 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 2 |
| Control Tax: The Price of Keeping AI in Check Caglar Gulcehre, Mikhail Terekhov, Samuel Albanie, Zhen Ning David Liu Published: 2025-06-05Area: Scalable OversightCitations: 3 Tags: ai-safety, empirical, safety-evaluation, scalable-oversight | 2025-06-05 | Scalable Oversight | ai-safety, empirical, safety-evaluation, scalable-oversight | E5 / R3 (94%) | 3 |
| Evaluating Prompt-Driven Chinese Large Language Models: The Influence of Persona Assignment on Stereotypes and Safeguards Carlo Alberto Bono, Francesco Pierri, Geng Liu, Li Feng Published: 2025-06-05Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-06-05 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| RedDebate: Safer Responses through Multi-Agent Red Teaming Debates Ali Asad, Radin Shayanfar, Stephen Obadinma, Xiaodan Zhu Published: 2025-06-04Area: Safety EvaluationCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2025-06-04 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E7 / R4 (97%) | 3 |
| RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming Cong Wang, Wei-Bin Lee, Xiang Zheng, Xingjun Ma Published: 2025-06-04Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, red-teaming, safety-evaluation | 2025-06-04 | Safety Evaluation | ai-safety, benchmark, red-teaming, safety-evaluation | E5 / R3 (97%) | 1 |
| Watermarking Degrades Alignment in Language Models: Analysis and Mitigation Apurv Verma, NhatHai Phan, Shubhendu Trivedi Published: 2025-06-04Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-06-04 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 2 |
| IndoSafety: Culturally Grounded Safety for LLMs in Indonesian Languages Alfan Farizki Wicaksono, Fajri Koto, Muhammad Dehan Al Kautsar, Muhammad Falensi Azmi Published: 2025-06-03Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2025-06-03 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | 4 |
| ThinkEval: Practical Evaluation of Knowledge Leakage in LLM Editing using Thought-based Knowledge Graphs Dinil Mon Divakaran, Manit Baser, Mohan Gurusamy Published: 2025-06-02Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-06-02 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (98%) | - |
| Existing Large Language Model Unlearning Evaluations Are Inconclusive Alexander Robey, Avi Schwarzschild, J. Zico Kolter, Robert Kirk Published: 2025-05-31Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-05-31 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E7 / R3 (94%) | 7 |
| SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning Saad Hossain, Samanvay Vajpayee, Sirisha Rambhatla Published: 2025-05-31Area: Safety EvaluationCitations: 2 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-05-31 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (95%) | 2 |
| A Red Teaming Roadmap Towards System-Level Safety Christina Q. Knight, Jeremy Kritz, Julian Michael, Willow E. Primack Published: 2025-05-30Area: Safety EvaluationCitations: 2 Tags: ai-safety, position, red-teaming, safety-evaluation | 2025-05-30 | Safety Evaluation | ai-safety, position, red-teaming, safety-evaluation | E5 / R3 (92%) | 2 |
| CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring Benjamin Arnav, Hannes Whittingham, Mary Phuong, Nathan Helm-Burger Published: 2025-05-29Area: Safety EvaluationCitations: 14 Tags: ai-safety, empirical, safety-evaluation | 2025-05-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 14 |
| EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refusal to Pseudo-Malicious Instructions Chong Teng, Donghong Ji, Fei Li, Li Zheng Published: 2025-05-29Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-05-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R4 (97%) | 3 |
| BLUR: A Benchmark for LLM Unlearning Robust to Forget-Retain Overlap Neil Kale, Pratiksha Thaker, Shengyuan Hu, Steven Wu Published: 2025-05-28Area: Safety EvaluationCitations: 6 Tags: ai-safety, benchmark, safety-evaluation | 2025-05-28 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | 6 |
| Jailbreak Distillation: Renewable Safety Benchmarking Ahmed Elgohary, Ahmed Magooda, A S M Iftekhar, Benjamin Van Durme Published: 2025-05-28Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-05-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | - |