Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing Haibo Jin, Haohan Wang, Liying Kang, Peiyan Zhang Published: 2025-07-10Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-07-10 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 3 |
| BlueGlass: A Framework for Composite AI Safety Harshal Nandigramwar, Kay-Ulrich Scholl, Syed Qutub Published: 2025-07-14Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, tool | 2025-07-14 | Safety Evaluation | ai-safety, safety-evaluation, tool | E5 / R3 (95%) | - |
| Can We Predict Alignment Before Models Finish Thinking? Towards Monitoring Misaligned Reasoning Models Stephen H. Bach, Yik Siu Chan, Zheng-Xin Yong Published: 2025-07-16Area: Safety EvaluationCitations: 9 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-07-16 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 9 |
| TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law Ehsan Shareghi, Nigel Collier, Yijiang River Dong, Zheng Hui Published: 2025-07-22Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2025-07-22 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (99%) | 4 |
| From Seed to Harvest: Augmenting Human Creativity with AI for Red-teaming Text-to-Image Models Alicia Parrish, Charvi Rastogi, Jessica Quaye, Lora Aroyo Published: 2025-07-23Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-07-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (96%) | - |
| PrompTrend: Continuous Community-Driven Vulnerability Discovery and Assessment for Large Language Models Jihene Bennaceur, Mootez Aloui, Ramzi Guesmi, Tarek Gasmi Published: 2025-07-25Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-07-25 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (97%) | - |
| A Survey on Generative Model Unlearning: Fundamentals, Taxonomy, Evaluation, and Future Direction Chaochao Chen, Chengye Wang, Fengyuan Yu, Jiaming Zhang Published: 2025-07-26Area: Surveys & ReviewsCitations: 2 Tags: ai-safety, safety-evaluation, survey, surveys-reviews | 2025-07-26 | Surveys & Reviews | ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R3 (93%) | 2 |
| Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems Hisashi Kashima, Jiyi Li, Koh Takeuchi, Kyohei Atarashi Published: 2025-07-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-07-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| LLMs Can Covertly Sandbag on Capability Evaluations Against Chain-of-Thought Monitoring Chloe Li, Mary Phuong, Noah Y. Siegel Published: 2025-07-31Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-07-31 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (97%) | 6 |
| Towards Evaluation for Real-World LLM Unlearning Ke Miao, Kui Ren, Wenjie Bao, Xiaochen Li Published: 2025-08-02Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-08-02 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E4 / R3 (95%) | - |
| ASTRA: Autonomous Spatial-Temporal Red-teaming for AI Software Assistants Chengpeng Wang, Guangyu Shen, Hanxi Guo, Jiasheng Jiang Published: 2025-08-05Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-08-05 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| Estimating Worst-Case Frontier Risks of Open-Weight LLMs Chris Koch, Eric Wallace, Kai Chen, Miles Wang Published: 2025-08-05Area: Safety EvaluationCitations: 16 Tags: ai-safety, empirical, safety-evaluation | 2025-08-05 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 16 |
| Automatic LLM Red Teaming Arunesh Sinha, Pradeep Varakantham, Roman Belaire Published: 2025-08-06Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-08-06 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (93%) | 1 |
| Who's the Evil Twin? Differential Auditing for Undesired Behavior Greta Kintzley, Ishwar Balappanawar, Ronan Azimi-Mancel, Satvik Golechha Published: 2025-08-09Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-08-09 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | - |
| Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models Aiwei Liu, Bolin Ding, Felix Henry, Leyi Pan Published: 2025-08-10Area: Multimodal SafetyCitations: 2 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-08-10 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 2 |
| Jinx: Unlimited LLMs for Probing Alignment Failures Jiahao Zhao, Liwei Dong Published: 2025-08-11Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, safety-evaluation, tool | 2025-08-11 | Safety Evaluation | ai-safety, alignment-training, safety-evaluation, tool | E6 / R4 (96%) | - |
| Amazon Nova AI Challenge - Trusted AI: Advancing secure, AI-assisted software development Anna Gottardi, Desheng Zhang, Hangjie Shi, Lavina Vaz Published: 2025-08-13Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2025-08-13 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| STREAM (ChemBio): A Standard for Transparently Reporting Evaluations in AI Model Reports Chris Painter, Jide Alaga, Luca Righetti, Rishi Bommasani Published: 2025-08-13Area: Safety EvaluationCitations: 5 Tags: ai-safety, safety-evaluation, tool | 2025-08-13 | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R3 (94%) | 5 |
| The PacifAIst Benchmark: Would an Artificial Intelligence Choose to Sacrifice Itself for Human Safety? Manuel Herrador Mu帽oz Published: 2025-08-13Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-08-13 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | - |
| AI Testing Should Account for Sophisticated Strategic Behaviour Alexis Ghersengorin, Eric Olav Chen, Sami Petersen, Vincent Conitzer Published: 2025-08-19Area: Safety EvaluationCitations: 3 Tags: ai-safety, safety-evaluation, theoretical | 2025-08-19 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E6 / R3 (96%) | 3 |
| Sycophancy under Pressure: Evaluating and Mitigating Sycophantic Bias via Adversarial Dialogues in Scientific QA Chunyi Li, Dandan Zhu, Guangtao Zhai, Kaiwei Zhang Published: 2025-08-19Area: Deception & FailureCitations: 6 Tags: adversarial-robustness, ai-safety, deception-failure, empirical, safety-evaluation | 2025-08-19 | Deception & Failure | adversarial-robustness, ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (95%) | 6 |
| Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation Chang Liu, Hang Su, Huanran Chen, Jun Zhu Published: 2025-08-21Area: Multimodal SafetyCitations: 1 Tags: ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | 2025-08-21 | Multimodal Safety | ai-safety, alignment-training, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 1 |
| Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs Daeun Moon, Hyejin Chung, Hyunsoo Yoon, Jiwon Kim Published: 2025-08-23Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-08-23 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (98%) | - |
| Quantized but Deceptive? A Multi-Dimensional Truthfulness Evaluation of Quantized LLMs Haotian Yu, Mu Sheng, Pan Li, Runchao Li Published: 2025-08-26Area: Safety EvaluationCitations: 6 Tags: ai-safety, empirical, safety-evaluation | 2025-08-26 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (93%) | 6 |
| Evaluating Language Model Reasoning about Confidential Information Alexander Robey, Andy Zou, Dylan Sam, J. Zico Kolter Published: 2025-08-27Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2025-08-27 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R3 (93%) | 1 |
| JADES: A Universal Framework for Jailbreak Assessment via Decompositional Scoring Chao Shen, Chenhao Lin, Junjie Chu, Michael Backes Published: 2025-08-28Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-08-28 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (93%) | 4 |
| The Resurgence of GCG Adversarial Attacks on Large Language Models Huizhen Shu, Peikang Hu, Xuying Li, Yuting Tan Published: 2025-08-30Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-08-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R4 (96%) | 1 |
| CE-Bench: Towards a Reliable Contrastive Evaluation Benchmark of Interpretability of Sparse Autoencoders Alex Gulko, Sachin Kumar, Yusen Peng Published: 2025-08-31Area: Mechanistic Interp.Citations: - Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2025-08-31 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | - |
| Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions Chang Liu, Cheng Wei, Fengxiang Wang, Hui Xue Published: 2025-09-01Area: Safety EvaluationCitations: 7 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-09-01 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 7 |
| Unlearning That Lasts: Utility-Preserving, Robust, and Almost Irreversible Forgetting in LLMs Francesco Croce, Matthias Hein, Maximilian M眉ller, Naman Deep Singh Published: 2025-09-02Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2025-09-02 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E5 / R3 (95%) | 4 |