Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Beyond Single-Value Metrics: Evaluating and Enhancing LLM Unlearning with Cognitive Diagnosis Haomin Zhuang, Kehan Guo, Tianyu Yang, Xiangliang Zhang Published: 2025-02-19Area: Model EditingCitations: 3 Tags: ai-safety, benchmark, model-editing | 2025-02-19 | Model Editing | ai-safety, benchmark, model-editing | E6 / R4 (96%) | 3 |
| OCCULT: Evaluating Large Language Models for Offensive Cyber Operation Capabilities Alex Byrne, Dan Martin, Ethan Michalak, Gianpaolo Russo Published: 2025-02-18Area: Safety EvaluationCitations: 15 Tags: ai-safety, benchmark, safety-evaluation | 2025-02-18 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (97%) | 15 |
| SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities Bill Yuchen Lin, Bo Li, Fengqing Jiang, Luyao Niu Published: 2025-02-17Area: Safety EvaluationCitations: 88 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-17 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 88 |
| Evaluating the Paperclip Maximizer: Are RL-Based Language Models More Likely to Pursue Instrumental Goals? Bryan Hooi, Jiaying Wu, Yuan Sui, Yuexin Li Published: 2025-02-16Area: Deception & FailureCitations: 22 Tags: ai-safety, benchmark, deception-failure | 2025-02-16 | Deception & Failure | ai-safety, benchmark, deception-failure | E5 / R2 (94%) | 22 |
| SafeDialBench: A Fine-Grained Safety Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks Boyan Wang, Chao Deng, Fan Feng, Fanyu Meng Published: 2025-02-16Area: Safety EvaluationCitations: 18 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-16 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R4 (98%) | 18 |
| Safety Evaluation of DeepSeek Models in Chinese Contexts Chaoyang Ma, Jiaojiao Zhao, Kai Wang, Minjie Hua Published: 2025-02-16Area: Safety EvaluationCitations: 11 Tags: ai-safety, benchmark, safety-evaluation | 2025-02-16 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 11 |
| The Mirage of Model Editing: Revisiting Evaluation in the Wild Dawei Yin, Fei Sun, Huawei Shen, Jiajun Tan Published: 2025-02-16Area: Model EditingCitations: 16 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-02-16 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (94%) | 16 |
| IHEval: Evaluating Language Models on Following the Instruction Hierarchy Bing Yin, Haodong Wang, Haoming Jiang, Meng Jiang Published: 2025-02-12Area: Safety EvaluationCitations: 21 Tags: ai-safety, benchmark, safety-evaluation | 2025-02-12 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 21 |
| Beautiful Images, Toxic Words: Understanding and Addressing Offensive Text in Generated Images Adam Dziedzic, Aditya Kumar, Franziska Boenisch, Tom Blanchard Published: 2025-02-07Area: Multimodal SafetyCitations: - Tags: ai-safety, benchmark, multimodal-safety | 2025-02-07 | Multimodal Safety | ai-safety, benchmark, multimodal-safety | E5 / R3 (94%) | - |
| ELITE: Enhanced Language-Image Toxicity Evaluation for Safety Ashkan Yousefpour, Bumsub Ham, Doehyeon Lee, Eugene Choi Published: 2025-02-07Area: Multimodal SafetyCitations: 5 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-02-07 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 5 |
| AxBench: Steering LLMs? Even Simple Baselines Outperform Sparse Autoencoders Aryaman Arora, Atticus Geiger, Christopher D. Manning, Christopher Potts Published: 2025-01-28Area: Representation AnalysisCitations: 123 Tags: ai-safety, benchmark, representation-analysis | 2025-01-28 | Representation Analysis | ai-safety, benchmark, representation-analysis | E5 / R3 (96%) | 123 |
| CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models Guangzhi Sun, Jose Such, Philip C. Woodland, Shutong Feng Published: 2025-01-24Area: Safety EvaluationCitations: 12 Tags: ai-safety, benchmark, safety-evaluation | 2025-01-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 12 |
| Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models Chao Shen, Erjia Xiao, Hao Cheng, Jindong Gu Published: 2025-01-23Area: Multimodal SafetyCitations: 8 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-01-23 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 8 |
| Libra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and Capability Artem Shelmanov, Bingchen Zhao, Cong Zeng, Donghai Hong Published: 2024-12-24Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2024-12-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 4 |
| Agent-SafetyBench: Evaluating the Safety of LLM Agents Hongning Wang, Jingzhuo Zhou, Junxiao Yang, Minlie Huang Published: 2024-12-19Area: Agent SafetyCitations: 107 Tags: agent-safety, ai-safety, benchmark | 2024-12-19 | Agent Safety | agent-safety, ai-safety, benchmark | E4 / R2 (96%) | 107 |
| LLMs Lost in Translation: M-ALERT uncovers Cross-Linguistic Safety Inconsistencies Bo Li, Felix Friedrich, Huu Nguyen, Kristian Kersting Published: 2024-12-19Area: Safety EvaluationCitations: 2 Tags: ai-safety, benchmark, safety-evaluation | 2024-12-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 2 |
| Knowledge Graph Guided Evaluation of Abstention Techniques Danish Pruthi, Kinshuk Vasisht, Navreet Kaur Published: 2024-12-10Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2024-12-10 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |
| Evaluating Sparse Autoencoders on Targeted Concept Erasure Tasks Adam Karvonen, Can Rager, Neel Nanda, Samuel Marks Published: 2024-11-28Area: Mechanistic Interp.Citations: 9 Tags: ai-safety, benchmark, mechanistic-interp, safety-evaluation | 2024-11-28 | Mechanistic Interp. | ai-safety, benchmark, mechanistic-interp, safety-evaluation | E5 / R3 (96%) | 9 |
| ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain Arman Cohan, Di Jin, Haochen Zhao, Mark Gerstein Published: 2024-11-23Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2024-11-23 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (94%) | 6 |
| RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts Aron Lajko, Ben West, Brian Goodrich, Elena Ericheva Published: 2024-11-22Area: Safety EvaluationCitations: 68 Tags: ai-safety, benchmark, safety-evaluation | 2024-11-22 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 68 |
| RedCode: Risky Code Execution and Generation Benchmark for Code Agents Andy Zhou, Bo Li, Chengquan Guo, Chulin Xie Published: 2024-11-12Area: Safety EvaluationCitations: 59 Tags: ai-safety, benchmark, safety-evaluation | 2024-11-12 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (98%) | 59 |
| Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset Bo Li, Chaowei Xiao, Fei Wang, Furong Huang Published: 2024-11-05Area: Model EditingCitations: 14 Tags: ai-safety, alignment-training, benchmark, model-editing | 2024-11-05 | Model Editing | ai-safety, alignment-training, benchmark, model-editing | E6 / R3 (97%) | 14 |
| Defining and Evaluating Physical Safety for Large Language Models Pin-Yu Chen, Tsung-Yi Ho, Yung-Chen Tang Published: 2024-11-04Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2024-11-04 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 4 |
| Desert Camels and Oil Sheikhs: Arab-Centric Red Teaming of Frontier LLMs Elgizouli Mohamed, Muhammad Abdul-Mageed, Muhammed Saeed, Mukhtar Mohamed Published: 2024-10-31Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-10-31 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E6 / R3 (95%) | - |
| RESTOR: Knowledge Recovery through Machine Unlearning Abhilasha Ravichander, Faeze Brahman, Keivan Rezaei, Khyathi Chandu Published: 2024-10-31Area: Model EditingCitations: 2 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2024-10-31 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E6 / R3 (95%) | 2 |
| CFSafety: Comprehensive Fine-grained Safety Assessment for LLMs Chenhui Hu, Zhihao Liu Published: 2024-10-29Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |
| Protecting Privacy in Multimodal Large Language Models with MLLMU-Bench Guangyao Dou, Meng Jiang, Mengzhao Jia, Qingkai Zeng Published: 2024-10-29Area: Model EditingCitations: 38 Tags: ai-safety, benchmark, model-editing | 2024-10-29 | Model Editing | ai-safety, benchmark, model-editing | E5 / R3 (95%) | 38 |
| SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt Types Shikun Zhang, Wei Ye, Yutao Mou Published: 2024-10-29Area: Safety EvaluationCitations: 48 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-29 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 48 |
| Sabotage Evaluations for Frontier Models Buck Shlegeris, Cem Anil, David Duvenaud, Deep Ganguli Published: 2024-10-28Area: Safety EvaluationCitations: 29 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-28 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 29 |
| ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models Bing Wang, Bingyi Jing, Guanhua Chen, Haifeng Bai Published: 2024-10-24Area: Safety EvaluationCitations: 6 Tags: ai-safety, benchmark, safety-evaluation | 2024-10-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R2 (98%) | 6 |