Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models Guangzhi Sun, Jose Such, Philip C. Woodland, Shutong Feng Published: 2025-01-24Area: Safety EvaluationCitations: 12 Tags: ai-safety, benchmark, safety-evaluation | 2025-01-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 12 |
| OpenAI's Approach to External Red Teaming for AI Models and Systems Lama Ahmad, Michael Lampe, Pamela Mishkin, Sandhini Agarwal Published: 2025-01-24Area: Safety EvaluationCitations: 33 Tags: ai-safety, position, red-teaming, safety-evaluation | 2025-01-24 | Safety Evaluation | ai-safety, position, red-teaming, safety-evaluation | E6 / R4 (97%) | 33 |
| A Sketch of an AI Control Safety Case Benjamin Hilton, Buck Shlegeris, Geoffrey Irving, Joshua Clymer Published: 2025-01-28Area: Agent SafetyCitations: 22 Tags: agent-safety, ai-safety, position, safety-evaluation | 2025-01-28 | Agent Safety | agent-safety, ai-safety, position, safety-evaluation | E6 / R4 (93%) | 22 |
| ASTRAL: Automated Safety Testing of Large Language Models Aitor Arrieta, Jose Antonio Parejo, Miriam Ugarte, Pablo Valle Published: 2025-01-28Area: Safety EvaluationCitations: 5 Tags: ai-safety, safety-evaluation, tool | 2025-01-28 | Safety Evaluation | ai-safety, safety-evaluation, tool | E6 / R3 (96%) | 5 |
| Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation Aitor Arrieta, Jos茅 Antonio Parejo, Miriam Ugarte, Pablo Valle Published: 2025-01-29Area: Safety EvaluationCitations: 14 Tags: ai-safety, empirical, safety-evaluation | 2025-01-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 14 |
| o3-mini vs DeepSeek-R1: Which One is Safer? Aitor Arrieta, Jos茅 Antonio Parejo, Miriam Ugarte, Pablo Valle Published: 2025-01-30Area: Safety EvaluationCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-01-30 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 31 |
| Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities Aidan Ewart, Anirudh Satheesh, Bilal Chughtai, Domenic Rosati Published: 2025-02-03Area: Safety EvaluationCitations: 32 Tags: ai-safety, empirical, safety-evaluation | 2025-02-03 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 32 |
| A Unified Understanding and Evaluation of Steering Methods Shawn Im, Yixuan Li Published: 2025-02-04Area: Representation AnalysisCitations: 24 Tags: ai-safety, empirical, representation-analysis, safety-evaluation | 2025-02-04 | Representation Analysis | ai-safety, empirical, representation-analysis, safety-evaluation | E5 / R3 (96%) | 24 |
| The Elicitation Game: Evaluating Capability Elicitation Techniques Felix Hofst盲tter, Francis Rhys Ward, Henning Bartsch, Jayden Teoh Published: 2025-02-04Area: Safety EvaluationCitations: 9 Tags: ai-safety, empirical, safety-evaluation | 2025-02-04 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E8 / R3 (93%) | 9 |
| A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluation Methods Qingchuan Zhao, Tao Ni, Wei-Bin Lee, Yihe Zhou Published: 2025-02-06Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, survey | E5 / R3 (95%) | 24 |
| Can LLMs Rank the Harmfulness of Smaller LLMs? We are Not There Yet Berk Atil, Rebecca J. Passonneau, Sarkar Snigdha Sarathi Das, Vipul Gupta Published: 2025-02-07Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-02-07 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R3 (95%) | - |
| ELITE: Enhanced Language-Image Toxicity Evaluation for Safety Ashkan Yousefpour, Bumsub Ham, Doehyeon Lee, Eugene Choi Published: 2025-02-07Area: Multimodal SafetyCitations: 5 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-02-07 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 5 |
| Assessing confidence in frontier AI safety cases Alejandro Tlaie, Joshua Krook, Philip Fox, Simon Mylius Published: 2025-02-09Area: Safety EvaluationCitations: 4 Tags: ai-safety, safety-evaluation, theoretical | 2025-02-09 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (94%) | 4 |
| A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks Hieu Minh Nguyen Published: 2025-02-10Area: Surveys & ReviewsCitations: 5 Tags: ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | 2025-02-10 | Surveys & Reviews | ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | E5 / R3 (92%) | 5 |
| IHEval: Evaluating Language Models on Following the Instruction Hierarchy Bing Yin, Haodong Wang, Haoming Jiang, Meng Jiang Published: 2025-02-12Area: Safety EvaluationCitations: 21 Tags: ai-safety, benchmark, safety-evaluation | 2025-02-12 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 21 |
| Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning Ang Li, Mingjie Li, Yichuan Mo, Yifei Wang Published: 2025-02-13Area: Safety EvaluationCitations: 15 Tags: ai-safety, empirical, safety-evaluation | 2025-02-13 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 15 |
| A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations Bo Du, Dacheng Tao, Mang Ye, Nenghai Yu Published: 2025-02-14Area: Multimodal SafetyCitations: 47 Tags: ai-safety, multimodal-safety, safety-evaluation, survey | 2025-02-14 | Multimodal Safety | ai-safety, multimodal-safety, safety-evaluation, survey | E5 / R3 (95%) | 47 |
| Fast Proxies for LLM Robustness Evaluation Jan Schuchardt, Leo Schwinn, Stephan G眉nnemann, Tim Beyer Published: 2025-02-14Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-02-14 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| SafeDialBench: A Fine-Grained Safety Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks Boyan Wang, Chao Deng, Fan Feng, Fanyu Meng Published: 2025-02-16Area: Safety EvaluationCitations: 18 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-16 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R4 (98%) | 18 |
| Safety Evaluation of DeepSeek Models in Chinese Contexts Chaoyang Ma, Jiaojiao Zhao, Kai Wang, Minjie Hua Published: 2025-02-16Area: Safety EvaluationCitations: 11 Tags: ai-safety, benchmark, safety-evaluation | 2025-02-16 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 11 |
| The Mirage of Model Editing: Revisiting Evaluation in the Wild Dawei Yin, Fei Sun, Huawei Shen, Jiajun Tan Published: 2025-02-16Area: Model EditingCitations: 16 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-02-16 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (94%) | 16 |
| SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities Bill Yuchen Lin, Bo Li, Fengqing Jiang, Luyao Niu Published: 2025-02-17Area: Safety EvaluationCitations: 88 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-17 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 88 |
| Language Models Can Predict Their Own Behavior Dhananjay Ashok, Jonathan May Published: 2025-02-18Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2025-02-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 5 |
| OCCULT: Evaluating Large Language Models for Offensive Cyber Operation Capabilities Alex Byrne, Dan Martin, Ethan Michalak, Gianpaolo Russo Published: 2025-02-18Area: Safety EvaluationCitations: 15 Tags: ai-safety, benchmark, safety-evaluation | 2025-02-18 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (97%) | 15 |
| Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking Dawei Yin, Junda Zhu, Lei Sha, Lingyong Yan Published: 2025-02-18Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-02-18 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 27 |
| The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1 Chengzhi Liu, Dawn Song, Gaowen Liu, Jayanth Srinivasa Published: 2025-02-18Area: Safety EvaluationCitations: 80 Tags: ai-safety, empirical, safety-evaluation | 2025-02-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 80 |
| LUME: LLM Unlearning with Multitask Evaluations Anil Ramakrishna, Bhanukiran Vinzamuri, Kai-Wei Chang, Mingyi Hong Published: 2025-02-20Area: Model EditingCitations: 25 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-02-20 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R3 (95%) | 25 |
| Soft Token Attacks Cannot Reliably Audit Unlearning in Large Language Models Haokun Chen, Nageen Himayat, Sebastian Szyller, Weilin Xu Published: 2025-02-20Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-02-20 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (95%) | 1 |
| Adversarial Prompt Evaluation: Systematic Benchmarking of Guardrails Against Prompt Input Attacks on LLMs Ambrish Rawat, Beat Buesser, Giandomenico Cornacchia, Giulio Zizzo Published: 2025-02-21Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-02-21 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E7 / R3 (97%) | 12 |
| A Comprehensive Survey of Machine Unlearning Techniques for Large Language Models Fakhri Karray, Hans-Arno Jacobsen, Herbert Woisetschl盲ger, Jiahui Geng Published: 2025-02-22Area: Model EditingCitations: 23 Tags: ai-safety, model-editing, safety-evaluation, survey | 2025-02-22 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E6 / R4 (97%) | 23 |