Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning Ang Li, Mingjie Li, Yichuan Mo, Yifei Wang Published: 2025-02-13Area: Safety EvaluationCitations: 15 Tags: ai-safety, empirical, safety-evaluation | 2025-02-13 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 15 |
| IHEval: Evaluating Language Models on Following the Instruction Hierarchy Bing Yin, Haodong Wang, Haoming Jiang, Meng Jiang Published: 2025-02-12Area: Safety EvaluationCitations: 21 Tags: ai-safety, benchmark, safety-evaluation | 2025-02-12 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 21 |
| A Survey of Theory of Mind in Large Language Models: Evaluations, Representations, and Safety Risks Hieu Minh Nguyen Published: 2025-02-10Area: Surveys & ReviewsCitations: 5 Tags: ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | 2025-02-10 | Surveys & Reviews | ai-safety, alignment-training, safety-evaluation, survey, surveys-reviews | E5 / R3 (92%) | 5 |
| Assessing confidence in frontier AI safety cases Alejandro Tlaie, Joshua Krook, Philip Fox, Simon Mylius Published: 2025-02-09Area: Safety EvaluationCitations: 4 Tags: ai-safety, safety-evaluation, theoretical | 2025-02-09 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (94%) | 4 |
| Can LLMs Rank the Harmfulness of Smaller LLMs? We are Not There Yet Berk Atil, Rebecca J. Passonneau, Sarkar Snigdha Sarathi Das, Vipul Gupta Published: 2025-02-07Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-02-07 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E7 / R3 (95%) | - |
| ELITE: Enhanced Language-Image Toxicity Evaluation for Safety Ashkan Yousefpour, Bumsub Ham, Doehyeon Lee, Eugene Choi Published: 2025-02-07Area: Multimodal SafetyCitations: 5 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-02-07 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (95%) | 5 |
| A Survey on Backdoor Threats in Large Language Models (LLMs): Attacks, Defenses, and Evaluation Methods Qingchuan Zhao, Tao Ni, Wei-Bin Lee, Yihe Zhou Published: 2025-02-06Area: Adversarial RobustnessCitations: 24 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-02-06 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, survey | E5 / R3 (95%) | 24 |
| A Unified Understanding and Evaluation of Steering Methods Shawn Im, Yixuan Li Published: 2025-02-04Area: Representation AnalysisCitations: 24 Tags: ai-safety, empirical, representation-analysis, safety-evaluation | 2025-02-04 | Representation Analysis | ai-safety, empirical, representation-analysis, safety-evaluation | E5 / R3 (96%) | 24 |
| The Elicitation Game: Evaluating Capability Elicitation Techniques Felix Hofst盲tter, Francis Rhys Ward, Henning Bartsch, Jayden Teoh Published: 2025-02-04Area: Safety EvaluationCitations: 9 Tags: ai-safety, empirical, safety-evaluation | 2025-02-04 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E8 / R3 (93%) | 9 |
| Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities Aidan Ewart, Anirudh Satheesh, Bilal Chughtai, Domenic Rosati Published: 2025-02-03Area: Safety EvaluationCitations: 32 Tags: ai-safety, empirical, safety-evaluation | 2025-02-03 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 32 |
| o3-mini vs DeepSeek-R1: Which One is Safer? Aitor Arrieta, Jos茅 Antonio Parejo, Miriam Ugarte, Pablo Valle Published: 2025-01-30Area: Safety EvaluationCitations: 31 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-01-30 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 31 |
| Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation Aitor Arrieta, Jos茅 Antonio Parejo, Miriam Ugarte, Pablo Valle Published: 2025-01-29Area: Safety EvaluationCitations: 14 Tags: ai-safety, empirical, safety-evaluation | 2025-01-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 14 |
| A Sketch of an AI Control Safety Case Benjamin Hilton, Buck Shlegeris, Geoffrey Irving, Joshua Clymer Published: 2025-01-28Area: Agent SafetyCitations: 22 Tags: agent-safety, ai-safety, position, safety-evaluation | 2025-01-28 | Agent Safety | agent-safety, ai-safety, position, safety-evaluation | E6 / R4 (93%) | 22 |
| ASTRAL: Automated Safety Testing of Large Language Models Aitor Arrieta, Jose Antonio Parejo, Miriam Ugarte, Pablo Valle Published: 2025-01-28Area: Safety EvaluationCitations: 5 Tags: ai-safety, safety-evaluation, tool | 2025-01-28 | Safety Evaluation | ai-safety, safety-evaluation, tool | E6 / R3 (96%) | 5 |
| CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models Guangzhi Sun, Jose Such, Philip C. Woodland, Shutong Feng Published: 2025-01-24Area: Safety EvaluationCitations: 12 Tags: ai-safety, benchmark, safety-evaluation | 2025-01-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 12 |
| OpenAI's Approach to External Red Teaming for AI Models and Systems Lama Ahmad, Michael Lampe, Pamela Mishkin, Sandhini Agarwal Published: 2025-01-24Area: Safety EvaluationCitations: 33 Tags: ai-safety, position, red-teaming, safety-evaluation | 2025-01-24 | Safety Evaluation | ai-safety, position, red-teaming, safety-evaluation | E6 / R4 (97%) | 33 |
| Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models Chao Shen, Erjia Xiao, Hao Cheng, Jindong Gu Published: 2025-01-23Area: Multimodal SafetyCitations: 8 Tags: adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-01-23 | Multimodal Safety | adversarial-robustness, ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 8 |
| Lessons From Red Teaming 100 Generative AI Products Amanda Minnich, Blake Bullwinkel, Bolor-Erdene Jagdagdorj, Chang Kawaguchi Published: 2025-01-13Area: Safety EvaluationCitations: 20 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-01-13 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (97%) | 20 |
| Rethinking Evaluation of Sparse Autoencoders through the Representation of Polysemous Words Gouki Minegishi, Hiroki Furuta, Yusuke Iwasawa, Yutaka Matsuo Published: 2025-01-09Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-01-09 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (94%) | 10 |
| CALM: Curiosity-Driven Auditing for Large Language Models Chao Shen, Cong Wang, Longxiang Wang, Xiang Zheng Published: 2025-01-06Area: Safety EvaluationCitations: 6 Tags: ai-safety, empirical, safety-evaluation | 2025-01-06 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 6 |
| Diverse and Effective Red Teaming with Auto-generated Rewards and Multi-step Reinforcement Learning Alex Beutel, Johannes Heidecke, Kai Xiao, Lilian Weng Published: 2024-12-24Area: Safety EvaluationCitations: 22 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2024-12-24 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (95%) | 22 |
| Libra-Leaderboard: Towards Responsible AI through a Balanced Leaderboard of Safety and Capability Artem Shelmanov, Bingchen Zhao, Cong Zeng, Donghai Hong Published: 2024-12-24Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2024-12-24 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 4 |
| Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs Alexander von Recum, Christoph Schnabl, Gabor Hollbeck, Marvin von Hagen Published: 2024-12-22Area: Safety EvaluationCitations: 5 Tags: ai-safety, empirical, safety-evaluation | 2024-12-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 5 |
| OpenAI o1 System Card Aaron Jaech, Adam Kalai, Adam Lerer, Ahmed El-Kishky Published: 2024-12-21Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | 2024-12-21 | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | - |
| LLMs Lost in Translation: M-ALERT uncovers Cross-Linguistic Safety Inconsistencies Bo Li, Felix Friedrich, Huu Nguyen, Kristian Kersting Published: 2024-12-19Area: Safety EvaluationCitations: 2 Tags: ai-safety, benchmark, safety-evaluation | 2024-12-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E4 / R3 (95%) | 2 |
| Quantifying detection rates for dangerous capabilities: a theoretical model of dangerous capability evaluations Alessandro Di Stefano, Paolo Bova, The Anh Han Published: 2024-12-19Area: Safety EvaluationCitations: 3 Tags: ai-safety, safety-evaluation, theoretical | 2024-12-19 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (94%) | 3 |
| Clio: Privacy-Preserving Insights into Real-World AI Use Alex Tamkin, Alfred Mountfield, Ankur Rathi, Brian Clarke Published: 2024-12-18Area: Safety EvaluationCitations: 62 Tags: ai-safety, safety-evaluation, tool | 2024-12-18 | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R3 (97%) | 62 |
| Subversion Strategy Eval: Can language models statelessly strategize to subvert control protocols? Alessandro Abate, Alex Mallen, Buck Shlegeris, Charlie Griffin Published: 2024-12-17Area: Safety EvaluationCitations: 9 Tags: ai-safety, empirical, safety-evaluation | 2024-12-17 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (96%) | 9 |
| Underestimated Privacy Risks for Minority Populations in Large Language Model Unlearning Bo Li, Eleonora Krea膷i膰, Eli Chien, Mohsen Ghassemi Published: 2024-12-11Area: Model EditingCitations: 4 Tags: ai-safety, empirical, model-editing, safety-evaluation | 2024-12-11 | Model Editing | ai-safety, empirical, model-editing, safety-evaluation | E6 / R3 (97%) | 4 |
| Knowledge Graph Guided Evaluation of Abstention Techniques Danish Pruthi, Kinshuk Vasisht, Navreet Kaur Published: 2024-12-10Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2024-12-10 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (96%) | 1 |