Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-22 of 22 papers (page 1 of 1)路 68 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models Chris Ngo, Quy-Anh Dang, Truong-Son Hy Published: 2026-01-07Area: Safety EvaluationCitations: - Tags: ai-safety, dataset, red-teaming, safety-evaluation | 2026-01-07 | Safety Evaluation | ai-safety, dataset, red-teaming, safety-evaluation | E5 / R4 (95%) | - |
| AssurAI: Experience with Constructing Korean Socio-cultural Datasets to Discover Potential Risks of Generative AI Chae-Gyun Lim, Dasom Choi, Donggyu Yoon, Dongkun Lee Published: 2025-11-20Area: Safety EvaluationCitations: - Tags: ai-safety, dataset, safety-evaluation | 2025-11-20 | Safety Evaluation | ai-safety, dataset, safety-evaluation | E5 / R4 (98%) | - |
| Annotating the Chain-of-Thought: A Behavior-Labeled Dataset for AI Safety Antonio-Gabriel Chac贸n Menke, Eiji Kamioka, Phan Xuan Tan Published: 2025-10-20Area: Safety EvaluationCitations: - Tags: ai-safety, dataset, safety-evaluation | 2025-10-20 | Safety Evaluation | ai-safety, dataset, safety-evaluation | E5 / R3 (95%) | - |
| Falcon: A Cross-Modal Evaluation Dataset for Comprehensive Safety Perception Guisong Liu, Minrui Jiang, Pei Ke, Qi Xue Published: 2025-09-28Area: Multimodal SafetyCitations: - Tags: ai-safety, dataset, multimodal-safety, safety-evaluation | 2025-09-28 | Multimodal Safety | ai-safety, dataset, multimodal-safety, safety-evaluation | E5 / R3 (96%) | - |
| UnsafeChain: Enhancing Reasoning Model Safety via Hard Cases Preslav Nakov, Raj Vardhan Tomar, Yuxia Wang Published: 2025-07-29Area: Alignment TrainingCitations: 4 Tags: ai-safety, alignment-training, dataset | 2025-07-29 | Alignment Training | ai-safety, alignment-training, dataset | E7 / R4 (95%) | 4 |
| WebGuard: Building a Generalizable Guardrail for Web Agents Boyuan Zheng, Dawn Song, Huan Sun, Michael Lin Published: 2025-07-18Area: Agent SafetyCitations: 7 Tags: agent-safety, ai-safety, dataset | 2025-07-18 | Agent Safety | agent-safety, ai-safety, dataset | E4 / R3 (95%) | 7 |
| FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning Chandan K. Reddy, Fanyou Wu, Weijie Xu, Zhehao Zhang Published: 2025-05-12Area: Safety EvaluationCitations: 13 Tags: ai-safety, dataset, safety-evaluation | 2025-05-12 | Safety Evaluation | ai-safety, dataset, safety-evaluation | E5 / R3 (95%) | 13 |
| STAR-1: Safer Alignment of Reasoning LLMs with 1K Data Bhavya Kailkhura, Brian R. Bartoldson, Cihang Xie, Haoqin Tu Published: 2025-04-02Area: Alignment TrainingCitations: 41 Tags: ai-safety, alignment-training, dataset | 2025-04-02 | Alignment Training | ai-safety, alignment-training, dataset | E5 / R3 (95%) | 41 |
| FindTheFlaws: Annotated Errors for Detecting Flawed Reasoning and Scalable Oversight Research Chatrik Singh Mangat, Gabriel Recchia, Gayatri Krishnakumar, Issac Li Published: 2025-03-29Area: Scalable OversightCitations: - Tags: ai-safety, dataset, scalable-oversight | 2025-03-29 | Scalable Oversight | ai-safety, dataset, scalable-oversight | E6 / R4 (93%) | - |
| TinySQL: A Progressive Text-to-SQL Dataset for Mechanistic Interpretability Research Abir Harrasse, Amir Abdullah, Clement Neo, Dhruv Nathawani Published: 2025-03-17Area: Mechanistic Interp.Citations: 2 Tags: ai-safety, dataset, interpretability, mechanistic-interp | 2025-03-17 | Mechanistic Interp. | ai-safety, dataset, interpretability, mechanistic-interp | E6 / R3 (95%) | 2 |
| PKU-SafeRLHF: A Safety Alignment Preference Dataset for Llama Family Models Boren Zheng, Borong Zhang, Boxuan Li, Boyuan Chen Published: 2024-06-20Area: Alignment TrainingCitations: 127 Tags: ai-safety, alignment-training, dataset | 2024-06-20 | Alignment Training | ai-safety, alignment-training, dataset | E5 / R3 (96%) | 127 |
| SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Models Feng Zhao, Guodong Zheng, Jing Shao, Jinlan Fu Published: 2024-06-17Area: Multimodal SafetyCitations: 68 Tags: ai-safety, alignment-training, dataset, multimodal-safety | 2024-06-17 | Multimodal Safety | ai-safety, alignment-training, dataset, multimodal-safety | E6 / R3 (95%) | 68 |
| Dataset and Lessons Learned from the 2024 SaTML LLM Capture-the-Flag Competition Ahmed Salem, Chenhao Li, Daniel Paleka, Dragos Albastroiu Published: 2024-06-12Area: Adversarial RobustnessCitations: 19 Tags: adversarial-robustness, ai-safety, dataset | 2024-06-12 | Adversarial Robustness | adversarial-robustness, ai-safety, dataset | E5 / R3 (97%) | 19 |
| Hummer: Towards Limited Competitive Preference Dataset Jingqing Ruan, Junwu Xiong, Jun Zhou, Li Jiang Published: 2024-05-19Area: Alignment TrainingCitations: 10 Tags: adversarial-robustness, ai-safety, alignment-training, dataset | 2024-05-19 | Alignment Training | adversarial-robustness, ai-safety, alignment-training, dataset | E6 / R3 (96%) | 10 |
| Tensor Trust: Interpretable Prompt Injection Attacks from an Online Game Alan Ritter, Ethan Mendes, Isaac Ong, Justin Svegliato Published: 2023-11-02Area: Adversarial RobustnessCitations: 108 Tags: adversarial-robustness, ai-safety, dataset | 2023-11-02 | Adversarial Robustness | adversarial-robustness, ai-safety, dataset | E6 / R3 (97%) | 108 |
| Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs Haonan Li, Preslav Nakov, Timothy Baldwin, Xudong Han Published: 2023-08-25Area: Safety EvaluationCitations: 158 Tags: ai-safety, dataset, safety-evaluation | 2023-08-25 | Safety Evaluation | ai-safety, dataset, safety-evaluation | E5 / R3 (95%) | 158 |
| BeaverTails: Towards Improved Safety Alignment of LLM via a Human-Preference Dataset Boyuan Chen, Ce Bian, Chi Zhang, Jiaming Ji Published: 2023-07-10Area: Alignment TrainingCitations: 767 Tags: ai-safety, alignment-training, dataset | 2023-07-10 | Alignment Training | ai-safety, alignment-training, dataset | E5 / R3 (95%) | 767 |
| OpenAssistant Conversations - Democratizing Large Language Model Alignment Abdelpakey Mohamed Hassan, Alexander Mattick, Alexander Rush, Andreas K枚pf Published: 2023-04-14Area: Alignment TrainingCitations: 811 Tags: ai-safety, alignment-training, dataset | 2023-04-14 | Alignment Training | ai-safety, alignment-training, dataset | E5 / R3 (95%) | 811 |
| Natural Adversarial Examples Dan Hendrycks, Dawn Song, Jacob Steinhardt, Kevin Zhao Published: 2019-07-16Area: Adversarial RobustnessCitations: 1794 Tags: adversarial-robustness, ai-safety, dataset | 2019-07-16 | Adversarial Robustness | adversarial-robustness, ai-safety, dataset | E5 / R3 (95%) | 1794 |
| MALT: A Dataset of Natural and Prompted Behaviors That Threaten Eval Integrity Hjalmar Wijk, Neev Parikh Published: -Area: Safety EvaluationCitations: - Tags: ai-safety, dataset, safety-evaluation | - | Safety Evaluation | ai-safety, dataset, safety-evaluation | E4 / R3 (99%) | - |
| Specification Gaming: The Flip Side of AI Ingenuity Jan Leike, Jonathan Uesato, Matthew Rahtz, Ramana Kumar Published: -Area: Deception & FailureCitations: - Tags: ai-safety, dataset, deception-failure | - | Deception & Failure | ai-safety, dataset, deception-failure | E3 / R2 (91%) | - |
| Working Towards Toxic datasets for LLM Safeguarding Liuye Guo, Tieke He, Zhipeng Wang, Ziyuan Wang Published: -Area: Safety EvaluationCitations: - Tags: ai-safety, dataset, safety-evaluation | - | Safety Evaluation | ai-safety, dataset, safety-evaluation | E4 / R2 (93%) | - |