Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 1-30 of 77 papers (page 1 of 3)路 569 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| NAAMSE: Framework for Evolutionary Security Evaluation of Agents Harshil Patel, Kunal Pai, Parth Shah Published: 2026-02-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2026-02-07 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R3 (93%) | - |
| AJAR: Adaptive Jailbreak Architecture for Red-teaming Wang Yang, Yipu Dou Published: 2026-01-16Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, tool | 2026-01-16 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E6 / R4 (97%) | - |
| MiniScope: A Least Privilege Framework for Authorizing Tool Calling Agents Gil Vernik, Jinhao Zhu, Kevin Tseng, Raluca Ada Popa Published: 2025-12-11Area: Agent SafetyCitations: 3 Tags: agent-safety, ai-safety, tool | 2025-12-11 | Agent Safety | agent-safety, ai-safety, tool | E4 / R3 (96%) | 3 |
| BlockCert: Certified Blockwise Extraction of Transformer Mechanisms Sandro Andric Published: 2025-11-20Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, tool | 2025-11-20 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (99%) | - |
| nnterp: A Standardized Interface for Mechanistic Interpretability of Transformers Cl茅ment Dumas Published: 2025-11-18Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2025-11-18 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | 1 |
| Visual Exploration of Feature Relationships in Sparse Autoencoders with Curated Concepts Bei Wang, Kowshik Thopalli, Shusen Liu, Xinyuan Yan Published: 2025-11-08Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, tool | 2025-11-08 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E6 / R3 (96%) | - |
| AdversariaLLM: A Unified and Modular Toolbox for LLM Robustness Research Jakob Steimle, Jonas Dornbusch, Leo Schwinn, Moritz Ladenburger Published: 2025-11-06Area: Adversarial RobustnessCitations: 1 Tags: adversarial-robustness, ai-safety, tool | 2025-11-06 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (96%) | 1 |
| Qwen3Guard Technical Report An Yang, Baosong Yang, Bowen Yu, Chen Cheng Published: 2025-10-16Area: Adversarial RobustnessCitations: 37 Tags: adversarial-robustness, ai-safety, tool | 2025-10-16 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (99%) | 37 |
| WeightLens and CircuitLens: Circuit Insights Towards Interpretability Beyond Activations Aakriti Jain, Ammar Ibrahim, Bruno Puri, Elena Golimblevskaia Published: 2025-10-16Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, tool | 2025-10-16 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (94%) | - |
| BlackIce: A Containerized Red Teaming Toolkit for AI Security Testing Alexander Warnecke, Caelin Kaplan, Neil Archibald Published: 2025-10-13Area: Safety EvaluationCitations: - Tags: ai-safety, red-teaming, safety-evaluation, tool | 2025-10-13 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, tool | E7 / R4 (98%) | - |
| ConceptViz: A Visual Analytics Approach for Exploring Concepts in Large Language Models Chenxiao Li, Haoxuan Li, Minfeng Zhu, Qiqi Jiang Published: 2025-09-20Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, tool | 2025-09-20 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (97%) | - |
| NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models Bowen Shi, Chuhan Zhang, Dazhen Deng, Shouling Ji Published: 2025-09-04Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, tool | 2025-09-04 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (95%) | - |
| STREAM (ChemBio): A Standard for Transparently Reporting Evaluations in AI Model Reports Chris Painter, Jide Alaga, Luca Righetti, Rishi Bommasani Published: 2025-08-13Area: Safety EvaluationCitations: 5 Tags: ai-safety, safety-evaluation, tool | 2025-08-13 | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R3 (94%) | 5 |
| Jinx: Unlimited LLMs for Probing Alignment Failures Jiahao Zhao, Liwei Dong Published: 2025-08-11Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, safety-evaluation, tool | 2025-08-11 | Safety Evaluation | ai-safety, alignment-training, safety-evaluation, tool | E6 / R4 (96%) | - |
| BlueGlass: A Framework for Composite AI Safety Harshal Nandigramwar, Kay-Ulrich Scholl, Syed Qutub Published: 2025-07-14Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, tool | 2025-07-14 | Safety Evaluation | ai-safety, safety-evaluation, tool | E5 / R3 (95%) | - |
| TRACE: Training and Inference-Time Interpretability Analysis for Language Models Andr茅 Freitas, Danilo S. Carvalho, Nura Aljaafari Published: 2025-07-04Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2025-07-04 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | 1 |
| Attestable Audits: Verifiable AI Safety Benchmarks Using Trusted Execution Environments Alastair R. Beresford, Bill Marino, Christoph Schnabl, Daniel Hugenroth Published: 2025-06-30Area: Safety EvaluationCitations: 4 Tags: ai-safety, safety-evaluation, tool | 2025-06-30 | Safety Evaluation | ai-safety, safety-evaluation, tool | E5 / R3 (97%) | 4 |
| Know-MRI: A Knowledge Mechanisms Revealer&Interpreter for Large Language Models Boxuan Xing, Chenhao Yuan, Chenxiang Zhang, Chuhan Lang Published: 2025-06-10Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, tool | 2025-06-10 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (93%) | - |
| SGM: A Framework for Building Specification-Guided Moderation Filters Enes Altinisik, Husrev Taha Sencar, Masoomali Fatehkia Published: 2025-05-26Area: Adversarial RobustnessCitations: 2 Tags: adversarial-robustness, ai-safety, tool | 2025-05-26 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E4 / R3 (95%) | 2 |
| LlamaFirewall: An Open Source Guardrail System for Building Secure AI Agents Abraham Montilla, Alekhya Gampa, Beto de Paola, Cyrus Nikolaidis Published: 2025-05-06Area: Adversarial RobustnessCitations: 41 Tags: adversarial-robustness, ai-safety, alignment-training, tool | 2025-05-06 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, tool | E5 / R4 (98%) | 41 |
| Dialz: A Python Toolkit for Steering Vectors Liam D. Turner, Luis Espinosa-Anke, Zara Siddique Published: 2025-05-04Area: Model EditingCitations: 2 Tags: ai-safety, model-editing, tool | 2025-05-04 | Model Editing | ai-safety, model-editing, tool | E5 / R4 (96%) | 2 |
| OET: Optimization-based prompt injection Evaluation Toolkit Chaowei Xiao, Jinsheng Pan, Xiaogeng Liu Published: 2025-05-01Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2025-05-01 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, tool | E6 / R3 (95%) | - |
| Prisma: An Open Source Toolkit for Mechanistic Interpretability in Vision and Video Blake Aaron Richards, Danilo Bzdok, Edward Stevinson, Lee Sharkey Published: 2025-04-28Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2025-04-28 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (98%) | 11 |
| aiXamine: Simplified LLM Safety and Security Dorde Popovic, Euisuh Jeong, Fatih Deniz, Issa Khalil Published: 2025-04-21Area: Safety EvaluationCitations: 2 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2025-04-21 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R3 (98%) | 2 |
| EasyEdit2: An Easy-to-use Steering Framework for Editing Large Language Models Guozhou Zheng, Haoming Xu, Huajun Chen, Kewei Xu Published: 2025-04-21Area: Model EditingCitations: 7 Tags: ai-safety, model-editing, tool | 2025-04-21 | Model Editing | ai-safety, model-editing, tool | E6 / R5 (96%) | 7 |
| DoomArena: A framework for Testing AI Agents Against Evolving Security Threats Abhay Puri, Alexandre Drouin, Alexandre Lacoste, Avinandan Bose Published: 2025-04-18Area: Agent SafetyCitations: 19 Tags: agent-safety, ai-safety, safety-evaluation, tool | 2025-04-18 | Agent Safety | agent-safety, ai-safety, safety-evaluation, tool | E6 / R4 (97%) | 19 |
| AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration Andy Zhou, Bo Li, Francesco Pinto, James Zou Published: 2025-03-20Area: Safety EvaluationCitations: 17 Tags: ai-safety, red-teaming, safety-evaluation, tool | 2025-03-20 | Safety Evaluation | ai-safety, red-teaming, safety-evaluation, tool | E5 / R3 (96%) | 17 |
| AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement Chengwei Pan, Hao Li, Hao Wang, Hongning Wang Published: 2025-02-24Area: Safety EvaluationCitations: 10 Tags: ai-safety, safety-evaluation, tool | 2025-02-24 | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R3 (96%) | 10 |
| ASTRAL: Automated Safety Testing of Large Language Models Aitor Arrieta, Jose Antonio Parejo, Miriam Ugarte, Pablo Valle Published: 2025-01-28Area: Safety EvaluationCitations: 5 Tags: ai-safety, safety-evaluation, tool | 2025-01-28 | Safety Evaluation | ai-safety, safety-evaluation, tool | E6 / R3 (96%) | 5 |
| Contextual Agent Security: A Policy for Every Purpose Eugene Bagdasarian, Lillian Tsai Published: 2025-01-28Area: Agent SafetyCitations: 14 Tags: agent-safety, ai-safety, tool | 2025-01-28 | Agent Safety | agent-safety, ai-safety, tool | E5 / R3 (95%) | 14 |