Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 61-77 of 77 papers (page 3 of 3)路 51 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| nnterp: A Standardized Interface for Mechanistic Interpretability of Transformers Cl茅ment Dumas Published: 2025-11-18Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2025-11-18 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | 1 |
| BlockCert: Certified Blockwise Extraction of Transformer Mechanisms Sandro Andric Published: 2025-11-20Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, tool | 2025-11-20 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (99%) | - |
| MiniScope: A Least Privilege Framework for Authorizing Tool Calling Agents Gil Vernik, Jinhao Zhu, Kevin Tseng, Raluca Ada Popa Published: 2025-12-11Area: Agent SafetyCitations: 3 Tags: agent-safety, ai-safety, tool | 2025-12-11 | Agent Safety | agent-safety, ai-safety, tool | E4 / R3 (96%) | 3 |
| AJAR: Adaptive Jailbreak Architecture for Red-teaming Wang Yang, Yipu Dou Published: 2026-01-16Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, tool | 2026-01-16 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E6 / R4 (97%) | - |
| NAAMSE: Framework for Evolutionary Security Evaluation of Agents Harshil Patel, Kunal Pai, Parth Shah Published: 2026-02-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2026-02-07 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R3 (93%) | - |
| AdversaFlow: Visual Red Teaming for Large Language Models with Multi-Level Adversarial Flow Chuhan Zhang, Dazhen Deng, Huawei Zheng, Shouling Ji Published: -Area: Safety EvaluationCitations: 12 Tags: adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | - | Safety Evaluation | adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | E4 / R3 (93%) | 12 |
| Between Generation and Judgment: A Cloud-Native Framework for Adversarial Evaluation of LLM Alignment C. Miers, Diego E. G. Caetano De Oliveira, Marcos A. Simplicio, Victor Takashi Hayashi Published: -Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, safety-evaluation, tool | - | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, safety-evaluation, tool | E5 / R4 (95%) | - |
| CCS-Lib: A Python package to elicit latent knowledge from LLMs Alexander Wan, Alex Mallen, Augustas Macijauskas, Ben W. Published: -Area: Representation AnalysisCitations: - Tags: ai-safety, representation-analysis, tool | - | Representation Analysis | ai-safety, representation-analysis, tool | E5 / R3 (99%) | - |
| ControlArena: A Library for Running AI Control Experiments Adam Hanson, Alan Cooney, Arathi Mani, Asa Cooper Stickland Published: -Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, tool | - | Agent Safety | agent-safety, ai-safety, tool | E5 / R3 (98%) | - |
| EvilPromptFuzzer: generating inappropriate content based on text-to-image models Baojiang Cui, Dun Liu, Hao Feng, Haoran Dai Published: -Area: Multimodal SafetyCitations: 7 Tags: adversarial-robustness, ai-safety, multimodal-safety, tool | - | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, tool | E4 / R3 (94%) | 7 |
| Gemma Scope 2: Comprehensive Suite of SAEs and Transcoders for Gemma 3 Arthur Conmy, Callum McDougall, Janos Kramar, Neel Nanda Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (98%) | - |
| Goodfire Ember: Scaling Interpretability for Frontier Model Alignment Atticus Geiger, Curt Tigges, Dan Braun, Daniel Balsam Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, interpretability, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, alignment-training, interpretability, mechanistic-interp, tool | E4 / R3 (99%) | - |
| G-STAR: A Threat Modeling Framework for General-Purpose AI Systems Prini Kotian, Pulei Xiong, Saeedeh Lohrasbi, Scott Buffett Published: -Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, tool | - | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R3 (93%) | - |
| Neuronpedia: Interactive SAE Feature Explorer Johnny Lin Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E6 / R3 (95%) | - |
| SAELens: A Library for Training and Analyzing Sparse Autoencoders Anthony Duong, Curt Tigges, David Chanin, Joseph Bloom Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (97%) | - |
| Scaling Responsible Generative AI: Automating Red Teaming of LLM Applications Adison Goh, Akshay Narayan, Benjamin Chee, Luca Baldassarre Published: -Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | - | Safety Evaluation | adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | E4 / R2 (94%) | - |
| TransformerLens Joseph Bloom, Neel Nanda Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | - |