Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Mechanistic understanding and validation of large AI models with SemanticLens Jim Berend, Johanna Vielhaben, Maximilian Dreyer, Sebastian Lapuschkin Published: 2025-01-09Area: Mechanistic Interp.Citations: 29 Tags: ai-safety, mechanistic-interp, tool | 2025-01-09 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (95%) | 29 |
| Clio: Privacy-Preserving Insights into Real-World AI Use Alex Tamkin, Alfred Mountfield, Ankur Rathi, Brian Clarke Published: 2024-12-18Area: Safety EvaluationCitations: 62 Tags: ai-safety, safety-evaluation, tool | 2024-12-18 | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R3 (97%) | 62 |
| Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders Frances Liu, Junxuan Wang, Lingjie Chen, Qipeng Guo Published: 2024-10-27Area: Mechanistic Interp.Citations: 91 Tags: ai-safety, mechanistic-interp, tool | 2024-10-27 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (97%) | 91 |
| PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System Amanda J. Minnich, Blake Bullwinkel, Bolor-Erdene Jagdagdorj, Chang Kawaguchi Published: 2024-10-01Area: Safety EvaluationCitations: 15 Tags: adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | 2024-10-01 | Safety Evaluation | adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | E6 / R4 (96%) | 15 |
| PROMPTFUZZ: Harnessing Fuzzing Techniques for Robust Testing of Prompt Injection in LLMs Hanwen Miao, Jiahao Yu, Junzheng Shi, Xinyu Xing Published: 2024-09-23Area: Adversarial RobustnessCitations: 20 Tags: adversarial-robustness, ai-safety, tool | 2024-09-23 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (95%) | 20 |
| Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2 Anca Dragan, Arthur Conmy, J脙隆nos Kram脙隆r, Lewis Smith Published: 2024-08-09Area: Mechanistic Interp.Citations: 254 Tags: ai-safety, mechanistic-interp, tool | 2024-08-09 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (96%) | 254 |
| h4rm3l: A Language for Composable Jailbreak Attack Synthesis Ananjan Nandi, Anna Goldie, Christopher D. Manning, Dan Jurafsky Published: 2024-08-09Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, tool | 2024-08-09 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (97%) | 11 |
| NNsight and NDIF: Democratizing Access to Foundation Model Internals Aaron Mueller, Adam Belfki, Alexander R. Loftus, Arjun Guha Published: 2024-07-18Area: Mechanistic Interp.Citations: 23 Tags: ai-safety, mechanistic-interp, tool | 2024-07-18 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (96%) | 23 |
| JailbreakHunter: A Visual Analytics Approach for Jailbreak Prompts Discovery From Large-Scale Human-LLM Conversational Datasets Haotian Li, Huamin Qu, Shiyi Liu, Xun Zhao Published: 2024-07-03Area: Adversarial RobustnessCitations: 6 Tags: adversarial-robustness, ai-safety, tool | 2024-07-03 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (95%) | 6 |
| WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs Allyson Ettinger, Bill Yuchen Lin, Kavel Rao, Liwei Jiang Published: 2024-06-26Area: Adversarial RobustnessCitations: 261 Tags: adversarial-robustness, ai-safety, tool | 2024-06-26 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E6 / R4 (96%) | 261 |
| garak: A Framework for Security Probing Large Language Models Erick Galinkin, Jeffrey Martin, Leon Derczynski, Nanna Inie Published: 2024-06-16Area: Safety EvaluationCitations: 38 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2024-06-16 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R4 (96%) | 38 |
| JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models Anyu Wang, Delong Ran, Jingyi Zheng, Jinyuan Liu Published: 2024-06-13Area: Safety EvaluationCitations: 27 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2024-06-13 | Safety Evaluation | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R3 (94%) | 27 |
| Lessons from the Trenches on Reproducible Evaluation of Language Models Alham Fikri Aji, Andy Zou, Anthony DiPofi, Aviya Skowron Published: 2024-05-23Area: Safety EvaluationCitations: 119 Tags: ai-safety, safety-evaluation, tool | 2024-05-23 | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R2 (96%) | 119 |
| MAIA: A Multimodal Automated Interpretability Agent Achyuta Rajaram, Antonio Torralba, Evan Hernandez, Franklin Wang Published: 2024-04-22Area: Mechanistic Interp.Citations: 45 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2024-04-22 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E6 / R4 (95%) | 45 |
| JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models Minfeng Zhu, Sijia Wang, Wei Chen, Wei Zhang Published: 2024-04-12Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2024-04-12 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, tool | E4 / R3 (96%) | 8 |
| LM Transparency Tool: Interactive Tool for Analyzing Transformer Language Models Elena Voita, Igor Tufanov, Javier Ferrando, Karen Hambardzumyan Published: 2024-04-10Area: Mechanistic Interp.Citations: 15 Tags: ai-safety, mechanistic-interp, tool | 2024-04-10 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (95%) | 15 |
| pyvene: A Library for Understanding and Improving PyTorch Models via Interventions Aryaman Arora, Atticus Geiger, Christopher D. Manning, Christopher Potts Published: 2024-03-12Area: Mechanistic Interp.Citations: 44 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2024-03-12 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | 44 |
| Detectors for Safe and Reliable LLMs: Implementations, Uses, and Limitations Aashka Trivedi, Adriana Alvarado Garcia, Ambrish Rawat, Ateret Anaby-Tavor Published: 2024-03-09Area: Adversarial RobustnessCitations: 15 Tags: adversarial-robustness, ai-safety, tool | 2024-03-09 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E6 / R4 (99%) | 15 |
| ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors Di Zhang, Hao Sun, Hongning Wang, Jingyuan Ma Published: 2024-02-26Area: Safety EvaluationCitations: 49 Tags: ai-safety, safety-evaluation, tool | 2024-02-26 | Safety Evaluation | ai-safety, safety-evaluation, tool | E5 / R3 (97%) | 49 |
| Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations Brian Fuller, Davide Testuggine, Hakan Inan, Jianfeng Chi Published: 2023-12-07Area: Adversarial RobustnessCitations: 813 Tags: adversarial-robustness, ai-safety, tool | 2023-12-07 | Adversarial Robustness | adversarial-robustness, ai-safety, tool | E5 / R3 (95%) | 813 |
| FlexModel: A Framework for Interpretability of Distributed Large Language Models David B. Emerson, John Willes, Matthew Choi, Muhammad Adil Asif Published: 2023-12-05Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2023-12-05 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (95%) | 1 |
| Attention Lens: A Tool for Mechanistically Interpreting the Attention Head Information Retrieval Mechanism Andr茅 Bauer, Arham Khan, Aswathy Ajith, Daniel Grzenda Published: 2023-10-25Area: Mechanistic Interp.Citations: 18 Tags: ai-safety, mechanistic-interp, tool | 2023-10-25 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (95%) | 18 |
| Identifying the Risks of LM Agents with an LM-Emulated Sandbox Andrew Wang, Chris J. Maddison, Honghua Dong, Jimmy Ba Published: 2023-09-25Area: Agent SafetyCitations: 217 Tags: agent-safety, ai-safety, tool | 2023-09-25 | Agent Safety | agent-safety, ai-safety, tool | E5 / R3 (95%) | 217 |
| GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts Jiahao Yu, Xingwei Lin, Xinyu Xing, Zheng Yu Published: 2023-09-19Area: Adversarial RobustnessCitations: 537 Tags: adversarial-robustness, ai-safety, red-teaming, tool | 2023-09-19 | Adversarial Robustness | adversarial-robustness, ai-safety, red-teaming, tool | E5 / R3 (97%) | 537 |
| Towards Vision-Language Mechanistic Interpretability: A Causal Tracing Tool for BLIP Aryaman Arora, Paul Pu Liang, Rohan Pandey, Vedant Palit Published: 2023-08-27Area: Mechanistic Interp.Citations: 47 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2023-08-27 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | 47 |
| EasyEdit: An Easy-to-use Knowledge Editing Framework for Large Language Models Bozhong Tian, Guozhou Zheng, Huajun Chen, Kangwei Liu Published: 2023-08-14Area: Model EditingCitations: 86 Tags: ai-safety, model-editing, safety-evaluation, tool | 2023-08-14 | Model Editing | ai-safety, model-editing, safety-evaluation, tool | E6 / R4 (97%) | 86 |
| FACADE: A Framework for Adversarial Circuit Anomaly Detection and Evaluation Andres Carranza, Arnuv Tandon, Dhruv Pai, Rylan Schaeffer Published: 2023-07-20Area: Mechanistic Interp.Citations: 2 Tags: adversarial-robustness, ai-safety, mechanistic-interp, safety-evaluation, tool | 2023-07-20 | Mechanistic Interp. | adversarial-robustness, ai-safety, mechanistic-interp, safety-evaluation, tool | E5 / R3 (94%) | 2 |
| Neuron to Graph: Interpreting Language Model Neurons at Scale Alex Foote, Esben Kran, Fazl Barez, Ioannis Konstas Published: 2023-05-31Area: Mechanistic Interp.Citations: 28 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2023-05-31 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (94%) | 28 |
| AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback Carlos Guestrin, Ishaan Gulrajani, Jimmy Ba, Percy Liang Published: 2023-05-22Area: Alignment TrainingCitations: 797 Tags: ai-safety, alignment-training, tool | 2023-05-22 | Alignment Training | ai-safety, alignment-training, tool | E5 / R3 (96%) | 797 |
| N2G: A Scalable Approach for Quantifying Interpretable Neuron Representations in Large Language Models Alex Foote, Esben Kran, Fazl Barez, Ionnis Konstas Published: 2023-04-22Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2023-04-22 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | 4 |