Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 61-77 of 77 papers (page 3 of 3)路 29 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling Aviya Skowron, Edward Raff, Eric Hallahan, Hailey Schoelkopf Published: 2023-04-03Area: Training DynamicsCitations: 1708 Tags: ai-safety, interpretability, tool, training-dynamics | 2023-04-03 | Training Dynamics | ai-safety, interpretability, tool, training-dynamics | E5 / R3 (99%) | 1708 |
| Tracr: Compiled Transformers as a Laboratory for Interpretability David Lindner, Janos Kramar, Matthew Rahtz, Sebastian Farquhar Published: 2023-01-12Area: Mechanistic Interp.Citations: 91 Tags: ai-safety, interpretability, mechanistic-interp, tool | 2023-01-12 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R4 (95%) | 91 |
| LM-Debugger: An Interactive Tool for Inspection and Intervention in Transformer-Based Language Models Avi Caciularu, Bar Tamir, Guy Dar, Micah Shlain Published: 2022-04-26Area: Mechanistic Interp.Citations: 32 Tags: ai-safety, mechanistic-interp, tool | 2022-04-26 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E4 / R3 (95%) | 32 |
| CLIP-Dissect: Automatic Description of Neuron Representations in Deep Vision Networks Tsui-Wei Weng, Tuomas Oikarinen Published: 2022-04-23Area: Mechanistic Interp.Citations: 130 Tags: ai-safety, mechanistic-interp, tool | 2022-04-23 | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E6 / R3 (96%) | 130 |
| Anticipating Safety Issues in E2E Conversational AI: Framework and Tooling A. Stevie Bergman, Dirk Hovy, Emily Dinan, Gavin Abercrombie Published: 2021-07-07Area: Safety EvaluationCitations: 115 Tags: ai-safety, safety-evaluation, tool | 2021-07-07 | Safety Evaluation | ai-safety, safety-evaluation, tool | E5 / R3 (93%) | 115 |
| AdversaFlow: Visual Red Teaming for Large Language Models with Multi-Level Adversarial Flow Chuhan Zhang, Dazhen Deng, Huawei Zheng, Shouling Ji Published: -Area: Safety EvaluationCitations: 12 Tags: adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | - | Safety Evaluation | adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | E4 / R3 (93%) | 12 |
| Between Generation and Judgment: A Cloud-Native Framework for Adversarial Evaluation of LLM Alignment C. Miers, Diego E. G. Caetano De Oliveira, Marcos A. Simplicio, Victor Takashi Hayashi Published: -Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, alignment-training, safety-evaluation, tool | - | Safety Evaluation | adversarial-robustness, ai-safety, alignment-training, safety-evaluation, tool | E5 / R4 (95%) | - |
| CCS-Lib: A Python package to elicit latent knowledge from LLMs Alexander Wan, Alex Mallen, Augustas Macijauskas, Ben W. Published: -Area: Representation AnalysisCitations: - Tags: ai-safety, representation-analysis, tool | - | Representation Analysis | ai-safety, representation-analysis, tool | E5 / R3 (99%) | - |
| ControlArena: A Library for Running AI Control Experiments Adam Hanson, Alan Cooney, Arathi Mani, Asa Cooper Stickland Published: -Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, tool | - | Agent Safety | agent-safety, ai-safety, tool | E5 / R3 (98%) | - |
| EvilPromptFuzzer: generating inappropriate content based on text-to-image models Baojiang Cui, Dun Liu, Hao Feng, Haoran Dai Published: -Area: Multimodal SafetyCitations: 7 Tags: adversarial-robustness, ai-safety, multimodal-safety, tool | - | Multimodal Safety | adversarial-robustness, ai-safety, multimodal-safety, tool | E4 / R3 (94%) | 7 |
| Gemma Scope 2: Comprehensive Suite of SAEs and Transcoders for Gemma 3 Arthur Conmy, Callum McDougall, Janos Kramar, Neel Nanda Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (98%) | - |
| Goodfire Ember: Scaling Interpretability for Frontier Model Alignment Atticus Geiger, Curt Tigges, Dan Braun, Daniel Balsam Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, alignment-training, interpretability, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, alignment-training, interpretability, mechanistic-interp, tool | E4 / R3 (99%) | - |
| G-STAR: A Threat Modeling Framework for General-Purpose AI Systems Prini Kotian, Pulei Xiong, Saeedeh Lohrasbi, Scott Buffett Published: -Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, tool | - | Safety Evaluation | ai-safety, safety-evaluation, tool | E4 / R3 (93%) | - |
| Neuronpedia: Interactive SAE Feature Explorer Johnny Lin Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E6 / R3 (95%) | - |
| SAELens: A Library for Training and Analyzing Sparse Autoencoders Anthony Duong, Curt Tigges, David Chanin, Joseph Bloom Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, mechanistic-interp, tool | E5 / R3 (97%) | - |
| Scaling Responsible Generative AI: Automating Red Teaming of LLM Applications Adison Goh, Akshay Narayan, Benjamin Chee, Luca Baldassarre Published: -Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | - | Safety Evaluation | adversarial-robustness, ai-safety, red-teaming, safety-evaluation, tool | E4 / R2 (94%) | - |
| TransformerLens Joseph Bloom, Neel Nanda Published: -Area: Mechanistic Interp.Citations: - Tags: ai-safety, interpretability, mechanistic-interp, tool | - | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, tool | E5 / R3 (96%) | - |