Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 991-1000 of 1000+ papers (page 34 of 34)· 501 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Prover-Verifier Games Improve Legibility of LLM Outputs Harri Edwards, Jan Hendrik Kirchner, Jan Leike, Nat McAleese Published: 2024-07-18Area: Scalable OversightCitations: 54 Tags: ai-safety, empirical, scalable-oversight | 2024-07-18 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R4 (95%) | 54 |
| Weak-to-Strong Reasoning Pengfei Liu, Yan Ma, Yuqing Yang Published: 2024-07-18Area: Scalable OversightCitations: 28 Tags: ai-safety, empirical, scalable-oversight | 2024-07-18 | Scalable Oversight | ai-safety, empirical, scalable-oversight | E5 / R3 (96%) | 28 |
| InterpBench: Semi-Synthetic Transformers for Evaluating Mechanistic Interpretability Techniques Adrià Garriga-Alonso, Iván Arcuschin, Rohan Gupta, Thomas Kwa Published: 2024-07-19Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | 2024-07-19 | Mechanistic Interp. | ai-safety, benchmark, interpretability, mechanistic-interp, safety-evaluation | E6 / R3 (98%) | 7 |
| Jumping Ahead: Improving Reconstruction Fidelity with JumpReLU Sparse Autoencoders Arthur Conmy, János Kramár, Neel Nanda, Nicolas Sonnerat Published: 2024-07-19Area: Mechanistic Interp.Citations: 194 Tags: ai-safety, empirical, mechanistic-interp | 2024-07-19 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R3 (94%) | 194 |
| Relational Composition in Neural Networks: A Survey and Call to Action Fernanda B. Viégas, Martin Wattenberg Published: 2024-07-19Area: Mechanistic Interp.Citations: 19 Tags: ai-safety, mechanistic-interp, survey | 2024-07-19 | Mechanistic Interp. | ai-safety, mechanistic-interp, survey | E6 / R3 (91%) | 19 |
| Operationalizing a Threat Model for Red-Teaming Large Language Models Anu Pradhan, Apurv Verma, David Rabinowitz, John Doucette Published: 2024-07-20Area: Safety EvaluationCitations: 42 Tags: ai-safety, safety-evaluation, survey | 2024-07-20 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (97%) | 42 |
| Adversarial Circuit Evaluation Adrià Garriga-Alonso, Niels uit de Bos Published: 2024-07-21Area: Mechanistic Interp.Citations: 1 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp, safety-evaluation | 2024-07-21 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp, safety-evaluation | E6 / R3 (95%) | 1 |
| Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts Chengjun Cai, Cong Wang, Xiaoli Zhang, Xingliang Yuan Published: 2024-07-21Area: Multimodal SafetyCitations: 38 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | 2024-07-21 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety, red-teaming | E5 / R3 (96%) | 38 |
| Intrinsic Self-correction for Enhanced Morality: An Analysis of Internal Mechanisms and the Superficial Hypothesis Guangliang Liu, Haitao Mao, Jiliang Tang, Kristen Marie Johnson Published: 2024-07-21Area: Deception & FailureCitations: 18 Tags: ai-safety, deception-failure, empirical | 2024-07-21 | Deception & Failure | ai-safety, deception-failure, empirical | E5 / R3 (94%) | 18 |
| Trading Devil Final: Backdoor attack via Stock market and Bayesian Optimization Orson Mengara Published: 2024-07-21Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical | 2024-07-21 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (94%) | - |
| Planning in a Recurrent Neural Network that Plays Sokoban Aaron David Tucker, Adam Gleave, Adrià Garriga-Alonso, Chris Cundy Published: 2024-07-22Area: Mechanistic Interp.Citations: 11 Tags: ai-safety, empirical, mechanistic-interp | 2024-07-22 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp | E5 / R4 (95%) | 11 |
| Revisiting the Robust Alignment of Circuit Breakers Leo Schwinn, Simon Geisler Published: 2024-07-22Area: Adversarial RobustnessCitations: 8 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R2 (93%) | 8 |
| Targeted Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs Abhay Sheshadri, Aengus Lynch, Aidan Ewart, Asa Cooper Stickland Published: 2024-07-22Area: Adversarial RobustnessCitations: 112 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-22 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 112 |
| Can Large Language Models Automatically Jailbreak GPT-4V? Lichao Sun, Pan Zhou, Xiang Li, Yixin Liu Published: 2024-07-23Area: Multimodal SafetyCitations: 3 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-07-23 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E5 / R3 (96%) | 3 |
| Course-Correction: Safety Alignment Using Synthetic Preferences Haiqin Weng, Han Qiu, Renjie Gu, Rongwu Xu Published: 2024-07-23Area: Alignment TrainingCitations: 13 Tags: ai-safety, alignment-training, empirical | 2024-07-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 13 |
| Figure it Out: Analyzing-based Jailbreak Attack on Large Language Models Changting Lin, Meng Han, Rongchang Li, Shi Lin Published: 2024-07-23Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 3 |
| PrimeGuard: Safe and Helpful LLMs through Tuning-Free Routing Blazej Manczak, Eliott Zemour, Eric Lin, Vaikkunth Mugunthan Published: 2024-07-23Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-23 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R4 (97%) | 9 |
| RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent Feng Xiao, Huiyu Xu, Kui Ren, Rui Zheng Published: 2024-07-23Area: Safety EvaluationCitations: 30 Tags: adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | 2024-07-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (97%) | 30 |
| FLRT: Fluent Student-Teacher Redteaming Michael Sklar, T. Ben Thompson Published: 2024-07-24Area: Adversarial RobustnessCitations: 10 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-24 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (96%) | 10 |
| Revisiting Who's Harry Potter: Towards Targeted Unlearning from a Causal Intervention Perspective Shiyu Chang, Tommi Jaakkola, Yang Zhang, Yujian Liu Published: 2024-07-24Area: Model EditingCitations: 28 Tags: ai-safety, empirical, model-editing | 2024-07-24 | Model Editing | ai-safety, empirical, model-editing | E5 / R3 (94%) | 28 |
| Exploring Scaling Trends in LLM Robustness Adam Gleave, Ian McKenzie, Michal Zajac, Nikolaus Howe Published: 2024-07-25Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, empirical | 2024-07-25 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (95%) | 11 |
| Learn while Unlearn: An Iterative Unlearning Framework for Generative Language Models Enhong Chen, Haoyu Tang, Kai Zhang, Qi Liu Published: 2024-07-25Area: Model EditingCitations: 7 Tags: ai-safety, empirical, model-editing | 2024-07-25 | Model Editing | ai-safety, empirical, model-editing | E6 / R4 (96%) | 7 |
| The Art of Refusal: A Survey of Abstention in Large Language Models Bill Howe, Bingbing Wen, Chenjun Xu, Jihan Yao Published: 2024-07-25Area: Surveys & ReviewsCitations: 55 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2024-07-25 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R3 (94%) | 55 |
| Cluster-Norm for Unsupervised Probing of Knowledge Grégoire Dhimoïla, Kaarel Hänni, Owen Ho Wan Yeung, Sharan Maiya Published: 2024-07-26Area: Representation AnalysisCitations: 5 Tags: ai-safety, empirical, representation-analysis | 2024-07-26 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R3 (96%) | 5 |
| The Emerged Security and Privacy of LLM Agent: A Survey with Case Studies Bo Liu, Dayong Ye, Feng He, Philip S. Yu Published: 2024-07-28Area: Surveys & ReviewsCitations: 85 Tags: ai-safety, survey, surveys-reviews | 2024-07-28 | Surveys & Reviews | ai-safety, survey, surveys-reviews | E7 / R4 (94%) | 85 |
| Detecting and Understanding Vulnerabilities in Language Models via Mechanistic Interpretability Alejandro Maté, Jorge García-Carrasco, Juan Trujillo Published: 2024-07-29Area: Mechanistic Interp.Citations: 6 Tags: adversarial-robustness, ai-safety, empirical, interpretability, mechanistic-interp | 2024-07-29 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, interpretability, mechanistic-interp | E5 / R3 (93%) | 6 |
| Editing LLMs Can Stealthily Subvert Safety Baixiang Huang, Canyu Chen, Chaowei Xiao, Dawn Song Published: 2024-07-29Area: Model EditingCitations: 24 Tags: ai-safety, empirical, model-editing | 2024-07-29 | Model Editing | ai-safety, empirical, model-editing | E7 / R4 (95%) | 24 |
| Supertrust foundational alignment: mutual trust must replace permanent control for safe superintelligence James M. Mazzu Published: 2024-07-29Area: Alignment TrainingCitations: 2 Tags: ai-safety, alignment-training, position | 2024-07-29 | Alignment Training | ai-safety, alignment-training, position | E6 / R3 (93%) | 2 |
| Breaking Agents: Compromising Autonomous LLM Agents Through Malfunction Amplification Ahmed Salem, Boyang Zhang, Michael Backes, Savvas Zannettou Published: 2024-07-30Area: Agent SafetyCitations: 65 Tags: agent-safety, ai-safety, empirical | 2024-07-30 | Agent Safety | agent-safety, ai-safety, empirical | E6 / R3 (93%) | 65 |
| Can LLMs be Fooled? Investigating Vulnerabilities in LLMs CJ Barberan, Jia He, Richard Anarfi, Sara Abdali Published: 2024-07-30Area: Adversarial RobustnessCitations: 9 Tags: adversarial-robustness, ai-safety, survey | 2024-07-30 | Adversarial Robustness | adversarial-robustness, ai-safety, survey | E6 / R4 (95%) | 9 |