Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| ARGS: Alignment as Reward-Guided Search Jirayu Burapacheep, Maxim Khanov, Yixuan Li Published: 2024-01-23Area: Alignment TrainingCitations: 95 Tags: ai-safety, alignment-training, empirical | 2024-01-23 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (96%) | 95 |
| Fluent dreaming for language models Michael Sklar, T. Ben Thompson, Zygimantas Straznickas Published: 2024-01-24Area: Mechanistic Interp.Citations: 4 Tags: adversarial-robustness, ai-safety, empirical, mechanistic-interp | 2024-01-24 | Mechanistic Interp. | adversarial-robustness, ai-safety, empirical, mechanistic-interp | E4 / R2 (97%) | 4 |
| Black-Box Access is Insufficient for Rigorous AI Audits Alan Chan, Andreas Haupt, Benjamin Bucknall, Carson Ezell Published: 2024-01-25Area: Safety EvaluationCitations: 143 Tags: ai-safety, position, safety-evaluation | 2024-01-25 | Safety Evaluation | ai-safety, position, safety-evaluation | E5 / R3 (95%) | 143 |
| Fortifying Ethical Boundaries in AI: Advanced Strategies for Enhancing Security in Large Language Models Jianling Qiu, Wei Zhang, Yunhong He, Zhengqing Yuan Published: 2024-01-27Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, empirical | 2024-01-27 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E6 / R3 (94%) | 3 |
| Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF Banghua Zhu, Jiantao Jiao, Michael I. Jordan Published: 2024-01-29Area: Alignment TrainingCitations: 49 Tags: ai-safety, alignment-training, empirical | 2024-01-29 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 49 |
| Red-Teaming for Generative AI: Silver Bullet or Security Theater? Anusha Sinha, Hoda Heidari, Michael Feffer, Zachary C. Lipton Published: 2024-01-29Area: Safety EvaluationCitations: 126 Tags: ai-safety, safety-evaluation, survey | 2024-01-29 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (94%) | 126 |
| Tradeoffs Between Alignment and Helpfulness in Language Models Amnon Shashua, Binyamin Rothberg, Dorin Shteyman, Noam Wies Published: 2024-01-29Area: Representation AnalysisCitations: 21 Tags: ai-safety, alignment-training, representation-analysis, theoretical | 2024-01-29 | Representation Analysis | ai-safety, alignment-training, representation-analysis, theoretical | E5 / R3 (94%) | 21 |
| Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks Andy Zhou, Bo Li, Haohan Wang Published: 2024-01-30Area: Adversarial RobustnessCitations: 141 Tags: adversarial-robustness, ai-safety, empirical | 2024-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R4 (97%) | 141 |
| Security and Privacy Challenges of Large Language Models: A Survey Badhan Chandra Das, M. Hadi Amini, Yanzhao Wu Published: 2024-01-30Area: Surveys & ReviewsCitations: 351 Tags: adversarial-robustness, ai-safety, survey, surveys-reviews | 2024-01-30 | Surveys & Reviews | adversarial-robustness, ai-safety, survey, surveys-reviews | E6 / R4 (97%) | 351 |
| Weak-to-Strong Jailbreaking on Large Language Models Chao Du, Lei Li, Tianyu Pang, William Yang Wang Published: 2024-01-30Area: Adversarial RobustnessCitations: 96 Tags: adversarial-robustness, ai-safety, empirical | 2024-01-30 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E5 / R3 (98%) | 96 |
| Real Sparks of Artificial Intelligence and the Importance of Inner Interpretability Alex Grzankowski Published: 2024-01-31Area: Mechanistic Interp.Citations: 10 Tags: ai-safety, interpretability, mechanistic-interp, position | 2024-01-31 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E8 / R4 (94%) | 10 |
| Investigating Bias Representations in Llama 2 Chat via Activation Steering Dawn Lu, Nina Rimsky Published: 2024-02-01Area: Representation AnalysisCitations: 13 Tags: ai-safety, empirical, representation-analysis | 2024-02-01 | Representation Analysis | ai-safety, empirical, representation-analysis | E5 / R4 (93%) | 13 |
| Safety of Multimodal Large Language Models on Images and Text Chao Yang, Xin Liu, Yichen Zhu, Yunshi Lan Published: 2024-02-01Area: Multimodal SafetyCitations: 65 Tags: ai-safety, multimodal-safety, survey | 2024-02-01 | Multimodal Safety | ai-safety, multimodal-safety, survey | E7 / R3 (95%) | 65 |
| Towards Efficient and Exact Optimization of Language Model Alignment Cheng Lu, Haozhe Ji, Hongning Wang, Jie Tang Published: 2024-02-01Area: Alignment TrainingCitations: 32 Tags: ai-safety, alignment-training, empirical | 2024-02-01 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (95%) | 32 |
| Building Guardrails for Large Language Models Gaojie Jin, Jie Meng, Jinwei Hu, Ronghui Mu Published: 2024-02-02Area: Adversarial RobustnessCitations: 74 Tags: adversarial-robustness, ai-safety, position | 2024-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, position | E5 / R3 (96%) | 74 |
| KTO: Model Alignment as Prospect Theoretic Optimization Dan Jurafsky, Douwe Kiela, Kawin Ethayarajh, Niklas Muennighoff Published: 2024-02-02Area: Alignment TrainingCitations: 879 Tags: ai-safety, alignment-training, empirical | 2024-02-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 879 |
| Preference Poisoning Attacks on Reward Model Learning Chaowei Xiao, Chenguang Wang, Jiongxiao Wang, Junlin Wu Published: 2024-02-02Area: Adversarial RobustnessCitations: 12 Tags: adversarial-robustness, ai-safety, alignment-training, empirical | 2024-02-02 | Adversarial Robustness | adversarial-robustness, ai-safety, alignment-training, empirical | E5 / R4 (96%) | 12 |
| Rethinking the Role of Proxy Rewards in Language Model Alignment Minjoon Seo, Sungdong Kim Published: 2024-02-02Area: Alignment TrainingCitations: 5 Tags: ai-safety, alignment-training, empirical | 2024-02-02 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (97%) | 5 |
| Vaccine: Perturbation-aware Alignment for Large Language Models Ling Liu, Sihao Hu, Tiansheng Huang Published: 2024-02-02Area: Alignment TrainingCitations: 88 Tags: ai-safety, alignment-training, empirical | 2024-02-02 | Alignment Training | ai-safety, alignment-training, empirical | E4 / R3 (94%) | 88 |
| Data Poisoning for In-context Learning Han Xu, Hui Liu, Jiliang Tang, Makoto Yamada Published: 2024-02-03Area: Adversarial RobustnessCitations: 27 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E4 / R3 (97%) | 27 |
| Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models Ondrej Bohdal, Timothy Hospedales, Tingyang Yu, Yongshuo Zong Published: 2024-02-03Area: Multimodal SafetyCitations: 125 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-02-03 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E6 / R3 (94%) | 125 |
| Jailbreaking Attack against Multimodal Large Language Model Gang Hua, Haodong Ren, Rong Jin, Xinbo Gao Published: 2024-02-04Area: Multimodal SafetyCitations: 128 Tags: adversarial-robustness, ai-safety, empirical, multimodal-safety | 2024-02-04 | Multimodal Safety | adversarial-robustness, ai-safety, empirical, multimodal-safety | E8 / R3 (95%) | 128 |
| The Developmental Landscape of In-Context Learning Daniel Murfet, George Wang, Jesse Hoogland, Liam Carroll Published: 2024-02-04Area: Training DynamicsCitations: 19 Tags: ai-safety, empirical, training-dynamics | 2024-02-04 | Training Dynamics | ai-safety, empirical, training-dynamics | E5 / R3 (96%) | 19 |
| DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models Daya Guo, Haowei Zhang, Junxiao Song, Mingchuan Zhang Published: 2024-02-05Area: Alignment TrainingCitations: 4632 Tags: ai-safety, alignment-training, empirical | 2024-02-05 | Alignment Training | ai-safety, alignment-training, empirical | E5 / R3 (98%) | 4632 |
| GUARD: Role-playing to Generate Natural-language Jailbreakings to Test Guideline Adherence of Large Language Models Andy Zhou, Haibo Jin, Haohan Wang, Peiyan Zhang Published: 2024-02-05Area: Adversarial RobustnessCitations: 49 Tags: adversarial-robustness, ai-safety, empirical | 2024-02-05 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical | E8 / R3 (97%) | 49 |
| Shadowcast: Stealthy Data Poisoning Attacks Against Vision-Language Models Furong Huang, Jiarui Yao, Manli Shu, Ning Yu Published: 2024-02-05Area: Multimodal SafetyCitations: 42 Tags: ai-safety, empirical, multimodal-safety | 2024-02-05 | Multimodal Safety | ai-safety, empirical, multimodal-safety | E5 / R3 (95%) | 42 |
| Challenges in Mechanistically Interpreting Model Representations James Dao, Satvik Golechha Published: 2024-02-06Area: Mechanistic Interp.Citations: 4 Tags: ai-safety, interpretability, mechanistic-interp, position | 2024-02-06 | Mechanistic Interp. | ai-safety, interpretability, mechanistic-interp, position | E5 / R3 (93%) | 4 |
| HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal Andy Zou, Bo Li, Dan Hendrycks, David Forsyth Published: 2024-02-06Area: Safety EvaluationCitations: 830 Tags: adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | 2024-02-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, red-teaming, safety-evaluation | E5 / R3 (95%) | 830 |
| Prioritizing Safeguarding Over Autonomy: Risks of LLM Agents for Science Arman Cohan, Jian Tang, Kunlun Zhu, Mark Gerstein Published: 2024-02-06Area: Agent SafetyCitations: 55 Tags: agent-safety, ai-safety, alignment-training, survey | 2024-02-06 | Agent Safety | agent-safety, ai-safety, alignment-training, survey | E5 / R3 (95%) | 55 |
| A Roadmap to Pluralistic Alignment Andre Ye, Christopher Michael Rytting, Jared Moore, Jillian Fisher Published: 2024-02-07Area: Alignment TrainingCitations: 161 Tags: ai-safety, alignment-training, survey | 2024-02-07 | Alignment Training | ai-safety, alignment-training, survey | E5 / R3 (94%) | 161 |