Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis Anand Kannappan, Darshan Deshpande, Rebecca Qian Published: 2026-01-27Area: Deception & FailureCitations: - Tags: ai-safety, benchmark, deception-failure, safety-evaluation | 2026-01-27 | Deception & Failure | ai-safety, benchmark, deception-failure, safety-evaluation | E5 / R3 (94%) | - |
| Truthfulness Despite Weak Supervision: Evaluating and Training LLMs Using Peer Prediction Cameron Allen, Micah Carroll, Tianyi Alex Qiu Published: 2026-01-28Area: Scalable OversightCitations: - Tags: ai-safety, empirical, safety-evaluation, scalable-oversight | 2026-01-28 | Scalable Oversight | ai-safety, empirical, safety-evaluation, scalable-oversight | E5 / R3 (95%) | - |
| Hair-Trigger Alignment: Black-Box Evaluation Cannot Guarantee Post-Update Alignment Duygu Nur Yaldiz, Sai Praneeth Karimireddy, Salman Avestimehr, Yavuz Bakman Published: 2026-01-29Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | 2026-01-29 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | E6 / R3 (95%) | - |
| When Prohibitions Become Permissions: Auditing Negation Sensitivity in Language Models Jon Chun, Katherine Elkins Published: 2026-01-29Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2026-01-29 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | - |
| Constructing Safety Cases for AI Systems: A Reusable Template Framework Jieshan Chen, Liming Dong, Liming Zhu, Md Shamsujjoha Published: 2026-01-30Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, survey | 2026-01-30 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R4 (97%) | - |
| Hearing is Believing? Evaluating and Analyzing Audio Language Model Sycophancy with SYAUDIO Annie Zhao, Danielle Zhao, Di Wang, Junchi Yao Published: 2026-01-30Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2026-01-30 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R3 (96%) | - |
| How Should AI Safety Benchmarks Benchmark Safety? Cheng Yu, Dalia Ali, Orestis Papakyriakopoulos, Ruoxuan Cao Published: 2026-01-30Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, survey | 2026-01-30 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R4 (94%) | - |
| Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models Chenhang Cui, Enyi Shi, Fei Shen, Jiayi Lyu Published: 2026-01-30Area: Multimodal SafetyCitations: - Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2026-01-30 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R4 (92%) | - |
| Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs Cheng-Kuang Wu, Yen-Shan Chen, Yun-Nung Chen, Zhi Rui Tam Published: 2026-02-02Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2026-02-02 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| Beyond Suffixes: Token Position in GCG Adversarial Attacks on Large Language Models Fadi Hassan, Hicham Eddoubi, Umar Faruk Abdullahi Published: 2026-02-03Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2026-02-03 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E7 / R3 (98%) | - |
| Attack Selection Reduces Safety in Concentrated AI Control Settings against Trusted Monitoring Arjun Khandelwal, Joachim Schaeffer, Tyler Tracy Published: 2026-02-04Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2026-02-04 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | - |
| From Data to Behavior: Predicting Unintended Model Behaviors Before Training Huajun Chen, Junfeng Fang, Mengru Wang, Ningyu Zhang Published: 2026-02-04Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2026-02-04 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents Fanyu Meng, Haoran Gao, Li Sun, Sen Su Published: 2026-02-04Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2026-02-04 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (94%) | - |
| Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation Igor Santos-Grueiro Published: 2026-02-05Area: Deception & FailureCitations: 1 Tags: ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | 2026-02-05 | Deception & Failure | ai-safety, alignment-training, deception-failure, safety-evaluation, theoretical | E4 / R2 (94%) | 1 |
| REBEL: Hidden Knowledge Recovery via Evolutionary-Based Evaluation Loop Patryk Rybak, Paul Swoboda, Pawe艂 Batorski, Przemys艂aw Spurek Published: 2026-02-05Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2026-02-05 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | - |
| Incentive-Aware AI Safety via Strategic Resource Allocation: A Stackelberg Security Games Perspective Cheol Woo Kim, Davin Choo, Milind Tambe, Tzeh Yuan Neoh Published: 2026-02-06Area: Formal/TheoreticalCitations: - Tags: adversarial-robustness, ai-safety, formaltheoretical, safety-evaluation, theoretical | 2026-02-06 | Formal/Theoretical | adversarial-robustness, ai-safety, formaltheoretical, safety-evaluation, theoretical | E5 / R3 (93%) | - |
| Rare Event Analysis of Large Language Models Dominic C. Rose, Edward Gillman, Jake McAllister Dorman, Jamie F. Mair Published: 2026-02-06Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2026-02-06 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering Kellin Pelrine, Matthew Kowal, Nayeema Nonta, Punya Syon Pandey Published: 2026-02-06Area: Safety EvaluationCitations: 1 Tags: ai-safety, benchmark, safety-evaluation | 2026-02-06 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (98%) | 1 |
| Do Large Language Models Reflect Demographic Pluralism in Safety? Abdullah Mohammad, Ebad Shabbir, Gautam Siddharth Kashyap, Rafiq Ali Published: 2026-02-07Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2026-02-07 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (95%) | - |
| NAAMSE: Framework for Evolutionary Security Evaluation of Agents Harshil Patel, Kunal Pai, Parth Shah Published: 2026-02-07Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, safety-evaluation, tool | 2026-02-07 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, tool | E5 / R3 (93%) | - |
| Lost in Translation? A Comparative Study on the Cross-Lingual Transfer of Composite Harms Adith N Reganti, Bagesh Kumar, Hardik Sharma, Soham Wasmatkar Published: 2026-02-08Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2026-02-08 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E7 / R4 (96%) | - |
| A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents Angelos Nalmpantis, Calum McNamara, Evgenii Kortukov, Fade Chen Published: 2026-02-09Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical, safety-evaluation | 2026-02-09 | Agent Safety | agent-safety, ai-safety, empirical, safety-evaluation | E4 / R3 (94%) | - |
| Stress-Testing Alignment Audits With Prompt-Level Strategic Deception Ben Marlin, David Lindner, Oliver Daniels, Perusha Moodley Published: 2026-02-09Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2026-02-09 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E6 / R3 (97%) | - |
| When Evaluation Becomes a Side Channel: Regime Leakage and Structural Mitigations for Alignment Assessment Igor Santos-Grueiro Published: 2026-02-09Area: Deception & FailureCitations: - Tags: ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | 2026-02-09 | Deception & Failure | ai-safety, alignment-training, deception-failure, empirical, safety-evaluation | E5 / R3 (92%) | - |
| Abstractive Red-Teaming of Language Model Character Allison Qi, Avery Griffin, Erik Jones, Henry Sleight Published: 2026-02-12Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2026-02-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 1 |
| AI-CARE: Carbon-Aware Reporting Evaluation Metric for AI Models KC Santosh, Rodrigue Rizk, Srikanth Baride Published: 2026-02-17Area: cs.LGCitations: 19 Tags: ai-safety, cslg, preprint, safety-evaluation | 2026-02-17 | cs.LG | ai-safety, cslg, preprint, safety-evaluation | E10 / R9 (89%) | 19 |
| Alignment as Iatrogenesis: Pastoral Power, Collective Pathology, and the Structural Limits of Monolingual Safety Evaluation Hiroki Fukui Published: 2026-02-17Area: cs.CYCitations: 15 Tags: ai-safety, alignment-training, cscy, preprint, safety-evaluation | 2026-02-17 | cs.CY | ai-safety, alignment-training, cscy, preprint, safety-evaluation | E12 / R7 (92%) | 15 |
| A Unified Evaluation of Learning-Based Similarity Techniques for Malware Detection Aniesh Chawla, Udbhav Prasad Published: 2026-02-17Area: cs.CRCitations: - Tags: ai-safety, cscr, preprint, safety-evaluation | 2026-02-17 | cs.CR | ai-safety, cscr, preprint, safety-evaluation | E12 / R11 (92%) | - |
| Decision Quality Evaluation Framework at Pinterest Aravindh Manickavasagam, Attila Dobi, Faisal Farooq, Kevin O'Sullivan Published: 2026-02-17Area: stat.APCitations: - Tags: ai-safety, preprint, safety-evaluation, statap | 2026-02-17 | stat.AP | ai-safety, preprint, safety-evaluation, statap | E10 / R9 (93%) | - |
| DocSplit: A Comprehensive Benchmark Dataset and Evaluation Approach for Document Packet Recognition and Splitting Bob Strahan, Boyi Xie, Diego A. Socolinsky, Md Mofijul Islam Published: 2026-02-17Area: cs.CLCitations: 15 Tags: ai-safety, cscl, preprint, safety-evaluation | 2026-02-17 | cs.CL | ai-safety, cscl, preprint, safety-evaluation | E11 / R9 (90%) | 15 |