Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Benchmarking Misuse Mitigation Against Covert Adversaries Alexander Robey, Davis Brown, Eric Wong, George J. Pappas Published: 2025-06-06Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-06 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 4 |
| Evaluating Neuron Explanations: A Unified Framework with Sanity Checks Ge Yan, Tsui-Wei Weng, Tuomas Oikarinen Published: 2025-06-06Area: Mechanistic Interp.Citations: 7 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-06-06 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E5 / R3 (99%) | 7 |
| The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs Chaozhuo Li, Feiran Huang, Jiameng Qiu, Litian Zhang Published: 2025-06-06Area: Safety EvaluationCitations: 23 Tags: ai-safety, safety-evaluation, survey | 2025-06-06 | Safety Evaluation | ai-safety, safety-evaluation, survey | E5 / R3 (94%) | 23 |
| Unintended Harms of Value-Aligned LLMs: Psychological and Empirical Insights Jaehyeok Lee, Jing Yao, JinYeong Bak, Sooyung Choi Published: 2025-06-06Area: Safety EvaluationCitations: 2 Tags: ai-safety, empirical, safety-evaluation | 2025-06-06 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 2 |
| SafeLawBench: Towards Safe Alignment of Large Language Models Chuxue Cao, Han Zhu, Jiaming Ji, Juntao Dai Published: 2025-06-07Area: Safety EvaluationCitations: 7 Tags: ai-safety, alignment-training, benchmark, safety-evaluation | 2025-06-07 | Safety Evaluation | ai-safety, alignment-training, benchmark, safety-evaluation | E5 / R3 (98%) | 7 |
| Evaluating and Improving Robustness in Large Language Models: A Survey and Future Directions Dacao Zhang, Guangyi Lv, Kui Yu, Kun Zhang Published: 2025-06-08Area: Surveys & ReviewsCitations: 1 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | 2025-06-08 | Surveys & Reviews | adversarial-robustness, ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R3 (95%) | 1 |
| Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs Di Wang, Lijie Hu, Qingsong Yang, Shu Yang Published: 2025-06-08Area: Safety EvaluationCitations: 10 Tags: ai-safety, benchmark, safety-evaluation | 2025-06-08 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (97%) | 10 |
| Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models Chao Qian, Hao-Tian Li, Ke Xue, Ren-Jian Wang Published: 2025-06-08Area: Safety EvaluationCitations: 4 Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-06-08 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 4 |
| Reward Model Interpretability via Optimal and Pessimal Tokens Brian Christian, Christopher Summerfield, Hannah Rose Kirk, Jessica A.F. Thompson Published: 2025-06-08Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical, interpretability, safety-evaluation | 2025-06-08 | Alignment Training | ai-safety, alignment-training, empirical, interpretability, safety-evaluation | E5 / R3 (96%) | 10 |
| QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA Aswin RRV, Ben Zhou, Chitta Baral, Jacob Dineen Published: 2025-06-09Area: Alignment TrainingCitations: 10 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-06-09 | Alignment Training | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R4 (96%) | 10 |
| SoK: Machine Unlearning for Large Language Models Charu C. Aggarwal, Hui Liu, Jie Ren, Yingqian Cui Published: 2025-06-10Area: Model EditingCitations: 5 Tags: ai-safety, model-editing, safety-evaluation, survey | 2025-06-10 | Model Editing | ai-safety, model-editing, safety-evaluation, survey | E6 / R3 (96%) | 5 |
| Detecting High-Stakes Interactions with Activation Probes Alex McKenzie, David Krueger, Dmitrii Krasheninnikov, Ekdeep Singh Lubana Published: 2025-06-12Area: Safety EvaluationCitations: 13 Tags: ai-safety, empirical, safety-evaluation | 2025-06-12 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (97%) | 13 |
| OpenUnlearning: Accelerating LLM Unlearning via Unified Benchmarking of Methods and Metrics Andrew McCallum, Anmol Mekala, J. Zico Kolter, Pratyush Maini Published: 2025-06-14Area: Model EditingCitations: 21 Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-06-14 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E5 / R4 (99%) | 21 |
| ContextBench: Modifying Contexts for Targeted Latent Activation Alexander Chia, Edward Stevinson, Joseph Isaac Bloom, Joseph Miller Published: 2025-06-15Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-06-15 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (96%) | - |
| Calibrated Predictive Lower Bounds on Time-to-Unsafe-Sampling in LLMs Gilad Freidkin, Hen Davidov, Shai Feldman, Yaniv Romano Published: 2025-06-16Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, theoretical | 2025-06-16 | Safety Evaluation | ai-safety, safety-evaluation, theoretical | E5 / R3 (95%) | - |
| FORTRESS: Frontier Risk Evaluation for National Security and Public Safety Christina Q. Knight, Julian Michael, Kaustubh Deshpande, Meher Mankikar Published: 2025-06-17Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-17 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (99%) | 6 |
| ROSE: Toward Reality-Oriented Safety Evaluation of Large Language Models Cong Wang, Jiale Ding, Wei-Bin Lee, Xiang Zheng Published: 2025-06-17Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-06-17 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | - |
| Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers Haritz Puerto, Martin Gubri, Sangdoo Yun, Seong Joon Oh Published: 2025-06-18Area: Safety EvaluationCitations: 14 Tags: ai-safety, empirical, safety-evaluation | 2025-06-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 14 |
| IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks Dongrui Liu, Jing Shao, Lu Sheng, Weichen Zhang Published: 2025-06-19Area: Safety EvaluationCitations: 8 Tags: ai-safety, benchmark, safety-evaluation | 2025-06-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 8 |
| PL-Guard: Benchmarking Language Model Safety for Polish Aleksandra Krasnod臋bska, Karolina Seweryn, Szymon 艁ukasik, Wojciech Kusa Published: 2025-06-19Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-19 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 1 |
| PRISON: Unmasking the Criminal Potential of Large Language Models Geng Hong, Min Yang, Pei Chen, Xinyi Wu Published: 2025-06-19Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-06-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R3 (96%) | 3 |
| Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know? Anirudha Majumdar, Christina Zhang, Justin Lidard, Ola Shorinwa Published: 2025-06-22Area: Safety EvaluationCitations: 12 Tags: ai-safety, empirical, safety-evaluation | 2025-06-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | 12 |
| Cross-Layer Discrete Concept Discovery for Interpreting Language Models Ankur Garg, Hassan Sajjad, Samira Ebrahimi Kahou, Xuemin Yu Published: 2025-06-24Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-06-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E6 / R3 (95%) | 1 |
| PrivacyXray: Detecting Privacy Breaches in LLMs through Semantic Consistency and Probability Certainty Jinwen He, Kai Chen, Yiyang Lu, Yue Zhao Published: 2025-06-24Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-06-24 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R4 (96%) | 1 |
| A Survey on Model Extraction Attacks and Defenses for Large Language Models Kaixiang Zhao, Kaize Ding, Lincan Li, Neil Zhenqiang Gong Published: 2025-06-26Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-06-26 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, survey | E5 / R3 (95%) | 11 |
| Attestable Audits: Verifiable AI Safety Benchmarks Using Trusted Execution Environments Alastair R. Beresford, Bill Marino, Christoph Schnabl, Daniel Hugenroth Published: 2025-06-30Area: Safety EvaluationCitations: 4 Tags: ai-safety, safety-evaluation, tool | 2025-06-30 | Safety Evaluation | ai-safety, safety-evaluation, tool | E5 / R3 (97%) | 4 |
| SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents Aishan Liu, Ee-Chien Chang, Jinyuan He, Siyuan Liang Published: 2025-07-01Area: Agent SafetyCitations: 5 Tags: adversarial-robustness, agent-safety, ai-safety, empirical, safety-evaluation | 2025-07-01 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical, safety-evaluation | E5 / R4 (95%) | 5 |
| Probing and Steering Evaluation Awareness of Language Models Carlo Leonardo Attubato, Felix Hofst盲tter, Jord Nguyen, Khiem Hoang Published: 2025-07-02Area: Deception & FailureCitations: 8 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-07-02 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (93%) | 8 |
| The Bitter Lesson of Misuse Detection Charbel-Rapha毛l Segerie, Diego Dorn, Hadrien Mariaccia Published: 2025-07-08Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-07-08 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | - |
| The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models Adam Gleave, Ann-Kathrin Dombrowski, Chris Cundy, Dillon Bowen Published: 2025-07-08Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-07-08 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (94%) | - |