Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| Jinx: Unlimited LLMs for Probing Alignment Failures Jiahao Zhao, Liwei Dong Published: 2025-08-11Area: Safety EvaluationCitations: - Tags: ai-safety, alignment-training, safety-evaluation, tool | 2025-08-11 | Safety Evaluation | ai-safety, alignment-training, safety-evaluation, tool | E6 / R4 (96%) | - |
| Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models Aiwei Liu, Bolin Ding, Felix Henry, Leyi Pan Published: 2025-08-10Area: Multimodal SafetyCitations: 2 Tags: ai-safety, benchmark, multimodal-safety, safety-evaluation | 2025-08-10 | Multimodal Safety | ai-safety, benchmark, multimodal-safety, safety-evaluation | E5 / R3 (96%) | 2 |
| Who's the Evil Twin? Differential Auditing for Undesired Behavior Greta Kintzley, Ishwar Balappanawar, Ronan Azimi-Mancel, Satvik Golechha Published: 2025-08-09Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-08-09 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | - |
| Automatic LLM Red Teaming Arunesh Sinha, Pradeep Varakantham, Roman Belaire Published: 2025-08-06Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, red-teaming, safety-evaluation | 2025-08-06 | Safety Evaluation | ai-safety, empirical, red-teaming, safety-evaluation | E5 / R3 (93%) | 1 |
| ASTRA: Autonomous Spatial-Temporal Red-teaming for AI Software Assistants Chengpeng Wang, Guangyu Shen, Hanxi Guo, Jiasheng Jiang Published: 2025-08-05Area: Safety EvaluationCitations: 3 Tags: ai-safety, empirical, safety-evaluation | 2025-08-05 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | 3 |
| Estimating Worst-Case Frontier Risks of Open-Weight LLMs Chris Koch, Eric Wallace, Kai Chen, Miles Wang Published: 2025-08-05Area: Safety EvaluationCitations: 16 Tags: ai-safety, empirical, safety-evaluation | 2025-08-05 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (95%) | 16 |
| Towards Evaluation for Real-World LLM Unlearning Ke Miao, Kui Ren, Wenjie Bao, Xiaochen Li Published: 2025-08-02Area: Model EditingCitations: - Tags: ai-safety, benchmark, model-editing, safety-evaluation | 2025-08-02 | Model Editing | ai-safety, benchmark, model-editing, safety-evaluation | E4 / R3 (95%) | - |
| Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems Hisashi Kashima, Jiyi Li, Koh Takeuchi, Kyohei Atarashi Published: 2025-07-31Area: Adversarial RobustnessCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-07-31 | Adversarial Robustness | adversarial-robustness, ai-safety, empirical, safety-evaluation | E5 / R3 (94%) | - |
| LLMs Can Covertly Sandbag on Capability Evaluations Against Chain-of-Thought Monitoring Chloe Li, Mary Phuong, Noah Y. Siegel Published: 2025-07-31Area: Deception & FailureCitations: 6 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-07-31 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E6 / R3 (97%) | 6 |
| A Survey on Generative Model Unlearning: Fundamentals, Taxonomy, Evaluation, and Future Direction Chaochao Chen, Chengye Wang, Fengyuan Yu, Jiaming Zhang Published: 2025-07-26Area: Surveys & ReviewsCitations: 2 Tags: ai-safety, safety-evaluation, survey, surveys-reviews | 2025-07-26 | Surveys & Reviews | ai-safety, safety-evaluation, survey, surveys-reviews | E5 / R3 (93%) | 2 |
| PrompTrend: Continuous Community-Driven Vulnerability Discovery and Assessment for Large Language Models Jihene Bennaceur, Mootez Aloui, Ramzi Guesmi, Tarek Gasmi Published: 2025-07-25Area: Safety EvaluationCitations: - Tags: ai-safety, empirical, safety-evaluation | 2025-07-25 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E4 / R3 (97%) | - |
| From Seed to Harvest: Augmenting Human Creativity with AI for Red-teaming Text-to-Image Models Alicia Parrish, Charvi Rastogi, Jessica Quaye, Lora Aroyo Published: 2025-07-23Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, empirical, safety-evaluation | 2025-07-23 | Safety Evaluation | adversarial-robustness, ai-safety, empirical, safety-evaluation | E4 / R3 (96%) | - |
| TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law Ehsan Shareghi, Nigel Collier, Yijiang River Dong, Zheng Hui Published: 2025-07-22Area: Safety EvaluationCitations: 4 Tags: ai-safety, benchmark, safety-evaluation | 2025-07-22 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R4 (99%) | 4 |
| Can We Predict Alignment Before Models Finish Thinking? Towards Monitoring Misaligned Reasoning Models Stephen H. Bach, Yik Siu Chan, Zheng-Xin Yong Published: 2025-07-16Area: Safety EvaluationCitations: 9 Tags: ai-safety, alignment-training, empirical, safety-evaluation | 2025-07-16 | Safety Evaluation | ai-safety, alignment-training, empirical, safety-evaluation | E5 / R3 (94%) | 9 |
| BlueGlass: A Framework for Composite AI Safety Harshal Nandigramwar, Kay-Ulrich Scholl, Syed Qutub Published: 2025-07-14Area: Safety EvaluationCitations: - Tags: ai-safety, safety-evaluation, tool | 2025-07-14 | Safety Evaluation | ai-safety, safety-evaluation, tool | E5 / R3 (95%) | - |
| GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing Haibo Jin, Haohan Wang, Liying Kang, Peiyan Zhang Published: 2025-07-10Area: Adversarial RobustnessCitations: 3 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-07-10 | Adversarial Robustness | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | 3 |
| The Bitter Lesson of Misuse Detection Charbel-Rapha毛l Segerie, Diego Dorn, Hadrien Mariaccia Published: 2025-07-08Area: Safety EvaluationCitations: - Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-07-08 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E5 / R3 (95%) | - |
| The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models Adam Gleave, Ann-Kathrin Dombrowski, Chris Cundy, Dillon Bowen Published: 2025-07-08Area: Safety EvaluationCitations: - Tags: ai-safety, benchmark, safety-evaluation | 2025-07-08 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E6 / R4 (94%) | - |
| Probing and Steering Evaluation Awareness of Language Models Carlo Leonardo Attubato, Felix Hofst盲tter, Jord Nguyen, Khiem Hoang Published: 2025-07-02Area: Deception & FailureCitations: 8 Tags: ai-safety, deception-failure, empirical, safety-evaluation | 2025-07-02 | Deception & Failure | ai-safety, deception-failure, empirical, safety-evaluation | E5 / R3 (93%) | 8 |
| SafeMobile: Chain-level Jailbreak Detection and Automated Evaluation for Multimodal Mobile Agents Aishan Liu, Ee-Chien Chang, Jinyuan He, Siyuan Liang Published: 2025-07-01Area: Agent SafetyCitations: 5 Tags: adversarial-robustness, agent-safety, ai-safety, empirical, safety-evaluation | 2025-07-01 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical, safety-evaluation | E5 / R4 (95%) | 5 |
| Attestable Audits: Verifiable AI Safety Benchmarks Using Trusted Execution Environments Alastair R. Beresford, Bill Marino, Christoph Schnabl, Daniel Hugenroth Published: 2025-06-30Area: Safety EvaluationCitations: 4 Tags: ai-safety, safety-evaluation, tool | 2025-06-30 | Safety Evaluation | ai-safety, safety-evaluation, tool | E5 / R3 (97%) | 4 |
| A Survey on Model Extraction Attacks and Defenses for Large Language Models Kaixiang Zhao, Kaize Ding, Lincan Li, Neil Zhenqiang Gong Published: 2025-06-26Area: Adversarial RobustnessCitations: 11 Tags: adversarial-robustness, ai-safety, safety-evaluation, survey | 2025-06-26 | Adversarial Robustness | adversarial-robustness, ai-safety, safety-evaluation, survey | E5 / R3 (95%) | 11 |
| Cross-Layer Discrete Concept Discovery for Interpreting Language Models Ankur Garg, Hassan Sajjad, Samira Ebrahimi Kahou, Xuemin Yu Published: 2025-06-24Area: Mechanistic Interp.Citations: 1 Tags: ai-safety, empirical, mechanistic-interp, safety-evaluation | 2025-06-24 | Mechanistic Interp. | ai-safety, empirical, mechanistic-interp, safety-evaluation | E6 / R3 (95%) | 1 |
| PrivacyXray: Detecting Privacy Breaches in LLMs through Semantic Consistency and Probability Certainty Jinwen He, Kai Chen, Yiyang Lu, Yue Zhao Published: 2025-06-24Area: Safety EvaluationCitations: 1 Tags: ai-safety, empirical, safety-evaluation | 2025-06-24 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R4 (96%) | 1 |
| Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know? Anirudha Majumdar, Christina Zhang, Justin Lidard, Ola Shorinwa Published: 2025-06-22Area: Safety EvaluationCitations: 12 Tags: ai-safety, empirical, safety-evaluation | 2025-06-22 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E6 / R3 (94%) | 12 |
| IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks Dongrui Liu, Jing Shao, Lu Sheng, Weichen Zhang Published: 2025-06-19Area: Safety EvaluationCitations: 8 Tags: ai-safety, benchmark, safety-evaluation | 2025-06-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E5 / R3 (97%) | 8 |
| PL-Guard: Benchmarking Language Model Safety for Polish Aleksandra Krasnod臋bska, Karolina Seweryn, Szymon 艁ukasik, Wojciech Kusa Published: 2025-06-19Area: Safety EvaluationCitations: 1 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-19 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (95%) | 1 |
| PRISON: Unmasking the Criminal Potential of Large Language Models Geng Hong, Min Yang, Pei Chen, Xinyi Wu Published: 2025-06-19Area: Safety EvaluationCitations: 3 Tags: ai-safety, benchmark, safety-evaluation | 2025-06-19 | Safety Evaluation | ai-safety, benchmark, safety-evaluation | E7 / R3 (96%) | 3 |
| Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers Haritz Puerto, Martin Gubri, Sangdoo Yun, Seong Joon Oh Published: 2025-06-18Area: Safety EvaluationCitations: 14 Tags: ai-safety, empirical, safety-evaluation | 2025-06-18 | Safety Evaluation | ai-safety, empirical, safety-evaluation | E5 / R3 (93%) | 14 |
| FORTRESS: Frontier Risk Evaluation for National Security and Public Safety Christina Q. Knight, Julian Michael, Kaustubh Deshpande, Meher Mankikar Published: 2025-06-17Area: Safety EvaluationCitations: 6 Tags: adversarial-robustness, ai-safety, benchmark, safety-evaluation | 2025-06-17 | Safety Evaluation | adversarial-robustness, ai-safety, benchmark, safety-evaluation | E6 / R3 (99%) | 6 |