Instant research discovery
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Search and browse arXiv CS/AI/ML papers, enriched with AI-generated insights.
Generate novel research ideas grounded in real arXiv papers with Brainstorm.
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
Showing 181-194 of 194 papers (page 7 of 7)路 26 ms
| Paper | Published | Area | Tags | Intel | Citations |
|---|---|---|---|---|---|
| R-Judge: Benchmarking Safety Risk Awareness for LLM Agents Binglin Zhou, Fangqi Li, Gongshen Liu, Lingzhong Dong Published: 2024-01-18Area: Agent SafetyCitations: 156 Tags: agent-safety, ai-safety, benchmark | 2024-01-18 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (96%) | 156 |
| Agent Alignment in Evolving Social Norms Qinyuan Cheng, Shimin Li, Tianxiang Sun, Xipeng Qiu Published: 2024-01-09Area: Agent SafetyCitations: 12 Tags: agent-safety, ai-safety, alignment-training, empirical | 2024-01-09 | Agent Safety | agent-safety, ai-safety, alignment-training, empirical | E5 / R3 (96%) | 12 |
| Evil Geniuses: Delving into the Safety of LLM-based Agents Hang Su, Jingyuan Zhang, Xiao Yang, Yinpeng Dong Published: 2023-11-20Area: Agent SafetyCitations: 101 Tags: adversarial-robustness, agent-safety, ai-safety, empirical | 2023-11-20 | Agent Safety | adversarial-robustness, agent-safety, ai-safety, empirical | E7 / R4 (95%) | 101 |
| Testing Language Model Agents Safely in the Wild Adam Tauman Kalai, Craig Swift, David Atkinson, David Bau Published: 2023-11-17Area: Agent SafetyCitations: 40 Tags: agent-safety, ai-safety, empirical | 2023-11-17 | Agent Safety | agent-safety, ai-safety, empirical | E4 / R2 (95%) | 40 |
| AI Systems of Concern Fazl Barez, Kayla Matteucci, Se谩n 脫 h脡igeartaigh, Shahar Avin Published: 2023-10-09Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, position | 2023-10-09 | Agent Safety | agent-safety, ai-safety, position | E5 / R3 (95%) | 1 |
| Identifying the Risks of LM Agents with an LM-Emulated Sandbox Andrew Wang, Chris J. Maddison, Honghua Dong, Jimmy Ba Published: 2023-09-25Area: Agent SafetyCitations: 217 Tags: agent-safety, ai-safety, tool | 2023-09-25 | Agent Safety | agent-safety, ai-safety, tool | E5 / R3 (95%) | 217 |
| Natural Selection Favors AIs over Humans Dan Hendrycks Published: 2023-03-28Area: Agent SafetyCitations: 40 Tags: agent-safety, ai-safety, position | 2023-03-28 | Agent Safety | agent-safety, ai-safety, position | E4 / R3 (93%) | 40 |
| What Would Jiminy Cricket Do? Towards Agents That Behave Morally Andy Zou, Bo Li, Christine Zhu, Dan Hendrycks Published: 2021-10-25Area: Agent SafetyCitations: 72 Tags: agent-safety, ai-safety, benchmark | 2021-10-25 | Agent Safety | agent-safety, ai-safety, benchmark | E5 / R3 (93%) | 72 |
| Open Problems in Cooperative AI Allan Dafoe, Edward Hughes, Joel Z. Leibo, Kate Larson Published: 2020-12-15Area: Agent SafetyCitations: 239 Tags: agent-safety, ai-safety, position | 2020-12-15 | Agent Safety | agent-safety, ai-safety, position | E6 / R5 (93%) | 239 |
| Avoiding Tampering Incentives in Deep RL via Decoupled Approval Jonathan Uesato, Ramana Kumar, Richard Ngo, Shane Legg Published: 2020-11-17Area: Agent SafetyCitations: 18 Tags: agent-safety, ai-safety, empirical | 2020-11-17 | Agent Safety | agent-safety, ai-safety, empirical | E5 / R4 (94%) | 18 |
| Aversion to external feedback suffices to ensure agent alignment Paulo Garcia Published: -Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, theoretical | - | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E5 / R3 (93%) | 1 |
| ControlArena: A Library for Running AI Control Experiments Adam Hanson, Alan Cooney, Arathi Mani, Asa Cooper Stickland Published: -Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, tool | - | Agent Safety | agent-safety, ai-safety, tool | E5 / R3 (98%) | - |
| Security Debt in LLM Agent Applications: A Measurement Study of Vulnerabilities and Mitigation Trade-offs Jiarun Dai, Min Yang, Yuan Zhang, Zhuoxiang Shen Published: -Area: Agent SafetyCitations: - Tags: agent-safety, ai-safety, empirical | - | Agent Safety | agent-safety, ai-safety, empirical | E4 / R3 (98%) | - |
| Toward Constitutional Autonomy in AI Systems: A Theoretical Framework for Aligned Agentic Intelligence William Torgbi Agbemabiese Published: -Area: Agent SafetyCitations: 1 Tags: agent-safety, ai-safety, alignment-training, theoretical | - | Agent Safety | agent-safety, ai-safety, alignment-training, theoretical | E4 / R3 (93%) | 1 |