Edoardo Debenedetti
- Defeating Prompt Injections by Design
2025/03/24 by Edoardo Debenedetti, Debenedetti, Edoardo, Ilia Shumailov +17 · 23 voices · 59 citations
#cs.CR #cs.AI
- Design Patterns for Securing LLM Agents against Prompt Injections
2025/06/10 by Luca Beurer-Kellner, Beat Buesser, Beurer-Kellner, Luca +25 · 10 voices · 19 citations
Computer Science · #Adversarial Robustness in Machine Learning #Explainable Artificial Intelligence (XAI) #Topic Modeling
- JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
2024/03/28 by Patrick Chao, Edoardo Debenedetti, Chao, Patrick +21 · 92 citations
Computer Science · #Authorship Attribution and Profiling #Cryptography and Security (cs.CR) #Digital and Cyber Forensics #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques
- Adversarial Search Engine Optimization for Large Language Models
2024/06/26 by Fredrik Nestaas, Nestaas, Fredrik, Edoardo Debenedetti +3 · 3 voices · 11 citations
#cs.CR #cs.LG
- Privacy Side Channels in Machine Learning Systems
2023/09/11 by Edoardo Debenedetti, Giorgio Severi, Debenedetti, Edoardo +13 · 4 citations
Computer Science · #Adversarial Robustness in Machine Learning #Cryptography and Data Security #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Privacy-Preserving Technologies in Data
- Exploring Memorization and Copyright Violation in Frontier LLMs: A Study of the New York Times v. OpenAI 2023 Lawsuit
2024/12/09 by Joshua Freeman, Freeman, Joshua, Chloe Rippe +5 · 5 citations
Social Sciences · Business, Management and Accounting · #Legal Systems and Judicial Processes #Intellectual Property Law #Business Law and Ethics
- Measuring Non-Adversarial Reproduction of Training Data in Large Language Models
2024/11/15 by Michael Aerni, Javier Rando, Aerni, Michael +9 · 2 voices · 2 citations
Computer Science · #Adversarial Robustness in Machine Learning #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Topic Modeling #cs.CL #cs.LG
- AutoAdvExBench: Benchmarking autonomous exploitation of adversarial example defenses
2025/03/03 by Nicholas Carlini, Javier Rando, Carlini, Nicholas +7 · 3 citations
Computer Science · #Adversarial Robustness in Machine Learning #Advanced Malware Detection Techniques #Security and Verification in Computing
- AI Risk Management Should Incorporate Both Safety and Security
2024/05/29 by Xiangyu Qi, Qi, Xiangyu, Yangsibo Huang +47 · 1 citation
Medicine · Social Sciences · #Artificial Intelligence (cs.AI) #Artificial Intelligence in Healthcare and Education #Cryptography and Security (cs.CR) #Ethics and Social Impacts of AI #FOS: Computer and information sciences