Florian Tramèr
- Large-scale online deanonymization with LLMs
LLMs enable scalable, high-precision deanonymization of pseudonymous online accounts using unstructured text.
2026/02/18 by Simon Lermen, Daniel Paleka, Joshua Swanson +3 · 85 voices · 1 citation
#cs.CR #cs.AI #cs.LG
- Scalable Extraction of Training Data from (Production) Language Models
2023/11/28 by Milad Nasr, Nicholas Carlini, Nasr, Milad +17 · 21 voices · 66 citations
Computer Science · #Adversarial Robustness in Machine Learning #Topic Modeling #Explainable Artificial Intelligence (XAI)
- On the Opportunities and Risks of Foundation Models
2021/08/16 by Rishi Bommasani, Drew A. Hudson, Bommasani, Rishi +233 · 11 voices · 534 citations
Computer Science · #Domain Adaptation and Few-Shot Learning #Adversarial Robustness in Machine Learning #Topic Modeling
- Defeating Prompt Injections by Design
2025/03/24 by Edoardo Debenedetti, Debenedetti, Edoardo, Ilia Shumailov +17 · 23 voices · 59 citations
#cs.CR #cs.AI
- Adversarial Perturbations Cannot Reliably Protect Artists From Generative AI
2024/06/17 by Robert Hönig, Hönig, Robert, Javier Rando +5 · 38 voices · 7 citations
Computer Science · #Adversarial Robustness in Machine Learning #cs.CR
- Extracting Training Data from Diffusion Models
2023/01/30 by Nicholas Carlini, Carlini, Nicholas, Jamie Hayes +15 · 9 voices · 102 citations
Computer Science · #Generative Adversarial Networks and Image Synthesis
- Stealing Machine Learning Models via Prediction APIs
2016/09/09 by Florian Tramèr, Tramèr, Florian, Fan Zhang +7 · 3 voices · 49 citations
#cs.CR #cs.LG #stat.ML
- Poisoning Web-Scale Training Datasets is Practical
2023/02/20 by Nicholas Carlini, Matthew Jagielski, Carlini, Nicholas +16 · 6 voices · 46 citations
Computer Science · Medicine · #Adversarial Robustness in Machine Learning #COVID-19 diagnosis using AI #Topic Modeling #cs.CR #cs.LG
- Extracting Training Data from Large Language Models
2020/12/14 by Nicholas Carlini, Carlini, Nicholas, Florian Tramèr +25 · 8 voices · 239 citations
Computer Science · #Adversarial Robustness in Machine Learning #Privacy-Preserving Technologies in Data #Topic Modeling #cs.CL #cs.CR #cs.LG
- Stealing Part of a Production Language Model
2024/03/11 by Nicholas Carlini, Carlini, Nicholas, Daniel Paleka +26 · 11 voices · 26 citations
Computer Science · #Natural Language Processing Techniques #cs.CR
- Design Patterns for Securing LLM Agents against Prompt Injections
2025/06/10 by Luca Beurer-Kellner, Beat Buesser, Beurer-Kellner, Luca +25 · 10 voices · 19 citations
Computer Science · #Adversarial Robustness in Machine Learning #Explainable Artificial Intelligence (XAI) #Topic Modeling
- Advances and Open Problems in Federated Learning
2020/12/02 by Peter Kairouz, H. Brendan McMahan, Brendan Avent +56 · 190 citations
Computer Science · #Cryptography and Data Security #Mobile Crowdsensing and Crowdsourcing #Privacy-Preserving Technologies in Data
- Persistent Pre-Training Poisoning of LLMs
2024/10/17 by Yiming Zhang, Javier Rando, Zhang, Yiming +13 · 3 voices · 20 citations
#cs.CR #cs.AI
- Membership Inference Attacks From First Principles
2021/12/07 by Nicholas Carlini, Steve Chien, Carlini, Nicholas +9 · 98 citations
Computer Science · #Adversarial Robustness in Machine Learning #Anomaly Detection Techniques and Applications #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG)
- Quantifying Memorization Across Neural Language Models
2022/02/15 by Nicholas Carlini, Daphne Ippolito, Carlini, Nicholas +9 · 73 citations
Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
- JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
2024/03/28 by Patrick Chao, Chao, Patrick, Edoardo Debenedetti +21 · 90 citations
Computer Science · #Authorship Attribution and Profiling #Cryptography and Security (cs.CR) #Digital and Cyber Forensics #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques
- Large Language Models Can Be Strong Differentially Private Learners
2021/10/12 by Xuechen Li, Florian Tramèr, Li, Xuechen +5 · 43 citations
Computer Science · #Privacy-Preserving Technologies in Data #Stochastic Gradient Optimization Techniques #Domain Adaptation and Few-Shot Learning
- Label-Only Membership Inference Attacks
2020/07/28 by Christopher A. Choquette-Choo, Florian Tramèr, Choquette-Choo, Christopher A. +5 · 32 citations
Computer Science · #Adversarial Robustness in Machine Learning #Privacy-Preserving Technologies in Data #Machine Learning and Algorithms
- The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections
2025/10/10 by Milad Nasr, Nicholas Carlini, Nasr, Milad +27 · 4 voices · 17 citations
Computer Science · #Adversarial Robustness in Machine Learning #Network Security and Intrusion Detection #Security and Verification in Computing #cs.CR #cs.LG
- Red-Teaming the Stable Diffusion Safety Filter
2022/10/03 by Javier Rando, Daniel Paleka, Rando, Javier +6 · 27 citations
Computer Science · #Generative Adversarial Networks and Image Synthesis #Digital Media Forensic Detection #Adversarial Robustness in Machine Learning
- What Does it Mean for a Language Model to Preserve Privacy?
2022/02/11 by Hannah Brown, Katherine Lee, Brown, Hannah +7 · 22 citations
Computer Science · #Privacy-Preserving Technologies in Data
- Slalom: Fast, Verifiable and Private Execution of Neural Networks in Trusted Hardware
2018/06/08 by Florian Tramèr, Tramèr, Florian, Dan Boneh +1 · 16 citations
Computer Science · #Adversarial Robustness in Machine Learning #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Physical Unclonable Functions (PUFs) and Hardware Security #Security and Verification in Computing
- Preventing Verbatim Memorization in Language Models Gives a False Sense of Privacy
2022/10/31 by Daphne Ippolito, Ippolito, Daphne, Florian Tramèr +13 · 23 citations
Computer Science · #Adversarial Robustness in Machine Learning #Computation and Language (cs.CL) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Topic Modeling
- The Privacy Onion Effect: Memorization is Relative
2022/06/21 by Nicholas Carlini, Carlini, Nicholas, Matthew Jagielski +9 · 18 citations
Computer Science · Social Sciences · #Adversarial Robustness in Machine Learning #Cryptography and Security (cs.CR) #Ethics and Social Impacts of AI #FOS: Computer and information sciences #Machine Learning (cs.LG) #Privacy-Preserving Technologies in Data
- Adversarial Training and Robustness for Multiple Perturbations
2019/04/30 by Florian Tramèr, Dan Boneh, Tramèr, Florian +1 · 12 citations
Computer Science · Biochemistry, Genetics and Molecular Biology · #Adversarial Robustness in Machine Learning #Bacillus and Francisella bacterial research
- Physical Adversarial Examples for Object Detectors
2018/07/20 by Kevin Eykholt, Ivan Evtimov, Eykholt, Kevin +15 · 17 citations
Computer Science · #Adversarial Robustness in Machine Learning #Advanced Malware Detection Techniques #Physical Unclonable Functions (PUFs) and Hardware Security
- An Adversarial Perspective on Machine Unlearning for AI Safety
2024/09/26 by Jakub Łucki, Boyi Wei, Łucki, Jakub +9 · 3 voices · 19 citations
Computer Science · #Adversarial Robustness in Machine Learning #cs.AI #cs.CL #cs.CR #cs.LG
- Counterfactual Memorization in Neural Language Models
2021/12/24 by Chiyuan Zhang, Zhang, Chiyuan, Daphne Ippolito +9 · 12 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
- Measuring Forgetting of Memorized Training Examples
2022/06/30 by Matthew Jagielski, Om Thakkar, Jagielski, Matthew +19 · 12 citations
Computer Science · #Adversarial Robustness in Machine Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Privacy-Preserving Technologies in Data #Topic Modeling
- Universal Jailbreak Backdoors from Poisoned Human Feedback
2023/11/24 by Javier Rando, Florian Tramèr, Rando, Javier +1 · 16 citations
Computer Science · #Adversarial Robustness in Machine Learning #Hate Speech and Cyberbullying Detection
- AgentDojo-PROV: A W3C PROV-O Corpus of LLM Agent Executions
2024/06/19 by Debenedetti, Edoardo, Jie Zhang, Zhang, Jie +8 · 19 citations
Computer Science · #Advanced Malware Detection Techniques #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multi-Agent Systems and Negotiation #Network Security and Intrusion Detection
- Adversarial Search Engine Optimization for Large Language Models
2024/06/26 by Fredrik Nestaas, Nestaas, Fredrik, Edoardo Debenedetti +3 · 3 voices · 11 citations
#cs.CR #cs.LG
- Position: Considerations for Differentially Private Learning with Large-Scale Public Pretraining
2022/12/13 by Florian Tramèr, Tramèr, Florian, Gautam Kamath +3 · 8 citations
Computer Science · #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Privacy-Preserving Technologies in Data
- Evaluating Superhuman Models with Consistency Checks
2023/06/16 by Lukas Fluri, Daniel Paleka, Fluri, Lukas +3 · 2 voices · 2 citations
Computer Science · #Explainable Artificial Intelligence (XAI) #Machine Learning and Data Classification #Statistical and Computational Modeling #cs.AI #cs.CR #cs.LG #stat.ML
- International AI Safety Report
2025/01/29 by Yoshua Bengio, Sören Mindermann, Bengio, Yoshua +180 · 17 citations
Social Sciences · #Artificial Intelligence (cs.AI) #Computers and Society (cs.CY) #Ethics and Social Impacts of AI #FOS: Computer and information sciences #Machine Learning (cs.LG)
- Membership Inference Attacks Cannot Prove that a Model Was Trained On Your Data
2024/09/29 by Jie Zhang, Debeshee Das, Zhang, Jie +5 · 1 voice · 10 citations
Computer Science · #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #cs.CR #cs.LG
- SoK: Watermarking for AI-Generated Content
2024/11/27 by Xuandong Zhao, Zhao, Xuandong, Sam Gunn +25 · 13 citations
Computer Science · #Advanced Steganography and Watermarking Techniques #Artificial Intelligence (cs.AI) #Chaos-based Image/Signal Encryption #Computer Graphics and Visualization Techniques #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG)
- (Certified!!) Adversarial Robustness for Free!
2022/06/21 by Nicholas Carlini, Carlini, Nicholas, Florian Tramèr +6 · 4 citations
Computer Science · Medicine · Engineering · #Adversarial Robustness in Machine Learning #COVID-19 diagnosis using AI #Advanced X-ray and CT Imaging
- Debugging Differential Privacy: A Case Study for Privacy Auditing
2022/02/24 by Florian Tramèr, Andreas Terzis, Tramer, Florian +9 · 3 citations
Computer Science · #Privacy-Preserving Technologies in Data #Cryptography and Data Security #Stochastic Gradient Optimization Techniques
- Privacy Side Channels in Machine Learning Systems
2023/09/11 by Edoardo Debenedetti, Giorgio Severi, Debenedetti, Edoardo +13 · 4 citations
Computer Science · #Adversarial Robustness in Machine Learning #Cryptography and Data Security #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Privacy-Preserving Technologies in Data
- CryptanalysisBench: Can LLMs do Cryptanalysis?
2026/07/20 by Lukas Fluri, Avital Shafran, Nicholas Carlini +5 · 3 voices
Computer Science · #cs.CR
- Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs
2024/04/22 by Javier Rando, Francesco Croce, Rando, Javier +11 · 4 citations
Computer Science · Economics, Econometrics and Finance · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Law, AI, and Intellectual Property #Law, Economics, and Judicial Systems #Machine Learning (cs.LG)
- SNAP: Efficient Extraction of Private Properties with Poisoning
2022/08/25 by Harsh Chaudhari, Chaudhari, Harsh, John Abascal +9 · 2 citations
Computer Science · Medicine · #Privacy-Preserving Technologies in Data #Adversarial Robustness in Machine Learning #Artificial Intelligence in Healthcare and Education
- Privacy Backdoors: Stealing Data with Corrupted Pretrained Models
2024/03/30 by Shanglun Feng, Feng, Shanglun, Florian Tramèr +1 · 3 citations
Computer Science · #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Privacy-Preserving Technologies in Data
- Fundamental Tradeoffs between Invariance and Sensitivity to Adversarial Perturbations
2020/02/11 by Florian Tramèr, Tramèr, Florian, Jens Behrmann +7 · 2 citations
Computer Science · #Adversarial Robustness in Machine Learning
- The Jailbreak Tax: How Useful are Your Jailbreak Outputs?
2025/04/14 by Kristina Nikolić, Nikolić, Kristina, Sun, Luze +4 · 7 citations
Computer Science · #Advanced Malware Detection Techniques #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #Cryptography and Security (cs.CR) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG)
- Exploiting Excessive Invariance caused by Norm-Bounded Adversarial\n Robustness
2019/03/25 by Jörn-Henrik Jacobsen, Jens Behrmann, Jacobsen, Jörn-Henrik +8 · 1 citation
Biochemistry, Genetics and Molecular Biology · Computer Science · #Adversarial Robustness in Machine Learning #Bacillus and Francisella bacterial research #Computer Vision and Pattern Recognition (cs.CV) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML)
- Measuring Non-Adversarial Reproduction of Training Data in Large Language Models
2024/11/15 by Michael Aerni, Aerni, Michael, Javier Rando +9 · 2 voices · 2 citations
Computer Science · #Adversarial Robustness in Machine Learning #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Topic Modeling #cs.CL #cs.LG
- Consistency Checks for Language Model Forecasters
2024/12/24 by Daniel Paleka, Paleka, Daniel, Abhimanyu Pallavi Sudhir +9 · 2 citations
Computer Science · #Natural Language Processing Techniques #Topic Modeling
- Evaluating the Robustness of the "Ensemble Everything Everywhere" Defense
2024/11/22 by Jie Zhang, Zhang, Jie, Christian Schlarmann +11 · 2 voices · 1 citation
#cs.LG #cs.CR
- Gradient-based Jailbreak Images for Multimodal Fusion Models
2024/10/04 by Javier Rando, Hannah Korevaar, Rando, Javier +7 · 2 citations
Engineering · Medicine · #Artificial Intelligence (cs.AI) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Medical Imaging Techniques and Applications #Medical Imaging and Analysis
- AutoAdvExBench: Benchmarking autonomous exploitation of adversarial example defenses
2025/03/03 by Nicholas Carlini, Javier Rando, Carlini, Nicholas +7 · 3 citations
Computer Science · #Adversarial Robustness in Machine Learning #Advanced Malware Detection Techniques #Security and Verification in Computing
- Pitfalls in Evaluating Language Model Forecasters
2025/05/31 by Daniel Paleka, Shashwat Goel, Paleka, Daniel +5 · 3 citations
Computer Science · #Natural Language Processing Techniques