Jones, Erik
- Best-of-N Jailbreaking
2024/12/04 by John D. Hughes, John Hughes, Hughes, John +18 · 17 voices · 17 citations
Computer Science · #Digital and Cyber Forensics #cs.AI #cs.CL #cs.LG
- Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples
2025/10/08 by Alexandra Souly, Javier Rando, Souly, Alexandra +25 · 34 voices · 19 citations
Medicine · #Medical Imaging and Pathology Studies
- Orca 2: Teaching Small Language Models How to Reason
2023/11/18 by Arindam Mitra, Luciano Del Corro, Mitra, Arindam +30 · 3 voices · 21 citations
Computer Science · #Explainable Artificial Intelligence (XAI) #Natural Language Processing Techniques #Topic Modeling #cs.AI
- Automatically Auditing Large Language Models via Discrete Optimization
2023/03/08 by Erik Jones, Anca D. Dragan, Jones, Erik +5 · 21 citations
Computer Science · Engineering · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Infrastructure Maintenance and Monitoring #Machine Learning (cs.LG) #Machine Learning and Data Classification #Software Engineering Research
- Feedback Loops With Language Models Drive In-Context Reward Hacking
2024/02/09 by Alexander Pan, Pan, Alexander, Erik Jones +5 · 1 voice · 17 citations
Computer Science · #Advanced Malware Detection Techniques #Software Testing and Debugging Techniques #Formal Methods in Verification
- Capturing Failures of Large Language Models via Human Cognitive Biases
2022/02/24 by Erik Jones, Jones, Erik, Jacob Steinhardt +1 · 12 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Software Engineering Research #Topic Modeling
- How Do Large Language Monkeys Get Their Power (Laws)?
2025/02/24 by Rylan Schaeffer, Joshua Kazdan, Schaeffer, Rylan +18 · 1 voice · 11 citations
Computer Science · Social Sciences · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Language and cultural evolution #Machine Learning (cs.LG) #cs.AI #cs.LG
- Attention Satisfies: A Constraint-Satisfaction Lens on Factual Errors of Language Models
2023/09/26 by Mert Yüksekgönül, Yuksekgonul, Mert, Varun Chandrasekaran +13 · 12 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
- Teaching Language Models to Hallucinate Less with Synthetic Tasks
2023/10/10 by Jones, Erik, Palangi, Hamid, Simões, Clarisse +5 · 5 citations
#Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)
- Mass-Producing Failures of Multimodal Systems with Language Models
2023/06/21 by Shengbang Tong, Erik Jones, Tong, Shengbang +3 · 4 citations
Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Software Engineering (cs.SE) #Software Engineering Research #Software Engineering Techniques and Practices #Software System Performance and Reliability
- Robust Encodings: A Framework for Combating Adversarial Typos
2020/05/04 by Erik Jones, Robin Jia, Jones, Erik +5 · 2 citations
Computer Science · #Adversarial Robustness in Machine Learning #Computation and Language (cs.CL) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Software Engineering Research #Topic Modeling
- Selective Classification Can Magnify Disparities Across Groups
2020/10/27 by Erik Jones, Shiori Sagawa, Jones, Erik +7 · 2 citations
Computer Science · #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Machine Learning and Data Classification
- Adversaries Can Misuse Combinations of Safe Models
2024/06/20 by Erik Jones, Jones, Erik, Anca D. Dragan +3 · 3 citations
Computer Science · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Physical Unclonable Functions (PUFs) and Hardware Security
- Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs
2025/12/05 by Igor Shilov, Alex Cloud, Shilov, Igor +13 · 2 voices · 1 citation
Computer Science · #Adversarial Robustness in Machine Learning #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning and Data Classification #cs.LG
- Forecasting Rare Language Model Behaviors
2025/02/24 by Jones, Erik, Meg Tong, Jesse Mu +16 · 3 citations
Computer Science · #Natural Language Processing Techniques #Topic Modeling #Text Readability and Simplification