vix.ing · top · new · best · stats · spec

Jones, Erik

  1. Best-of-N Jailbreaking
    2024/12/04 by John D. Hughes, John Hughes, Hughes, John +18 · 17 voices · 17 citations
    Computer Science · #Digital and Cyber Forensics #cs.AI #cs.CL #cs.LG
  2. Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples
    2025/10/08 by Alexandra Souly, Javier Rando, Souly, Alexandra +25 · 34 voices · 19 citations
    Medicine · #Medical Imaging and Pathology Studies
  3. Orca 2: Teaching Small Language Models How to Reason
    2023/11/18 by Arindam Mitra, Luciano Del Corro, Mitra, Arindam +30 · 3 voices · 21 citations
    Computer Science · #Explainable Artificial Intelligence (XAI) #Natural Language Processing Techniques #Topic Modeling #cs.AI
  4. Automatically Auditing Large Language Models via Discrete Optimization
    2023/03/08 by Erik Jones, Anca D. Dragan, Jones, Erik +5 · 21 citations
    Computer Science · Engineering · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Infrastructure Maintenance and Monitoring #Machine Learning (cs.LG) #Machine Learning and Data Classification #Software Engineering Research
  5. Feedback Loops With Language Models Drive In-Context Reward Hacking
    2024/02/09 by Alexander Pan, Pan, Alexander, Erik Jones +5 · 1 voice · 17 citations
    Computer Science · #Advanced Malware Detection Techniques #Software Testing and Debugging Techniques #Formal Methods in Verification
  6. Capturing Failures of Large Language Models via Human Cognitive Biases
    2022/02/24 by Erik Jones, Jones, Erik, Jacob Steinhardt +1 · 12 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Software Engineering Research #Topic Modeling
  7. How Do Large Language Monkeys Get Their Power (Laws)?
    2025/02/24 by Rylan Schaeffer, Joshua Kazdan, Schaeffer, Rylan +18 · 1 voice · 11 citations
    Computer Science · Social Sciences · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Language and cultural evolution #Machine Learning (cs.LG) #cs.AI #cs.LG
  8. Attention Satisfies: A Constraint-Satisfaction Lens on Factual Errors of Language Models
    2023/09/26 by Mert Yüksekgönül, Yuksekgonul, Mert, Varun Chandrasekaran +13 · 12 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
  9. Teaching Language Models to Hallucinate Less with Synthetic Tasks
    2023/10/10 by Jones, Erik, Palangi, Hamid, Simões, Clarisse +5 · 5 citations
    #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  10. Mass-Producing Failures of Multimodal Systems with Language Models
    2023/06/21 by Shengbang Tong, Erik Jones, Tong, Shengbang +3 · 4 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Software Engineering (cs.SE) #Software Engineering Research #Software Engineering Techniques and Practices #Software System Performance and Reliability
  11. Robust Encodings: A Framework for Combating Adversarial Typos
    2020/05/04 by Erik Jones, Robin Jia, Jones, Erik +5 · 2 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Computation and Language (cs.CL) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Software Engineering Research #Topic Modeling
  12. Selective Classification Can Magnify Disparities Across Groups
    2020/10/27 by Erik Jones, Shiori Sagawa, Jones, Erik +7 · 2 citations
    Computer Science · #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Machine Learning and Data Classification
  13. Adversaries Can Misuse Combinations of Safe Models
    2024/06/20 by Erik Jones, Jones, Erik, Anca D. Dragan +3 · 3 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Physical Unclonable Functions (PUFs) and Hardware Security
  14. Beyond Data Filtering: Knowledge Localization for Capability Removal in LLMs
    2025/12/05 by Igor Shilov, Alex Cloud, Shilov, Igor +13 · 2 voices · 1 citation
    Computer Science · #Adversarial Robustness in Machine Learning #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning and Data Classification #cs.LG
  15. Forecasting Rare Language Model Behaviors
    2025/02/24 by Jones, Erik, Meg Tong, Jesse Mu +16 · 3 citations
    Computer Science · #Natural Language Processing Techniques #Topic Modeling #Text Readability and Simplification