Vaugrante, Laurène
- Compromising Honesty and Harmlessness in Language Models via Deception Attacks
2025/02/12 by Laurène Vaugrante, Vaugrante, Laurène, Francesca Carlon +5 · 5 citations
Computer Science · Medicine · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #Artificial Intelligence in Healthcare and Education #Computation and Language (cs.CL) #Computers and Society (cs.CY) #FOS: Computer and information sciences #Topic Modeling
- A Looming Replication Crisis in Evaluating Behavior in Language Models? Evidence and Solutions
2024/09/30 by Laurène Vaugrante, Vaugrante, Laurène, Mathias Niepert +3 · 2 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Natural Language Processing Techniques #Topic Modeling