vix.ing · top · new · best · stats · spec

Dawn Song

  1. The Secret Sharer: Evaluating and Testing Unintended Memorization in Neural Networks
    2018/02/22 by Nicholas Carlini, Carlini, Nicholas, Chang Liu +7 · 5 voices · 68 citations
    #cs.LG #cs.AI #cs.CR
  2. The False Promise of Imitating Proprietary LLMs
    2023/05/25 by Arnav Gudibande, Gudibande, Arnav, Eric Wallace +13 · 8 voices · 14 citations
    Computer Science · Engineering · #Topic Modeling #Ferroelectric and Negative Capacitance Devices #Software Engineering Research
  3. Extracting Training Data from Large Language Models
    2020/12/14 by Nicholas Carlini, Florian Tramèr, Florian Tramer +25 · 8 voices · 236 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Privacy-Preserving Technologies in Data #Topic Modeling #cs.CL #cs.CR #cs.LG
  4. SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks
    2026/02/13 by Xiangyi Li, Yimin Liu, Wenbo Chen +75 · 27 voices · 24 citations
    #cs.AI
  5. A Definition of AGI
    2025/10/21 by Dan Hendrycks, Dawn Song, Hendrycks, Dan +65 · 28 voices · 10 citations
    Psychology · Computer Science · #Cognitive Abilities and Testing #Computability, Logic, AI Algorithms #Cognitive Computing and Networks
  6. Measuring Massive Multitask Language Understanding
    2020/09/07 by Dan Hendrycks, Hendrycks, Dan, Collin Burns +11 · 1176 citations
    Computer Science · #Topic Modeling #Explainable Artificial Intelligence (XAI) #Natural Language Processing Techniques
  7. Measuring Mathematical Problem Solving With the MATH Dataset
    2021/03/05 by Dan Hendrycks, Hendrycks, Dan, Collin Burns +13 · 1031 citations
    Computer Science · #Topic Modeling #Natural Language Processing Techniques #Advanced Text Analysis Techniques
  8. Type-Constrained Code Generation with Language Models
    2025/04/12 by Niels Mündler, Jingxuan He, Hao Wang +3 · 17 voices · 21 citations
    Computer Science · #Model-Driven Software Engineering Techniques #Logic, programming, and type systems #Software Testing and Debugging Techniques
  9. Representation Engineering: A Top-Down Approach to AI Transparency
    2023/10/02 by Andy Zou, Zou, Andy, Long Phan +40 · 5 voices · 153 citations
    Computer Science · Engineering · #cs.LG #cs.AI #cs.CL #cs.CV #cs.CY
  10. Unique Identification of 50,000+ Virtual Reality Users from Head & Hand Motion Data
    2023/02/17 by Vivek Nair, Wenbo Guo, Justus Mattern +4 · 4 voices · 7 citations
    #cs.CR #cs.LG
  11. Measuring Agents in Production
    2025/12/02 by Melissa Z. Pan, Negar Arabzadeh, Pan, Melissa Z. +47 · 11 voices · 4 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computers and Society (cs.CY) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Software Engineering (cs.SE) #cs.AI #cs.CY #cs.LG #cs.SE
  12. Robust Physical-World Attacks on Deep Learning Models
    2017/07/27 by Kevin Eykholt, Eykholt, Kevin, Ivan Evtimov +15 · 3 voices · 1 citation
    #cs.CR #cs.LG
  13. The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution Generalization
    2020/06/29 by Dan Hendrycks, Steven Basart, Hendrycks, Dan +23 · 153 citations
    Computer Science · Biochemistry, Genetics and Molecular Biology · #Advanced Image Processing Techniques #Image and Signal Denoising Methods #Cell Image Analysis Techniques
  14. Advances and Open Problems in Federated Learning
    2020/12/02 by Peter Kairouz, H. Brendan McMahan, Brendan Avent +56 · 189 citations
    Computer Science · #Cryptography and Data Security #Mobile Crowdsensing and Crowdsourcing #Privacy-Preserving Technologies in Data
  15. Humanity's Last Exam
    2025/01/24 by Long Phan, Alice Gatti, Phan, Long +2240 · 9 voices · 103 citations
    #cs.LG #cs.AI #cs.CL
  16. Targeted Backdoor Attacks on Deep Learning Systems Using Data Poisoning
    2017/12/15 by Xinyun Chen, Chang Liu, Chen, Xinyun +7 · 143 citations
    Computer Science · Psychology · #Adversarial Robustness in Machine Learning #Advanced Malware Detection Techniques #Deception detection and forensic psychology
  17. Natural Adversarial Examples
    2019/07/16 by Dan Hendrycks, Kevin Zhao, Hendrycks, Dan +7 · 118 citations
    Computer Science · #Advanced Neural Network Applications #Adversarial Robustness in Machine Learning #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML)
  18. GPT-Neo: Large Scale Autoregressive Language Modeling with Mesh-Tensorflow
    2021/03/21 by Hendrycks, Dan, Basart, Steven, Kadavath, Saurav +14 · 113 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning and Data Classification #Software Engineering (cs.SE) #Software Engineering Research #Software Testing and Debugging Techniques
  19. Aligning AI With Shared Human Values
    2020/08/05 by Dan Hendrycks, Collin Burns, Hendrycks, Dan +11 · 92 citations
    Computer Science · Social Sciences · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computers and Society (cs.CY) #Ethics and Social Impacts of AI #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Topic Modeling
  20. Delving into Transferable Adversarial Examples and Black-box Attacks
    2016/11/08 by Yanpei Liu, Liu, Yanpei, Xinyun Chen +5 · 75 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Security and Verification in Computing #Physical Unclonable Functions (PUFs) and Hardware Security
  21. How malicious AI swarms can threaten democracy
    2025/05/18 by Daniel Thilo Schroeder, Meeyoung Cha, Schroeder, Daniel Thilo +46 · 10 voices · 11 citations
    Computer Science · Social Sciences · #Adversarial Robustness in Machine Learning #Ethics and Social Impacts of AI #Network Security and Intrusion Detection
  22. Learning to Reason without External Rewards
    2025/05/26 by Xuandong Zhao, Zhewei Kang, Zhao, Xuandong +7 · 3 voices · 61 citations
    #cs.LG #cs.CL
  23. Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models
    2025/07/10 by K.S. Liang, Kaiqu Liang, Haimin Hu +10 · 15 voices · 2 citations
    Social Sciences · Computer Science · #Misinformation and Its Impacts #Hate Speech and Cyberbullying Detection #Computational and Text Analysis Methods
  24. DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models
    2023/06/20 by Boxin Wang, Weixin Chen, Wang, Boxin +35 · 58 citations
    Computer Science · Medicine · Social Sciences · #Adversarial Robustness in Machine Learning #Artificial Intelligence in Healthcare and Education #Ethics and Social Impacts of AI
  25. Towards Efficient Data Valuation Based on the Shapley Value
    2019/02/27 by Ruoxi Jia, David Dao, Jia, Ruoxi +17 · 37 citations
    Computer Science · Decision Sciences · Economics, Econometrics and Finance · #Auction Theory and Applications #Blockchain Technology Applications and Security #FOS: Computer and information sciences #Game Theory and Voting Systems #Machine Learning (cs.LG) #Machine Learning (stat.ML)
  26. Agent Instructs Large Language Models to be General Zero-Shot Reasoners
    2023/10/05 by Nicholas Crispino, Kyle Montgomery, Crispino, Nicholas +7 · 2 voices · 7 citations
    Computer Science · #Topic Modeling #Natural Language Processing Techniques #Text Readability and Simplification
  27. Formal Mathematical Reasoning: A New Frontier in AI
    2024/12/20 by Kaiyu Yang, Gabriel Poesia, Yang, Kaiyu +11 · 2 voices · 20 citations
    Computer Science · #Computability, Logic, AI Algorithms #Logic, Reasoning, and Knowledge #AI-based Problem Solving and Planning
  28. Hidden Persuaders: LLMs' Political Leaning and Their Influence on Voters
    2024/10/31 by Yujin Potter, Potter, Yujin, Shiyang Lai +7 · 3 voices · 24 citations
    #cs.CL #cs.CY
  29. Agentic Web: Weaving the Next Web with AI Agents
    2025/07/28 by Yingxuan Yang, Mulei Ma, Yang, Yingxuan +33 · 8 voices · 15 citations
    Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #cs.AI #cs.LG
  30. Using Self-Supervised Learning Can Improve Model Robustness and Uncertainty
    2019/06/28 by Dan Hendrycks, Hendrycks, Dan, Mantas Mazeika +5 · 22 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Data Classification
  31. SQLNet: Generating Structured Queries From Natural Language Without Reinforcement Learning
    2017/11/13 by Xiaojun Xu, Xu, Xiaojun, Chang Liu +3 · 20 citations
    Computer Science · Decision Sciences · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Data Quality and Management #Databases (cs.DB) #FOS: Computer and information sciences #Natural Language Processing Techniques #Topic Modeling
  32. Characterizing Adversarial Subspaces Using Local Intrinsic Dimensionality
    2018/01/08 by Xingjun Ma, Ma, Xingjun, Bo Li +15 · 17 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Physical Unclonable Functions (PUFs) and Hardware Security
  33. Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation
    2025/10/13 by Sayash Kapoor, Benedikt Stroebl, Kapoor, Sayash +63 · 3 voices · 9 citations
    Computer Science · #Multi-Agent Systems and Negotiation
  34. GuardAgent: Safeguard LLM Agents by a Guard Agent via Knowledge-Enabled Reasoning
    2024/06/13 by Zhen Xiang, Xiang, Zhen, Linzhi Zheng +21 · 36 citations
    Computer Science · Engineering · Social Sciences · #Access Control and Trust #FOS: Computer and information sciences #Machine Learning (cs.LG) #Network Security and Intrusion Detection #Smart Grid Security and Resilience
  35. A Principled Approach to Data Valuation for Federated Learning
    2020/09/14 by Tianhao Wang, Johannes Rausch, Wang, Tianhao +7 · 17 citations
    Computer Science · #Privacy-Preserving Technologies in Data #Adversarial Robustness in Machine Learning #Domain Adaptation and Few-Shot Learning
  36. Generating Adversarial Examples with Adversarial Networks
    2018/01/08 by Chaowei Xiao, Xiao, Chaowei, Bo Li +9 · 17 citations
    Computer Science · Physics and Astronomy · #Advanced Malware Detection Techniques #Adversarial Robustness in Machine Learning #Computer Vision and Pattern Recognition (cs.CV) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (stat.ML) #Model Reduction and Neural Networks
  37. Scalable Best-of-N Selection for Large Language Models via Self-Certainty
    2025/02/25 by Zhewei Kang, Kang, Zhewei, Xuandong Zhao +3 · 50 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Explainable Artificial Intelligence (XAI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Topic Modeling
  38. Tree-to-tree Neural Networks for Program Translation
    2018/02/11 by Xinyun Chen, Chang Liu, Chen, Xinyun +3 · 12 citations
    Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Programming Languages (cs.PL) #Topic Modeling
  39. The Sky Above The Clouds
    2022/05/14 by Sarah Chasins, Alvin Cheung, Chasins, Sarah +32 · 2 voices
    Business, Management and Accounting · Engineering · Computer Science · #Digital Platforms and Economics #Green IT and Sustainability #Cloud Computing and Resource Management
  40. Dataset Security for Machine Learning: Data Poisoning, Backdoor Attacks, and Defenses
    2020/12/18 by Micah Goldblum, Goldblum, Micah, Dimitris Tsipras +15 · 13 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Network Security and Intrusion Detection #Advanced Malware Detection Techniques
  41. Physical Adversarial Examples for Object Detectors
    2018/07/20 by Kevin Eykholt, Ivan Evtimov, Eykholt, Kevin +15 · 17 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Advanced Malware Detection Techniques #Physical Unclonable Functions (PUFs) and Hardware Security
  42. Assessing Generalization in Deep Reinforcement Learning
    2018/10/29 by Charles Packer, Katelyn Gao, Packer, Charles +9 · 17 citations
    Computer Science · #Reinforcement Learning in Robotics #Evolutionary Algorithms and Applications #Mobile Crowdsensing and Crowdsourcing
  43. SoK: Decentralized Finance (DeFi) Attacks
    2022/08/27 by Liyi Zhou, Zhou, Liyi, Xihan Xiong +17 · 14 citations
    Business, Management and Accounting · Computer Science · Social Sciences · #Blockchain Technology Applications and Security #Crime, Illicit Activities, and Governance #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #FinTech, Crowdfunding, Digital Finance
  44. Tamper-Resistant Safeguards for Open-Weight LLMs
    2024/08/01 by Rishub Tamirisa, Bhrugu Bharathi, Tamirisa, Rishub +27 · 25 citations
    Engineering · #Radiation Effects in Electronics #Electrostatic Discharge in Electronics #Electrical Fault Detection and Protection
  45. The Secret Revealer: Generative Model-Inversion Attacks Against Deep Neural Networks
    2019/11/17 by Yuheng Zhang, Zhang, Yuheng, Ruoxi Jia +9 · 10 citations
    Computer Science · Engineering · #Adversarial Robustness in Machine Learning #FOS: Computer and information sciences #Geophysical Methods and Applications #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Privacy-Preserving Technologies in Data
  46. Spatially Transformed Adversarial Examples
    2018/01/08 by Chaowei Xiao, Jun-Yan Zhu, Xiao, Chaowei +9 · 15 citations
    Computer Science · #Advanced Malware Detection Techniques #Computer Vision and Pattern Recognition (cs.CV) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (stat.ML) #Physical Unclonable Functions (PUFs) and Hardware Security
  47. Delving into adversarial attacks on deep policies
    2017/05/18 by Jernej Kos, Kos, Jernej, Dawn Song +1 · 8 citations
    Computer Science · #Adversarial Robustness in Machine Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics
  48. AIR-Bench 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies
    2024/07/11 by Yi Zeng, Zeng, Yi, Yu Yang +21 · 1 voice · 18 citations
    #cs.CY #cs.AI
  49. DataSentinel: A Game-Theoretic Detection of Prompt Injection Attacks
    2025/04/15 by Yupei Liu, Liu, Yupei, Yuqi Jia +7 · 39 citations
    Engineering · Computer Science · #Smart Grid Security and Resilience #Adversarial Robustness in Machine Learning #Security and Verification in Computing
  50. Data Shapley in One Training Run
    2024/06/16 by Jiachen T. Wang, Wang, Jiachen T., Prateek Mittal +5 · 20 citations
    Computer Science · #Computation and Language (cs.CL) #Edcuational Technology Systems #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Teaching and Learning Programming
  51. Adversarial examples for generative models
    2017/02/22 by Jernej Kos, Ian Fischer, Kos, Jernej +3 · 1 voice · 2 citations
    Computer Science · Mathematics · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #cs.LG #stat.ML
  52. RedCode: Risky Code Execution and Generation Benchmark for Code Agents
    2024/11/12 by Chengquan Guo, Guo, Chengquan, Xun Liu +13 · 25 citations
    Computer Science · #Advanced Malware Detection Techniques #Artificial Intelligence (cs.AI) #Distributed systems and fault tolerance #FOS: Computer and information sciences #Security and Verification in Computing #Software Engineering (cs.SE)
  53. An Undetectable Watermark for Generative Image Models
    2024/10/09 by Sam Gunn, Xuandong Zhao, Gunn, Sam +3 · 21 citations
    Computer Science · #Advanced Steganography and Watermarking Techniques #Artificial Intelligence (cs.AI) #Chaos-based Image/Signal Encryption #Computer Graphics and Visualization Techniques #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimedia (cs.MM)
  54. On the Societal Impact of Open Foundation Models
    2024/02/27 by Sayash Kapoor, Rishi Bommasani, Kapoor, Sayash +47 · 15 citations
    Engineering · #3D Modeling in Geospatial Applications #Artificial Intelligence (cs.AI) #BIM and Construction Integration #Computers and Society (cs.CY) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  55. An Illusion of Progress? Assessing the Current State of Web Agents
    2025/04/02 by Xue, Tianci, Weijian Qi, Tingyan Shi +11 · 31 citations
    Computer Science · #AI in Service Interactions #Web Data Mining and Analysis #Recommender Systems and Techniques
  56. Forecasting Future World Events with Neural Networks
    2022/06/30 by Andy Zou, Tristan Xiao, Zou, Andy +17 · 9 citations
    Computer Science · Social Sciences · #Computation and Language (cs.CL) #Computational and Text Analysis Methods #FOS: Computer and information sciences #Machine Learning (cs.LG) #Topic Modeling
  57. Practical One-Shot Federated Learning for Cross-Silo Setting
    2020/10/02 by Qinbin Li, Bingsheng He, Li, Qinbin +3 · 7 citations
    Computer Science · Social Sciences · #Privacy-Preserving Technologies in Data #Mobile Crowdsensing and Crowdsourcing #Privacy, Security, and Data Protection
  58. BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models
    2024/06/24 by Yi Zeng, Zeng, Yi, Weiyu Sun +9 · 13 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Software Testing and Debugging Techniques
  59. Do you still need a manual smart contract audit?
    2023/06/21 by Isaac David, Liyi Zhou, David, Isaac +9 · 9 citations
    Computer Science · #Internet Traffic Analysis and Secure E-voting #Cryptography and Data Security #Advanced Malware Detection Techniques
  60. ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?
    2026/05/11 by Zhun Wang, Nico Schiller, Hongwei Li +13 · 8 voices · 1 citation
    #cs.CR #cs.AI #cs.LG
  61. TABOR: A Highly Accurate Approach to Inspecting and Restoring Trojan Backdoors in AI Systems
    2019/08/02 by Wenbo Guo, Lun Wang, Guo, Wenbo +7 · 9 citations
    Computer Science · Engineering · #Adversarial Robustness in Machine Learning #Anomaly Detection Techniques and Applications #Artificial Intelligence (cs.AI) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Integrated Circuits and Semiconductor Failure Analysis
  62. What Would Jiminy Cricket Do? Towards Agents That Behave Morally
    2021/10/25 by Dan Hendrycks, Mantas Mazeika, Hendrycks, Dan +15 · 6 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #Artificial Intelligence in Games #Computation and Language (cs.CL) #Computers and Society (cs.CY) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Topic Modeling
  63. International AI Safety Report
    2025/01/29 by Yoshua Bengio, Sören Mindermann, Bengio, Yoshua +180 · 17 citations
    Social Sciences · #Artificial Intelligence (cs.AI) #Computers and Society (cs.CY) #Ethics and Social Impacts of AI #FOS: Computer and information sciences #Machine Learning (cs.LG)
  64. Decoding Compressed Trust: Scrutinizing the Trustworthiness of Efficient LLMs Under Compression
    2024/03/18 by Junyuan Hong, Jinhao Duan, Hong, Junyuan +27 · 9 citations
    Computer Science · #Advanced Data Storage Technologies #Artificial Intelligence (cs.AI) #Blockchain Technology Applications and Security #Computation and Language (cs.CL) #Cryptography and Data Security #FOS: Computer and information sciences
  65. LLM-PBE: Assessing Data Privacy in Large Language Models
    2024/08/23 by Qinbin Li, Li, Qinbin, Junyuan Hong +23 · 11 citations
    Computer Science · Decision Sciences · #Artificial Intelligence (cs.AI) #Cryptography and Security (cs.CR) #Data Quality and Management #FOS: Computer and information sciences #Privacy-Preserving Technologies in Data
  66. Unpacking How Decentralized Autonomous Organizations (DAOs) Work in Practice
    2023/04/17 by Tanusree Sharma, Yu‐Jin Kwon, Sharma, Tanusree +11 · 6 citations
    Business, Management and Accounting · Computer Science · #Blockchain Technology Applications and Security #Computers and Society (cs.CY) #Digital Platforms and Economics #FOS: Computer and information sciences #FinTech, Crowdfunding, Digital Finance #Social and Information Networks (cs.SI)
  67. SoK: Watermarking for AI-Generated Content
    2024/11/27 by Xuandong Zhao, Zhao, Xuandong, Sam Gunn +25 · 13 citations
    Computer Science · #Advanced Steganography and Watermarking Techniques #Artificial Intelligence (cs.AI) #Chaos-based Image/Signal Encryption #Computer Graphics and Visualization Techniques #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  68. Imitation Attacks and Defenses for Black-box Machine Translation Systems
    2020/04/30 by Eric Wallace, Wallace, Eric, Mitchell Stern +3 · 4 citations
    Computer Science · #Advanced Malware Detection Techniques #Adversarial Robustness in Machine Learning #Computation and Language (cs.CL) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Topic Modeling
  69. Language Models are Open Knowledge Graphs
    2020/10/22 by Chenguang Wang, Xiao Liu, Wang, Chenguang +3 · 6 citations
    Computer Science · #Topic Modeling #Natural Language Processing Techniques #Advanced Graph Neural Networks
  70. Multimodal Situational Safety
    2024/10/08 by Kaiwen Zhou, Zhou, Kaiwen, Chengzhi Liu +8 · 10 citations
    Decision Sciences · Health Professions · Psychology · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Occupational Health and Safety Research #Risk and Safety Analysis #Safety Warnings and Signage
  71. KnowHalu: Hallucination Detection via Multi-Form Knowledge Based Factual Checking
    2024/04/03 by Jiawei Zhang, Zhang, Jiawei, Chejian Xu +9 · 7 citations
    Computer Science · Mathematics · Social Sciences · #Artificial Intelligence (cs.AI) #Benford’s Law and Fraud Detection #Computation and Language (cs.CL) #FOS: Computer and information sciences #Imbalanced Data Classification Techniques #Machine Learning (cs.LG) #Misinformation and Its Impacts
  72. Adversarial Texts with Gradient Methods
    2018/01/22 by Zhitao Gong, Gong, Zhitao, Wenlu Wang +7 · 6 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Digital Media Forensic Detection #Generative Adversarial Networks and Image Synthesis
  73. TextGuard: Provable Defense against Backdoor Attacks on Text Classification
    2023/11/19 by Hengzhi Pei, Pei, Hengzhi, Jinyuan Jia +7 · 6 citations
    Computer Science · #Advanced Malware Detection Techniques #Adversarial Robustness in Machine Learning #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Web Application Security Vulnerabilities
  74. Impossibility of Full Decentralization in Permissionless Blockchains
    2019/05/13 by Yu‐Jin Kwon, Jian Liu, Kwon, Yujin +7 · 3 citations
    Computer Science · #Blockchain Technology Applications and Security #Distributed systems and fault tolerance
  75. AutoScale: Scale-Aware Data Mixing for Pre-Training LLMs
    2024/07/29 by Feiyang Kang, Kang, Feiyang, Yifan Sun +11 · 7 citations
    Computer Science · Decision Sciences · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Data Mining Algorithms and Applications #Data Quality and Management #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Semantic Web and Ontologies
  76. ThreatKG: An AI-Powered System for Automated Open-Source Cyber Threat Intelligence Gathering and Management
    2022/12/20 by Peng Gao, Xiaoyuan Liu, Gao, Peng +9 · 4 citations
    Social Sciences · Computer Science · #Terrorism, Counterterrorism, and Political Violence #Cybercrime and Law Enforcement Studies #Information and Cyber Security
  77. Characterizing Attacks on Deep Reinforcement Learning
    2019/07/21 by Xinlei Pan, Pan, Xinlei, Chaowei Xiao +17 · 4 citations
    Computer Science · #Advanced Malware Detection Techniques #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics
  78. Adaptation of Agentic AI: A Survey of Post-Training, Memory, and Skills
    2025/12/18 by Pengcheng Jiang, Jiang, Pengcheng, Jiacheng Lin +67 · 5 voices · 2 citations
    Computer Science · #AI-based Problem Solving and Planning #Advanced Software Engineering Methodologies #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Reinforcement Learning in Robotics #cs.AI #cs.CL
  79. Robust Anomaly Detection and Backdoor Attack Detection Via Differential Privacy
    2019/11/16 by Min Du, Ruoxi Jia, Du, Min +3 · 5 citations
    Computer Science · #Anomaly Detection Techniques and Applications #Adversarial Robustness in Machine Learning #Privacy-Preserving Technologies in Data
  80. Improving LLM Safety Alignment with Dual-Objective Optimization
    2025/03/05 by Zhao, Xuandong, Tingyan Shi, Cai, Will +7 · 10 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Topic Modeling #Explainable Artificial Intelligence (XAI)
  81. The Singapore Consensus on Global AI Safety Research Priorities
    2025/06/25 by Yoshua Bengio, Bengio, Yoshua, Tegan Maharaj +171 · 2 voices · 8 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computers and Society (cs.CY) #FOS: Computer and information sciences #cs.AI #cs.CY
  82. LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage
    2024/12/07 by Yuzhou Nie, Nie, Yuzhou, Zhun Wang +11 · 1 voice · 5 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #cs.AI #cs.CR #cs.LG
  83. AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents
    2025/05/09 by Vincent Siu, Wang, Zhun, Zhe Ye +14 · 11 citations
    Computer Science · Social Sciences · #Access Control and Trust #Artificial Intelligence (cs.AI) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Security and Verification in Computing
  84. Lessons Learned: Surveying the Practicality of Differential Privacy in the Industry
    2022/11/07 by Gonzalo Munilla Garrido, Xiaoyuan Liu, Garrido, Gonzalo Munilla +5 · 3 citations
    Computer Science · Social Sciences · #Privacy-Preserving Technologies in Data #Privacy, Security, and Data Protection
  85. DPlis: Boosting Utility of Differentially Private Deep Learning via Randomized Smoothing
    2021/03/02 by Wenxiao Wang, Tianhao Wang, Wang, Wenxiao +11 · 3 citations
    Computer Science · #Privacy-Preserving Technologies in Data #Adversarial Robustness in Machine Learning #Stochastic Gradient Optimization Techniques
  86. SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning
    2025/05/22 by Kaiwen Zhou, Zhou, Kaiwen, Gaowen Liu +10 · 12 citations
    Computer Science · Engineering · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Safety Systems Engineering in Autonomy #Topic Modeling
  87. Towards Synthesizing Complex Programs from Input-Output Examples
    2017/06/05 by Xinyun Chen, Chang Liu, Chen, Xinyun +3 · 3 citations
    Computer Science · #Software Engineering Research #Software Testing and Debugging Techniques #Machine Learning and Algorithms
  88. Adversarial Examples for k-Nearest Neighbor Classifiers Based on\n Higher-Order Voronoi Diagrams
    2020/11/19 by Chawin Sitawarin, Evgenios M. Kornaropoulos, Sitawarin, Chawin +5 · 2 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Anomaly Detection Techniques and Applications #Artificial Intelligence (cs.AI) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Machine Learning and Data Classification
  89. C-RAG: Certified Generation Risks for Retrieval-Augmented Language Models
    2024/02/05 by Mintong Kang, Nezihe Merve Gürel, Kang, Mintong +7 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Information Retrieval (cs.IR) #Natural Language Processing Techniques #Topic Modeling
  90. Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs
    2025/04/07 by Tianneng Shi, Cai, Will, Shi, Tianneng +4 · 6 citations
    Computer Science · Decision Sciences · #Adversarial Robustness in Machine Learning #Security and Verification in Computing #Scientific Computing and Data Management
  91. DeepStruct: Pretraining of Language Models for Structure Prediction
    2022/05/21 by Chenguang Wang, Wang, Chenguang, Xiao Liu +9 · 2 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
  92. Advancing Science- and Evidence-based AI Policy
    2025/07/31 by Rishi Bommasani, Bommasani, Rishi, Sanjeev Arora +37 · 1 voice · 6 citations
    Medicine · Computer Science · #Computers and Society (cs.CY) #FOS: Computer and information sciences
  93. Enabling Efficient Cyber Threat Hunting With Cyber Threat Intelligence
    2020/10/26 by Peng Gao, Fei Shao, Gao, Peng +15 · 2 citations
    Computer Science · #Advanced Malware Detection Techniques #Computation and Language (cs.CL) #Cryptography and Security (cs.CR) #Databases (cs.DB) #FOS: Computer and information sciences #Network Security and Intrusion Detection #Spam and Phishing Detection
  94. AgentSynth: Scalable Task Generation for Generalist Computer-Use Agents
    2025/06/17 by Xie, Jingxu, Xu, Dylan, Xuandong Zhao +3 · 9 citations
    Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Multi-Agent Systems and Negotiation
  95. Agents' Last Exam
    2026/06/03 by Yiyou Sun, Xinyang Han, Weichen Zhang +306 · 4 voices
    #cs.AI #cs.CL #cs.LG
  96. Frontier AI's Impact on the Cybersecurity Landscape
    2025/04/07 by Yujin Potter, Potter, Yujin, Wenbo Guo +12 · 7 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computers and Society (cs.CY) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Network Security and Intrusion Detection
  97. What Drives the (In)stability of a Stablecoin?
    2023/06/15 by Yu‐Jin Kwon, Kwon, Yujin, Kornrapat Pongmala +13 · 2 citations
    Computer Science · Economics, Econometrics and Finance · #Blockchain Technology Applications and Security #Complex Systems and Time Series Analysis #Computer Science and Game Theory (cs.GT) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Market Dynamics and Volatility
  98. Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?
    2025/04/16 by Youfa Sun, Sun, Yiyou, Bai, Haoyue +9 · 5 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
  99. Evolving AI Collectives to Enhance Human Diversity and Enable Self-Regulation
    2024/02/19 by Shiyang Lai, Yujin Potter, Lai, Shiyang +9 · 2 citations
    Decision Sciences · #Computation and Language (cs.CL) #Computers and Society (cs.CY) #FOS: Computer and information sciences #Impact of AI and Big Data on Business and Society
  100. Preserving Link Privacy in Social Network Based Systems
    2012/08/30 by Prateek Mittal, Charalampos Papamanthou, Mittal, Prateek +3 · 1 citation
    Computer Science · Social Sciences · #Privacy-Preserving Technologies in Data #Internet Traffic Analysis and Secure E-voting #Privacy, Security, and Data Protection
  101. Scalability vs. Utility: Do We Have to Sacrifice One for the Other in Data Importance Quantification?
    2019/11/17 by Ruoxi Jia, Fan Wu, Jia, Ruoxi +15 · 1 citation
    Computer Science · #Data Stream Mining Techniques #FOS: Computer and information sciences #Imbalanced Data Classification Techniques #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Data Classification
  102. Why and How LLMs Hallucinate: Connecting the Dots with Subsequence Associations
    2025/04/17 by Yiyou Sun, Sun, Yiyou, Yu Gai +9 · 4 citations
    Computer Science · Medicine · Psychology · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning in Healthcare #Mental Health via Writing #Schizophrenia research and treatment
  103. Anomalous Example Detection in Deep Learning: A Survey
    2020/03/16 by Saikiran Bulusu, Bhavya Kailkhura, Bulusu, Saikiran +7 · 1 citation
    Computer Science · #Advanced Malware Detection Techniques #Adversarial Robustness in Machine Learning #Anomaly Detection Techniques and Applications #Computer Vision and Pattern Recognition (cs.CV) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML)
  104. Hierarchical Variational Imitation Learning of Control Programs
    2019/12/29 by Roy Fox, Richard Shin, Fox, Roy +13 · 1 citation
    Computer Science · Engineering · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Reinforcement Learning in Robotics #Robot Manipulation and Learning
  105. The exploding gradient problem demystified - definition, prevalence, impact, origin, tradeoffs, and solutions
    2017/12/15 by George Philipp, Philipp, George, Dawn Song +3 · 1 voice
    #cs.LG #cs.CV
  106. Subliminal Probing for Private Information via EEG-Based BCI Devices
    2013/12/20 by Mario Frank, Frank, Mario, Tiffany Hwu +15 · 1 voice
    Neuroscience · Psychology · #cs.CR
  107. A System for Automated Open-Source Threat Intelligence Gathering and Management
    2021/01/19 by Peng Gao, Xiaoyuan Liu, Gao, Peng +11 · 1 citation
    Computer Science · #Advanced Malware Detection Techniques #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Cryptography and Security (cs.CR) #Cybercrime and Law Enforcement Studies #Databases (cs.DB) #FOS: Computer and information sciences #Information and Cyber Security
  108. VERINA: Benchmarking Verifiable Code Generation
    2025/05/29 by 哲章 小野, Ye, Zhe, Zhengxu Yan +9 · 5 citations
    Computer Science · Materials Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Logic in Computer Science (cs.LO) #Machine Learning (cs.LG) #Machine Learning in Materials Science #Model-Driven Software Engineering Techniques #Programming Languages (cs.PL) #Software Engineering (cs.SE) #Software Engineering Research
  109. Grounded Graph Decoding Improves Compositional Generalization in Question Answering
    2021/11/05 by Yu Gai, Paras Jain, Gai, Yu +9 · 1 citation
    Computer Science · #Topic Modeling #Natural Language Processing Techniques #Multimodal Machine Learning Applications
  110. Self-Sovereign Agent
    2026/03/04 by Wenjie Qu, Xuandong Zhao, Jiaheng Zhang +1 · 1 voice
    Computer Science · #cs.CR #cs.CY #cs.LG
  111. MLAN: Language-Based Instruction Tuning Preserves and Transfers Knowledge in Multimodal Language Models
    2024/11/15 by Jianhong Tu, Tu, Jianhong, Zheng Ni +19 · 2 citations
    Computer Science · #Speech and dialogue systems #Natural Language Processing Techniques
  112. MMDT: Decoding the Trustworthiness and Safety of Multimodal Foundation Models
    2025/03/19 by Chejian Xu, Jiawei Zhang, Xu, Chejian +44 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Multi-Agent Systems and Negotiation
  113. Enhancing Smart Contract Security Analysis with Execution Property Graphs
    2023/05/23 by Kaihua Qin, Qin, Kaihua, Zhe Ye +13 · 1 citation
    Computer Science · #Blockchain Technology Applications and Security
  114. In-Context Watermarks for Large Language Models
    2025/05/22 by Yepeng Liu, Liu, Yepeng, Xuandong Zhao +7 · 4 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Generative Adversarial Networks and Image Synthesis #Advanced Graph Neural Networks
  115. RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs?
    2025/09/25 by Yiyou Sun, Sun, Yiyou, Yuhan Cao +11 · 6 citations
    Computer Science · #Distributed and Parallel Computing Systems
  116. COSMIC: Generalized Refusal Direction Identification in LLM Activations
    2025/05/30 by Siu, Vincent, Nicholas Crispino, Zihao Yu +11 · 4 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Fuzzy Logic and Control Systems #Natural Language Processing Techniques #Speech Recognition and Synthesis
  117. Exploring the Space of Black-box Attacks on Deep Neural Networks
    2017/12/27 by Arjun Nitin Bhagoji, Bhagoji, Arjun Nitin, Warren He +5 · 1 citation
    Computer Science · Medicine · #Adversarial Robustness in Machine Learning #Cardiac Arrest and Resuscitation #Computer Vision and Pattern Recognition (cs.CV) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  118. AI Risk Management Should Incorporate Both Safety and Security
    2024/05/29 by Xiangyu Qi, Yangsibo Huang, Qi, Xiangyu +47 · 1 citation
    Medicine · Social Sciences · #Artificial Intelligence (cs.AI) #Artificial Intelligence in Healthcare and Education #Cryptography and Security (cs.CR) #Ethics and Social Impacts of AI #FOS: Computer and information sciences
  119. OVERT: A Benchmark for Over-Refusal Evaluation on Text-to-Image Models
    2025/05/27 by Ziheng Cheng, Yixiao Huang, Cheng, Ziheng +11 · 2 citations
    Computer Science · #Adversarial Robustness in Machine Learning
  120. Data Free Backdoor Attacks
    2024/12/09 by Bochuan Cao, Cao, Bochuan, Jinyuan Jia +13 · 1 citation
    Computer Science · #Network Security and Intrusion Detection #Advanced Malware Detection Techniques #Information and Cyber Security
  121. Agent Security Needs Redefinition through a Holistic Framework
    2026/07/24 by Vincent Siu, Jingxuan He, Kyle Montgomery +3
    #cs.CR #cs.AI
  122. Generative Compilation: On-the-Fly Compiler Feedback as AI Generates Code
    2026/07/15 by Niels Mündler-Sasahara, Hristo Venev, Dawn Song +2
    #cs.PL #cs.AI #cs.LG