Large language models encode clinical knowledge
2023/07/12 by Karan Singhal, Shekoofeh Azizi, Tao Tu +29 · 200 citations
Computer Science · Medicine · #Artificial Intelligence in Healthcare and Education #Natural Language Processing Techniques #Topic Modeling
paper · pdf · doi:10.1038/s41586-023-06291-2
openalex publication_date 2023/07/12 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/31
Abstract
Abstract Large language models (LLMs) have demonstrated impressive capabilities, but the bar for clinical applications is high. Attempts to assess the clinical knowledge of models typically rely on automated evaluations based on limited benchmarks. Here, to address these limitations, we present MultiMedQA, a benchmark combining six existing medical question answering datasets spanning professional medicine, research and consumer queries and a new dataset of medical questions searched online, HealthSearchQA. We propose a human evaluation framework for model answers along multiple axes including factuality, comprehension, reasoning, possible harm and bias. In addition, we evaluate Pathways Language Model 1 (PaLM, a 540-billion parameter LLM) and its instruction-tuned variant, Flan-PaLM 2 on MultiMedQA. Using a combination of prompting strategies, Flan-PaLM achieves state-of-the-art accuracy on every MultiMedQA multiple-choice dataset (MedQA 3 , MedMCQA 4 , PubMedQA 5 and Measuring Massive Multitask Language Understanding (MMLU) clinical topics 6 ), including 67.6% accuracy on MedQA (US Medical Licensing Exam-style questions), surpassing the prior state of the art by more than 17%. However, human evaluation reveals key gaps. To resolve this, we introduce instruction prompt tuning, a parameter-efficient approach for aligning LLMs to new domains using a few exemplars. The resulting model, Med-PaLM, performs encouragingly, but remains inferior to clinicians. We show that comprehension, knowledge recall and reasoning improve with model scale and instruction prompt tuning, suggesting the potential utility of LLMs in medicine. Our human evaluations reveal limitations of today’s models, reinforcing the importance of both evaluation frameworks and method development in creating safe, helpful LLMs for clinical applications.
Citations
Cited by
- Artificial intelligence in bioinformatics: a survey
- RadioRAG: Online Retrieval–Augmented Generation for Radiology Question Answering
- CoLLM: Integrating Collaborative Embeddings Into Large Language Models for Recommendation
- An Explainable Artificial Intelligence Approach Using Graph Learning to Predict Intensive Care Unit Length of Stay
- A Framework for Autonomous AI-Driven Drug Discovery
- Large language model-based biological age prediction in large-scale populations
- How to read a paper involving artificial intelligence (AI)
- The generative era of medical AI
- Linear-LLM-SCM: Benchmarking LLMs for Coefficient Elicitation in Linear-Gaussian Causal Models
- The EU Artificial Intelligence Act (2024): Implications for healthcare
- Large language models for biomedicine: foundations, opportunities, challenges, and best practices
- Multilingual Large Language Models do not comprehend all natural languages to equal degrees
- Generative AI for Healthcare: Fundamentals, Challenges, and Perspectives
- Mitigating Hallucination in Large Language Models (LLMs): An Application-Oriented Survey on RAG, Reasoning, and Agentic Systems
- Towards Transparent Reasoning: What Drives Faithfulness in Large Language Models?
- HACK: Hallucinations Along Certainty and Knowledge Axes
- META-RAG: Meta-Analysis-Inspired Evidence-Re-Ranking Method for Retrieval-Augmented Generation in Evidence-Based Medicine
- PICOs-RAG: PICO-supported Query Rewriting for Retrieval-Augmented Generation in Evidence-Based Medicine
- Assessing Pharmacists’ Use and Perception of AI Chatbots in Pharmacy Practice: Cross-Sectional Survey Study
- Label Smoothing Improves Gradient Ascent in LLM Unlearning
- How to Auto-optimize Prompts for Domain Tasks? Adaptive Prompting and Reasoning through Evolutionary Domain Knowledge Adaptation
- User Perceptions of Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios
- LM-mixup: Text Data Augmentation via Language Model based Mixup
- KORE: Enhancing Knowledge Injection for Large Multimodal Models via Knowledge-Oriented Controls
- A Multi-faceted Analysis of Cognitive Abilities: Evaluating Prompt Methods with Large Language Models on the CONSORT Checklist
- Beyond MedQA: Towards Real-world Clinical Decision Making in the Era of LLMs
- Timely Clinical Diagnosis through Active Test Selection
- Prompting the Priorities: A First Look at Evaluating LLMs for Vulnerability Triage and Prioritization
- Fine-Tuning MedGemma for Clinical Captioning to Enhance Multimodal RAG over Malaysia CPGs
- From Retrieval to Generation: Unifying External and Parametric Knowledge for Medical Question Answering
- BrailleLLM: Braille Instruction Tuning with Large Language Models for Braille Domain Tasks
- Motion2Meaning: A Clinician-Centered Framework for Contestable LLM in Parkinson's Disease Gait Interpretation
- Hearing Health in Home Healthcare: Leveraging LLMs for Illness Scoring and ALMs for Vocal Biomarker Extraction
- Evaluating Medical LLMs by Levels of Autonomy: A Survey Moving from Benchmarks to Applications
- Disparities in Multilingual LLM-Based Healthcare Q&A
- BenCao: An Instruction-Tuned Large Language Model for Traditional Chinese Medicine
- Who's Asking? Simulating Role-Based Questions for Conversational AI Evaluation
- Domain-Contextualized Concept Graphs: A Computable Framework for Knowledge Representation
- TraceCoder: Towards Traceable ICD Coding via Multi-Source Knowledge Integration
- InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
- Adaptive Minds: Empowering Agents with LoRA-as-Tools
- Circuit Insights: Towards Interpretability Beyond Activations
- CURE: Confidence-driven Unified Reasoning Ensemble Framework for Medical Question Answering
- A survey on retrieval-augmentation generation (RAG) models for healthcare applications
- MedREK: Retrieval-Based Editing for Medical LLMs with Key-Aware Prompts
- A Survey on Evaluation of Large Language Models
- MedKGEval: A Knowledge Graph-Based Multi-Turn Evaluation Framework for Open-Ended Patient Interactions with Clinical LLMs
- CGBench: Benchmarking Language Model Scientific Reasoning for Clinical Genetics Research
- AgentCaster: Reasoning-Guided Tornado Forecasting
- Enabling Doctor-Centric Medical AI with LLMs through Workflow-Aligned Tasks and Benchmarks
- Assessing Large Language Models for Structured Medical Order Extraction
- LONGQAEVAL: Designing Reliable Evaluations of Long-Form Clinical QA under Resource Constraints
- Variational Open-Domain Question Answering
- ArtPerception: ASCII Art-based Jailbreak on LLMs with Recognition Pre-test
- Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models
- You only need 4 extra tokens: Synergistic Test-time Adaptation for LLMs
- Advancing health coaching: A comparative study of large language model and health coaches
- IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures
- From Explainability to Action: A Generative Operational Framework for Integrating XAI in Clinical Mental Health Screening
- Mephisto: Self-Improving Large Language Model-Based Agents for Automated Interpretation of Multi-band Galaxy Observations
- Metric Calculating Benchmark: Code-Verifiable Complicate Instruction Following Benchmark for Large Language Models
- YpathRAG:A Retrieval-Augmented Generation Framework and Benchmark for Pathology
- Resource-Efficient Fine-Tuning of LLaMA-3.2-3B for Medical Chain-of-Thought Reasoning
- CLARITY: Clinical Assistant for Routing, Inference, and Triage
- Evaluation of Clinical Trials Reporting Quality using Large Language Models
- A global log for medical AI
- Triplet-Structured Knowledge Integration for Multi-Turn Medical Reasoning
- Grounding Large Language Models in Clinical Evidence: A Retrieval-Augmented Generation System for Querying UK NICE Clinical Guidelines
- Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks
- PRISM-Consult: A Panel-of-Experts Architecture for Clinician-Aligned Diagnosis
- Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving
- HalluGuard: Evidence-Grounded Small Reasoning Models to Mitigate Hallucinations in Retrieval-Augmented Generation
- Rethinking Reward Models for Multi-Domain Test-Time Scaling
- Microsaccade-Inspired Probing: Positional Encoding Perturbations Reveal LLM Misbehaviours
- The TRIPOD-LLM reporting guideline for studies using large language models
- International multicenter validation of AI-driven ultrasound detection of ovarian cancer
- Retrieval-Augmented Framework for LLM-Based Clinical Decision Support
- Glaucoma Detection and Structured OCT Report Generation via a Fine-tuned Multimodal Large Language Model
- TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
- KnowGuard: Knowledge-Driven Abstention for Multi-Round Clinical Reasoning
- MedMMV: A Controllable Multimodal Multi-Agent Framework for Reliable and Verifiable Clinical Reasoning
- Beyond Overall Accuracy: A Psychometric Deep Dive into the Topic-Specific Medical Capabilities of 80 Large Language Models
- Large language models accurately identify immunosuppression in intensive care unit patients
- MedLA: A Logic-Driven Multi-Agent Framework for Complex Medical Reasoning with Large Language Models
- Transparency of medical artificial intelligence systems
- DentVLM: A Multimodal Vision-Language Model for Comprehensive Dental Diagnosis and Enhanced Clinical Practice
- NanoFlux: Adversarial Dual-LLM Evaluation and Distillation For Multi-Domain Reasoning
- RHYTHM: Reasoning with Hierarchical Temporal Tokenization for Human Mobility
- WirelessMathLM: Teaching Mathematical Reasoning for LLMs in Wireless Communications with Reinforcement Learning
- Patient-specific Biomolecular Instruction Tuning
- From recorded to <scp>AI</scp> ‐generated instructional videos: A comparison of learning performance and experience
- Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks
- Agentic-AI Healthcare: Multilingual, Privacy-First Framework with MCP Agents
- Position: Human Factors Reshape Adversarial Analysis in Human-AI Decision-Making Systems
- SuperOffload: Unleashing the Power of Large-Scale LLM Training on Superchips
- RAR2: Retrieval-Augmented Medical Reasoning via Thought-Driven Retrieval
- AgentClinic: a multimodal benchmark for tool-using clinical AI agents
- Generative AI for medical education: Insights from a case study with medical students and an AI tutor for clinical reasoning
- A Licensure Framework for Autonomous Clinical AI
- LLM-assisted systematic review of large language models in clinical medicine
- When Derived Measurements Mislead: Quantifying and Mitigating LLM Over-Trust with Privileged-Modality Reliability Evidence
- Comparing guideline adherence and readability: Artificial intelligence with deep learning versus specialized physicians in peripheral artery disease management
- SeedLLM·Rice: A large language model integrated with rice biological knowledge graph
- In Situ Graph Reasoning and Knowledge Expansion Using Graph‐PRefLexOR
- Exploring artificial intelligence-powered virtual assistants to understand their potential to support older adults’ search needs
- AI in Rehabilitation Medicine: Opportunities and Challenges
- Medicine as an Information Industry in the Age of Language Models
- Scientific Writing, Generative Artificial Intelligence, and the Non–Native English Speaker
- Artificial intelligence ethics: automation of medical publishing
- Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning
- Advances in Large Language Models for Medicine
- Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
- AgriDoctor: A Multimodal Intelligent Assistant for Agriculture
- Causal Representation Learning from Multimodal Clinical Records under Non-Random Modality Missingness
- From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations
- RephQA: Evaluating Readability of Large Language Models in Public Health Question Answering
- Reward Hacking Mitigation using Verifiable Composite Rewards
- Semantic Representation Attack against Aligned Large Language Models
- A Knowledge-driven Adaptive Collaboration of LLMs for Enhancing Medical Decision-making
- Enhancing Retrieval Augmentation via Adversarial Collaboration
- Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
- Combining Evidence and Reasoning for Biomedical Fact-Checking
- Performance of Large Language Models in Answering Critical Care Medicine Questions
- A Visualized Framework for Event Cooperation with Generative Agents
- SitLLM: Large Language Models for Sitting Posture Health Understanding via Pressure Sensor Data
- Reinforcement Learning enhanced Online Adaptive Clinical Decision Support via Digital Twin powered Policy and Treatment Effect optimized Reward
- Root Cause Analysis of Radiation Oncology Incidents Using Large Language Models
- KoSEL: Knowledge subgraph enhanced large language model for medical question answering
- Biomedical Hypothesis Explainability with Graph-Based Context Retrieval
- Audited Reasoning Refinement: Fine-Tuning Language Models via LLM-Guided Step-Wise Evaluation and Correction
- Towards Better Health Conversations: The Benefits of Context-seeking
- MatQnA: A Benchmark Dataset for Multi-modal Large Language Models in Materials Characterization and Analysis
- The Psychogenic Machine: Simulating AI Psychosis, Delusion Reinforcement and Harm Enablement in Large Language Models
- A Survey on Retrieval And Structuring Augmented Generation with Large Language Models
- Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
- GrACE: A Generative Approach to Better Confidence Elicitation in Large Language Models
- MetaRAG: Metamorphic Testing for Hallucination Detection in RAG Systems
- Memorization in Large Language Models in Medicine: Prevalence, Characteristics, and Implications
- Walking Backward to Ensure Risk Management of Large Language Models in Medicine
- HealthSLM-Bench: Benchmarking Small Language Models for Mobile and Wearable Healthcare Monitoring
- Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift
- Chatbot To Help Patients Understand Their Health
- Manipulating Transformer-Based Models: Controllability, Steerability, and Robust Interventions
- Facts Fade Fast: Evaluating Memorization of Outdated Medical Knowledge in Large Language Models
- Domain Adaptation for Different Sensor Configurations in 3D Object Detection
- DSRAG: A Domain-Specific Retrieval Framework Based on Document-derived Multimodal Knowledge Graph
- MedQARo: A Large-Scale Benchmark for Medical Question Answering in Romanian
- Machine learning for 2D material–based devices
- RPRO: Ranked Preference Reinforcement Optimization for Enhancing Medical QA and Diagnostic Reasoning
- The Resurgence of GCG Adversarial Attacks on Large Language Models
- A Modality-agnostic Multi-task Foundation Model for Human Brain Imaging
- Automated Clinical Problem Detection from SOAP Notes using a Collaborative Multi-Agent LLM Architecture
- Benchmarking GPT-5 in Radiation Oncology: Measurable Gains, but Persistent Need for Expert Oversight
- HealthProcessAI: A Technical Framework and Proof-of-Concept for LLM-Enhanced Healthcare Process Mining
- OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries
- End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning
- Embodied AI: Emerging Risks and Opportunities for Policy Action
- Benchmarking GPT-5 for biomedical natural language processing
- Evaluating Language Model Reasoning about Confidential Information
- Survey of Specialized Large Language Model
- Mitigating Clinician Information Overload: Generative AI for Integrated EHR and RPM Data Analysis
- Reasoning LLMs in the Medical Domain: A Literature Survey
- eSkinHealth: A Multimodal Dataset for Neglected Tropical Skin Diseases
- LLM4Sweat: A Trustworthy Large Language Model for Hyperhidrosis Support
- Organ-Agents: Virtual Human Physiology Simulator via LLMs
- ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
- BioLORD-2023: semantic textual representations fusing large language models and clinical knowledge graph insights
- The AI-Fraud Diamond: A Novel Lens for Auditing Algorithmic Deception
- Exploring Efficiency Frontiers of Thinking Budget in Medical Reasoning: Scaling Laws between Computational Resources and Reasoning Quality
- QuarkMed Medical Foundation Model Technical Report
- RPKT: Learning What You Don't -- Know Recursive Prerequisite Knowledge Tracing in Conversational AI Tutors for Personalized Learning
- Group Fairness Meets the Black Box: Enabling Fair Algorithms on Closed LLMs via Post-Processing
- Performance of GPT-5 in Brain Tumor MRI Reasoning
- Reverse Physician-AI Relationship: Full-process Clinical Diagnosis Driven by a Large Language Model
- HiRef: Leveraging Hierarchical Ontology and Network Refinement for Robust Medication Recommendation
- Dynamic Uncertainty-aware Multimodal Fusion for Outdoor Health Monitoring
- Can We Trust AI to Govern AI? Benchmarking LLM Performance on Privacy and AI Governance Exams
- Differentiated Information Mining: A Semi-supervised Learning Framework for GNNs
- Evaluating Large Language Models as Expert Annotators
- Capabilities of GPT-5 on Multimodal Medical Reasoning
- A Multi-Agent Approach to Neurological Clinical Reasoning
- EndoCogniAgent: Closed-Loop Agentic Reasoning with Self-Consistency Validation for Endoscopic Diagnosis
- Towards Experience-Centered AI: A Framework for Integrating Lived Experience in Design and Development
- Generative AI without guardrails can harm learning: Evidence from high school mathematics
- Synthesizing scientific literature with retrieval-augmented language models
- MedSumGraph: enhancing GraphRAG for medical QA with summarization and optimized prompts
- Explanatory argument extraction of correct answers in resident medical exams
- The Problem of Atypicality in LLM-Powered Psychiatry
- Mediator-Guided Multi-Agent Collaboration among Open-Source Models for Medical Decision-Making
- Efficient Knowledge Probing of Large Language Models by Adapting Pre-trained Embeddings
- Comparing Knowledge Injection Methods for LLMs in a Low-Resource Regime
- Iterative Learning of Computable Phenotypes for Treatment Resistant Hypertension using Large Language Models
- Skin-SOAP: A Weakly Supervised Framework for Generating Structured SOAP Notes
- Benchmarking Foundation Models for Mitotic Figure Classification
- Large Language Model's Multi-Capability Alignment in Biomedical Domain
- Light-IF: Endowing LLMs with Generalizable Reasoning via Preview and Self-Checking for Complex Instruction Following
- Clinically Grounded Agent-based Report Evaluation: An Interpretable Metric for Radiology Report Generation
- Improving Hospital Risk Prediction with Knowledge-Augmented Multimodal EHR Modeling
- BioDisco: Multi-agent hypothesis generation with dual-mode evidence, iterative feedback and temporal evaluation
- Integrating clinical reasoning into large language model-based diagnosis through etiology-aware attention steering
- A Bayesian Hybrid Parameter-Efficient Fine-Tuning Method for Large Language Models
Related