Capabilities of GPT-4 on Medical Challenge Problems
2023/03/20 by Harsha Nori, Nori, Harsha, Nicholas King +7 · 3 voices · 97 citations
Medicine · Computer Science · #Artificial Intelligence in Healthcare and Education #Topic Modeling #Clinical Reasoning and Diagnostic Skills
paper · pdf · doi:10.48550/arxiv.2303.13375
Abstract
Large language models (LLMs) have demonstrated remarkable capabilities in natural language understanding and generation across various domains, including medicine. We present a comprehensive evaluation of GPT-4, a state-of-the-art LLM, on medical competency examinations and benchmark datasets. GPT-4 is a general-purpose model that is not specialized for medical problems through training or engineered to solve clinical tasks. Our analysis covers two sets of official practice materials for the USMLE, a three-step examination program used to assess clinical competency and grant licensure in the United States. We also evaluate performance on the MultiMedQA suite of benchmark datasets. Beyond measuring model performance, experiments were conducted to investigate the influence of test questions containing both text and images on model performance, probe for memorization of content during training, and study probability calibration, which is of critical importance in high-stakes applications like medicine. Our results show that GPT-4, without any specialized prompt crafting, exceeds the passing score on USMLE by over 20 points and outperforms earlier general-purpose models (GPT-3.5) as well as models specifically fine-tuned on medical knowledge (Med-PaLM, a prompt-tuned version of Flan-PaLM 540B). In addition, GPT-4 is significantly better calibrated than GPT-3.5, demonstrating a much-improved ability to predict the likelihood that its answers are correct. We also explore the behavior of the model qualitatively through a case study that shows the ability of GPT-4 to explain medical reasoning, personalize explanations to students, and interactively craft new counterfactual scenarios around a medical case. Implications of the findings are discussed for potential uses of GPT-4 in medical education, assessment, and clinical practice, with appropriate attention to challenges of accuracy and safety.
Cited by
- Benchmarking Fine-tuning and Retrieval Strategies for a Multimodal Language Model on the NRC Reactor Operator Licensing Examination
- WHBench: Evaluating Frontier LLMs with Expert-in-the-Loop Validation on Women's Health Topics
- LLM-Extracted Covariates for Clinical Causal Inference: Rethinking Integration Strategies
- Safety boundary maintenance in consumer AI systems responding to pediatric health queries: a cross-platform benchmark evaluation under naturalistic and adversarially pressured conditions
- HijackKV: New Threat in Position-Independent KV Cache Reuse
- MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications
- PertReason: A Knowledge-Grounded Benchmark and Framework for Cell-State-Conditioned Mechanistic Reasoning of Perturbation Effects
- Large Language Models as Unified Multimodal Learners for Clinical Prediction
- GraphDx: A Cost-Aware Knowledge-Enhanced Multi-Agent Framework for Sequential Diagnosis
- This Treatment Works, Right? Evaluating LLM Sensitivity to Patient Question Framing in Medical QA
- Reliability of LLMs as medical assistants for the general public: a randomized preregistered study
- Sequential Diagnosis with Language Models
- Elucidating Mechanisms of Demographic Bias in LLMs for Healthcare
- Measuring Epistemic Resilience of LLMs Under Misleading Medical Context
- Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs
- The Mirage of LLM Guardrails: A Case Study in AI-Assisted Medical Note Manipulation
- Socioeconomic Inference in LLM Medical Triage: Same Symptoms, Different ZIP Code
- VeriLLMed: Interactive Visual Debugging of Medical Large Language Models with Knowledge Graphs
- HARBOR: Holistic Adaptive Risk assessment model for BehaviORal healthcare
- An Agentic AI Framework for Training General Practitioner Student Skills
- Multi-Agent Medical Decision Consensus Matrix System: An Intelligent Collaborative Framework for Oncology MDT Consultations
- Counting Clues: A Lightweight Probabilistic Baseline Can Match an LLM
- COMPARE: Clinical Optimization with Modular Planning and Assessment via RAG-Enhanced AI-OCT: Superior Decision Support for Percutaneous Coronary Intervention Compared to ChatGPT-5 and Junior Operators
- AutoMedic: An Automated Evaluation Framework for Clinical Conversational Agents with Medical Dataset Grounding
- Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology
- When Medical AI Explanations Help and When They Harm
- Optimizing Medical Question-Answering Systems: A Comparative Study of Fine-Tuned and Zero-Shot Large Language Models with RAG Framework
- CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning
- Automated Identification of Incidentalomas Requiring Follow-Up: A Multi-Anatomy Evaluation of LLM-Based and Supervised Approaches
- MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis
- AR-Med: Automated Relevance Enhancement in Medical Search via LLM-Driven Information Augmentation
- AlignCheck: a Semantic Open-Domain Metric for Factual Consistency Assessment
- Mirror, Mirror on the Wall -- Which is the Best Model of Them All?
- Medical Malice: A Dataset for Context-Aware Safety in Healthcare LLMs
- Assessing Automated Fact-Checking for Medical LLM Responses with Knowledge Graphs
- Cognitive bias in LLM reasoning compromises interpretation of clinical oncology notes
- 47B Mixture-of-Experts Beats 671B Dense Models on Chinese Medical Examinations
- Enhancing the Medical Context-Awareness Ability of LLMs via Multifaceted Self-Refinement Learning
- CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization
- AI as We Describe It: How Large Language Models and Their Applications in Health are Represented Across Channels of Public Discourse
- LLM-as-a-Judge is Bad, Based on AI Attempting the Exam Qualifying for the Member of the Polish National Board of Appeal
- EHR-R1: A Reasoning-Enhanced Foundational Language Model for Electronic Health Record Analysis
- SciMON: Scientific Inspiration Machines Optimized for Novelty
- An efficient probabilistic hardware architecture for diffusion-like models
- SALSA: Single-pass Autoregressive LLM Structured Classification
- Evaluating Prompting Strategies and Large Language Models in Systematic Literature Review Screening: Relevance and Task-Stage Classification
- Beyond Pairwise: Empowering LLM Alignment With Ranked Choice Modeling
- Investigating LLM Capabilities on Long Context Comprehension for Medical Question Answering
- Large language models in medicine
- SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
- Who's Asking? Simulating Role-Based Questions for Conversational AI Evaluation
- Open WebUI: An Open, Extensible, and Usable Interface for AI Interaction
- CURE: Confidence-driven Unified Reasoning Ensemble Framework for Medical Question Answering
- Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B
- FocusMed: A Large Language Model-based Framework for Enhancing Medical Question Summarization with Focus Identification
- Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks
- Retrieval-Augmented Framework for LLM-Based Clinical Decision Support
- The Dialogue That Heals: A Comprehensive Evaluation of Doctor Agents' Inquiry Capability
- Can you SPLICE it together? A Human Curated Benchmark for Probing Visual Reasoning in VLMs
- Advancements in Generative AI: A Comprehensive Review of GANs, GPT, Autoencoders, Diffusion Model, and Transformers
- An Improved Framework for Scaling Party Positions from Texts with Transformer
- GPT (Generative Pre-Trained Transformer)— A Comprehensive Review on Enabling Technologies, Potential Applications, Emerging Challenges, and Future Directions
- LLM-Based Support for Diabetes Diagnosis: Opportunities, Scenarios, and Challenges with GPT-5
- Position: Human Factors Reshape Adversarial Analysis in Human-AI Decision-Making Systems
- MedLLM: An Open Medical Language Model at the Sub-Billion Scale
- iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning
- Beyond Diagnosis: Evaluating Multimodal LLMs for Pathology Localization in Chest Radiographs
- A Knowledge-driven Adaptive Collaboration of LLMs for Enhancing Medical Decision-making
- Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
- SitLLM: Large Language Models for Sitting Posture Health Understanding via Pressure Sensor Data
- Towards Better Health Conversations: The Benefits of Context-seeking
- BALI: Enhancing Biomedical Language Representations through Knowledge Graph and Language Model Alignment
- HealthSLM-Bench: Benchmarking Small Language Models for Mobile and Wearable Healthcare Monitoring
- Energy Landscapes Enable Reliable Abstention in Retrieval-Augmented Large Language Models for Healthcare
- RPRO: Ranked Preference Reinforcement Optimization for Enhancing Medical QA and Diagnostic Reasoning
- OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries
- Benchmarking GPT-5 for biomedical natural language processing
- Mitigating Clinician Information Overload: Generative AI for Integrated EHR and RPM Data Analysis
- Reasoning LLMs in the Medical Domain: A Literature Survey
- An Investigation on Group Query Hallucination Attacks
- A Comparative Study of Decoding Strategies in Medical Text Generation
- Benchmarking GPT-5 for Zero-Shot Multimodal Medical Reasoning in Radiology and Radiation Oncology
- Performance of GPT-5 in Brain Tumor MRI Reasoning
- PASS: Probabilistic Agentic Supernet Sampling for Interpretable and Adaptive Chest X-Ray Reasoning
- AdaptFlow: Adaptive Workflow Optimization via Meta-Learning
- Capabilities of GPT-5 on Multimodal Medical Reasoning
- FEAT: A Multi-Agent Forensic AI System with Domain-Adapted Large Language Model for Automated Cause-of-Death Analysis
- On the Limits of Selective AI Prediction: A Case Study in Clinical Decision Making
- Root Cause Analysis Training for Healthcare Professionals With AI-Powered Virtual Simulation: A Proof-of-Concept
- Charts-of-Thought: Enhancing LLM Visualization Literacy Through Structured Data Extraction
- Data Overdose? Time for a Quadruple Shot: Knowledge Graph Construction using Enhanced Triple Extraction
- TT-XAI: Trustworthy Clinical Text Explanations via Keyword Distillation and LLM Reasoning
- A Systematic Review of Key Retrieval-Augmented Generation (RAG) Systems: Progress, Gaps, and Future Directions
- Deceptive Grounding: Entity Attribution Failure in Clinical Retrieval-Augmented Generation
- Enhancing emergency medical service diversion decision-making through large language models integration
- Foundation model [wikipedia]
- GPT-4 [wikipedia]
Discussions
Related