Self-Consistency Improves Chain of Thought Reasoning in Language Models
2022/03/21 by Xuezhi Wang, Wang, Xuezhi, Wei, Jason +9 · 965 citations
Computer Science · #Topic Modeling #Natural Language Processing Techniques #Advanced Graph Neural Networks
paper · pdf · doi:10.48550/arxiv.2203.11171
Abstract
Chain-of-thought prompting combined with pre-trained large language models has achieved encouraging results on complex reasoning tasks. In this paper, we propose a new decoding strategy, self-consistency, to replace the naive greedy decoding used in chain-of-thought prompting. It first samples a diverse set of reasoning paths instead of only taking the greedy one, and then selects the most consistent answer by marginalizing out the sampled reasoning paths. Self-consistency leverages the intuition that a complex reasoning problem typically admits multiple different ways of thinking leading to its unique correct answer. Our extensive empirical evaluation shows that self-consistency boosts the performance of chain-of-thought prompting with a striking margin on a range of popular arithmetic and commonsense reasoning benchmarks, including GSM8K (+17.9%), SVAMP (+11.0%), AQuA (+12.2%), StrategyQA (+6.4%) and ARC-challenge (+3.9%).
Cited by
- Single LLM Debate, MoLaCE: Mixture of Latent Concept Experts Against Confirmation Bias
- Beyond Correctness: Exposing LLM-generated Logical Flaws in Reasoning via Multi-step Automated Theorem Proving
- CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation
- Anka: A Domain-Specific Language for Reliable LLM Code Generation
- Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process
- SPIRAL: Symbolic LLM Planning via Grounded and Reflective Search
- Scaling Unverifiable Rewards: A Case Study on Visual Insights
- Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs
- Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
- Agentic Software Issue Resolution with Large Language Models: A Survey
- Calibrating LLM Judges: Linear Probes for Fast and Reliable Uncertainty Estimation
- State-dependent error correlations shape voting thresholds in committees of AI agents
- Training Language Models to Cooperate with Inference-Time Controllers
- A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever
- Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation
- Verbalized Particle Posterior: Bayesian Inference over Natural Language Hypotheses
- Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets
- Hierarchical Group-Conditional Conformal Risk Control for Selective Prediction in Language Models
- Statistically Supported LLM Ingredient and Recipe Data Collection in Computational Nutrition
- ConsistencyGate: Preventing Memory Contamination in LLM Agents via Self-Consistency Admission Control
- Visual prompt engineering for video models
- Beyond Prefill-Decode Disaggregation: Dissecting LLM Inference for Heterogeneous Platforms via Dynamic Operator Scheduling
- Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference
- When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness
- HALLELUAI: A Hallucination-Aware AI System for Ultra-Realistic Image-to-Video Generation at Scale
- MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution
- How Well Can AI Generate Backlogs from App Mockups?
- Agent Team Work Zone: An Automated, Persistent Workspace for Long-Lived Claude Code Agent Teams
- Do Language Models Converge to Themselves? Recursive Self-Refinement as Textual Relaxation
- Measuring and Improving Behavioral Consistency in Large Language Models through Fact-Heuristic-Emotion State Enforcement
- Evolving from Lessons: Skill-Augmented Table Graph Reasoning for Operation-wise Table Question Answering
- DeepLook: Deeper Thinking with Lookahead
- DeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs
- Evaluating large language models for diagnostic reasoning from unstructured clinical narratives in epilepsy
- Procedural Knowledge at Scale Improves Reasoning
- StAR: Segment Anything Reasoner
- Method Decoration (DeMe): A Framework for LLM-Driven Adaptive Method Generation in Dynamic IoT Environments
- What Makes a GitHub Issue Ready for Copilot?
- AegisAgent: An Autonomous Defense Agent Against Prompt Injection Attacks in LLM-HARs
- Pioneering Multimodal Emotion Recognition in the Era of Large Models: From Closed Sets to Open Vocabularies
- PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding
- Multi-LLM Thematic Analysis with Dual Reliability Metrics: Combining Cohen's Kappa and Semantic Similarity for Qualitative Research Validation
- Reason2Decide: Rationale-Driven Multi-Task Learning
- Reaching Agreement Among Reasoning LLM Agents
- Demystifying LLM-as-a-Judge: Analytically Tractable Model for Inference-Time Scaling
- Understanding Chain-of-Thought in Large Language Models via Topological Data Analysis
- A Large Language Model Based Method for Complex Logical Reasoning over Knowledge Graphs
- Population-Evolve: a Parallel Sampling and Evolutionary Method for LLM Math Reasoning
- HARMON-E: Hierarchical Agentic Reasoning for Multimodal Oncology Notes to Extract Structured Data
- Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs
- MDToC: Metacognitive Dynamic Tree of Concepts for Boosting Mathematical Problem-Solving of Large Language Models
- Multi-Agent LLM Committees for Autonomous Software Beta Testing
- Reflective Confidence: Correcting Reasoning Flaws via Online Self-Correction
- Training LLMs with LogicReward for Faithful and Rigorous Reasoning
- External Hippocampus: Topological Cognitive Maps for Guiding Large Language Model Reasoning
- Eidoku: A Neuro-Symbolic Verification Gate for LLM Reasoning via Structural Constraint Satisfaction
- Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs
- Trust-Region Adaptive Policy Optimization
- Constructive Circuit Amplification: Improving Math Reasoning in LLMs via Targeted Sub-Network Updates
- Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
- FlowDet: Unifying Object Detection and Generative Transport Flows
- Emergent Bias and Fairness in Multi-Agent Decision Systems
- A Network Arena for Benchmarking AI Agents on Network Troubleshooting
- Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation
- QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems
- ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs
- BRAID: Bounded Reasoning for Autonomous Inference and Decisions
- City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs
- Characterizing Mamba's Selective Memory using Auto-Encoders
- Step-GUI Technical Report
- Dual-Density Inference for Efficient Language Model Reasoning
- Evaluating LLMs for Zeolite Synthesis Event Extraction (ZSEE): A Systematic Analysis of Prompting Strategies
- RFKG-CoT: Relation-Driven Adaptive Hop-count Selection and Few-Shot Path Guidance for Knowledge-Aware QA
- Do Large Language Models Know What They Don't Know? Kalshibench: A New Benchmark for Evaluating Epistemic Calibration via Prediction Markets
- Beyond Fast and Slow: Cognitive-Inspired Elastic Reasoning for Large Language Models
- An Exploratory Study of Bayesian Prompt Optimization for Test-Driven Code Generation with Large Language Models
- Multi-Agent Medical Decision Consensus Matrix System: An Intelligent Collaborative Framework for Oncology MDT Consultations
- Intention Chain-of-Thought Prompting with Dynamic Routing for Code Generation
- OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
- Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning
- Let's (not) just put things in Context: Test-Time Training for Long-Context LLMs
- Error-Driven Prompt Optimization for Arithmetic Reasoning
- ORIBA: Exploring LLM-Driven Role-Play Chatbot as a Creativity Support Tool for Original Character Artists
- Socratic Students: Teaching Language Models to Learn by Asking Questions
- How Prompts Move Language Model Behavior: Frames, Salience, and Construal as Semantic Control
- Hold Onto That Thought: Assessing KV Cache Compression On Reasoning
- When Actions Teach You to Think: Reasoning-Action Synergy via Reinforcement Learning in Conversational Agents
- FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modularized Collaboration
- Limits and Gains of Test-Time Scaling in Vision-Language Reasoning
- PIAST: Rapid Prompting with In-context Augmentation for Scarce Training data
- Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors
- BAMBO: Construct Ability and Efficiency LLM Pareto Set via Bayesian Adaptive Multi-objective Block-wise Optimization
- Encoder-Free Knowledge-Graph Reasoning with LLMs via Hyperdimensional Path Retrieval
- Decoupling Template Bias in CLIP: Harnessing Empty Prompts for Enhanced Few-Shot Learning
- Enhancing Clinical Note Generation with ICD-10, Clinical Ontology Knowledge Graphs, and Chain-of-Thought Prompting Using GPT-4
- Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation
- ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning
- Metric-Fair Prompting: Treating Similar Samples Similarly
- Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
- Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning
- CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks
- Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models
- TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models
- Prompting Science Report 4: Playing Pretend: Expert Personas Don't Improve Factual Accuracy
- The Missing Layer of AGI: From Pattern Alchemy to Coordination Physics
- MARINE: Theoretical Optimization and Design for Multi-Agent Recursive IN-context Enhancement
- CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning
- RoBoN: Routed Online Best-of-n for Test-Time Scaling with Multiple LLMs
- The Seeds of Scheming: Weakness of Will in the Building Blocks of Agentic Systems
- RevoNAD: Reflective Evolutionary Exploration for Neural Architecture Design
- Algorithmic Thinking Theory
- Dual-Use AI Face Swap Apps Are Mostly Unsafe: A Systematic Safety Audit
- Beyond Factual Accuracy: Evaluating Global Reasoning Integrity in RAG Systems with LogicScore
- On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference
- Distance Is All You Need: Radial Dispersion for Uncertainty Estimation in Large Language Models
- From Hypothesis to Premises: LLM-based Backward Logical Reasoning with Selective Symbolic Translation
- CrowdLLM: Building LLM-Based Digital Populations Augmented with Generative Models
- SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
- Network Self-Configuration based on Fine-Tuned Small Language Models
- From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks
- In-Context Distillation with Self-Consistency Cascades: A Simple, Training-Free Way to Reduce LLM Agent Costs
- WISE: Weighted Iterative Society-of-Experts for Robust Multimodal Multi-Agent Debate
- Distribution-Calibrated Inference Time Compute for Thinking LLM-as-a-Judge
- When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers
- Think in Parallel, Answer as One: Logit Averaging for Open-Ended Reasoning
- ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
- DETAIL Matters: Measuring the Impact of Prompt Specificity on Reasoning in Large Language Models
- ALARM: Automated MLLM-Based Anomaly Detection in Complex-EnviRonment Monitoring with Uncertainty Quantification
- The Art of Scaling Test-Time Compute for Large Language Models
- Latent Debate: A Surrogate Framework for Interpreting LLM Thinking
- Zero-Overhead Introspection for Adaptive Test-Time Compute
- ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models
- RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving
- Mode-Conditioning Unlocks Superior Test-Time Scaling
- IndiMathBench: Autoformalizing Mathematical Reasoning Problems with a Human Touch
- ART: Adaptive Response Tuning Framework -- A Multi-Agent Tournament-Based Approach to LLM Response Optimization
- Large Language Model based Smart Contract Auditing with LLMBugScanner
- Augmented Runtime Collaboration for Self-Organizing Multi-Agent Systems: A Hybrid Bi-Criteria Routing Approach
- SCALE: Selective Resource Allocation for Overcoming Performance Bottlenecks in Mathematical Test-time Scaling
- ML-Tool-Bench: Tool-Augmented Planning for ML Tasks
- Aligning Probabilistic Beliefs under Informative Missingness: LLM Steerability in Clinical Reasoning
- Evaluating LLMs for One-Shot Patching of Real and Artificial Vulnerabilities
- Toward a Safe Internet of Agents
- Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
- Multi-chain Graph Refinement and Selection for Reliable Reasoning in Large Language Models
- Experts are all you need: A Composable Framework for Large Language Model Inference
- ORION: Teaching Language Models to Reason Efficiently in the Language of Thought
- Adversarial Training for Process Reward Models
- AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture
- Analyzing Image Beyond Visual Aspect: Image Emotion Classification via Multiple-Affective Captioning
- VeriDispatcher: Multi-Model Dispatching through Pre-Inference Difficulty Prediction for RTL Generation Optimization
- Rethinking Test Time Scaling for Flow-Matching Generative Models
- On the Limits of Innate Planning in Large Language Models
- EWE: An Agentic Framework for Extreme Weather Analysis
- Scaling Generative Verifiers For Natural Language Mathematical Proof Verification And Selection
- GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs
- BRIDGE: Building Representations In Domain Guided Program Verification
- Aragog: Just-in-Time Model Routing for Scalable Serving of Agentic Workflows
- Complex QA and language models hybrid architectures, Survey
- DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs
- Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
- VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
- ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models
- Cross Domain Evaluation of Multimodal Chain-of-Thought Reasoning of different datasets into the Amazon CoT Framework
- LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models
- GraphMind: Theorem Selection and Conclusion Generation Framework with Dynamic GNN for LLM Reasoning
- Majority of the Bests: Improving Best-of-N via Bootstrapping
- Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
- DELTA: Language Diffusion-based EEG-to-Text Architecture
- A2Flow: Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- Reuse, Don't Recompute: Efficient Large Reasoning Model Inference via Memory Orchestration
- LLMs as Firmware Experts: A Runtime-Grown Tree-of-Agents Framework
- MedRule-KG: A Knowledge-Graph--Steered Scaffold for Reliable Mathematical and Biomedical Reasoning
- Enhancing Automated Program Repair via Faulty Token Localization and Quality-Aware Patch Refinement
- SPINE: Token-Selective Test-Time Reinforcement Learning with Entropy-Band Regularization
- Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Language Models
- AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale
- FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle
- Hallucinate Less by Thinking More: Aspect-Based Causal Abstention for Large Language Models
- HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation
- Do Vision-Language Models Understand Visual Persuasiveness?
- Budget-Aware Tool-Use Enables Effective Agent Scaling
- V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models
- Goal-Directed Search Outperforms Goal-Agnostic Memory Compression in Long-Context Memory Tasks
- Cognitive Foundations for Reasoning and Their Manifestation in LLMs
- SDA: Steering-Driven Distribution Alignment for Open LLMs without Fine-Tuning
- Pass@k Metric for RLVR: A Diagnostic Tool of Exploration, But Not an Objective
- JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
- Step-Audio-R1 Technical Report
- When to Think and When to Look: Uncertainty-Guided Lookback
- ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions
- Efficiency Will Not Lead to Sustainable Reasoning AI
- SkinGPT-R1: Adapter-Only Dual Distillation for Efficient Dermatology Reasoning
- OEMA: Ontology-Enhanced Multi-Agent Collaboration Framework for Zero-Shot Clinical Named Entity Recognition
- SafeRBench: A Comprehensive Benchmark for Safety Assessment in Large Reasoning Models
- ProRAC: A Neuro-symbolic Method for Reasoning about Actions with LLM-based Progression
- Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
- RB-FT: Rationale-Bootstrapped Fine-Tuning for Video Classification
- SVBRD-LLM: Self-Verifying Behavioral Rule Discovery for Autonomous Vehicle Identification
- GPS: General Per-Sample Prompter
- Extending Test-Time Scaling: A 3D Perspective with Context, Batch, and Turn
- Collaborative QA using Interacting LLMs. Impact of Network Structure, Node Capability and Distributed Data
- Dynamic Template Selection for Output Token Generation Optimization: MLP-Based and Transformer Approaches
- Quantifying and Mitigating Selection Bias in LLMs: A Transferable LoRA Fine-Tuning and Efficient Majority Voting Approach
- MedDCR: Learning to Design Agentic Workflows for Medical Coding
- Think with Self-Decoupling and Self-Verification: Automated RTL Design with Backtrack-ToT
- From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
- Scaling Graph Chain-of-Thought Reasoning: A Multi-Agent Framework with Efficient LLM Serving
- MedSumGraph: enhancing GraphRAG for medical QA with summarization and optimized prompts
- R2Seg: Training-Free OOD Medical Tumor Segmentation via Anatomical Reasoning and Statistical Rejection
- Knots: A Large-Scale Multi-Agent Enhanced Expert-Annotated Dataset and LLM Prompt Optimization for NOTAM Semantic Parsing
- ARCHE: A Novel Task to Evaluate LLMs on Latent Reasoning Chain Extraction
- Optimal Self-Consistency for Efficient Reasoning with Large Language Models
- Learning to Refine: An Agentic RL Approach for Iterative SPARQL Query Construction
- An Analysis of Architectural Impact on LLM-based Abstract Visual Reasoning: A Systematic Benchmark on RAVEN-FAIR
- Scaling Open-Weight Large Language Models for Hydropower Regulatory Information Extraction: A Systematic Analysis
- On the Notion that Language Models Reason
- iMAD: Intelligent Multi-Agent Debate for Efficient and Accurate LLM Inference
- Hindsight Distillation Reasoning with Knowledge Encouragement Preference for Knowledge-based Visual Question Answering
- Binary Verification for Zero-Shot Vision
- Socrates-Mol: Self-Oriented Cognitive Reasoning through Autonomous Trial-and-Error with Empirical-Bayesian Screening for Molecules
- ProgRAG: Hallucination-Resistant Progressive Retrieval and Reasoning over Knowledge Graphs
- Efficient Thought Space Exploration Through Strategic Intervention
- Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling
- Modeling Uncertainty Trends for Timely Retrieval in Dynamic RAG
- Seer Self-Consistency: Advance Budget Estimation for Adaptive Test-Time Scaling
- Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives
- Automatic Minds: Cognitive Parallels Between Hypnotic States and Large Language Model Processing
- AlphaCast: A Human Wisdom-LLM Intelligence Co-Reasoning Framework for Interactive Time Series Forecasting
- Hierarchical Memorization in Large Language Models: Evidence from Citation Generation
- Consensus Sampling for Safer Generative AI
- DynaAct: Large Language Model Reasoning with Dynamic Action Spaces
- Knowledge-Augmented Long-CoT Generation for Complex Biomolecular Reasoning
- Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models
- DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF
- Last Layer Logits to Logic: Empowering LLMs with Logic-Consistent Structured Knowledge Reasoning
- Judging by the Rules: Compliance-Aligned Framework for Modern Slavery Statement Monitoring
- PCRLLM: Proof-Carrying Reasoning with Large Language Models under Stepwise Logical Constraints
- C3PO: Optimized Large Language Model Cascades with Probabilistic Cost Constraints for Reasoning
- Voice-Interactive Surgical Agent for Multimodal Patient Data Control
- Think Consistently, Reason Efficiently: Energy-Based Calibration for Implicit Chain-of-Thought
- CoLM: Collaborative Large Models via A Client-Server Paradigm
- A Meta-Evaluation of Faithfulness Metrics for Long-Form Hospital-Course Summarization
- TabRAG: Tabular Document Retrieval via Structured Language Representations
- SAFENLIDB: A Privacy-Preserving Safety Alignment Framework for LLM-based Natural Language Database Interfaces
- A Low-Rank Method for Vision Language Model Hallucination Mitigation in Autonomous Driving
- Data Trajectory Alignment for LLM Domain Adaptation: A Two-Phase Synthesis Framework for Telecommunications Mathematics
- Self-Evaluating LLMs for Multi-Step Tasks: Stepwise Confidence Estimation for Failure Detection
- ALIGN: A Vision-Language Framework for High-Accuracy Accident Location Inference through Geo-Spatial Neural Reasoning
- Confidence-Guided Stepwise Model Routing for Cost-Efficient Reasoning
- TimeSense:Making Large Language Models Proficient in Time-Series Analysis
- FLEX: Continuous Agent Evolution via Forward Learning from Experience
- Kunlun Anomaly Troubleshooter: Enabling Kernel-Level Anomaly Detection and Causal Reasoning for Large Model Distributed Inference
- In-depth Analysis on Caching and Pre-fetching in Mixture of Experts Offloading
- CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization
- Culture in Action: Evaluating Text-to-Image Models through Social Activities
- Logit-Entropy Adaptive Stopping Heuristic for Efficient Chain-of-Thought Reasoning
- Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
- Reusing Pre-Training Data at Test Time is a Compute Multiplier
- Batch Prompting Suppresses Overthinking Reasoning Under Constraint: How Batch Prompting Suppresses Overthinking in Reasoning Models
- PSD2Code: Automated Front-End Code Generation from Design Files via Multimodal Large Language Models
- Revealing AI Reasoning Increases Trust but Crowds Out Unique Human Knowledge
- Efficient Reasoning via Thought-Training and Thought-Free Inference
- GEMMA-SQL: A Novel Text-to-SQL Model Based on Large Language Models
- LFC-DA: Logical Formula-Controlled Data Augmentation for Enhanced Logical Reasoning
- From Five Dimensions to Many: Large Language Models as Precise and Interpretable Psychological Profilers
- Analyzing the Power of Chain of Thought through Memorization Capabilities
- QiMeng-NeuComBack: Self-Evolving Translation from IR to Assembly Code
- CGES: Confidence-Guided Early Stopping for Efficient and Accurate Self-Consistency
- LTD-Bench: Evaluating Large Language Models by Letting Them Draw
- The Sequential Edge: Inverse-Entropy Voting Beats Parallel Self-Consistency at Matched Compute
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- LA-MARRVEL: A Knowledge-Grounded, Language-Aware LLM Framework for Clinically Robust Rare Disease Gene Prioritization
- Personalized Decision Modeling: Utility Optimization or Textualized-Symbolic Reasoning
- When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
- FEval-TTC: Fair Evaluation Protocol for Test-Time Compute
- Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning
- GeoToken: Hierarchical Geolocalization of Images via Next Token Prediction
- Efficient Test-Time Retrieval Augmented Generation
- MARS-SQL: A multi-agent reinforcement learning framework for Text-to-SQL
- ORANGE: An Online Reflection ANd GEneration framework with Domain Knowledge for Text-to-SQL
- Assessing LLM Reasoning Steps via Principal Knowledge Grounding
- Do Math Reasoning LLMs Help Predict the Impact of Public Transit Events?
- How Focused Are LLMs? A Quantitative Study via Repetitive Deterministic Prediction Tasks
- Self-Consistency Is Losing Its Edge: Diminishing Returns and Rising Costs in Modern LLMs
- Inference-Time Chain-of-Thought Pruning with Latent Informativeness Signals
- Test-time Scaling of LLMs: A Survey from A Subproblem Structure Perspective
- DTS: Enhancing Large Reasoning Models via Decoding Tree Sketching
- SpecDiff-2: Scaling Diffusion Drafter Alignment For Faster Speculative Decoding
- Reasoning Planning for Language Models
- TreeQA: Enhanced LLM-RAG with logic tree reasoning for reliable and interpretable multi-hop question answering
- Sherlock: Reliable and Efficient Agentic Workflow Execution
- TempoBench: Evaluating Temporal Causal Reasoning in Large Language Models
- ThoughtProbe: Classifier-Guided LLM Thought Space Exploration via Probing Representations
- A Survey on Generative Recommendation: Data, Model, and Tasks
- Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks
- LLMs are Overconfident: Evaluating Confidence Interval Calibration with FermiEval
- Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models
- Chopping Trees: Semantic Similarity Based Dynamic Pruning for Tree-of-Thought Reasoning
- Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems
- The Geometry of Dialogue: Graphing Language Models to Reveal Synergistic Teams for Multi-Agent Collaboration
- Do LLMs Signal When They're Right? Evidence from Neuron Agreement
- Pragmatic Theories Enhance Understanding of Implied Meanings in LLMs
- Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking
- Limits of Generalization in RLVR: Two Case Studies in Mathematical Reasoning
- CAVE: Detecting and Explaining Commonsense Anomalies in Visual Environments
- Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph
- Symbolically Scaffolded Play: Designing Role-Sensitive Prompts for Generative NPC Dialogue
- TextualVerifier: Verify TextGrad Step-by-Step
- LLM-as-a-Verifier: A General-Purpose Verification Framework
- Cache Merging as a Convergent Replicated State for Multi-Agent Latent Reasoning
- Considering the ethics of large machine learning models in the chemical sciences
- Rethinking the Evaluation of Harness Evolution for Agents
- Large Language Models for Software Engineering Diagrams: A Systematic Review of UML and ER modelling
- A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models
- Lang-PINN: From Language to Physics-Informed Neural Networks via a Multi-Agent Framework
- LLM-TSFD: An industrial time series human-in-the-loop fault diagnosis method based on a large language model
- Truth-Aware Decoding: A Program-Logic Approach to Factual Language Generation
- The Architecture of Errors: From Universal Impossibility to Patch-Local LLM Reliability
- STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision
- Metacognition Should Be the Scientific Framework for Bounded and Effective Self-Governance in Generative AI
- Lattice Deduction Transformers
- The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration
- GroupRAG: Cognitively Inspired Group-Aware Retrieval and Reasoning via Knowledge-Driven Problem Structuring
- When Agents Disagree With Themselves: Behavioral Consistency as an Uncertainty Signal for LLM Agents
- Large language models encode clinical knowledge
- How well LLM-based test generation techniques perform with newer LLM versions?
- TrajSelector: Harnessing Latent Representations for Efficient and Effective Best-of-N in Large Reasoning Model
- Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
- Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items?
- Aligning Large Language Models with Procedural Rules: An Autoregressive State-Tracking Prompting for In-Game Trading
- ParallelMuse: Agentic Parallel Thinking for Deep Information Seeking
- LoRA-DA: Data-Aware Initialization for Low-Rank Adaptation via Asymptotic Analysis
- Quantum Combinatorial Reasoning for Large Language Models
- Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
- Verifying Large Language Models' Reasoning Paths via Correlation Matrix Rank
- Auto prompting without training labels: An LLM cascade for product quality assessment in e-commerce catalogs
- ProofSketch: Efficient Verified Reasoning for Large Language Models
- From Stochasticity to Signal: A Bayesian Latent State Model for Reliable Measurement with LLMs
- SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
- Compiler.next: A Search-Based Compiler to Power the AI-Native Future of Software Engineering
- TDFlow: Agentic Workflows for Test Driven Software Engineering
- Think Twice: Branch-and-Rethink Reasoning Reward Model
- Unleashing Diverse Thinking Modes in LLMs through Multi-Agent Collaboration
- BrowseConf: Confidence-Guided Test-Time Scaling for Web Agents
- Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
- Can Language Models Compose Skills In-Context?
- Reasoning About Reasoning: Towards Informed and Reflective Use of LLM Reasoning in HCI
- Scalable Supervising Software Agents with Patch Reasoner
- Multi-Modal Fact-Verification Framework for Reducing Hallucinations in Large Language Models
- S-Chain: Structured Visual Chain-of-Thought For Medicine
- Scalable Oversight via Partitioned Human Supervision
- Agent-GSPO: Communication-Efficient Multi-Agent Systems via Group Sequence Policy Optimization
- CHOIR: Collaborative Harmonization fOr Inference Robustness
- Chitchat with AI: Understand the supply chain carbon disclosure of companies worldwide through Large Language Model
- You Don't Need Prompt Engineering Anymore: The Prompting Inversion
- Controllable Mathematical Reasoning via Self-Optimizing Thought Vectors
- Foundation of Intelligence: Review of Math Word Problems from Human Cognition Perspective
- RETuning: Upgrading Inference-Time Scaling for Stock Movement Prediction with Large Language Models
- Boosting Accuracy and Efficiency of Budget Forcing in LLMs via Reinforcement Learning for Mathematical Reasoning
- Co-Sight: Enhancing LLM-Based Agents via Conflict-Aware Meta-Verification and Trustworthy Reasoning with Structured Facts
- Unifying Large Language Models and Knowledge Graphs: A Roadmap
- String Seed of Thought: Prompting LLMs for Distribution-Faithful and Diverse Generation
- Large Language Models Meet Text-Attributed Graphs: A Survey of Integration Frameworks and Applications
- The Virtues of Brevity: Avoid Overthinking in Parallel Test-Time Reasoning
- Reasoning's Razor: Reasoning Improves Accuracy but Can Hurt Recall at Critical Operating Points in Safety and Hallucination Detection
- Towards Scalable Oversight with Collaborative Multi-Agent Debate in Error Detection
- Language Ranker: A Lightweight Ranking framework for LLM Decoding
- GeoThought: A Dataset for Enhancing Mathematical Geometry Reasoning in Vision-Language Models
- Neural Diversity Regularizes Hallucinations in Small Models
- Systematic Evaluation of Uncertainty Estimation Methods in Large Language Models
- The Shape of Reasoning: Topological Analysis of Reasoning Traces in Large Language Models
- Robust Preference Alignment via Directional Neighborhood Consensus
- Automatic Prompt Engineering for Automatic Scoring
- TriAgent: Automated Biomarker Discovery with Deep Research Grounding for Triage in Acute Care by LLM-Based Multi-Agent Collaboration
- Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding
- Rethinking Cross-lingual Gaps from a Statistical Viewpoint
- Enhancing visual-LLM for construction site safety compliance via prompt engineering and Bi-stage retrieval-augmented generation
- SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models
- Teaming LLMs to Detect and Mitigate Hallucinations
- Automated HIV Screening on Dutch Electronic Health Records with Large Language Models
- AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
- The Zero-Step Thinking: An Empirical Study of Mode Selection as Harder Early Exit in Reasoning Models
- SheetBrain: A Neuro-Symbolic Agent for Accurate Reasoning over Complex and Large Spreadsheets
- DiSRouter: Distributed Self-Routing for LLM Selections
- What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
- Robust Driving QA through Metadata-Grounded Context and Task-Specific Prompts
- Prompt Decorators: A Declarative and Composable Syntax for Reasoning, Formatting, and Control in LLMs
- Large language models in medicine
- PlanU: Large Language Model Reasoning through Planning under Uncertainty
- 3D Optimization for AI Inference Scaling: Balancing Accuracy, Cost, and Latency
- DelvePO: Direction-Guided Self-Evolving Framework for Flexible Prompt Optimization
- Exemplar-Guided Planing: Enhanced LLM Agent for KGQA
- OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning
- Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
- LLM-as-a-Prophet: Understanding Predictive Intelligence with Prophet Arena
- Certified Self-Consistency: Statistical Guarantees and Test-Time Training for Reliable Reasoning in LLMs
- Strengthening LLMs for Tabular Prediction with Structural Priors
- StreamingThinker: Large Language Models Can Think While Reading
- CLAWS:Creativity detection for LLM-generated solutions using Attention Window of Sections
- Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation
- QueST: Incentivizing LLMs to Generate Difficult Problems
- I-RAVEN-X: Benchmarking Generalization and Robustness of Analogical and Mathematical Reasoning in Large Language and Reasoning Models
- Reasoning Distillation and Structural Alignment for Improved Code Generation
- DAG-Math: Graph-of-Thought Guided Mathematical Reasoning in LLMs
- Investigating the Impact of Rationales for LLMs on Natural Language Understanding
- Planner and Executor: Collaboration between Discrete Diffusion And Autoregressive Models in Reasoning
- The Spark Effect: On Engineering Creative Diversity in Multi-Agent AI Systems
- Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert models
- A Theoretical Study on Bridging Internal Probability and Self-Consistency for LLM Reasoning
- CarBoN: Calibrated Best-of-N Sampling Improves Test-time Reasoning
- LSPO: Length-aware Dynamic Sampling for Policy Optimization in LLM Reasoning
- Fusion-Augmented Large Language Models: Boosting Diagnostic Trustworthiness via Model Consensus
- Composition-Grounded Instruction Synthesis for Visual Reasoning
- Harmonizing Diverse Models: A Layer-wise Merging Strategy for Consistent Generation
- Mapping Smarter, Not Harder: A Test-Time Reinforcement Learning Agent That Improves Without Labels or Model Updates
- You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
- Boosting Instruction Following at Scale
- Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning
- COIG-Writer: A High-Quality Dataset for Chinese Creative Writing with Thought Processes
- ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling
- LLM Agents Beyond Utility: An Open-Ended Perspective
- Suicidal Comment Tree Dataset: Enhancing Risk Assessment and Prediction Through Contextual Analysis
- CURE: Confidence-driven Unified Reasoning Ensemble Framework for Medical Question Answering
- Automated Extraction of Protocol State Machines from 3GPP Specifications with Domain-Informed Prompts and LLM Ensembles
- Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction
- Where to Search: Measure the Prior-Structured Search Space of LLM Agents
- Budget-aware Test-time Scaling via Discriminative Verification
- Stop Reducing Responsibility in LLM-Powered Multi-Agent Systems to Local Alignment
- Classifying and Addressing the Diversity of Errors in Retrieval-Augmented Generation Systems
- Big Reasoning with Small Models: Instruction Retrieval at Inference Time
- In-Distribution Steering: Balancing Control and Coherence in Language Model Generation
- Stable LLM Ensemble: Interaction between Example Representativeness and Diversity
- Retrieval-in-the-Chain: Bootstrapping Large Language Models for Generative Retrieval
- Towards Human-Centric Intelligent Treatment Planning for Radiation Therapy
- Higher Satisfaction, Lower Cost: A Technical Report on How LLMs Revolutionize Meituan's Intelligent Interaction Systems
- ESI: Epistemic Uncertainty Quantification via Semantic-preserving Intervention for Large Language Models
- Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling
- Adaptive Reasoning Executor: A Collaborative Agent System for Efficient Reasoning
- Max It or Miss It: Benchmarking LLM On Solving Extremal Problems
- Schema for In-Context Learning
- Benefits and Limitations of Communication in Multi-Agent Reasoning
- Multi-Agent Debate for LLM Judges with Adaptive Stability Detection
- PromptFlow: Training Prompts Like Neural Networks
- Evolution of meta's llama models and parameter-efficient fine-tuning of large language models: a survey
- Towards Inference-time Scaling for Continuous Space Reasoning
- A Survey on Parallel Reasoning
- HoneyBee: Data Recipes for Vision-Language Reasoners
- LLM Reasoning for Machine Translation: Synthetic Data Generation over Thinking Tokens
- DMAS-Forge: A Framework for Transparent Deployment of AI Applications as Distributed Systems
- OneRec-Think: In-Text Reasoning for Generative Recommendation
- ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
- LLM-Specific Utility: A New Perspective for Retrieval-Augmented Generation
- EAGER: Entropy-Aware GEneRation for Adaptive Inference-Time Scaling
- CoSPED: Consistent Soft Prompt Targeted Data Extraction and Defense
- Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization
- Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
- Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning
- D3MAS: Decompose, Deduce, and Distribute for Enhanced Knowledge Sharing in Multi-Agent Systems
- Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?
- Tracing the Traces: Latent Temporal Signals for Efficient and Accurate Reasoning
- LLM-Friendly Knowledge Representation for Customer Support
- Agro-Consensus: Semantic Self-Consistency in Vision-Language Models for Crop Disease Management in Developing Countries
- MatryoshkaThinking: Recursive Test-Time Scaling Enables Efficient Reasoning
- Audit-of-Understanding: Posterior-Constrained Inference for Mathematical Reasoning in Language Models
- Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inference
- SwarmSys: Decentralized Swarm-Inspired Agents for Scalable and Adaptive Reasoning
- Failure-Driven Workflow Refinement
- Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
- Ontology-Guided Neuro-Symbolic Inference: Grounding Language Models with Mathematical Domain Knowledge
- PromptGuard at BLP-2025 Task 1: A Few-Shot Classification Framework Using Majority Voting and Keyword Similarity for Bengali Hate Speech Detection
- Prompting Test-Time Scaling Is A Strong LLM Reasoning Data Augmentation
- SIMBA UQ: Similarity-Based Aggregation for Uncertainty Quantification in Large Language Models
- Mitigating Overthinking through Reasoning Shaping
- Agentic Systems in Radiology: Design, Applications, Evaluation, and Challenges
- Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
- Safety Game: Balancing Safe and Informative Conversations with Blackbox Agentic AI using LP Solvers
- MEC3O: Multi-Expert Consensus for Code Time Complexity Prediction
- Repairing Regex Vulnerabilities via Localization-Guided Instructions
- MASA: LLM-Driven Multi-Agent Systems for Autoformalization
- Fundamentals of Building Autonomous LLM Agents
- Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models
- FOR-Prompting: From Objection to Revision via an Asymmetric Prompting Protocol
- RefGrader: Automated Grading of Mathematical Competition Proofs using Agentic Workflows
- Q-Router: Agentic Video Quality Assessment with Expert Model Routing and Artifact Localization
- CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards
- Think Just Enough: Sequence-Level Entropy as a Confidence Signal for LLM Reasoning
- Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models
- GCPO: When Contrast Fails, Go Gold
- Parallel Test-Time Scaling for Latent Reasoning Models
- Selection, Reflection and Self-Refinement: Revisit Reasoning Tasks via a Causal Lens
- xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning
- MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding
- LOGicalThought: Logic-Based Ontological Grounding of LLMs for High-Assurance Reasoning
- TS-Agent: Understanding and Reasoning Over Raw Time Series via Iterative Insight Gathering
- CARPAS: Towards Content-Aware Refinement of Provided Aspects for Summarization in Large Language Models
- Reasoning for Hierarchical Text Classification: The Case of Patents
- On Randomness in Agentic Evals
- CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
- Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression
- Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
- Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B
- Efficient numeracy in language models through single-token number embeddings
- GPT-5 Model Corrected GPT-4V's Chart Reading Errors, Not Prompting
- Foundations of LLM Knowledge Materialization: Termination, Reproducibility, Robustness
- Iterative LLM-Based Generation and Refinement of Distracting Conditions in Math Word Problems
- On the Role of Temperature Sampling in Test-Time Scaling
- Optimal Stopping vs Best-of-N for Inference Time Optimization
- Auto-Prompt Ensemble for LLM Judge
- Adaptive Tool Generation with Models as Tools and Reinforcement Learning
- Get RICH or Die Scaling: Profitably Trading Inference Compute for Robustness
- AsyncSpade: Efficient Test-Time Scaling with Asynchronous Sparse Decoding
- Self-signals Driven Multi-LLM Debate for Efficient and Accurate Reasoning
- Valid Stopping for LLM Generation via Empirical Dynamic Formal Lift
- Belief-Calibrated Multi-Agent Consensus Seeking for Complex NLP Tasks
- Pushing Test-Time Scaling Limits of Deep Search with Asymmetric Verification
- Towards Label-Free Biological Reasoning Synthetic Dataset Creation via Uncertainty Filtering
- ARM: Discovering Agentic Reasoning Modules for Generalizable Multi-Agent Systems
- AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning
- Mission Impossible: Feedback-Guided Dynamic Interactive Planning for Improving Reasoning on LLMs
- Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs
- Classical AI vs. LLMs for Decision-Maker Alignment in Health Insurance Choices
- RareAgent: Self-Evolving Reasoning for Drug Repurposing in Rare Diseases
- Verifier-free Test-Time Sampling for Vision-Language-Action Models
- When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
- AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering
- Let it Calm: Exploratory Annealed Decoding for Verifiable Reinforcement Learning
- Slm-mux: Orchestrating small language models for reasoning
- SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
- RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
- AI-to-AI Feedback: Amplified Intelligence — Prior Art and Governance Implications for Multi-Model Advisory Architectures
- Modeling Student Learning with 3.8 Million Program Traces
- Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
- Resource-Efficient Fine-Tuning of LLaMA-3.2-3B for Medical Chain-of-Thought Reasoning
- Bridging Reasoning to Learning: Unmasking Illusions using Complexity Out of Distribution Generalization
- Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
- Multi-Agent Collaborative Intelligence: Dual-Dial Control for Reliable LLM Reasoning
- MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models
- Natural Language Edge Labelling: Decoupling Intent from Execution in Structured LM Reasoning
- Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
- AlphaApollo: Orchestrating Foundation Models and Professional Tools into a Self-Evolving System for Deep Agentic Reasoning
- Open Agent Specification (Agent Spec): A Unified Representation for AI Agents
- PatternKV: Flattening KV Representation Expands Quantization Headroom
- Large Language Models Hallucination: A Comprehensive Survey
- SPOGW: a Score-based Preference Optimization method via Group-Wise comparison for workflows
- Increasing LLM response trustworthiness using voting ensembles
- Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
- Searching Meta Reasoning Skeleton to Guide LLM Reasoning
- Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation
- Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models
- On Using Large Language Models to Enhance Clinically-Driven Missing Data Recovery Algorithms in Electronic Health Records
- MITS: Enhanced Tree Search Reasoning for LLMs via Pointwise Mutual Information
- GuidedSampling: Steering LLMs Towards Diverse Candidate Solutions at Inference-Time
- Efficient Test-Time Scaling for Small Vision-Language Models
- Sample, Align, Synthesize: Graph-Based Response Synthesis with ConGrs
- Best-of-Majority: Minimax-Optimal Strategy for Pass@k Inference Scaling
- Lateral Tree-of-Thoughts Surpasses ToT by Incorporating Logically-Consistent, Low-Utility Candidates
- Self-Reflective Generation at Test Time
- RoiRL: Efficient, Self-Supervised Reasoning with Offline Iterative Reinforcement Learning
- NCV: A Node-Wise Consistency Verification Approach for Low-Cost Structured Error Localization in LLM Reasoning
- Knowledge Graph-Guided Multi-Agent Distillation for Reliable Industrial Question Answering with Datasets
- Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal Retrieval
- AutoMaAS: Self-Evolving Multi-Agent Architecture Search for Large Language Models
- StepChain GraphRAG: Reasoning Over Knowledge Graphs for Multi-Hop Question Answering
- Typed Chain-of-Thought: A Curry-Howard Framework for Verifying LLM Reasoning
- Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
- Hearing the Order: Investigating Selection Bias in Large Audio-Language Models
- When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
- JoyAgent-JDGenie: Technical Report on the GAIA
- Curiosity-Driven LLM-as-a-judge for Personalized Creative Judgment
- Generalized Parallel Scaling with Interdependent Generations
- Rethinking Thinking Tokens: LLMs as Improvement Operators
- Making, not Taking, the Best of N
- CodeChemist: Functional Knowledge Transfer for Low-Resource Code Generation via Test-Time Scaling
- Stochastic Self-Organization in Multi-Agent Systems
- Beyond Majority Voting: LLM Aggregation by Leveraging Higher-Order Information
- Training Large Language Models To Reason In Parallel With Global Forking Tokens
- Judging with Confidence: Calibrating Autoraters to Preference Distributions
- BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
- GRPO-λ: Credit Assignment improves LLM Reasoning
- TAMA: Tool-Augmented Multimodal Agent for Procedural Activity Understanding
- Recursive Self-Aggregation Unlocks Deep Thinking in Large Language Models
- Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark
- Go with Your Gut: Scaling Confidence for Autoregressive Image Generation
- Memory-Driven Self-Improvement for Decision Making with Large Language Models
- Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts
- Reinforced Strategy Optimization for Conversational Recommender Systems via Network-of-Experts
- DyFlow: Dynamic Workflow Framework for Agentic Reasoning
- Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA
- Chain-in-Tree: Back to Sequential Reasoning in LLM Tree Search
- Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking
- TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
- SING-SQL: A Synthetic Data Generation Framework for In-Domain Text-to-SQL Translation
- Nudging the Boundaries of LLM Reasoning
- Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systems
- Explainable Fault Localization for Programming Assignments via LLM-Guided Annotation
- Automated Model Discovery via Multi-modal & Multi-step Pipeline
- Planner-R1: Reward Shaping Enables Efficient Agentic RL with Smaller LLMs
- Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
- SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA
- DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search
- Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
- From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
- PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images
- Rethinking Entropy Regularization in Large Reasoning Models
- SecInfer: Preventing Prompt Injection via Inference-time Scaling
- The Dialogue That Heals: A Comprehensive Evaluation of Doctor Agents' Inquiry Capability
- Intra-request branch orchestration for efficient LLM reasoning
- Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval
- A Hierarchical Error Framework for Reliable Automated Coding in Communication Research: Applications to Health and Political Communication
- KnowGuard: Knowledge-Driven Abstention for Multi-Round Clinical Reasoning
- LatentEvolve: Self-Evolving Test-Time Scaling in Latent Space
- From Ambiguity to Verdict: A Semiotic-Grounded Multi-Perspective Agent for LLM Logical Reasoning
- CDT: A Comprehensive Capability Framework for Large Language Models Across Cognition, Domain, and Task
- Plan before Solving: Problem-Aware Strategy Routing for Mathematical Reasoning with LLMs
- From Static to Dynamic: Adaptive Monte Carlo Search for Mathematical Process Supervision
- MAS2: Self-Generative, Self-Configuring, Self-Rectifying Multi-Agent Systems
- MedMMV: A Controllable Multimodal Multi-Agent Framework for Reliable and Verifiable Clinical Reasoning
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- Learning to Ponder: Adaptive Reasoning in Latent Space
- Can Large Language Models Express Uncertainty Like Human?
- Dynamic Policy Induction for Adaptive Prompt Optimization: Bridging the Efficiency-Accuracy Gap via Lightweight Reinforcement Learning
- Think Twice, Generate Once: Safeguarding by Progressive Self-Reflection
- ContextPRM: Leveraging Contextual Coherence for multi-domain Test-Time Scaling
- Calibrating Verbalized Confidence with Self-Generated Distractors
- Not Wrong, But Untrue: LLM Overconfidence in Document-Based Queries
- Expanding Computation Spaces of LLMs at Inference Time
- Agentar-Scale-SQL: Advancing Text-to-SQL through Orchestrated Test-Time Scaling
- ReasonCACHE: Teaching LLMs To Reason Without Weight Updates
- Beyond Magic Words: Sharpness-Aware Prompt Evolving for Robust Large Language Models with TARE
- Explore-Execute Chain: Towards an Efficient Structured Reasoning Paradigm
- Fast Thinking for Large Language Models
- MASH: A Multiplatform and Multimodal Annotated Dataset for Societal Impact of Hurricane
- Reasoning Scaffolding: Distilling the Flow of Thought from LLMs
- Do Repetitions Matter? Strengthening Reliability in LLM Evaluations
- EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance
- Cognition-of-Thought Elicits Social-Aligned Reasoning in Large Language Models
- Language, Culture, and Ideology: Personalizing Offensiveness Detection in Political Tweets with Reasoning LLMs
- Scaling LLM Test-Time Compute with Mobile NPU on Smartphones
- Decoupling Reasoning and Perception: An LLM-LMM Framework for Faithful Visual Reasoning
- Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning
- Scaling Policy Compliance Assessment in Language Models with Policy Reasoning Traces
- MathBode: Measuring the Stability of LLM Reasoning using Frequency Response
- Tracing Uncertainty in Language Model "Reasoning"
- Agentic AI Reasoning for Mobile Edge General Intelligence: Fundamentals, Approaches, and Directions
- From Harm to Help: Turning Reasoning In-Context Demos into Assets for Reasoning LMs
- AutoEP: LLMs-Driven Automation of Hyperparameter Evolution for Metaheuristic Algorithms
- Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts
- PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space
- LAGEA: Language Guided Embodied Agents for Robotic Manipulation
- Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers
- Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned
- Protocode: Prototype-Driven Interpretability for Code Generation in LLMs
- Taming Variability: Randomized and Bootstrapped Conformal Risk Control for LLMs
- Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks
- HEART: Emotionally-driven test-time scaling of Language Models
- UML-CoT: Structured Reasoning and Planning with Unified Modeling Language for Robotic Room Cleaning
- Dynamic Experts Search: Enhancing Reasoning in Mixture-of-Experts LLMs at Test Time
- InfiAgent: Self-Evolving Pyramid Agent Framework for Infinite Scenarios
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- PRIME: Planning and Retrieval-Integrated Memory for Enhanced Reasoning
- From Long to Lean: Performance-aware and Adaptive Chain-of-Thought Compression via Multi-round Refinement
- R-Capsule: Compressing High-Level Plans for Efficient Large Language Model Reasoning
- Multi-Agent Path Finding via Offline RL and LLM Collaboration
- Think Right, Not More: Test-Time Scaling for Numerical Claim Verification
- Reinforcement Learning-Guided Chain-of-Draft for Token-Efficient Code Generation
- Fuzzy Reasoning Chain (FRC): An Innovative Reasoning Framework from Fuzziness to Clarity
- A2R: An Asymmetric Two-Stage Reasoning Framework for Parallel Reasoning
- Teaching Transformers to Solve Combinatorial Problems through Efficient Trial & Error
- Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
- Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
- Retrieval-of-Thought: Efficient Reasoning via Reusing Thoughts
- Thinking in Many Modes: How Composite Reasoning Elevates Large Language Model Performance with Limited Data
- Why Chain of Thought Fails in Clinical Text Understanding
- Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty
- Towards Transparent AI: A Survey on Explainable Language Models
- Correct Reasoning Paths Visit Shared Decision Pivots
- Plan2Evolve: LLM Self-Evolution for Improved Planning Capability via Automated Domain Generation
- Dual-Head Reasoning Distillation: Improving Classifier Accuracy with Train-Time-Only Reasoning
- A State-of-the-Art SQL Reasoning Model using RLVR
- VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
- Bounds of Chain-of-Thought Robustness: Reasoning Steps, Embed Norms, and Beyond
- Best-of-∞ -- Asymptotic Performance of Test-Time Compute
- Verification Limits Code LLM Training
- Distilling Many-Shot In-Context Learning into a Cheat Sheet
- LogReasoner: Empowering LLMs with Expert-like Coarse-to-Fine Reasoning for Automated Log Analysis
- TyphoonMLA: A Mixed Naive-Absorb MLA Kernel For Shared Prefix
- A Fano-Style Accuracy Upper Bound for LLM Single-Pass Reasoning in Multi-Hop QA
- Difference-Guided Reasoning: A Temporal-Spatial Framework for Large Language Models
- RJE: A Retrieval-Judgment-Exploration Framework for Efficient Knowledge Graph Question Answering with LLMs
- Mixture of Thoughts: Learning to Aggregate What Experts Think, Not Just What They Say
- MARS: toward more efficient multi-agent collaboration for LLM reasoning
- Instruction Boundary: Quantifying Biases in LLM Reasoning under Various Coverage
- SIM-CoT: Supervised Implicit Chain-of-Thought
- SKYLENAGE Technical Report: Mathematical Reasoning and Contest-Innovation Benchmarks for Multi-Level Math Evaluation
- LOCA: Logical Chain Augmentation for Scientific Corpus Cleaning
- Mamba Modulation: On the Length Generalization of Mamba
- STARQA: A Question Answering Dataset for Complex Analytical Reasoning over Structured Databases
- What makes prompts a graph: necessary and sufficient conditions for prompt graph engineering
- Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems
- LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger
- Distilling Answer Set Programming Theories from Large Language Models
- Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense
- Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems
- Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs
- Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups
- LASAR: Latent Adaptive Semantic Aligned Reasoning for Generative Recommendation
- Can neural networks do arithmetic? A survey on the elementary numerical skills of state-of-the-art deep learning models
- RELISH: LLM REgression with a Latent Iterative State Head
- Verbalizing LLM's Higher-order Uncertainty via Imprecise Probabilities
- Geometric Risk Control for Vision-Language Model OCR
- Language Models Coupled with Metacognition Can Outperform Reasoning Models
- Large language model consensus substantially improves the cell type annotation accuracy for scRNA-seq data
- Pandora: Leveraging Code-driven Knowledge Transfer for Unified Structured Knowledge Reasoning
- DRQA: Dynamic Reasoning Quota Allocation for Controlling Overthinking in Reasoning Large Language Models
- Estimating the Self-Consistency of LLMs
- Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning
- LLM-based Agents Suffer from Hallucinations: A Survey of Taxonomy, Methods, and Directions
- Solving Math Word Problems Using Estimation Verification and Equation Generation
- CCQA: Generating Question from Solution Can Improve Inference-Time Reasoning in SLMs
- Confidence-Aware Routing for Large Language Model Reliability Enhancement: A Multi-Signal Approach to Pre-Generation Hallucination Mitigation
- When TableQA Meets Noise: A Dual Denoising Framework for Complex Questions and Large-scale Tables
- Correlation or Causation: Analyzing the Causal Structures of LLM and LRM Reasoning Process
- MSCoRe: A Benchmark for Multi-Stage Collaborative Reasoning in LLM Agents
- Mitigating Strategy-Selection Bias in Reasoning for More Effective Test-Time Scaling
- Variation in Verification: Understanding Verification Dynamics in Large Language Models
- Can Agents Judge Systematic Reviews Like Humans? Evaluating SLRs with LLM-based Multi-Agent System
- Localizing Malicious Outputs from CodeLLM
- K-DeCore: Facilitating Knowledge Transfer in Continual Structured Knowledge Reasoning via Knowledge Decoupling
- MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE
- V-CECE: Visual Counterfactual Explanations via Conceptual Edits
- A Novel Differential Feature Learning for Effective Hallucination Detection and Classification
- SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning
- SalaMAnder: Shapley-based Mathematical Expression Attribution and Metric for Chain-of-Thought Reasoning
- From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations
- Best-of-L: Cross-Lingual Reward Modeling for Mathematical Reasoning
- Spectral Logit Sculpting: Adaptive Low-Rank Logit Transformation for Controlled Text Generation
- GPO: Learning from Critical Steps to Improve LLM Reasoning
- Temporal Reasoning with Large Language Models Augmented by Evolving Knowledge Graphs
- LLM Agents at the Roundtable: A Multi-Perspective and Dialectical Reasoning Framework for Essay Scoring
- The NazoNazo Benchmark: A Cost-Effective and Extensible Test of Insight-Based Reasoning in LLMs
- (P)rior(D)yna(F)low: A Priori Dynamic Workflow Construction via Multi-Agent Collaboration
- Large Language Models in Operations Research: Methods, Applications, and Challenges
- Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
- From Pixels to Urban Policy-Intelligence: Recovering Legacy Effects of Redlining with a Multimodal LLM
- Self-Improvement of Language Models by Post-Training on Multi-Agent Debate
- Class-Invariant Test-Time Augmentation for Domain Generalization
- A Taxonomy of Prompt Defects in LLM Systems
- Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision
- MICA: Multi-Agent Industrial Coordination Assistant
- Enhancing Multi-Agent Debate System Performance via Confidence Expression
- Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies
- Thinking in a Crowd: How Auxiliary Information Shapes LLM Reasoning
- DSCC-HS: A Dynamic Self-Reinforcing Framework for Hallucination Suppression in Large Language Models
- Early Stopping Chain-of-thoughts in Large Language Models
- Slim-SC: Thought Pruning for Efficient Scaling with Self-Consistency
- FVDebug: An LLM-Driven Debugging Assistant for Automated Root Cause Analysis of Formal Verification Failures
- Single-stream Policy Optimization
- REFINER: Reasoning Feedback on Intermediate Representations
- The LLM Already Knows: Estimating LLM-Perceived Question Difficulty via Hidden Representations
- LTA-thinker: Latent Thought-Augmented Training Framework for Large Language Models on Complex Reasoning
- Leveraging Large Language Models to Effectively Generate Visual Data for Canine Musculoskeletal Diagnoses
- Routing Distilled Knowledge via Mixture of LoRA Experts for Large Language Model based Bundle Generation
- Analogy-Driven Financial Chain-of-Thought (AD-FCoT): A Prompting Approach for Financial Sentiment Analysis
- Shaping Explanations: Semantic Reward Modeling with Encoder-Only Transformers for GRPO
- Large Language Model-Based Automatic Formulation for Stochastic Optimization Models
- Selective Risk Certification for LLM Outputs via Information-Lift Statistics: PAC-Bayes, Robustness, and Skeleton Design
- A Fine-Grained 3D Radio Map Construction Paradigm with Ultra-Low Sampling Rates by Large Generative Models
- Audited Reasoning Refinement: Fine-Tuning Language Models via LLM-Guided Step-Wise Evaluation and Correction
- HalluDetect: Detecting, Mitigating, and Benchmarking Hallucinations in Conversational Systems in the Legal Domain
- The Prompt Engineering Report Distilled: Quick Start Guide for Life Sciences
- Predictable Compression Failures: Why Language Models Actually Hallucinate
- Free-MAD: Consensus-Free Multi-Agent Debate
- PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits
- Improving Table Understanding with LLMs and Entity-Oriented Search
- Reasoning Under Uncertainty: Exploring Probabilistic Reasoning Capabilities of LLMs
- Planning for Success: Exploring LLM Long-term Planning Capabilities in Table Understanding
- DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL
- RefactorCoderQA: Benchmarking LLMs for Multi-Domain Coding Question Solutions in Cloud and Edge Deployment
- Who Decides How Knowing Becomes Doing? Redistributing Authority in Human-AI Music Co-Creation
- On LLM-Based Scientific Inductive Reasoning Beyond Equations
- Large Language Models Meet Legal Artificial Intelligence: A Survey
- Smart Trial: Evaluating the Use of Large Language Models for Recruiting Clinical Trial Participants via Social Media
- Unsupervised Hallucination Detection by Inspecting Reasoning Processes
- Limited Reference, Reliable Generation: A Two-Component Framework for Tabular Data Generation in Low-Data Regimes
- Enhancing LLM-based Specification Generation via Program Slicing and Logical Deletion
- XAgents: A Unified Framework for Multi-Agent Cooperation via IF-THEN Rules and Multipolar Task Processing Graph
- CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
- Visual Programmability: A Guide for Code-as-Thought in Chart Understanding
- Jupiter: Enhancing LLM Data Analysis Capabilities via Notebook and Inference-Time Value-Guided Search
- Quality Assessment of Tabular Data using Large Language Models and Code Generation
- Latency and Token-Aware Test-Time Compute
- PromptGuard: An Orchestrated Prompting Framework for Principled Synthetic Text Generation for Vulnerable Populations using LLMs with Enhanced Safety, Fairness, and Controllability
- Evaluating LLMs Without Oracle Feedback: Agentic Annotation Evaluation Through Unsupervised Consistency Signals
- Leveraging AI Agents for Autonomous Networks: A Reference Architecture and Empirical Studies
- Improving MLLM Historical Record Extraction with Test-Time Image
- CM-Align: Consistency-based Multilingual Alignment for Large Language Models
- AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
- Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization
- XML Prompting as Grammar-Constrained Interaction: Fixed-Point Semantics, Convergence Guarantees, and Human-AI Protocols
- Parallel-R1: Towards Parallel Thinking via Reinforcement Learning
- Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs
- HealthSLM-Bench: Benchmarking Small Language Models for Mobile and Wearable Healthcare Monitoring
- RAFFLES: Reasoning-based Attribution of Faults for LLM Systems
- MachineLearningLM: Scaling Many-shot In-context Learning via Continued Pretraining
- Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
- From Implicit Exploration to Structured Reasoning: Leveraging Guideline and Refinement for LLMs
- The Majority is not always right: RL training for solution aggregation
- Benchmarking Information Retrieval Models on Complex Retrieval Tasks
- X-SQL: Expert Schema Linking and Understanding of Text-to-SQL with Multi-LLMs
- From Long to Short: LLMs Excel at Trimming Own Reasoning Chains
- Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation
- Cross-Question Method Reuse in Large Language Models: From Word-Level Prediction to Rational Logical-Layer Reasoning
- Self-Aligned Reward: Towards Effective and Efficient Reasoners
- Sticker-TTS: Learn to Utilize Historical Experience with a Sticker-driven Test-Time Scaling Framework
- Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
- DreamPRM-1.5: Unlocking the Potential of Each Instance for Multimodal Process Reward Model Training
- Talk Isn't Always Cheap: Understanding Failure Modes in Multi-Agent Debate
- FLAMES: Improving LLM Math Reasoning via a Fine-Grained Analysis of the Data Synthesis Pipeline
- Psychologically Enhanced AI Agents
- CoT-Space: A Theoretical Framework for Internal Slow-Thinking via Reinforcement Learning
- Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation
- A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
- A Probabilistic Inference Scaling Theory for LLM Self-Correction
- Beyond Interpretability: Exploring the Comprehensibility of Adaptive Video Streaming through Large Language Models
- Explainable Knowledge Graph Retrieval-Augmented Generation (KG-RAG) with KG-SMILE
- Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents
- Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?
- Knowledge Integration for Physics-informed Symbolic Regression Using Pre-trained Large Language Models
- ReCode: Improving LLM-based Code Repair with Fine-Grained Retrieval-Augmented Generation
- Scale, Don't Fine-tune: Guiding Multimodal LLMs for Efficient Visual Place Recognition at Test-Time
- LLMs for LLMs: A Structured Prompting Methodology for Long Legal Documents
- Avoidance Decoding for Diverse Multi-Branch Story Generation
- Inducing Faithfulness in Structured Reasoning via Counterfactual Sensitivity
- Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal
- GradeSQL: Test-Time Inference with Outcome Reward Models for Text-to-SQL Generation from Large Language Models
- Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning
- Aligning Reasoning LLMs for Materials Discovery with Physics-aware Rejection Sampling
- GIER: Gap-Driven Self-Refinement for Large Language Models
- Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
- Illuminating Patterns of Divergence: DataDios SmartDiff for Large-Scale Data Difference Analysis
- ParaThinker: Native Parallel Thinking as a New Paradigm to Scale LLM Test-time Compute
- PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains
- Reasoning-Intensive Regression
- How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images
- Can Multiple Responses from an LLM Reveal the Sources of Its Uncertainty?
- An Agile Method for Implementing Retrieval Augmented Generation Tools in Industrial SMEs
- Measuring Reasoning Utility in LLMs via Conditional Entropy Reduction
- CyberSleuth: Autonomous Blue-Team LLM Agent for Web Attack Forensics
- Automated Quality Assessment for LLM-Based Complex Qualitative Coding: A Confidence-Diversity Framework
- PersoNo: Personalised Notification Urgency Classifier in Mixed Reality
- LFD: Layer Fused Decoding to Exploit External Knowledge in Retrieval-Augmented Generation
- SLIM: Subtrajectory-Level Elimination for More Effective Reasoning
- Entropy-Guided Loop: Achieving Reasoning through Uncertainty-Aware Generation
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation
- Can Structured Templates Facilitate LLMs in Tackling Harder Tasks? : An Exploration of Scaling Laws by Difficulty
- Beyond the Textual: Generating Coherent Visual Options for MCQs
- Tailored Teaching with Balanced Difficulty: Elevating Reasoning in Multimodal Chain-of-Thought via Prompt Curriculum
- Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks
- Thinking Before You Speak: A Proactive Test-time Scaling Approach
- VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft
- MIRAGE: Scaling Test-Time Inference with Parallel Graph-Retrieval-Augmented Reasoning Chains
- InReAcTable: LLM-Powered Interactive Visual Data Story Construction from Tabular Data
- Named Entity Recognition of Historical Text via Large Language Model
- LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries
- Deep Think with Confidence
- Fine-tuning and prompt engineering for large language models-based code review automation
- Trust but Verify! A Survey on Verification Design for Test-time Scaling
- Semantic Energy: Detecting LLM Hallucination Beyond Entropy
- Automated Optimization Modeling through Expert-Guided Large Language Model Reasoning
- Zero-knowledge LLM hallucination detection and mitigation through fine-grained cross-model consistency
- Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
- Prompt Orchestration Markup Language
- Can Large Language Models (LLMs) Describe Pictures Like Children? A Comparative Corpus Study
- Expertise-aware Multi-LLM Recruitment and Collaboration for Medical Decision-Making
- CausalPlan: Empowering Efficient LLM Multi-Agent Collaboration Through Causality-Driven Planning
- Generics and Default Reasoning in Large Language Models
- Input-Time Scaling
- Self-Organizing Agent Network for LLM-based Workflow Automation
- Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
- Can Large Models Teach Student Models to Solve Mathematical Problems Like Human Beings? A Reasoning Distillation Method via Multi-LoRA Interaction
- Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models
- Navigating the Exploration-Exploitation Tradeoff in Inference-Time Scaling of Diffusion Models
- Fast, Slow, and Tool-augmented Thinking for LLMs: A Review
- Improving Pre-Trained Vision-Language-Action Policies with Model-Based Search
- Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow
- Cost-Aware Contrastive Routing for LLMs
- ReaLM: Reflection-Enhanced Autonomous Reasoning with Small Language Models
- Mitigating Hallucinations in Large Language Models via Causal Reasoning
- AgentMental: An Interactive Multi-Agent Framework for Explainable and Adaptive Mental Health Assessment
- MM-R1: Unleashing the Power of Unified Multimodal Large Language Models for Personalized Image Generation
- ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism
- HOID-R1: Reinforcement Learning for Open-World Human-Object Interaction Detection Reasoning with Multimodal Large Language Model
- Hard Examples Are All You Need: Maximizing GRPO Post-Training Under Annotation Budgets
- Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding
- PASS: Probabilistic Agentic Supernet Sampling for Interpretable and Adaptive Chest X-Ray Reasoning
- MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding
- MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
- Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization
- MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
- Episodic Memory Representation for Long-form Video Understanding
- ASPD: Unlocking Adaptive Serial-Parallel Decoding by Exploring Intrinsic Parallelism in LLMs
- Leveraging Large Language Models for Rare Disease Named Entity Recognition
- InternBootcamp Technical Report: Boosting LLM Reasoning with Verifiable Task Scaling
- Rational Inverse Reasoning: Few-Shot Imitation by Inferring Intent through Planning
- Privacy-protected Retrieval-Augmented Generation for Knowledge Graph Question Answering
- Train Long, Think Short: Curriculum Learning for Efficient Reasoning
- Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language Models
- Evaluating Large Language Models as Expert Annotators
- ThinkTuning: Instilling Cognitive Reflections without Distillation
- Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression
- Can LLMs Detect Their Confabulations? Estimating Reliability in Uncertainty-Aware Language Models
- Steerable Pluralism: Pluralistic Alignment via Few-Shot Comparative Regression
- Hallucination as a Computational Boundary: A Hierarchy of Inevitability and the Oracle Escape
- EndoCogniAgent: Closed-Loop Agentic Reasoning with Self-Consistency Validation for Endoscopic Diagnosis
- Uncertainty-Aware Semantic Decoding for LLM-Based Sequential Recommendation
- AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning
- Chain-of-Alpha: Unleashing the Power of Large Language Models for Alpha Mining in Quantitative Trading
- Mediator-Guided Multi-Agent Collaboration among Open-Source Models for Medical Decision-Making
- Navigating the Risks of Using Large Language Models for Text Annotation in Social Science Research
- First Ask Then Answer: A Framework Design for AI Dialogue Based on Supplementary Questioning with Large Language Models
- Learning by Teaching: Engaging Students as Instructors of Large Language Models in Computer Science Education
- Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
- Decision-Making with Deliberation: Meta-reviewing as a Document-grounded Dialogue
- Incident Response Planning Using a Lightweight Large Language Model with Reduced Hallucination
- FedCoT: Communication-Efficient Federated Reasoning Enhancement for Large Language Models
- ConfAgents: A Conformal-Guided Multi-Agent Framework for Cost-Efficient Medical Diagnosis
- Charts-of-Thought: Enhancing LLM Visualization Literacy Through Structured Data Extraction
- Hop, Skip, and Overthink: Diagnosing Why Reasoning Models Fumble during Multi-Hop Analysis
- TRAIL: Joint Inference and Refinement of Knowledge Graphs with Large Language Models
- StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs through Knowledge-Reasoning Fusion
- PersonaEval: Are LLM Evaluators Human Enough to Judge Role-Play?
- Chain of Questions: Guiding Multimodal Curiosity in Language Models
- Deliberative Reasoning Network: An Uncertainty-Driven Paradigm for Belief-Tracked Inference with Pretrained Language Models
- Large Language Model's Multi-Capability Alignment in Biomedical Domain
- GeoSR: Cognitive-Agentic Framework for Probing Geospatial Knowledge Boundaries via Iterative Self-Refinement
- Enhancing Serendipity Recommendation System by Constructing Dynamic User Knowledge Graphs with Large Language Models
- Unravelling the Probabilistic Forest: Arbitrage in Prediction Markets
- GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control
- Toward a Trustworthy Optimization Modeling Agent via Verifiable Synthetic Data Generation
- Adaptive Command: Real-Time Policy Adjustment via Language Models in StarCraft II
- CTTS: Collective Test-Time Scaling
- Polymath: A Self-Optimizing Agent with Dynamic Hierarchical Workflow
- XFacta: Contemporary, Real-World Dataset and Evaluation for Multimodal Misinformation Detection with Multimodal LLMs
- CAAD: Context-Aware Adaptive Decoding for Truthful Text Generation
- A Survey on AgentOps: Categorization, Challenges, and Future Directions
- MArgE: Meshing Argumentative Evidence from Multiple Large Language Models for Justifiable Claim Verification
- A Confidence-Diversity Framework for Calibrating AI Judgement in Accessible Qualitative Coding Tasks
- TIBSTC-CoT: A Multi-Domain Instruction Dataset for Chain-of-Thought Reasoning in Language Models
- Test-time Prompt Intervention
- SE-Agent: Self-Evolution Trajectory Optimization in Multi-Step Reasoning with LLM-Based Agents
- Counterfactual Probing for Hallucination Detection and Mitigation in Large Language Models
- Uncertainty-Based Methods for Automated Process Reward Data Construction and Output Aggregation in Mathematical Reasoning
- ReflecSched: Solving Dynamic Flexible Job-Shop Scheduling via LLM-Powered Hierarchical Reflection
- Enhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware Intervention
- LLM-Assisted Model-Based Fuzzing of Protocol Implementations
- Accurate and Consistent Graph Model Generation from Text with Large Language Models
- Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models
- Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications
- Ordinal Folding Index: A Computable Metric for Self-Referential Semantics
- BAR Conjecture: the Feasibility of Inference Budget-Constrained LLM Services with Authenticity and Reasoning
- LENS: Learning Ensemble Confidence from Neural States for Multi-LLM Answer Integration
- Failures Are the Stepping Stones to Success: Enhancing Few-Shot In-Context Learning by Leveraging Negative Samples
- Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions
- MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines
Related