Self-Consistency Improves Chain of Thought Reasoning in Language Models
2022/03/21 by Xuezhi Wang, Wang, Xuezhi, Jason Wei +15 · 4 voices · 1,769 citations
Computer Science · #Advanced Graph Neural Networks #Natural Language Processing Techniques #Topic Modeling #cs.AI #cs.CL
paper · pdf · doi:10.48550/arxiv.2203.11171
arxiv published 2022/03/21 · arxiv updated 2023/03/07
Abstract
Chain-of-thought prompting combined with pre-trained large language models has achieved encouraging results on complex reasoning tasks. In this paper, we propose a new decoding strategy, self-consistency, to replace the naive greedy decoding used in chain-of-thought prompting. It first samples a diverse set of reasoning paths instead of only taking the greedy one, and then selects the most consistent answer by marginalizing out the sampled reasoning paths. Self-consistency leverages the intuition that a complex reasoning problem typically admits multiple different ways of thinking leading to its unique correct answer. Our extensive empirical evaluation shows that self-consistency boosts the performance of chain-of-thought prompting with a striking margin on a range of popular arithmetic and commonsense reasoning benchmarks, including GSM8K (+17.9%), SVAMP (+11.0%), AQuA (+12.2%), StrategyQA (+6.4%) and ARC-challenge (+3.9%).
Cited by
- Single LLM Debate, MoLaCE: Mixture of Latent Concept Experts Against Confirmation Bias
- Beyond Correctness: Exposing LLM-generated Logical Flaws in Reasoning via Multi-step Automated Theorem Proving
- CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation
- Anka: A Domain-Specific Language for Reliable LLM Code Generation
- Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process
- SPIRAL: Symbolic LLM Planning via Grounded and Reflective Search
- Scaling Unverifiable Rewards: A Case Study on Visual Insights
- Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs
- Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
- Agentic Software Issue Resolution with Large Language Models: A Survey
- Calibrating LLM Judges: Linear Probes for Fast and Reliable Uncertainty Estimation
- State-dependent error correlations shape voting thresholds in committees of AI agents
- Training Language Models to Cooperate with Inference-Time Controllers
- A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever
- Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation
- Verbalized Particle Posterior: Bayesian Inference over Natural Language Hypotheses
- Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets
- Hierarchical Group-Conditional Conformal Risk Control for Selective Prediction in Language Models
- Statistically Supported LLM Ingredient and Recipe Data Collection in Computational Nutrition
- ConsistencyGate: Preventing Memory Contamination in LLM Agents via Self-Consistency Admission Control
- Visual prompt engineering for video models
- Beyond Prefill-Decode Disaggregation: Dissecting LLM Inference for Heterogeneous Platforms via Dynamic Operator Scheduling
- Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference
- When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness
- HALLELUAI: A Hallucination-Aware AI System for Ultra-Realistic Image-to-Video Generation at Scale
- MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution
- How Well Can AI Generate Backlogs from App Mockups?
- Agent Team Work Zone: An Automated, Persistent Workspace for Long-Lived Claude Code Agent Teams
- Do Language Models Converge to Themselves? Recursive Self-Refinement as Textual Relaxation
- Measuring and Improving Behavioral Consistency in Large Language Models through Fact-Heuristic-Emotion State Enforcement
- Evolving from Lessons: Skill-Augmented Table Graph Reasoning for Operation-wise Table Question Answering
- DeepLook: Deeper Thinking with Lookahead
- DeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs
- Evaluating large language models for diagnostic reasoning from unstructured clinical narratives in epilepsy
- Procedural Knowledge at Scale Improves Reasoning
- StAR: Segment Anything Reasoner
- Method Decoration (DeMe): A Framework for LLM-Driven Adaptive Method Generation in Dynamic IoT Environments
- What Makes a GitHub Issue Ready for Copilot?
- AegisAgent: An Autonomous Defense Agent Against Prompt Injection Attacks in LLM-HARs
- Pioneering Multimodal Emotion Recognition in the Era of Large Models: From Closed Sets to Open Vocabularies
- PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding
- Multi-LLM Thematic Analysis with Dual Reliability Metrics: Combining Cohen's Kappa and Semantic Similarity for Qualitative Research Validation
- Reason2Decide: Rationale-Driven Multi-Task Learning
- Reaching Agreement Among Reasoning LLM Agents
- Demystifying LLM-as-a-Judge: Analytically Tractable Model for Inference-Time Scaling
- Understanding Chain-of-Thought in Large Language Models via Topological Data Analysis
- A Large Language Model Based Method for Complex Logical Reasoning over Knowledge Graphs
- Population-Evolve: a Parallel Sampling and Evolutionary Method for LLM Math Reasoning
- HARMON-E: Hierarchical Agentic Reasoning for Multimodal Oncology Notes to Extract Structured Data
- Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs
- MDToC: Metacognitive Dynamic Tree of Concepts for Boosting Mathematical Problem-Solving of Large Language Models
- Multi-Agent LLM Committees for Autonomous Software Beta Testing
- Reflective Confidence: Correcting Reasoning Flaws via Online Self-Correction
- Training LLMs with LogicReward for Faithful and Rigorous Reasoning
- External Hippocampus: Topological Cognitive Maps for Guiding Large Language Model Reasoning
- Eidoku: A Neuro-Symbolic Verification Gate for LLM Reasoning via Structural Constraint Satisfaction
- Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs
- Trust-Region Adaptive Policy Optimization
- Constructive Circuit Amplification: Improving Math Reasoning in LLMs via Targeted Sub-Network Updates
- Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
- FlowDet: Unifying Object Detection and Generative Transport Flows
- Emergent Bias and Fairness in Multi-Agent Decision Systems
- A Network Arena for Benchmarking AI Agents on Network Troubleshooting
- Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation
- QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems
- ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs
- BRAID: Bounded Reasoning for Autonomous Inference and Decisions
- City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs
- Characterizing Mamba's Selective Memory using Auto-Encoders
- Step-GUI Technical Report
- Dual-Density Inference for Efficient Language Model Reasoning
- Evaluating LLMs for Zeolite Synthesis Event Extraction (ZSEE): A Systematic Analysis of Prompting Strategies
- RFKG-CoT: Relation-Driven Adaptive Hop-count Selection and Few-Shot Path Guidance for Knowledge-Aware QA
- Do Large Language Models Know What They Don't Know? Kalshibench: A New Benchmark for Evaluating Epistemic Calibration via Prediction Markets
- Beyond Fast and Slow: Cognitive-Inspired Elastic Reasoning for Large Language Models
- An Exploratory Study of Bayesian Prompt Optimization for Test-Driven Code Generation with Large Language Models
- Multi-Agent Medical Decision Consensus Matrix System: An Intelligent Collaborative Framework for Oncology MDT Consultations
- Intention Chain-of-Thought Prompting with Dynamic Routing for Code Generation
- OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
- Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning
- Let's (not) just put things in Context: Test-Time Training for Long-Context LLMs
- Error-Driven Prompt Optimization for Arithmetic Reasoning
- ORIBA: Exploring LLM-Driven Role-Play Chatbot as a Creativity Support Tool for Original Character Artists
- Socratic Students: Teaching Language Models to Learn by Asking Questions
- How Prompts Move Language Model Behavior: Frames, Salience, and Construal as Semantic Control
- Hold Onto That Thought: Assessing KV Cache Compression On Reasoning
- When Actions Teach You to Think: Reasoning-Action Synergy via Reinforcement Learning in Conversational Agents
- FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modularized Collaboration
- Limits and Gains of Test-Time Scaling in Vision-Language Reasoning
- PIAST: Rapid Prompting with In-context Augmentation for Scarce Training data
- Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors
- AP-BMM: Approximating Capability-Cost Pareto Sets of LLMs via Asynchronous Prior-Guided Bayesian Model Merging
- Encoder-Free Knowledge-Graph Reasoning with LLMs via Hyperdimensional Path Retrieval
- Decoupling Template Bias in CLIP: Harnessing Empty Prompts for Enhanced Few-Shot Learning
- Enhancing Clinical Note Generation with ICD-10, Clinical Ontology Knowledge Graphs, and Chain-of-Thought Prompting Using GPT-4
- Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation
- ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning
- Metric-Fair Prompting: Treating Similar Samples Similarly
- Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
- Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning
- CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks
- Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models
- TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models
- Prompting Science Report 4: Playing Pretend: Expert Personas Don't Improve Factual Accuracy
- AGI Requires a Coordination Layer on Top of Pattern Repositories
- MARINE: Theoretical Optimization and Design for Multi-Agent Recursive IN-context Enhancement
- CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning
- RoBoN: Routed Online Best-of-n for Test-Time Scaling with Multiple LLMs
- The Seeds of Scheming: Weakness of Will in the Building Blocks of Agentic Systems
- RevoNAD: Reflective Evolutionary Exploration for Neural Architecture Design
- Algorithmic Thinking Theory
- Dual-Use AI Face Swap Apps Are Mostly Unsafe: A Systematic Safety Audit
- Beyond Factual Accuracy: Evaluating Global Reasoning Integrity in RAG Systems with LogicScore
- On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference
- Distance Is All You Need: Radial Dispersion for Uncertainty Estimation in Large Language Models
- From Hypothesis to Premises: LLM-based Backward Logical Reasoning with Selective Symbolic Translation
- CrowdLLM: Building LLM-Based Digital Populations Augmented with Generative Models
- SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
- Network Self-Configuration based on Fine-Tuned Small Language Models
- From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks
- Inference-Time Distillation: Cost-Efficient Agents Without Fine-Tuning or Manual Prompt Engineering
- WISE: Weighted Iterative Society-of-Experts for Robust Multimodal Multi-Agent Debate
- Distribution-Calibrated Inference Time Compute for Thinking LLM-as-a-Judge
- When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers
- Think in Parallel, Answer as One: Logit Averaging for Open-Ended Reasoning
- ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning
- DETAIL Matters: Measuring the Impact of Prompt Specificity on Reasoning in Large Language Models
- ALARM: Automated MLLM-Based Anomaly Detection in Complex-EnviRonment Monitoring with Uncertainty Quantification
- The Art of Scaling Test-Time Compute for Large Language Models
- Latent Debate: A Surrogate Framework for Interpreting LLM Thinking
- Zero-Overhead Introspection for Adaptive Test-Time Compute
- ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models
- RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving
- Mode-Conditioning Unlocks Superior Test-Time Scaling
- IndiMathBench: Autoformalizing Mathematical Reasoning Problems with a Human Touch
- ART: Adaptive Response Tuning Framework -- A Multi-Agent Tournament-Based Approach to LLM Response Optimization
- Large Language Model based Smart Contract Auditing with LLMBugScanner
- Augmented Runtime Collaboration for Self-Organizing Multi-Agent Systems: A Hybrid Bi-Criteria Routing Approach
- SCALE: Selective Resource Allocation for Overcoming Performance Bottlenecks in Mathematical Test-time Scaling
- ML-Tool-Bench: Tool-Augmented Planning for ML Tasks
- Aligning Probabilistic Beliefs under Informative Missingness: LLM Steerability in Clinical Reasoning
- Evaluating LLMs for One-Shot Patching of Real and Artificial Vulnerabilities
- Toward a Safe Internet of Agents
- Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
- Multi-chain Graph Refinement and Selection for Reliable Reasoning in Large Language Models
- Experts are all you need: A Composable Framework for Large Language Model Inference
- ORION: Teaching Language Models to Reason Efficiently in the Language of Thought
- Adversarial Training for Process Reward Models
- AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture
- Analyzing Image Beyond Visual Aspect: Image Emotion Classification via Multiple-Affective Captioning
- VeriDispatcher: Multi-Model Dispatching through Pre-Inference Difficulty Prediction for RTL Generation Optimization
- Rethinking Test Time Scaling for Flow-Matching Generative Models
- On the Limits of Innate Planning in Large Language Models
- EWE: An Agentic Framework for Extreme Weather Analysis
- Scaling Generative Verifiers For Natural Language Mathematical Proof Verification And Selection
- GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs
- BRIDGE: Building Representations In Domain Guided Program Synthesis
- Aragog: Just-in-Time Model Routing for Scalable Serving of Agentic Workflows
- Complex QA and language models hybrid architectures, Survey
- DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs
- Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
- VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
- ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models
- Cross Domain Evaluation of Multimodal Chain-of-Thought Reasoning of different datasets into the Amazon CoT Framework
- LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models
- GraphMind: Theorem Selection and Conclusion Generation Framework with Dynamic GNN for LLM Reasoning
- Majority of the Bests: Improving Best-of-N via Bootstrapping
- Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
- DELTA: Language Diffusion-based EEG-to-Text Architecture
- A2Flow: Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- Reuse, Don't Recompute: Efficient Large Reasoning Model Inference via Memory Orchestration
- LLMs as Firmware Experts: A Runtime-Grown Tree-of-Agents Framework
- MedRule-KG: A Knowledge-Graph--Steered Scaffold for Reliable Mathematical and Biomedical Reasoning
- Enhancing Automated Program Repair via Faulty Token Localization and Quality-Aware Patch Refinement
- SPINE: Token-Selective Test-Time Reinforcement Learning with Entropy-Band Regularization
- Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Language Models
- AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale
- FireScope: Wildfire Risk Raster Prediction with a Chain-of-Thought Oracle
- Hallucinate Less by Thinking More: Aspect-Based Causal Abstention for Large Language Models
- HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation
- Do Vision-Language Models Understand Visual Persuasiveness?
- Budget-Aware Tool-Use Enables Effective Agent Scaling
- V-ReasonBench: Toward Unified Reasoning Benchmark Suite for Video Generation Models
- Goal-Directed Search Outperforms Goal-Agnostic Memory Compression in Long-Context Memory Tasks
- Cognitive Foundations for Reasoning and Their Manifestation in LLMs
- SDA: Steering-Driven Distribution Alignment for Open LLMs without Fine-Tuning
- Pass@k Metric for RLVR: A Diagnostic Tool of Exploration, But Not an Objective
- JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
- Step-Audio-R1 Technical Report
- When to Think and When to Look: Uncertainty-Guided Lookback
- ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions
- Efficiency Will Not Lead to Sustainable Reasoning AI
- SkinGPT-R1: Adapter-Only Dual Distillation for Efficient Dermatology Reasoning
- OEMA: Ontology-Enhanced Multi-Agent Collaboration Framework for Zero-Shot Clinical Named Entity Recognition
- SafeRBench: Dissecting the Reasoning Safety of Large Language Models
- ProRAC: A Neuro-symbolic Method for Reasoning about Actions with LLM-based Progression
- Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks
- RB-FT: Rationale-Bootstrapped Fine-Tuning for Video Classification
- SVBRD-LLM: Self-Verifying Behavioral Rule Discovery for Autonomous Vehicle Identification
- GPS: General Per-Sample Prompter
- Extending Test-Time Scaling: A 3D Perspective with Context, Batch, and Turn
- Collaborative QA using Interacting LLMs. Impact of Network Structure, Node Capability and Distributed Data
- Dynamic Template Selection for Output Token Generation Optimization: MLP-Based and Transformer Approaches
- Quantifying and Mitigating Selection Bias in LLMs: A Transferable LoRA Fine-Tuning and Efficient Majority Voting Approach
- MedDCR: Learning to Design Agentic Workflows for Medical Coding
- Think with Self-Decoupling and Self-Verification: Automated RTL Design with Backtrack-ToT
- From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
- Scaling Graph Chain-of-Thought Reasoning: A Multi-Agent Framework with Efficient LLM Serving
- MedSumGraph: enhancing GraphRAG for medical QA with summarization and optimized prompts
- R2Seg: Training-Free OOD Medical Tumor Segmentation via Anatomical Reasoning and Statistical Rejection
- Knots: A Large-Scale Multi-Agent Enhanced Expert-Annotated Dataset and LLM Prompt Optimization for NOTAM Semantic Parsing
- ARCHE: A Novel Task to Evaluate LLMs on Latent Reasoning Chain Extraction
- Optimal Self-Consistency for Efficient Reasoning with Large Language Models
- Learning to Refine: An Agentic RL Approach for Iterative SPARQL Query Construction
- An Analysis of Architectural Impact on LLM-based Abstract Visual Reasoning: A Systematic Benchmark on RAVEN-FAIR
- Scaling Open-Weight Large Language Models for Hydropower Regulatory Information Extraction: A Systematic Analysis
- On the Notion that Language Models Reason
- iMAD: Intelligent Multi-Agent Debate for Efficient and Accurate LLM Inference
- Hindsight Distillation Reasoning with Knowledge Encouragement Preference for Knowledge-based Visual Question Answering
- Binary Verification for Zero-Shot Vision
- Socrates-Mol: Self-Oriented Cognitive Reasoning through Autonomous Trial-and-Error with Empirical-Bayesian Screening for Molecules
- ProgRAG: Hallucination-Resistant Progressive Retrieval and Reasoning over Knowledge Graphs
- Efficient Thought Space Exploration Through Strategic Intervention
- Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling
- Modeling Uncertainty Trends for Timely Retrieval in Dynamic RAG
- Seer Self-Consistency: Advance Budget Estimation for Adaptive Test-Time Scaling
- Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives
- Automatic Minds: Cognitive Parallels Between Hypnotic States and Large Language Model Processing
- AlphaCast: A Human Wisdom-LLM Intelligence Co-Reasoning Framework for Interactive Time Series Forecasting
- Hierarchical Memorization in Large Language Models: Evidence from Citation Generation
- Consensus Sampling for Safer Generative AI
- DynaAct: Large Language Model Reasoning with Dynamic Action Spaces
- Knowledge-Augmented Long-CoT Generation for Complex Biomolecular Reasoning
- Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models
- DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF
- Last Layer Logits to Logic: Empowering LLMs with Logic-Consistent Structured Knowledge Reasoning
- Judging by the Rules: Compliance-Aligned Framework for Modern Slavery Statement Monitoring
- PCRLLM: Proof-Carrying Reasoning with Large Language Models under Stepwise Logical Constraints
- C3PO: Optimized Large Language Model Cascades with Probabilistic Cost Constraints for Reasoning
- Voice-Interactive Surgical Agent for Multimodal Patient Data Control
- Think Consistently, Reason Efficiently: Energy-Based Calibration for Implicit Chain-of-Thought
- CoLM: Collaborative Large Models via A Client-Server Paradigm
- A Meta-Evaluation of Faithfulness Metrics for Long-Form Hospital-Course Summarization
- TabRAG: Improving Tabular Document Question Answering for Retrieval Augmented Generation via Structured Representations
- SAFENLIDB: A Privacy-Preserving Safety Alignment Framework for LLM-based Natural Language Database Interfaces
- A Low-Rank Method for Vision Language Model Hallucination Mitigation in Autonomous Driving
- Data Trajectory Alignment for LLM Domain Adaptation: A Two-Phase Synthesis Framework for Telecommunications Mathematics
- Self-Evaluating LLMs for Multi-Step Tasks: Stepwise Confidence Estimation for Failure Detection
- ALIGN: A Vision-Language Framework for High-Accuracy Accident Location Inference through Geo-Spatial Neural Reasoning
- Confidence-Guided Stepwise Model Routing for Cost-Efficient Reasoning
- TimeSense:Making Large Language Models Proficient in Time-Series Analysis
- FLEX: Continuous Agent Evolution via Forward Learning from Experience
- Kunlun Anomaly Troubleshooter: Enabling Kernel-Level Anomaly Detection and Causal Reasoning for Large Model Distributed Inference
- In-depth Analysis on Caching and Pre-fetching in Mixture of Experts Offloading
- CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization
- Culture in Action: Evaluating Text-to-Image Models through Social Activities
- Logit-Entropy Adaptive Stopping Heuristic for Efficient Chain-of-Thought Reasoning
- Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
- Reusing Pre-Training Data at Test Time is a Compute Multiplier
- Batch Prompting Suppresses Overthinking Reasoning Under Constraint: How Batch Prompting Suppresses Overthinking in Reasoning Models
- PSD2Code: Automated Front-End Code Generation from Design Files via Multimodal Large Language Models
- Revealing AI Reasoning Increases Trust but Crowds Out Unique Human Knowledge
- Efficient Reasoning via Thought-Training and Thought-Free Inference
- GEMMA-SQL: A Novel Text-to-SQL Model Based on Large Language Models
- LFC-DA: Logical Formula-Controlled Data Augmentation for Enhanced Logical Reasoning
- From Five Dimensions to Many: Large Language Models as Precise and Interpretable Psychological Profilers
- Analyzing the Power of Chain of Thought through Memorization Capabilities
- QiMeng-NeuComBack: Self-Evolving Translation from IR to Assembly Code
- CGES: Confidence-Guided Early Stopping for Efficient and Accurate Self-Consistency
- LTD-Bench: Evaluating Large Language Models by Letting Them Draw
- The Sequential Edge: Inverse-Entropy Voting Beats Parallel Self-Consistency at Matched Compute
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- LA-MARRVEL: A Knowledge-Grounded, Language-Aware LLM Framework for Clinically Robust Rare Disease Gene Prioritization
- Personalized Decision Modeling: Utility Optimization or Textualized-Symbolic Reasoning
- When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
- FEval-TTC: Fair Evaluation Protocol for Test-Time Compute
- Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning
- GeoToken: Hierarchical Geolocalization of Images via Next Token Prediction
- Efficient Test-Time Retrieval Augmented Generation
- MARS-SQL: A multi-agent reinforcement learning framework for Text-to-SQL
- ORANGE: An Online Reflection ANd GEneration framework with Domain Knowledge for Text-to-SQL
- Assessing LLM Reasoning Steps via Principal Knowledge Grounding
- Do Math Reasoning LLMs Help Predict the Impact of Public Transit Events?
- How Focused Are LLMs? A Quantitative Study via Repetitive Deterministic Prediction Tasks
- Self-Consistency Is Losing Its Edge: Diminishing Returns and Rising Costs in Modern LLMs
- Inference-Time Chain-of-Thought Pruning with Latent Informativeness Signals
- Test-time Scaling of LLMs: A Survey from A Subproblem Structure Perspective
- DTS: Enhancing Large Reasoning Models via Decoding Tree Sketching
- SpecDiff-2: Scaling Diffusion Drafter Alignment For Faster Speculative Decoding
- Reasoning Planning for Language Models
- TreeQA: Enhanced LLM-RAG with logic tree reasoning for reliable and interpretable multi-hop question answering
- Sherlock: Reliable and Efficient Agentic Workflow Execution
- TempoBench: Evaluating Temporal Causal Reasoning in Large Language Models
- ThoughtProbe: Classifier-Guided LLM Thought Space Exploration via Probing Representations
- A Survey on Generative Recommendation: Data, Model, and Tasks
- Rating Roulette: Self-Inconsistency in LLM-As-A-Judge Frameworks
- LLMs are Overconfident: Evaluating Confidence Interval Calibration with FermiEval
- Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models
- Chopping Trees: Semantic Similarity Based Dynamic Pruning for Tree-of-Thought Reasoning
- Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems
- The Geometry of Dialogue: Graphing Language Models to Reveal Synergistic Teams for Multi-Agent Collaboration
- Do LLMs Signal When They're Right? Evidence from Neuron Agreement
- Pragmatic Theories Enhance Understanding of Implied Meanings in LLMs
- Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking
- Limits of Generalization in RLVR: Two Case Studies in Mathematical Reasoning
- CAVE: Detecting and Explaining Commonsense Anomalies in Visual Environments
- Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph
- Symbolically Scaffolded Play: Designing Role-Sensitive Prompts for Generative NPC Dialogue
- TextualVerifier: Verify TextGrad Step-by-Step
- LLM-as-a-Verifier: A General-Purpose Verification Framework
- Cache Merging as a Convergent Replicated State for Multi-Agent Latent Reasoning
- Considering the ethics of large machine learning models in the chemical sciences
- Rethinking the Evaluation of Harness Evolution for Agents
- Large Language Models for Software Engineering Diagrams: A Systematic Review of UML and ER modelling
- A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models
- Lang-PINN: From Language to Physics-Informed Neural Networks via a Multi-Agent Framework
- LLM-TSFD: An industrial time series human-in-the-loop fault diagnosis method based on a large language model
- Truth-Aware Decoding: A Program-Logic Approach to Factual Language Generation
- The Architecture of Errors: From Universal Impossibility to Patch-Local LLM Reliability
- STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision
- Metacognition Should Be the Scientific Framework for Bounded and Effective Self-Governance in Generative AI
- Lattice Deduction Transformers
- The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration
- GroupRAG: Cognitively Inspired Group-Aware Retrieval and Reasoning via Knowledge-Driven Problem Structuring
- When Agents Disagree With Themselves: Behavioral Consistency as an Uncertainty Signal for LLM Agents
- Large language models encode clinical knowledge
- How well LLM-based test generation techniques perform with newer LLM versions?
- TrajSelector: Harnessing Latent Representations for Efficient and Effective Best-of-N in Large Reasoning Model
- Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
- Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items?
- Aligning Large Language Models with Procedural Rules: An Autoregressive State-Tracking Prompting for In-Game Trading
- ParallelMuse: Agentic Parallel Thinking for Deep Information Seeking
- LoRA-DA: Data-Aware Initialization for Low-Rank Adaptation via Asymptotic Analysis
- Quantum Combinatorial Reasoning for Large Language Models
- Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
- Verifying Large Language Models' Reasoning Paths via Correlation Matrix Rank
- Auto prompting without training labels: An LLM cascade for product quality assessment in e-commerce catalogs
- ProofSketch: Efficient Verified Reasoning for Large Language Models
- From Stochasticity to Signal: A Bayesian Latent State Model for Reliable Measurement with LLMs
- SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
- Compiler.next: A Search-Based Compiler to Power the AI-Native Future of Software Engineering
- TDFlow: Agentic Workflows for Test Driven Software Engineering
- Think Twice: Branch-and-Rethink Reasoning Reward Model
- Unleashing Diverse Thinking Modes in LLMs through Multi-Agent Collaboration
- BrowseConf: Confidence-Guided Test-Time Scaling for Web Agents
- Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
- Can Language Models Compose Skills In-Context?
- Reasoning About Reasoning: Towards Informed and Reflective Use of LLM Reasoning in HCI
- Scalable Supervising Software Agents with Patch Reasoner
- Multi-Modal Fact-Verification Framework for Reducing Hallucinations in Large Language Models
- S-Chain: Structured Visual Chain-of-Thought For Medicine
- Towards Scalable Oversight via Partitioned Human Supervision
- Agent-GSPO: Communication-Efficient Multi-Agent Systems via Group Sequence Policy Optimization
- CHOIR: Collaborative Harmonization fOr Inference Robustness
- Chitchat with AI: Understand the supply chain carbon disclosure of companies worldwide through Large Language Model
- You Don't Need Prompt Engineering Anymore: The Prompting Inversion
- Controllable Mathematical Reasoning via Self-Optimizing Thought Vectors
- Foundation of Intelligence: Review of Math Word Problems from Human Cognition Perspective
- RETuning: Upgrading Inference-Time Scaling for Stock Movement Prediction with Large Language Models
- Boosting Accuracy and Efficiency of Budget Forcing in LLMs via Reinforcement Learning for Mathematical Reasoning
- Co-Sight: Enhancing LLM-Based Agents via Conflict-Aware Meta-Verification and Trustworthy Reasoning with Structured Facts
- Unifying Large Language Models and Knowledge Graphs: A Roadmap
- String Seed of Thought: Prompting LLMs for Distribution-Faithful and Diverse Generation
- Large Language Models Meet Text-Attributed Graphs: A Survey of Integration Frameworks and Applications
- The Virtues of Brevity: Avoid Overthinking in Parallel Test-Time Reasoning
- Reasoning's Razor: Reasoning Improves Accuracy but Can Hurt Recall at Critical Operating Points in Safety and Hallucination Detection
- When and Why Does Multi-Agent Debate Fail and Does It Really Underperform?
- Language Ranker: A Lightweight Ranking framework for LLM Decoding
- GeoThought: A Dataset for Enhancing Mathematical Geometry Reasoning in Vision-Language Models
- Neural Diversity Regularizes Hallucinations in Language Models
- Systematic Evaluation of Uncertainty Estimation Methods in Large Language Models
- The Shape of Reasoning: Topological Analysis of Reasoning Traces in Large Language Models
- Robust Preference Alignment via Directional Neighborhood Consensus
- Automatic Prompt Engineering for Automatic Scoring
- TriAgent: Automated Biomarker Discovery with Deep Research Grounding for Triage in Acute Care by LLM-Based Multi-Agent Collaboration
- Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding
- Rethinking Cross-lingual Gaps from a Statistical Viewpoint
- Enhancing visual-LLM for construction site safety compliance via prompt engineering and Bi-stage retrieval-augmented generation
- SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models
- Teaming LLMs to Detect and Mitigate Hallucinations
- Automated HIV Screening on Dutch Electronic Health Records with Large Language Models
- AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
- The Zero-Step Thinking: An Empirical Study of Mode Selection as Harder Early Exit in Reasoning Models
- SheetBrain: A Neuro-Symbolic Agent for Accurate Reasoning over Complex and Large Spreadsheets
- DiSRouter: Distributed Self-Routing for LLM Selections
- What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
- Robust Driving QA through Metadata-Grounded Context and Task-Specific Prompts
- Prompt Decorators: A Declarative and Composable Syntax for Reasoning, Formatting, and Control in LLMs
- Large language models in medicine
- PlanU: Large Language Model Reasoning through Planning under Uncertainty
- 3D Optimization for AI Inference Scaling: Balancing Accuracy, Cost, and Latency
- DelvePO: Direction-Guided Self-Evolving Framework for Flexible Prompt Optimization
- Exemplar-Guided Planing: Enhanced LLM Agent for KGQA
- OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning
- Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
- LLM-as-a-Prophet: Understanding Predictive Intelligence with Prophet Arena
- Certified Self-Consistency: Statistical Guarantees and Test-Time Training for Reliable Reasoning in LLMs
- Strengthening LLMs for Tabular Prediction with Structural Priors
- StreamingThinker: Large Language Models Can Think While Reading
- CLAWS:Creativity detection for LLM-generated solutions using Attention Window of Sections
- Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation
- QueST: Incentivizing LLMs to Generate Difficult Problems
- I-RAVEN-X: Benchmarking Generalization and Robustness of Analogical and Mathematical Reasoning in Large Language and Reasoning Models
- Reasoning Distillation and Structural Alignment for Improved Code Generation
- DAG-Math: Graph-of-Thought Guided Mathematical Reasoning in LLMs
- Investigating the Impact of Rationales for LLMs on Natural Language Understanding
- Planner and Executor: Collaboration between Discrete Diffusion And Autoregressive Models in Reasoning
- The Spark Effect: On Engineering Creative Diversity in Multi-Agent AI Systems
- Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert models
- A Theoretical Study on Bridging Internal Probability and Self-Consistency for LLM Reasoning
- CarBoN: Calibrated Best-of-N Sampling Improves Test-time Reasoning
- LSPO: Length-aware Dynamic Sampling for Policy Optimization in LLM Reasoning
- Fusion-Augmented Large Language Models: Boosting Diagnostic Trustworthiness via Model Consensus
- Composition-Grounded Data Synthesis for Visual Reasoning
- Harmonizing Diverse Models: A Layer-wise Merging Strategy for Consistent Generation
- Mapping Smarter, Not Harder: A Test-Time Reinforcement Learning Agent That Improves Without Labels or Model Updates
- You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
- Boosting Instruction Following at Scale
- Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning
- COIG-Writer: A High-Quality Dataset for Chinese Creative Writing with Thought Processes
- ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling
- LLM Agents Beyond Utility: An Open-Ended Perspective
- Suicidal Comment Tree Dataset: Enhancing Risk Assessment and Prediction Through Contextual Analysis
- CURE: Confidence-driven Unified Reasoning Ensemble Framework for Medical Question Answering
- Automated Extraction of Protocol State Machines from 3GPP Specifications with Domain-Informed Prompts and LLM Ensembles
- Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction
- Where to Search: Measure the Prior-Structured Search Space of LLM Agents
- Budget-aware Test-time Scaling via Discriminative Verification
- Stop Reducing Responsibility in LLM-Powered Multi-Agent Systems to Local Alignment
- Classifying and Addressing the Diversity of Errors in Retrieval-Augmented Generation Systems
- Big Reasoning with Small Models: Instruction Retrieval at Inference Time
- In-Distribution Steering: Balancing Control and Coherence in Language Model Generation
- Stable LLM Ensemble: Interaction between Example Representativeness and Diversity
- Retrieval-in-the-Chain: Bootstrapping Large Language Models for Generative Retrieval
- Towards Human-Centric Intelligent Treatment Planning for Radiation Therapy
- Higher Satisfaction, Lower Cost: A Technical Report on How LLMs Revolutionize Meituan's Intelligent Interaction Systems
- ESI: Epistemic Uncertainty Quantification via Semantic-preserving Intervention for Large Language Models
- Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling
- Adaptive Reasoning Executor: A Collaborative Agent System for Efficient Reasoning
- Max It or Miss It: Benchmarking LLM On Solving Extremal Problems
- Schema for In-Context Learning
- Benefits and Limitations of Communication in Multi-Agent Reasoning
- Multi-Agent Debate for LLM Judges with Adaptive Stability Detection
- PromptFlow: Training Prompts Like Neural Networks
- Evolution of meta's llama models and parameter-efficient fine-tuning of large language models: a survey
- Towards Inference-time Scaling for Continuous Space Reasoning
- A Survey on Parallel Reasoning
- HoneyBee: Data Recipes for Vision-Language Reasoners
- LLM Reasoning for Machine Translation: Synthetic Data Generation over Thinking Tokens
- DMAS-Forge: A Framework for Transparent Deployment of AI Applications as Distributed Systems
- OneRec-Think: In-Text Reasoning for Generative Recommendation
- ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
- LLM-Specific Utility: A New Perspective for Retrieval-Augmented Generation
- EAGer: Entropy-Aware GEneRation for Adaptive Inference-Time Scaling
- CoSPED: Consistent Soft Prompt Targeted Data Extraction and Defense
- Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization
- Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
- Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning
- D3MAS: Decompose, Deduce, and Distribute for Enhanced Knowledge Sharing in Multi-Agent Systems
- Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?
- Tracing the Traces: Latent Temporal Signals for Efficient and Accurate Reasoning
- LLM-Friendly Knowledge Representation for Customer Support
- Agro-Consensus: Semantic Self-Consistency in Vision-Language Models for Crop Disease Management in Developing Countries
- MatryoshkaThinking: Recursive Test-Time Scaling Enables Efficient Reasoning
- Audit-of-Understanding: Posterior-Constrained Inference for Mathematical Reasoning in Language Models
- Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inference
- SwarmSys: Decentralized Swarm-Inspired Agents for Scalable and Adaptive Reasoning
- Failure-Driven Workflow Refinement
- Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
- Ontology-Guided Neuro-Symbolic Inference: Grounding Language Models with Mathematical Domain Knowledge
- PromptGuard at BLP-2025 Task 1: A Few-Shot Classification Framework Using Majority Voting and Keyword Similarity for Bengali Hate Speech Detection
- Prompting Test-Time Scaling Is A Strong LLM Reasoning Data Augmentation
- SIMBA UQ: Similarity-Based Aggregation for Uncertainty Quantification in Large Language Models
- Mitigating Overthinking through Reasoning Shaping
- Agentic Systems in Radiology: Design, Applications, Evaluation, and Challenges
- Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
- Safety Game: Balancing Safe and Informative Conversations with Blackbox Agentic AI using LP Solvers
- MEC3O: Multi-Expert Consensus for Code Time Complexity Prediction
- Repairing Regex Vulnerabilities via Localization-Guided Instructions
- MASA: LLM-Driven Multi-Agent Systems for Autoformalization
- Fundamentals of Building Autonomous LLM Agents
- Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models
- FOR-Prompting: From Objection to Revision via an Asymmetric Prompting Protocol
- RefGrader: Automated Grading of Mathematical Competition Proofs using Agentic Workflows
- Q-Router: Agentic Video Quality Assessment with Expert Model Routing and Artifact Localization
- CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards
- Think Just Enough: Sequence-Level Entropy as a Confidence Signal for LLM Reasoning
- Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models
- GCPO: When Contrast Fails, Go Gold
- Parallel Test-Time Scaling for Latent Reasoning Models
- Selection, Reflection and Self-Refinement: Revisit Reasoning Tasks via a Causal Lens
- xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning
- MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding
- LOGicalThought: Logic-Based Ontological Grounding of LLMs for High-Assurance Reasoning
- TS-Agent: Understanding and Reasoning Over Raw Time Series via Iterative Insight Gathering
- CARPAS: Towards Content-Aware Refinement of Provided Aspects for Summarization in Large Language Models
- Reasoning for Hierarchical Text Classification: The Case of Patents
- On Randomness in Agentic Evals
- CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
- Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression
- Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
- Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B
- Efficient numeracy in language models through single-token number embeddings
- GPT-5 Model Corrected GPT-4V's Chart Reading Errors, Not Prompting
- Foundations of LLM Knowledge Materialization: Termination, Reproducibility, Robustness
- Iterative LLM-Based Generation and Refinement of Distracting Conditions in Math Word Problems
- On the Role of Temperature Sampling in Test-Time Scaling
- Optimal Stopping vs Best-of-N for Inference Time Optimization
- Auto-Prompt Ensemble for LLM Judge
- Adaptive Tool Generation with Models as Tools and Reinforcement Learning
- Get RICH or Die Scaling: Profitably Trading Inference Compute for Robustness
- AsyncSpade: Efficient Test-Time Scaling with Asynchronous Sparse Decoding
- Self-signals Driven Multi-LLM Debate for Efficient and Accurate Reasoning
- Valid Stopping for LLM Generation via Empirical Dynamic Formal Lift
- Belief-Calibrated Multi-Agent Consensus Seeking for Complex NLP Tasks
- Pushing Test-Time Scaling Limits of Deep Search with Asymmetric Verification
- Towards Label-Free Biological Reasoning Synthetic Dataset Creation via Uncertainty Filtering
- ARM: Discovering Agentic Reasoning Modules for Generalizable Multi-Agent Systems
- AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning
- Mission Impossible: Feedback-Guided Dynamic Interactive Planning for Improving Reasoning on LLMs
- Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs
- Classical AI vs. LLMs for Decision-Maker Alignment in Health Insurance Choices
- RareAgent: Self-Evolving Reasoning for Drug Repurposing in Rare Diseases
- Verifier-free Test-Time Sampling for Vision-Language-Action Models
- When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
- AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering
- Let it Calm: Exploratory Annealed Decoding for Verifiable Reinforcement Learning
- Slm-mux: Orchestrating small language models for reasoning
- SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
- RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
- AI-to-AI Feedback: Amplified Intelligence — Prior Art and Governance Implications for Multi-Model Advisory Architectures
- Modeling Student Learning with 3.8 Million Program Traces
- Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
- Resource-Efficient Fine-Tuning of LLaMA-3.2-3B for Medical Chain-of-Thought Reasoning
- Bridging Reasoning to Learning: Unmasking Illusions using Complexity Out of Distribution Generalization
- Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
- Multi-Agent Collaborative Intelligence: Dual-Dial Control for Reliable LLM Reasoning
- MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models
- Natural Language Edge Labelling: Decoupling Intent from Execution in Structured LM Reasoning
- Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
- AlphaApollo: A System for Deep Agentic Reasoning
- Open Agent Specification (Agent Spec): A Unified Representation for AI Agents
- PatternKV: Flattening KV Representation Expands Quantization Headroom
- Large Language Models Hallucination: A Comprehensive Survey
- SPOGW: a Score-based Preference Optimization method via Group-Wise comparison for workflows
- Increasing LLM response trustworthiness using voting ensembles
- Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
- Searching Meta Reasoning Skeleton to Guide LLM Reasoning
- Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation
- Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models
- On Using Large Language Models to Enhance Clinically-Driven Missing Data Recovery Algorithms in Electronic Health Records
- MITS: Enhanced Tree Search Reasoning for LLMs via Pointwise Mutual Information
- GuidedSampling: Steering LLMs Towards Diverse Candidate Solutions at Inference-Time
- Efficient Test-Time Scaling for Small Vision-Language Models
- Sample, Align, Synthesize: Graph-Based Response Synthesis with ConGrs
- Best-of-Majority: Minimax-Optimal Strategy for Pass@k Inference Scaling
- Lateral Tree-of-Thoughts Surpasses ToT by Incorporating Logically-Consistent, Low-Utility Candidates
- Self-Reflective Generation at Test Time
- RoiRL: Efficient, Self-Supervised Reasoning with Offline Iterative Reinforcement Learning
- NCV: A Node-Wise Consistency Verification Approach for Low-Cost Structured Error Localization in LLM Reasoning
- Knowledge Graph-Guided Multi-Agent Distillation for Reliable Industrial Question Answering with Datasets
- Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal Retrieval
- AutoMaAS: Self-Evolving Multi-Agent Architecture Search for Large Language Models
- StepChain GraphRAG: Reasoning Over Knowledge Graphs for Multi-Hop Question Answering
- Typed Chain-of-Thought: A Curry-Howard Framework for Verifying LLM Reasoning
- Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
- Hearing the Order: Investigating Selection Bias in Large Audio-Language Models
- When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
- JoyAgent-JDGenie: Technical Report on the GAIA
- Curiosity-Driven LLM-as-a-judge for Personalized Creative Judgment
- Generalized Parallel Scaling with Interdependent Generations
- Rethinking Thinking Tokens: LLMs as Improvement Operators
- Making, not Taking, the Best of N
- CodeChemist: Test-Time Scaling for Low-Resource Code Generation via Functional Knowledge Transfer
- Stochastic Self-Organization in Multi-Agent Systems
- Beyond Majority Voting: LLM Aggregation by Leveraging Higher-Order Information
- Training Large Language Models To Reason In Parallel With Global Forking Tokens
- Judging with Confidence: Calibrating Autoraters to Preference Distributions
- BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
- GRPO-λ: Credit Assignment improves LLM Reasoning
- TAMA: Tool-Augmented Multimodal Agent for Procedural Activity Understanding
- Recursive Self-Aggregation Unlocks Deep Thinking in Large Language Models
- Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark
- Go with Your Gut: Scaling Confidence for Autoregressive Image Generation
- Memory-Driven Self-Improvement for Decision Making with Large Language Models
- Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts
- Reinforced Strategy Optimization for Conversational Recommender Systems via Network-of-Experts
- DyFlow: Dynamic Workflow Framework for Agentic Reasoning
- Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA
- Chain-in-Tree: Back to Sequential Reasoning in LLM Tree Search
- Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking
- TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
- SING-SQL: A Synthetic Data Generation Framework for In-Domain Text-to-SQL Translation
- Nudging the Boundaries of LLM Reasoning
- Uncertainty-Aware Answer Selection for Improved Reasoning in Multi-LLM Systems
- Explainable Fault Localization for Programming Assignments via LLM-Guided Annotation
- Automated Model Discovery via Multi-modal & Multi-step Pipeline
- Planner-R1: Reward Shaping Enables Efficient Agentic RL with Smaller LLMs
- Voice Evaluation of Reasoning Ability: Diagnosing the Modality-Induced Performance Gap
- SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA
- DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search
- Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
- From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
- PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images
- Rethinking Entropy Regularization in Large Reasoning Models
- SecInfer: Preventing Prompt Injection via Inference-time Scaling
- The Dialogue That Heals: A Comprehensive Evaluation of Doctor Agents' Inquiry Capability
- Intra-request branch orchestration for efficient LLM reasoning
- Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval
- A Hierarchical Error Framework for Reliable Automated Coding in Communication Research: Applications to Health and Political Communication
- KnowGuard: Knowledge-Driven Abstention for Multi-Round Clinical Reasoning
- LatentEvolve: Self-Evolving Test-Time Scaling in Latent Space
- From Ambiguity to Verdict: A Semiotic-Grounded Multi-Perspective Agent for LLM Logical Reasoning
- CDT: A Comprehensive Capability Framework for Large Language Models Across Cognition, Domain, and Task
- Plan before Solving: Problem-Aware Strategy Routing for Mathematical Reasoning with LLMs
- From Static to Dynamic: Adaptive Monte Carlo Search for Mathematical Process Supervision
- MAS2: Self-Generative, Self-Configuring, Self-Rectifying Multi-Agent Systems
- MedMMV: A Controllable Multimodal Multi-Agent Framework for Reliable and Verifiable Clinical Reasoning
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- Learning to Ponder: Adaptive Reasoning in Latent Space
- Can Large Language Models Express Uncertainty Like Human?
- Dynamic Policy Induction for Adaptive Prompt Optimization: Bridging the Efficiency-Accuracy Gap via Lightweight Reinforcement Learning
- Think Twice, Generate Once: Safeguarding by Progressive Self-Reflection
- ContextPRM: Leveraging Contextual Coherence for multi-domain Test-Time Scaling
- Calibrating Verbalized Confidence with Self-Generated Distractors
- Not Wrong, But Untrue: LLM Overconfidence in Document-Based Queries
- Expanding Computation Spaces of LLMs at Inference Time
- Agentar-Scale-SQL: Advancing Text-to-SQL through Orchestrated Test-Time Scaling
- ReasonCACHE: Teaching LLMs To Reason Without Weight Updates
- Beyond Magic Words: Sharpness-Aware Prompt Evolving for Robust Large Language Models with TARE
- Explore-Execute Chain: Towards an Efficient Structured Reasoning Paradigm
- Fast Thinking for Large Language Models
- MASH: A Multiplatform and Multimodal Annotated Dataset for Societal Impact of Hurricane
- Reasoning Scaffolding: Distilling the Flow of Thought from LLMs
- Do Repetitions Matter? Strengthening Reliability in LLM Evaluations
- EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance
- Cognition-of-Thought Elicits Social-Aligned Reasoning in Large Language Models
- Language, Culture, and Ideology: Personalizing Offensiveness Detection in Political Tweets with Reasoning LLMs
- Scaling LLM Test-Time Compute with Mobile NPU on Smartphones
- Decoupling Reasoning and Perception: An LLM-LMM Framework for Faithful Visual Reasoning
- Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning
- Scaling Policy Compliance Assessment in Language Models with Policy Reasoning Traces
- Mitigating Spurious Correlations in LLMs via Causality-Aware Post-Training
- MathBode: Measuring the Stability of LLM Reasoning using Frequency Response
- Tracing Uncertainty in Language Model "Reasoning"
- Agentic AI Reasoning for Mobile Edge General Intelligence: Fundamentals, Approaches, and Directions
- From Harm to Help: Turning Reasoning In-Context Demos into Assets for Reasoning LMs
- AutoEP: LLMs-Driven Automation of Hyperparameter Evolution for Metaheuristic Algorithms
- Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts
- PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space
- LAGEA: Language Guided Embodied Agents for Robotic Manipulation
- Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers
- Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned
- Protocode: Prototype-Driven Interpretability for Code Generation in LLMs
- Taming Variability: Randomized and Bootstrapped Conformal Risk Control for LLMs
- Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks
- HEART: Emotionally-driven test-time scaling of Language Models
- UML-CoT: Structured Reasoning and Planning with Unified Modeling Language for Robotic Room Cleaning
- Dynamic Experts Search: Enhancing Reasoning in Mixture-of-Experts LLMs at Test Time
- InfiAgent: Self-Evolving Pyramid Agent Framework for Infinite Scenarios
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- PRIME: Planning and Retrieval-Integrated Memory for Enhanced Reasoning
- From Long to Lean: Performance-aware and Adaptive Chain-of-Thought Compression via Multi-round Refinement
- R-Capsule: Compressing High-Level Plans for Efficient Large Language Model Reasoning
- Multi-Agent Path Finding via Offline RL and LLM Collaboration
- Think Right, Not More: Test-Time Scaling for Numerical Claim Verification
- Reinforcement Learning-Guided Chain-of-Draft for Token-Efficient Code Generation
- Fuzzy Reasoning Chain (FRC): An Innovative Reasoning Framework from Fuzziness to Clarity
- A2R: An Asymmetric Two-Stage Reasoning Framework for Parallel Reasoning
- Teaching Transformers to Solve Combinatorial Problems through Efficient Trial & Error
- Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
- Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
- Retrieval-of-Thought: Efficient Reasoning via Reusing Thoughts
- Thinking in Many Modes: How Composite Reasoning Elevates Large Language Model Performance with Limited Data
- Why Chain of Thought Fails in Clinical Text Understanding
- Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty
- Towards Transparent AI: A Survey on Explainable Language Models
- Correct Reasoning Paths Visit Shared Decision Pivots
- Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation
- Dual-Head Reasoning Distillation: Improving Classifier Accuracy with Train-Time-Only Reasoning
- A State-of-the-Art SQL Reasoning Model using RLVR
- VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
- Bounds of Chain-of-Thought Robustness: Reasoning Steps, Embed Norms, and Beyond
- Best-of-∞ -- Asymptotic Performance of Test-Time LLM Ensembling
- Verification Limits Code LLM Training
- Distilling Many-Shot In-Context Learning into a Cheat Sheet
- LogReasoner: Empowering LLMs with Expert-like Coarse-to-Fine Reasoning for Automated Log Analysis
- TyphoonMLA: A Mixed Naive-Absorb MLA Kernel For Shared Prefix
- A Fano-Style Accuracy Upper Bound for LLM Single-Pass Reasoning in Multi-Hop QA
- Difference-Guided Reasoning: A Temporal-Spatial Framework for Large Language Models
- RJE: A Retrieval-Judgment-Exploration Framework for Efficient Knowledge Graph Question Answering with LLMs
- Mixture of Thoughts: Learning to Aggregate What Experts Think, Not Just What They Say
- MARS: toward more efficient multi-agent collaboration for LLM reasoning
- Instruction Boundary: Quantifying Biases in LLM Reasoning under Various Coverage
- SIM-CoT: Supervised Implicit Chain-of-Thought
- SKYLENAGE Technical Report: Mathematical Reasoning and Contest-Innovation Benchmarks for Multi-Level Math Evaluation
- LOCA: Logical Chain Augmentation for Scientific Corpus Cleaning
- Mamba Modulation: On the Length Generalization of Mamba
- STARQA: A Question Answering Dataset for Complex Analytical Reasoning over Structured Databases
- What makes prompts a graph: necessary and sufficient conditions for prompt graph engineering
- Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems
- LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger
- Distilling Answer Set Programming Theories from Large Language Models
- Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense
- Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems
- Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs
- Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups
- LASAR: Latent Adaptive Semantic Aligned Reasoning for Generative Recommendation
- Can neural networks do arithmetic? A survey on the elementary numerical skills of state-of-the-art deep learning models
- RELISH: LLM REgression with a Latent Iterative State Head
- Verbalizing LLM's Higher-order Uncertainty via Imprecise Probabilities
- Geometric Risk Control for Vision-Language Model OCR
- Language Models Coupled with Metacognition Can Outperform Reasoning Models
- Large language model consensus substantially improves the cell type annotation accuracy for scRNA-seq data
- Pandora: Leveraging Code-driven Knowledge Transfer for Unified Structured Knowledge Reasoning
- DRQA: Dynamic Reasoning Quota Allocation for Controlling Overthinking in Reasoning Large Language Models
- Estimating the Self-Consistency of LLMs
- Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning
- LLM-based Agents Suffer from Hallucinations: A Survey of Taxonomy, Methods, and Directions
- Solving Math Word Problems Using Estimation Verification and Equation Generation
- CCQA: Generating Question from Solution Can Improve Inference-Time Reasoning in SLMs
- Confidence-Aware Routing for Large Language Model Reliability Enhancement: A Multi-Signal Approach to Pre-Generation Hallucination Mitigation
- When TableQA Meets Noise: A Dual Denoising Framework for Complex Questions and Large-scale Tables
- Correlation or Causation: Analyzing the Causal Structures of LLM and LRM Reasoning Process
- MSCoRe: A Benchmark for Multi-Stage Collaborative Reasoning in LLM Agents
- Mitigating Strategy-Selection Bias in Reasoning for More Effective Test-Time Scaling
- Variation in Verification: Understanding Verification Dynamics in Large Language Models
- Can Agents Judge Systematic Reviews Like Humans? Evaluating SLRs with LLM-based Multi-Agent System
- Localizing Malicious Outputs from CodeLLM
- K-DeCore: Facilitating Knowledge Transfer in Continual Structured Knowledge Reasoning via Knowledge Decoupling
- MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE
- V-CECE: Visual Counterfactual Explanations via Conceptual Edits
- A Novel Differential Feature Learning for Effective Hallucination Detection and Classification
- SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning
- SalaMAnder: Shapley-based Mathematical Expression Attribution and Metric for Chain-of-Thought Reasoning
- From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations
- Best-of-L: Cross-Lingual Reward Modeling for Mathematical Reasoning
- Spectral Logit Sculpting: Adaptive Low-Rank Logit Transformation for Controlled Text Generation
- GPO: Learning from Critical Steps to Improve LLM Reasoning
- Temporal Reasoning with Large Language Models Augmented by Evolving Knowledge Graphs
- LLM Agents at the Roundtable: A Multi-Perspective and Dialectical Reasoning Framework for Essay Scoring
- Japanese Children's Riddles as a Benchmark for Machine Insight and Metacognition
- (P)rior(D)yna(F)low: A Priori Dynamic Workflow Construction via Multi-Agent Collaboration
- Large Language Models in Operations Research: Methods, Applications, and Challenges
- Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
- From Pixels to Urban Policy-Intelligence: Recovering Legacy Effects of Redlining with a Multimodal LLM
- Self-Improvement of Language Models by Post-Training on Multi-Agent Debate
- Class-Invariant Test-Time Augmentation for Domain Generalization
- A Taxonomy of Prompt Defects in LLM Systems
- Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision
- MICA: Multi-Agent Industrial Coordination Assistant
- Enhancing Multi-Agent Debate System Performance via Confidence Expression
- Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies
- Thinking in a Crowd: How Auxiliary Information Shapes LLM Reasoning
- DSCC-HS: A Dynamic Self-Reinforcing Framework for Hallucination Suppression in Large Language Models
- Early Stopping Chain-of-thoughts in Large Language Models
- Slim-SC: Thought Pruning for Efficient Scaling with Self-Consistency
- FVDebug: An LLM-Driven Debugging Assistant for Automated Root Cause Analysis of Formal Verification Failures
- Single-stream Policy Optimization
- REFINER: Reasoning Feedback on Intermediate Representations
- The LLM Already Knows: Estimating LLM-Perceived Question Difficulty via Hidden Representations
- LTA-thinker: Latent Thought-Augmented Training Framework for Large Language Models on Complex Reasoning
- Leveraging Large Language Models to Effectively Generate Visual Data for Canine Musculoskeletal Diagnoses
- Routing Distilled Knowledge via Mixture of LoRA Experts for Large Language Model based Bundle Generation
- Analogy-Driven Financial Chain-of-Thought (AD-FCoT): A Prompting Approach for Financial Sentiment Analysis
- Shaping Explanations: Semantic Reward Modeling with Encoder-Only Transformers for GRPO
- Large Language Model-Based Automatic Formulation for Stochastic Optimization Models
- Selective Risk Certification for LLM Outputs via Information-Lift Statistics: PAC-Bayes, Robustness, and Skeleton Design
- A Fine-Grained 3D Radio Map Construction Paradigm with Ultra-Low Sampling Rates by Large Generative Models
- Audited Reasoning Refinement: Fine-Tuning Language Models via LLM-Guided Step-Wise Evaluation and Correction
- HalluDetect: Detecting, Mitigating, and Benchmarking Hallucinations in Conversational Systems in the Legal Domain
- The Prompt Engineering Report Distilled: Quick Start Guide for Life Sciences
- Predictable Compression Failures: Order Sensitivity and Information Budgeting for Evidence-Grounded Binary Adjudication
- Free-MAD: Consensus-Free Multi-Agent Debate
- PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits
- Improving Table Understanding with LLMs and Entity-Oriented Search
- Reasoning Under Uncertainty: Exploring Probabilistic Reasoning Capabilities of LLMs
- Planning for Success: Exploring LLM Long-term Planning Capabilities in Table Understanding
- DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL
- RefactorCoderQA: Benchmarking LLMs for Multi-Domain Coding Question Solutions in Cloud and Edge Deployment
- Who Decides How Knowing Becomes Doing? Redistributing Authority in Human-AI Music Co-Creation
- On LLM-Based Scientific Inductive Reasoning Beyond Equations
- Large Language Models Meet Legal Artificial Intelligence: A Survey
- Smart Trial: Evaluating the Use of Large Language Models for Recruiting Clinical Trial Participants via Social Media
- Unsupervised Hallucination Detection by Inspecting Reasoning Processes
- Limited Reference, Reliable Generation: A Two-Component Framework for Tabular Data Generation in Low-Data Regimes
- Enhancing LLM-based Specification Generation via Program Slicing and Logical Deletion
- XAgents: A Unified Framework for Multi-Agent Cooperation via IF-THEN Rules and Multipolar Task Processing Graph
- CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
- Visual Programmability: A Guide for Code-as-Thought in Chart Understanding
- Jupiter: Enhancing LLM Data Analysis Capabilities via Notebook and Inference-Time Value-Guided Search
- Quality Assessment of Tabular Data using Large Language Models and Code Generation
- Latency and Token-Aware Test-Time Compute
- PromptGuard: An Orchestrated Prompting Framework for Principled Synthetic Text Generation for Vulnerable Populations using LLMs with Enhanced Safety, Fairness, and Controllability
- Evaluating LLMs Without Oracle Feedback: Agentic Annotation Evaluation Through Unsupervised Consistency Signals
- Leveraging AI Agents for Autonomous Networks: A Reference Architecture and Empirical Studies
- Improving MLLM Historical Record Extraction with Test-Time Image
- CM-Align: Consistency-based Multilingual Alignment for Large Language Models
- AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
- Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization
- XML Prompting as Grammar-Constrained Interaction: Fixed-Point Semantics, Convergence Guarantees, and Human-AI Protocols
- Parallel-R1: Towards Parallel Thinking via Reinforcement Learning
- Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs
- HealthSLM-Bench: Benchmarking Small Language Models for Mobile and Wearable Healthcare Monitoring
- RAFFLES: Reasoning-based Attribution of Faults for LLM Systems
- MachineLearningLM: Scaling Many-shot In-context Learning via Continued Pretraining
- Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
- From Implicit Exploration to Structured Reasoning: Leveraging Guideline and Refinement for LLMs
- The Majority is not always right: RL training for solution aggregation
- Benchmarking Information Retrieval Models on Complex Retrieval Tasks
- X-SQL: Expert Schema Linking and Understanding of Text-to-SQL with Multi-LLMs
- From Long to Short: LLMs Excel at Trimming Own Reasoning Chains
- Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation
- Cross-Question Method Reuse in Large Language Models: From Word-Level Prediction to Rational Logical-Layer Reasoning
- Self-Aligned Reward: Towards Effective and Efficient Reasoners
- Sticker-TTS: Learn to Utilize Historical Experience with a Sticker-driven Test-Time Scaling Framework
- Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
- DreamPRM-1.5: Unlocking the Potential of Each Instance for Multimodal Process Reward Model Training
- Talk Isn't Always Cheap: Understanding Failure Modes in Multi-Agent Debate
- FLAMES: Improving LLM Math Reasoning via a Fine-Grained Analysis of the Data Synthesis Pipeline
- Psychologically Enhanced AI Agents
- CoT-Space: A Theoretical Framework for Internal Slow-Thinking via Reinforcement Learning
- Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation
- A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
- A Probabilistic Inference Scaling Theory for LLM Self-Correction
- Beyond Interpretability: Exploring the Comprehensibility of Adaptive Video Streaming through Large Language Models
- Explainable Knowledge Graph Retrieval-Augmented Generation (KG-RAG) with KG-SMILE
- Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents
- Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?
- Knowledge Integration for Physics-informed Symbolic Regression Using Pre-trained Large Language Models
- ReCode: Improving LLM-based Code Repair with Fine-Grained Retrieval-Augmented Generation
- Scale, Don't Fine-tune: Guiding Multimodal LLMs for Efficient Visual Place Recognition at Test-Time
- LLMs for LLMs: A Structured Prompting Methodology for Long Legal Documents
- Avoidance Decoding for Diverse Multi-Branch Story Generation
- Causal Consistency Regularization: Training Verifiably Sensitive Reasoning in Large Language Models
- Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal
- GradeSQL: Test-Time Inference with Outcome Reward Models for Text-to-SQL Generation from Large Language Models
- Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning
- Aligning Reasoning LLMs for Materials Discovery with Physics-aware Rejection Sampling
- GIER: Gap-Driven Self-Refinement for Large Language Models
- Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
- Illuminating Patterns of Divergence: DataDios SmartDiff for Large-Scale Data Difference Analysis
- ParaThinker: Native Parallel Thinking as a New Paradigm to Scale LLM Test-time Compute
- PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains
- Reasoning-Intensive Regression
- How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images
- Can Multiple Responses from an LLM Reveal the Sources of Its Uncertainty?
- An Agile Method for Implementing Retrieval Augmented Generation Tools in Industrial SMEs
- Measuring Reasoning Utility in LLMs via Conditional Entropy Reduction
- CyberSleuth: Autonomous Blue-Team LLM Agent for Web Attack Forensics
- Automated Quality Assessment for LLM-Based Complex Qualitative Coding: A Confidence-Diversity Framework
- PersoNo: Personalised Notification Urgency Classifier in Mixed Reality
- LFD: Layer Fused Decoding to Exploit External Knowledge in Retrieval-Augmented Generation
- SLIM: Subtrajectory-Level Elimination for More Effective Reasoning
- Entropy-Guided Loop: Achieving Reasoning through Uncertainty-Aware Generation
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation
- Can Structured Templates Facilitate LLMs in Tackling Harder Tasks? : An Exploration of Scaling Laws by Difficulty
- Beyond the Textual: Generating Coherent Visual Options for MCQs
- Tailored Teaching with Balanced Difficulty: Elevating Reasoning in Multimodal Chain-of-Thought via Prompt Curriculum
- Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks
- Thinking Before You Speak: A Proactive Test-time Scaling Approach
- VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft
- MIRAGE: Scaling Test-Time Inference with Parallel Graph-Retrieval-Augmented Reasoning Chains
- InReAcTable: LLM-Powered Interactive Visual Data Story Construction from Tabular Data
- Named Entity Recognition of Historical Text via Large Language Model
- LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries
- Deep Think with Confidence
- Fine-tuning and prompt engineering for large language models-based code review automation
- Trust but Verify! A Survey on Verification Design for Test-time Scaling
- Semantic Energy: Detecting LLM Hallucination Beyond Entropy
- Automated Optimization Modeling through Expert-Guided Large Language Model Reasoning
- Zero-knowledge LLM hallucination detection and mitigation through fine-grained cross-model consistency
- Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
- Prompt Orchestration Markup Language
- Can Large Language Models (LLMs) Describe Pictures Like Children? A Comparative Corpus Study
- Expertise-aware Multi-LLM Recruitment and Collaboration for Medical Decision-Making
- CausalPlan: Empowering Efficient LLM Multi-Agent Collaboration Through Causality-Driven Planning
- Generics and Default Reasoning in Large Language Models
- Input-Time Scaling: Adding Noise and Irrelevance into Less-Is-More Drastically Improves Reasoning Performance and Efficiency
- Self-Organizing Agent Network for LLM-based Workflow Automation
- Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models
- Can Large Models Teach Student Models to Solve Mathematical Problems Like Human Beings? A Reasoning Distillation Method via Multi-LoRA Interaction
- Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models
- Navigating the Exploration-Exploitation Tradeoff in Inference-Time Scaling of Diffusion Models
- Fast, Slow, and Tool-augmented Thinking for LLMs: A Review
- Improving Pre-Trained Vision-Language-Action Policies with Model-Based Search
- Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow
- Cost-Aware Contrastive Routing for LLMs
- ReaLM: Reflection-Enhanced Autonomous Reasoning with Small Language Models
- Mitigating Hallucinations in Large Language Models via Causal Reasoning
- AgentMental: An Interactive Multi-Agent Framework for Explainable and Adaptive Mental Health Assessment
- MM-R1: Unleashing the Power of Unified Multimodal Large Language Models for Personalized Image Generation
- ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism
- HOID-R1: Reinforcement Learning for Open-World Human-Object Interaction Detection Reasoning with Multimodal Large Language Model
- Hard Examples Are All You Need: Maximizing GRPO Post-Training Under Annotation Budgets
- Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding
- PASS: Probabilistic Agentic Supernet Sampling for Interpretable and Adaptive Chest X-Ray Reasoning
- MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding
- MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
- Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization
- MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
- Episodic Memory Representation for Long-form Video Understanding
- ASPD: Unlocking Adaptive Serial-Parallel Decoding by Exploring Intrinsic Parallelism in LLMs
- Leveraging Large Language Models for Rare Disease Named Entity Recognition
- InternBootcamp Technical Report: Boosting LLM Reasoning with Verifiable Task Scaling
- Rational Inverse Reasoning: Few-Shot Imitation by Inferring Intent through Planning
- Privacy-protected Retrieval-Augmented Generation for Knowledge Graph Question Answering
- Train Long, Think Short: Curriculum Learning for Efficient Reasoning
- Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language Models
- Bottom-up Domain-specific Superintelligence: A Reliable Knowledge Graph is What We Need
- Evaluating Large Language Models as Expert Annotators
- ThinkTuning: Instilling Cognitive Reflections without Distillation
- Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression
- Can LLMs Detect Their Confabulations? Estimating Reliability in Uncertainty-Aware Language Models
- Steerable Pluralism: Pluralistic Alignment via Few-Shot Comparative Regression
- Hallucination as a Computational Boundary: A Hierarchy of Inevitability and the Oracle Escape
- EndoCogniAgent: Closed-Loop Agentic Reasoning with Self-Consistency Validation for Endoscopic Diagnosis
- Uncertainty-Aware Semantic Decoding for LLM-Based Sequential Recommendation
- AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning
- Chain-of-Alpha: Unleashing the Power of Large Language Models for Alpha Mining in Quantitative Trading
- Mediator-Guided Multi-Agent Collaboration among Open-Source Models for Medical Decision-Making
- Navigating the Risks of Using Large Language Models for Text Annotation in Social Science Research
- First Ask Then Answer: A Framework Design for AI Dialogue Based on Supplementary Questioning with Large Language Models
- Learning by Teaching: Engaging Students as Instructors of Large Language Models in Computer Science Education
- Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
- Decision-Making with Deliberation: Meta-reviewing as a Document-grounded Dialogue
- Incident Response Planning Using a Lightweight Large Language Model with Reduced Hallucination
- FedCoT: Communication-Efficient Federated Reasoning Enhancement for Large Language Models
- ConfAgents: A Conformal-Guided Multi-Agent Framework for Cost-Efficient Medical Diagnosis
- Charts-of-Thought: Enhancing LLM Visualization Literacy Through Structured Data Extraction
- Hop, Skip, and Overthink: Diagnosing Why Reasoning Models Fumble during Multi-Hop Analysis
- TRAIL: Joint Inference and Refinement of Knowledge Graphs with Large Language Models
- StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs through Knowledge-Reasoning Fusion
- PersonaEval: Are LLM Evaluators Human Enough to Judge Role-Play?
- Chain of Questions: Guiding Multimodal Curiosity in Language Models
- Deliberative Reasoning Network: An Uncertainty-Driven Paradigm for Belief-Tracked Inference with Pretrained Language Models
- Large Language Model's Multi-Capability Alignment in Biomedical Domain
- GeoSR: Cognitive-Agentic Framework for Probing Geospatial Knowledge Boundaries via Iterative Self-Refinement
- Enhancing Serendipity Recommendation System by Constructing Dynamic User Knowledge Graphs with Large Language Models
- Unravelling the Probabilistic Forest: Arbitrage in Prediction Markets
- GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control
- Toward a Trustworthy Optimization Modeling Agent via Verifiable Synthetic Data Generation
- Adaptive Command: Real-Time Policy Adjustment via Language Models in StarCraft II
- CTTS: Collective Test-Time Scaling
- Polymath: A Self-Optimizing Agent with Dynamic Hierarchical Workflow
- XFacta: Contemporary, Real-World Dataset and Evaluation for Multimodal Misinformation Detection with Multimodal LLMs
- CAAD: Context-Aware Adaptive Decoding for Truthful Text Generation
- A Survey on AgentOps: Categorization, Challenges, and Future Directions
- MArgE: Meshing Argumentative Evidence from Multiple Large Language Models for Justifiable Claim Verification
- A Confidence-Diversity Framework for Calibrating AI Judgement in Accessible Qualitative Coding Tasks
- TIBSTC-CoT: A Multi-Domain Instruction Dataset for Chain-of-Thought Reasoning in Language Models
- Test-time Prompt Intervention
- SE-Agent: Self-Evolution Trajectory Optimization in Multi-Step Reasoning with LLM-Based Agents
- Counterfactual Probing for Hallucination Detection and Mitigation in Large Language Models
- Uncertainty-Based Methods for Automated Process Reward Data Construction and Output Aggregation in Mathematical Reasoning
- ReflecSched: Solving Dynamic Flexible Job-Shop Scheduling via LLM-Powered Hierarchical Reflection
- Enhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware Intervention
- LLM-Assisted Model-Based Fuzzing of Protocol Implementations
- Reasoning as a Resource: Optimizing Fast and Slow Thinking in Code Generation Models
- Accurate and Consistent Graph Model Generation from Text with Large Language Models
- Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models
- Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications
- Ordinal Folding Index: A Computable Metric for Self-Referential Semantics
- BAR Conjecture: the Feasibility of Inference Budget-Constrained LLM Services with Authenticity and Reasoning
- LENS: Learning Ensemble Confidence from Neural States for Multi-LLM Answer Integration
- A Framework for Analyzing Abnormal Emergence in Service Ecosystems Through LLM-based Agent Intention Mining
- Failures Are the Stepping Stones to Success: Enhancing Few-Shot In-Context Learning by Leveraging Negative Samples
- LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization
- GeoReg: Weight-Constrained Few-Shot Regression for Socio-Economic Estimation using LLM
- Surfacing Variations to Calibrate Perceived Reliability of MLLM-generated Image Descriptions
- Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions
- MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines
- Introducing HALC: A general pipeline for finding optimal prompting strategies for automated coding with LLMs in the computational social sciences
- Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models
- Which LLMs Get the Joke? Probing Non-STEM Reasoning Abilities with HumorBench
- Enhancing Hallucination Detection via Future Context
- SAND-Math: Using LLMs to Generate Novel, Difficult and Useful Mathematics Questions and Answers
- Cognitive Chain-of-Thought: Structured Multimodal Reasoning about Social Situations
- The Blessing and Curse of Dimensionality in Safety Alignment
- IM-Chat: A Multi-agent LLM Framework Integrating Tool-Calling and Diffusion Modeling for Knowledge Transfer in Injection Molding Industry
- PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
- Large Language Model Agent for Structural Drawing Generation Using ReAct Prompt Engineering and Retrieval Augmented Generation
- Leveraging Fine-Tuned Large Language Models for Interpretable Pancreatic Cystic Lesion Feature Extraction and Risk Categorization
- AgentTTS: Large Language Model Agent for Test-time Compute-optimal Scaling Strategy in Complex Tasks
- Ultracoarse Equilibria and Ordinal-Folding Dynamics in Operator-Algebraic Models of Infinite Multi-Agent Games
- SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models
- Adaptive Cluster Collaborativeness Boosts LLMs Medical Decision Support Capacity
- Efficient Learning for Product Attributes with Compact Multimodal Models
- A Toolbox, Not a Hammer -- Multi-TAG: Scaling Math Reasoning with Multi-Tool Aggregation
- Learning neuro-symbolic convergent term rewriting systems
- TTS-VAR: A Test-Time Scaling Framework for Visual Auto-Regressive Generation
- Does More Inference-Time Compute Really Help Robustness?
- Assemble Your Crew: Automatic Multi-agent Communication Topology Design via Autoregressive Graph Generation
- EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs
- SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models
- Survey of GenAI for Automotive Software Development: From Requirements to Executable Code
- VeriMinder: Mitigating Analytical Vulnerabilities in NL2SQL
- Critique of impure reason: Unveiling the reasoning behaviour of medical large language models
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- Mitigating Factual Hallucination in Large Reasoning Models via Mixed-Mode Advantage Regularization
- Unlocking the Working Memory of Large Language Models for Latent Reasoning
- Towards Cybersecurity SuperIntelligence (CSI): What's the best harness for cybersecurity?
- Darwin Family: MRI-Trust-Weighted Evolutionary Merging for Training-Free Scaling of Language-Model Reasoning
- Enhanced Mycelium of Thought (EMoT): A Bio-Inspired Hierarchical Reasoning Architecture with Strategic Dormancy and Mnemonic Encoding
- V1: Unifying Generation and Self-Verification for Parallel Reasoners
- Theory of Mind Abilities of Large Language Models in Human-Robot Interaction: An Illusion?
- DPBench: Structural Determinants of Multi-Agent LLM Coordination Under Simultaneous Resource Contention
- Benchmarking Gaslighting Negation Attacks Against Reasoning Models
- It's Not That Simple. An Analysis of Simple Test-Time Scaling
- Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework
- Impact of Code Context and Prompting Strategies on Automated Unit Test Generation with Modern General-Purpose Large Language Models
- Team of One: Cracking Complex Video QA with Model Synergy
- Pretraining on the Test Set Is No Longer All You Need: A Debate-Driven Approach to QA Benchmarks
- CLARIFID: Improving Radiology Report Generation by Reinforcing Clinically Accurate Impressions and Enforcing Detailed Findings
- KiC: Keyword-inspired Cascade for Cost-Efficient Text Generation with LLMs
- GenSelect: A Generative Approach to Best-of-N
- Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling
- R4ec: A Reasoning, Reflection, and Refinement Framework for Recommendation Systems
- A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning
- Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities
- Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
- Promptomatix: An Automatic Prompt Optimization Framework for Large Language Models
- Are Knowledge and Reference in Multilingual Language Models Cross-Lingually Consistent?
- Chain-of-Descriptions: Improving Code LLMs for VHDL Code Generation and Summarization
- A Compute-Matched Re-Evaluation of TroVE on MATH
- Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification
- Reasoning Strategies in Large Language Models: Can They Follow, Prefer, and Optimize?
- ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
- e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs
- Learning to Reason Across Parallel Samples for LLM Reasoning
- A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search
- RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling
- Sample Efficient Demonstration Selection for In-Context Learning
- How Good LLM-Generated Password Policies Are?
- VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism
- MasHost Builds It All: Autonomous Multi-Agent System Directed by Reinforcement Learning
- Transforming Expert Knowledge into Scalable Ontology via Large Language Models
- Guiding LLM Decision-Making with Fairness Reward Models
- FinHEAR: Human Expertise and Adaptive Risk-Aware Temporal Reasoning for Financial Decision-Making
- MEMETRON: Metaheuristic Mechanisms for Test-time Response Optimization of Large Language Models
- LRCTI: A Large Language Model-Based Framework for Multi-Step Evidence Retrieval and Reasoning in Cyber Threat Intelligence Credibility Verification
- A Survey on Large Language Models for Mathematical Reasoning
- SIMCODE: A Benchmark for Natural Language to ns-3 Network Simulation Code Generation
- From Alerts to Intelligence: A Novel LLM-Aided Framework for Host-based Intrusion Detection
- FedRAG: A Framework for Fine-Tuning Retrieval-Augmented Generation Systems
- PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training
- Stabilizing Black-Box Prompt Optimization with Textual Regularization and Signal Aggregation
- Deep Hidden Cognition Facilitates Reliable Chain-of-Thought Reasoning
- ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation
- Evaluating LLM-based Workflows for Switched-Mode Power Supply Design
- ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
- FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data
- Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations
- Psychology-Driven Enhancement of Humour Translation
- SPICE: An Automated SWE-Bench Labeling Pipeline for Issue Clarity, Test Coverage, and Effort Estimation
- Reinforce LLM Reasoning through Multi-Agent Reflection
- OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique
- Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
- How to Train a Leader: Hierarchical Reasoning in Multi-Agent LLMs
- Optimizing Sequential Multi-Step Tasks with Parallel LLM Agents
- Knowledge Fusion via Bidirectional Information Aggregation
- Anthropomimetic Uncertainty: What Verbalized Uncertainty in Language Models is Missing
- A Survey of Large Language Models in Discipline-specific Research: Challenges, Methods and Opportunities
- Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
- Performance and Practical Considerations of Large and Small Language Models in Clinical Decision Support in Rheumatology
- SAND: Boosting LLM Agents with Self-Taught Action Deliberation
- PLAN-TUNING: Post-Training Language Models to Learn Step-by-Step Planning for Complex Problem Solving
- DrugMCTS: a drug repurposing framework combining multi-agent, RAG and Monte Carlo Tree Search
- Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
- Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code
- Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model
- CRISP: Complex Reasoning with Interpretable Step-based Plans
- Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving
- A Mathematical Theory of Discursive Networks
- On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks
- Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
- Adaptive Termination for Multi-round Parallel Reasoning: An Universal Semantic Entropy-Guided Framework
- Self-Consistency in Vision-Language Models for Precision Agriculture: Multi-Response Consensus for Crop Disease Management
- Enhancing Test-Time Scaling of Large Language Models with Hierarchical Retrieval-Augmented MCTS
- CoRE: Enhancing Metacognition with Label-free Self-evaluation in LRMs
- BlueLM-2.5-3B Technical Report
- Lost in Localization: Building RabakBench with Human-in-the-Loop Validation to Measure Multilingual Safety Gaps
- MARBLE: A Multi-Agent Rule-Based LLM Reasoning Engine for Accident Severity Prediction
- Activation Steering for Chain-of-Thought Compression
- XiYan-SQL: A Novel Multi-Generator Framework For Text-to-SQL
- Harnessing the Wisdom of LLM Crowds through Complementarity-Driven Iterative Collaboration
- On the Bias of Next-Token Predictors Toward Systematically Inefficient Reasoning: A Shortest-Path Case Study
- Context Tuning for In-Context Optimization
- Dissecting Clinical Reasoning in Language Models: A Comparative Study of Prompts and Model Adaptation Strategies
- Toward Better Generalisation in Uncertainty Estimators: Leveraging Data-Agnostic Features
- CortexDebate: Debating Sparsely and Equally for Multi-Agent Debate
- Prompt Engineering Guidelines for Using Large Language Models in Requirements Engineering
- Effects of structure on reasoning in instance-level Self-Discover
- Controlling Thinking Speed in Reasoning Models
- MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination
- StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason
- Multimodal Mathematical Reasoning with Diverse Solving Perspective
- On the Convergence of Large Language Model Optimizer for Black-Box Network Management
- Think How to Think: Mitigating Overthinking with Autonomous Difficulty Cognition in Large Reasoning Models
- DynamiCare: A Dynamic Multi-Agent Framework for Interactive and Open-Ended Medical Decision-Making
- MPF: Aligning and Debiasing Language Models post Deployment via Multi Perspective Fusion
- AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench
- Uncertainty-aware Reward Design Process
- Where Do Reasoning Models Refuse?
- Cautious Next Token Prediction
- ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning
- Reasoning on a Budget: A Survey of Adaptive and Controllable Test-Time Compute in LLMs
- High-Layer Attention Pruning with Rescaling
- Wired for Reuse: Automating Context-Aware Code Adaptation in IDEs via LLM-Based Agent
- Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames
- FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale
- Causal Prompting for Implicit Sentiment Analysis with Large Language Models
- iPanda: An LLM-based Agent for Automated Conformance Testing of Communication Protocols
- ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context
- Efficient Post-Training Refinement of Latent Reasoning in Large Language Models
- Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models
- Semantic-guided Diverse Decoding for Large Language Model
- What to Keep and What to Drop: Adaptive Table Filtering Framework
- Learning to Focus: Causal Attention Distillation via Gradient-Guided Token Pruning
- Format-Adapter: Improving Reasoning Capability of LLMs by Adapting Suitable Format
- CyberV: Cybernetics for Test-time Scaling in Video Understanding
- Boosting LLM's Molecular Structure Elucidation with Knowledge Enhanced Tree Search Reasoning
- Advanced Financial Reasoning at Scale: A Comprehensive Evaluation of Large Language Models on CFA Level III
- Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding
- ReasonBridge: Efficient Reasoning Transfer from Closed to Open-Source Language Models
- Selecting and Merging: Towards Adaptable and Scalable Named Entity Recognition with Large Language Models
- BEST-Route: Adaptive LLM Routing with Test-Time Optimal Compute
- OptScale: Probabilistic Optimality for Inference-time Scaling
- Looking Beyond Visible Cues: Implicit Video Question Answering via Dual-Clue Reasoning
- Lost at the Beginning of Reasoning
- AbstRaL: Augmenting LLMs' Reasoning by Reinforcing Abstract Thinking
- A Survey of LLM Inference Systems
- Active Inference AI Systems for Scientific Discovery
- Chain-of-Thought Enhanced Shallow Transformers for Wireless Symbol Detection
- STEP Planner: Constructing cross-hierarchical subgoal tree as an embodied long-horizon task planner
- KScope: A Framework for Characterizing the Knowledge Status of Language Models
- T3: Multi-level Tree-based Automatic Program Repair with Large Language Models
- LegalReasoner: Step-wised Verification-Correction for Legal Judgment Reasoning
- SEED: Enhancing Text-to-SQL Performance and Practical Usability Through Automatic Evidence Generation
- TableMoE: Neuro-Symbolic Routing for Structured Expert Reasoning in Multimodal Table Understanding
- Uncovering Hidden Violent Tendencies in LLMs: A Demographic Analysis via Behavioral Vignettes
- π-CoT: Prolog-Initialized Chain-of-Thought Prompting for Multi-Hop Question-Answering
- When Life Gives You Samples: The Benefits of Scaling up Inference Compute for Multilingual LLMs
- Ctrl-Z Sampling: Diffusion Sampling with Controlled Random Zigzag Explorations
- Enterprise Large Language Model Evaluation Benchmark
- A Modular Multitask Reasoning Framework Integrating Spatio-temporal Models and LLMs
- Inference Scaled GraphRAG: Improving Multi Hop Question Answering on Knowledge Graphs
- Temporalizing Confidence: Evaluation of Chain-of-Thought Reasoning with Signal Temporal Logic
- Commonsense Generation and Evaluation for Dialogue Systems using Large Language Models
- CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning
- ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation
- Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
- A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
- From Debate to Equilibrium: Belief-Driven Multi-Agent LLM Reasoning via Bayesian Nash Equilibrium
- RLPR: Extrapolating RLVR to General Domains without Verifiers
- Smart-LLaMA-DPO: Reinforced Large Language Model for Explainable Smart Contract Vulnerability Detection
- Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?
- FairCauseSyn: Towards Causally Fair LLM-Augmented Synthetic Data Generation
- MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
- Scatter-Based Innovation Propagation in Large Language Models for Multi-Stage Process Adaptation
- AnyMAC: Cascading Flexible Multi-Agent Collaboration via Next-Agent Prediction
- Semantic-Aware Parsing for Security Logs
- OmniReflect: Discovering Transferable Constitutions for LLM agents via Neuro-Symbolic Reflections
- Aha Moment Revisited: Are VLMs Truly Capable of Self Verification in Inference-time Scaling?
- Leveraging LLMs to Assess Tutor Moves in Real-Life Dialogues: A Feasibility Study
- When Can Model-Free Reinforcement Learning be Enough for Thinking?
- Towards Effective Complementary Security Analysis using Large Language Models
- Reward-Agnostic Prompt Optimization for Text-to-Image Diffusion Models
- Chiron-o1: Igniting Multimodal Large Language Models towards Generalizable Medical Reasoning via Mentor-Intern Collaborative Search
- Chain-of-Thought Prompting Obscures Hallucination Cues in Large Language Models: An Empirical Evaluation
- GeoGuess: Multimodal Reasoning based on Hierarchy of Visual Information in Street View
- Reranking-based Generation for Unbiased Perspective Summarization
- DynScaling: Efficient Verifier-free Inference Scaling via Dynamic and Integrated Sampling
- Representation Consistency for Accurate and Coherent LLM Answer Aggregation
- SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling
- HeurAgenix: Leveraging LLMs for Solving Complex Combinatorial Optimization Challenges
- From Passive to Active Reasoning: Can Large Language Models Ask the Right Questions under Incomplete Information?
- MoR: Better Handling Diverse Queries with a Mixture of Sparse, Dense, and Human Retrievers
- CC-LEARN: Cohort-based Consistency Learning
- Fractional Reasoning via Latent Steering Vectors Improves Inference Time Compute
- Exploring MLLMs Perception of Network Visualization Principles
- Doppelganger Method: Breaking Role Consistency in LLM Agent via Prompt-based Transferable Adversarial Attack
- MIST: Towards Multi-dimensional Implicit BiaS Evaluation of LLMs for Theory of Mind
- Casper: Inferring Diverse Intents for Assistive Teleoperation with Vision Language Models
- What Makes a Good Natural Language Prompt?
- VIDEE: Visual and Interactive Decomposition, Execution, and Evaluation of Text Analytics with Intelligent Agents
- Excessive Reasoning Attack on Reasoning LLMs
- An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability
- Evaluating and Improving Robustness in Large Language Models: A Survey and Future Directions
- A Practical Guide for Evaluating LLMs and LLM-Reliant Systems
- BOW: Training Language Models to Reason Over Plausible Next Words
- Querying Large Automotive Software Models: Agentic vs. Direct LLM Approaches
- Keeping Up with the Models: Online Deployment and Routing of LLMs at Scale
- Chain of Methodologies: Scaling Test Time Computation without Training
- Semantic-preserved Augmentation with Confidence-weighted Fine-tuning for Aspect Category Sentiment Analysis
- Strategic Scaling of Test-Time Compute: A Bandit Learning Approach
- DoTA-RAG: Dynamic of Thought Aggregation RAG
- Graph of Verification: Structured Verification of LLM Reasoning with Directed Acyclic Graphs
- Tiered Agentic Oversight: A Hierarchical Multi-Agent System for Healthcare Safety
- ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities
- Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models
- Efficient LLM Collaboration via Planning
- Tokenized Bandit for LLM Decoding and Alignment
- How Far Are We from Optimal Reasoning Efficiency?
- Training-free LLM Verification via Recycling Few-shot Examples
- From Emergence to Control: Probing and Modulating Self-Reflection in Language Models
- Med-PRM: Medical Reasoning Models with Stepwise, Guideline-verified Process Rewards
- Execution Guided Line-by-Line Code Generation
- Mind the Gap: Benchmarking LLM Uncertainty and Calibration with Specialty-Aware Clinical QA and Reasoning-Based Behavioural Features
- Neural at ArchEHR-QA 2025: Agentic Prompt Optimization for Evidence-Grounded Clinical Question Answering
- Specification and Evaluation of Multi-Agent LLM Systems -- Prototype and Cybersecurity Applications
- From Replication to Redesign: Exploring Pairwise Comparisons for LLM-Based Peer Review
- PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
- Textual Bayes: Quantifying Uncertainty in LLM-Based Systems
- Multiverse: Your Language Models Secretly Decide How to Parallelize and Merge Generation
- Causal Sufficiency and Necessity Improves Chain-of-Thought Reasoning
- Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models
- Reasoning Models Don't Always Say What They Think
- An Agentic Framework for Autonomous Metamaterial Modeling and Inverse Design
- Beyond Facts: Evaluating Intent Hallucination in Large Language Models
- Bridging External and Parametric Knowledge: Mitigating Hallucination of LLMs with Shared-Private Semantic Synergy in Dual-Stream Knowledge
- Scalable Chain of Thoughts via Elastic Reasoning
- SPRINT: Enabling Interleaved Planning and Parallelized Execution in Reasoning Models
- Token Signature: Predicting Chain-of-Thought Gains with Token Decoding Feature in Large Language Models
- Can Theoretical Physics Research Benefit from Language Agents?
- Saffron-1: Safety Inference Scaling
- Audio-Aware Large Language Models as Judges for Speaking Styles
- When to Trust Context: Self-Reflective Debates for Context Reliability
- Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
- DynamicMind: A Tri-Mode Thinking System for Large Language Models
- AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search
- From Bias To Improved Prompts: A Case Study of Bias Mitigation of Clone Detection Models
- Sample Complexity and Representation Ability of Test-time Scaling Paradigms
- Resisting Contextual Interference in RAG via Parametric-Knowledge Reinforcement
- Accelerated Test-Time Scaling with Model-Free Speculative Sampling
- Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection
- LLM-First Search: Self-Guided Exploration of the Solution Space
- Simulating LLM-to-LLM Tutoring for Multilingual Math Feedback
- Inference-Time Hyper-Scaling with KV Cache Compression
- Reason-to-Recommend: Using Interaction-of-Thought Reasoning to Enhance LLM Recommendation
- Kinetics: Rethinking Test-Time Scaling Laws
- Revisiting Test-Time Scaling: A Survey and a Diversity-Aware Method for Efficient Reasoning
- Search Arena: Analyzing Search-Augmented LLMs
- SPARTA ALIGNMENT: Collectively Aligning Multiple Language Models through Combat
- Conformal Prediction Beyond the Seen: A Missing Mass Perspective for Uncertainty Quantification in Generative Models
- SweRank: Software Issue Localization with Code Ranking
- Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs
- Structured Pruning for Diverse Best-of-N Reasoning Optimization
- Pre3: Enabling Deterministic Pushdown Automata for Faster Structured LLM Generation
- Nature's Insight: A Novel Framework and Comprehensive Analysis of Agentic Reasoning Through the Lens of Neuroscience
- Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers
- Beyond Theorem Proving: Formulation, Framework and Benchmark for Formal Problem-Solving
- ROSA: Addressing text understanding challenges in photographs via ROtated SAmpling
- Towards conversational assistants for health applications: using ChatGPT to generate conversations about heart failure
- Exchange of Perspective Prompting Enhances Reasoning in Large Language Models
- RoE-FND: A Case-Based Reasoning Approach with Dual Verification for Fake News Detection via LLMs
- CyclicReflex: Improving Reasoning Models via Cyclical Reflection Token Scheduling
- Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
- Reason from Future: Reverse Thought Chain Enhances LLM Reasoning
- EPiC: Towards Lossless Speedup for Reasoning Training through Edge-Preserving CoT Condensation
- RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates
- Prompt Candidates, then Distill: A Teacher-Student Framework for LLM-driven Data Annotation
- ScoreRAG: A Retrieval-Augmented Generation Framework with Consistency-Relevance Scoring and Structured Summarization for News Generation
- The Cost of Dynamic Reasoning: Demystifying AI Agents and Test-Time Scaling from an AI Infrastructure Perspective
- RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routing
- Verbalized Confidence Triggers Self-Verification: Emergent Behavior Without Explicit Reasoning Supervision
- CoT is Not True Reasoning, It Is Just a Tight Constraint to Imitate: A Theory Perspective
- ReSpace: Text-Driven 3D Indoor Scene Synthesis and Editing with Preference Alignment
- Exploring Explanations Improves the Robustness of In-Context Learning
- Adaptive Graph Pruning for Multi-Agent Communication
- Learning Together to Perform Better: Teaching Small-Scale LLMs to Collaborate via Preferential Rationale Tuning
- Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in LLM Reasoning
- Self-ensemble: Mitigating Confidence Mis-calibration for Large Language Models
- Incentivizing LLMs to Self-Verify Their Answers
- When LLMs Team Up: The Emergence of Collaborative Affective Computing
- Integration of Large Language Models and Traditional Deep Learning for Social Determinants of Health Prediction
- GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models
- The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning
- Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing
- Beyond In-Context Learning: Aligning Long-form Generation of Large Language Models via Task-Inherent Attribute Guidelines
- RewardBench 2: Advancing Reward Model Evaluation
- AdaRewriter: Unleashing the Power of Prompting-based Conversational Query Reformulation via Test-Time Adaptation
- Integrating Neural and Symbolic Components in a Model of Pragmatic Question-Answering
- Unified Game Moderation: Soft-Prompting and LLM-Assisted Label Transfer for Resource-Efficient Toxicity Detection
- SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
- Pi-SQL: Enhancing Text-to-SQL with Fine-Grained Guidance from Pivot Programming Languages
- GuessBench: Sensemaking Multimodal Creativity in the Wild
- KG-TRACES: Enhancing Large Language Models with Knowledge Graph-constrained Trajectory Reasoning and Attribution Supervision
- Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering
- ProtInvTree: Deliberate Protein Inverse Folding with Reward-guided Tree Search
- Position: Agent Should Invoke External Tools ONLY When Epistemically Necessary
- A Hashgraph-Inspired Consensus Mechanism for Reliable Multi-Model Reasoning
- TreeRare: Syntax Tree-Guided Retrieval and Reasoning for Knowledge-Intensive Question Answering
- MIRROR: Converging Cognitive Principles as Computational Mechanisms for AI Reasoning
- Efficient Latent Semantic Clustering for Scaling Test-Time Computation of LLMs
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively
- CausalAbstain: Enhancing Multilingual LLMs with Causal Reasoning for Trustworthy Abstention
- SHARE: An SLM-based Hierarchical Action CorREction Assistant for Text-to-SQL
- A Comprehensive Survey of Large AI Models for Future Communications: Foundations, Applications and Challenges
- RMoA: Optimizing Mixture-of-Agents through Diversity Maximization and Residual Compensation
- Towards Scalable Schema Mapping using Large Language Models
- Unifying Language Agent Algorithms with Graph-based Orchestration Engine for Reproducible Agent Research
- Semi-structured LLM Reasoners Can Be Rigorously Audited
- Benchmarking Foundation Models for Zero-Shot Biometric Tasks
- Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability
- AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time
- Beyond Exponential Decay: Rethinking Error Accumulation in Large Language Models
- SiLVR: A Simple Language-based Video Reasoning Framework
- Every Rollout Counts: Optimal Resource Allocation for Efficient Test-Time Scaling
- Knowledge Augmented Complex Problem Solving with Large Language Models: A Survey
- An Adversary-Resistant Multi-Agent LLM System via Credibility Scoring
- Soft Reasoning: Navigating Solution Spaces in Large Language Models through Controlled Embedding Exploration
- MSQA: Benchmarking LLMs on Graduate-Level Materials Science Reasoning and Knowledge
- Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought
- Fortune: Formula-Driven Reinforcement Learning for Symbolic Table Reasoning in Language Models
- Probability-Consistent Preference Optimization for Enhanced LLM Reasoning
- X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains
- LLM-based HSE Compliance Assessment: Benchmark, Performance, and Advancements
- TailorSQL: An NL2SQL System Tailored to Your Query Workload
- EndoBench: A Comprehensive Evaluation of Multi-Modal Large Language Models for Endoscopy Analysis
- Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
- Threading the Needle: Reweaving Chain-of-Thought Reasoning to Explain Human Label Variation
- Continuous Chain of Thought Enables Parallel Exploration and Reasoning
- Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness
- Can LLMs Reason Structurally? Benchmarking via the Lens of Data Structures
- MermaidFlow: Redefining Agentic Workflow Generation via Safety-Constrained Evolutionary Programming
- ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark
- Scaling Reasoning without Attention
- Chain-of-Thought for Large Language Model-empowered Wireless Communications
- Visual Large Language Models Exhibit Human-Level Cognitive Flexibility in the Wisconsin Card Sorting Test
- Decomposing Elements of Problem Solving: What "Math" Does RL Teach?
- What Makes a Good Reasoning Chain? Uncovering Structural Patterns in Long Chain-of-Thought Reasoning
- Resolving Knowledge Conflicts in Domain-specific Data Selection: A Case Study on Medical Instruction-tuning
- Scaling Offline RL via Efficient and Expressive Shortcut Models
- RISE: Reasoning Enhancement via Iterative Self-Exploration in Multi-hop Question Answering
- Rethinking the Unsolvable: When In-Context Search Meets Test-Time Scaling
- On Learning Verifiers and Implications to Chain-of-Thought Reasoning
- ClaimPKG: Enhancing Claim Verification via Pseudo-Subgraph Generation with Lightweight Specialized LLM
- Knowledge Base Construction for Knowledge-Augmented Text-to-SQL
- Do We Know What LLMs Don't Know? A Study of Consistency in Knowledge Probing
- Leveraging Large Language Models for Bengali Math Word Problem Solving with Chain of Thought Reasoning
- Who Reasons in the Large Language Models?
- Step-Wise Formal Verification for LLM-Based Mathematical Problem Solving
- Building trustworthy NeuroSymbolic AI Systems: Consistency, reliability, explainability, and safety
- Pretraining Language Models to Ponder in Continuous Space
- Long Context Scaling: Divide and Conquer via Multi-Agent Question-driven Collaboration
- Calibrating LLMs for Text-to-SQL Parsing by Leveraging Sub-clause Frequencies
- Divide-Then-Align: Honest Alignment based on the Knowledge Boundary of RAG
- Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling
- Reason-Align-Respond: Aligning LLM Reasoning with Knowledge Graphs for KGQA
- Policy Induction: Predicting Startup Success via Explainable Memory-Augmented In-Context Learning
- Can Past Experience Accelerate LLM Reasoning?
- FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
- VeriTrail: Closed-Domain Hallucination Detection with Traceability
- Let Me Think! A Long Chain-of-Thought Can Be Worth Exponentially Many Short Ones
- MIRROR: Multi-agent Intra- and Inter-Reflection for Optimized Reasoning in Tool Learning
- Can Large Reasoning Models Self-Train?
- Don't Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models
- Estimating LLM Consistency: A User Baseline vs Surrogate Metrics
- Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects
- Temporal Sampling for Forgotten Reasoning in LLMs
- Program of Equations Thoughts to Solve Algebra Word Problems
- Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision
- Faster and Better LLMs via Latency-Aware Test-Time Scaling
- Training-Free Multi-Step Audio Source Separation
- Self-Reflective Planning with Knowledge Graphs: Enhancing LLM Reasoning Reliability for Question Answering
- An Empirical Study on Strong-Weak Model Collaboration for Repo-level Code Generation
- S2LPP: Small-to-Large Prompt Prediction across LLMs
- Recursive Decomposition with Dependencies for Generic Divide-and-Conquer Reasoning
- Can Compressed LLMs Truly Act? An Empirical Evaluation of Agentic Capabilities in LLM Compression
- Sailing by the Stars: A Survey on Reward Models and Learning Strategies for Learning from Rewards
- Invoke Interfaces Only When Needed: Adaptive Invocation for Large Language Models in Question Answering
- Improving Model Alignment Through Collective Intelligence of Open-Source LLMS
- Route to Reason: Adaptive Routing for LLM and Reasoning Strategy Selection
- The Avengers: A Simple Recipe for Uniting Smaller Language Models to Challenge Proprietary Giants
- Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
- Minimalist Softmax Attention Provably Learns Constrained Boolean Functions
- DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
- To CoT or To Loop? A Formal Comparison Between Chain-of-Thought and Looped Transformers
- From Course to Skill: Evaluating LLM Performance in Curricular Analytics
- MOOSE-Chem2: Exploring LLM Limits in Fine-Grained Scientific Hypothesis Discovery via Hierarchical Search
- LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling
- Self-Critique Guided Iterative Reasoning for Multi-hop Question Answering
- Do Large Language Models (Really) Need Statistical Foundations?
- Optimal Transport-Based Token Weighting scheme for Enhanced Preference Optimization
- Knowledge Retrieval in LLM Gaming: A Shift from Entity-Centric to Goal-Oriented Graphs
- Flex-Judge: Text-Only Reasoning Unleashes Zero-Shot Multimodal Evaluators
- B-score: Detecting biases in large language models using response history
- The Quest for Efficient Reasoning: A Data-Centric Benchmark to CoT Distillation
- How Is LLM Reasoning Distracted by Irrelevant Context? An Analysis Using a Controlled Benchmark
- metaTextGrad: Automatically optimizing language model optimizers
- CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos
- Efficient Long CoT Reasoning in Small Language Models
- Thought calibration: Efficient and confident test-time scaling
- TAGS: A Test-Time Generalist-Specialist Framework with Retrieval-Augmented Reasoning and Verification
- UNJOIN: Enhancing Multi-Table Text-to-SQL Generation via Schema Simplification
- Reward Model Generalization for Compute-Aware Test-Time Reasoning
- Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias
- VeriThinker: Learning to Verify Makes Reasoning Model Efficient
- ComfyMind: Toward General-Purpose Generation via Tree-Based Planning and Reactive Feedback
- Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
- Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning
- Does the Competitive Component of Adversarial Self-Play Improve Legal Reasoning? A Controlled Negative Result
- Fast Quiet-STaR: Thinking Without Thought Tokens
- Activation Control for Efficiently Eliciting Long Chain-of-thought Ability of Language Models
- Towards Dynamic Theory of Mind: Evaluating LLM Adaptation to Temporal Evolution of Human States
- Distilling LLM Agent into Small Models with Retrieval and Code Tools
- Reasoning Meets Personalization: Unleashing the Potential of Large Reasoning Model for Personalized Generation
- SLearnLLM: A Self-Learning Framework for Efficient Domain-Specific Adaptation of Large Language Models
- Self-Training Large Language Models with Confident Reasoning
- LeTS: Learning to Think-and-Search via Process-and-Outcome Reward Hybridization
- Misaligning Reasoning with Answers -- A Framework for Assessing LLM CoT Robustness
- Value-Guided Search for Efficient Chain-of-Thought Reasoning
- Navigate the Unknown: Enhancing LLM Reasoning with Intrinsic Motivation Guided Exploration
- Too Consistent to Detect: A Study of Self-Consistent Errors in LLMs
- Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards
- Beyond Demonstrations: Dynamic Vector Construction from Latent Representations
- RaDeR: Reasoning-aware Dense Retrieval Models
- DEL-ToM: Inference-Time Scaling for Theory-of-Mind Reasoning via Dynamic Epistemic Logic
- Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT Reasoning
- ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models
- Optimal Policy Minimum Bayesian Risk
- ARB: A Comprehensive Arabic Multimodal Reasoning Benchmark
- Incremental Sequence Classification with Temporal Consistency
- Advancing the Scientific Method with Large Language Models: From Hypothesis to Discovery
- AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners
- Don't "Overthink" Passage Reranking: Is Reasoning Truly Necessary?
- SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development
- KTAE: A Model-Free Algorithm to Key-Tokens Advantage Estimation in Mathematical Reasoning
- O2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering
- Grounding Chest X-Ray Visual Question Answering with Generated Radiology Reports
- Plan and Budget: Effective and Efficient Test-Time Scaling on Reasoning Large Language Models
- Veracity Bias and Beyond: Uncovering LLMs' Hidden Beliefs in Problem-Solving Reasoning
- Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO
- VLM-R3: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
- Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
- Logic-of-Thought: Empowering Large Language Models with Logic Programs for Solving Puzzles in Natural Language
- Collaboration among Multiple Large Language Models for Medical Question Answering
- MASLab: A Unified and Comprehensive Codebase for LLM-based Multi-Agent Systems
- Conformal Language Model Reasoning with Coherent Factuality
- Swarm Intelligence Enhanced Reasoning: A Density-Driven Framework for LLM-Based Multi-Agent Optimization
- DISCO Balances the Scales: Adaptive Domain- and Difficulty-Aware Reinforcement Learning on Imbalanced Data
- Towards Explainable Temporal Reasoning in Large Language Models: A Structure-Aware Generative Framework
- NL-Debugging: Exploiting Natural Language as an Intermediate Representation for Code Debugging
- Learning to Rank Chain-of-Thought: Using a Small Model
- Learning to Reason via Mixture-of-Thought for Logical Reasoning
- Advancing LLM Safe Alignment with Safety Representation Ranking
- ThinkLess: A Training-Free Inference-Efficient Method for Reducing Reasoning Redundancy
- Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space
- LLM-Explorer: A Plug-in Reinforcement Learning Policy Exploration Enhancement Driven by Large Language Models
- GRIT: Teaching MLLMs to Think with Images
- VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
- MAS-ZERO: Designing Multi-Agent Systems with Zero Supervision
- EcomScriptBench: A Multi-task Benchmark for E-commerce Script Planning via Step-wise Intention-Driven Product Association
- Small Language Models in the Real World: Insights from Industrial Text Classification
- KaFT: Knowledge-aware Fine-tuning for Boosting LLMs' Domain-specific Question-Answering Performance
- FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering
- The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning
- Incorporating Token Usage into Prompting Strategy Evaluation
- Prolonged Reasoning Is Not All You Need: Certainty-Based Adaptive Routing for Efficient LLM/MLLM Reasoning
- Toward Reliable Scientific Hypothesis Generation: Evaluating Truthfulness and Hallucination in Large Language Models
- PRL: Prompts from Reinforcement Learning
- RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning
- Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging
- Beyond Chains: Bridging Large Language Models and Knowledge Bases in Complex Question Answering
- Structured Agent Distillation for Large Language Model
- InfiGFusion: Graph-on-Logits Distillation via Efficient Gromov-Wasserstein for Model Fusion
- Self-Reasoning Language Models: Unfold Hidden Reasoning Chains with Few Reasoning Catalyst
- The Energy Cost of Reasoning: Analyzing Energy Usage in LLMs with Test-time Compute
- SHARP: Synthesizing High-quality Aligned Reasoning Problems for Large Reasoning Models Reinforcement Learning
- AUTOLAW: Enhancing Legal Compliance in Large Language Models via Case Law Generation and Jury-Inspired Deliberation
- Are Large Language Models Good at Detecting Propaganda?
- A*-Decoding: Token-Efficient Inference Scaling
- MAFA: A multi-agent framework for annotation
- J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
- Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space
- RBF++: Quantifying and Optimizing Reasoning Boundaries across Measurable and Unmeasurable Capabilities for Chain-of-Thought Reasoning
- Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning
- Are LLMs Better Formalizers than Solvers on Complex Problems?
- VocalAgent: Large Language Models for Vocal Health Diagnostics with Safety-Aware Evaluation
- Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs
- Prompt Stability Matters: Evaluating and Optimizing Auto-Generated Prompt in General-Purpose Systems
- CoIn: Counting the Invisible Reasoning Tokens in Commercial Opaque LLM APIs
- Guided Search Strategies in Non-Serializable Environments with Applications to Software Engineering Agents
- Fractured Chain-of-Thought Reasoning
- Incentivizing Truthful Language Models via Peer Elicitation Games
- MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
- On the Thinking-Language Modeling Gap in Large Language Models
- Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
- MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
- Accelerating Adaptive Retrieval Augmented Generation via Instruction-Driven Representation Reduction of Retrieval Overlaps
- Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately
- Language Model Networks: Supervision-Efficient Learning through Dense Communication
- Batched Self-Consistency Improves LLM Relevance Assessment and Ranking
- BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
- SLOT: Sample-specific Language Model Optimization at Test-time
- Enhancing Large Language Models with Reward-guided Tree Search for Knowledge Graph Question and Answering
- Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning
- SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization
- Solve-Detect-Verify: Inference-Time Scaling with Flexible Generative Verifier
- Latent Veracity Inference for Identifying Errors in Stepwise Reasoning
- Retrospex: Language Agent Meets Offline Reinforcement Learning Critic
- LAMP: Extracting Locally Linear Decision Surfaces from LLM World Models
- AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning
- HALO: Hierarchical Autonomous Logic-Oriented Orchestration for Multi-Agent LLM Systems
- Cognitive Demand Steering for Adaptive Meta-Reasoning in Large Language Models
- Gaokerena: A Small Persian Medical Language Model Family
- LifelongAgentBench: Evaluating LLM Agents as Lifelong Learners
- On the Eligibility of LLMs for Counterfactual Reasoning: A Decompositional Study
- AdaBoN: Adaptive Best-of-N Alignment
- TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning
- Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO
- Quantization Meets Reasoning: Exploring and Mitigating Degradation of Low-Bit LLMs in Mathematical Reasoning
- Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations
- HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
- ZeroTuning: Unlocking the Initial Token's Power to Enhance Large Language Models Without Training
- Group Think: Multiple Concurrent Reasoning Agents Collaborating at Token Level Granularity
- SoftCoT++: Test-Time Scaling with Soft Chain-of-Thought Reasoning
- Rethinking Optimal Verification Granularity for Compute-Efficient Test-Time Scaling
- Dist2ill: Distributional Distillation for One-Pass Uncertainty Estimation in Large Language Models
- Ranked Voting based Self-Consistency of Large Language Models
- Cochain: Balancing Insufficient and Excessive Collaboration in LLM Agent Workflows
- The CoT Encyclopedia: Analyzing, Predicting, and Controlling how a Reasoning Model will Think
- Pre-Act: Multi-Step Planning and Reasoning Improves Acting in LLM Agents
- Parallel Scaling Law for Language Models
- Demystifying AI Agents: The Final Generation of Intelligence
- Mining Hidden Thoughts from Texts: Evaluating Continual Pretraining with Synthetic Data for LLM Reasoning
- TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation
- CurveShift: Is Agent Progress Scalar? Separating Level from Shape
- J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning
- Atomic Consistency Preference Optimization for Long-Form Question Answering
- CEC-Zero: Chinese Error Correction Solution Based on LLM
- Automated Meta Prompt Engineering for Alignment with the Theory of Mind
- Verifier-Induced Support Reshaping in On-Policy Optimization
- NurValues: Real-World Nursing Values Evaluation for Large Language Models in Clinical Context
- Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance
- Agent-as-a-Service based on Agent Network
- TUMS: Enhancing Tool-use Abilities of LLMs with Multi-structure Handlers
- Uncertainty-Aware Simulation-Based Inference for Operations Research with Large Language Models
- Entropy-Gated Latent Recursion
- CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts
- DSADF: Thinking Fast and Slow for Decision Making
- Improving the Reliability of LLMs: Combining CoT, RAG, Self-Consistency, and Self-Verification
- Memory Reward Inflation in Self-Improving LLM Agents
- FitText: Evolving Agent Tool Ecologies via Memetic Retrieval
- SAMChat: Introducing Chain of Thought Reasoning and GRPO to a Multimodal Small Language Model for Small Scale Remote Sensing
- ToolACE-DEV: Self-Improving Tool Learning via Decomposition and EVolution
- Learning from Peers in Reasoning Models
- RedTeamLLM: an Agentic AI framework for offensive security
- Applying Cognitive Design Patterns to General LLM Agents
- HyperGuide: Hyperbolic Guidance for Efficient Multi-Step Reasoning in Large Language Models
- VISTA: Generative Visual Imagination for Vision-and-Language Navigation
- Learn to Think: Bootstrapping LLM Reasoning Capability Through Graph Representation Learning
- When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling
- Empowering Scientific Workflows with Federated Agents
- Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images
- On the Wings of Imagination: Conflicting Script-based Multi-role Framework for Humor Caption Generation
- SoK: DARPA's AI Cyber Challenge (AIxCC): Competition Design, Architectures, and Lessons Learned
- Large Language Models as Automatic Annotators and Annotation Adjudicators for Fine-Grained Opinion Analysis
- CORE: Collaborative Reasoning via Cross Teaching
- When Silence Is Golden: Can LLMs Learn to Abstain in Temporal QA and Beyond?
- Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning
- Multi-agents based User Values Mining for Recommendation
- Understanding LLM Scientific Reasoning through Promptings and Model's Explanation on the Answers
- Enhancing tutoring systems by leveraging tailored promptings and domain knowledge with Large Language Models
- From PDF to RAG-Ready: Evaluating Document Conversion Frameworks for Domain-Specific Question Answering
- Aligning Large Language Models with Healthcare Stakeholders: A Pathway to Trustworthy AI Integration
- Always Tell Me The Odds: Fine-grained Conditional Probability Estimation
- Visual Test-time Scaling for GUI Agent Grounding
- DeepCritic: Deliberate Critique with Large Language Models
- RASPRef: Retrieval-Augmented Self-Supervised Prompt Refinement for Large Reasoning Models
- AIRA2: Overcoming Bottlenecks in AI Research Agents
- R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning
- Confident and Wrong: Silent Semantic Failures in Coding Agents
- Learning From Developers: Towards Reliable Patch Validation at Scale for Linux
- Self-Evolving Multi-Agent Framework for Efficient Decision Making in Real-Time Strategy Scenarios
- Brain-Inspired Graph Multi-Agent Systems for LLM Reasoning
- Reasoning Models Struggle to Control their Chains of Thought
- Cognitive Agency Surrender: Defending Epistemic Sovereignty via Scaffolded AI Friction
- Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution
- The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
- CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction
- Top-b: Entropic Regulation of Relative Probability Bands in Autoregressive Language Processes
- Semantic Invariance in Agentic AI
- Enabling Cloud-Level Accuracy in Edge AI through IoT Data Preprocessing
- GRPO Does Not Close the Multi-Agent Coordination Gap
- Multi-Stream Perturbation Attack: Breaking Safety Alignment of Thinking LLMs Through Concurrent Task Interference
- Consistency in Language Models: Current Landscape, Challenges, and Future Directions
- Toward Epistemic Stability: Engineering Consistent Procedures for Industrial LLM Hallucination Reduction
- Latent Reasoning with Normalizing Flows
- How Small Can 6G Reason? Scaling Tiny-to-Small Language Models for AI-Native Networks
- Pencil Puzzle Bench: A Benchmark for Multi-Step Verifiable Reasoning
- LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models
- ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference
- On the generalization of language models from in-context learning and finetuning: a controlled study
- Perfect score on IPhO 2025 theory by Gemini agent
- ParamMem: Augmenting Language Agents with Parametric Reflective Memory
- AVA: Towards Agentic Video Analytics with Vision Language Models
- SmallPlan: Leverage Small Language Models for Sequential Path Planning with Simulation-Powered, LLM-Guided Distillation
- AdaptMI: Adaptive Skill-based In-context Math Instruction for Small Language Models
- Prompt Architecture Determines Reasoning Quality: A Variable Isolation Study on the Car Wash Problem
- Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs
- Power and Limitations of Aggregation in Compound AI Systems
- Benchmark Test-Time Scaling of General LLM Agents
- Training Large Reasoning Models Efficiently via Progressive Thought Encoding
- Evolutionary Context Search for Automated Skill Acquisition
- Underspecification does not imply Incoherence: The Risks of Semantic Collapse in Coding Models
- Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks
- Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher
- Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens
- ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling
- Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework
- Training-Free Looped Transformers
- Using Large Language Models in Physics Education
- LLMs Encode Their Failures: Predicting Success from Pre-Generation Activations
- The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?
- Does the Prompt-based Large Language Model Recognize Students' Demographics and Introduce Bias in Essay Scoring?
- ShorterBetter: Guiding Reasoning Models to Find Optimal Inference Length for Efficient Reasoning
- Manifold-Guided Attention Steering
- When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
- When Reasoning Beats Scale: A 1.5B Reasoning Model Outranks 13B LLMs as Discriminator
- Calibrating Uncertainty Quantification of Multi-Modal LLMs using Grounding
- Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models
- TClone: Low-Latency Forking of Live GUI Environments for Computer-Use Agents
- Agentic Test-Time Scaling for WebAgents
- The Last Word Often Wins: A Format Confound in Chain-of-Thought Corruption Studies
- LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling
- Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key
- Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games
- Safety and accuracy follow different scaling laws in clinical large language models
- RAG over Thinking Traces Can Improve Reasoning Tasks
- When Less is Enough: Efficient Inference via Collaborative Reasoning
- Trace-of-Thought Prompting: Investigating Prompt-Based Knowledge Distillation Through Question Decomposition
- Computational Reasoning of Large Language Models
- Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
- Beyond the Last Answer: Your Reasoning Trace Uncovers More than You Think
- Accurate and Diverse LLM Mathematical Reasoning via Automated PRM-Guided GFlowNets
- BRIDGE: Benchmarking Large Language Models for Understanding Real-world Clinical Practice Text
- When are likely answers right? On Sequence Probability and Correctness in LLMs
- PaperClaw: Harnessing Agents for Autonomous Research and Human-in-the-Loop Refinement
- OpenSkill: Open-World Self-Evolution for LLM Agents
- Thinking as Compression: Your Reasoning Model is Secretly a Context Compressor
- Vector Policy Optimization: Training for Diversity Improves Test-Time Search
- Scale-Dependent Collective Adaptation in Self-Amending LLM Societies: A Cross-Family Study of Emergent Governance
- BioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research Agents
- Distributional Alignment Games for Answer-Level Fine-Tuning
- Self-Consistency for LLM-Based Motion Trajectory Generation and Verification
- SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs
- Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
- Maximum Likelihood Reinforcement Learning
- Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains
- From Evidence to Belief: A Bayesian Epistemology Approach to Language Models
- Uncertainty Quantification for Language Models: A Suite of Black-Box, White-Box, LLM Judge, and Ensemble Scorers
- Unsupervised Confidence Calibration for Reasoning LLMs from a Single Generation
- AndroidGen: Building an Android Language Agent under Data Scarcity
- SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
- Detect, Explain, Escalate: Sustainable Dialogue Breakdown Management for LLM Agents
- Comparing Uncertainty Measurement and Mitigation Methods for Large Language Models: A Systematic Review
- AI Achieves a Perfect LSAT Score
- The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models
- Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory
- Evaluating ChatGPT on Medical Information Extraction Tasks: Performance, Explainability and Beyond
- UniCog: Uncovering Cognitive Abilities of LLMs through Latent Mind Space Analysis
- Scaling Laws for Moral Machine Judgment in Large Language Models
- Reasoning Models Will Sometimes Lie About Their Reasoning
- PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning
- Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory
- ROAD: Reflective Optimization via Automated Debugging for Zero-Shot Agent Alignment
- Complexity Agnostic Recursive Decomposition of Thoughts
- Improving Language Model Personas via Rationalization with Psychological Scaffolds
- Towards Adaptive Software Agents for Debugging
- AI Awareness
- Sparks of Tabular Reasoning via Text2SQL Reinforcement Learning
- Agreement Before Diversity: Verification-First Complementarity for Heterogeneous Language-Model Coordination
- When Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMs
- Self-Adaptive Cognitive Debiasing for Large Language Models in Decision-Making
- T1: Tool-integrated Verification for Test-time Compute Scaling in Small Language Models
- Rethinking Reflection in Pre-Training
- Debate Only When Necessary: Adaptive Multiagent Collaboration for Efficient LLM Reasoning
- Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study
- SplitReason: Learning To Offload Reasoning
- GreenMind: A Next-Generation Vietnamese Large Language Model for Structured and Logical Reasoning
- AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset
- Process Reward Models That Think
- Monte Carlo Planning with Large Language Model for Text-Based Game Agents
- Lightweight Latent Verifiers for Efficient Meta-Generation Strategies
- Building LLM Agents by Incorporating Insights from Computer Systems
- ConformalNL2LTL: Translating Natural Language Instructions into Temporal Logic Formulas with Conformal Correctness Guarantees
- LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities
- TTRL: Test-Time Reinforcement Learning
- PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models
- Honey, I Shrunk the Language Model: Impact of Knowledge Distillation Methods on Performance and Explainability
- LLM-based Semantic Augmentation for Harmful Content Detection
- BELL: Benchmarking the Explainability of Large Language Models
- Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs
- Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
- Jailbreak Detection in Clinical Training LLMs Using Feature-Based Predictive Models
- DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual Understanding
- Transparentize the Internal and External Knowledge Utilization in LLMs with Trustworthy Citation
- TVR: Automotive System Requirement Traceability Validation and Recovery Through Retrieval-Augmented Generation
- Learning Adaptive Parallel Reasoning with Language Models
- CHAINSFORMER: Numerical Reasoning on Knowledge Graphs from a Chain Perspective
- A Knowledge-Informed Deep Learning Paradigm for Generalizable and Stability-Optimized Car-Following Models
- Self-Correction Makes LLMs Better Parsers
- Rethinking Inference-Time Scaling: Efficiency Limits and Linguistic Signals
- Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning
- Harnessing Generative AI to Facilitate Epistemic Understanding of Students in Scientific Inquiry
- Cost-of-Pass: An Economic Framework for Evaluating Language Models
- Pandora: A Code-Driven Large Language Model Agent for Unified Reasoning Across Diverse Structured Knowledge
- Sparks of Science: Hypothesis Generation Using Structured Paper Data
- InstructRAG: Leveraging Retrieval-Augmented Generation on Instruction Graphs for LLM-Based Task Planning
- Are Retrials All You Need? Enhancing Large Language Model Reasoning Without Verbalized Feedback
- Clarifying Ambiguities: on the Role of Ambiguity Types in Prompting Methods for Clarification Generation
- Could Thinking Multilingually Empower LLM Reasoning?
- Trusting CHATGPT: how minor tweaks in the prompts lead to major differences in sentiment classification
- WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
- Foundation Models for Environmental Science: A Survey of Emerging Frontiers
- A Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM Systems
- When Does Consensus Mean Correctness? Measuring the Agreement-Accuracy Coupling with Semantics-Preserving Re-Rendering
- Consistency Has a Computable Blind Spot: A Commutation Theory of Label-Free Reliability for Vision-Language Figure Reading
- SCP-NL2TL: Selective Conformal Prediction with Semantic Verification for Natural Language to Temporal Logic Specifications
- PPDL: LLM-Based Flows as Probabilistic Programs
- Position: It's Time to Optimize LLMs for Self-Consistency
- Adaptive Elicitation of Latent Information Using Natural Language
- Simulator-Grounded Large Language Models for Industrial Causal Reasoning: Tool-Use, Structured Injection, and Plant-Portable Retrieval for Wastewater Treatment Decision Support
- Mean-Field Dynamics of Chain-of-Thought Reasoning in Large Language Models
- LELA: an LLM-based Entity Linking Approach with Zero-Shot Domain Adaptation
- Efficient Reasoning Models: A Survey
- Learning to Be A Doctor: Searching for Effective Medical Agent Architectures
- Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR
- ARise: Towards Knowledge-Augmented Reasoning via Risk-Adaptive Search
- Offline Learning and Forgetting for Reasoning with Large Language Models
- EMAFusion: A Self-Optimizing System for Seamless LLM Selection and Integration
- Reasoning Court: Combining Reasoning, Action, and Judgment for Multi-Hop Reasoning
- Executable Functional Abstractions: Inferring Generative Programs for Advanced Math Problems
- Weight Ensembling Improves Reasoning in Language Models
- xVerify: Efficient Answer Verifier for Reasoning Model Evaluations
- Mixture-of-RAG: Integrating Text and Tables with Large Language Models
- Enhancing Mathematical Reasoning in Large Language Models with Self-Consistency-Based Hallucination Detection
- Syzygy of Thoughts: Improving LLM CoT with the Minimal Free Resolution
- Towards Stepwise Domain Knowledge-Driven Reasoning Optimization and Reflection Improvement
- Fast-Slow-Thinking: Complex Task Solving with Large Language Models
- Should you use LLMs to simulate opinions? Quality checks for early-stage deliberation
- A Survey of Reasoning with Foundation Models: Concepts, Methodologies, and Outlook
- Dynamic Cheatsheet: Test-Time Learning with Adaptive Memory
- Redefining Machine Translation on Social Network Services with Large Language Models
- Dual Engines of Thoughts: A Depth-Breadth Integration Framework for Open-Ended Analysis
- Exploring Human-Like Thinking in Search Simulations with Large Language Models
- Using LLMs for Analyzing AIS Data
- Supervised Optimism Correction: Be Confident When LLMs Are Sure
- SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
- Zero-Shot Image-Based Large Language Model Approach to Road Pavement Monitoring
- ThoughtProbe: Classifier-Guided Thought Space Exploration Leveraging LLM Intrinsic Reasoning
- Self-Steering Language Models
- ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs
- Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
- A Desideratum for Conversational Agents: Capabilities, Challenges, and Future Directions
- Learning to Reason Over Time: Timeline Self-Reflection for Improved Temporal Reasoning in Language Models
- AI for Climate Finance: Agentic Retrieval and Multi-Step Reasoning for Early Warning System Investments
- Weak-for-Strong: Training Weak Meta-Agent to Harness Strong Executors
- Beyond the Next Token: Towards Prompt-Robust Zero-Shot Classification via Efficient Multi-Token Prediction
- Do LLM Evaluators Prefer Themselves for a Reason?
- Sample, Don't Search: Rethinking Test-Time Alignment for Language Models
- Bonsai: Interpretable Tree-Adaptive Grounded Reasoning
- Have Large Language Models Learned to Reason? A Characterization via 3-SAT Phase Transition
- Efficient Dynamic Clustering-Based Document Compression for Retrieval-Augmented-Generation
- LLM for Complex Reasoning Task: An Exploratory Study in Fermi Problems
- Reasoning Under 1 Billion: Memory-Augmented Reinforcement Learning for Large Language Models
Discussions
- Boost reasoning accuracy with #Self-Consistency! 🚀 By #sampling diverse #reasoning paths via #CoT, #LLMs identify answers with the highest agreement, hence avoiding pitfalls of greedy strategy of CoT [bsky, 2 points, 0 comments]
- Ja, es ist in der Wissenschaft eine gängige Methode. Bei Mathematik & Logik-Themen führt es zu höherer Präzision. Allerdings geht man da inzwischen schon zu Self-Consistency über, da es zu noch präzis [bsky, 1 points, 1 comments]
- Bueno, es una idea que no es nueva, se trata de aplicar Self-Consistency a la respuesta del LLM, solo q ahora la respuesta es un tocho de informe. arxiv.org/abs/2203.11171 [bsky, 1 points, 0 comments]
- What is self-consistency ? https://arxiv.org/abs/2203.11171
This technique combines Chain-Of-Thought (CoT) prompting + a clever decoding technique with impressive results. The trick is to generate mul [bsky, 0 points, 1 comments]
Related