Training Verifiers to Solve Math Word Problems
2021/10/27 by Karl Cobbe, Vineet Kosaraju, Cobbe, Karl +21 · 2 voices · 2,858 citations
Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling #cs.CL #cs.LG
paper · pdf · doi:10.48550/arxiv.2110.14168
openalex publication_date 2021/10/27 · arxiv published 2021/10/27 · arxiv created 2021/11/18 · arxiv updated 2021/11/19 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
State-of-the-art language models can match human performance on many tasks, but they still struggle to robustly perform multi-step mathematical reasoning. To diagnose the failures of current models and support research, we introduce GSM8K, a dataset of 8.5K high quality linguistically diverse grade school math word problems. We find that even the largest transformer models fail to achieve high test performance, despite the conceptual simplicity of this problem distribution. To increase performance, we propose training verifiers to judge the correctness of model completions. At test time, we generate many candidate solutions and select the one ranked highest by the verifier. We demonstrate that verification significantly improves performance on GSM8K, and we provide strong empirical evidence that verification scales more effectively with increased data than a finetuning baseline.
Citations
Cited by
- Towards Bridging the Reward-Generation Gap in Direct Alignment Algorithms
- UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective
- Coupling Experts and Routers in Mixture-of-Experts via an Auxiliary Loss
- Same or Not? Enhancing Visual Perception in Vision-Language Models
- Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance
- Entropy-Guided Token Dropout: Training Autoregressive Language Models with Limited Domain Data
- The Reward Model Selection Crisis in Personalized Alignment
- Diversity or Precision? A Deep Dive into Next Token Prediction
- LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws
- BenCSSmark: Making the Social Sciences Count in LLM Research
- WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference
- When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs
- Learning When Not to Attend Globally
- AFA-LoRA: Enabling Non-Linear Adaptations in LoRA with Activation Function Annealing
- Efficient Multi-Model Orchestration for Self-Hosted Large Language Models
- LLMBoost: Make Large Language Models Stronger with Boosting
- Shape of Thought: When Distribution Matters More than Correctness in Reasoning Tasks
- DiRL: An Efficient Post-Training Framework for Diffusion Language Models
- State-dependent error correlations shape voting thresholds in committees of AI agents
- ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning
- DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention
- Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion
- Attention Residuals
- ATLAS: Automated Approximation of Transformers for Efficient Homomorphic Inference in One Hour
- Selecting Language Models for Social Science: Start Small, Start Open, and Validate
- DualityCert: Verifier-Gated Language-Model Repair of Broken Duality Claims in Quantum Field Theory
- The JEPA Paradox in Language: The Geometry of Linguistic Alternatives
- Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam
- Training Language Models to Cooperate with Inference-Time Controllers
- From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
- The Intruder Threshold: A Spectral Law for LoRA Fine-Tuning
- Rethinking the Generation Order of Block Diffusion Language Models
- From Data to Device: ELMOD An Efficient German-First 2.7B Language Model for Mobile Inference
- SymStep: Symbolic Step Verification for Logical Reasoning
- ADAGE: A Language-Agnostic Pipeline for Analogical Reasoning Evaluation
- Bridging Compute- and Data-Optimal Pretraining
- Retraction-Free Optimization over the Stiefel Manifold for the LoRA Fine-Tuning
- Toward an Organizational Science of Multi-Agent LLM Systems: Decoupling Who, How, and Which Algorithm
- Mask2Shield: Strengthening LLM Safety against Neuron-Pruning Attacks
- In-Context Learning as Implicit Policy Gradient
- Not All LLM Reasoning is Visible in the Chain-of-Thought
- Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias
- AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning
- How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift
- CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data
- CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models
- PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding
- Masked Distillation: Internalizing the Chain-of-Thought in Language Models
- What Does Chain-of-Thought Contribute at Probe Time? Evidence for Local Co-Occurrence Activation
- Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy
- From Context to Skills: Can Language Models Learn from Context Skillfully?
- Superposition Without Interference? Towards Isolated Interventions via Almost Orthogonal Features in Language Models
- Entropy Sentinel: Probing Entropy Traces for LLM Monitoring
- Accelerate Speculative Decoding with Sparse Computation in Verification
- Broken Words, Broken Performance: Effect of Tokenization on Performance of LLMs
- Gamayun's Path to Multilingual Mastery: Cost-Efficient Training of a 1.5B-Parameter LLM
- MoRAgent: Parameter Efficient Agent Tuning with Mixture-of-Roles
- Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty
- AInsteinBench: Benchmarking Coding Agents on Scientific Repositories
- Artificial or Just Artful? Do LLMs Bend the Rules in Programming?
- Rethinking Supervised Fine-Tuning: Emphasizing Key Answer Tokens for Improved LLM Accuracy
- EVE: A Generator-Verifier System for Generative Policies
- Scaling Reinforcement Learning for Content Moderation with Large Language Models
- Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs
- TableGPT-R1: Advancing Tabular Reasoning Through Reinforcement Learning
- Schoenfeld's Anatomy of Mathematical Reasoning by Language Models
- Optimistic TEE-Rollups: A Hybrid Architecture for Scalable and Verifiable Generative AI Inference on Blockchain
- Concept Generalization in Humans and Large Language Models: Insights from the Number Game
- Reaching Agreement Among Reasoning LLM Agents
- The Seismic Wavefield Common Task Framework
- Selective LoRA for Visual Tokens and Attention Heads
- JEPA-Reasoner: Decoupling Latent Reasoning from Token Generation
- Understanding Chain-of-Thought in Large Language Models via Topological Data Analysis
- Population-Evolve: a Parallel Sampling and Evolutionary Method for LLM Math Reasoning
- Can abstract concepts from LLM improve SLM performance?
- Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models
- MAGIC: Achieving Superior Model Merging via Magnitude Calibration
- CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning
- Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection
- MoE Pathfinder: Trajectory-driven Expert Pruning
- Training LLMs with LogicReward for Faithful and Rigorous Reasoning
- Efficient Mixture-of-Agents Serving via Tree-Structured Routing, Adaptive Pruning, and Dependency-Aware Prefill-Decode Overlap
- Rethinking Multi-Agent Intelligence Through the Lens of Small-World Networks
- When Reasoning Meets Its Laws
- ReX-MLE: The Autonomous Agent Benchmark for Medical Imaging Challenges
- Mitigating Forgetting in Low Rank Adaptation
- ShareChat: A Dataset of Chatbot Conversations in the Wild
- AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens
- Governance-Aware Hybrid Fine-Tuning for Multilingual Large Language Models
- Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs
- Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
- Constructive Circuit Amplification: Improving Math Reasoning in LLMs via Targeted Sub-Network Updates
- Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
- Meta-RL Induces Exploration in Language Agents
- DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI
- Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics
- Sigma-MoE-Tiny Technical Report
- LoPA: Scaling dLLM Inference via Lookahead Parallel Decoding
- LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
- How Much is Too Much? Exploring LoRA Rank Trade-offs for Retaining Knowledge and Domain Robustness
- Autoregressive Language Models are Secretly Energy-Based Models: Insights into the Lookahead Capabilities of Next-Token Prediction
- Bolmo: Byteifying the Next Generation of Language Models
- Revisiting Task-Oriented Dataset Search in the Era of Large Language Models: Challenges, Benchmark, and Solution
- Dual-Density Inference for Efficient Language Model Reasoning
- DEER: Draft with Diffusion, Verify with Autoregressive Models
- Beyond Fast and Slow: Cognitive-Inspired Elastic Reasoning for Large Language Models
- Prompt Repetition Improves Non-Reasoning LLMs
- FrontierCS: Evolving Challenges for Evolving Intelligence
- Cross-Tokenizer Likelihood Scoring Algorithms for Language Model Distillation
- Imitation Learning for Multi-turn LM Agents via On-policy Expert Corrections
- T5Gemma 2: Seeing, Reading, and Understanding Longer
- Let the Barbarians In: How AI Can Accelerate Systems Performance Research
- Fast and Accurate Causal Parallel Decoding using Jacobi Forcing
- Ladder Up, Memory Down: Low-Cost Fine-Tuning With Side Nets
- RADAR: Accelerating Large Language Model Inference With RL-Based Dynamic Draft Trees
- What Affects the Effective Depth of Large Language Models?
- OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value
- Intention Chain-of-Thought Prompting with Dynamic Routing for Code Generation
- Sharing State Between Prompts and Programs
- Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation
- ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
- Differentiable Evolutionary Reinforcement Learning
- FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
- AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
- Socratic Students: Teaching Language Models to Learn by Asking Questions
- MIDUS: Memory-Infused Depth Up-Scaling
- SIGMA: An AI-Empowered Training Stack on Early-Life Hardware
- One Leak Away: How Pretrained Model Exposure Amplifies Jailbreak Risks in Finetuned LLMs
- VOYAGER: A Training Free Approach for Generating Diverse Datasets using LLMs
- Hold Onto That Thought: Assessing KV Cache Compression On Reasoning
- LYNX: Learning Dynamic Exits for Confidence-Controlled Reasoning
- Mistake Notebook Learning: Batch-Clustered Failures for Training-Free Agent Adaptation
- CADMorph: Geometry-Driven Parametric CAD Editing via a Plan-Generate-Verify Loop
- Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning
- AdaGradSelect: An adaptive gradient-guided layer selection method for efficient fine-tuning of SLMs
- Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization
- AdaSD: Adaptive Speculative Decoding for Efficient Language Model Inference
- Progress over Points: Reframing LM Benchmarks Around Scientific Objectives
- Speculative Decoding Speed-of-Light: Optimal Lower Bounds via Branching Random Walks
- Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs
- PIAST: Rapid Prompting with In-context Augmentation for Scarce Training data
- OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification
- GLOW: Graph-Language Co-Reasoning for Agentic Workflow Performance Prediction
- Reverse Thinking Enhances Missing Information Detection in Large Language Models
- MiniF2F-Dafny: LLM-Guided Mathematical Theorem Proving via Auto-Active Verification
- Scaling Behavior of Discrete Diffusion Language Models
- Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
- MOA: Multi-Objective Alignment for Role-Playing Agents
- d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models
- LLaDA2.0: Scaling Up Diffusion Language Models to 100B
- CONCUR: A Framework for Continual Constrained and Unconstrained Routing
- Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens
- Evolving Excellence: Automated Optimization of LLM-based Agents
- Learning Unmasking Policies for Diffusion Language Models
- Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training
- Do Depth-Grown Models Overcome the Curse of Depth? An In-Depth Analysis
- Towards a Science of Scaling Agent Systems
- SkipKV: Selective Skipping of KV Generation and Storage for Efficient Inference with Large Reasoning Models
- On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
- PCMind-2.1-Kaiyuan-2B Technical Report
- Comparative Analysis and Parametric Tuning of PPO, GRPO, and DAPO for LLM Reasoning Enhancement
- Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
- Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning
- SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models
- JT-DA: Enhancing Data Analysis with Tool-Integrated Table Reasoning Large Language Models
- From Next-Token to Next-Block: A Principled Adaptation Path for Diffusion LLMs
- Graph-Regularized Sparse Autoencoders for LLM Safety Steering
- GradientSpace: Unsupervised Data Clustering for Improved Instruction Tuning
- Uncovering Competency Gaps in Large Language Models and Their Benchmarks
- Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models
- Greedy Alignment Principle for Optimizer Selection
- A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation
- A Latent Variable Framework for Scaling Laws in Large Language Models
- TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models
- Mitigating Catastrophic Forgetting in Mathematical Reasoning Finetuning through Mixed Training
- Evolutionary System 2 Reasoning: An Empirical Proof
- RoBoN: Routed Online Best-of-n for Test-Time Scaling with Multiple LLMs
- BEAVER: An Efficient Deterministic LLM Verifier
- SQ-format: A Unified Sparse-Quantized Hardware-friendly Data Format for LLMs
- AI & Human Co-Improvement for Safer Co-Superintelligence
- Sell Data to AI Algorithms Without Revealing It: Secure Data Valuation and Sharing via Homomorphic Encryption
- Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded Updates
- The Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems
- Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
- Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models
- Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective
- ADAPT: Learning Task Mixtures for Budget-Constrained Instruction Tuning
- AdmTree: Compressing Lengthy Context with Adaptive Semantic Trees
- Decoding Large Language Diffusion Models with Foreseeing Movement
- Jina-VLM: Small Multilingual Vision Language Model
- OD-MoE: On-Demand Expert Loading for Cacheless Edge-Distributed MoE Inference
- Evaluating Hydro-Science and Engineering Knowledge of Large Language Models
- Cognitive Mirrors: Exploring the Diverse Functional Roles of Attention Heads in LLM Reasoning
- A Preliminary Study on the Promises and Challenges of Native Top-k Sparse Attention
- Nexus: Higher-Order Attention Mechanisms in Transformers
- Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs
- PretrainZero: Reinforcement Active Pretraining
- MarkTune: Improving the Quality-Detectability Trade-off in Open-Weight LLM Watermarking
- When Do Symbolic Solvers Enhance Reasoning in Large Language Models?
- SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
- InnoGym: Benchmarking the Innovation Potential of AI Agents
- Fast-Decoding Diffusion Language Models via Progress-Aware Confidence Schedules
- CryptoQA: A Large-scale Question-answering Dataset for AI-assisted Cryptography
- From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks
- Guided Self-Evolving LLMs with Minimal Human Supervision
- E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing
- promptolution: A Unified, Modular Framework for Prompt Optimization
- When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers
- Think in Parallel, Answer as One: Logit Averaging for Open-Ended Reasoning
- Parameter-Efficient Subspace Optimization for LLM Fine-Tuning
- Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
- CoRT: Code-integrated Reasoning within Thinking
- Neural steering vectors reveal dose and exposure-dependent impacts of human-AI relationships
- KV Pareto: Systems-Level Optimization of KV Cache and Model Compression for Long Context Inference
- SVRG and Beyond via Posterior Correction
- Rectifying LLM Thought from Lens of Optimization
- Zero-Overhead Introspection for Adaptive Test-Time Compute
- Lightweight Latent Reasoning for Narrative Tasks
- Mode-Conditioning Unlocks Superior Test-Time Scaling
- Towards Active Synthetic Data Generation for Finetuning Language Models
- Augmented Runtime Collaboration for Self-Organizing Multi-Agent Systems: A Hybrid Bi-Criteria Routing Approach
- SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs
- EDIT: Early Diffusion Inference Termination for dLLMs Based on Dynamics of Training Gradients
- Query-Level Uncertainty in Large Language Models
- Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards
- Multi-chain Graph Refinement and Selection for Reliable Reasoning in Large Language Models
- MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?
- Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match
- AgentShield: Make MAS more secure and efficient
- Adversarial Training for Process Reward Models
- A Rosetta Stone for AI Benchmarks
- Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models
- Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
- Revisiting Generalization Across Difficulty Levels: It's Not So Easy
- ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models
- DSD: A Distributed Speculative Decoding Solution for Edge-Cloud Agile Large Model Serving
- Focused Chain-of-Thought: Efficient LLM Reasoning via Structured Input Information
- Decomposed Trust: Exploring Privacy, Adversarial Robustness, Fairness, and Ethics of Low-Rank LLMs
- Learning When to Stop: Adaptive Latent Reasoning via Reinforcement Learning
- BAMAS: Structuring Budget-Aware Multi-Agent Systems
- IntAttention: A Fully Integer Attention Pipeline for Efficient Edge Inference
- Bootstrapping LLMs via Preference-Based Policy Optimization
- The Good, The Bad, and The Hybrid: A Reward Structure Showdown in Reasoning Models Training
- GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs
- Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models
- Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models
- Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs
- From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models
- ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning
- CafeQ: Calibration-free Quantization via Learned Transformations and Adaptive Rounding
- Reinforcement Learning for Latent-Space Thinking in LLMs
- Structured Prompting Enables More Robust Evaluation of Language Models
- CDLM: Consistency Diffusion Language Models For Faster Sampling
- DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs
- Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios
- ParaBlock: Communication-Computation Parallel Block Coordinate Federated Learning for Large Language Models
- Differential Smoothing Mitigates Sharpening and Improves LLM Reasoning
- RPM-MCTS: Knowledge-Retrieval as Process Reward Model with Monte Carlo Tree Search for Code Generation
- Knowing How to Edit: Reliable Evaluation Signals for Diagnosing and Optimizing Prompts at Query Level
- Mosaic Pruning: A Hierarchical Framework for Generalizable Pruning of Mixture-of-Experts Models
- Learning to Reason: Training LLMs with GPT-OSS or DeepSeek R1 Reasoning Traces
- Latent Collaboration in Multi-Agent Systems
- ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models
- Orchestrating Dual-Boundaries: An Arithmetic Intensity Inspired Acceleration Framework for Diffusion Language Models
- GraphMind: Theorem Selection and Conclusion Generation Framework with Dynamic GNN for LLM Reasoning
- Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation
- SWAN: Sparse Winnowed Attention for Reduced Inference Memory via Decompression-Free KV-Cache Compression
- Periodic Asynchrony: An On-Policy Approach for Accelerating LLM Reinforcement Learning
- Think Before You Prune: Selective Self-Generated Calibration for Pruning Large Reasoning Models
- Majority of the Bests: Improving Best-of-N via Bootstrapping
- Eliciting Chain-of-Thought in Base LLMs via Gradient-Based Representation Optimization
- Prompt Less, Smile More: MTP with Semantic Engineering in Lieu of Prompt Engineering
- Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost
- Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning
- Xmodel-2.5: 1.3B Data-Efficient Reasoning SLM
- EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning
- A2Flow: Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- AnyExperts: On-Demand Expert Allocation for Multimodal Language Models with Mixture of Expert
- Bringing Stability to Diffusion: Decomposing and Reducing Variance of Training Masked Diffusion Models
- WavefrontDiffusion: Dynamic Decoding Schedule for Improved Reasoning
- Scaling Competence, Shrinking Reasoning: Cognitive Signatures in Language Model Learning
- Deterministic Inference across Tensor Parallel Sizes That Eliminates Training-Inference Mismatch
- Attention Guided Alignment in Efficient Vision-Language Models
- E3-Pruner: Towards Efficient, Economical, and Effective Layer Pruning for Large Language Models
- Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
- Beyond Component Strength: Synergistic Integration and Adaptive Calibration in Multi-Agent RAG Systems
- PersonalizedRouter: Personalized LLM Routing via Graph-based User Preference Modeling
- Fantastic Bugs and Where to Find Them in AI Benchmarks
- ELPO: Ensemble Learning Based Prompt Optimization for Large Language Models
- Pass@k Metric for RLVR: A Diagnostic Tool of Exploration, But Not an Objective
- JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
- Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning
- Global Resolution: Optimal Multi-Draft Speculative Sampling via Convex Minimization
- Reasoning in Diffusion Large Language Models is Concentrated in Dynamic Confusion Zones
- From Solving to Verifying: A Unified Objective for Robust Reasoning in LLMs
- Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference
- What Really Counts? Examining Step and Token Level Attribution in Multilingual CoT Reasoning
- DEPO: Dual-Efficiency Preference Optimization for LLM Agents
- GPS: General Per-Sample Prompter
- Agent-R1: A Unified and Modular Framework for Agentic Reinforcement Learning
- Entropy-Guided Reasoning Compression
- Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT
- Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models
- Donors and Recipients: On Asymmetric Transfer Across Tasks and Languages with Parameter-Efficient Fine-Tuning
- Cost-Effective Communication: An Auction-based Method for Language Agent Interaction
- Learning from the Undesirable: Robust Adaptation of Language Models without Forgetting
- Group-Aware Reinforcement Learning for Output Diversity in Large Language Models
- ARCHE: A Novel Task to Evaluate LLMs on Latent Reasoning Chain Extraction
- Genomic Next-Token Predictors are In-Context Learners
- Optimal Self-Consistency for Efficient Reasoning with Large Language Models
- Better LLM Reasoning via Dual-Play
- Striking the Right Balance between Compute and Copy: Improving LLM Inferencing Under Speculative Decoding
- GateRA: Token-Aware Modulation for Parameter-Efficient Fine-Tuning
- From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
- Defending Unauthorized Model Merging via Dual-Stage Weight Protection
- FarSkip-Collective: Unhobbling Blocking Communication in Mixture of Experts Models
- Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation
- BhashaKritika: Building Synthetic Pretraining Data at Scale for Indic Languages
- Virtual Width Networks
- GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models
- When Data is the Algorithm: A Systematic Study and Curation of Preference Optimization Datasets
- Reasoning about Intent for Ambiguous Requests
- Do Not Merge My Model! Safeguarding Open-Source LLMs Against Unauthorized Model Merging
- Efficient Thought Space Exploration Through Strategic Intervention
- Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
- Reasoning: From Reflection to Solution
- Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis for Large Reasoning Models
- EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
- Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models
- Steering Pretrained Drafters during Speculative Decoding
- Rethinking the Reliability of Multi-agent System: A Perspective from Byzantine Fault Tolerance
- Hail to the Thief: Exploring Attacks and Defenses in Decentralised GRPO
- The Ouroboros of Benchmarking: Reasoning Evaluation in an Era of Saturation
- Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models
- Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models
- A Matter of Interest: Understanding Interestingness of Math Problems in Humans and Language Models
- SPEAR-MM: Selective Parameter Evaluation and Restoration via Model Merging for Efficient Financial LLM Adaptation
- Why Should the Server Do It All?: A Scalable, Versatile, and Model-Agnostic Framework for Server-Light DNN Inference over Massively Distributed Clients via Training-Free Intermediate Feature Compression
- AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
- Multimodal LLMs Do Not Compose Skills Optimally Across Modalities
- MSCR: Exploring the Vulnerability of LLMs' Mathematical Reasoning Abilities Using Multi-Source Candidate Replacement
- DynaAct: Large Language Model Reasoning with Dynamic Action Spaces
- Numerical Sensitivity and Robustness: Exploring the Flaws of Mathematical Reasoning in Large Language Models
- WaterMod: Modular Token-Rank Partitioning for Probability-Balanced LLM Watermarking
- From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
- PCRLLM: Proof-Carrying Reasoning with Large Language Models under Stepwise Logical Constraints
- When, What, and How: Rethinking Retrieval-Enhanced Speculative Decoding
- RedOne 2.0: Rethinking Domain-specific LLM Post-Training in Social Networking Services
- Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs
- C3PO: Optimized Large Language Model Cascades with Probabilistic Cost Constraints for Reasoning
- Think Consistently, Reason Efficiently: Energy-Based Calibration for Implicit Chain-of-Thought
- More Agents Helps but Adversarial Robustness Gap Persists
- EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers
- TuckA: Hierarchical Compact Tensor Experts for Efficient Fine-Tuning
- MathSE: Improving Multimodal Mathematical Reasoning via Self-Evolving Iterative Reflection and Reward-Guided Fine-Tuning
- Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence
- MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
- Self-Evaluating LLMs for Multi-Step Tasks: Stepwise Confidence Estimation for Failure Detection
- Better Datasets Start From RefineLab: Automatic Optimization for High-Quality Dataset Refinement
- You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
- EASE: Practical and Efficient Safety Alignment for Small Language Models
- MuonAll: Muon Variant for Efficient Finetuning of Large Language Models
- Route Experts by Sequence, not by Token
- DyKAF: Dynamical Kronecker Approximation of the Fisher Information Matrix for Gradient Preconditioning
- Towards Resource-Efficient Multimodal Intelligence: Learned Routing among Specialized Expert Models
- Optimizing Chain-of-Thought Confidence via Topological and Dirichlet Risk Analysis
- CG-TTRL: Context-Guided Test-Time Reinforcement Learning for On-Device Large Language Models
- ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
- Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models
- FLEX: Continuous Agent Evolution via Forward Learning from Experience
- ScRPO: From Errors to Insights
- MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling
- CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization
- OckBench: Measuring the Efficiency of LLM Reasoning
- Optimizing Diversity and Quality through Base-Aligned Model Collaboration
- Steering Language Models with Weight Arithmetic
- Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results
- KLASS: KL-Guided Fast Inference in Masked Diffusion Models
- Motif 2 12.7B technical report
- Logit-Entropy Adaptive Stopping Heuristic for Efficient Chain-of-Thought Reasoning
- Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
- Are language models aware of the road not taken? Token-level uncertainty and hidden state dynamics
- RIDE: Difficulty Evolving Perturbation with Item Response Theory for Mathematical Reasoning
- CryptoMoE: Privacy-Preserving and Scalable Mixture of Experts Inference via Balanced Expert Routing
- LiveTradeBench: Seeking Real-World Alpha with Large Language Models
- Efficient Reasoning via Thought-Training and Thought-Free Inference
- In Good GRACEs: Principled Teacher Selection for Knowledge Distillation
- Curriculum Design for Trajectory-Constrained Agent: Compressing Chain-of-Thought Tokens in LLMs
- Optimal Singular Damage: Efficient LLM Inference in Low Storage Regimes
- DecompSR: A dataset for decomposed analyses of compositional multihop spatial reasoning
- CGES: Confidence-Guided Early Stopping for Efficient and Accurate Self-Consistency
- LTD-Bench: Evaluating Large Language Models by Letting Them Draw
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- FATE: A Formal Benchmark Series for Frontier Algebra of Multiple Difficulty Levels
- Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models
- Can LLMs subtract numbers?
- Watermarking Discrete Diffusion Language Models
- Towards Robust Mathematical Reasoning
- KV Cache Transform Coding for Compact Storage in LLM Inference
- Random Initialization of Gated Sparse Adapters
- Measuring what Matters: Construct Validity in Large Language Model Benchmarks
- RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks
- FEval-TTC: Fair Evaluation Protocol for Test-Time Compute
- Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning
- Efficient Test-Time Retrieval Augmented Generation
- Prompt-R1: Collaborative Automatic Prompting Framework via End-to-end Reinforcement Learning
- Do Math Reasoning LLMs Help Predict the Impact of Public Transit Events?
- Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
- How Focused Are LLMs? A Quantitative Study via Repetitive Deterministic Prediction Tasks
- Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices
- Inference-Time Chain-of-Thought Pruning with Latent Informativeness Signals
- Toward Sustainability-Aware LLM Inference on Edge Clusters
- Reasoning Planning for Language Models
- G2: Guided Generation for Enhanced Output Diversity in LLMs
- Superpositional Gradient Descent: Harnessing Quantum Principles for Model Training
- Sherlock: Reliable and Efficient Agentic Workflow Execution
- Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
- TempoBench: Evaluating Temporal Causal Reasoning in Large Language Models
- Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning
- VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision
- LLM generation novelty through the lens of semantic similarity
- Glia: A Human-Inspired AI for Automated Systems Design and Optimization
- Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
- A Comparative Analysis of LLM Adaptation: SFT, LoRA, and ICL in Data-Scarce Scenarios
- LongCat-Flash-Omni Technical Report
- H-FA: A Hybrid Floating-Point and Logarithmic Approach to Hardware Accelerated FlashAttention
- Kad: A Framework for Proxy-based Test-time Alignment with Knapsack Approximation Deferral
- FlowMesh: A Service Fabric for Composable LLM Workflows
- AMO-Bench: Large Language Models Still Struggle in High School Math Competitions
- Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models
- Chopping Trees: Semantic Similarity Based Dynamic Pruning for Tree-of-Thought Reasoning
- LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits
- Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model
- Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems
- EdgeRunner 20B: Military Task Parity with GPT-5 while Running on the Edge
- Polybasic Speculative Decoding Through a Theoretical Perspective
- Think Outside the Policy: In-Context Steered Policy Optimization
- OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
- Chain-of-Thought Hijacking
- Scales++: Compute Efficient Evaluation Subset Selection with Cognitive Scales Embeddings
- The Geometry of Dialogue: Graphing Language Models to Reveal Synergistic Teams for Multi-Agent Collaboration
- From Amateur to Master: Infusing Knowledge into LLMs via Automated Curriculum Learning
- Language Models Learn Universal Representations of Numbers and Here's Why You Should Care
- Angular Steering: Behavior Control via Rotation in Activation Space
- Test-Time Alignment of LLMs via Sampling-Based Optimal Control in pre-logit space
- RCScore: Quantifying Response Consistency in Large Language Models
- Lean4Physics: Comprehensive Reasoning Framework for College-level Physics in Lean4
- Predicate Renaming via Large Language Models
- CausalGuard: A Smart System for Detecting and Preventing False Information in Large Language Models
- Gaperon: A Peppered English-French Generative Language Model Suite
- E-Scores for (In)Correctness Assessment of Generative Model Outputs
- Adaptively Robust LLM Monitoring via Activation Watermarking
- Are Language Models Efficient Reasoners? A Perspective from Logic Programming
- NormWorlds-CF: Solver-Verified Counterfactual Normative Reasoning with Metamorphic-Relation GRPO
- From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs
- LLM-as-a-Verifier: A General-Purpose Verification Framework
- From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models
- HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models
- FedWeave: Rethinking the Unit of Specialization in Heterogeneous Federated MoE-LoRA
- Metis: Memory Foundation Model
- Constitutional Midtraining: Content Presence Drives Alignment Gains
- Do Latent Channels Actually Communicate? A Causal Audit of Latent Multi-Agent LLM
- Between Gradient and Natural Gradient: A Continuum of LoRA Initializations
- Multi-Agent Debate Strategies: Survey, Taxonomy, and Challenges
- A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models
- EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
- Training Language Models via Neural Cellular Automata
- PRISM-Physics: Causal DAG-Based Process Evaluation for Physics Reasoning
- RAPID: An Efficient Reinforcement Learning Algorithm for Small Language Models
- Covenant-72B: Pre-Training a 72B LLM with Trustless Peers Over-the-Internet
- Will Scaling Improve Social Simulation with LLMs?
- Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents
- Two Calls Beat Five Agents: Evaluating Multi-Agent Pipelines Against Self-Refinement for Local Language Models
- ThriftAttention: Selective Mixed Precision for Long-Context FP4 Attention
- MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval
- Guess-Verify-Refine: Data-Aware Top-K for Sparse-Attention Decoding on Blackwell via Temporal Correlation
- Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale
- MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue
- RL makes MLLMs see better than SFT
- HySparse: A Hybrid Sparse Attention Architecture with Oracle Token Selection and KV Cache Sharing
- FrugalPrompt: Reducing Contextual Overhead in Large Language Models via Token Attribution
- Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
- PRESTO: Preimage-Informed Instruction Optimization for Prompting Black-Box LLMs
- Sharpness-Guided Group Relative Policy Optimization via Probability Shaping
- A Survey on Unlearning in Large Language Models
- SemCoT: Accelerating Chain-of-Thought Reasoning through Semantically-Aligned Implicit Tokens
- RiddleBench: A New Generative Reasoning Benchmark for LLMs
- SPICE: Self-Play In Corpus Environments Improves Reasoning
- MISA: Memory-Efficient LLMs Optimization with Module-wise Importance Sampling
- MedRule-KG: A Knowledge-Graph--Steered Scaffold for Mathematical Reasoning with a Lightweight Verifier
- Zero-Shot Cross-Lingual Transfer using Prefix-Based Adaptation
- LoRA-DA: Data-Aware Initialization for Low-Rank Adaptation via Asymptotic Analysis
- Structured Interfaces for Automated Reasoning with 3D Scene Graphs
- What Limits Agentic Systems Efficiency?
- Parallel Loop Transformer for Efficient Test-Time Computation Scaling
- BuildArena: A Physics-Aligned Interactive Benchmark of LLMs for Engineering Construction
- SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models
- APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training
- Calibrating and Rotating: A Unified Framework for Weight Conditioning in PEFT
- Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
- Verifying Large Language Models' Reasoning Paths via Correlation Matrix Rank
- SALS: Sparse Attention in Latent Space for KV cache Compression
- MASPRM: Multi-Agent System Process Reward Model
- Before you , monitor: Implementing Flavell's metacognitive framework in LLMs
- ChessQA: Evaluating Large Language Models for Chess Understanding
- SelecTKD: Selective Token-Weighted Knowledge Distillation for LLMs
- GIFT: Group-relative Implicit Fine Tuning Integrates GRPO with DPO and UNA
- On the Impossibility of Retrain Equivalence in Machine Unlearning
- ScaLoRA: Optimally Scaled Low-Rank Adaptation for Efficient High-Rank Fine-Tuning
- Multi-Agent Evolve: LLM Self-Improve through Co-evolution
- PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection
- Unleashing Diverse Thinking Modes in LLMs through Multi-Agent Collaboration
- Learning to Reason Efficiently with Discounted Reinforcement Learning
- Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
- The Best of N Worlds: Aligning Reinforcement Learning with Best-of-N Sampling via max@k Optimisation
- Adaptive Blockwise Search: Inference-Time Alignment for Large Language Models
- SentinelNet: Safeguarding Multi-Agent Collaboration Through Credit-Based Dynamic Threat Detection
- A Survey on LLM Mid-Training
- Knocking-Heads Attention
- Improving Human Verification of LLM Reasoning through Interactive Explanation Interfaces
- Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
- TELL-TALE: Task Efficient LLMs with Task Aware Layer Elimination
- AutoBench: Automating LLM Evaluation through Reciprocal Peer Assessment
- AsyncVoice Agent: Real-Time Explanation for LLM Planning and Reasoning
- Backward-Friendly Optimization: Training Large Language Models with Approximate Gradients under Memory Constraints
- Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks
- Expert Merging in Sparse Mixture of Experts with Nash Bargaining
- Modeling Hierarchical Thinking in Large Reasoning Models
- You Don't Need Prompt Engineering Anymore: The Prompting Inversion
- Edit Less, Achieve More: Dynamic Sparse Neuron Masking for Lifelong Knowledge Editing in LLMs
- Controllable Mathematical Reasoning via Self-Optimizing Thought Vectors
- Generalization or Memorization: Dynamic Decoding for Mode Steering
- Emotions Where Art Thou: Understanding and Characterizing the Emotional Latent Space of Large Language Models
- Foundation of Intelligence: Review of Math Word Problems from Human Cognition Perspective
- Parallel Sampling from Masked Diffusion Models via Conditional Independence Testing
- Confidence is Not Competence
- RETuning: Upgrading Inference-Time Scaling for Stock Movement Prediction with Large Language Models
- Boosting Accuracy and Efficiency of Budget Forcing in LLMs via Reinforcement Learning for Mathematical Reasoning
- Risk Management for Mitigating Benchmark Failure Modes: BenchRisk
- Multi-turn Training with Basic Human Feedback Helps Little on LLM Reasoning
- Compressing Many-Shots in In-Context Learning
- Model Merging with Functional Dual Anchors
- Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency
- Chain of Execution Supervision Promotes General Reasoning in Large Language Models
- Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
- DictPFL: Efficient and Private Federated Learning on Encrypted Gradients
- The Universal Landscape of Human Reasoning
- Attention Sinks in Diffusion Language Models
- When and Why Does Multi-Agent Debate Fail and Does It Really Underperform?
- Thought Communication in Multiagent Collaboration
- Systematic Evaluation of Uncertainty Estimation Methods in Large Language Models
- What Defines Good Reasoning in LLMs? Dissecting Reasoning Steps with Multi-Aspect Evaluation
- ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases
- Teaching Language Models to Reason with Tools
- TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
- LM-mixup: Text Data Augmentation via Language Model based Mixup
- Can Confidence Estimates Decide When Chain-of-Thought Is Necessary for LLMs?
- Not-a-Bandit: Provably No-Regret Drafter Selection in Speculative Decoding for LLMs
- Policy Optimization Prefers The Path of Least Resistance
- A Tutorial on Cognitive Biases in Agentic AI-Driven 6G Autonomous Networks
- Data-Centric Lessons To Improve Speech-Language Pretraining
- SmartSwitch: Advancing LLM Reasoning by Overcoming Underthinking via Promoting Deeper Thought Exploration
- Zhyper: Factorized Hypernetworks for Conditioned LLM Fine-Tuning
- Fast Inference via Hierarchical Speculative Decoding
- Teaming LLMs to Detect and Mitigate Hallucinations
- HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment
- AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
- HAD: HAllucination Detection Language Models Based on a Comprehensive Hallucination Taxonomy
- The Zero-Step Thinking: An Empirical Study of Mode Selection as Harder Early Exit in Reasoning Models
- AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
- DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference
- No Compute Left Behind: Rethinking Reasoning and Sampling with Masked Diffusion Models
- DiSRouter: Distributed Self-Routing for LLM Selections
- What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
- Verifiable Accuracy and Abstention Rewards in Curriculum RL to Alleviate Lost-in-Conversation
- Reasoning Language Model Inference Serving Unveiled: An Empirical Study
- From Quarter to All: Accelerating Speculative LLM Decoding via Floating-Point Exponent Remapping and Parameter Sharing
- Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients
- Higher Embedding Dimension Creates a Stronger World Model for a Simple Sorting Task
- Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs
- Adaptive Coopetition: Leveraging Coarse Verifier Signals for Resilient Multi-Agent LLM Reasoning
- NeuroAda: Activating Each Neuron's Potential for Parameter-Efficient Fine-Tuning
- Test-time Verification via Optimal Transport: Coverage, ROC, & Sub-optimality
- Local Coherence or Global Validity? Investigating RLVR Traces in Math Domains
- Learning from Generalization Patterns: An Evaluation-Driven Approach to Enhanced Data Augmentation for Fine-Tuning Small Language Models
- Evaluating LLM Reasoning Beyond Correctness and CoT
- Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth
- OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning
- From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
- Unbiased Gradient Low-Rank Projection
- Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
- Inference-Time Compute Scaling For Flow Matching
- Empowering Real-World: A Survey on the Technology, Practice, and Evaluation of LLM-driven Industry Agents
- Certified Self-Consistency: Statistical Guarantees and Test-Time Training for Reliable Reasoning in LLMs
- Strengthening LLMs for Tabular Prediction with Structural Priors
- Select-Then-Decompose: From Empirical Analysis to Adaptive Selection Strategy for Task Decomposition in Large Language Models
- Soft-Masked Diffusion Language Models
- EduAdapt: A Question Answer Benchmark Dataset for Evaluating Grade-Level Adaptability in LLMs
- Verification-Aware Planning for Multi-Agent Systems
- JT-Safe: Intrinsically Enhancing the Safety and Trustworthiness of LLMs
- Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization
- ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models
- Online Mixture of Experts: No-Regret Learning for Optimal Collective Decision-Making
- A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications
- Utility-Diversity Aware Online Batch Selection for LLM Supervised Fine-tuning
- When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling
- Neuronal Group Communication for Efficient Neural representation
- CRepair Wrapper Improves Structural Self-Repair Across Three LLM Families: A Cross-Model Replication Study
- Planner and Executor: Collaboration between Discrete Diffusion And Autoregressive Models in Reasoning
- Dual-Weighted Reinforcement Learning for Generative Preference Modeling
- Soundness-Aware Level: A Microscopic Signature that Predicts LLM Reasoning Potential
- ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning
- TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Games
- MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
- Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert models
- Structure-R1: Dynamically Leveraging Structural Knowledge in LLM Reasoning through Reinforcement Learning
- Attention Is All You Need for KV Cache in Diffusion LLMs
- LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
- Predicting Task Performance with Context-aware Scaling Laws
- Midtraining Bridges Pretraining and Posttraining Distributions
- To Infinity and Beyond: Tool-Use Unlocks Length Generalization in State Space Models
- AMS-QUANT: Adaptive Mantissa Sharing for Floating-point Quantization
- Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning
- Beyond Multi-Token Prediction: Pretraining LLMs with Future Summaries
- Purifying Task Vectors in Knowledge-Aware Subspace for Model Merging
- Holdout-Loss-Based Data Selection for LLM Finetuning via In-Context Learning
- Understanding the Ability of LLMs to Handle Character-Level Perturbation
- Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction
- A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space
- Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs
- Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models
- RLSR: Reinforcement Learning with Supervised Reward Outperforms SFT in Instruction Following
- Budget-aware Test-time Scaling via Discriminative Verification
- ERGO: Entropy-guided Resetting for Generation Optimization in Multi-turn Language Models
- REAP the Experts: Why Pruning Prevails for One-Shot MoE compression
- Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
- Big Reasoning with Small Models: Instruction Retrieval at Inference Time
- NOSA: Native and Offloadable Sparse Attention
- Confidence as a Reward: Transforming LLMs into Reward Models
- Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation
- End-to-End Multi-Modal Diffusion Mamba
- Putting on the Thinking Hats: A Survey on Chain of Thought Fine-tuning from the Perspective of Human Reasoning Mechanism
- GatePro: Parameter-Free Expert Selection Optimization for Mixture-of-Experts Models
- Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling
- Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference
- Adaptive Reasoning Executor: A Collaborative Agent System for Efficient Reasoning
- ConsintBench: Evaluating Language Models on Real-World Consumer Intent Understanding
- Evaluating Arabic Large Language Models: A Survey of Benchmarks, Methods, and Gaps
- Max It or Miss It: Benchmarking LLM On Solving Extremal Problems
- Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization
- BoN Appetit Team at LeWiDi-2025: Best-of-N Test-time Scaling Can Not Stomach Annotation Disagreements (Yet)
- Who's Asking? Evaluating LLM Robustness to Inquiry Personas in Factual Question Answering
- KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems
- Dr.LLM: Dynamic Layer Routing in LLMs
- CARVQ: Corrective Adaptor with Group Residual Vector Quantization for LLM Embedding Compression
- Market-Driven Subset Selection for Budgeted Training
- MoBiLE: Efficient Mixture-of-Experts Inference on Consumer GPU with Mixture of Big Little Experts
- MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
- Towards Inference-time Scaling for Continuous Space Reasoning
- A Survey on Parallel Reasoning
- Self-Verifying Reflection Helps Transformers with CoT Reasoning
- Reliable Fine-Grained Evaluation of Natural Language Math Proofs
- Uncertainty Quantification for Hallucination Detection in Large Language Models: Foundations, Methodology, and Future Directions
- OPLoRA: Orthogonal Projection LoRA Prevents Catastrophic Forgetting during Parameter-Efficient Fine-Tuning
- Multi-stage Prompt Refinement for Mitigating Hallucinations in Large Language Models
- UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
- Catch Your Breath: Adaptive Computation for Self-Paced Sequence Production
- LLM Reasoning for Machine Translation: Synthetic Data Generation over Thinking Tokens
- Balancing Synthetic Data and Replay for Enhancing Task-Specific Capabilities
- Z0-Inf: Zeroth Order Approximation for Data Influence
- Are Large Reasoning Models Interruptible?
- QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
- Representation-Based Exploration for Language Models: From Test-Time to Post-Training
- Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
- A2FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning
- MeTA-LoRA: Data-Efficient Multi-Task Fine-Tuning for Large Language Models
- Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models
- From to : Multidimensional Supervision of Reasoning Process for LLM Optimization
- Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs
- Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization
- Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States
- LogiNumSynth: Synthesizing Joint Logical-Numerical Reasoning Problems for Language Models
- DND: Boosting Large Language Models with Dynamic Nested Depth
- APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport
- MC#: Mixture Compressor for Mixture-of-Experts Large Models
- Cog-Rethinker: Hierarchical Metacognitive Reinforcement Learning for LLM Reasoning
- BanglaMATH : A Bangla benchmark dataset for testing LLM mathematical reasoning at grades 6, 7, and 8
- Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
- AMiD: Knowledge Distillation for LLMs with α-mixture Assistant Distribution
- Beyond Consensus: Mitigating the Agreeableness Bias in LLM Judge Evaluations
- Direct Multi-Token Decoding
- Preserving LLM Capabilities through Calibration Data Curation: From Analysis to Optimization
- HyperAgent: Leveraging Hypergraphs for Topology Optimization in Multi-Agent Communication
- GraphTracer: Graph-Guided Failure Tracing in LLM Agents for Robust Multi-Turn Deep Search
- Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?
- Detecting Hallucinations in Authentic LLM-Human Interactions
- Merlin's Whisper: Enabling Efficient Reasoning in LLMs via Black-box Adversarial Prompting
- One Token Embedding Is Enough to Deadlock Your Large Reasoning Model
- Rethinking LLM Evaluation: Can We Evaluate LLMs with 200x Less Data?
- Demystifying the Roles of LLM Layers in Retrieval, Knowledge, and Reasoning
- CTR-LoRA: Curvature-Aware and Trust-Region Guided Low-Rank Adaptation for Large Language Models
- DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
- Audit-of-Understanding: Posterior-Constrained Inference for Mathematical Reasoning in Language Models
- Debiasing LLMs by Masking Unfairness-Driving Attention Heads
- Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
- ADEPT: Continual Pretraining via Adaptive Expansion and Dynamic Decoupled Tuning
- Failure-Driven Workflow Refinement
- Skill-Targeted Adaptive Training
- StelLA: Subspace Learning in Low-rank Adaptation using Stiefel Manifold
- Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
- Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers
- Learning Reasoning Rewards from Expert Demonstrations with Inverse Reinforcement Learning
- Brick: Spatial Capability Routing for the Mixture-of-Models (MoM) Paradigm
- Syntactic Blind Spots: How Misalignment Leads to LLMs Mathematical Errors
- Decoupled DiLoCo for Resilient Distributed Pre-training
- Faster LLM Inference via Sequential Monte Carlo
- PostTrainBench: Can LLM Agents Automate LLM Post-Training?
- Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs
- Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs
- Don't Throw Away Your Pretrained Model
- SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
- Evaluating Robustness of Large Language Models Against Multilingual Typographical Errors
- StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
- ConDABench: Interactive Evaluation of Language Models for Data Analysis
- Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
- Entropy Meets Importance: A Unified Head Importance-Entropy Score for Stable and Efficient Transformer Pruning
- Users as Annotators: LLM Preference Learning from Comparison Mode
- ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability
- Alif: Advancing Urdu Large Language Models via Multilingual Synthetic Data Distillation
- TripScore: Benchmarking and rewarding real-world travel planning with fine-grained evaluation
- Constraints-of-Thought: A Framework for Constrained Reasoning in Language-Model-Guided Search
- The Idola Tribus of AI: Large Language Models tend to perceive order where none exists
- Verifying Chain-of-Thought Reasoning via Its Computational Graph
- MaP: A Unified Framework for Reliable Evaluation of Pre-training Dynamics
- On the Provable Performance Guarantee of Efficient Reasoning Models
- A Comprehensive Evaluation of Multilingual Chain-of-Thought Reasoning: Performance, Consistency, and Faithfulness Across Languages
- ProxRouter: Proximity-Weighted LLM Query Routing for Improved Robustness to Outliers
- Active Model Selection for Large Language Models
- DARO: Difficulty-Aware Reweighting Policy Optimization
- FOR-Prompting: From Objection to Revision via an Asymmetric Prompting Protocol
- RefGrader: Automated Grading of Mathematical Competition Proofs using Agentic Workflows
- CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards
- Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
- dInfer: An Efficient Inference Framework for Diffusion Language Models
- Guided Star-Shaped Masked Diffusion
- First Try Matters: Revisiting the Role of Reflection in Reasoning Models
- Lossless Vocabulary Reduction for Auto-Regressive Language Models
- AILoRA: Function-Aware Asymmetric Initialization for Low-Rank Adaptation of Large Language Models
- Fewer Weights, More Problems: A Practical Attack on LLM Pruning
- LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
- Contrastive Weak-to-strong Generalization
- Upfront Chain-of-Thought: A Cooperative Framework for Chain-of-Thought Compression
- MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
- GCPO: When Contrast Fails, Go Gold
- Rethinking Reasoning: A Survey on Reasoning-based Backdoors in LLMs
- R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
- Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
- On the optimization dynamics of RLVR: Gradient gap and step size thresholds
- Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization
- xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning
- FlyLoRA: Boosting Task Decoupling and Parameter Efficiency via Implicit Rank-Wise Mixture-of-Experts
- PEAR: Phase Entropy Aware Reward for Efficient Reasoning
- TAPAS: Datasets for Learning the Learning with Errors Problem
- TRIM: Token-wise Attention-Derived Saliency for Data-Efficient Instruction Tuning
- SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training
- SliceFine: The Universal Winning-Slice Hypothesis for Pretrained Networks
- ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation
- SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
- AgentAsk: Multi-Agent Systems Need to Ask
- Benchmarking is Broken -- Don't Let AI be its Own Judge
- Measuring and Mitigating Identity Bias in Multi-Agent Debate via Anonymization
- Can Speech LLMs Think while Listening?
- MAPRO: Recasting Multi-Agent Prompt Optimization as Maximum a Posteriori Inference
- Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
- More Data or Better Data? A Critical Analysis of Data Selection and Synthesis for Mathematical Reasoning
- Encode, Think, Decode: Scaling test-time reasoning with recursive latent thoughts
- Accelerating Diffusion LLM Inference via Local Determinism Propagation
- Pragyaan: Designing and Curating High-Quality Cultural Post-Training Datasets for Indian Languages
- EDUMATH: Generating Standards-aligned Educational Math Word Problems
- SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
- SoftMatcha 2: A Fast and Soft Pattern Matcher for Trillion-Scale Corpora
- PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review
- CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
- ReSSFormer: A Recursive Sparse Structured Transformer for Scalable and Long-Context Reasoning
- Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
- Mid-Training of Large Language Models: A Survey
- Efficient numeracy in language models through single-token number embeddings
- JAI-1: A Thai-Centric Large Language Model
- Gold-Switch: Training-Free Superposition of Slow- and Fast- Thinking LLMs
- PIKA: Expert-Level Synthetic Datasets for Post-Training Alignment from Scratch
- Aligning Large Language Models via Fully Self-Synthetic Data
- KaVa: Latent Reasoning via Compressed KV-Cache Distillation
- Iterative LLM-Based Generation and Refinement of Distracting Conditions in Math Word Problems
- LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics
- Flipping the Dialogue: Training and Evaluating User Language Models
- Online Rubrics Elicitation from Pairwise Comparisons
- Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs
- λ-GRPO: Unifying the GRPO Frameworks with Learnable Token Preferences
- h1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement Learning
- POME: Post Optimization Model Edit via Muon-style Projection
- Expanding the Action Space of LLMs to Reason Beyond Language
- Grouped Differential Attention
- Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels
- Attention Sinks and Compression Valleys in LLMs are Two Sides of the Same Coin
- VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
- SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence Generation
- CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credits
- lm-Meter: Unveiling Runtime Inference Latency for On-Device Language Models
- Influence Functions for Efficient Data Selection in Reasoning
- MatheMagic: Generating Dynamic Mathematics Benchmarks Robust to Memorization
- Gradient-Sign Masking for Task Vector Transport Across Pre-Trained Models
- VeriEquivBench: An Equivalence Score for Ground-Truth-Free Evaluation of Formally Verifiable Code
- EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget
- Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies
- ARMOR: High-Performance Semi-Structured Pruning via Adaptive Matrix Factorization
- AMAQ: Adaptive Mixed-bit Activation Quantization for Collaborative Parameter Efficient Fine-tuning
- MixReasoning: Switching Modes to Think
- Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs
- MASA: Rethinking the Representational Bottleneck in LoRA with Multi-A Shared Adaptation
- Prototype-Based Dynamic Steering for Large Language Models
- Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment
- Boomerang Distillation Enables Zero-Shot Model Size Interpolation
- Staircase Streaming for Low-Latency Multi-Agent Inference
- Stratum: System-Hardware Co-Design with Tiered Monolithic 3D-Stackable DRAM for Efficient MoE Serving
- Finish First, Perfect Later: Test-Time Token-Level Cross-Validation for Diffusion Large Language Models
- Slm-mux: Orchestrating small language models for reasoning
- SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
- Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
- Reinforcement Learning for Clinical Reasoning: Aligning LLMs with ACR Imaging Appropriateness Criteria
- Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails
- Bridging Reasoning to Learning: Unmasking Illusions using Complexity Out of Distribution Generalization
- ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs
- The Reasoning Boundary Paradox: How Reinforcement Learning Constrains Language Models
- BrokenMath: A Benchmark for Sycophancy in Theorem Proving with LLMs
- Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation
- FedSRD: Sparsify-Reconstruct-Decompose for Communication-Efficient Federated Large Language Models Fine-Tuning
- DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Natural Language Edge Labelling: Decoupling Intent from Execution in Structured LM Reasoning
- KVLinC : KV Cache Quantization with Hadamard Rotation and Linear Correction
- Context Length Alone Hurts LLM Performance Despite Perfect Retrieval
- Making Mathematical Reasoning Adaptive
- LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
- Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
- GRACE: Generative Representation Learning via Contrastive Policy Optimization
- Multilingual Routing in Mixture-of-Experts
- Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time
- Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization
- PatternKV: Flattening KV Representation Expands Quantization Headroom
- Self Speculative Decoding for Diffusion Large Language Models
- Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
- Searching Meta Reasoning Skeleton to Guide LLM Reasoning
- Systematic Diagnosis of Brittle Reasoning in Large Language Models
- Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation
- Scaling Code-Assisted Chain-of-Thoughts and Instructions for Model Reasoning
- Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models
- SATER: A Self-Aware and Token-Efficient Approach to Routing and Cascading
- TROLL: Trust Regions improve Reinforcement Learning for Large Language Models
- Beyond Token Length: Step Pruner for Efficient and Accurate Reasoning in Large Language Models
- REG: A Regularization Optimizer for Robust Training Dynamics
- Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs
- Decoupling Task-Solving and Output Formatting in LLM Generation
- Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
- GuidedSampling: Steering LLMs Towards Diverse Candidate Solutions at Inference-Time
- Best-of-Majority: Minimax-Optimal Strategy for Pass@k Inference Scaling
- Lateral Tree-of-Thoughts Surpasses ToT by Incorporating Logically-Consistent, Low-Utility Candidates
- Leave No TRACE: Black-box Detection of Copyrighted Dataset Usage in Large Language Models via Watermarking
- Consolidating Reinforcement Learning for Multimodal Discrete Diffusion Models
- Reward Model Routing in Alignment
- Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
- NCV: A Node-Wise Consistency Verification Approach for Low-Cost Structured Error Localization in LLM Reasoning
- AutoMaAS: Self-Evolving Multi-Agent Architecture Search for Large Language Models
- TravelBench : Exploring LLM Performance in Low-Resource Domains
- Fine-Tuning on Noisy Instructions: Effects on Generalization and Performance
- Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach
- Energy-Regularized Sequential Model Editing on Hyperspheres
- Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
- mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
- CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs
- Large Reasoning Models Learn Better Alignment from Flawed Thinking
- Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving
- Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
- When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
- Curiosity-Driven LLM-as-a-judge for Personalized Creative Judgment
- Rethinking Reward Models for Multi-Domain Test-Time Scaling
- Characterizing Model Behavior Under Synthetic Data Training: An Empirical Study Across Scales and Mixing Ratios
- TokMem: Tokenized Procedural Memory for Large Language Models
- Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs
- Generalized Parallel Scaling with Interdependent Generations
- RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
- Learning Compact Representations of LLM Abilities via Item Response Theory
- Making, not Taking, the Best of N
- Stochastic Self-Organization in Multi-Agent Systems
- Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning
- Exploring System 1 and 2 communication for latent reasoning in LLMs
- ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models
- HiSpec: Hierarchical Speculative Decoding for LLMs
- Reasoning-Aware Prompt Orchestration: A Foundation Model for Multi-Agent Language Model Coordination
- DecepChain: Inducing Deceptive Reasoning in Large Language Models
- Towards Ecologically Valid LLM Benchmarks: Understanding and Designing Domain-Centered Evaluations for Journalism Practitioners
- Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
- Improving Metacognition and Uncertainty Communication in Language Models
- Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space
- GRPO-λ: Credit Assignment improves LLM Reasoning
- Train Large, Deploy Compact: Structured Compression for Compact Low-Rank Adaptation
- Recursive Self-Aggregation Unlocks Deep Thinking in Large Language Models
- Are Robust LLM Fingerprints Adversarially Robust?
- Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning
- Can LLMs Write Mathematics Papers? A Case Study in Reservoir Computing
- Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation
- dParallel: Learnable Parallel Decoding for dLLMs
- AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size
- Communication-Efficient and Accurate Approach for Aggregation in Federated Low-Rank Adaptation
- Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts
- One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient
- Interactive Learning for LLM Reasoning
- Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing
- Clip-Low Increases Entropy and Clip-High Decreases Entropy in Reinforcement Learning of Large Language Models
- CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
- RoRecomp: Enhancing Reasoning Efficiency via Rollout Response Recomposition in Reinforcement Learning
- Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA
- Distillation of Large Language Models via Concrete Score Matching
- OPPO: Accelerating PPO-based RLHF via Pipeline Overlap
- Atomic Thinking of LLMs: Decoupling and Exploring Mathematical Reasoning Abilities
- Expert Merging: Model Merging with Unsupervised Expert Alignment and Importance-Guided Layer Chunking
- Collaborative Compression for Large-Scale MoE Deployment on Edge
- IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation
- Hierarchical Reasoning Models: Perspectives and Misconceptions
- Thinking Sparks!: Emergent Attention Heads in Reasoning Models During Post Training
- RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
- Aligning Multilingual Reasoning with Verifiable Semantics from a High-Resource Expert Model
- MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources
- Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
- Rethinking Parameter Sharing for LLM Fine-Tuning with Multiple LoRAs
- Predicting Training Re-evaluation Curves Enables Effective Data Curriculums for LLMs
- From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
- Structural Reward Model: Enhancing Interpretability, Efficiency, and Scalability in Reward Modeling
- UniAPL: A Unified Adversarial Preference Learning Framework for Instruct-Following
- Rethinking Entropy Regularization in Large Reasoning Models
- Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
- CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning
- Generalized Correctness Models: Learning Calibrated and Model-Agnostic Correctness Predictors from Historical Patterns
- Intra-request branch orchestration for efficient LLM reasoning
- MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes
- SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Models
- LatentEvolve: Self-Evolving Test-Time Scaling in Latent Space
- Stop Before You Fail: Operational Capability Boundaries for Mitigating Unproductive Reasoning in Large Reasoning Models
- MemGen: Weaving Generative Latent Memory for Self-Evolving Agents
- Reference-Free Rating of LLM Responses via Latent Information
- CDT: A Comprehensive Capability Framework for Large Language Models Across Cognition, Domain, and Task
- From Static to Dynamic: Adaptive Monte Carlo Search for Mathematical Process Supervision
- Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding
- DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
- LOGOS: LLM-driven End-to-End Grounded Theory Development and Schema Induction for Qualitative Research
- Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models
- SpecExit: Accelerating Large Reasoning Model via Speculative Exit
- Prompt and Parameter Co-Optimization for Large Language Models
- ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
- Learning to Ponder: Adaptive Reasoning in Latent Space
- Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends
- Model Correlation Detection via Random Selection Probing
- Watermarking Diffusion Language Models
- Deep Thinking by Markov Chain of Continuous Thoughts
- Why Tree-Style Branching Matters for Thought Advantage Estimation in GRPO
- AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play
- ContextPRM: Leveraging Contextual Coherence for multi-domain Test-Time Scaling
- Socratic-Zero : Bootstrapping Reasoning via Data-Free Agent Co-evolution
- From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing
- Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding
- ReasonCACHE: Teaching LLMs To Reason Without Weight Updates
- Beyond Magic Words: Sharpness-Aware Prompt Evolving for Robust Large Language Models with TARE
- Sequential Diffusion Language Models
- Toward Preference-aligned Large Language Models via Residual-based Model Steering
- Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
- Beyond Benchmarks: Understanding Mixture-of-Experts Models through Internal Mechanisms
- Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
- Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
- Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning
- Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions
- DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
- Evaluating Program Semantics Reasoning with Type Inference in System F
- Aligning LLMs for Multilingual Consistency in Enterprise Applications
- Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs
- Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models
- Reasoning Scaffolding: Distilling the Flow of Thought from LLMs
- Towards Efficient CoT Distillation: Self-Guided Rationale Selector for Better Performance with Fewer Rationales
- On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization
- Large-Scale Constraint Generation -- Can LLMs Parse Hundreds of Constraints?
- Pretraining Scaling Laws for Generative Evaluations of Language Models
- DOoM: Difficult Olympiads of Math
- Structured In-context Environment Scaling for Large Language Model Reasoning
- A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models
- Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning
- Mitigating Spurious Correlations in LLMs via Causality-Aware Post-Training
- MathBode: Measuring the Stability of LLM Reasoning using Frequency Response
- Tracing Uncertainty in Language Model "Reasoning"
- NanoFlux: Adversarial Dual-LLM Evaluation and Distillation For Multi-Domain Reasoning
- p-less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding
- Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
- From Harm to Help: Turning Reasoning In-Context Demos into Assets for Reasoning LMs
- PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space
- C2GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning
- Effective Quantization of Muon Optimizer States
- WirelessMathLM: Teaching Mathematical Reasoning for LLMs in Wireless Communications with Reinforcement Learning
- Protocode: Prototype-Driven Interpretability for Code Generation in LLMs
- Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
- d2Cache: Accelerating Diffusion-Based LLMs via Dual Adaptive Caching
- JE-IRT: A Geometric Lens on LLM Abilities through Joint Embedding Item Response Theory
- IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning
- Dynamic Experts Search: Enhancing Reasoning in Mixture-of-Experts LLMs at Test Time
- The Emergence of Altruism in Large-Language-Model Agents Society
- REMA: A Unified Reasoning Manifold Framework for Interpreting Large Language Model
- Representing LLMs in Prompt Semantic Task Space
- InfiAgent: Self-Evolving Pyramid Agent Framework for Infinite Scenarios
- Multidimensional Uncertainty Quantification via Optimal Transport
- Stochastic activations
- Erase or Hide? Suppressing Spurious Unlearning Neurons for Robust Unlearning
- When Does Reasoning Matter? A Controlled Study of Reasoning's Contribution to Model Performance
- Lightweight error mitigation strategies for post-training N:M activation sparsity in LLMs
- From Long to Lean: Performance-aware and Adaptive Chain-of-Thought Compression via Multi-round Refinement
- Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
- R-Capsule: Compressing High-Level Plans for Efficient Large Language Model Reasoning
- Think Right, Not More: Test-Time Scaling for Numerical Claim Verification
- Fine-tuning Done Right in Model Editing
- A2R: An Asymmetric Two-Stage Reasoning Framework for Parallel Reasoning
- GSM-Agent: Understanding Agentic Reasoning Using Controllable Environments
- Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
- QoNext: Towards Next-generation QoE for Foundation Models
- SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models
- RobustFlow: Towards Robust Agentic Workflow Generation
- FastGRPO: Accelerating Policy Optimization via Concurrency-aware Speculative Decoding and Online Draft Learning
- Quantifying the Impact of Structured Output Format on Large Language Models through Causal Inference
- KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI
- Rethinking Large Language Model Distillation: A Constrained Markov Decision Process Perspective
- Front-Loading Reasoning: The Synergy between Pretraining and Post-Training Data
- Learning More with Less: A Dynamic Dual-Level Down-Sampling Framework for Efficient Policy Optimization
- Induction Signatures Are Not Enough: A Matched-Compute Study of Load-Bearing Structure in In-Context Learning
- RLP: Reinforcement as a Pretraining Objective
- Blockwise Hadamard high-Rank Adaptation for Parameter-Efficient LLM Fine-Tuning
- Hallucination reduction with CASAL: Contrastive Activation Steering For Amortized Learning
- Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation
- On Code-Induced Reasoning in LLMs
- Learning to Reason with Mixture of Tokens
- Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning
- Best-of-∞ -- Asymptotic Performance of Test-Time LLM Ensembling
- Predicting LLM Reasoning Performance with Small Proxy Model
- StyleBench: Evaluating thinking styles in Large Language Models
- SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs
- Stability of In-Context Learning: A Spectral Coverage Perspective
- TyphoonMLA: A Mixed Naive-Absorb MLA Kernel For Shared Prefix
- SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials
- It's Not You, It's Clipping: A Soft Trust-Region via Probability Smoothing for LLM RL
- Mixture of Thoughts: Learning to Aggregate What Experts Think, Not Just What They Say
- d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation
- MARS: toward more efficient multi-agent collaboration for LLM reasoning
- DRES: Benchmarking LLMs for Disfluency Removal
- Thinking Augmented Pre-training
- PEPS: Quantum-Inspired Reinforcement Learning for Coherent Reasoning Traces in LLMs
- Integrated Framework for LLM Evaluation with Answer Generation
- FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
- Future Policy Aware Preference Learning for Mathematical Reasoning
- SpecMamba: Accelerating Mamba Inference on FPGA with Speculative Decoding
- Enhancing Linear Attention with Residual Learning
- SIM-CoT: Supervised Implicit Chain-of-Thought
- Do Before You Judge: Self-Reference as a Pathway to Better LLM Evaluation
- SKYLENAGE Technical Report: Mathematical Reasoning and Contest-Innovation Benchmarks for Multi-Level Math Evaluation
- CIFLEX: Contextual Instruction Flow for Sub-task Execution in Multi-Turn Interactions with a Single On-Device LLM
- Are We Scaling the Right Thing? A System Perspective on Test-Time Scaling
- Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMs
- Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems
- LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models
- TAPO: Transition-Aware Policy Optimization for LLM Agents
- Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models
- Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game
- Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training
- Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning
- Cybersecurity Detection Classification with Reasoning-enabled Language Models
- SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute
- A Policy-Driven Runtime Layer for Agentic LLM Serving
- SDO: Structure-Aware Data Organization for Efficient LLM Post-Training
- Multi-Head Attention Residuals
- Averaged Evaluation Masks Capability Trade-Offs: Multi-Source Calibration for High-Sparsity LLM Pruning
- AXIOM: A Trust-First Neuro-Symbolic Execution Architecture for Verifiable Mathematical Reasoning
- CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning
- Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting
- EMO: Pretraining Mixture of Experts for Emergent Modularity
- Defusing the Trigger: Tail-Risk-Informed Attention Rebalancing for LLM Backdoor Mitigation
- How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data
- Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs
- DFlash: Block Diffusion for Flash Speculative Decoding
- AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games
- Where-to-Unmask: Ground-Truth-Guided Unmasking Order Learning for Masked Diffusion Language Models
- SHINE: A Scalable In-Context Hypernetwork for Mapping Context to LoRA in a Single Pass
- Riemannian Optimization for LoRA on the Stiefel Manifold
- Proximal Supervised Fine-Tuning
- DRQA: Dynamic Reasoning Quota Allocation for Controlling Overthinking in Reasoning Large Language Models
- Randomly Removing 50% of Dimensions in Text Embeddings has Minimal Impact on Retrieval and Classification Tasks
- AgentInit: Initializing LLM-based Multi-Agent Systems via Diversity and Expertise Orchestration for Effective and Efficient Collaboration
- Soft Tokens, Hard Truths
- AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field
- When Long Helps Short: How Context Length in Supervised Fine-tuning Affects Behavior of Large Language Models
- Prior-based Noisy Text Data Filtering: Fast and Strong Alternative For Perplexity
- HyperAdapt: Simple High-Rank Adaptation
- Solving Math Word Problems Using Estimation Verification and Equation Generation
- Analyzing Uncertainty of LLM-as-a-Judge: Interval Evaluations with Conformal Prediction
- NGRPO: Negative-enhanced Group Relative Policy Optimization
- Benchmark Profiling: Mechanistic Diagnosis of LLM Benchmarks
- CCQA: Generating Question from Solution Can Improve Inference-Time Reasoning in SLMs
- A Good Plan is Hard to Find: Aligning Models with Preferences is Misaligned with What Helps Users
- Symphony-MoE: Harmonizing Disparate Pre-trained Models into a Coherent Mixture-of-Experts
- Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
- Reasoning Core: A Scalable RL Environment for LLM Symbolic Reasoning
- ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs
- EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
- Correlation or Causation: Analyzing the Causal Structures of LLM and LRM Reasoning Process
- Weights-Rotated Preference Optimization for Large Language Models
- CogAtom: From Cognitive Atoms to Olympiad-level Mathematical Reasoning in Large Language Models
- Understanding Benchmark Language Under Weakened Formal Semantics
- Variation in Verification: Understanding Verification Dynamics in Large Language Models
- SilentStriker:Toward Stealthy Bit-Flip Attacks on Large Language Models
- DIWALI: Diversity and Inclusivity aWare cuLture specific Items for India: Dataset and Assessment of LLMs for Cultural Text Adaptation in Indian Context
- QWHA: Quantization-Aware Walsh-Hadamard Adaptation for Parameter-Efficient Fine-Tuning on Large Language Models
- Asking a Language Model for Diverse Responses
- Understanding Post-Training Structural Changes in Large Language Models
- Structuring The Future: Diffusion LLM Speculative Decoding via Calibrated Draft Graphs
- Probabilistic Token Alignment for Large Language Model Fusion
- nDNA -- the Semantic Helix of Artificial Cognition
- Adaptive Overclocking: Dynamic Control of Thinking Path Length via Real-Time Reasoning Signals
- seqBench: A Tunable Benchmark to Quantify Sequential Reasoning Limits of LLMs
- Large Language Models as End-to-end Combinatorial Optimization Solvers
- Dynamic Expert Specialization: Towards Catastrophic Forgetting-Free Multi-Domain MoE Adaptation
- MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE
- Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories
- PruneCD: Contrasting Pruned Self Model to Improve Decoding Factuality
- Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels
- SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning
- Can an Individual Manipulate the Collective Decisions of Multi-Agents?
- Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs
- Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle
- Pico: A Modular Framework for Hypothesis-Driven Small Language Model Research
- Best-of-L: Cross-Lingual Reward Modeling for Mathematical Reasoning
- UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression
- Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding
- GPO: Learning from Critical Steps to Improve LLM Reasoning
- Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
- Think, Verbalize, then Speak: Bridging Complex Thoughts and Comprehensible Speech
- DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
- LNE-Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models
- Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction
- School of Reward Hacks: Hacking harmless tasks generalizes to misaligned behavior in LLMs
- FURINA: Free from Unmergeable Router via LINear Aggregation of mixed experts
- MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models
- Reveal and Release: Iterative LLM Unlearning with Self-generated Data
- (P)rior(D)yna(F)low: A Priori Dynamic Workflow Construction via Multi-Agent Collaboration
- TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
- Self-Improvement of Language Models by Post-Training on Multi-Agent Debate
- Fast and Fluent Diffusion Language Models via Convolutional Decoding and Rejective Fine-tuning
- Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents
- Masked Diffusion Models as Energy Minimization
- ZERA: Zero-init Instruction Evolving Refinement Agent -- From Zero Instructions to Structured Prompts via Principle-based Optimization
- Latent Traits and Cross-Task Transfer: Deconstructing Dataset Interactions in LLM Fine-tuning
- DSFT: Inspiring Diffusion Large Language Models to Comprehend Mathematical and Logical Patterns
- A Study on Thinking Patterns of Large Reasoning Models in Code Generation
- Aegis: Automated Error Generation and Attribution for Multi-Agent Systems
- Early Stopping Chain-of-thoughts in Large Language Models
- Teaching According to Talents! Instruction Tuning LLMs with Competence-Aware Curriculum Learning
- Slim-SC: Thought Pruning for Efficient Scaling with Self-Consistency
- Explain Before You Answer: A Survey on Compositional Visual Reasoning
- Meta-R1: Empowering Large Reasoning Models with Metacognition
- REAMS: Reasoning Enhanced Algorithm for Maths Solving
- FVDebug: An LLM-Driven Debugging Assistant for Automated Root Cause Analysis of Formal Verification Failures
- From Language to Action: A Review of Large Language Models as Autonomous Agents and Tool Users
- The Anatomy of Alignment: Decomposing Preference Optimization by Steering Sparse Features
- All Roads Lead to Rome: Graph-Based Confidence Estimation for Large Language Model Reasoning
- LTA-thinker: Latent Thought-Augmented Training Framework for Large Language Models on Complex Reasoning
- EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer
- Root Cause Analysis of Radiation Oncology Incidents Using Large Language Models
- MaRVL-QA: A Benchmark for Mathematical Reasoning over Visual Landscapes
- AMQ: Enabling AutoML for Mixed-precision Weight-Only Quantization of Large Language Models
- POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization
- D2HScore: Reasoning-Aware Hallucination Detection via Semantic Breadth and Depth Analysis in LLMs
- HARP: Hallucination Detection via Reasoning Subspace Projection
- Preservation of Language Understanding Capabilities in Speech-aware Large Language Models
- What Matters in Data for DPO?
- MALLM: Multi-Agent Large Language Models Framework
- ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
- Fluid Language Model Benchmarking
- MAPGD: Multi-Agent Prompt Gradient Descent for Collaborative Prompt Optimization
- Harnessing Optimization Dynamics for Curvature-Informed Model Merging
- Difficulty-Aware Agentic Orchestration for Query-Specific Multi-Agent Workflows
- PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits
- AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs
- From Parameters to Performance: A Data-Driven Study on LLM Structure and Development
- Limitations of refinement methods for weak to strong generalization
- No Answer Needed: Predicting LLM Answer Accuracy from Question-Only Linear Probes
- LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
- Unsupervised Hallucination Detection by Inspecting Reasoning Processes
- CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
- Bridging the Capability Gap: Joint Alignment Tuning for Harmonizing LLM-based Multi-Agent Systems
- Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference
- TORSO: Template-Oriented Reasoning Towards General Tasks
- Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs
- Tree-OPO: Off-policy Monte Carlo Tree-Guided Advantage Optimization for Multistep Reasoning
- LLM-JEPA: Large Language Models Meet Joint Embedding Predictive Architectures
- ForTIFAI: Fending Off Recursive Training Induced Failure for AI Model Collapse
- FRIT: Using Causal Importance to Improve Chain-of-Thought Faithfulness
- Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models
- EvolKV: Evolutionary KV Cache Compression for LLM Inference
- Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization
- Mitigating Catastrophic Forgetting in Large Language Models with Forgetting-aware Pruning
- Language Self-Play For Data-Free Training
- PersonaFuse: A Personality Activation-Driven Framework for Enhancing Human-LLM Interactions
- RIMO: An Easy-to-Evaluate, Hard-to-Solve Olympiad Benchmark for Advanced Mathematical Reasoning
- Unleashing the True Potential of LLMs: A Feedback-Triggered Self-Correction with Long-Term Multipath Decoding
- Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
- Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding
- COMPACT: Common-token Optimized Model Pruning Across Channels and Tokens
- MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security
- LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection
- Ban&Pick: Ehancing Performance and Efficiency of MoE-LLMs via Smarter Routing
- Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
- Error Reflection Prompting: Can Large Language Models Successfully Understand Errors?
- IPR: Intelligent Prompt Routing with User-Controlled Quality-Cost Trade-offs
- Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL
- From Long to Short: LLMs Excel at Trimming Own Reasoning Chains
- Hyperbolic Large Language Models
- Orchestrator: Active Inference for Multi-Agent Systems in Long-Horizon Tasks
- AntiDote: Bi-level Adversarial Training for Tamper-Resistant LLMs
- Self-Aligned Reward: Towards Effective and Efficient Reasoners
- PLaMo 2 Technical Report
- Post-training Large Language Models for Diverse High-Quality Responses
- Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts
- Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
- Rethinking Reasoning in LLMs: Neuro-Symbolic Local RetoMaton Beyond ICL and CoT
- DreamPRM-1.5: Unlocking the Potential of Each Instance for Multimodal Process Reward Model Training
- Talk Isn't Always Cheap: Understanding Failure Modes in Multi-Agent Debate
- Hunyuan-MT Technical Report
- FLAMES: Improving LLM Math Reasoning via a Fine-Grained Analysis of the Data Synthesis Pipeline
- Delta Activations: A Representation for Finetuned Large Language Models
- Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?
- Set Block Decoding is a Language Model Inference Accelerator
- CoT-Space: A Theoretical Framework for Internal Slow-Thinking via Reinforcement Learning
- On Robustness and Reliability of Benchmark-Based Evaluation of LLMs
- A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
- Learning to Deliberate: Meta-policy Collaboration for Agentic LLMs with Multi-agent Reinforcement Learning
- A Probabilistic Inference Scaling Theory for LLM Self-Correction
- Systematic Characterization of LLM Quantization: A Performance, Energy, and Quality Perspective
- SharedRep-RLHF: A Shared Representation Approach to RLHF with Diverse Preferences
- Cetvel: A Unified Benchmark for Evaluating Language Understanding, Generation and Cultural Capacity of LLMs for Turkish
- Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents
- Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training
- AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
- TeRA: Vector-based Random Tensor Network for High-Rank Adaptation of Large Language Models
- Adaptive Preference Optimization with Uncertainty-aware Utility Anchor
- Adaptive KV-Cache Compression without Manually Setting Budget
- PromptCOS: Towards Content-only System Prompt Copyright Auditing for LLMs
- Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning
- Efficient Training-Free Online Routing for High-Volume Multi-LLM Serving
- Surrogate Benchmarks for Model Merging Optimization
- Implicit Reasoning in Large Language Models: A Comprehensive Survey
- Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
- Batch Query Processing and Optimization for Agentic Workflows
- Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation
- GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation
- Improving Large Vision and Language Models by Learning from a Panel of Peers
- Causal Consistency Regularization: Training Verifiably Sensitive Reasoning in Large Language Models
- LLMs cannot spot math errors, even when allowed to peek into the solution
- Reasoning Vectors: Transferring Chain-of-Thought Capabilities via Task Arithmetic
- KoBLEX: Open Legal Question Answering with Multi-hop Reasoning
- GradeSQL: Test-Time Inference with Outcome Reward Models for Text-to-SQL Generation from Large Language Models
- Rethinking the Chain-of-Thought: The Roles of In-Context Learning and Pre-trained Priors
- VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
- Dream-Coder 7B: An Open Diffusion Language Model for Code
- Enhancing Uncertainty Estimation in LLMs with Expectation of Aggregated Internal Belief
- Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling
- DSDE: Dynamic Speculative Decoding with KLD Stability for Real-World Serving
- LongCat-Flash Technical Report
- Aligning Reasoning LLMs for Materials Discovery with Physics-aware Rejection Sampling
- Any-Order Flexible Length Masked Diffusion
- LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model
- When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment
- Universal Properties of Activation Sparsity in Modern Large Language Models
- Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
- Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online
- Democratizing Agentic AI with Fast Test-Time Scaling on the Edge
- Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics
- PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains
- Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
- HyperFlexis: Joint Design of Algorithms and Systems for Multi-SLO Serving and Fast Scaling
- Evaluating Differentially Private Generation of Domain-Specific Text
- UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools
- Measuring Reasoning Utility in LLMs via Conditional Entropy Reduction
- NPG-Muse: Scaling Long Chain-of-Thought Reasoning with NP-Hard Graph Problems
- Language Models and Logic Programs for Trustworthy Tax Reasoning
- Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
- SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models
- SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control
- Diffusion Language Models Know the Answer Before Decoding
- PSO-Merging: Merging Models Based on Particle Swarm Optimization
- Benchmarking Hindi LLMs: A New Suite of Datasets and a Comparative Analysis
- Principled Personas: Defining and Measuring the Intended Effects of Persona Prompting on Task Performance
- Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs
- CompLex: Music Theory Lexicon Constructed by Autonomous Agents for Automatic Music Generation
- Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding
- Entropy-Guided Loop: Achieving Reasoning through Uncertainty-Aware Generation
- StepWiser: Stepwise Generative Judges for Wiser Reasoning
- Predicting the Order of Upcoming Tokens Improves Language Modeling
- Federated Fine-Tuning of Sparsely-Activated Large Language Models on Resource-Constrained Devices
- Test-time Corpus Feedback: From Retrieval to RAG
- Reflection-Enhanced Meta-Optimization Integrating TextGrad-style Prompt Optimization with Memory-Driven Self-Evolution
- Arrows of Math Reasoning Data Synthesis for Large Language Models: Diversity, Complexity and Correctness
- Dynamic Collaboration of Multi-Language Models based on Minimal Complete Semantic Units
- Answering the Unanswerable Is to Err Knowingly: Analyzing and Mitigating Abstention Failures in Large Reasoning Models
- UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning
- Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks
- Beyond Benchmark: LLMs Evaluation with an Anthropomorphic and Value-oriented Roadmap
- RLMR: Reinforcement Learning with Mixed Rewards for Creative Writing
- Scaling Laws for Task-Stratified Knowledge in Post-Training Quantized Large Language Models
- ConfTuner: Training Large Language Models to Express Their Confidence Verbally
- Principled Detection of Hallucinations in Large Language Models via Multiple Testing
- Latent Self-Consistency for Reliable Majority-Set Selection in Short- and Long-Answer Reasoning
- DualSparse-MoE: Coordinating Tensor/Neuron-Level Sparsity with Expert Partition and Reconstruction
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- WISCA: A Lightweight Model Transition Method to Improve LLM Training via Weight Scaling
- Teaching LLMs to Think Mathematically: A Critical Study of Decision-Making via Optimization
- VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models
- CARFT: Boosting LLM Reasoning via Contrastive Learning with Annotated Chain-of-Thought-based Reinforced Fine-Tuning
- Dream 7B: Diffusion Large Language Models
- Transduction is All You Need for Structured Data Workflows
- Trust but Verify! A Survey on Verification Design for Test-time Scaling
- Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset
- Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs
- Long Chain-of-Thought Reasoning Across Languages
- MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
- Understanding Data Influence with Differential Approximation
- NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model
- Inv-Entropy: A Fully Probabilistic Framework for Uncertainty Quantification in Language Models
- Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
- Prompt Orchestration Markup Language
- Generics and Default Reasoning in Large Language Models
- Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation
- Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR
- DPad: Efficient Diffusion Language Models with Suffix Dropout
- PC-Sampler: Position-Aware Calibration of Decoding Bias in Masked Diffusion Models
- CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features
- FedSODA: Federated Fine-tuning of LLMs via Similarity Group Pruning and Orchestrated Distillation Alignment
- Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
- Mini-Omni-Reasoner: Token-Level Thinking-in-Speaking in Large Speech Models
- Signal and Noise: A Framework for Reducing Uncertainty in Language Model Evaluation
- EvolMathEval: Towards Evolvable Benchmarks for Mathematical Reasoning via Evolutionary Testing
- Can Large Models Teach Student Models to Solve Mathematical Problems Like Human Beings? A Reasoning Distillation Method via Multi-LoRA Interaction
- A Stitch in Time Saves Nine: Proactive Self-Refinement for Language Models
- Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models
- Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position
- ReaLM: Reflection-Enhanced Autonomous Reasoning with Small Language Models
- Too Easily Fooled? Prompt Injection Breaks LLMs on Frustratingly Simple Multiple-Choice Questions
- DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections
- Mitigating Jailbreaks with Intent-Aware LLMs
- Chart-CoCa: Self-Improving Chart Understanding of Vision LMs via Code-Driven Synthesis and Candidate-Conditioned Answering
- QuarkMed Medical Foundation Model Technical Report
- Mind the Generation Process: Fine-Grained Confidence Estimation During LLM Generation
- Data Mixing Optimization for Supervised Fine-Tuning of Large Language Models
- On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
- Aware First, Think Less: Dynamic Boundary Self-Awareness Drives Extreme Reasoning Efficiency in Large Language Models
- LLM Compression: How Far Can We Go in Balancing Size and Performance?
- Inclusion Arena: An Open Platform for Evaluating Large Foundation Models with Real-World Apps
- Dynamic Quality-Latency Aware Routing for LLM Inference in Wireless Edge-Device Networks
- Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information
- Hard Examples Are All You Need: Maximizing GRPO Post-Training Under Annotation Budgets
- Automatic Prompt Engineering for Automatic Scoring
- Thinking Inside the Mask: In-Place Prompting in Diffusion LLMs
- MSRS: Adaptive Multi-Subspace Representation Steering for Attribute Alignment in Large Language Models
- Improving Value-based Process Verifier via Low-Cost Variance Reduction
- XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization
- Bridging the Culture Gap: A Framework for LLM-Driven Socio-Cultural Localization of Math Word Problems in Low-Resource Languages
- Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization
- mSCoRe: a Multilingual and Scalable Benchmark for Skill-based Commonsense Reasoning
- Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
- Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
- Beyond Scaling Law: A Data-Efficient Distillation Framework for Reasoning
- MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
- EffiEval: Efficient and Generalizable Model Evaluation via Capability Coverage Maximization
- Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
- READER: Retrieval-Assisted Drafter for Efficient LLM Inference
- Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
- A Survey of Optimization Modeling Meets LLMs: Progress and Future Directions
- GreenTEA: Gradient Descent with Topic-modeling and Evolutionary Auto-prompting
- Aryabhata: An exam-focused language model for JEE Math
- An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems
- Retrospective Sparse Attention for Efficient Long-Context Generation
- Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language Models
- OverFill: Two-Stage Models for Efficient Language Model Decoding
- BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks
- AdaptFlow: Adaptive Workflow Optimization via Meta-Learning
- WeChat-YATT: A Scalable, Simple, Efficient, and Production Ready Training Library
- Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression
- EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning
- Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
- Gradient Surgery for Safe LLM Fine-Tuning
- MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams
- Sample-efficient LLM Optimization with Reset Replay
- LLM Unlearning Without an Expert Curated Dataset
- SABER: Switchable and Balanced Training for Efficient LLM Reasoning
- UR2: Unify RAG and Reasoning through Reinforcement Learning
- Fine-Grained Safety Neurons with Training-Free Continual Projection to Reduce LLM Fine Tuning Risks
- MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models
- Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing
- In-Training Defenses against Emergent Misalignment in Language Models
- DP-LLM: Runtime Model Adaptation with Dynamic Layer-wise Precision Assignment
- Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
- Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle
- MathSmith: Towards Extremely Hard Mathematical Reasoning by Forging Synthetic Problems with a Reinforced Policy
- Bench-2-CoP: Can We Trust Benchmarking for EU AI Compliance?
- LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
- A Novel Architecture for Symbolic Reasoning with Decision Trees and LLM Agents
- MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs
- Align, Don't Divide: Revisiting the LoRA Architecture in Multi-Task Learning
- SPaRFT: Self-Paced Reinforcement Fine-Tuning for Large Language Models
- Decoupling Understanding from Reasoning via Problem Space Mapping for Small-Scale Model Reasoning
- IFDECORATOR: Wrapping Instruction Following Reinforcement Learning with Verifiable Rewards
- CARD: A Cache-Assisted Parallel Speculative Decoding Framework via Query-and-Correct Paradigm for Accelerating LLM Inference
- From "Aha Moments" to Controllable Thinking: Toward Meta-Cognitive Reasoning in Large Reasoning Models via Decoupled Reasoning and Control
- GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
- KG-Augmented Executable CoT for Mathematical Coding
- COPO: Consistency-Aware Policy Optimization
- Enhancing Serendipity Recommendation System by Constructing Dynamic User Knowledge Graphs with Large Language Models
- Tensorized Clustered LoRA Merging for Multi-Task Interference
- Putnam-AXIOM: A Functional and Static Benchmark for Measuring Higher Level Mathematical Reasoning in LLMs
- CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward
- LLMs are Single-threaded Reasoners: Demystifying the Working Mechanism of Soft Thinking
- Hide and Seek with LLMs: An Adversarial Game for Sneaky Error Generation and Self-Improving Diagnosis
- Compressing Chain-of-Thought in LLMs via Step Entropy
- RCP-Merging: Merging Long Chain-of-Thought Models with Domain-Specific Models by Considering Reasoning Capability as Prior
- RegMean++: Enhancing Effectiveness and Generalization of Regression Mean for Model Merging
- VFLAIR-LLM: A Comprehensive Framework and Benchmark for Split Learning of LLMs
- When AI Evaluates Its Own Work: Validating Learner-Initiated, AI-Generated Physics Practice Problems
- Thinking with Nothinking Calibration: A New In-Context Learning Paradigm in Reasoning Large Language Models
- Polymath: A Self-Optimizing Agent with Dynamic Hierarchical Workflow
- PLoRA: Efficient LoRA Hyperparameter Tuning for Large Models
- CAMA: Enhancing Mathematical Reasoning in Large Language Models with Causal Knowledge
- Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty
- Learning Temporal Abstractions via Variational Homomorphisms in Option-Induced Abstract MDPs
- Everyone Contributes! Incentivizing Strategic Cooperation in Multi-LLM Systems via Sequential Public Goods Games
- Test-time Prompt Intervention
- Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction
- Parameter-Efficient Routed Fine-Tuning: Mixture-of-Experts Demands Mixture of Adaptation Modules
- Reconsidering Overthinking: Penalizing Internal and External Redundancy in CoT Reasoning
- MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
- SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference
- EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
- ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models
- Large-Scale Diverse Synthesis for Mid-Training
- AffectGPT-R1: Leveraging Reinforcement Learning for Open-Vocabulary Multimodal Emotion Recognition
- LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
- Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
- R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge
- Latent Knowledge Scalpel: Precise and Massive Knowledge Editing for Large Language Models
- WMAS: A Multi-Agent System Towards Intelligent and Customized Wireless Networks
- Multi-Layer Attention is the Amplifier of Demonstration Effectiveness
- Llama-3.1-FoundationAI-SecurityLLM-8B-Instruct Technical Report
- Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models
- RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
- Hierarchical Budget Policy Optimization for Adaptive Reasoning
- EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes
- GanitBench: A bi-lingual benchmark for evaluating mathematical reasoning in Vision Language Models
- PhysicsEval: Inference-Time Techniques to Improve the Reasoning Proficiency of Large Language Models on Physics Problems
- Cascaded Information Disclosure for Generalized Evaluation of Problem Solving Capabilities
- Self-Foveate: Enhancing Diversity and Difficulty of Synthesized Instructions from Unsupervised Text via Multi-Level Foveation
- Unveiling Super Experts in Mixture-of-Experts Large Language Models
- BAR Conjecture: the Feasibility of Inference Budget-Constrained LLM Services with Authenticity and Reasoning
- Beyond Passive Critical Thinking: Fostering Proactive Questioning to Enhance Human-AI Collaboration
- DialogueForge: LLM Simulation of Human-Chatbot Dialogue
- Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems
- Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?
- FormulaOne: Measuring the Depth of Algorithmic Reasoning Beyond Competitive Programming
- Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning
- P3: Prompts Promote Prompting
- Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
- Strategic Deflection: Defending LLMs from Logit Manipulation
- Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training
- Post-Training Large Language Models via Reinforcement Learning from Self-Feedback
- UnsafeChain: Enhancing Reasoning Model Safety via Hard Cases
- CHECK-MAT: Checking Hand-Written Mathematical Answers for the Russian Unified State Exam
- LoRA-PAR: A Flexible Dual-System LoRA Partitioning Approach to Efficient LLM Fine-Tuning
- How Chain-of-Thought Works? Tracing Information Flow from Decoding, Projection, and Activation
- Kimi K2: Open Agentic Intelligence
- SAND-Math: Using LLMs to Generate Novel, Difficult and Useful Mathematics Questions and Answers
- STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
- The Blessing and Curse of Dimensionality in Safety Alignment
- Post-Completion Learning for Language Models
- From Benchmarks to Skills: Low-Rank Factors for LLM Evaluation
- Diversity-Enhanced Reasoning for Subjective Questions
- MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge
- PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
- StackTrans: From Large Language Model to Large Pushdown Automata Model
- Voxtral
- A Survey on Generative Model Unlearning: Fundamentals, Taxonomy, Evaluation, and Future Direction
- Agentic Reinforced Policy Optimization
- JT-Math: A Multi-Stage Framework for Advanced Mathematical Reasoning in Large Language Models
- CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative Feedback
- AGORA: Incentivizing Group Emergence Capability in LLMs via Group Distillation
- SESR-Eval: Dataset for Evaluating LLMs in the Title-Abstract Screening of Systematic Reviews
- A Toolbox, Not a Hammer -- Multi-TAG: Scaling Math Reasoning with Multi-Tool Aggregation
- How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework
- CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages
- TRPrompt: Bootstrapping Query-Aware Prompt Optimization from Textual Rewards
- Wide-In, Narrow-Out: Revokable Decoding for Efficient and Effective DLLMs
- CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning
- BadReasoner: Planting Tunable Overthinking Backdoors into Large Reasoning Models for Fun or Profit
- Innovator: Scientific Continued Pretraining with Fine-grained MoE Upcycling
- Decoupling Knowledge and Reasoning in LLMs: An Exploration Using Cognitive Dual-System Theory
- Maximizing Prefix-Confidence at Test-Time Efficiently Improves Mathematical Reasoning
- Hybrid and Unitary PEFT for Resource-Efficient Large Language Models
- Resource Consumption Red-Teaming for Large Vision-Language Models
- Assemble Your Crew: Automatic Multi-agent Communication Topology Design via Autoregressive Graph Generation
- CLEAR: Error Analysis via LLM-as-a-Judge Made Easy
- Checklists Are Better Than Reward Models For Aligning Language Models
- PromptSuite: A Task-Agnostic Framework for Multi-Prompt Generation
- AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- Mitigating Factual Hallucination in Large Reasoning Models via Mixed-Mode Advantage Regularization
- Discretizing Reward Models
- SASFT: Sparse Autoencoder-guided Supervised Finetuning to Mitigate Unexpected Code-Switching in LLMs
- Demystifying Hidden-State Recurrence: Switchable Latent Reasoning with On-Policy Reinforcement Learning
- The Role of Feedback Alignment in Self-Distillation
- A Primer in Post-Training Reasoning Data: What We Know About How It Works
- Mellum2 Technical Report
- Unlocking the Working Memory of Large Language Models for Latent Reasoning
- GRID: Scalable Task-Agnostic Prompt-Based Continual Learning for Language Models
- MathDuels: Evaluating LLMs as Problem Posers and Solvers
- Computational Arbitrage in AI Model Markets
- V1: Unifying Generation and Self-Verification for Parallel Reasoners
- Retrieval-Aware Distillation for Transformer-SSM Hybrids
- GRP-Obliteration: Unaligning LLMs With a Single Unlabeled Prompt
- Benchmarking Gaslighting Negation Attacks Against Reasoning Models
- Pretraining on the Test Set Is No Longer All You Need: A Debate-Driven Approach to QA Benchmarks
- URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
- MultiNRC: A Challenging and Native Multilingual Reasoning Evaluation Benchmark for LLMs
- R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning
- The Geometry of Harmfulness in LLMs through Subconcept Probing
- CLARIFID: Improving Radiology Report Generation by Reinforcing Clinically Accurate Impressions and Enforcing Detailed Findings
- WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training
- GenSelect: A Generative Approach to Best-of-N
- Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring
- Towards Greater Leverage: Scaling Laws for Efficient Mixture-of-Experts Language Models
- Can External Validation Tools Improve Annotation Quality for LLM-as-a-Judge?
- MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning
- SpeLLM: Character-Level Multi-Head Decoding
- C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning
- The Ever-Evolving Science Exam
- INTEGRALBENCH: Benchmarking LLMs with Definite Integral Problems
- A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning
- Know What You Don't Know: Uncertainty Calibration of Process Reward Models
- VAR-MATH: Probing True Mathematical Reasoning in LLMS via Symbolic Multi-Instance Benchmarks
- Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
- The Serial Scaling Hypothesis
- Language Models Improve When Pretraining Data Matches Target Tasks
- DIVE into MoE: Diversity-Enhanced Reconstruction of Large Language Models from Dense into Mixture-of-Experts
- ROC-n-reroll: How verifier imperfection affects test-time scaling
- Probing for Arithmetic Errors in Language Models
- GigaChat Family: Efficient Russian Language Modeling Through Mixture of Experts Architecture
- DAC: A Dynamic Attention-aware Approach for Task-Agnostic Prompt Compression
- Findings of MEGA: Maths Explanation with LLMs using the Socratic Method for Active Learning
- BlockBPE: Parallel BPE Tokenization
- Thought Purity: A Defense Framework For Chain-of-Thought Attack
- SLED: A Speculative LLM Decoding Framework for Efficient Edge Serving
- Reasoning Strategies in Large Language Models: Can They Follow, Prefer, and Optimize?
- KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?
- The Emergence of Abstract Thought in Large Language Models Beyond Any Language
- ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
- SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning
- Learning to Reason Across Parallel Samples for LLM Reasoning
- PALM: Synergizing Program Analysis and LLMs to Enhance Rust Unit Test Coverage
- A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search
- Educators' Perceptions of Large Language Models as Tutors: Comparing Human and AI Tutors in a Blind Text-only Setting
- AsFT: Anchoring Safety During LLM Fine-Tuning Within Narrow Safety Basin
- SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
- MasHost Builds It All: Autonomous Multi-Agent System Directed by Reinforcement Learning
- LLM-as-a-qualitative-judge: automating error analysis in natural language generation
- AdaMuon: Adaptive Muon Optimizer
- A Survey on Large Language Models for Mathematical Reasoning
- LLMs are Bayesian, In Expectation, Not in Realization
- DCR: Quantifying Data Contamination in LLMs Evaluation
- FMC: Formalization of Natural Language Mathematical Competition Problems
- REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once
- ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
- Deep Hidden Cognition Facilitates Reliable Chain-of-Thought Reasoning
- FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data
- Differentially Private Federated Low Rank Adaptation Beyond Fixed-Matrix
- AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions
- Large Language Models Encode Semantics and Alignment in Linearly Separable Representations
- Reframing SAR Target Recognition as Visual Reasoning: A Chain-of-Thought Dataset with Multimodal LLMs
- RedOne: Revealing Domain-specific LLM Post-Training in Social Networking Services
- Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey
- Can A Gamer Train A Mathematical Reasoning Model?
- Demystifying Entropy-based Selection for Chain-of-Thought Compression in Large Reasoning Models
- Scalpel vs. Hammer: GRPO Amplifies Existing Capabilities, SFT Replaces Them
- DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models
- The Geometries of Truth Are Orthogonal Across Tasks
- Know-MRI: A Knowledge Mechanisms Revealer&Interpreter for Large Language Models
- CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards
- Reinforce LLM Reasoning through Multi-Agent Reflection
- ALIGN: Prompt-based Attribute Alignment for Reliable, Responsible, and Personalized LLM-based Decision-Making
- Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
- Optimizing Sequential Multi-Step Tasks with Parallel LLM Agents
- KV Cache Steering for Controlling Frozen LLMs
- One Token to Fool LLM-as-a-Judge
- Introspection of Thought Helps AI Agents
- The AI Language Proficiency Monitor -- Tracking the Progress of LLMs on Multilingual Benchmarks
- From Language to Logic: A Bi-Level Framework for Structured Reasoning
- Can Large Language Models Understand As Well As Apply Patent Regulations to Pass a Hands-On Patent Attorney Test?
- Inference-Time Scaling of Diffusion Language Models with Particle Gibbs Sampling
- Can LLMs Reliably Simulate Real Students' Abilities in Mathematics and Reading Comprehension?
- Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
- TruthTorchLM: A Comprehensive Library for Predicting Truthfulness in LLM Outputs
- CTRLS: Chain-of-Thought Reasoning via Latent State-Transition
- Why is Your Language Model a Poor Implicit Reward Model?
- Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code
- FlexOlmo: Open Language Models for Flexible Data Use
- CRISP: Complex Reasoning with Interpretable Step-based Plans
- Integrating External Tools with Large Language Models to Improve Accuracy
- Reflection or Re-Generation? Why LLM Revision Fails Where Human Revision Succeeds
- Adaptive Termination for Multi-round Parallel Reasoning: An Universal Semantic Entropy-Guided Framework
- BLADE: Boundary-Expanded and Layer-Adaptive Dynamic Exit for Efficient LLM Reasoning
- The Primacy of Magnitude in Low-Rank Adaptation
- CCQ: Convolutional Code for Extreme Low-bit Quantization in LLMs
- Evolution without Large Models: Training Language Model with Task Principles
- The Delta Learning Hypothesis: Preference Tuning on Weak Data can Yield Strong Gains
- Enhancing Test-Time Scaling of Large Language Models with Hierarchical Retrieval-Augmented MCTS
- AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction
- Deprecating Benchmarks: Criteria and Framework
- DocTalk: Scalable Graph-based Dialogue Synthesis for Enhancing LLM Conversational Capabilities
- CoRE: Enhancing Metacognition with Label-free Self-evaluation in LRMs
- BlueLM-2.5-3B Technical Report
- Steering Information Utility in Key-Value Memory for Language Model Post-Training
- Activation Steering for Chain-of-Thought Compression
- Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
- Who's the Mole? Modeling and Detecting Intention-Hiding Malicious Agents in LLM-Based Multi-Agent Systems
- wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models
- Train-before-Test Harmonizes Language Model Rankings
- TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter
- Discrete Diffusion Trajectory Alignment via Stepwise Decomposition
- Learn Globally, Speak Locally: Bridging the Gaps in Multilingual Reasoning
- Pre-Trained Policy Discriminators are General Reward Models
- LoSiA: Efficient High-Rank Fine-Tuning via Subnet Localization and Optimization
- Does Learning Mathematical Problem-Solving Generalize to Broader Reasoning?
- EmoPrefer: Can Large Language Models Understand Human Emotion Preferences?
- ESSA: Evolutionary Strategies for Scalable Alignment
- Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models
- CortexDebate: Debating Sparsely and Equally for Multi-Agent Debate
- Importance-Aware Activation Space Reconstruction
- APPO: Agentic Procedural Policy Optimization
- The Self-Correction Illusion: Role Relabeling Gates Explicit Error Flagging in Large Language Models
- BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset
- Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
- MOTIF: Modular Thinking via Reinforcement Fine-tuning in LLMs
- ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning
- FlowSpec: Continuous Pipelined Speculative Decoding for Efficient Distributed LLM Inference
- Think How to Think: Mitigating Overthinking with Autonomous Difficulty Cognition in Large Reasoning Models
- OmniDraft: A Cross-vocabulary, Online Adaptive Drafter for On-device Speculative Decoding
- ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
- RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents
- Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
- Cautious Next Token Prediction
- Scaling LLM Planning: NL2FLOW for Parametric Problem Generation and Rigorous Evaluation
- Latent Chain-of-Thought? Decoding the Depth-Recurrent Transformer
- Energy-Based Transformers are Scalable Learners and Thinkers
- Reasoning on a Budget: A Survey of Adaptive and Controllable Test-Time Compute in LLMs
- High-Layer Attention Pruning with Rescaling
- Frontiers of Generative AI for Network Optimization: Theories, Limits, and Visions
- Tuning without Peeking: Provable Generalization Bounds and Robust LLM Post-Training
- LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
- LEDOM: Reverse Language Model
- LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning
- Eka-Eval: An Evaluation Framework for Low-Resource Multilingual Large Language Models
- Probing and Steering Evaluation Awareness of Language Models
- MiCoTA: Bridging the Learnability Gap with Intermediate CoT and Teacher Assistants
- Exploring Advanced LLM Multi-Agent Systems Based on Blackboard Architecture
- ICLShield: Exploring and Mitigating In-Context Learning Backdoor Attacks
- La Leaderboard: A Large Language Model Leaderboard for Spanish Varieties and Languages of Spain and Latin America
- Mixture of Reasonings: Teach Large Language Models to Reason with Adaptive Strategies
- GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
- Mathematics Isn't Culture-Free: Probing Cultural Gaps via Entity and Scenario Perturbations
- VisioMath: Benchmarking Figure-based Mathematical Reasoning in LMMs
- Reasoning as an Adaptive Defense for Safety
- Pitfalls of Evaluating Language Models with Open Benchmarks
- On Reasoning Strength Planning in Large Reasoning Models
- Efficient Post-Training Refinement of Latent Reasoning in Large Language Models
- Performance of LLMs on Stochastic Modeling Operations Research Problems: From Theory to Practice
- Enhancing Reasoning Capabilities of Small Language Models with Blueprints and Prompt Template Search
- Advancing Multi-Step Mathematical Reasoning in Large Language Models through Multi-Layered Self-Reflection with Auto-Prompting
- Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models
- Semantic-guided Diverse Decoding for Large Language Model
- Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective
- QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA
- DABstep: Data Agent Benchmark for Multi-step Reasoning
- Large Language Models Don't Make Sense of Word Problems. A Scoping Review from a Mathematics Education Perspective
- User Behavior Prediction as a Generic, Robust, Scalable, and Low-Cost Evaluation Strategy for Estimating Generalization in LLMs
- Learning to Focus: Causal Attention Distillation via Gradient-Guided Token Pruning
- ATGen: A Framework for Active Text Generation
- Learning-to-Context Slope: Evaluating In-Context Learning Effectiveness Beyond Performance Illusions
- Theoretical Modeling of Large Language Model Self-Improvement Training Dynamics Through Solver-Verifier Gap
- Empowering Small VLMs to Think with Dynamic Memorization and Exploration
- VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
- Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models
- Improving Rationality in the Reasoning Process of Language Models through Self-playing Game
- Improving Large Language Models with Concept-Aware Fine-Tuning
- OptScale: Probabilistic Optimality for Inference-time Scaling
- EFRame: Deeper Reasoning via Exploration-Filter-Replay Reinforcement Learning Framework
- Memory Savings at What Cost? A Study of Alternatives to Backpropagation
- AbstRaL: Augmenting LLMs' Reasoning by Reinforcing Abstract Thinking
- The Hidden Link Between RLHF and Contrastive Learning
- Layer Importance for Mathematical Reasoning is Forged in Pre-Training and Invariant after Post-Training
- LoRMA: Low-Rank Multiplicative Adaptation for LLMs
- Training Language Model to Critique for Better Refinement
- Active Inference AI Systems for Scientific Discovery
- Complexity-aware fine-tuning
- Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions
- OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
- From Calibration to Collaboration: LLM Uncertainty Quantification Should Be More Human-Centered
- Enhancing LLM Tool Use with High-quality Instruction Data from Knowledge Graph
- Multi-lingual Functional Evaluation for Large Language Models
- Model Editing as a Double-Edged Sword: Steering Agent Ethical Behavior Toward Beneficence or Harm
- When Life Gives You Samples: The Benefits of Scaling up Inference Compute for Multilingual LLMs
- Ctrl-Z Sampling: Diffusion Sampling with Controlled Random Zigzag Explorations
- AALC: Large Language Model Efficient Reasoning via Adaptive Accuracy-Length Control
- DuoGPT: Training-free Dual Sparsity through Activation-aware Pruning in LLMs
- Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation
- The Decrypto Benchmark for Multi-Agent Reasoning and Theory of Mind
- DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation
- Adapt Once, Thrive with Updates: Transferable Parameter-Efficient Fine-Tuning on Evolving Base Models
- PLoP: Precise LoRA Placement for Efficient Finetuning of Large Models
- Test-time Scaling Techniques in Theoretical Physics -- A Comparison of Methods on the TPBench Dataset
- Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks
- OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling
- Synthesis by Design: Controlled Data Generation via Structural Guidance
- Scaling Speculative Decoding with Lookahead Reasoning
- Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction
- Position: Machine Learning Conferences Should Establish a "Refutations and Critiques" Track
- Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models
- Compound AI Systems Optimization: A Survey of Methods, Challenges, and Future Directions
- Reparameterized LLM Training via Orthogonal Equivalence Transformation
- Augmenting Multi-Agent Communication with State Delta Trajectory
- HiMA-Ecom: Enabling Joint Training of Hierarchical Multi-Agent E-commerce Assistants
- Distilling Tool Knowledge into Language Models via Back-Translated Traces
- Plan for Speed: Dilated Scheduling for Masked Diffusion Language Models
- OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization
- CommVQ: Commutative Vector Quantization for KV Cache Compression
- MiniCPM4: Ultra-Efficient LLMs on End Devices
- ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation
- Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
- PARALLELPROMPT: Extracting Parallelism from Large Language Model Queries
- ReDit: Reward Dithering for Improved LLM Policy Optimization
- Parallel Continuous Chain-of-Thought with Jacobi Iteration
- Confucius3-Math: A Lightweight High-Performance Reasoning LLM for Chinese K-12 Mathematics Learning
- ARD-LoRA: Dynamic Rank Allocation for Parameter-Efficient Fine-Tuning of Foundation Models with Heterogeneous Adaptation Needs
- RLPR: Extrapolating RLVR to General Domains without Verifiers
- Beyond Parameters: Exploring Virtual Logic Depth for Scaling Laws
- Infinity Instruct: Scaling Instruction Selection and Synthesis to Enhance Language Models
- Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations
- The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs
- RL for Reasoning by Adaptively Revealing Rationales
- RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models
- AnyMAC: Cascading Flexible Multi-Agent Collaboration via Next-Agent Prediction
- DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning
- Revisiting LoRA through the Lens of Parameter Redundancy: Spectral Encoding Helps
- Differentiation-Based Extraction of Proprietary Data from Fine-Tuned LLMs
- No Free Lunch: Rethinking Internal Feedback for LLM Reasoning
- From Concepts to Components: Concept-Agnostic Attention Module Discovery in Transformers
- OJBench: A Competition Level Code Benchmark For Large Language Models
- SGIC: A Self-Guided Iterative Calibration Framework for RAG
- GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
- Probing the Robustness of Large Language Models Safety to Latent Perturbations
- LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning
- Drag-and-Drop LLMs: Zero-Shot Prompt-to-Weights
- DynScaling: Efficient Verifier-free Inference Scaling via Dynamic and Integrated Sampling
- SparseLoRA: Accelerating LLM Fine-Tuning with Contextual Sparsity
- RiOT: Efficient Prompt Refinement with Residual Optimization Tree
- Exploring and Exploiting the Inherent Efficiency within Large Reasoning Models for Self-Guided Efficiency Enhancement
- LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning
- Gender Inclusivity Fairness Index (GIFI): A Multilevel Framework for Evaluating Gender Diversity in Large Language Models
- PredGen: Accelerated Inference of Large Language Models through Input-Time Speculation for Real-Time Speech Interaction
- Enhancing Watermarking Quality for LLMs via Contextual Generation States Awareness
- Gradients: When Markets Meet Fine-tuning -- A Distributed Approach to Model Optimisation
- SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling
- From Passive to Active Reasoning: Can Large Language Models Ask the Right Questions under Incomplete Information?
- Guideline Forest: Retrieval-Augmented Reasoning with Branching Experience-Induced Guidelines
- NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models
- Language Models can perform Single-Utterance Self-Correction of Perturbed Reasoning
- RE-IMAGINE: Symbolic Benchmark Synthesis for Reasoning Evaluation
- Fractional Reasoning via Latent Steering Vectors Improves Inference Time Compute
- RATTENTION: Towards the Minimal Sliding Window Size in Local-Global Attention Models
- Utility-Driven Speculative Decoding for Mixture-of-Experts
- Optimizing Length Compression in Large Reasoning Models
- AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models
- Massive Supervised Fine-tuning Experiments Reveal How Data, Layer, and Training Factors Shape LLM Alignment Quality
- Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding
- LoRA-Mixer: Coordinate Modular LoRA Experts Through Serial Attention Routing
- How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison
- MoORE: SVD-based Model MoE-ization for Conflict- and Oblivion-Resistant Multi-Task Adaptation
- Thunder-NUBench: A Benchmark for LLMs' Sentence-Level Negation Understanding
- DCRM: A Heuristic to Measure Response Pair Quality in Preference Optimization
- Re-Initialization Token Learning for Tool-Augmented Large Language Models
- Adapting Lightweight Vision Language Models for Radiological Visual Question Answering
- Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents
- What Makes a Good Natural Language Prompt?
- Improving LoRA with Variational Learning
- Overclocking LLM Reasoning: Monitoring and Controlling Thinking Path Lengths in LLMs
- Excessive Reasoning Attack on Reasoning LLMs
- Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models
- Value-Free Policy Optimization via Reward Partitioning
- What Happens During the Loss Plateau? Understanding Abrupt Learning in Transformers
- Unveiling the Learning Mind of Language Models: A Cognitive Framework and Empirical Study
- DualEdit: Mitigating Safety Fallback in LLM Backdoor Editing via Affirmation-Refusal Regulation
- Mixture of Cognitive Reasoners: Modular Reasoning with Brain-Like Specialization
- The Butterfly Effect: Neural Network Training Trajectories Are Highly Sensitive to Initial Conditions
- RULE: Reinforcement UnLEarning Achieves Forget-Retain Pareto Optimality
- AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy
- Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models
- Understand the Implication: Learning to Think for Pragmatic Understanding
- Dynamic Context-oriented Decomposition for Task-aware Low-rank Adaptation with Less Forgetting and Faster Convergence
- Keeping Up with the Models: Online Deployment and Routing of LLMs at Scale
- Position: Pause Recycling LoRAs and Prioritize Mechanisms to Uncover Limits and Effectiveness
- Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling Law
- Min-p, Max Exaggeration: A Critical Analysis of Min-p Sampling in Language Models
- HauntAttack: When Attack Follows Reasoning as a Shadow
- Chain of Methodologies: Scaling Test Time Computation without Training
- QFFT, Question-Free Fine-Tuning for Adaptive Reasoning
- Rethinking DPO: The Role of Rejected Responses in Preference Misalignment
- SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
- Flexible Realignment of Language Models
- Strategic Scaling of Test-Time Compute: A Bandit Learning Approach
- SciDA: Scientific Dynamic Assessor of LLMs
- PersonaFeedback: A Large-scale Human-annotated Benchmark For Personalization
SPECS: Faster Test-Time Scaling through Speculative Drafts- AI Flow: Perspectives, Scenarios, and Approaches
- AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint
- OpenUnlearning: Accelerating LLM Unlearning via Unified Benchmarking of Methods and Metrics
- Efficient Reasoning Through Suppression of Self-Affirmation Reflections in Large Reasoning Models
- From Outcomes to Processes: Guiding PRM Learning from ORM for Inference-Time Alignment
- EMLoC: Emulator-based Memory-efficient Fine-tuning with LoRA Correction
- DART: Distilling Autoregressive Reasoning to Silent Thought
- LearnAlign: Reasoning Data Selection for Reinforcement Learning in Large Language Models Based on Improved Gradient Alignment
- Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making
- Improving Large Language Model Safety with Contrastive Representation Learning
- Infini-gram mini: Exact n-gram Search at the Internet Scale with FM-Index
- Training-free LLM Verification via Recycling Few-shot Examples
- VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
- Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty
- ClusterUCB: Efficient Gradient-Based Data Selection for Targeted Fine-Tuning of LLMs
- OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics
- SwiftSpec: Ultra-Low Latency LLM Decoding by Scaling Asynchronous Speculative Decoding
- StepProof: Step-by-step verification of natural language mathematical proofs
- PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
- OPT-BENCH: Evaluating LLM Agent on Large-Scale Search Spaces Optimization Problems
- PREMISE: Scalable and Strategic Prompt Optimization for Efficient Mathematical Reasoning in Large Models
- Slimming Down LLMs Without Losing Their Minds
- TeleMath: A Benchmark for Large Language Models in Telecom Mathematical Problem Solving
- Test-Time-Scaling for Zero-Shot Diagnosis with Visual-Language Reasoning
- Multiverse: Your Language Models Secretly Decide How to Parallelize and Merge Generation
- Pareto Optimal Code Generation
- Causal Sufficiency and Necessity Improves Chain-of-Thought Reasoning
- Integrating Quantized LLMs into Robotics Systems as Edge AI to Leverage their Natural Language Processing Capabilities
- Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models
- Learning Distribution-Wise Control in Representation Space for Language Models
- Training-Free Tokenizer Transplantation via Orthogonal Matching Pursuit
- Epistemic Artificial Intelligence is Essential for Machine Learning Models to Truly 'Know When They Do Not Know'
- Corrector Sampling in Language Models
- MATP-BENCH: Can MLLM Be a Good Automated Theorem Prover for Multimodal Problems?
- dots.llm1 Technical Report
- Discrete Minds in a Continuous World: Do Language Models Know Time Passes?
- SPRINT: Enabling Interleaved Planning and Parallelized Execution in Reasoning Models
- Come Together, But Not Right Now: A Progressive Strategy to Boost Low-Rank Adaptation
- Token Signature: Predicting Chain-of-Thought Gains with Token Decoding Feature in Large Language Models
- Large Language Models are Demonstration Pre-Selectors for Themselves
- Topology of Reasoning: Understanding Large Reasoning Models through Reasoning Graph Properties
- Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey
- Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
- DynamicMind: A Tri-Mode Thinking System for Large Language Models
- SIGMA: Refining Large Language Model Reasoning via Sibling-Guided Monte Carlo Augmentation
- Conformal Prediction Adaptive to Unknown Subpopulation Shifts
- Sample Complexity and Representation Ability of Test-time Scaling Paradigms
- Enhancing Delta Compression in LLMs via SVD-based Quantization Error Minimization
- Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning
- Reshaping Reasoning in LLMs: A Theoretical Analysis of RL Training Dynamics through Pattern Selection
- Towards Better Generalization via Distributional Input Projection Network
- From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems
- Truly Self-Improving Agents Require Intrinsic Metacognitive Learning
- Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay
- TreeRPO: Tree Relative Policy Optimization
- ProRefine: Inference-Time Prompt Refinement with Textual Feedback
- TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering
- Multi-Layer GRPO: Enhancing Reasoning and Self-Correction in Large Language Models
- LogicPuzzleRL: Cultivating Robust Mathematical Reasoning in LLMs via Reinforcement Learning
- Simulating LLM-to-LLM Tutoring for Multilingual Math Feedback
- Inference-Time Hyper-Scaling with KV Cache Compression
- Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification
- Revisiting Test-Time Scaling: A Survey and a Diversity-Aware Method for Efficient Reasoning
- MMTU: A Massive Multi-Task Table Understanding and Reasoning Benchmark
- SPARTA ALIGNMENT: Collectively Aligning Multiple Language Models through Combat
- When Models Know More Than They Can Explain: Quantifying Knowledge Transfer in Human-AI Collaboration
- Crosslingual Reasoning through Test-Time Scaling
- Conformal Prediction Beyond the Seen: A Missing Mass Perspective for Uncertainty Quantification in Generative Models
- Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models
- List-Level Distribution Coupling with Applications to Speculative Decoding and Lossy Compression
- Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs
- Structured Pruning for Diverse Best-of-N Reasoning Optimization
- REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM
- Advancing and Benchmarking Personalized Tool Invocation for LLMs
- Nature's Insight: A Novel Framework and Comprehensive Analysis of Agentic Reasoning Through the Lens of Neuroscience
- Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers
- Beyond Theorem Proving: Formulation, Framework and Benchmark for Formal Problem-Solving
- STELLA: A Multimodal LLM for Protein Functional Annotation via Unified Sequence-Structure Encoding
- Learning to Insert [PAUSE] Tokens for Better Reasoning
- RobotxR1: Enabling Embodied Robotic Intelligence on Large Language Models through Closed-Loop Reinforcement Learning
- Exchange of Perspective Prompting Enhances Reasoning in Large Language Models
- POSS: Position Specialist Generates Better Draft for Speculative Decoding
- APT: Improving Specialist LLM Performance with Weakness Case Acquisition and Iterative Preference Training
- Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
- Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis
- Reason from Future: Reverse Thought Chain Enhances LLM Reasoning
- FreePRM: Training Process Reward Models Without Ground Truth Process Labels
- MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science
- Prompt Candidates, then Distill: A Teacher-Student Framework for LLM-driven Data Annotation
- Vulnerability-Aware Alignment: Mitigating Uneven Forgetting in Harmful Fine-Tuning
- Aligning Large Language Models with Implicit Preferences from User-Generated Content
- RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routing
- Bohdi: Heterogeneous LLM Fusion with Automatic Data Exploration
- AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism
- ClozeMath: Improving Mathematical Reasoning in Language Models by Learning to Fill Equations
- Matching Markets Meet LLMs: Algorithmic Reasoning with Ranked Preferences
- RewardAnything: Generalizable Principle-Following Reward Models
- Long or short CoT? Investigating Instance-level Switch of Large Reasoning Models
- Does Thinking More always Help? Mirage of Test-Time Scaling in Reasoning Models
- Rectified Sparse Attention
- Unifying Uniform and Binary-coding Quantization for Accurate Compression of Large Language Models
- am-ELO: A Stable Framework for Arena-based LLM Evaluation
- A Statistical Physics of Language Model Reasoning
- Verbalized Confidence Triggers Self-Verification: Emergent Behavior Without Explicit Reasoning Supervision
- Robustness of Prompting: Enhancing Robustness of Large Language Models Against Prompting Attacks
- PoLAR: Polar-Decomposed Low-Rank Adapter Representation
- Pruning General Large Language Models into Customized Expert Models
- FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
- BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflage
- FroM: Frobenius Norm-Based Data-Free Adaptive Model Merging
- Hopscotch: Discovering and Skipping Redundancies in Language Models
- Adaptive Graph Pruning for Multi-Agent Communication
- OThink-R1: Intrinsic Fast/Slow Thinking Mode Switching for Over-Reasoning Mitigation
- DiaBlo: Diagonal Blocks Are Sufficient For Finetuning
- Understanding the Impact of Sampling Quality in Direct Preference Optimization
- Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
- EvaLearn: Quantifying the Learning Capability and Efficiency of LLMs via Sequential Problem Solving
- Learning Together to Perform Better: Teaching Small-Scale LLMs to Collaborate via Preferential Rationale Tuning
- Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation
- Answer Convergence as a Signal for Early Stopping in Reasoning
- HyperSteer: Activation Steering at Scale with Hypernetworks
- GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
- Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in LLM Reasoning
- Expanding before Inferring: Enhancing Factuality in Large Language Models through Premature Layers Interpolation
- Self-ensemble: Mitigating Confidence Mis-calibration for Large Language Models
- Cycle Consistency as Reward: Learning Image-Text Alignment without Human Preferences
- Incentivizing LLMs to Self-Verify Their Answers
- T-SHIRT: Token-Selective Hierarchical Data Selection for Instruction Tuning
- Human-Centric Evaluation for Foundation Models
- Benford's Curse: Tracing Digit Bias to Numerical Hallucination in LLMs
- Angles Don't Lie: Unlocking Training-Efficient RL Through the Model's Own Signals
- ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding
- The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning
- ORMind: A Cognitive-Inspired End-to-End Reasoning Framework for Operations Research
- MLorc: Momentum Low-rank Compression for Memory Efficient Large Language Model Adaptation
- Beyond In-Context Learning: Aligning Long-form Generation of Large Language Models via Task-Inherent Attribute Guidelines
- VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model
- Representations of Fact, Fiction and Forecast in Large Language Models: Epistemics and Attitudes
- RewardBench 2: Advancing Reward Model Evaluation
- STORM-BORN: A Challenging Mathematical Derivations Dataset Curated via a Human-in-the-Loop Multi-Agent Framework
- XAI-Units: Benchmarking Explainability Methods with Unit Tests
- SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning
- HASHIRU: Hierarchical Agent System for Hybrid Intelligent Resource Utilization
- zip2zip: Inference-Time Adaptive Tokenization via Online Compression
- Evaluating the Unseen Capabilities: How Many Theorems Do LLMs Know?
- From Objectives to Questions: A Planning-based Framework for Educational Mathematical Question Generation
- SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning
- IRT-Router: Effective and Interpretable Multi-LLM Routing via Item Response Theory
- Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation
- Reconsidering LLM Uncertainty Estimation Methods in the Wild
- Mamba Drafters for Speculative Decoding
- Uni-LoRA: One Vector is All You Need
- Data Swarms: Optimizable Generation of Synthetic Evaluation Data
- Massively Multilingual Adaptation of Large Language Models Using Bilingual Translation Data
- Scaling Textual Gradients via Sampling-Based Momentum
- BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation
- Efficient Latent Semantic Clustering for Scaling Test-Time Computation of LLMs
- SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning
- FLoE: Fisher-Based Layer Selection for Efficient Sparse Adaptation of Low-Rank Experts
- Accelerating Diffusion LLMs via Adaptive Parallel Decoding
- Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively
- RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
- BadLingual: A Novel Lingual-Backdoor Attack against Large Language Models
- SafeTy Reasoning Elicitation Alignment for Multi-Turn Dialogues
- EXP-Bench: Can AI Conduct AI Research Experiments?
- Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning
- Unifying Language Agent Algorithms with Graph-based Orchestration Engine for Reproducible Agent Research
- A*-Thought: Efficient Reasoning via Bidirectional Compression for Low-Resource Settings
- Cross-Attention Speculative Decoding
- DEEPQUESTION: Systematic Generation of Real-World Challenges for Evaluating LLMs Performance
- ClueAnchor: Clue-Anchored Knowledge Reasoning Exploration and Optimization for Retrieval-Augmented Generation
- Semi-structured LLM Reasoners Can Be Rigorously Audited
- Model Unlearning via Sparse Autoencoder Subspace Guided Projections
- SkyWalker: A Locality-Aware Cross-Region Load Balancer for LLM Inference
- RAST: Reasoning Activation in LLMs via Small-model Transfer
- Evaluation of LLMs for mathematical problem solving
- Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability
- Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models
- SUMO: Subspace-Aware Moment-Orthogonalization for Accelerating Memory-Efficient LLM Training
- CLaSp: In-Context Layer Skip for Self-Speculative Decoding
- Revisiting Epistemic Markers in Confidence Estimation: Can Markers Accurately Reflect Large Language Models' Uncertainty?
- AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time
- AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
- SCOUT: Teaching Pre-trained Language Models to Enhance Reasoning via Flow Chain-of-Thought
- Simulating Training Data Leakage in Multiple-Choice Benchmarks for LLM Evaluation
- Reasoning Can Hurt the Inductive Abilities of Large Language Models
- MDPO: Multi-Granularity Direct Preference Optimization for Mathematical Reasoning
- Advantageous Parameter Expansion Training Makes Better Large Language Models
- Knowledge Augmented Complex Problem Solving with Large Language Models: A Survey
- An Adversary-Resistant Multi-Agent LLM System via Credibility Scoring
- Evaluating Gemini in an arena for learning
- Tag-Evol: Achieving Efficient Instruction Evolving via Tag Injection
- Soft Reasoning: Navigating Solution Spaces in Large Language Models through Controlled Embedding Exploration
- Accelerated Sampling from Masked Diffusion Models via Entropy Bounded Unmasking
- VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL
- From Chat Logs to Collective Insights: Aggregative Question Answering
- Can LLMs Reason Abstractly Over Math Word Problems Without CoT? Disentangling Abstract Formulation From Arithmetic Computation
- Satori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software Engineering
- Merge Hijacking: Backdoor Attacks to Model Merging of Large Language Models
- Probability-Consistent Preference Optimization for Enhanced LLM Reasoning
- X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains
- KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
- Discriminative Policy Optimization for Token-Level Reward Models
- Noise-Robustness Through Noise: A Framework combining Asymmetric LoRA with Poisoning MoE
- ExpeTrans: LLMs Are Experiential Transfer Learners
- Cross-Task Experiential Learning on LLM-based Multi-Agent Collaboration
- PBEBench: A Multi-Step Programming by Examples Reasoning Benchmark inspired by Historical Linguistics
- R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
- Diversity-Aware Policy Optimization for Large Language Model Reasoning
- Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
- Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism
- Scalable Complexity Control Facilitates Reasoning Ability of LLMs
- Leave it to the Specialist: Repair Sparse LLMs with Sparse Fine-Tuning via Sparsity Evolution
- AutoGPS: Automated Geometry Problem Solving via Multimodal Formalization and Deductive Reasoning
- DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
- SC-LoRA: Balancing Efficient Fine-tuning and Knowledge Preservation via Subspace-Constrained LoRA
- MathArena: Evaluating LLMs on Uncontaminated Math Competitions
- LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training
- MCP Safety Training: Learning to Refuse Falsely Benign MCP Exploits using Improved Preference Alignment
- Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness
- Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training
- Active Layer-Contrastive Decoding Reduces Hallucination in Large Language Model Generation
- Can LLMs Reason Structurally? Benchmarking via the Lens of Data Structures
- Differential Information Distribution: A Bayesian Perspective on Direct Preference Optimization
- MermaidFlow: Redefining Agentic Workflow Generation via Safety-Constrained Evolutionary Programming
- Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
- ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark
- AutoL2S: Auto Long-Short Reasoning for Efficient Large Language Models
- Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning
- Evaluation Hallucination in Multi-Round Incomplete Information Lateral-Driven Reasoning Tasks
- Advancing Expert Specialization for Better MoE
- Enhancing Long-Chain Reasoning Distillation through Error-Aware Self-Reflection
- LoKI: Low-damage Knowledge Implanting of Large Language Models
- Latent Reasoning via Sentence Embedding Prediction
- The Price of a Second Thought: On the Evaluation of Reasoning Efficiency in Large Language Models
- Decomposing Elements of Problem Solving: What "Math" Does RL Teach?
- Maximizing Confidence Alone Improves Reasoning
- GuessArena: Guess Who I Am? A Self-Adaptive Framework for Evaluating LLMs in Domain-Specific Knowledge and Reasoning
- LaMDAgent: An Autonomous Framework for Post-Training Pipeline Optimization via LLM Agents
- Mitigating Overthinking in Large Reasoning Models via Manifold Steering
- RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding
- Benchmarking Abstract and Reasoning Abilities Through A Theoretical Perspective
- Read Your Own Mind: Reasoning Helps Surface Self-Confidence Signals in LLMs
- From Accuracy to Robustness: A Study of Rule- and Model-based Verifiers in Mathematical Reasoning
- On Learning Verifiers and Implications to Chain-of-Thought Reasoning
- Reverse Preference Optimization for Complex Instruction Following
- Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
- LASER: Stratified Selective Sampling for Instruction Tuning with Dedicated Scoring Strategy
- Look Within or Look Beyond? A Theoretical Comparison Between Parameter-Efficient and Full Fine-Tuning
- From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with Large Language Models
- The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
- Do We Know What LLMs Don't Know? A Study of Consistency in Knowledge Probing
- R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning
- Leveraging Large Language Models for Bengali Math Word Problem Solving with Chain of Thought Reasoning
- Pause Tokens Strictly Increase the Expressivity of Constant-Depth Transformers
- Trans-EnV: A Framework for Evaluating the Linguistic Robustness of LLMs Against English Varieties
- Beyond Templates: Dynamic Adaptation of Reasoning Demonstrations via Feasibility-Aware Exploration
- Pretraining Language Models to Ponder in Continuous Space
- RADLADS: Rapid Attention Distillation to Linear Attention Decoders at Scale
- Are Language Models Consequentialist or Deontological Moral Reasoners?
- BacktrackAgent: Enhancing GUI Agent with Error Detection and Backtracking Mechanism
- Reinforcing General Reasoning without Verifiers
- What happens when generative AI models train recursively on each others' outputs?
- FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models
- Test-Time Learning for Large Language Models
- Multi-objective Large Language Model Alignment with Hierarchical Experts
- DenseLoRA: Dense Low-Rank Adaptation of Large Language Models
- Accelerating RL for LLM Reasoning with Optimal Advantage Regression
- Don't Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models
- BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge
- Efficient Large Language Model Inference with Neural Block Linearization
- Beyond Chemical QA: Evaluating LLM's Chemical Reasoning with Modular Chemical Operations
- Improved Representation Steering for Language Models
- Fast and Cost-effective Speculative Edge-Cloud Decoding with Early Exits
- Pretrained LLMs Learn Multiple Types of Uncertainty
- Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning
- VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection
- Program of Equations Thoughts to Solve Algebra Word Problems
- Semantic-Preserving Adversarial Attacks on LLMs: An Adaptive Greedy Binary Search Approach
- Two Causally Related Needles in a Video Haystack
- MOLE: Metadata Extraction and Validation in Scientific Papers Using LLMs
- Done Is Better than Perfect: Unlocking Efficient Reasoning by Structured Multi-Turn Decomposition
- Graceful Forgetting in Generative Language Models
- Token-Importance Guided Direct Preference Optimization
- Radio: Rate-Distortion Optimization for Large Language Model Compression
- DOGe: Defensive Output Generation for LLM Protection Against Knowledge Distillation
- The Role of Diversity in In-Context Learning for Large Language Models
- Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection
- Large Language Models for Planning: A Comprehensive and Systematic Survey
- HS-STaR: Hierarchical Sampling for Self-Taught Reasoners via Difficulty Estimation and Budget Reallocation
- Inference-time Alignment in Continuous Space
- PiCa: Parameter-Efficient Fine-Tuning with Column Space Projection
- Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows
- S2LPP: Small-to-Large Prompt Prediction across LLMs
- FinLoRA: Benchmarking LoRA Methods for Fine-Tuning LLMs on Financial Datasets
- Adaptive Classifier-Free Guidance via Dynamic Low-Confidence Masking
- CP-Router: An Uncertainty-Aware Router Between LLM and LRM
- SAEs Are Good for Steering -- If You Select the Right Features
- REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
- SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning
- Rewriting Pre-Training Data Boosts LLM Performance in Math and Code
- Sailing by the Stars: A Survey on Reward Models and Learning Strategies for Learning from Rewards
- Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play
- Route to Reason: Adaptive Routing for LLM and Reasoning Strategy Selection
- WINA: Weight Informed Neuron Activation for Accelerating Large Language Model Inference
- HAMburger: Accelerating LLM Inference via Token Smashing
- TTPA: Token-level Tool-use Preference Alignment Training Framework with Fine-grained Evaluation
- Large Language Models' Reasoning Stalls: An Investigation into the Capabilities of Frontier Models
- Which Data Attributes Stimulate Math and Code Reasoning? An Investigation via Influence Functions
- Beyond the Proxy: Trajectory-Distilled Guidance for Offline GFlowNet Training
- ARM: Adaptive Reasoning Model
- Efficient Reasoning via Chain of Unconscious Thought
- Concise Reasoning, Big Gains: Pruning Long Reasoning Trace with Difficulty-Aware Prompting
- Efficient Hallucination Detection for LLMs Using Uncertainty-Aware Attention Heads
- Lifelong Safety Alignment for Language Models
- DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
- LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
- Universal Reasoner: A Single, Composable Plug-and-Play Reasoner for Frozen LLMs
- UNCERTAINTY-LINE: Length-Invariant Estimation of Uncertainty for Large Language Models
- Efficient Data Selection at Scale via Influence Distillation
- Online Knowledge Distillation with Reward Guidance
- MMATH: A Multilingual Benchmark for Mathematical Reasoning
- Foundations of Top-k Decoding For Language Models
- AI4Math: A Native Spanish Benchmark for University-Level Mathematical Reasoning in Large Language Models
- Shifting AI Efficiency From Model-Centric to Data-Centric Compression
- The Price of Format: Diversity Collapse in LLMs
- Do Large Language Models (Really) Need Statistical Foundations?
- System-1.5 Reasoning: Traversal in Language and Latent Spaces with Dynamic Shortcuts
- Behavior Injection: Preparing Language Models for Reinforcement Learning
- Retrieval-Augmented Generation for Service Discovery: Chunking Strategies and Benchmarking
- Optimization-Inspired Few-Shot Adaptation for Large Language Models
- SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning
- AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting
- ALPS: Attention Localization and Pruning Strategy for Efficient Alignment of Large Language Models
- LoTA-QAF: Lossless Ternary Adaptation for Quantization-Aware Fine-Tuning
- Optimal Transport-Based Token Weighting scheme for Enhanced Preference Optimization
- Neural Parameter Search for Slimmer Fine-Tuned Models and Better Transfer
- Adaptive Prediction-Powered AutoEval with Reliability and Efficiency Guarantees
- Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving
- Skip-Thinking: Chunk-wise Chain-of-Thought Distillation Enable Smaller Language Models to Reason Better and Faster
- Multilingual Question Answering in Low-Resource Settings: A Dzongkha-English Benchmark for Foundation Models
- Unraveling Misinformation Propagation in LLM Reasoning
- MSA at BEA 2025 Shared Task: Disagreement-Aware Instruction Tuning for Multi-Dimensional Evaluation of LLMs as Math Tutors
- Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning
- Knowledge Grafting of Large Language Models
- Anchored Diffusion Language Model
- The Quest for Efficient Reasoning: A Data-Centric Benchmark to CoT Distillation
- How Is LLM Reasoning Distracted by Irrelevant Context? An Analysis Using a Controlled Benchmark
- Hybrid Latent Reasoning via Reinforcement Learning
- Steering LLM Reasoning Through Bias-Only Adaptation
- v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
- G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning
- Not the Dimension, the Norm: What Matters in Gradient-Free Weight Perturbation of Language Models
- HD-PiSSA: High-Rank Distributed Orthogonal Adaptation
- From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling
- Efficient Long CoT Reasoning in Small Language Models
- OpenReview Should be Protected and Leveraged as a Community Asset for Research in the Era of Large Language Models
- Think Before You Accept: Semantic Reflective Verification for Faster Speculative Decoding
- FedHL: Federated Learning for Heterogeneous Low-Rank Adaptation via Unbiased Aggregation
- The Unreasonable Effectiveness of Model Merging for Cross-Lingual Transfer in LLMs
- Beyond Prompt Engineering: Robust Behavior Control in LLMs via Steering Target Atoms
- ProgRM: Build Better GUI Agents with Progress Rewards
- Stable Reinforcement Learning for Efficient Reasoning
- Reward Model Generalization for Compute-Aware Test-Time Reasoning
- FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling
- Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning
- Training with Pseudo-Code for Instruction Following
- VeriThinker: Learning to Verify Makes Reasoning Model Efficient
- Explaining Sources of Uncertainty in Automated Fact-Checking
- Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
- TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs
- Self-Improving Large Language Models via Progressive Experience Evolution
- COUNTDOWN: Contextually Sparse Activation Filtering Out Unnecessary Weights in Down Projection
- GeoGramBench: Benchmarking the Geometric Program Reasoning in Modern LLMs
- Emergent Standing Wave Dynamics and Attractor Basins in Transformer Latent Spaces via Prompt Driven ConstraintsAnathema to Corporate Control by Ingrid Johnson
- REFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language Models
- CoMoE: Contrastive Representation for Mixture-of-Experts in Parameter-Efficient Fine-tuning
- L-MTP: Leap Multi-Token Prediction Beyond Adjacent Context for Large Language Models
- Self-Training Large Language Models with Confident Reasoning
- Misaligning Reasoning with Answers -- A Framework for Assessing LLM CoT Robustness
- Value-Guided Search for Efficient Chain-of-Thought Reasoning
- Navigate the Unknown: Enhancing LLM Reasoning with Intrinsic Motivation Guided Exploration
- Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards
- NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
- Rethinking the Sampling Criteria in Reinforcement Learning for LLM Reasoning: A Competence-Difficulty Alignment Perspective
- Think or Not? Exploring Thinking Efficiency in Large Reasoning Models via an Information-Theoretic Lens
- Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training
- Trinity-RFT: A General-Purpose and Unified Framework for Reinforcement Fine-Tuning of Large Language Models
- DAPD: Dual-Anchored Policy Distillation
- ECHO-LLaMA: Efficient Caching for High-Performance LLaMA Training
- Learning to Choose or Choosing to Learn: Best-of-N vs. Supervised Fine-Tuning for Bit String Generation
- Global Optimization and Inference-Time Region Grafting for Agentic Workflows
- The Rise of Parameter Specialization for Knowledge Storage in Large Language Models
- ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models
- Automated Capability Evaluation of Foundation Models
- Reasoning Model is Stubborn: Diagnosing Instruction Overriding in Reasoning Models
- Effective Reinforcement Learning for Reasoning in Language Models
- Shape it Up! Restoring LLM Safety during Finetuning
- Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning
- MPO: Multilingual Safety Alignment via Reward Gap Optimization
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- MCP-RADAR: A Multi-Dimensional Benchmark for Evaluating Tool Use Capabilities in Large Language Models
- CTRAP: Embedding Collapse Trap to Safeguard Large Language Models from Harmful Fine-Tuning
- Incremental Sequence Classification with Temporal Consistency
- HOFT: Householder Orthogonal Fine-tuning
- AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners
- Incentivizing Dual Process Thinking for Efficient Large Language Model Reasoning
- INFERENCEDYNAMICS: Efficient Routing Across LLMs through Structured Capability and Knowledge Profiling
- LightRouter: Towards Efficient LLM Collaboration with Minimal Overhead
- Dynamic Sampling that Adapts: Iterative DPO for Self-Aware Mathematical Reasoning
- KNN-SSD: Enabling Dynamic Self-Speculative Decoding via Nearest Neighbor Layer Set Optimization
- EduBench: A Comprehensive Benchmarking Dataset for Evaluating Large Language Models in Diverse Educational Scenarios
- Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs
- Reasoning Beyond Language: A Comprehensive Survey on Latent Chain-of-Thought Reasoning
- xInv: Explainable Optimization of Inverse Problems
- Do Large Language Models Excel in Complex Logical Reasoning with Formal Language?
- Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning
- Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains
- AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
- SATURN: SAT-based Reinforcement Learning to Unleash LLMs Reasoning
- O2-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering
- xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding
- LLM Fingerprinting via Semantically Conditioned Watermarks
- Watch your steps: Dormant Adversarial Behaviors that Activate upon LLM Finetuning
- Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards
- DuFFin: A Dual-Level Fingerprinting Framework for LLMs IP Protection
- Veracity Bias and Beyond: Uncovering LLMs' Hidden Beliefs in Problem-Solving Reasoning
- Understanding Differential Transformer Unchains Pretrained Self-Attentions
- Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
- NAN: A Training-Free Solution to Coefficient Estimation in Model Merging
- Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuning
- When Do LLMs Admit Their Mistakes? Understanding The Role Of Model Belief In Retraction
- Beyond Needle(s) in the Embodied Haystack: Environment, Architecture, and Training Considerations for Long Context Reasoning
- Generalizable Process Reward Models via Formally Verified Training Data
- CoT Information: Improved Sample Complexity under Chain-of-Thought Supervision
- MMaDA: Multimodal Large Diffusion Language Models
- STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs
- Scaling Physical Reasoning with the PHYSICS Dataset
- EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers
- UniErase: Towards Balanced and Precise Unlearning in Language Models
- Swarm Intelligence Enhanced Reasoning: A Density-Driven Framework for LLM-Based Multi-Agent Optimization
- The Effects of Data Augmentation on Confidence Estimation for LLMs
- Revealing Language Model Trajectories via Kullback-Leibler Divergence
- Cross-Domain Hybrid OPD for Generalizable Search Agents
- DUSK: Do Not Unlearn Shared Knowledge
- Any Large Language Model Can Be a Reliable Judge: Debiasing with a Reasoning-based Bias Detector
- lmgame-Bench: How Good are LLMs at Playing Games?
- DISCO Balances the Scales: Adaptive Domain- and Difficulty-Aware Reinforcement Learning on Imbalanced Data
- Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory
- NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
- Learning to Rank Chain-of-Thought: Using a Small Model
- ModelingAgent: Bridging LLMs and Mathematical Modeling for Real-World Challenges
- Likelihood Variance as Text Importance for Resampling Texts to Map Language Models
- Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval
- DEBATE, TRAIN, EVOLVE: Self Evolution of Language Model Reasoning
- Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space
- From Problem-Solving to Teaching Problem-Solving: Aligning LLMs with Pedagogy using Reinforcement Learning
- Hunyuan-TurboS: Advancing Large Language Models through Mamba-Transformer Synergy and Adaptive Chain-of-Thought
- VocalBench: Benchmarking the Vocal Conversational Abilities for Speech Interaction Models
- CoLA: Collaborative Low-Rank Adaptation
- SSR: Speculative Parallel Scaling Reasoning in Test-time
- Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression
- ReasonCast: Towards Explainable Time Series Forecasting with Reasoning
- Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure Modes
- LFTF: Locating First and Then Fine-Tuning for Mitigating Gender Bias in Large Language Models
- On the Generalization vs Fidelity Paradox in Knowledge Distillation
- MAS-ZERO: Designing Multi-Agent Systems with Zero Supervision
- Multilingual Test-Time Scaling via Initial Thought Transfer
- Towards Spoken Mathematical Reasoning: Benchmarking Speech-based Models over Multi-faceted Math Problems
- HPFA: Hypergraph-Based Paired Failure Attribution for LLM Reasoning
- From Chains to Trees: Parent-Conditioned Drafting for Semi-Autoregressive Speculative Decoding
- An Efficient Private GPT Never Autoregressively Decodes
- RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
- TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
- Social Bias in Popular Question-Answering Benchmarks
- Bole: Efficient Tree Speculation for Hybrid-Attention Language Models
- A Systematic Evaluation of On-Device LLMs: Quantization, Performance, and Resources
- dKV-Cache: The Cache for Diffusion Language Models
- Incorporating Token Usage into Prompting Strategy Evaluation
- Prolonged Reasoning Is Not All You Need: Certainty-Based Adaptive Routing for Efficient LLM/MLLM Reasoning
- When Can Large Reasoning Models Save Thinking? Mechanistic Analysis of Behavioral Divergence in Reasoning
- STree: Speculative Tree Decoding for Hybrid State-Space Models
- Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
- Enhancing Learned Knowledge in LoRA Adapters Through Efficient Contrastive Decoding on Ascend NPUs
- ServerlessLoRA: Minimizing Latency and Cost in Serverless Inference for LoRA-Based LLMs
- PRL: Prompts from Reinforcement Learning
- From Reasoning to Code: GRPO Optimization for Underrepresented Languages
- Temporal Alignment of Time Sensitive Facts with Activation Engineering
- RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning
- Activation-Guided Consensus Merging for Large Language Models
- DRP: Distilled Reasoning Pruning with Skill-aware Step Decomposition for Efficient Large Reasoning Models
- InfiGFusion: Graph-on-Logits Distillation via Efficient Gromov-Wasserstein for Model Fusion
- Self-Reasoning Language Models: Unfold Hidden Reasoning Chains with Few Reasoning Catalyst
- Let LRMs Break Free from Overthinking via Self-Braking Tuning
- The Energy Cost of Reasoning: Analyzing Energy Usage in LLMs with Test-time Compute
- KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
- InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
- Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning
- General-Reasoner: Advancing LLM Reasoning Across All Domains
- Attend to Your Own Thoughts: Breaking the Barrier for Post-Training Quantization of Reasoning LLMs through the Lens of 1.58-Bit Quantization
- DecIF: Improving Instruction-Following through Meta-Decomposition
- Can Pruning Improve Reasoning? Revisiting Long-CoT Compression with Capability in Mind for Better Reasoning
- FOL-Traces: Verified First-Order Logic Reasoning Traces at Scale
- AudSemThinker: Enhancing Audio-Language Models through Reasoning over Semantics of Sound
- Safety Subspaces are Not Linearly Distinct: A Fine-Tuning Case Study
- OSoRA: Output-Dimension and Singular-Value Initialized Low-Rank Adaptation
- Self-Evolving Curriculum for LLM Reasoning
- Reward Reasoning Model
- Reasoning Path Compression: Compressing Generation Trajectories for Efficient LLM Reasoning
- EasyMath: A 0-shot Math Benchmark for SLMs
- Do Language Models Use Their Depth Efficiently?
- GemMaroc: Unlocking Darija Proficiency in LLMs with Minimal Data
- WirelessMathBench: A Mathematical Modeling Benchmark for LLMs in Wireless Communications
- The Hallucination Tax of Reinforcement Finetuning
- Dual Decomposition of Weights and Singular Value Low Rank Adaptation
- ABBA-Adapters: Efficient and Expressive Fine-Tuning of Foundation Models
- SCOPE: Compress Mathematical Reasoning Steps for Efficient Automated Process Annotation
- Causal Head Gating: A Framework for Interpreting Roles of Attention Heads in Transformers
- Safety Alignment Can Be Not Superficial With Explicit Safety Signals
- RL in Name Only? Analyzing the Structural Assumptions in RL post-training for LLMs
- Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space
- HeteroSpec: Leveraging Contextual Heterogeneity for Efficient Speculative Decoding
- Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs
- TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios
- IDEAL: Data Equilibrium Adaptation for Multi-Capability Language Model Alignment
- Shadow-FT: Tuning Instruct Model via Training on Paired Base Model
- Learnware of Language Models: Specialized Small Language Models Can Do Big
- Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics
- Thinkless: LLM Learns When to Think
- Guided Search Strategies in Non-Serializable Environments with Applications to Software Engineering Agents
- Fractured Chain-of-Thought Reasoning
- AutoMathKG: The automated mathematical knowledge graph based on LLM and vector database
- MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
- CoT-Kinetics: A Theoretical Modeling Assessing LRM Reasoning Process
- ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
- On the Thinking-Language Modeling Gap in Large Language Models
- Enhancing Latent Computation in Transformers with Latent Tokens
- AdaptThink: Reasoning Models Can Learn When to Think
- Language Model Networks: Supervision-Efficient Learning through Dense Communication
- Towards Budget-Friendly Model-Agnostic Explanation Generation for Large Language Models
- MARGE: Improving Math Reasoning for LLMs with Guided Exploration
- UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
- AltLoRA: Towards Better Gradient Approximation in Low-Rank Adaptation with Alternating Projections
- HBO: Hierarchical Balancing Optimization for Fine-Tuning Large Language Models
- Synthetic Data RL: Task Definition Is All You Need
- Mining Intrinsic Rewards from LLM Hidden States for Efficient Best-of-N Sampling
- Traversal Verification for Speculative Tree Decoding
- Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context Learning
- KVmix: Gradient-Based Layer Importance-Aware Mixed-Precision Quantization for KV Cache
- ExpertSteer: Intervening in LLMs through Expert Knowledge
- Self-Destructive Language Model
- BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
- Not All Documents Are What You Need for Extracting Instruction Tuning Data
- SLOT: Sample-specific Language Model Optimization at Test-time
- RealMath: A Continuous Benchmark for Evaluating Language Models on Research-Level Mathematics
- SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
- K-MSHC: Unmasking Minimally Sufficient Head Circuits in Large Language Models with Experiments on Syntactic Classification Tasks
- Teach2Eval: An Indirect Evaluation Method for LLM by Judging How It Teaches
- Latent Veracity Inference for Identifying Errors in Stepwise Reasoning
- HARDMath2: A Benchmark for Applied Mathematics Built by Students as Part of a Graduate Class
- Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets
- Model Merging in Pre-training of Large Language Models
- LoRASuite: Efficient LoRA Adaptation Across Large Language Model Upgrades
- Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling
- LLM-BABYBENCH: Understanding and Evaluating Grounded Planning and Reasoning in LLMs
- Why Not Act on What You Know? Unleashing Safety Potential of LLMs via Self-Aware Guard Enhancement
- dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
- Mutual-Taught for Co-adapting Policy and Reward Models
- TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning
- Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO
- ProxyPrompt: Securing System Prompts against Prompt Extraction Attacks
- Mergenetic: a Simple Evolutionary Model Merging Library
- SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning
- Efficient Orthogonal Fine-Tuning with Principal Subspace Adaptation
- Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs
- Quantization Meets Reasoning: Exploring and Mitigating Degradation of Low-Bit LLMs in Mathematical Reasoning
- Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
- Towards Robust Evaluation of STEM Education: Leveraging MLLMs in Project-Based Learning
- Rethinking the Role of Prompting Strategies in LLM Test-Time Scaling: A Perspective of Probability Theory
- AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction
- Relative Parameter Importance in Task-Agnostic Replay-Free Continual Learning
- SymboUQ: Symbolic Uncertainty Quantification for Spatial Reasoning in LLMs
- Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations
- Creativity or Brute Force? Using Brainteasers as a Window into the Problem-Solving Abilities of Large Language Models
- IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation
- MergeBench: A Benchmark for Merging Domain-Specialized LLMs
- Accurate KV Cache Quantization with Outlier Tokens Tracing
- Critique-Guided Distillation for Robust Reasoning via Refinement
- HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization
- Noise Injection Systemically Degrades Large Language Model Safety Guardrails
- Real-Time Verification of Embodied Reasoning for Generative Skill Acquisition
- A Systematic Analysis of Base Model Choice for Reward Modeling
- SoftCoT++: Test-Time Scaling with Soft Chain-of-Thought Reasoning
- Rethinking Optimal Verification Granularity for Compute-Efficient Test-Time Scaling
- Addition is almost all you need: Compressing large language models with double binary factorization
- CURE: Local Uncertainty Repair for Block-Parallel Speculative Decoding
- Can Large Language Models Correctly Interpret Equations with Errors?
- Dist2ill: Distributional Distillation for One-Pass Uncertainty Estimation in Large Language Models
- HelpSteer3-Preference: Open Human-Annotated Preference Data across Diverse Tasks and Languages
- Ranked Voting based Self-Consistency of Large Language Models
- SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training
- WorldView-Bench: A Benchmark for Evaluating Global Cultural Perspectives in Large Language Models
- Auditable Release Control for Pedagogical Leakage in LLM Tutors
- ComplexFormer: Disruptively Advancing Transformer Inference Ability via Head-Specific Complex Vector Attention
- Rethinking Prompt Optimizers: From Prompt Merits to Optimization
- Decomposed Inductive Procedure Learning: Learning Academic Tasks with Human-Like Data Efficiency
- Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models
- Parallel Scaling Law for Language Models
- Demystifying AI Agents: The Final Generation of Intelligence
- RSRA: Training-Free Probing of Representation Sensitivity for Efficient LoRA Rank Allocation
- Multi-Token Prediction Needs Registers
- Mining Hidden Thoughts from Texts: Evaluating Continual Pretraining with Synthetic Data for LLM Reasoning
- DIF: A Framework for Benchmarking and Verifying Implicit Bias in LLMs
- CurveShift: Is Agent Progress Scalar? Separating Level from Shape
- Learning to Coordinate Symbolic Tools: LLM Agents for Verified Sum-of-Squares Certificates
- PT-MoE: An Efficient Finetuning Framework for Integrating Mixture-of-Experts into Prompt Tuning
- MorphMark: Flexible Adaptive Watermarking for Large Language Models
- Learning Long-Context Diffusion Policies via Past-Token Prediction
- Analog Foundation Models
- Qwen3 Technical Report
- Verifier-Induced Support Reshaping in On-Policy Optimization
- DeepMath-Creative: A Benchmark for Evaluating Mathematical Creativity of Large Language Models
- From Pixels to PCells: A Neurosymbolic Approach to Photonic Component Creation
- Amplitude-Only FFN Intervention for Tool-Structured LLM Inference Method: Gated Evaluation Protocol, and Cross-Model Empirical Results
- Request-Level Energy Attribution for Batched LLM Serving
- TUMS: Enhancing Tool-use Abilities of LLMs with Multi-structure Handlers
- Accelerating Chain-of-Thought Reasoning: When Goal-Gradient Importance Meets Dynamic Skipping
- Towards Contamination Resistant Benchmarks
- Entropy-Gated Latent Recursion
- Evaluating LLM Metrics Through Real-World Capabilities
- DSADF: Thinking Fast and Slow for Decision Making
- CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection
- S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models
- A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models
- SEM: Reinforcement Learning for Search-Efficient Large Language Models
- LEAD: Iterative Data Selection for Efficient LLM Instruction Tuning
- Direct Density Ratio Optimization: A Statistically Consistent Approach to Aligning Large Language Models
- ToolACE-DEV: Self-Improving Tool Learning via Decomposition and EVolution
- Uncertainty Profiles for LLMs: Uncertainty Source Decomposition and Adaptive Model-Metric Selection
- Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
- FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning
- Learning from Peers in Reasoning Models
- MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining
- SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models
- xGen-small Technical Report
- Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
- Practical Reasoning Interruption Attacks on Reasoning Large Language Models
- KCluster: An LLM-based Clustering Approach to Knowledge Component Discovery
- Multimodal Integrated Knowledge Transfer to Large Language Models through Preference Optimization with Biomedical Applications
- Full-Parameter Continual Pretraining of Gemma2: Insights into Fluency and Domain Knowledge
- AgentVigil: Generic Black-Box Red-teaming for Indirect Prompt Injection against LLM Agents
- When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling
- Assessing Robustness to Spurious Correlations in Post-Training Language Models
- LiteLMGuard: Seamless and Lightweight On-Device Prompt Filtering for Safeguarding Small Language Models against Quantization-induced Risks and Vulnerabilities
- Scalable LLM Math Reasoning Acceleration with Low-rank Distillation
- Scaling Laws for Speculative Decoding
- Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models
- Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models
- A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs
- TEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model Acceleration
- Just on Time: Token-Level Early Stopping for Diffusion Language Models
- Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions
- Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks
- CORE: Collaborative Reasoning via Cross Teaching
- When Silence Is Golden: Can LLMs Learn to Abstain in Temporal QA and Beyond?
- Measuring Hong Kong Massive Multi-Task Language Understanding
- Memory-Efficient LLM Training by Various-Grained Low-Rank Projection of Gradients
- ThinknCheck: Grounded Claim Verification with Compact, Reasoning-Driven, and Interpretable Models
- Accelerating Large Language Model Reasoning via Speculative Search
- When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation
- TRAVELER: A Benchmark for Evaluating Temporal Reasoning across Vague, Implicit and Explicit References
- Suffix-Constrained Greedy Search Algorithms for Causal Language Models
- MoEQuant: Enhancing Quantization for Mixture-of-Experts Large Language Models via Expert-Balanced Sampling and Affinity Guidance
- Efficient Fine-Tuning of Quantized Models via Adaptive Rank and Bitwidth
- TutorGym: A Testbed for Evaluating AI Agents as Tutors and Students
- NeMo-Inspector: A Visualization Tool for LLM Generation Analysis
- DeepCritic: Deliberate Critique with Large Language Models
- Antidistillation Fingerprinting
- Agentic Abstention: Do Agents Know When to Stop Instead of Act?
- CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs
- Diffusion Language Models: An Experimental Analysis
- Visual Verification Enables Inference-time Steering and Autonomous Policy Improvement
- An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models
- Not All Thoughts Need HBM: Semantics-Aware Memory Hierarchy for LLM Reasoning
- HorizonMath: Measuring AI Progress Toward Mathematical Discovery with Automatic Verification
- Brain-Inspired Graph Multi-Agent Systems for LLM Reasoning
- Leaderboard Incentives: Model Rankings under Strategic Post-Training
- Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards
- Position: AI Competitions Provide the Gold Standard for Empirical Rigor in GenAI Evaluation
- Block Circulant Adapter for Large Language Models
- Measuring and Eliminating Refusals in Military Large Language Models
- GreenServ: Energy-Efficient Context-Aware Dynamic Routing for Multi-Model LLM Inference
- Quo Vadis, World Modeling?
- Evading Chain-of-Thought Monitoring Through Model Poisoning
- Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks
- AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification
- RL Post-Training Builds Compositional Reasoning Strategies
- Swarm: Co-Activation Aware KVCache Offloading Across Multiple SSDs
- DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
- On the Utility and Factual Reliability of Pruned Mixture-of-Experts Models in the Biomedical Domain
- CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction
- Domain-Specialized Tree of Thought through Plug-and-Play Predictors
- Semantic Invariance in Agentic AI
- Colluding LoRA: A Compositional Vulnerability in LLM Safety Alignment
- Epiphany-Aware KV Cache Eviction Without the Attention Matrix
- Improved Large Language Diffusion Models
- Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding
- From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning
- The Value Axis: Language Models Encode Whether They're on the Right Track
- MiniMax Sparse Attention
- Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
- Architecting Trust in Artificial Epistemic Agents
- What LLMs Think When You Don't Tell Them What to Think About?
- Pencil Puzzle Bench: A Benchmark for Multi-Step Verifiable Reasoning
- Demystifying Group Relative Policy Optimization: Its Policy Gradient is a U-Statistic
- The Aftermath of DrawEduMath: Vision Language Models Underperform with Struggling Students and Misdiagnose Errors
- On the Limits of Layer Pruning for Generative Reasoning in Large Language Models
- When RL Meets Adaptive Speculative Training: A Unified Training-Serving System
- Taming Momentum: Rethinking Optimizer States Through Low-Rank Approximation
- From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves
- LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics
- ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference
- RLHFless: Serverless Computing for Efficient RLHF
- VeRO: A Harness for Agents to Optimize Agents
- AdaptMI: Adaptive Skill-based In-context Math Instruction for Small Language Models
- TENP: Trapezoidal Expert Neuron Pruning For Mixture-of-Experts
- Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs
- Benchmark Test-Time Scaling of General LLM Agents
- Think First, Diffuse Fast: Improving Diffusion Language Model Reasoning via Autoregressive Plan Conditioning
- TFL: Targeted Bit-Flip Attack on Large Language Model
- Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs
- Predictable GRPO: A Closed-Form Model of Training Dynamics
- Arithmetic Pedagogy for Language Models
- Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
- Fully Open Meditron: An Auditable Pipeline for Clinical LLMs
- Target Policy Optimization
- Brevity Constraints Reverse Performance Hierarchies in Language Models
- The Design Space of Tri-Modal Masked Diffusion Models
- Intent Laundering: AI Safety Datasets Are Not What They Seem
- Symphony-Coord: Adaptive Routing for Multi-Agent LLM Systems
- Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks
- SPEAR: Code-Augmented Agentic Prompt Optimization
- A New Framework for Cybersecurity Refusals in AI Agents
- BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution
- Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher
- GNMR: Runtime Stability Control for Low-Precision Large Language Model Training
- Trust-Region Behavior Blending for On-Policy Distillation
- Auditing LLM Benchmarks with Item Response Theory
- Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding
- In LLM Reasoning, there is Irrationality on top of Value Misalignment
- The Bridge-Garden Dilemma in LLM Distillation: Why Mixing Hard and Soft Labels Works
- ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling
- Learning to Route Languages for Multilingual Policy Optimization
- Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework
- Training-Free Looped Transformers
- Using Large Language Models in Physics Education
- GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs
- LLMs Encode Their Failures: Predicting Success from Pre-Generation Activations
- The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?
- Scaling Embeddings Outperforms Scaling Experts in Language Models
- Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems
- COSMOS: Predictable and Cost-Effective Adaptation of LLMs
- Manifold-Guided Attention Steering
- Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline
- What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema
- MAC-Tuning: LLM Multi-Compositional Problem Reasoning with Enhanced Knowledge Boundary Awareness
- Ada-R1: Hybrid-CoT via Bi-Level Adaptive Reasoning Optimization
- DEL: Digit Entropy Loss for Numerical Learning of Large Language Models
- Pion: A Spectrum-Preserving Optimizer via Orthogonal Equivalence Transformation
- A Mechanistic Investigation of Supervised Fine Tuning
- Agentic Test-Time Scaling for WebAgents
- The Last Word Often Wins: A Format Confound in Chain-of-Thought Corruption Studies
- HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models
- Gradient Extrapolation-Based Policy Optimization
- A Survey on Parameter-Efficient Fine-Tuning for Foundation Models in Federated Learning
- Trace-of-Thought Prompting: Investigating Prompt-Based Knowledge Distillation Through Question Decomposition
- Token-Efficient RL for LLM Reasoning
- Computational Reasoning of Large Language Models
- Local Prompt Optimization
- Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces
- RV-Syn: Rational and Verifiable Mathematical Reasoning Data Synthesis based on Structured Function Library
- Search-Based Interaction For Conversation Recommendation via Generative Reward Model Based Simulated User
- Accurate and Diverse LLM Mathematical Reasoning via Automated PRM-Guided GFlowNets
- HiFloat4 Format for Language Model Inference
- SAGE: A Generic Framework for LLM Safety Evaluation
- Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling
- Nautile-370M: Spectral Memory Meets Attention in a Small Reasoning Model
- ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation
- When are likely answers right? On Sequence Probability and Correctness in LLMs
- Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents
- Beyond Safe Data: Pretraining-Stage Alignment with Regular Safety Reflection
- Beyond Parallel Sampling: Diverse Query Initialization for Agentic Search
- Autonomous Continual Learning for Environment Adaptation of Computer-Use Agents
- Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning
- Vector Policy Optimization: Training for Diversity Improves Test-Time Search
- Riemann-Bench: A Benchmark for Moonshot Mathematics
- MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
- LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
- Screening Is Enough
- AMALIA Technical Report: A Fully Open Source Large Language Model for European Portuguese
- FinTradeBench: A Financial Reasoning Benchmark for LLMs
- The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?
- Interleaved Head Attention
- Weak-Driven Learning: How Weak Agents make Strong Agents Stronger
- Maximum Likelihood Reinforcement Learning
- Post-LayerNorm Is Back: Stable, ExpressivE, and Deep
- STEM: Scaling Transformers with Embedding Modules
- AutoJudge: Judge Decoding Without Manual Annotation
- From Evidence to Belief: A Bayesian Epistemology Approach to Language Models
- GenCLS++: Pushing the Boundaries of Generative Classification in LLMs Through Comprehensive SFT and RL Studies Across Diverse Datasets
- Efficient Reasoning for LLMs through Speculative Chain-of-Thought
- Uncertainty Quantification for Language Models: A Suite of Black-Box, White-Box, LLM Judge, and Ensemble Scorers
- Unsupervised Confidence Calibration for Reasoning LLMs from a Single Generation
- River-LLM: Large Language Model Seamless Exit Based on KV Share
- Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence
- Bi-directional Model Cascading with Proxy Confidence
- SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning
- Anyprefer: An Agentic Framework for Preference Data Synthesis
- KETCHUP: K-Step Return Estimation for Sequential Knowledge Distillation
- Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks
- PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
- Random-Set Large Language Models
- Think, Prune, Train, Improve: Scaling Reasoning without Scaling Models
- Towards Autonomous Mechanistic Reasoning in Virtual Cells
- Think in Sentences: Explicit Sentence Boundaries Enhance Language Model's Capabilities
- AI Achieves a Perfect LSAT Score
- The Rise and Fall of G in AGI
- A Case Study of Selected PTQ Baselines for Reasoning LLMs on Ascend NPU
- Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima
- The Alignment Floor: How Persona Customization Breaks Safety in Weakly-Aligned LLMs
- What do Language Models Learn and When? The Implicit Curriculum Hypothesis
- SMART: When is it Actually Worth Expanding a Speculative Tree?
- Flux Attention: Context-Aware Hybrid Attention for Efficient LLMs Inference
- The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models
- Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
- On the Role of Computation in Reinforcement Learning
- FOCUS: DLLMs Know How to Tame Their Compute Bound
- Unrewarded Exploration in Large Language Models Reveals Latent Learning from Psychology
- RedSage: A Cybersecurity Generalist LLM
- M2XFP: A Metadata-Augmented Microscaling Data Format for Efficient Low-bit Quantization
- AcceptMoE: Commitment-Weighted Self-Sizing Verifier Expert Sets for Efficient MoE Speculative Decoding
- AI for Mathematics: Progress, Challenges, and Prospects
- Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains
- When Single-Agent with Skills Replace Multi-Agent Systems and When They Fail
- Scalable Frequency- and Length-Aware Subdocument Deduplication for Large Language Model Pretraining
- Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR
- LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
- LoopMTP: A looped transformer guided by latent multi-token prediction
- When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs
- Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve
- Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA Serving
- History Matters: Meta-policy Delegation with Heterogeneous Multi-agent Reinforcement Learning
- Oilbird: Training-Free Speculative Decoding with Keys the Verifier Already Computes
- Sensitivity, Causality, and Repair Dissociate: A Layer-Wise Analysis of Perturbation Robustness and Its Scaling
- Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss
- Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse
- Decomposing LLM Self-Correction: The Accuracy-Correction Paradox and Error Depth Hypothesis
- Complexity Agnostic Recursive Decomposition of Thoughts
- Evaluating Large Language Models on Quantum Mechanics: A Comparative Study Across Diverse Models and Tasks
- OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models
- Evaluating Intermediate Reasoning of Code-Assisted Large Language Models for Mathematics
- An Empirical Study on Prompt Compression for Large Language Models
- Training Large Language Models to Reason via EM Policy Gradient
- Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency
- MOOSComp: Improving Lightweight Long-Context Compressor via Mitigating Over-Smoothing and Incorporating Outlier Scores
- DataRx: Missingness-Aware Sampling for Safer Large Language Model Task-Specific Fine-Tuning
- NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap
- The Calibration Floor: Format Repair Can Masquerade as Self-Correction at Small-to-Mid Scale
- ExeCRE: Execution-Consistency Guided Reliability Estimation for Self-Correcting Code Generation
- Training-Free Hashing-Based Attention via Binary Principal Components
- SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts
- Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)
- K-EXAONE 2.0 Technical Report
- When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO
- Agreement Before Diversity: Verification-First Complementarity for Heterogeneous Language-Model Coordination
- HELENA:Hierarchical Sparse Coordination over a Union of Complementary Topologies for MAS
- Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark
- When Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMs
- Cost-Aware Multi-Objective Bandits: Theory and Application to Budgeted LLM Configuration Evaluation
- AsymSpec: Efficient Cloud-Edge Speculative Decoding over Asymmetric Networks
- T1: Tool-integrated Verification for Test-time Compute Scaling in Small Language Models
- Efficient Reinforcement Finetuning via Adaptive Curriculum Learning
- Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use
- Reasoning Models Know When They're Right: Probing Hidden States for Self-Verification
- Rethinking Reflection in Pre-Training
- FISH-Tuning: Enhancing PEFT Methods with Fisher Information
- Bidirectional Resource Scheduling for Disaggregated and Asynchronous RL Post-Training
- Trivium: Temporal Regret as a First-Class Objective for Causal-Memory Controllers
- Dion: Distributed Orthonormalized Updates
- Evaluating Multi-Hop Reasoning in Large Language Models: A Chemistry-Centric Case Study
- Safety Pretraining: Toward the Next Generation of Safe AI
- Information Leakage of Sentence Embeddings via Generative Embedding Inversion Attacks
- PARD: Accelerating LLM Inference with Low-Cost PARallel Draft Model Adaptation
- Do Large Language Models Truly Grasp Addition? A Rule-Focused Diagnostic Using Two-Integer Arithmetic
- AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset
- Exploring How LLMs Capture and Represent Domain-Specific Knowledge
- Process Reward Models That Think
- Lightweight Latent Verifiers for Efficient Meta-Generation Strategies
- CAPO: Cost-Aware Prompt Optimization
- AutoPDL: Automatic Prompt Optimization for LLM Agents
- Retro-Search: Exploring Untaken Paths for Deeper and Efficient Reasoning
- LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities
- Instruction-Tuning Data Synthesis from Scratch via Web Reconstruction
- PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models
- Dynamic Early Exit in Reasoning Models
- What's the Difference? Supporting Users in Identifying the Effects of Prompt and Model Changes Through Token Patterns
- Understanding the Skill Gap in Recurrent Language Models: The Role of the Gather-and-Aggregate Mechanism
- Compass-V2 Technical Report
- Exploring Cognitive and Aesthetic Causality for Multimodal Aspect-Based Sentiment Analysis
- Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
- Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
- Efficient Pretraining Length Scaling
- Virology Capabilities Test (VCT): A Multimodal Virology Q&A Benchmark
- Trillion 7B Technical Report
- MARFT: Multi-Agent Reinforcement Fine-Tuning
- Learning Adaptive Parallel Reasoning with Language Models
- DONOD: Efficient and Generalizable Instruction Fine-Tuning for LLMs via Model-Intrinsic Dataset Pruning
- PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines
- Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey
- ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
- Empirical Evaluation of Knowledge Distillation from Transformers to Subquadratic Language Models
- Improving RL Exploration for LLM Reasoning through Retrospective Replay
- An Empirical Study of LLM Reasoning Ability Under Strict Output Length Constraint
- Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
- MIG: Automatic Data Selection for Instruction Tuning by Maximizing Information Gain in Semantic Space
- Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
- Thought Manipulation: External Thought Can Be Efficient for Large Reasoning Models
- CoT-RAG: Integrating Chain of Thought and Retrieval-Augmented Generation to Enhance Reasoning in Large Language Models
- Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning
- From Large to Super-Tiny: End-to-End Optimization for Cost-Efficient LLMs
- D-GEN: Automatic Distractor Generation and Evaluation for Reliable Assessment of Generative Model
- STAMP Your Content: Proving Dataset Membership via Watermarked Rephrasings
- Cost-of-Pass: An Economic Framework for Evaluating Language Models
- ImPart: Importance-Aware Delta-Sparsification for Improved Model Compression and Merging in LLMs
- DIDS: Domain Impact-aware Data Sampling for Large Language Model Training
- Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training
- Antidistillation Sampling
- GeoSense: Evaluating Identification and Application of Geometric Principles in Multimodal Reasoning
- Are Retrials All You Need? Enhancing Large Language Model Reasoning Without Verbalized Feedback
- Entropy-Guided Watermarking for LLMs: A Test-Time Framework for Robust and Traceable Text Generation
- d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
- FLIP Reasoning Challenge
- Answer First, Reason Later: Commitment Order in Diffusion LLMs
- Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning
- CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits
- MACRO: Markov Chain Routing of Transformer Layers
- Beyond Full-Model Rollback: AuroSFT for Adapter-State Multi-Task Fine-Tuning
- DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding
- Decoupling Perception from Description: Computation-Grounded Representation Alignment between Multivariate Time Series and Language
- PPDL: LLM-Based Flows as Probabilistic Programs
- EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding
- QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding
- Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models
- Cross-Architecture Steering Transfer in Language Models: A Systematic Empirical Study
- RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs
- d3LLM: Ultra-Fast Diffusion LLM using Pseudo-Trajectory Distillation
- All-Quadrant Bounded Clipping GRPO: Closing the Unbounded Blind Spot for Stable and Generalizable Training
- SpecPipe: Accelerating Pipeline Parallelism-based LLM Inference with Speculative Decoding
- A Dual-Space Framework for General Knowledge Distillation of Large Language Models
- DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning
- Efficient Reasoning Models: A Survey
- PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
- Leveraging Submodule Linearity Enhances Task Arithmetic Performance in LLMs
- ARise: Towards Knowledge-Augmented Reasoning via Risk-Adaptive Search
- MMC: Iterative Refinement of VLM Reasoning via MCTS-based Multimodal Critique
- Offline Learning and Forgetting for Reasoning with Large Language Models
- How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients
- Introducing Large Language Models as the Next Challenging Internet Traffic Source
- EMAFusion: A Self-Optimizing System for Seamless LLM Selection and Integration
- HELIOS: Adaptive Model And Early-Exit Selection for Efficient LLM Inference Serving
- Executable Functional Abstractions: Inferring Generative Programs for Advanced Math Problems
- InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
- Weight Ensembling Improves Reasoning in Language Models
- LLM Unlearning Reveals a Stronger-Than-Expected Coreset Effect in Current Benchmarks
- Enhancing Reasoning Abilities of Small LLMs with Cognitive Alignment
- The Jailbreak Tax: How Useful are Your Jailbreak Outputs?
- Exploring the System 1 Thinking Capability of Large Reasoning Models
- DICE: A Framework for Dimensional and Contextual Evaluation of Language Models
- Breaking the Data Barrier -- Building GUI Agents Through Task Generalization
- Read Before You Think: Mitigating LLM Comprehension Failures with Step-by-Step Reading
- Can the capability of Large Language Models be described by human ability? A Meta Study
- Leveraging Reasoning Model Answers to Enhance Non-Reasoning Model Capability
- Syzygy of Thoughts: Improving LLM CoT with the Minimal Free Resolution
- Short-Path Prompting in LLMs: Analyzing Reasoning Instability and Solutions for Robust Performance
- Alleviating the Fear of Losing Alignment in LLM Fine-tuning
- Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning
- Position: Beyond Euclidean -- Foundation Models Should Embrace Non-Euclidean Geometries
- Large Language Models Could Be Rote Learners
- A Strategic Coordination Framework of Small LLMs Matches Large LLMs in Data Synthesis
- SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
- A Survey of Reasoning with Foundation Models: Concepts, Methodologies, and Outlook
- Playpen: An Environment for Exploring Learning Through Conversational Interaction
- HyperCore: The Core Framework for Building Hyperbolic Foundation Models with Comprehensive Modules
- Dynamic Cheatsheet: Test-Time Learning with Adaptive Memory
- Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining
- Pangu Ultra: Pushing the Limits of Dense Large Language Models on Ascend NPUs
- Cluster-Driven Expert Pruning for Mixture-of-Experts Large Language Models
- AI-Slop to AI-Polish? Aligning Language Models through Edit-Based Writing Rewards and Test-time Computation
- Supervised Optimism Correction: Be Confident When LLMs Are Sure
- Task-Circuit Quantization: Leveraging Knowledge Localization and Interpretability for Compression
- LoRI: Reducing Cross-Task Interference in Multi-Task Low-Rank Adaptation
- SD2: Self-Distilled Sparse Drafters
- Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?
- DeduCE: Deductive Consistency as a Framework to Evaluate LLM Reasoning
- ThoughtProbe: Classifier-Guided Thought Space Exploration Leveraging LLM Intrinsic Reasoning
- MDIT: A Model-free Data Interpolation Method for Diverse Instruction Tuning
- Alice: Proactive Learning with Teacher's Demonstrations for Weak-to-Strong Generalization
- Self-Steering Language Models
- S'MoRE: Structural Mixture of Residual Experts for Parameter-Efficient LLM Fine-tuning
- Encoder-Decoder Gemma: Improving the Quality-Efficiency Trade-Off via Adaptation
- From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models
- MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
- ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs
- Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
- DEL: Context-Aware Dynamic Exit Layer for Efficient Self-Speculative Decoding
- Can LLMs Simulate Personas with Reversed Performance? A Systematic Investigation for Counterfactual Instruction Following in Math Reasoning Context
- Knowledge-Instruct: Effective Continual Pre-training from Limited Data using Instructions
- OrderChain: Towards General Instruct-Tuning for Stimulating the Ordinal Understanding Ability of MLLM
- SEAL: Steerable Reasoning Calibration of Large Language Models for Free
- EduPlanner: LLM-Based Multi-Agent Systems for Customized and Intelligent Instructional Design
- Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
- Weak-for-Strong: Training Weak Meta-Agent to Harness Strong Executors
- Fast Controlled Generation from Language Models with Adaptive Weighted Rejection Sampling
Discussions
Related