Training Verifiers to Solve Math Word Problems
2021/10/27 by Karl Cobbe, Cobbe, Karl, Vineet Kosaraju +12 · 1463 citations
Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
paper · pdf · doi:10.48550/arxiv.2110.14168
openalex publication_date 2021/10/27 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
State-of-the-art language models can match human performance on many tasks, but they still struggle to robustly perform multi-step mathematical reasoning. To diagnose the failures of current models and support research, we introduce GSM8K, a dataset of 8.5K high quality linguistically diverse grade school math word problems. We find that even the largest transformer models fail to achieve high test performance, despite the conceptual simplicity of this problem distribution. To increase performance, we propose training verifiers to judge the correctness of model completions. At test time, we generate many candidate solutions and select the one ranked highest by the verifier. We demonstrate that verification significantly improves performance on GSM8K, and we provide strong empirical evidence that verification scales more effectively with increased data than a finetuning baseline.
Citations
Cited by
- UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective
- Coupling Experts and Routers in Mixture-of-Experts via an Auxiliary Loss
- Same or Not? Enhancing Visual Perception in Vision-Language Models
- Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance
- Entropy-Guided Token Dropout: Training Autoregressive Language Models with Limited Domain Data
- The Reward Model Selection Crisis in Personalized Alignment
- Diversity or Precision? A Deep Dive into Next Token Prediction
- LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws
- BenCSSmark: Making the Social Sciences Count in LLM Research
- WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference
- When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs
- Learning When Not to Attend Globally
- AFA-LoRA: Enabling Non-Linear Adaptations in LoRA with Activation Function Annealing
- Efficient Multi-Model Orchestration for Self-Hosted Large Language Models
- LLMBoost: Make Large Language Models Stronger with Boosting
- Shape of Thought: When Distribution Matters More than Correctness in Reasoning Tasks
- DiRL: An Efficient Post-Training Framework for Diffusion Language Models
- State-dependent error correlations shape voting thresholds in committees of AI agents
- ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning
- DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention
- Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion
- Attention Residuals
- ATLAS: Automated Approximation of Transformers for Efficient Homomorphic Inference in One Hour
- Selecting Language Models for Social Science: Start Small, Start Open, and Validate
- DualityCert: Verifier-Gated Language-Model Repair of Broken Duality Claims in Quantum Field Theory
- The JEPA Paradox in Language: The Geometry of Linguistic Alternatives
- Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam
- Training Language Models to Cooperate with Inference-Time Controllers
- From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
- The Intruder Threshold: A Spectral Law for LoRA Fine-Tuning
- Rethinking the Generation Order of Block Diffusion Language Models
- From Data to Device: ELMOD An Efficient German-First 2.7B Language Model for Mobile Inference
- SymStep: Symbolic Step Verification for Logical Reasoning
- ADAGE: A Language-Agnostic Pipeline for Analogical Reasoning Evaluation
- Bridging Compute- and Data-Optimal Pretraining
- Retraction-Free Optimization over the Stiefel Manifold for the LoRA Fine-Tuning
- Toward an Organizational Science of Multi-Agent LLM Systems: Decoupling Who, How, and Which Algorithm
- Mask2Shield: Strengthening LLM Safety against Neuron-Pruning Attacks
- In-Context Learning as Implicit Policy Gradient
- Not All LLM Reasoning is Visible in the Chain-of-Thought
- Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias
- AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning
- How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift
- CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data
- CaRE Compute-aware Remasking Evaluation Protocol for Masked Diffusion Language Models
- PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding
- Masked Distillation: Internalizing the Chain-of-Thought in Language Models
- What Does Chain-of-Thought Contribute at Probe Time? Evidence for Local Co-Occurrence Activation
- Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy
- From Context to Skills: Can Language Models Learn from Context Skillfully?
- Towards Isolated Interventions via Almost Orthogonal Features in Language Models
- Entropy Sentinel: Probing Entropy Traces for LLM Monitoring
- Accelerate Speculative Decoding with Sparse Computation in Verification
- Broken Words, Broken Performance: Effect of Tokenization on Performance of LLMs
- Gamayun's Path to Multilingual Mastery: Cost-Efficient Training of a 1.5B-Parameter LLM
- MoRAgent: Parameter Efficient Agent Tuning with Mixture-of-Roles
- Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty
- AInsteinBench: Benchmarking Coding Agents on Scientific Repositories
- Artificial or Just Artful? Do LLMs Bend the Rules in Programming?
- Rethinking Supervised Fine-Tuning: Emphasizing Key Answer Tokens for Improved LLM Accuracy
- EVE: A Generator-Verifier System for Generative Policies
- Scaling Reinforcement Learning for Content Moderation with Large Language Models
- Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs
- TableGPT-R1: Advancing Tabular Reasoning Through Reinforcement Learning
- Schoenfeld's Anatomy of Mathematical Reasoning by Language Models
- Optimistic TEE-Rollups: A Hybrid Architecture for Scalable and Verifiable Generative AI Inference on Blockchain
- Concept Generalization in Humans and Large Language Models: Insights from the Number Game
- Reaching Agreement Among Reasoning LLM Agents
- The Seismic Wavefield Common Task Framework
- Selective LoRA for Visual Tokens and Attention Heads
- JEPA-Reasoner: Decoupling Latent Reasoning from Token Generation
- Understanding Chain-of-Thought in Large Language Models via Topological Data Analysis
- Population-Evolve: a Parallel Sampling and Evolutionary Method for LLM Math Reasoning
- Can abstract concepts from LLM improve SLM performance?
- Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models
- MAGIC: Achieving Superior Model Merging via Magnitude Calibration
- CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning
- Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection
- MoE Pathfinder: Trajectory-driven Expert Pruning
- Training LLMs with LogicReward for Faithful and Rigorous Reasoning
- Efficient Mixture-of-Agents Serving via Tree-Structured Routing, Adaptive Pruning, and Dependency-Aware Prefill-Decode Overlap
- Rethinking Multi-Agent Intelligence Through the Lens of Small-World Networks
- When Reasoning Meets Its Laws
- ReX-MLE: The Autonomous Agent Benchmark for Medical Imaging Challenges
- Mitigating Forgetting in Low Rank Adaptation
- ShareChat: A Dataset of Chatbot Conversations in the Wild
- AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens
- Governance-Aware Hybrid Fine-Tuning for Multilingual Large Language Models
- Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs
- Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
- Constructive Circuit Amplification: Improving Math Reasoning in LLMs via Targeted Sub-Network Updates
- Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
- Meta-RL Induces Exploration in Language Agents
- DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI
- Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics
- Sigma-MoE-Tiny Technical Report
- LoPA: Scaling dLLM Inference via Lookahead Parallel Decoding
- LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
- How Much is Too Much? Exploring LoRA Rank Trade-offs for Retaining Knowledge and Domain Robustness
- Autoregressive Language Models are Secretly Energy-Based Models: Insights into the Lookahead Capabilities of Next-Token Prediction
- Bolmo: Byteifying the Next Generation of Language Models
- Revisiting Task-Oriented Dataset Search in the Era of Large Language Models: Challenges, Benchmark, and Solution
- Dual-Density Inference for Efficient Language Model Reasoning
- DEER: Draft with Diffusion, Verify with Autoregressive Models
- Beyond Fast and Slow: Cognitive-Inspired Elastic Reasoning for Large Language Models
- Prompt Repetition Improves Non-Reasoning LLMs
- FrontierCS: Evolving Challenges for Evolving Intelligence
- Cross-Tokenizer Likelihood Scoring Algorithms for Language Model Distillation
- Imitation Learning for Multi-turn LM Agents via On-policy Expert Corrections
- T5Gemma 2: Seeing, Reading, and Understanding Longer
- Let the Barbarians In: How AI Can Accelerate Systems Performance Research
- Fast and Accurate Causal Parallel Decoding using Jacobi Forcing
- Ladder Up, Memory Down: Low-Cost Fine-Tuning With Side Nets
- RADAR: Accelerating Large Language Model Inference With RL-Based Dynamic Draft Trees
- What Affects the Effective Depth of Large Language Models?
- OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value
- Intention Chain-of-Thought Prompting with Dynamic Routing for Code Generation
- Sharing State Between Prompts and Programs
- Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation
- ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
- Differentiable Evolutionary Reinforcement Learning
- FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
- AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
- Socratic Students: Teaching Language Models to Learn by Asking Questions
- MIDUS: Memory-Infused Depth Up-Scaling
- SIGMA: An AI-Empowered Training Stack on Early-Life Hardware
- One Leak Away: How Pretrained Model Exposure Amplifies Jailbreak Risks in Finetuned LLMs
- VOYAGER: A Training Free Approach for Generating Diverse Datasets using LLMs
- Hold Onto That Thought: Assessing KV Cache Compression On Reasoning
- LYNX: Learning Dynamic Exits for Confidence-Controlled Reasoning
- Mistake Notebook Learning: Batch-Clustered Failures for Training-Free Agent Adaptation
- CADMorph: Geometry-Driven Parametric CAD Editing via a Plan-Generate-Verify Loop
- Rethinking Expert Trajectory Utilization in LLM Post-training
- AdaGradSelect: An adaptive gradient-guided layer selection method for efficient fine-tuning of SLMs
- Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization
- AdaSD: Adaptive Speculative Decoding for Efficient Language Model Inference
- Progress over Points: Reframing LM Benchmarks Around Scientific Objectives
- Speculative Decoding Speed-of-Light: Optimal Lower Bounds via Branching Random Walks
- Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs
- PIAST: Rapid Prompting with In-context Augmentation for Scarce Training data
- OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification
- GLOW: Graph-Language Co-Reasoning for Agentic Workflow Performance Prediction
- Reverse Thinking Enhances Missing Information Detection in Large Language Models
- MiniF2F-Dafny: LLM-Guided Mathematical Theorem Proving via Auto-Active Verification
- Scaling Behavior of Discrete Diffusion Language Models
- Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
- MOA: Multi-Objective Alignment for Role-Playing Agents
- d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models
- LLaDA2.0: Scaling Up Diffusion Language Models to 100B
- CONCUR: A Framework for Continual Constrained and Unconstrained Routing
- Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens
- Evolving Excellence: Automated Optimization of LLM-based Agents
- Learning Unmasking Policies for Diffusion Language Models
- Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training
- Do Depth-Grown Models Overcome the Curse of Depth? An In-Depth Analysis
- Towards a Science of Scaling Agent Systems
- SkipKV: Selective Skipping of KV Generation and Storage for Efficient Inference with Large Reasoning Models
- On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
- PCMind-2.1-Kaiyuan-2B Technical Report
- Comparative Analysis and Parametric Tuning of PPO, GRPO, and DAPO for LLM Reasoning Enhancement
- Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
- Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning
- SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models
- JT-DA: Enhancing Data Analysis with Tool-Integrated Table Reasoning Large Language Models
- From Next-Token to Next-Block: A Principled Adaptation Path for Diffusion LLMs
- Graph-Regularized Sparse Autoencoders for LLM Safety Steering
- GradientSpace: Unsupervised Data Clustering for Improved Instruction Tuning
- Uncovering Competency Gaps in Large Language Models and Their Benchmarks
- Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models
- Greedy Alignment Principle for Optimizer Selection
- A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation
- A Latent Variable Framework for Scaling Laws in Large Language Models
- TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models
- Mitigating Catastrophic Forgetting in Mathematical Reasoning Finetuning through Mixed Training
- Evolutionary System 2 Reasoning: An Empirical Proof
- RoBoN: Routed Online Best-of-n for Test-Time Scaling with Multiple LLMs
- BEAVER: An Efficient Deterministic LLM Verifier
- SQ-format: A Unified Sparse-Quantized Hardware-friendly Data Format for LLMs
- AI & Human Co-Improvement for Safer Co-Superintelligence
- Sell Data to AI Algorithms Without Revealing It: Secure Data Valuation and Sharing via Homomorphic Encryption
- Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded Updates
- The Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems
- Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
- Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models
- Principled RL for Diffusion LLMs Emerges from a Sequence-Level Perspective
- ADAPT: Learning Task Mixtures for Budget-Constrained Instruction Tuning
- AdmTree: Compressing Lengthy Context with Adaptive Semantic Trees
- Decoding Large Language Diffusion Models with Foreseeing Movement
- Jina-VLM: Small Multilingual Vision Language Model
- OD-MoE: On-Demand Expert Loading for Cacheless Edge-Distributed MoE Inference
- Evaluating Hydro-Science and Engineering Knowledge of Large Language Models
- Cognitive Mirrors: Exploring the Diverse Functional Roles of Attention Heads in LLM Reasoning
- A Preliminary Study on the Promises and Challenges of Native Top-k Sparse Attention
- Nexus: Higher-Order Attention Mechanisms in Transformers
- Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs
- PretrainZero: Reinforcement Active Pretraining
- MarkTune: Improving the Quality-Detectability Trade-off in Open-Weight LLM Watermarking
- When Do Symbolic Solvers Enhance Reasoning in Large Language Models?
- SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
- InnoGym: Benchmarking the Innovation Potential of AI Agents
- Fast-Decoding Diffusion Language Models via Progress-Aware Confidence Schedules
- CryptoQA: A Large-scale Question-answering Dataset for AI-assisted Cryptography
- From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks
- Guided Self-Evolving LLMs with Minimal Human Supervision
- E-valuator: Reliable Agent Verifiers with Sequential Hypothesis Testing
- promptolution: A Unified, Modular Framework for Prompt Optimization
- When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers
- Think in Parallel, Answer as One: Logit Averaging for Open-Ended Reasoning
- Parameter-Efficient Subspace Optimization for LLM Fine-Tuning
- Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
- Neural steering vectors reveal dose and exposure-dependent impacts of human-AI relationships
- KV Pareto: Systems-Level Optimization of KV Cache and Model Compression for Long Context Inference
- SVRG and Beyond via Posterior Correction
- Rectifying LLM Thought from Lens of Optimization
- Zero-Overhead Introspection for Adaptive Test-Time Compute
- Lightweight Latent Reasoning for Narrative Tasks
- Mode-Conditioning Unlocks Superior Test-Time Scaling
- Towards Active Synthetic Data Generation for Finetuning Language Models
- Augmented Runtime Collaboration for Self-Organizing Multi-Agent Systems: A Hybrid Bi-Criteria Routing Approach
- SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs
- EDIT: Early Diffusion Inference Termination for dLLMs Based on Dynamics of Training Gradients
- Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards
- Multi-chain Graph Refinement and Selection for Reliable Reasoning in Large Language Models
- MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?
- Training-Free Loosely Speculative Decoding: Accepting Semantically Correct Drafts Beyond Exact Match
- AgentShield: Make MAS more secure and efficient
- Adversarial Training for Process Reward Models
- A Rosetta Stone for AI Benchmarks
- Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models
- Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
- Revisiting Generalization Across Difficulty Levels: It's Not So Easy
- ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models
- DSD: A Distributed Speculative Decoding Solution for Edge-Cloud Agile Large Model Serving
- Focused Chain-of-Thought: Efficient LLM Reasoning via Structured Input Information
- Decomposed Trust: Exploring Privacy, Adversarial Robustness, Fairness, and Ethics of Low-Rank LLMs
- Learning When to Stop: Adaptive Latent Reasoning via Reinforcement Learning
- BAMAS: Structuring Budget-Aware Multi-Agent Systems
- IntAttention: A Fully Integer Attention Pipeline for Efficient Edge Inference
- Bootstrapping LLMs via Preference-Based Policy Optimization
- The Good, The Bad, and The Hybrid: A Reward Structure Showdown in Reasoning Models Training
- GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs
- Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models
- Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models
- Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs
- From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models
- ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning
- CafeQ: Calibration-free Quantization via Learned Transformations and Adaptive Rounding
- Reinforcement Learning for Latent-Space Thinking in LLMs
- Structured Prompting Enables More Robust Evaluation of Language Models
- CDLM: Consistency Diffusion Language Models For Faster Sampling
- DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs
- Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios
- ParaBlock: Communication-Computation Parallel Block Coordinate Federated Learning for Large Language Models
- Differential Smoothing Mitigates Sharpening and Improves LLM Reasoning
- RPM-MCTS: Knowledge-Retrieval as Process Reward Model with Monte Carlo Tree Search for Code Generation
- Knowing How to Edit: Reliable Evaluation Signals for Diagnosing and Optimizing Prompts at Query Level
- Mosaic Pruning: A Hierarchical Framework for Generalizable Pruning of Mixture-of-Experts Models
- Learning to Reason: Training LLMs with GPT-OSS or DeepSeek R1 Reasoning Traces
- Latent Collaboration in Multi-Agent Systems
- ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models
- Orchestrating Dual-Boundaries: An Arithmetic Intensity Inspired Acceleration Framework for Diffusion Language Models
- GraphMind: Theorem Selection and Conclusion Generation Framework with Dynamic GNN for LLM Reasoning
- Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation
- SWAN: Sparse Winnowed Attention for Reduced Inference Memory via Decompression-Free KV-Cache Compression
- Periodic Asynchrony: An On-Policy Approach for Accelerating LLM Reinforcement Learning
- Think Before You Prune: Selective Self-Generated Calibration for Pruning Large Reasoning Models
- Majority of the Bests: Improving Best-of-N via Bootstrapping
- Eliciting Chain-of-Thought in Base LLMs via Gradient-Based Representation Optimization
- Prompt Less, Smile More: MTP with Semantic Engineering in Lieu of Prompt Engineering
- Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost
- Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning
- Xmodel-2.5: 1.3B Data-Efficient Reasoning SLM
- EngChain: A Symbolic Benchmark for Verifiable Multi-Step Reasoning in Engineering
- A2Flow: Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- AnyExperts: On-Demand Expert Allocation for Multimodal Language Models with Mixture of Expert
- Bringing Stability to Diffusion: Decomposing and Reducing Variance of Training Masked Diffusion Models
- WavefrontDiffusion: Dynamic Decoding Schedule for Improved Reasoning
- Scaling Competence, Shrinking Reasoning: Cognitive Signatures in Language Model Learning
- Deterministic Inference across Tensor Parallel Sizes That Eliminates Training-Inference Mismatch
- Attention Guided Alignment in Efficient Vision-Language Models
- E3-Pruner: Towards Efficient, Economical, and Effective Layer Pruning for Large Language Models
- Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
- Beyond Component Strength: Synergistic Integration and Adaptive Calibration in Multi-Agent RAG Systems
- PersonalizedRouter: Personalized LLM Routing via Graph-based User Preference Modeling
- Fantastic Bugs and Where to Find Them in AI Benchmarks
- ELPO: Ensemble Learning Based Prompt Optimization for Large Language Models
- Pass@k Metric for RLVR: A Diagnostic Tool of Exploration, But Not an Objective
- JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
- Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning
- Global Resolution: Optimal Multi-Draft Speculative Sampling via Convex Minimization
- Reasoning in Diffusion Large Language Models is Concentrated in Dynamic Confusion Zones
- From Solving to Verifying: A Unified Objective for Robust Reasoning in LLMs
- Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference
- What Really Counts? Examining Step and Token Level Attribution in Multilingual CoT Reasoning
- DEPO: Dual-Efficiency Preference Optimization for LLM Agents
- GPS: General Per-Sample Prompter
- Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement Learning
- Entropy-Guided Reasoning Compression
- Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT
- Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models
- Donors and Recipients: On Asymmetric Transfer Across Tasks and Languages with Parameter-Efficient Fine-Tuning
- Cost-Effective Communication: An Auction-based Method for Language Agent Interaction
- Learning from the Undesirable: Robust Adaptation of Language Models without Forgetting
- Group-Aware Reinforcement Learning for Output Diversity in Large Language Models
- ARCHE: A Novel Task to Evaluate LLMs on Latent Reasoning Chain Extraction
- Genomic Next-Token Predictors are In-Context Learners
- Optimal Self-Consistency for Efficient Reasoning with Large Language Models
- Better LLM Reasoning via Dual-Play
- Striking the Right Balance between Compute and Copy: Improving LLM Inferencing Under Speculative Decoding
- GateRA: Token-Aware Modulation for Parameter-Efficient Fine-Tuning
- From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
- Defending Unauthorized Model Merging via Dual-Stage Weight Protection
- FarSkip-Collective: Unhobbling Blocking Communication in Mixture of Experts Models
- Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation
- BhashaKritika: Building Synthetic Pretraining Data at Scale for Indic Languages
- Virtual Width Networks
- GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models
- When Data is the Algorithm: A Systematic Study and Curation of Preference Optimization Datasets
- Reasoning About Intent for Ambiguous Requests
- Do Not Merge My Model! Safeguarding Open-Source LLMs Against Unauthorized Model Merging
- Efficient Thought Space Exploration Through Strategic Intervention
- Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
- Reasoning: From Reflection to Solution
- Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis for Large Reasoning Models
- EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
- Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models
- Steering Pretrained Drafters during Speculative Decoding
- Rethinking the Reliability of Multi-agent System: A Perspective from Byzantine Fault Tolerance
- Hail to the Thief: Exploring Attacks and Defenses in Decentralised GRPO
- The Ouroboros of Benchmarking: Reasoning Evaluation in an Era of Saturation
- Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models
- Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models
- A Matter of Interest: Understanding Interestingness of Math Problems in Humans and Language Models
- SPEAR-MM: Selective Parameter Evaluation and Restoration via Model Merging for Efficient Financial LLM Adaptation
- Why Should the Server Do It All?: A Scalable, Versatile, and Model-Agnostic Framework for Server-Light DNN Inference over Massively Distributed Clients via Training-Free Intermediate Feature Compression
- AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
- Multimodal LLMs Do Not Compose Skills Optimally Across Modalities
- MSCR: Exploring the Vulnerability of LLMs' Mathematical Reasoning Abilities Using Multi-Source Candidate Replacement
- DynaAct: Large Language Model Reasoning with Dynamic Action Spaces
- Numerical Sensitivity and Robustness: Exploring the Flaws of Mathematical Reasoning in Large Language Models
- WaterMod: Modular Token-Rank Partitioning for Probability-Balanced LLM Watermarking
- From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
- PCRLLM: Proof-Carrying Reasoning with Large Language Models under Stepwise Logical Constraints
- When, What, and How: Rethinking Retrieval-Enhanced Speculative Decoding
- RedOne 2.0: Rethinking Domain-specific LLM Post-Training in Social Networking Services
- Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs
- C3PO: Optimized Large Language Model Cascades with Probabilistic Cost Constraints for Reasoning
- Think Consistently, Reason Efficiently: Energy-Based Calibration for Implicit Chain-of-Thought
- More Agents Helps but Adversarial Robustness Gap Persists
- EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers
- TuckA: Hierarchical Compact Tensor Experts for Efficient Fine-Tuning
- MathSE: Improving Multimodal Mathematical Reasoning via Self-Evolving Iterative Reflection and Reward-Guided Fine-Tuning
- Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence
- MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
- Self-Evaluating LLMs for Multi-Step Tasks: Stepwise Confidence Estimation for Failure Detection
- Better Datasets Start From RefineLab: Automatic Optimization for High-Quality Dataset Refinement
- You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
- EASE: Practical and Efficient Safety Alignment for Small Language Models
- MuonAll: Muon Variant for Efficient Finetuning of Large Language Models
- Route Experts by Sequence, not by Token
- DyKAF: Dynamical Kronecker Approximation of the Fisher Information Matrix for Gradient Preconditioning
- Towards Resource-Efficient Multimodal Intelligence: Learned Routing among Specialized Expert Models
- Optimizing Chain-of-Thought Confidence via Topological and Dirichlet Risk Analysis
- CG-TTRL: Context-Guided Test-Time Reinforcement Learning for On-Device Large Language Models
- ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
- Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models
- FLEX: Continuous Agent Evolution via Forward Learning from Experience
- ScRPO: From Errors to Insights
- MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling
- CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization
- OckBench: Measuring the Efficiency of LLM Reasoning
- Optimizing Diversity and Quality through Base-Aligned Model Collaboration
- Steering Language Models with Weight Arithmetic
- Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results
- KLASS: KL-Guided Fast Inference in Masked Diffusion Models
- Motif 2 12.7B technical report
- Logit-Entropy Adaptive Stopping Heuristic for Efficient Chain-of-Thought Reasoning
- Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
- Are language models aware of the road not taken? Token-level uncertainty and hidden state dynamics
- RIDE: Difficulty Evolving Perturbation with Item Response Theory for Mathematical Reasoning
- CryptoMoE: Privacy-Preserving and Scalable Mixture of Experts Inference via Balanced Expert Routing
- LiveTradeBench: Seeking Real-World Alpha with Large Language Models
- Efficient Reasoning via Thought-Training and Thought-Free Inference
- In Good GRACEs: Principled Teacher Selection for Knowledge Distillation
- Curriculum Design for Trajectory-Constrained Agent: Compressing Chain-of-Thought Tokens in LLMs
- Optimal Singular Damage: Efficient LLM Inference in Low Storage Regimes
- DecompSR: A dataset for decomposed analyses of compositional multihop spatial reasoning
- CGES: Confidence-Guided Early Stopping for Efficient and Accurate Self-Consistency
- LTD-Bench: Evaluating Large Language Models by Letting Them Draw
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- FATE: A Formal Benchmark Series for Frontier Algebra of Multiple Difficulty Levels
- Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models
- Can LLMs subtract numbers?
- Watermarking Discrete Diffusion Language Models
- Towards Robust Mathematical Reasoning
- KV Cache Transform Coding for Compact Storage in LLM Inference
- Random Initialization of Gated Sparse Adapters
- Measuring what Matters: Construct Validity in Large Language Model Benchmarks
- RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks
- FEval-TTC: Fair Evaluation Protocol for Test-Time Compute
- Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning
- Efficient Test-Time Retrieval Augmented Generation
- Prompt-R1: Collaborative Automatic Prompting Framework via End-to-end Reinforcement Learning
- Do Math Reasoning LLMs Help Predict the Impact of Public Transit Events?
- Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
- How Focused Are LLMs? A Quantitative Study via Repetitive Deterministic Prediction Tasks
- Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices
- Inference-Time Chain-of-Thought Pruning with Latent Informativeness Signals
- Toward Sustainability-Aware LLM Inference on Edge Clusters
- Reasoning Planning for Language Models
- G2: Guided Generation for Enhanced Output Diversity in LLMs
- Superpositional Gradient Descent: Harnessing Quantum Principles for Model Training
- Sherlock: Reliable and Efficient Agentic Workflow Execution
- Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
- TempoBench: Evaluating Temporal Causal Reasoning in Large Language Models
- Diffuse Thinking: Exploring Diffusion Language Models as Efficient Thought Proposers for Reasoning
- VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision
- LLM generation novelty through the lens of semantic similarity
- Glia: A Human-Inspired AI for Automated Systems Design and Optimization
- Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
- A Comparative Analysis of LLM Adaptation: SFT, LoRA, and ICL in Data-Scarce Scenarios
- LongCat-Flash-Omni Technical Report
- H-FA: A Hybrid Floating-Point and Logarithmic Approach to Hardware Accelerated FlashAttention
- Kad: A Framework for Proxy-based Test-time Alignment with Knapsack Approximation Deferral
- FlowMesh: A Service Fabric for Composable LLM Workflows
- AMO-Bench: Large Language Models Still Struggle in High School Math Competitions
- Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models
- Chopping Trees: Semantic Similarity Based Dynamic Pruning for Tree-of-Thought Reasoning
- LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits
- Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model
- Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems
- EdgeRunner 20B: Military Task Parity with GPT-5 while Running on the Edge
- Polybasic Speculative Decoding Through a Theoretical Perspective
- Think Outside the Policy: In-Context Steered Policy Optimization
- OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
- Chain-of-Thought Hijacking
- Scales++: Compute Efficient Evaluation Subset Selection with Cognitive Scales Embeddings
- The Geometry of Dialogue: Graphing Language Models to Reveal Synergistic Teams for Multi-Agent Collaboration
- From Amateur to Master: Infusing Knowledge into LLMs via Automated Curriculum Learning
- Unravelling the Mechanisms of Manipulating Numbers in Language Models
- Angular Steering: Behavior Control via Rotation in Activation Space
- Test-Time Alignment of LLMs via Sampling-Based Optimal Control in pre-logit space
- RCScore: Quantifying Response Consistency in Large Language Models
- Lean4Physics: Comprehensive Reasoning Framework for College-level Physics in Lean4
- Predicate Renaming via Large Language Models
- CausalGuard: A Smart System for Detecting and Preventing False Information in Large Language Models
- Gaperon: A Peppered English-French Generative Language Model Suite
- E-Scores for (In)Correctness Assessment of Generative Model Outputs
- Adaptively Robust LLM Monitoring via Activation Watermarking
- Are Language Models Efficient Reasoners? A Perspective from Logic Programming
- NormWorlds-CF: Solver-Verified Counterfactual Normative Reasoning with Metamorphic-Relation GRPO
- From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs
- LLM-as-a-Verifier: A General-Purpose Verification Framework
- From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models
- HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models
- FedWeave: Rethinking the Unit of Specialization in Heterogeneous Federated MoE-LoRA
- Metis: Memory Foundation Model
- Constitutional Midtraining: Content Presence Drives Alignment Gains
- Do Latent Channels Actually Communicate? A Causal Audit of Latent Multi-Agent LLM
- Between Gradient and Natural Gradient: A Continuum of LoRA Initializations
- Multi-Agent Debate Strategies: Survey, Taxonomy, and Challenges
- A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models
- EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
- Training Language Models via Neural Cellular Automata
- PRISM-Physics: Causal DAG-Based Process Evaluation for Physics Reasoning
- RAPID: An Efficient Reinforcement Learning Algorithm for Small Language Models
- Covenant-72B: Pre-Training a 72B LLM with Trustless Peers Over-the-Internet
- Will Scaling Improve Social Simulation with LLMs?
- Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents
- Two Calls Beat Five Agents: Evaluating Multi-Agent Pipelines Against Self-Refinement for Local Language Models
- ThriftAttention: Selective Mixed Precision for Long-Context FP4 Attention
- MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval
- Guess-Verify-Refine: Data-Aware Top-K for Sparse-Attention Decoding on Blackwell via Temporal Correlation
- Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale
- MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue
- RL makes MLLMs see better than SFT
- HySparse: A Hybrid Sparse Attention Architecture with Oracle Token Selection and KV Cache Sharing
- FrugalPrompt: Reducing Contextual Overhead in Large Language Models via Token Attribution
- Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
- PRESTO: Preimage-Informed Instruction Optimization for Prompting Black-Box LLMs
- Sharpness-Guided Group Relative Policy Optimization via Probability Shaping
- A Survey on Unlearning in Large Language Models
- SemCoT: Accelerating Chain-of-Thought Reasoning through Semantically-Aligned Implicit Tokens
- RiddleBench: A New Generative Reasoning Benchmark for LLMs
- SPICE: Self-Play In Corpus Environments Improves Reasoning
- MISA: Memory-Efficient LLMs Optimization with Module-wise Importance Sampling
- MedRule-KG: A Knowledge-Graph--Steered Scaffold for Mathematical Reasoning with a Lightweight Verifier
- Zero-Shot Cross-Lingual Transfer using Prefix-Based Adaptation
- LoRA-DA: Data-Aware Initialization for Low-Rank Adaptation via Asymptotic Analysis
- Structured Interfaces for Automated Reasoning with 3D Scene Graphs
- What Limits Agentic Systems Efficiency?
- Parallel Loop Transformer for Efficient Test-Time Computation Scaling
- BuildArena: A Physics-Aligned Interactive Benchmark of LLMs for Engineering Construction
- SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models
- APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training
- Calibrating and Rotating: A Unified Framework for Weight Conditioning in PEFT
- Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
- Verifying Large Language Models' Reasoning Paths via Correlation Matrix Rank
- SALS: Sparse Attention in Latent Space for KV cache Compression
- MASPRM: Multi-Agent System Process Reward Model
- Before you , monitor: Implementing Flavell's metacognitive framework in LLMs
- ChessQA: Evaluating Large Language Models for Chess Understanding
- SelecTKD: Selective Token-Weighted Knowledge Distillation for LLMs
- GIFT: Group-relative Implicit Fine Tuning Integrates GRPO with DPO and UNA
- On the Impossibility of Retrain Equivalence in Machine Unlearning
- ScaLoRA: Optimally Scaled Low-Rank Adaptation for Efficient High-Rank Fine-Tuning
- Multi-Agent Evolve: LLM Self-Improve through Co-evolution
- PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection
- Unleashing Diverse Thinking Modes in LLMs through Multi-Agent Collaboration
- Learning to Reason Efficiently with Discounted Reinforcement Learning
- Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
- The Best of N Worlds: Aligning Reinforcement Learning with Best-of-N Sampling via max@k Optimisation
- Adaptive Blockwise Search: Inference-Time Alignment for Large Language Models
- SentinelNet: Safeguarding Multi-Agent Collaboration Through Credit-Based Dynamic Threat Detection
- A Survey on LLM Mid-Training
- Knocking-Heads Attention
- Improving Human Verification of LLM Reasoning through Interactive Explanation Interfaces
- Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
- TELL-TALE: Task Efficient LLMs with Task Aware Layer Elimination
- AutoBench: Automating LLM Evaluation through Reciprocal Peer Assessment
- AsyncVoice Agent: Real-Time Explanation for LLM Planning and Reasoning
- Backward-Friendly Optimization: Training Large Language Models with Approximate Gradients under Memory Constraints
- Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks
- Expert Merging in Sparse Mixture of Experts with Nash Bargaining
- Modeling Hierarchical Thinking in Large Reasoning Models
- You Don't Need Prompt Engineering Anymore: The Prompting Inversion
- Edit Less, Achieve More: Dynamic Sparse Neuron Masking for Lifelong Knowledge Editing in LLMs
- Controllable Mathematical Reasoning via Self-Optimizing Thought Vectors
- Generalization or Memorization: Dynamic Decoding for Mode Steering
- Emotions Where Art Thou: Understanding and Characterizing the Emotional Latent Space of Large Language Models
- Foundation of Intelligence: Review of Math Word Problems from Human Cognition Perspective
- Parallel Sampling from Masked Diffusion Models via Conditional Independence Testing
- Confidence is Not Competence
- RETuning: Upgrading Inference-Time Scaling for Stock Movement Prediction with Large Language Models
- Boosting Accuracy and Efficiency of Budget Forcing in LLMs via Reinforcement Learning for Mathematical Reasoning
- Risk Management for Mitigating Benchmark Failure Modes: BenchRisk
- Multi-turn Training with Basic Human Feedback Helps Little on LLM Reasoning
- Compressing Many-Shots in In-Context Learning
- Model Merging with Functional Dual Anchors
- Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency
- Chain of Execution Supervision Promotes General Reasoning in Large Language Models
- Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
- DictPFL: Efficient and Private Federated Learning on Encrypted Gradients
- The Universal Landscape of Human Reasoning
- Attention Sinks in Diffusion Language Models
- Towards Scalable Oversight with Collaborative Multi-Agent Debate in Error Detection
- Thought Communication in Multiagent Collaboration
- Systematic Evaluation of Uncertainty Estimation Methods in Large Language Models
- What Defines Good Reasoning in LLMs? Dissecting Reasoning Steps with Multi-Aspect Evaluation
- ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases
- Teaching Language Models to Reason with Tools
- TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
- LM-mixup: Text Data Augmentation via Language Model based Mixup
- Can Confidence Estimates Decide When Chain-of-Thought Is Necessary for LLMs?
- Not-a-Bandit: Provably No-Regret Drafter Selection in Speculative Decoding for LLMs
- Policy Optimization Prefers The Path of Least Resistance
- A Tutorial on Cognitive Biases in Agentic AI-Driven 6G Autonomous Networks
- Data-Centric Lessons To Improve Speech-Language Pretraining
- SmartSwitch: Advancing LLM Reasoning by Overcoming Underthinking via Promoting Deeper Thought Exploration
- Zhyper: Factorized Hypernetworks for Conditioned LLM Fine-Tuning
- Fast Inference via Hierarchical Speculative Decoding
- Teaming LLMs to Detect and Mitigate Hallucinations
- HarmRLVR: Weaponizing Verifiable Rewards for Harmful LLM Alignment
- AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
- HAD: HAllucination Detection Language Models Based on a Comprehensive Hallucination Taxonomy
- The Zero-Step Thinking: An Empirical Study of Mode Selection as Harder Early Exit in Reasoning Models
- AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
- DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference
- No Compute Left Behind: Rethinking Reasoning and Sampling with Masked Diffusion Models
- DiSRouter: Distributed Self-Routing for LLM Selections
- What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
- Verifiable Accuracy and Abstention Rewards in Curriculum RL to Alleviate Lost-in-Conversation
- Reasoning Language Model Inference Serving Unveiled: An Empirical Study
- From Quarter to All: Accelerating Speculative LLM Decoding via Floating-Point Exponent Remapping and Parameter Sharing
- Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients
- Higher Embedding Dimension Creates a Stronger World Model for a Simple Sorting Task
- Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs
- Adaptive Coopetition: Leveraging Coarse Verifier Signals for Resilient Multi-Agent LLM Reasoning
- NeuroAda: Activating Each Neuron's Potential for Parameter-Efficient Fine-Tuning
- Test-time Verification via Optimal Transport: Coverage, ROC, & Sub-optimality
- Local Coherence or Global Validity? Investigating RLVR Traces in Math Domains
- Learning from Generalization Patterns: An Evaluation-Driven Approach to Enhanced Data Augmentation for Fine-Tuning Small Language Models
- Evaluating LLM Reasoning Beyond Correctness and CoT
- Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth
- OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning
- From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
- Unbiased Gradient Low-Rank Projection
- Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
- Inference-Time Compute Scaling For Flow Matching
- Empowering Real-World: A Survey on the Technology, Practice, and Evaluation of LLM-driven Industry Agents
- Certified Self-Consistency: Statistical Guarantees and Test-Time Training for Reliable Reasoning in LLMs
- Strengthening LLMs for Tabular Prediction with Structural Priors
- Select-Then-Decompose: From Empirical Analysis to Adaptive Selection Strategy for Task Decomposition in Large Language Models
- Soft-Masked Diffusion Language Models
- EduAdapt: A Question Answer Benchmark Dataset for Evaluating Grade-Level Adaptability in LLMs
- Verification-Aware Planning for Multi-Agent Systems
- JT-Safe: Intrinsically Enhancing the Safety and Trustworthiness of LLMs
- Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization
- ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models
- Online Mixture of Experts: No-Regret Learning for Optimal Collective Decision-Making
- A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications
- Utility-Diversity Aware Online Batch Selection for LLM Supervised Fine-tuning
- When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling
- Neuronal Group Communication for Efficient Neural representation
- Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
- Planner and Executor: Collaboration between Discrete Diffusion And Autoregressive Models in Reasoning
- Dual-Weighted Reinforcement Learning for Generative Preference Modeling
- Soundness-Aware Level: A Microscopic Signature that Predicts LLM Reasoning Potential
- ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning
- MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
- Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert models
- Structure-R1: Dynamically Leveraging Structural Knowledge in LLM Reasoning through Reinforcement Learning
- Attention Is All You Need for KV Cache in Diffusion LLMs
- LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
- Predicting Task Performance with Context-aware Scaling Laws
- Midtraining Bridges Pretraining and Posttraining Distributions
- To Infinity and Beyond: Tool-Use Unlocks Length Generalization in State Space Models
- AMS-QUANT: Adaptive Mantissa Sharing for Floating-point Quantization
- Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning
- Beyond Multi-Token Prediction: Pretraining LLMs with Future Summaries
- Purifying Task Vectors in Knowledge-Aware Subspace for Model Merging
- Holdout-Loss-Based Data Selection for LLM Finetuning via In-Context Learning
- Understanding the Ability of LLMs to Handle Character-Level Perturbation
- Metacognitive Self-Correction for Multi-Agent System via Prototype-Guided Next-Execution Reconstruction
- A Guardrail for Safety Preservation: When Safety-Sensitive Subspace Meets Harmful-Resistant Null-Space
- Flip-Flop Consistency: Unsupervised Training for Robustness to Prompt Perturbations in LLMs
- Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models
- RLSR: Reinforcement Learning with Supervised Reward Outperforms SFT in Instruction Following
- Budget-aware Test-time Scaling via Discriminative Verification
- ERGO: Entropy-guided Resetting for Generation Optimization in Multi-turn Language Models
- REAP the Experts: Why Pruning Prevails for One-Shot MoE compression
- Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
- Big Reasoning with Small Models: Instruction Retrieval at Inference Time
- NOSA: Native and Offloadable Sparse Attention
- Confidence as a Reward: Transforming LLMs into Reward Models
- Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation
- End-to-End Multi-Modal Diffusion Mamba
- Putting on the Thinking Hats: A Survey on Chain of Thought Fine-tuning from the Perspective of Human Reasoning Mechanism
- GatePro: Parameter-Free Expert Selection Optimization for Mixture-of-Experts Models
- Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling
- Mirror Speculative Decoding: Breaking the Serial Barrier in LLM Inference
- Adaptive Reasoning Executor: A Collaborative Agent System for Efficient Reasoning
- ConsintBench: Evaluating Language Models on Real-World Consumer Intent Understanding
- Evaluating Arabic Large Language Models: A Survey of Benchmarks, Methods, and Gaps
- Max It or Miss It: Benchmarking LLM On Solving Extremal Problems
- Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization
- BoN Appetit Team at LeWiDi-2025: Best-of-N Test-time Scaling Can Not Stomach Annotation Disagreements (Yet)
- Who's Asking? Evaluating LLM Robustness to Inquiry Personas in Factual Question Answering
- KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems
- Dr.LLM: Dynamic Layer Routing in LLMs
- CARVQ: Corrective Adaptor with Group Residual Vector Quantization for LLM Embedding Compression
- Market-Driven Subset Selection for Budgeted Training
- MoBiLE: Efficient Mixture-of-Experts Inference on Consumer GPU with Mixture of Big Little Experts
- MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
- Towards Inference-time Scaling for Continuous Space Reasoning
- A Survey on Parallel Reasoning
- Self-Verifying Reflection Helps Transformers with CoT Reasoning
- Reliable Fine-Grained Evaluation of Natural Language Math Proofs
- Uncertainty Quantification for Hallucination Detection in Large Language Models: Foundations, Methodology, and Future Directions
- OPLoRA: Orthogonal Projection LoRA Prevents Catastrophic Forgetting during Parameter-Efficient Fine-Tuning
- Multi-stage Prompt Refinement for Mitigating Hallucinations in Large Language Models
- UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
- Catch Your Breath: Adaptive Computation for Self-Paced Sequence Production
- LLM Reasoning for Machine Translation: Synthetic Data Generation over Thinking Tokens
- Balancing Synthetic Data and Replay for Enhancing Task-Specific Capabilities
- Z0-Inf: Zeroth Order Approximation for Data Influence
- Are Large Reasoning Models Interruptible?
- QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
- Representation-Based Exploration for Language Models: From Test-Time to Post-Training
- Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
- A2FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning
- MeTA-LoRA: Data-Efficient Multi-Task Fine-Tuning for Large Language Models
- Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models
- From to : Multidimensional Supervision of Reasoning Process for LLM Optimization
- Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs
- Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization
- Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States
- LogiNumSynth: Synthesizing Joint Logical-Numerical Reasoning Problems for Language Models
- DND: Boosting Large Language Models with Dynamic Nested Depth
- APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport
- MC#: Mixture Compressor for Mixture-of-Experts Large Models
- Cog-Rethinker: Hierarchical Metacognitive Reinforcement Learning for LLM Reasoning
- BanglaMATH : A Bangla benchmark dataset for testing LLM mathematical reasoning at grades 6, 7, and 8
- Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
- AMiD: Knowledge Distillation for LLMs with α-mixture Assistant Distribution
- Beyond Consensus: Mitigating the Agreeableness Bias in LLM Judge Evaluations
- Direct Multi-Token Decoding
- Preserving LLM Capabilities through Calibration Data Curation: From Analysis to Optimization
- HyperAgent: Leveraging Hypergraphs for Topology Optimization in Multi-Agent Communication
- GraphTracer: Graph-Guided Failure Tracing in LLM Agents for Robust Multi-Turn Deep Search
- Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?
- Detecting Hallucinations in Authentic LLM-Human Interactions
- Merlin's Whisper: Enabling Efficient Reasoning in LLMs via Black-box Adversarial Prompting
- One Token Embedding Is Enough to Deadlock Your Large Reasoning Model
- Rethinking LLM Evaluation: Can We Evaluate LLMs with 200x Less Data?
- Demystifying the Roles of LLM Layers in Retrieval, Knowledge, and Reasoning
- CTR-LoRA: Curvature-Aware and Trust-Region Guided Low-Rank Adaptation for Large Language Models
- DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
- Audit-of-Understanding: Posterior-Constrained Inference for Mathematical Reasoning in Language Models
- Debiasing LLMs by Masking Unfairness-Driving Attention Heads
- Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
- ADEPT: Continual Pretraining via Adaptive Expansion and Dynamic Decoupled Tuning
- Failure-Driven Workflow Refinement
- Skill-Targeted Adaptive Training
- StelLA: Subspace Learning in Low-rank Adaptation using Stiefel Manifold
- Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
- Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers
- Learning a Dense Reasoning Reward Model from Expert Demonstration via Inverse Reinforcement Learning
- Brick: Spatial Capability Routing for the Mixture-of-Models (MoM) Paradigm
- Syntactic Blind Spots: How Misalignment Leads to LLMs Mathematical Errors
- Decoupled DiLoCo for Resilient Distributed Pre-training
- Faster LLM Inference via Sequential Monte Carlo
- PostTrainBench: Can LLM Agents Automate LLM Post-Training?
- Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs
- Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs
- Don't Throw Away Your Pretrained Model
- SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
- Evaluating Robustness of Large Language Models Against Multilingual Typographical Errors
- StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
- ConDABench: Interactive Evaluation of Language Models for Data Analysis
- Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
- Entropy Meets Importance: A Unified Head Importance-Entropy Score for Stable and Efficient Transformer Pruning
- Users as Annotators: LLM Preference Learning from Comparison Mode
- ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability
- Alif: Advancing Urdu Large Language Models via Multilingual Synthetic Data Distillation
- TripScore: Benchmarking and rewarding real-world travel planning with fine-grained evaluation
- Constraints-of-Thought: A Framework for Constrained Reasoning in Language-Model-Guided Search
- The Idola Tribus of AI: Large Language Models tend to perceive order where none exists
- Verifying Chain-of-Thought Reasoning via Its Computational Graph
- MaP: A Unified Framework for Reliable Evaluation of Pre-training Dynamics
- On the Provable Performance Guarantee of Efficient Reasoning Models
- A Comprehensive Evaluation of Multilingual Chain-of-Thought Reasoning: Performance, Consistency, and Faithfulness Across Languages
- ProxRouter: Proximity-Weighted LLM Query Routing for Improved Robustness to Outliers
- Active Model Selection for Large Language Models
- DARO: Difficulty-Aware Reweighting Policy Optimization
- FOR-Prompting: From Objection to Revision via an Asymmetric Prompting Protocol
- RefGrader: Automated Grading of Mathematical Competition Proofs using Agentic Workflows
- CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards
- Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
- dInfer: An Efficient Inference Framework for Diffusion Language Models
- Guided Star-Shaped Masked Diffusion
- First Try Matters: Revisiting the Role of Reflection in Reasoning Models
- Lossless Vocabulary Reduction for Auto-Regressive Language Models
- AILoRA: Function-Aware Asymmetric Initialization for Low-Rank Adaptation of Large Language Models
- Fewer Weights, More Problems: A Practical Attack on LLM Pruning
- LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
- Contrastive Weak-to-strong Generalization
- Upfront Chain-of-Thought: A Cooperative Framework for Chain-of-Thought Compression
- MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
- GCPO: When Contrast Fails, Go Gold
- Rethinking Reasoning: A Survey on Reasoning-based Backdoors in LLMs
- R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
- Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
- On the optimization dynamics of RLVR: Gradient gap and step size thresholds
- Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization
- xRouter: Training Cost-Aware LLMs Orchestration System via Reinforcement Learning
- FlyLoRA: Boosting Task Decoupling and Parameter Efficiency via Implicit Rank-Wise Mixture-of-Experts
- PEAR: Phase Entropy Aware Reward for Efficient Reasoning
- TAPAS: Datasets for Learning the Learning with Errors Problem
- TRIM: Token-wise Attention-Derived Saliency for Data-Efficient Instruction Tuning
- SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training
- SliceFine: The Universal Winning-Slice Hypothesis for Pretrained Networks
- ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation
- SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
- AgentAsk: Multi-Agent Systems Need to Ask
- Benchmarking is Broken -- Don't Let AI be its Own Judge
- Measuring and Mitigating Identity Bias in Multi-Agent Debate via Anonymization
- Can Speech LLMs Think while Listening?
- MAPRO: Recasting Multi-Agent Prompt Optimization as Maximum a Posteriori Inference
- Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
- More Data or Better Data? A Critical Analysis of Data Selection and Synthesis for Mathematical Reasoning
- Encode, Think, Decode: Scaling test-time reasoning with recursive latent thoughts
- Accelerating Diffusion LLM Inference via Local Determinism Propagation
- Pragyaan: Designing and Curating High-Quality Cultural Post-Training Datasets for Indian Languages
- EDUMATH: Generating Standards-aligned Educational Math Word Problems
- SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
- SoftMatcha 2: A Fast and Soft Pattern Matcher for Trillion-Scale Corpora
- PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review
- CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
- ReSSFormer: A Recursive Sparse Structured Transformer for Scalable and Long-Context Reasoning
- Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
- Mid-Training of Large Language Models: A Survey
- Efficient numeracy in language models through single-token number embeddings
- JAI-1: A Thai-Centric Large Language Model
- Gold-Switch: Training-Free Superposition of Slow- and Fast- Thinking LLMs
- PIKA: Expert-Level Synthetic Datasets for Post-Training Alignment from Scratch
- Aligning Large Language Models via Fully Self-Synthetic Data
- KaVa: Latent Reasoning via Compressed KV-Cache Distillation
- Iterative LLM-Based Generation and Refinement of Distracting Conditions in Math Word Problems
- LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics
- Flipping the Dialogue: Training and Evaluating User Language Models
- Online Rubrics Elicitation from Pairwise Comparisons
- Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs
- λ-GRPO: Unifying the GRPO Frameworks with Learnable Token Preferences
- h1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement Learning
- POME: Post Optimization Model Edit via Muon-style Projection
- Expanding the Action Space of LLMs to Reason Beyond Language
- Grouped Differential Attention
- Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels
- Attention Sinks and Compression Valleys in LLMs are Two Sides of the Same Coin
- VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
- SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence Generation
- CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credits
- lm-Meter: Unveiling Runtime Inference Latency for On-Device Language Models
- Influence Functions for Efficient Data Selection in Reasoning
- MatheMagic: Generating Dynamic Mathematics Benchmarks Robust to Memorization
- Gradient-Sign Masking for Task Vector Transport Across Pre-Trained Models
- VeriEquivBench: An Equivalence Score for Ground-Truth-Free Evaluation of Formally Verifiable Code
- EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget
- Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies
- ARMOR: High-Performance Semi-Structured Pruning via Adaptive Matrix Factorization
- AMAQ: Adaptive Mixed-bit Activation Quantization for Collaborative Parameter Efficient Fine-tuning
- MixReasoning: Switching Modes to Think
- Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs
- MASA: Rethinking the Representational Bottleneck in LoRA with Multi-A Shared Adaptation
- Prototype-Based Dynamic Steering for Large Language Models
- Provably Mitigating Corruption, Overoptimization, and Verbosity Simultaneously in Offline and Online RLHF/DPO Alignment
- Boomerang Distillation Enables Zero-Shot Model Size Interpolation
- Staircase Streaming for Low-Latency Multi-Agent Inference
- Stratum: System-Hardware Co-Design with Tiered Monolithic 3D-Stackable DRAM for Efficient MoE Serving
- Finish First, Perfect Later: Test-Time Token-Level Cross-Validation for Diffusion Large Language Models
- Slm-mux: Orchestrating small language models for reasoning
- SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
- Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
- Reinforcement Learning for Clinical Reasoning: Aligning LLMs with ACR Imaging Appropriateness Criteria
- Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails
- Bridging Reasoning to Learning: Unmasking Illusions using Complexity Out of Distribution Generalization
- ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs
- The Reasoning Boundary Paradox: How Reinforcement Learning Constrains Language Models
- BrokenMath: A Benchmark for Sycophancy in Theorem Proving with LLMs
- Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation
- FedSRD: Sparsify-Reconstruct-Decompose for Communication-Efficient Federated Large Language Models Fine-Tuning
- DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Natural Language Edge Labelling: Decoupling Intent from Execution in Structured LM Reasoning
- KVLinC : KV Cache Quantization with Hadamard Rotation and Linear Correction
- Context Length Alone Hurts LLM Performance Despite Perfect Retrieval
- Making Mathematical Reasoning Adaptive
- LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
- Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
- GRACE: Generative Representation Learning via Contrastive Policy Optimization
- Multilingual Routing in Mixture-of-Experts
- Inoculation Prompting: Eliciting traits from LLMs during training can suppress them at test-time
- Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization
- PatternKV: Flattening KV Representation Expands Quantization Headroom
- Self Speculative Decoding for Diffusion Large Language Models
- Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
- Searching Meta Reasoning Skeleton to Guide LLM Reasoning
- Systematic Diagnosis of Brittle Reasoning in Large Language Models
- Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation
- Scaling Code-Assisted Chain-of-Thoughts and Instructions for Model Reasoning
- Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models
- SATER: A Self-Aware and Token-Efficient Approach to Routing and Cascading
- TROLL: Trust Regions improve Reinforcement Learning for Large Language Models
- Beyond Token Length: Step Pruner for Efficient and Accurate Reasoning in Large Language Models
- REG: A Regularization Optimizer for Robust Training Dynamics
- Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs
- Decoupling Task-Solving and Output Formatting in LLM Generation
- Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
- GuidedSampling: Steering LLMs Towards Diverse Candidate Solutions at Inference-Time
- Best-of-Majority: Minimax-Optimal Strategy for Pass@k Inference Scaling
- Lateral Tree-of-Thoughts Surpasses ToT by Incorporating Logically-Consistent, Low-Utility Candidates
- Leave No TRACE: Black-box Detection of Copyrighted Dataset Usage in Large Language Models via Watermarking
- Consolidating Reinforcement Learning for Multimodal Discrete Diffusion Models
- Reward Model Routing in Alignment
- Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
- NCV: A Node-Wise Consistency Verification Approach for Low-Cost Structured Error Localization in LLM Reasoning
- AutoMaAS: Self-Evolving Multi-Agent Architecture Search for Large Language Models
- TravelBench : Exploring LLM Performance in Low-Resource Domains
- Fine-Tuning on Noisy Instructions: Effects on Generalization and Performance
- Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach
- Energy-Regularized Sequential Model Editing on Hyperspheres
- Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards
- mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
- CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs
- Large Reasoning Models Learn Better Alignment from Flawed Thinking
- Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving
- Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers
- When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
- Curiosity-Driven LLM-as-a-judge for Personalized Creative Judgment
- Rethinking Reward Models for Multi-Domain Test-Time Scaling
- Characterizing Model Behavior Under Synthetic Data Training: An Empirical Study Across Scales and Mixing Ratios
- TokMem: Tokenized Procedural Memory for Large Language Models
- Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs
- Generalized Parallel Scaling with Interdependent Generations
- RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
- Learning Compact Representations of LLM Abilities via Item Response Theory
- Making, not Taking, the Best of N
- Stochastic Self-Organization in Multi-Agent Systems
- Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning
- Exploring System 1 and 2 communication for latent reasoning in LLMs
- ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models
- HiSpec: Hierarchical Speculative Decoding for LLMs
- Reasoning-Aware Prompt Orchestration: A Foundation Model for Multi-Agent Language Model Coordination
- DecepChain: Inducing Deceptive Reasoning in Large Language Models
- Towards Ecologically Valid LLM Benchmarks: Understanding and Designing Domain-Centered Evaluations for Journalism Practitioners
- Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
- Improving Metacognition and Uncertainty Communication in Language Models
- Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space
- GRPO-λ: Credit Assignment improves LLM Reasoning
- Train Large, Deploy Compact: Structured Compression for Compact Low-Rank Adaptation
- Recursive Self-Aggregation Unlocks Deep Thinking in Large Language Models
- Are Robust LLM Fingerprints Adversarially Robust?
- Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning
- Can LLMs Write Mathematics Papers? A Case Study in Reservoir Computing
- Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation
- dParallel: Learnable Parallel Decoding for dLLMs
- AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size
- Communication-Efficient and Accurate Approach for Aggregation in Federated Low-Rank Adaptation
- Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts
- One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient
- Interactive Learning for LLM Reasoning
- Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing
- Clip-Low Increases Entropy and Clip-High Decreases Entropy in Reinforcement Learning of Large Language Models
- CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
- RoRecomp: Enhancing Reasoning Efficiency via Rollout Response Recomposition in Reinforcement Learning
- Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA
- Distillation of Large Language Models via Concrete Score Matching
- OPPO: Accelerating PPO-based RLHF via Pipeline Overlap
- Atomic Thinking of LLMs: Decoupling and Exploring Mathematical Reasoning Abilities
- Expert Merging: Model Merging with Unsupervised Expert Alignment and Importance-Guided Layer Chunking
- Collaborative Compression for Large-Scale MoE Deployment on Edge
- IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation
- Hierarchical Reasoning Models: Perspectives and Misconceptions
- Thinking Sparks!: Emergent Attention Heads in Reasoning Models During Post Training
- RFG: Test-Time Scaling for Diffusion Large Language Model Reasoning with Reward-Free Guidance
- Aligning Multilingual Reasoning with Verifiable Semantics from a High-Resource Expert Model
- MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources
- Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
- Rethinking Parameter Sharing for LLM Fine-Tuning with Multiple LoRAs
- Predicting Training Re-evaluation Curves Enables Effective Data Curriculums for LLMs
- From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
- Structural Reward Model: Enhancing Interpretability, Efficiency, and Scalability in Reward Modeling
- UniAPL: A Unified Adversarial Preference Learning Framework for Instruct-Following
- Rethinking Entropy Regularization in Large Reasoning Models
- Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
- CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning
- Generalized Correctness Models: Learning Calibrated and Model-Agnostic Correctness Predictors from Historical Patterns
- Intra-request branch orchestration for efficient LLM reasoning
- MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes
- SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Models
- LatentEvolve: Self-Evolving Test-Time Scaling in Latent Space
- On the Self-awareness of Large Reasoning Models' Capability Boundaries
- MemGen: Weaving Generative Latent Memory for Self-Evolving Agents
- Reference-Free Rating of LLM Responses via Latent Information
- CDT: A Comprehensive Capability Framework for Large Language Models Across Cognition, Domain, and Task
- From Static to Dynamic: Adaptive Monte Carlo Search for Mathematical Process Supervision
- Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding
- DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
- LOGOS: LLM-driven End-to-End Grounded Theory Development and Schema Induction for Qualitative Research
- Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models
- SpecExit: Accelerating Large Reasoning Model via Speculative Exit
- Prompt and Parameter Co-Optimization for Large Language Models
- ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
- Learning to Ponder: Adaptive Reasoning in Latent Space
- Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends
- Model Correlation Detection via Random Selection Probing
- Watermarking Diffusion Language Models
- Deep Thinking by Markov Chain of Continuous Thoughts
- Why Tree-Style Branching Matters for Thought Advantage Estimation in GRPO
- AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play
- ContextPRM: Leveraging Contextual Coherence for multi-domain Test-Time Scaling
- Socratic-Zero : Bootstrapping Reasoning via Data-Free Agent Co-evolution
- From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing
- Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding
- ReasonCACHE: Teaching LLMs To Reason Without Weight Updates
- Beyond Magic Words: Sharpness-Aware Prompt Evolving for Robust Large Language Models with TARE
- Sequential Diffusion Language Models
- Toward Preference-aligned Large Language Models via Residual-based Model Steering
- Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
- Beyond Benchmarks: Understanding Mixture-of-Experts Models through Internal Mechanisms
- Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
- Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
- Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning
- Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions
- DiffuSpec: Unlocking Diffusion Language Models for Speculative Decoding
- Evaluating Program Semantics Reasoning with Type Inference in System F
- Aligning LLMs for Multilingual Consistency in Enterprise Applications
- Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs
- Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models
- Reasoning Scaffolding: Distilling the Flow of Thought from LLMs
- Towards Efficient CoT Distillation: Self-Guided Rationale Selector for Better Performance with Fewer Rationales
- On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization
- Large-Scale Constraint Generation -- Can LLMs Parse Hundreds of Constraints?
- Pretraining Scaling Laws for Generative Evaluations of Language Models
- DOoM: Difficult Olympiads of Math
- Learning to Reason in Structured In-context Environments with Reinforcement Learning
- A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models
- Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning
- MathBode: Measuring the Stability of LLM Reasoning using Frequency Response
- Tracing Uncertainty in Language Model "Reasoning"
- NanoFlux: Adversarial Dual-LLM Evaluation and Distillation For Multi-Domain Reasoning
- p-less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding
- Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
- From Harm to Help: Turning Reasoning In-Context Demos into Assets for Reasoning LMs
- PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space
- C2GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning
- Effective Quantization of Muon Optimizer States
- WirelessMathLM: Teaching Mathematical Reasoning for LLMs in Wireless Communications with Reinforcement Learning
- Protocode: Prototype-Driven Interpretability for Code Generation in LLMs
- Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
- d2Cache: Accelerating Diffusion-Based LLMs via Dual Adaptive Caching
- JE-IRT: A Geometric Lens on LLM Abilities through Joint Embedding Item Response Theory
- IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning
- Dynamic Experts Search: Enhancing Reasoning in Mixture-of-Experts LLMs at Test Time
- The Emergence of Altruism in Large-Language-Model Agents Society
- REMA: A Unified Reasoning Manifold Framework for Interpreting Large Language Model
- Representing LLMs in Prompt Semantic Task Space
- InfiAgent: Self-Evolving Pyramid Agent Framework for Infinite Scenarios
- Multidimensional Uncertainty Quantification via Optimal Transport
- Stochastic activations
- Erase or Hide? Suppressing Spurious Unlearning Neurons for Robust Unlearning
- When Does Reasoning Matter? A Controlled Study of Reasoning's Contribution to Model Performance
- Lightweight error mitigation strategies for post-training N:M activation sparsity in LLMs
- From Long to Lean: Performance-aware and Adaptive Chain-of-Thought Compression via Multi-round Refinement
- Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
- R-Capsule: Compressing High-Level Plans for Efficient Large Language Model Reasoning
- Think Right, Not More: Test-Time Scaling for Numerical Claim Verification
- Fine-tuning Done Right in Model Editing
- A2R: An Asymmetric Two-Stage Reasoning Framework for Parallel Reasoning
- GSM-Agent: Understanding Agentic Reasoning Using Controllable Environments
- Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
- QoNext: Towards Next-generation QoE for Foundation Models
- SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models
- RobustFlow: Towards Robust Agentic Workflow Generation
- FastGRPO: Accelerating Policy Optimization via Concurrency-aware Speculative Decoding and Online Draft Learning
- Quantifying the Impact of Structured Output Format on Large Language Models through Causal Inference
- KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI
- Rethinking Large Language Model Distillation: A Constrained Markov Decision Process Perspective
- Front-Loading Reasoning: The Synergy between Pretraining and Post-Training Data
- Learning More with Less: A Dynamic Dual-Level Down-Sampling Framework for Efficient Policy Optimization
- Induction Signatures Are Not Enough: A Matched-Compute Study of Load-Bearing Structure in In-Context Learning
- RLP: Reinforcement as a Pretraining Objective
- Blockwise Hadamard high-Rank Adaptation for Parameter-Efficient LLM Fine-Tuning
- Hallucination reduction with CASAL: Contrastive Activation Steering For Amortized Learning
- Plan2Evolve: LLM Self-Evolution for Improved Planning Capability via Automated Domain Generation
- On Code-Induced Reasoning in LLMs
- Learning to Reason with Mixture of Tokens
- Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning
- Best-of-∞ -- Asymptotic Performance of Test-Time Compute
- Predicting LLM Reasoning Performance with Small Proxy Model
- StyleBench: Evaluating thinking styles in Large Language Models
- SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs
- Stability of In-Context Learning: A Spectral Coverage Perspective
- TyphoonMLA: A Mixed Naive-Absorb MLA Kernel For Shared Prefix
- SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials
- It's Not You, It's Clipping: A Soft Trust-Region via Probability Smoothing for LLM RL
- Mixture of Thoughts: Learning to Aggregate What Experts Think, Not Just What They Say
- d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation
- MARS: toward more efficient multi-agent collaboration for LLM reasoning
- DRES: Benchmarking LLMs for Disfluency Removal
- Thinking Augmented Pre-training
- PEPS: Quantum-Inspired Reinforcement Learning for Coherent Reasoning Traces in LLMs
- Integrated Framework for LLM Evaluation with Answer Generation
- FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
- Future Policy Aware Preference Learning for Mathematical Reasoning
- SpecMamba: Accelerating Mamba Inference on FPGA with Speculative Decoding
- Enhancing Linear Attention with Residual Learning
- SIM-CoT: Supervised Implicit Chain-of-Thought
- Do Before You Judge: Self-Reference as a Pathway to Better LLM Evaluation
- SKYLENAGE Technical Report: Mathematical Reasoning and Contest-Innovation Benchmarks for Multi-Level Math Evaluation
- CIFLEX: Contextual Instruction Flow for Sub-task Execution in Multi-Turn Interactions with a Single On-Device LLM
- Are We Scaling the Right Thing? A System Perspective on Test-Time Scaling
- Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMs
- Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems
- LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models
- TAPO: Transition-Aware Policy Optimization for LLM Agents
- Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models
- Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game
- Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training
- Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning
- Cybersecurity Detection Classification with Reasoning-enabled Language Models
- SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute
- A Policy-Driven Runtime Layer for Agentic LLM Serving
- SDO: Structure-Aware Data Organization for Efficient LLM Post-Training
- Multi-Head Attention Residuals
- Averaged Evaluation Masks Capability Trade-Offs: Multi-Source Calibration for High-Sparsity LLM Pruning
- AXIOM: A Trust-First Neuro-Symbolic Execution Architecture for Verifiable Mathematical Reasoning
- CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning
- Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting
- EMO: Pretraining Mixture of Experts for Emergent Modularity
- Defusing the Trigger: Tail-Risk-Informed Attention Rebalancing for LLM Backdoor Mitigation
- How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data
- Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs
- DFlash: Block Diffusion for Flash Speculative Decoding
- AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games
- Where-to-Unmask: Ground-Truth-Guided Unmasking Order Learning for Masked Diffusion Language Models
- SHINE: A Scalable In-Context Hypernetwork for Mapping Context to LoRA in a Single Pass
- Riemannian Optimization for LoRA on the Stiefel Manifold
- Proximal Supervised Fine-Tuning
- DRQA: Dynamic Reasoning Quota Allocation for Controlling Overthinking in Reasoning Large Language Models
- Randomly Removing 50% of Dimensions in Text Embeddings has Minimal Impact on Retrieval and Classification Tasks
- AgentInit: Initializing LLM-based Multi-Agent Systems via Diversity and Expertise Orchestration for Effective and Efficient Collaboration
- Soft Tokens, Hard Truths
- AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field
- When Long Helps Short: How Context Length in Supervised Fine-tuning Affects Behavior of Large Language Models
- Prior-based Noisy Text Data Filtering: Fast and Strong Alternative For Perplexity
- HyperAdapt: Simple High-Rank Adaptation
- Solving Math Word Problems Using Estimation Verification and Equation Generation
- Analyzing Uncertainty of LLM-as-a-Judge: Interval Evaluations with Conformal Prediction
- NGRPO: Negative-enhanced Group Relative Policy Optimization
- Benchmark Profiling: Mechanistic Diagnosis of LLM Benchmarks
- CCQA: Generating Question from Solution Can Improve Inference-Time Reasoning in SLMs
- A Good Plan is Hard to Find: Aligning Models with Preferences is Misaligned with What Helps Users
- Symphony-MoE: Harmonizing Disparate Pre-trained Models into a Coherent Mixture-of-Experts
- Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
- Reasoning Core: A Scalable RL Environment for LLM Symbolic Reasoning
- ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs
- EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
- Correlation or Causation: Analyzing the Causal Structures of LLM and LRM Reasoning Process
- Weights-Rotated Preference Optimization for Large Language Models
- CogAtom: From Cognitive Atoms to Olympiad-level Mathematical Reasoning in Large Language Models
- Understanding Benchmark Language Under Weakened Formal Semantics
- Variation in Verification: Understanding Verification Dynamics in Large Language Models
- SilentStriker:Toward Stealthy Bit-Flip Attacks on Large Language Models
- DIWALI: Diversity and Inclusivity aWare cuLture specific Items for India: Dataset and Assessment of LLMs for Cultural Text Adaptation in Indian Context
- QWHA: Quantization-Aware Walsh-Hadamard Adaptation for Parameter-Efficient Fine-Tuning on Large Language Models
- Asking a Language Model for Diverse Responses
- Understanding Post-Training Structural Changes in Large Language Models
- Structuring The Future: Diffusion LLM Speculative Decoding via Calibrated Draft Graphs
- Probabilistic Token Alignment for Large Language Model Fusion
- nDNA -- the Semantic Helix of Artificial Cognition
- Adaptive Overclocking: Dynamic Control of Thinking Path Length via Real-Time Reasoning Signals
- seqBench: A Tunable Benchmark to Quantify Sequential Reasoning Limits of LLMs
- Large Language Models as End-to-end Combinatorial Optimization Solvers
- Dynamic Expert Specialization: Towards Catastrophic Forgetting-Free Multi-Domain MoE Adaptation
- MoEs Are Stronger than You Think: Hyper-Parallel Inference Scaling with RoE
- Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories
- PruneCD: Contrasting Pruned Self Model to Improve Decoding Factuality
- Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels
- SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning
- Can an Individual Manipulate the Collective Decisions of Multi-Agents?
- Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs
- Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle
- Pico: A Modular Framework for Hypothesis-Driven Small Language Model Research
- Best-of-L: Cross-Lingual Reward Modeling for Mathematical Reasoning
- UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression
- Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding
- GPO: Learning from Critical Steps to Improve LLM Reasoning
- Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
- Think, Verbalize, then Speak: Bridging Complex Thoughts and Comprehensible Speech
- DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
- LNE-Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models
- Beyond Surface Alignment: Rebuilding LLMs Safety Mechanism via Probabilistically Ablating Refusal Direction
- School of Reward Hacks: Hacking harmless tasks generalizes to misaligned behavior in LLMs
- FURINA: Free from Unmergeable Router via LINear Aggregation of mixed experts
- MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models
- Reveal and Release: Iterative LLM Unlearning with Self-generated Data
- (P)rior(D)yna(F)low: A Priori Dynamic Workflow Construction via Multi-Agent Collaboration
- TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
- Self-Improvement of Language Models by Post-Training on Multi-Agent Debate
- Fast and Fluent Diffusion Language Models via Convolutional Decoding and Rejective Fine-tuning
- Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents
- Masked Diffusion Models as Energy Minimization
- ZERA: Zero-init Instruction Evolving Refinement Agent -- From Zero Instructions to Structured Prompts via Principle-based Optimization
- Latent Traits and Cross-Task Transfer: Deconstructing Dataset Interactions in LLM Fine-tuning
- DSFT: Inspiring Diffusion Large Language Models to Comprehend Mathematical and Logical Patterns
- A Study on Thinking Patterns of Large Reasoning Models in Code Generation
- Aegis: Automated Error Generation and Attribution for Multi-Agent Systems
- Early Stopping Chain-of-thoughts in Large Language Models
- Teaching According to Talents! Instruction Tuning LLMs with Competence-Aware Curriculum Learning
- Slim-SC: Thought Pruning for Efficient Scaling with Self-Consistency
- Explain Before You Answer: A Survey on Compositional Visual Reasoning
- Meta-R1: Empowering Large Reasoning Models with Metacognition
- REAMS: Reasoning Enhanced Algorithm for Maths Solving
- FVDebug: An LLM-Driven Debugging Assistant for Automated Root Cause Analysis of Formal Verification Failures
- From Language to Action: A Review of Large Language Models as Autonomous Agents and Tool Users
- The Anatomy of Alignment: Decomposing Preference Optimization by Steering Sparse Features
- All Roads Lead to Rome: Graph-Based Confidence Estimation for Large Language Model Reasoning
- LTA-thinker: Latent Thought-Augmented Training Framework for Large Language Models on Complex Reasoning
- EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer
- Root Cause Analysis of Radiation Oncology Incidents Using Large Language Models
- MaRVL-QA: A Benchmark for Mathematical Reasoning over Visual Landscapes
- AMQ: Enabling AutoML for Mixed-precision Weight-Only Quantization of Large Language Models
- POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization
- D2HScore: Reasoning-Aware Hallucination Detection via Semantic Breadth and Depth Analysis in LLMs
- HARP: Hallucination Detection via Reasoning Subspace Projection
- Preservation of Language Understanding Capabilities in Speech-aware Large Language Models
- What Matters in Data for DPO?
- MALLM: Multi-Agent Large Language Models Framework
- ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
- Fluid Language Model Benchmarking
- MAPGD: Multi-Agent Prompt Gradient Descent for Collaborative Prompt Optimization
- Harnessing Optimization Dynamics for Curvature-Informed Model Merging
- Difficulty-Aware Agentic Orchestration for Query-Specific Multi-Agent Workflows
- PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits
- AQUA: Attention via QUery mAgnitudes for Memory and Compute Efficient Inference in LLMs
- From Parameters to Performance: A Data-Driven Study on LLM Structure and Development
- Limitations of refinement methods for weak to strong generalization
- No Answer Needed: Predicting LLM Answer Accuracy from Question-Only Linear Probes
- LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
- Unsupervised Hallucination Detection by Inspecting Reasoning Processes
- CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
- Bridging the Capability Gap: Joint Alignment Tuning for Harmonizing LLM-based Multi-Agent Systems
- Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference
- TORSO: Template-Oriented Reasoning Towards General Tasks
- Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs
- Tree-OPO: Off-policy Monte Carlo Tree-Guided Advantage Optimization for Multistep Reasoning
- LLM-JEPA: Large Language Models Meet Joint Embedding Predictive Architectures
- ForTIFAI: Fending Off Recursive Training Induced Failure for AI Model Collapse
- FRIT: Using Causal Importance to Improve Chain-of-Thought Faithfulness
- Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models
- EvolKV: Evolutionary KV Cache Compression for LLM Inference
- Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization
- Mitigating Catastrophic Forgetting in Large Language Models with Forgetting-aware Pruning
- Language Self-Play For Data-Free Training
- PersonaFuse: A Personality Activation-Driven Framework for Enhancing Human-LLM Interactions
- RIMO: An Easy-to-Evaluate, Hard-to-Solve Olympiad Benchmark for Advanced Mathematical Reasoning
- Unleashing the True Potential of LLMs: A Feedback-Triggered Self-Correction with Long-Term Multipath Decoding
- Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
- Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding
- COMPACT: Common-token Optimized Model Pruning Across Channels and Tokens
- MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security
- LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection
- Ban&Pick: Ehancing Performance and Efficiency of MoE-LLMs via Smarter Routing
- Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
- Error Reflection Prompting: Can Large Language Models Successfully Understand Errors?
- IPR: Intelligent Prompt Routing with User-Controlled Quality-Cost Trade-offs
- Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL
- From Long to Short: LLMs Excel at Trimming Own Reasoning Chains
- Hyperbolic Large Language Models
- Orchestrator: Active Inference for Multi-Agent Systems in Long-Horizon Tasks
- AntiDote: Bi-level Adversarial Training for Tamper-Resistant LLMs
- Self-Aligned Reward: Towards Effective and Efficient Reasoners
- PLaMo 2 Technical Report
- Post-training Large Language Models for Diverse High-Quality Responses
- Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts
- Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
- Rethinking Reasoning in LLMs: Neuro-Symbolic Local RetoMaton Beyond ICL and CoT
- DreamPRM-1.5: Unlocking the Potential of Each Instance for Multimodal Process Reward Model Training
- Talk Isn't Always Cheap: Understanding Failure Modes in Multi-Agent Debate
- Hunyuan-MT Technical Report
- FLAMES: Improving LLM Math Reasoning via a Fine-Grained Analysis of the Data Synthesis Pipeline
- Delta Activations: A Representation for Finetuned Large Language Models
- Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?
- Set Block Decoding is a Language Model Inference Accelerator
- CoT-Space: A Theoretical Framework for Internal Slow-Thinking via Reinforcement Learning
- On Robustness and Reliability of Benchmark-Based Evaluation of LLMs
- A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
- Learning to Deliberate: Meta-policy Collaboration for Agentic LLMs with Multi-agent Reinforcement Learning
- A Probabilistic Inference Scaling Theory for LLM Self-Correction
- Systematic Characterization of LLM Quantization: A Performance, Energy, and Quality Perspective
- SharedRep-RLHF: A Shared Representation Approach to RLHF with Diverse Preferences
- Cetvel: A Unified Benchmark for Evaluating Language Understanding, Generation and Cultural Capacity of LLMs for Turkish
- Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents
- Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training
- AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
- TeRA: Vector-based Random Tensor Network for High-Rank Adaptation of Large Language Models
- Adaptive Preference Optimization with Uncertainty-aware Utility Anchor
- Adaptive KV-Cache Compression without Manually Setting Budget
- PromptCOS: Towards Content-only System Prompt Copyright Auditing for LLMs
- Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning
- Efficient Training-Free Online Routing for High-Volume Multi-LLM Serving
- Surrogate Benchmarks for Model Merging Optimization
- Implicit Reasoning in Large Language Models: A Comprehensive Survey
- Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
- Batch Query Processing and Optimization for Agentic Workflows
- Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation
- GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation
- Improving Large Vision and Language Models by Learning from a Panel of Peers
- Inducing Faithfulness in Structured Reasoning via Counterfactual Sensitivity
- LLMs cannot spot math errors, even when allowed to peek into the solution
- Reasoning Vectors: Transferring Chain-of-Thought Capabilities via Task Arithmetic
- KoBLEX: Open Legal Question Answering with Multi-hop Reasoning
- GradeSQL: Test-Time Inference with Outcome Reward Models for Text-to-SQL Generation from Large Language Models
- Rethinking the Chain-of-Thought: The Roles of In-Context Learning and Pre-trained Priors
- VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
- Dream-Coder 7B: An Open Diffusion Language Model for Code
- Enhancing Uncertainty Estimation in LLMs with Expectation of Aggregated Internal Belief
- Distilled Pretraining: A modern lens of Data, In-Context Learning and Test-Time Scaling
- DSDE: Dynamic Speculative Decoding with KLD Stability for Real-World Serving
- LongCat-Flash Technical Report
- Aligning Reasoning LLMs for Materials Discovery with Physics-aware Rejection Sampling
- Any-Order Flexible Length Masked Diffusion
- LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model
- When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment
- Universal Properties of Activation Sparsity in Modern Large Language Models
- Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
- Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online
- Democratizing Agentic AI with Fast Test-Time Scaling on the Edge
- Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics
- PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains
- Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
- HyperFlexis: Joint Design of Algorithms and Systems for Multi-SLO Serving and Fast Scaling
- Evaluating Differentially Private Generation of Domain-Specific Text
- UI-Bench: A Benchmark for Evaluating Design Capabilities of AI Text-to-App Tools
- Measuring Reasoning Utility in LLMs via Conditional Entropy Reduction
- NPG-Muse: Scaling Long Chain-of-Thought Reasoning with NP-Hard Graph Problems
- Language Models and Logic Programs for Trustworthy Tax Reasoning
- Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
- SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models
- SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control
- Diffusion Language Models Know the Answer Before Decoding
- PSO-Merging: Merging Models Based on Particle Swarm Optimization
- Benchmarking Hindi LLMs: A New Suite of Datasets and a Comparative Analysis
- Principled Personas: Defining and Measuring the Intended Effects of Persona Prompting on Task Performance
- Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs
- CompLex: Music Theory Lexicon Constructed by Autonomous Agents for Automatic Music Generation
- Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding
- Entropy-Guided Loop: Achieving Reasoning through Uncertainty-Aware Generation
- StepWiser: Stepwise Generative Judges for Wiser Reasoning
- Predicting the Order of Upcoming Tokens Improves Language Modeling
- Federated Fine-Tuning of Sparsely-Activated Large Language Models on Resource-Constrained Devices
- Test-time Corpus Feedback: From Retrieval to RAG
- Reflection-Enhanced Meta-Optimization Integrating TextGrad-style Prompt Optimization with Memory-Driven Self-Evolution
- Arrows of Math Reasoning Data Synthesis for Large Language Models: Diversity, Complexity and Correctness
- Dynamic Collaboration of Multi-Language Models based on Minimal Complete Semantic Units
- Answering the Unanswerable Is to Err Knowingly: Analyzing and Mitigating Abstention Failures in Large Reasoning Models
- UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning
- Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks
- Beyond Benchmark: LLMs Evaluation with an Anthropomorphic and Value-oriented Roadmap
- RLMR: Reinforcement Learning with Mixed Rewards for Creative Writing
- Scaling Laws for Task-Stratified Knowledge in Post-Training Quantized Large Language Models
- ConfTuner: Training Large Language Models to Express Their Confidence Verbally
- Principled Detection of Hallucinations in Large Language Models via Multiple Testing
- Latent Self-Consistency for Reliable Majority-Set Selection in Short- and Long-Answer Reasoning
- DualSparse-MoE: Coordinating Tensor/Neuron-Level Sparsity with Expert Partition and Reconstruction
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- WISCA: A Lightweight Model Transition Method to Improve LLM Training via Weight Scaling
- Teaching LLMs to Think Mathematically: A Critical Study of Decision-Making via Optimization
- VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models
- CARFT: Boosting LLM Reasoning via Contrastive Learning with Annotated Chain-of-Thought-based Reinforced Fine-Tuning
- Dream 7B: Diffusion Large Language Models
- Transduction is All You Need for Structured Data Workflows
- Trust but Verify! A Survey on Verification Design for Test-time Scaling
- Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset
- Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs
- Long Chain-of-Thought Reasoning Across Languages
- MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
- Understanding Data Influence with Differential Approximation
- NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model
- Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
- Prompt Orchestration Markup Language
- Generics and Default Reasoning in Large Language Models
- Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation
- Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR
- DPad: Efficient Diffusion Language Models with Suffix Dropout
- PC-Sampler: Position-Aware Calibration of Decoding Bias in Masked Diffusion Models
- CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features
- FedSODA: Federated Fine-tuning of LLMs via Similarity Group Pruning and Orchestrated Distillation Alignment
- Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation
- Mini-Omni-Reasoner: Token-Level Thinking-in-Speaking in Large Speech Models
- Signal and Noise: A Framework for Reducing Uncertainty in Language Model Evaluation
- EvolMathEval: Towards Evolvable Benchmarks for Mathematical Reasoning via Evolutionary Testing
- Can Large Models Teach Student Models to Solve Mathematical Problems Like Human Beings? A Reasoning Distillation Method via Multi-LoRA Interaction
- A Stitch in Time Saves Nine: Proactive Self-Refinement for Language Models
- Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models
- Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position
- ReaLM: Reflection-Enhanced Autonomous Reasoning with Small Language Models
- Too Easily Fooled? Prompt Injection Breaks LLMs on Frustratingly Simple Multiple-Choice Questions
- DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections
- Mitigating Jailbreaks with Intent-Aware LLMs
- Chart-CoCa: Self-Improving Chart Understanding of Vision LMs via Code-Driven Synthesis and Candidate-Conditioned Answering
- QuarkMed Medical Foundation Model Technical Report
- Mind the Generation Process: Fine-Grained Confidence Estimation During LLM Generation
- Data Mixing Optimization for Supervised Fine-Tuning of Large Language Models
- On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
- Aware First, Think Less: Dynamic Boundary Self-Awareness Drives Extreme Reasoning Efficiency in Large Language Models
- LLM Compression: How Far Can We Go in Balancing Size and Performance?
- Inclusion Arena: An Open Platform for Evaluating Large Foundation Models with Real-World Apps
- Dynamic Quality-Latency Aware Routing for LLM Inference in Wireless Edge-Device Networks
- Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information
- Hard Examples Are All You Need: Maximizing GRPO Post-Training Under Annotation Budgets
- Thinking Inside the Mask: In-Place Prompting in Diffusion LLMs
- MSRS: Adaptive Multi-Subspace Representation Steering for Attribute Alignment in Large Language Models
- Improving Value-based Process Verifier via Low-Cost Variance Reduction
- XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization
- Bridging the Culture Gap: A Framework for LLM-Driven Socio-Cultural Localization of Math Word Problems in Low-Resource Languages
- Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization
- mSCoRe: a Multilingual and Scalable Benchmark for Skill-based Commonsense Reasoning
- Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
- Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
- Beyond Scaling Law: A Data-Efficient Distillation Framework for Reasoning
- MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
- EffiEval: Efficient and Generalizable Model Evaluation via Capability Coverage Maximization
- Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
- READER: Retrieval-Assisted Drafter for Efficient LLM Inference
- Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
- A Survey of Optimization Modeling Meets LLMs: Progress and Future Directions
- GreenTEA: Gradient Descent with Topic-modeling and Evolutionary Auto-prompting
- Aryabhata: An exam-focused language model for JEE Math
- An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems
- Retrospective Sparse Attention for Efficient Long-Context Generation
- Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language Models
- OverFill: Two-Stage Models for Efficient Language Model Decoding
- BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks
- AdaptFlow: Adaptive Workflow Optimization via Meta-Learning
- WeChat-YATT: A Scalable, Simple, Efficient, and Production Ready Training Library
- Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression
- EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning
- Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
- Gradient Surgery for Safe LLM Fine-Tuning
- MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams
- Sample-efficient LLM Optimization with Reset Replay
- LLM Unlearning Without an Expert Curated Dataset
- SABER: Switchable and Balanced Training for Efficient LLM Reasoning
- UR2: Unify RAG and Reasoning through Reinforcement Learning
- Fine-Grained Safety Neurons with Training-Free Continual Projection to Reduce LLM Fine Tuning Risks
- MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models
- Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing
- In-Training Defenses against Emergent Misalignment in Language Models
- DP-LLM: Runtime Model Adaptation with Dynamic Layer-wise Precision Assignment
- Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
- Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle
- MathSmith: Towards Extremely Hard Mathematical Reasoning by Forging Synthetic Problems with a Reinforced Policy
- Bench-2-CoP: Can We Trust Benchmarking for EU AI Compliance?
- LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
- A Novel Architecture for Symbolic Reasoning with Decision Trees and LLM Agents
- MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs
- Align, Don't Divide: Revisiting the LoRA Architecture in Multi-Task Learning
- SPaRFT: Self-Paced Reinforcement Fine-Tuning for Large Language Models
- Decoupling Understanding from Reasoning via Problem Space Mapping for Small-Scale Model Reasoning
- IFDECORATOR: Wrapping Instruction Following Reinforcement Learning with Verifiable Rewards
- CARD: A Cache-Assisted Parallel Speculative Decoding Framework via Query-and-Correct Paradigm for Accelerating LLM Inference
- From "Aha Moments" to Controllable Thinking: Toward Meta-Cognitive Reasoning in Large Reasoning Models via Decoupled Reasoning and Control
- GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
- KG-Augmented Executable CoT for Mathematical Coding
- COPO: Consistency-Aware Policy Optimization
- Enhancing Serendipity Recommendation System by Constructing Dynamic User Knowledge Graphs with Large Language Models
- Tensorized Clustered LoRA Merging for Multi-Task Interference
- Putnam-AXIOM: A Functional and Static Benchmark for Measuring Higher Level Mathematical Reasoning in LLMs
- CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward
- LLMs are Single-threaded Reasoners: Demystifying the Working Mechanism of Soft Thinking
- Hide and Seek with LLMs: An Adversarial Game for Sneaky Error Generation and Self-Improving Diagnosis
- Compressing Chain-of-Thought in LLMs via Step Entropy
- RCP-Merging: Merging Long Chain-of-Thought Models with Domain-Specific Models by Considering Reasoning Capability as Prior
- RegMean++: Enhancing Effectiveness and Generalization of Regression Mean for Model Merging
- VFLAIR-LLM: A Comprehensive Framework and Benchmark for Split Learning of LLMs
- When AI Evaluates Its Own Work: Validating Learner-Initiated, AI-Generated Physics Practice Problems
- Thinking with Nothinking Calibration: A New In-Context Learning Paradigm in Reasoning Large Language Models
- Polymath: A Self-Optimizing Agent with Dynamic Hierarchical Workflow
- PLoRA: Efficient LoRA Hyperparameter Tuning for Large Models
- CAMA: Enhancing Mathematical Reasoning in Large Language Models with Causal Knowledge
- Everyone Contributes! Incentivizing Strategic Cooperation in Multi-LLM Systems via Sequential Public Goods Games
- Test-time Prompt Intervention
- Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction
- Parameter-Efficient Routed Fine-Tuning: Mixture-of-Experts Demands Mixture of Adaptation Modules
- Reconsidering Overthinking: Penalizing Internal and External Redundancy in CoT Reasoning
- MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
- SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference
- EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
- ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models
- Large-Scale Diverse Synthesis for Mid-Training
- AffectGPT-R1: Leveraging Reinforcement Learning for Open-Vocabulary Multimodal Emotion Recognition
- LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
- Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
- R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge
- Latent Knowledge Scalpel: Precise and Massive Knowledge Editing for Large Language Models
- WMAS: A Multi-Agent System Towards Intelligent and Customized Wireless Networks
- Multi-Layer Attention is the Amplifier of Demonstration Effectiveness
- Llama-3.1-FoundationAI-SecurityLLM-8B-Instruct Technical Report
- Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models
- RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
- EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes
- GanitBench: A bi-lingual benchmark for evaluating mathematical reasoning in Vision Language Models
- PhysicsEval: Inference-Time Techniques to Improve the Reasoning Proficiency of Large Language Models on Physics Problems
- Cascaded Information Disclosure for Generalized Evaluation of Problem Solving Capabilities
- Self-Foveate: Enhancing Diversity and Difficulty of Synthesized Instructions from Unsupervised Text via Multi-Level Foveation
- Unveiling Super Experts in Mixture-of-Experts Large Language Models
- BAR Conjecture: the Feasibility of Inference Budget-Constrained LLM Services with Authenticity and Reasoning
- Beyond Passive Critical Thinking: Fostering Proactive Questioning to Enhance Human-AI Collaboration
- Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems
- Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning
Related