Efficient Memory Management for Large Language Model Serving with PagedAttention
2023/09/12 by Woosuk Kwon, Zhuohan Li, Kwon, Woosuk +15 · 4 voices · 2,501 citations
Computer Science · #CPU cache #Cache #Cache algorithms #Cache coloring #Cache pollution #Caching and Content Delivery #Computer network #Computer science #Demand paging #Latency (audio) #Memory management #Operating system #Overlay #Page cache #Paging #Parallel computing #Software System Performance and Reliability #Topic Modeling #Virtual memory #cs.DC #cs.LG
paper · pdf · doi:10.48550/arxiv.2309.06180
published in arXiv (Cornell University) (Cornell University)
openalex publication_date 2023/09/12 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
High throughput serving of large language models (LLMs) requires batching sufficiently many requests at a time. However, existing systems struggle because the key-value cache (KV cache) memory for each request is huge and grows and shrinks dynamically. When managed inefficiently, this memory can be significantly wasted by fragmentation and redundant duplication, limiting the batch size. To address this problem, we propose PagedAttention, an attention algorithm inspired by the classical virtual memory and paging techniques in operating systems. On top of it, we build vLLM, an LLM serving system that achieves (1) near-zero waste in KV cache memory and (2) flexible sharing of KV cache within and across requests to further reduce memory usage. Our evaluations show that vLLM improves the throughput of popular LLMs by 2-4× with the same level of latency compared to the state-of-the-art systems, such as FasterTransformer and Orca. The improvement is more pronounced with longer sequences, larger models, and more complex decoding algorithms. vLLM's source code is publicly available at https://github.com/vllm-project/vllm
Cited by
- TENT: A Declarative Slice Spraying Engine for Performant and Resilient Data Movement in Disaggregated LLM Serving
- Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?
- LMEB: Long-horizon Memory Embedding Benchmark
- Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning
- Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning
- Mapping Political-Elite Networks in Europe with a Multilingual Joint Entity-Relation Extraction Pipeline
- SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation
- Fewer Paths, Better Performance: Understanding the ZCube Topology through Braess's Paradox
- Agentic CPU-GPU Scheduling for Heterogeneous AI Workloads
- Adversarial Prompts for Acceptance Collapse in Speculative Decoding
- Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging
- Learning to Reason for Factuality
- HiKV: Hierarchical Importance-Aware KV Cache With Hardware Acceleration for LLM Decoding
- Persistent Computational State: A Session-Centric Runtime for Generative World Models
- A Unified Moral-Value Dataset for Instruction Tuning
- FlashDiff: Efficient Regional Execution and Scheduling for Diffusion Model Serving
- Efficient Clustering with Provable Guardrails for LLM Inference at Scale
- PReM: Learning What to Preserve and When to Refresh for Context Compression
- HijackKV: New Threat in Position-Independent KV Cache Reuse
- GPU-to-Grid: Voltage Regulation via GPU Utilization Control
- An LLM-powered Agentic Recommendation System for Connected TV Content Discovery
- Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference
- Refusal-Gated Decoding: Preserving Refusal Behavior Under High-Temperature Sampling
- OntoBook: Ontology-Grounded Synthetic Textbooks for Medical Encoder Pretraining
- Contrastive On-Policy Distillation
- Structured Feedback Improves Repair in an LLM Agent Loop
- Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
- PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference
- Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning
- The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation
- DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations
- How Fast Can Reward Models Score? A Systems Study of C++ and PyTorch Inference Runtimes for RLHF
- Leaky Language Models: Stealing Architecture and Inference Optimizations via Per-Token Timing
- BLUE: Semantics-Preserving Video Compression for Efficient Vision-Language Surveillance Analytics
- Timeripple: Accelerating vDiTs by Understanding the Spatio-Temporal Correlations in Latent Space
- AnythingReality: Robust Online Gaussian Splatting SLAM for Open-Vocabulary VR Scene Exploration
- FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
- Robust Reasoning Benchmark
- Fluid Reasoning Representations
- Efficient Multi-round LLM Inference over Disaggregated Serving
- Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer
- Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning
- AgentJet: A Distributed Swarm Training Framework for Agentic Reinforcement Learning
- AI Tour Meeting: Group Travel Planning by LLM Agents
- Keeping the Cache Warm Pays: Keepalive Economics for Agentic Workloads
- DAIS: Dependency-Aware Intermediate QA Supervision for Complex Reasoning
- Large Language Models Explore by Latent Distilling
- InstantInfer: Enabling Fast LLM Cold Start with Communicating Finite Automata
- HACO: Hedged Agent Computing for Reliable LLM Systems
- ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples
- Reasoning Before Translation: Enhancing Legal Machine Translation with Structured Reasoning
- Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information
- D-NOVA: In-Storage Retrieval Accelerator via Dual-Bound 3D NAND-Optimized Similarity Search with Vector Adaptation
- Natural Language Access to Domain-Specific Metadata: A Reusable Framework for LLM Query Generation
- What Transfers Under Source Shift? Definitions, Examples, and Fine-Tuning for Climate Disclosure Classification
- Harness Engineering for LLM-Driven GPU Kernel Generation
- Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning
- Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
- Don't Blame the Large Language Model: How Agent Harness Evolution Shapes Coding Agent Quality
- A CXL Memory Rack for Multi-Turn LLM Serving
- The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale
- Codec-Gauge: Learning Compression-Friendly Gauges for Transformer KV Caches
- Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary
- Decode-Time Grammars: Constrained LLM Generation over a Refinement Order of Grammar Fragments
- Hardware Mechanisms to Dynamically Throttle AI Performance
- DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training
- When Does Muon Help Agentic Reinforcement Learning?
- A Systematic Investigation of RL-Jailbreaking in LLMs
- SlotGuard: Stop Oversharing Private Local Context in LLM Agent Transcri
- Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware
- ThAME: 3D Memory-Enabled Heterogeneous Accelerator for LLM Mixture of Experts
- Talaria: Session-Aware Serverless Serving of Hundred-Billion-Parameter LLMs
- Transition-Aware Backend Dispatch for Edge LLM Inference
- LATTICE: Constraint-Directed Scheduling, Memory Planning, and Pipeline Refinement for NPUs
- Do Value Vectors in Deep Layers Need Context from the Residual Stream?
- MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs
- Is "Knowing It's Malicious Enough?" Evaluating LLMs for Fine-Grained Malware Behavior Auditing
- Robust KV Cache Management for LLM Serving under Output Token Length Uncertainty
- CHIA: An open-source framework for principled, agentic AI-driven hardware/software co-design research
- Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR
- Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems
- Scalable LLM Agent Tool Access in the Cloud
- PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization
- When Do Multi-Agent Systems Help? An Information Bottleneck Perspective
- DualKV: Shared-Prompt Flash Attention for Efficient RL Training with Large Rollouts and Long Contexts
- Enabling Spatially Fine-Grained DVFS in Neural Processing Units for Energy-Efficient LLM Serving
- RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation
- Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
- Speculative Decoding with a Speculative Vocabulary
- Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives
- Length Penalties Make Chain-of-Thought Less Monitorable
- SODA: Semi On-Policy Black-Box Distillation for Large Language Models
- Auto-Scaling Heterogeneous Neural Processing Units for Energy and Cost-Efficient LLM Serving
- JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models
- KD-Judge: A Knowledge-Driven Automated Judge Framework for Functional Fitness Movements on Edge Devices
- MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems
- Attention to Detail: Evaluating Energy, Performance, and Accuracy Trade-offs Across vLLM Configurations
- On-Policy Delta Distillation
- Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models
- Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent
- Reflex: Real-Time VLA Control through Streaming Inference
- Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers
- Models Can Model, But Can't Bind: Structured Grounding in Text-to-Optimization
- Reliability-Aware LLM Alignment from Inconsistent Human Feedback
- Self-Compacting Language Model Agents
- One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context
- High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration
- CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents
- Still: Amortized KV Cache Compaction in a Single Forward Pass
- Workload-Aware Caching for Multi-Agent Systems
- SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification
- DecodeShare: Tracing the Shared Subspace of LLM Decode-Time Decisions
- Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX
- InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents
- CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs
- JAXBench: Benchmarking Autonomous TPU Kernel Optimization
- CPPL: A Circuit Prompt Programming Language
- Decoupled Attention Fusion: Accelerating RAG with Efficient KV Cache Reuse
- AgentKVShift: Efficient KV Cache Reuse for Agentic Memory Systems
- PEARL: Solver-in-the-Loop Interactive Optimization Modeling from Natural Language
- Domyn-Small: A European 10B Reasoning Language Model
- Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads
- Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices
- Embarrassingly Simple Self-Distillation Improves Code Generation
- Sequential KV Cache Compression via Probabilistic Language Tries: Beyond the Per-Vector Shannon Limit
- Effective Distillation to Hybrid xLSTM Architectures
- Mamba-3: Improved Sequence Modeling using State Space Principles
- Can LLMs Beat Classical Hyperparameter Optimization Algorithms? A Study on autoresearch
- Flash-KMeans: Fast and Memory-Efficient Exact K-Means
- LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models
- Speculative Speculative Decoding
- Learning to Reason in 13 Parameters
- PrAg-PO: Prompt Augmented Policy Optimization for Robust and Diverse Mathematical Reasoning
- Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?
- Understanding Efficiency: Quantization, Batching, and Serving Strategies in LLM Energy Use
- Strategies for Span Labeling with Large Language Models
- Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models
- Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem
- NL2Logic: AST-Guided Translation of Natural Language into First-Order Logic with Large Language Models
- In-Context Probing for Membership Inference in Fine-Tuned Language Models
- PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language Generation
- LLM Output Drift: Cross-Provider Validation & Mitigation for Financial Workflows
- Antislop: A Comprehensive Framework for Identifying and Eliminating Repetitive Patterns in Language Models
- Not All Bits Are Equal: Scale-Dependent Memory Optimization Strategies for Reasoning Models
- Expected Attention: KV Cache Compression by Estimating Attention from Future Queries Distribution
- Base Models Know How to Reason, Thinking Models Learn When
- Every FLOP Counts: Scaling a 300B Mixture-of-Experts LING LLM without Premium GPUs
- A Cost-Benefit Analysis of On-Premise Large Language Model Deployment: Breaking Even with Commercial LLM Services
- A Survey on Diffusion Language Models
- Reinforcement Learning Teachers of Test Time Scaling
- ProxAnn: Use-Oriented Evaluations of Topic Models and Document Clustering
- Self-Adapting Language Models
- Log-Linear Attention
- RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
- Expressing stigma and inappropriate responses prevents LLMs from safely replacing mental health providers.
- Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions
- M1: Towards Scalable Test-Time Compute with Mamba Reasoning Models
- SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion
- ZSMerge: Zero-Shot KV Cache Compression for Memory-Efficient Long-Context LLMs
- Multi-Modal Framing Analysis of News
- InfiniteHiP: Extending Language Model Context Up to 3 Million Tokens on a Single GPU
- Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs
- Is That Your Final Answer? Test-Time Scaling Improves Selective Question Answering
- CalibQuant: 1-Bit KV Cache Quantization for Multimodal LLMs
- Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
- DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning
- s1: Simple test-time scaling
- Accelerating Time Series Foundation Models with Speculative Decoding
- Remedy-R: Generative Reasoning for Machine Translation Evaluation without Error Annotations
- DMA: Online RAG Alignment with Human Feedback
- C8s: A Confidential Kubernetes Architecture
- Discourse Diversity in Multi-Turn Empathic Dialogue
- Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models
- LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation
- NanoQuant: Efficient Sub-1-Bit Quantization of Large Language Models
- Reinforcement Learning via Self-Distillation
- Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
- MindWatcher: Toward Smarter Multimodal Tool-Integrated Reasoning
- Trust Region Masking for Long-Horizon LLM Reinforcement Learning
- Viability and Performance of a Private LLM Server for SMBs: A Benchmark Analysis of Qwen3-30B on Consumer-Grade Hardware
- Fleet: Hierarchical Task-based Abstraction for Megakernels on Multi-Die GPUs
- Argus: Token Aware Distributed LLM Inference Optimization
- Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation
- OptiNIC: A Resilient and Tail-Optimal RDMA NIC for Distributed ML Workloads
- WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference
- Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents
- Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
- RollArt: Disaggregated Multi-Task Agentic RL Training at Scale
- Role-Based Fault Tolerance System for LLM RL Post-Training
- AFA-LoRA: Enabling Non-Linear Adaptations in LoRA with Activation Function Annealing
- Nightjar: Dynamic Adaptive Speculative Decoding for Large Language Models Serving
- Efficient Multi-Model Orchestration for Self-Hosted Large Language Models
- VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
- Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
- MatKV: Trading Compute for Flash Storage in LLM Inference
- DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention
- Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
- SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving
- Language Shapes Instruction Hierarchy Compliance in Multilingual LLMs
- Do LLM Debates Repeat Arguments Differently Across Languages?
- LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention
- StreamIndex: Memory-Bounded Compressed Sparse Attention via Streaming Top-k
- In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models
- Accelerating Language Model Workflows with Prompt Choreography
- A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever
- Kalypso: Relational LLM Serving
- INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models
- KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems
- LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding
- Decoding the Skew: Distribution-Aware MoE Inference with Adaptive Kernel Dispatch
- Memory for Large Language Models
- Everyone is unique: Towards Behaviorally Heterogeneous Negotiation Dialogue Systems for Debt Collection
- CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention
- Beyond Prefill-Decode Disaggregation: Dissecting LLM Inference for Heterogeneous Platforms via Dynamic Operator Scheduling
- Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference
- LLM as Forecasting Planner: Training-Free Text Conditioning for Time-Series Foundation Models
- Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs
- MixQuant: Adaptive Mixed-Precision Quantization for Large Language Models
- MedJudgeRAG: Option-Wise Evidence Judgment with Dynamic Knowledge Graphs for Medical MCQA
- The Best Programming Language for Tokenmaxxing: An Investigation of Coding Agent Behavior Across Programming Languages
- AssumptionMiner: Extracting, Tracing, and Revising Implicit Assumptions in LLM Code Generation
- Agent Team Work Zone: An Automated, Persistent Workspace for Long-Lived Claude Code Agent Teams
- TGMS: An Agent-Native Bi-Temporal Graph Management System
- DRC-Aid: Design-Rule Correction via Agentic Framework utilizing Inference-Time Large Language Models
- AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning
- MPR-CiteG: Enhancing RAG with Multi-Portfolio Retrieval and Citation-Grounded Generation
- StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design
- How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift
- FARM: Find Anything using Relational Spatial Memory
- PTStore (Prefix Tensor Store): Distributed Prefix Caching and Replication for High Throughput Inference Serving
- TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs
- HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization
- Evolving from Lessons: Skill-Augmented Table Graph Reasoning for Operation-wise Table Question Answering
- DynaResize: Runtime GPU Reallocation for Disaggregated LLM Post-Training
- HyCE-RAG: Hypergraph Chain-of-Evidence Retrieval-Augmented Generation for Explainable Multi-hop Question Answering
- xMIx: High-Performance Serving-Time Platform for Mechanistic Interpretability Apps
- Lexical discovery in unknown environments orchestrated by Large Language Models
- Keyword Matters: Unveiling the Energy Sensitivity of On-Device LLM Prompting
- Codifying the Judge: Scalable Evaluation via Program Distillation
- Procedural Knowledge at Scale Improves Reasoning
- Geometric Context Transformer for Streaming 3D Reconstruction
- SkipOPU: An FPGA-based Overlay Processor for Large Language Models with Dynamically Allocated Computation
- Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
- Adapter Merging Reactivates Latent Reasoning Traces: A Mechanism Analysis
- Entropy Sentinel: Probing Entropy Traces for LLM Monitoring
- Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices
- A Comedy of Estimators: On KL Regularization in RL Training of LLMs
- Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
- Efficient MoE Inference with Fine-Grained Scheduling of Disaggregated Expert Parallelism
- RLLaVA: An RL-central Framework for Language and Vision Assistants
- A Plan Reuse Mechanism for LLM-Driven Agent
- One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents
- ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models
- EVE: A Generator-Verifier System for Generative Policies
- Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
- RHAPSODY: Execution of Hybrid AI-HPC Workflows at Scale
- AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
- Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
- Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs
- Toward Explaining Large Language Models in Software Engineering Tasks
- Learning to Reason in LLMs by Expectation Maximization
- Predictive-LoRA: A Proactive and Fragmentation-Aware Serverless Inference System for LLMs
- CodeSimpleQA: Scaling Factuality in Code Large Language Models
- RAPID-LLM: Resilience-Aware Performance analysis of Infrastructure for Distributed LLM Training and Inference
- MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning
- CascadeInfer: Length-Aware Scheduling of LLM Serving with Low Latency and Load Balancing
- On Finding Inconsistencies in Documents
- X-Talk: On the Underestimated Potential of Modular Speech-to-Speech Dialogue System
- SmartSight: Mitigating Hallucination in Video-LLMs Without Compromising Video Understanding via Temporal Attention Collapse
- TraCT: Disaggregated LLM Serving with CXL Shared Memory KV Cache at Rack-Scale
- SRS-Stories: Vocabulary-constrained multilingual story generation for language learning
- Efficient Mixture-of-Agents Serving via Tree-Structured Routing, Adaptive Pruning, and Dependency-Aware Prefill-Decode Overlap
- Layout-Aware Text Editing for Efficient Transformation of Academic PDFs to Markdown
- Shuttling Compiler for Trapped-Ion Quantum Computers Based on Large Language Models
- When the Gold Standard Isn't Necessarily Standard: Challenges of Evaluating the Translation of User-Generated Content
- Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing
- KV Admission: Learning What to Write for Efficient Long-Context Inference
- CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning
- Understanding Generalization in Role-Playing Models via Information Theory
- Enhancing Long Document Long Form Summarisation with Self-Planning
- Trust-Region Adaptive Policy Optimization
- Reinforcement Learning for Self-Improving Agent with Skill Library
- A Solver-in-the-Loop Framework for Improving LLMs on Answer Set Programming for Logic Puzzle Solving
- XLM: A Python package for non-autoregressive language models
- AdaTooler-V: Adaptive Tool-Use for Images and Videos
- Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
- A Benchmark and Agentic Framework for Omni-Modal Reasoning and Tool Use in Long Videos
- AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning
- MEPIC: Memory Efficient Position Independent Caching for LLM Serving
- Exploration of Augmentation Strategies in Multi-modal Retrieval-Augmented Generation for the Biomedical Domain: A Case Study Evaluating Question Answering in Glycobiology
- DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI
- AI4EOSC: a Federated Cloud Platform for Artificial Intelligence in Scientific Research
- LoPA: Scaling dLLM Inference via Lookahead Parallel Decoding
- Scaling Text2SQL via LLM-efficient Schema Filtering with Functional Dependency Graph Rerankers
- MultiPath Memory Access: Breaking Host-GPU Bandwidth Bottlenecks in LLM Services
- INTELLECT-3: Technical Report
- The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs
- Dynamic Rebatching for Efficient Early-Exit Inference with DREX
- Optimizing Agentic Language Model Inference via Speculative Tool Calls
- Towards Proactive Personalization through Profile Customization for Individual Users in Dialogues
- How Much is Too Much? Exploring LoRA Rank Trade-offs for Retaining Knowledge and Domain Robustness
- Bolmo: Byteifying the Next Generation of Language Models
- CTkvr: KV Cache Retrieval for Long-Context LLMs via Centroid then Token Indexing
- DEER: Draft with Diffusion, Verify with Autoregressive Models
- Mixture of Attention Schemes (MoAS): Learning to Route Between MHA, GQA, and MQA
- Spatia: Video Generation with Updatable Spatial Memory
- EVICPRESS: Joint KV-Cache Compression and Eviction for Efficient LLM Serving
- ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
- Ladder Up, Memory Down: Low-Cost Fine-Tuning With Side Nets
- Cornfigurator: Automated Planning for Any-to-Any Multimodal Model Serving
- Sharing State Between Prompts and Programs
- SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning
- VLCache: Computing 2% Vision Tokens and Reusing 98% for Vision-Language Inference
- Async Control: Stress-testing Asynchronous Control Measures for LLM Agents
- From User Interface to Agent Interface: Efficiency Optimization of UI Representations for LLM Agents
- Beyond Training: Enabling Self-Evolution of Agents with MOBIMEM
- Fine-Grained Energy Prediction For Parallellized LLM Inference With PIE-P
- Revisiting the Reliability of Language Models in Instruction-Following
- ProServe: Unified Multi-Priority Request Scheduling for LLM Serving
- Persistent Personas? Role-Playing, Instruction Following, and Safety in Extended Interactions
- gpuext: Extensible OS Policies for GPUs via eBPF
- Exact Flow Linear Attention: Exact Solution from Continuous-Time Dynamics
- Coupled Variational Reinforcement Learning for Language Model General Reasoning
- More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models
- HetRL: Efficient Reinforcement Learning for LLMs in Heterogeneous Environments
- Taint-Based Code Slicing for LLMs-based Malicious NPM Package Detection
- Training Versatile Coding Agents in Synthetic Environments
- The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior
- Instruction-Tuning Open-Weight Language Models for BPMN Model Generation
- xGR: Efficient Generative Recommendation Serving at Scale
- AgentBalance: Backbone-then-Topology Design for Cost-Effective Multi-Agent Systems under Budget Constraints
- AGAPI-Agents: An Open-Access Agentic AI Platform for Accelerated Materials Design on AtomGPT.org
- Speculative Decoding Speed-of-Light: Optimal Lower Bounds via Branching Random Walks
- Asynchronous Reasoning: Training-Free Interactive Thinking LLMs
- CXL-SpecKV: A Disaggregated FPGA Speculative KV-Cache for Datacenter LLM Serving
- ESS: An Offload-Centric Latent-Cache Management Architecture for DeepSeek-V3.2-Exp
- LLM-Auction: Generative Auction towards LLM-Native Advertising
- Unlocking the Address Book: Dissecting the Sparse Semantic Structure of LLM Key-Value Caches via Sparse Autoencoders
- InFerActive: Interactive Tree-Based Exploration of LLM Sampling for Safety Evaluation
- SWAA: Sliding Window Attention Adaptation for Efficient and Quality Preserving Long Context Processing
- KBQA-R1: Reinforcing Large Language Models for Knowledge Base Question Answering
- Supporting Dynamic Agentic Workloads: How Data and Agents Interact
- RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning
- WarmServe: Enabling One-for-Many GPU Prewarming for Multi-LLM Serving
- ODMA: On-Demand Memory Allocation Strategy for LLM Serving on LPDDR-Class Accelerators
- RACAM: Enhancing DRAM with Reuse-Aware Computation and Automated Mapping for ML Inference
- GoodSpeed: Optimizing Fair Goodput with Adaptive Speculative Decoding in Distributed Edge Inference
- Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs
- LaMoSys3.5D: Enabling 3.5D-IC-Based Large Language Model Inference Serving Systems via Hardware/Software Co-Design
- To Think or Not to Think: The Hidden Cost of Meta-Training with Excessive CoT Examples
- QSTN: A Modular Framework for Robust Questionnaire Inference with Large Language Models
- Magneton: Optimizing Energy Efficiency of ML Systems via Differential Energy Debugging
- SoMe: A Realistic Benchmark for LLM-based Social Media Agents
- Mind to Hand: Purposeful Robotic Control via Embodied Reasoning
- SkipKV: Selective Skipping of KV Generation and Storage for Efficient Inference with Large Reasoning Models
- Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
- Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning
- MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
- PersonaMem-v2: Towards Personalized Intelligence via Learning Implicit User Personas and Agentic Memory
- RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs
- VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning
- Policy-based Sentence Simplification: Replacing Parallel Corpora with LLM-as-a-Judge
- A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation
- Compass: Co-Exploration of Mapping and Hardware for Heterogeneous Multi-Chiplet Accelerators Targeting LLM Inference Service Workloads
- Bootstrapping Fuzzers for Compilers of Low-Resource Language Dialects Using Language Models
- RoBoN: Routed Online Best-of-n for Test-Time Scaling with Multiple LLMs
- PrivCode: When Code Generation Meets Differential Privacy
- Structured Document Translation via Format Reinforcement Learning
- RefineBench: Evaluating Refinement Capability of Language Models via Checklists
- Distilling Temporal Search and Reasoning: Evolving LLMs for Future Prediction via Harness-Assisted Efficient Data Synthesis
- LAWS: Learning from Actual Workloads Symbolically -- A Self-Certifying Parametrized Cache Architecture for Neural Inference, Robotics, and Edge Deployment
- Beyond Factual Accuracy: Evaluating Global Reasoning Integrity in RAG Systems with LogicScore
- Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
- CryptoTensors: A Light-Weight Large Language Model File Format for Highly-Secure Model Distribution
- Solving LLM Repetition Problem in Production: A Comprehensive Study of Multiple Solutions
- Distance Is All You Need: Radial Dispersion for Uncertainty Estimation in Large Language Models
- KV Cache Recycling to Expand Usable Context Capacity in Low Parameter LLMs
- Log Probability Tracking of LLM APIs
- AR-Med: Automated Relevance Enhancement in Medical Search via LLM-Driven Information Augmentation
- KVNAND: Efficient On-Device Large Language Model Inference Using DRAM-Free In-Flash Computing
- OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation
- AsymPuzl: An Asymmetric Puzzle for multi-agent cooperation
- TokenScale: Timely and Accurate Autoscaling for Disaggregated LLM Serving with Token Velocity
- Continuous Prompts: LLM-Augmented Pipeline Processing over Unstructured Streams
- Leveraging LLMs for Structured Data Extraction from Unstructured Patient Records
- Large Language Models as Generalist Policies for Network Optimization
- Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
- SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
- TokenPowerBench: Benchmarking the Power Consumption of LLM Inference
- Fairy2i: Training Complex LLMs from Real LLMs with All Parameters in \± 1, ± i\
- MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm
- PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling
- GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding
- Cross-Lingual Prompt Steerability: Towards Accurate and Robust LLM Behavior across Languages
- VACoT: Rethinking Visual Data Augmentation with VLMs
- SpecPV: Improving Self-Speculative Decoding for Long-Context Generation via Partial Verification
- promptolution: A Unified, Modular Framework for Prompt Optimization
- Think in Parallel, Answer as One: Logit Averaging for Open-Ended Reasoning
- Trinity: Disaggregating Vector Search from Prefill-Decode Disaggregation in LLM Serving
- PAI-Bench: A Comprehensive Benchmark For Physical AI
- KV Pareto: Systems-Level Optimization of KV Cache and Model Compression for Long Context Inference
- Rectifying LLM Thought from Lens of Optimization
- A Systematic Characterization of LLM Inference on GPUs
- MAC-SLU: Multi-Intent Automotive Cabin Spoken Language Understanding Benchmark
- MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages
- Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding
- ZO-ASR: Zeroth-Order Fine-Tuning of Speech Foundation Models without Back-Propagation
- KVReviver: Reversible KV Cache Compression with Sketch-Based Token Reconstruction
- Chain of Unit-Physics: A Primitive-Centric Approach to Scientific Code Synthesis
- Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning
- Bias Injection Attacks on RAG Databases and Sanitization Defenses
- SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs
- SIMPLE: Disaggregating Sampling from GPU Inference into a Decision Plane for Faster Distributed LLM Serving
- ESPO: Entropy Importance Sampling Policy Optimization
- Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code Translation
- Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
- ThetaEvolve: Test-time Learning on Open Problems
- OctoMed: Data Recipes for State-of-the-Art Multimodal Medical Reasoning
- MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?
- ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
- ORION: Teaching Language Models to Reason Efficiently in the Language of Thought
- Behavior-Equivalent Token: Single-Token Replacement for Long Prompts in LLMs
- CacheTrap: Unveiling a Stealthier Gray-Box Trojan against LLMs
- Geometrically-Constrained Agent for Spatial Reasoning
- DisCEdge: Distributed Context Management for Large Language Models at the Edge
- OmniInfer: System-Wide Acceleration Techniques for Optimizing LLM Serving Throughput and Latency
- Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework
- PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel
- Guiding the Inner Eye: A Framework for Hierarchical and Flexible Visual Grounded Reasoning
- Statistical Independence Aware Caching for LLM Workflows
- IntAttention: A Fully Integer Attention Pipeline for Efficient Edge Inference
- Automated Dynamic AI Inference Scaling on HPC-Infrastructure: Integrating Kubernetes, Slurm and vLLM
- Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
- Co-Training Vision Language Models for Remote Sensing Multi-task Learning
- Self-Guided Adaptive Safety Alignment: Synthesizing and Internalizing Guidelines in Reasoning Models
- Orthographic Constraint Satisfaction and Human Difficulty Alignment in Large Language Models
- Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design
- Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression
- DOPD: A Dynamic PD-Disaggregation Architecture for Maximizing Goodput in LLM Inference Serving
- Aragog: Just-in-Time Model Routing for Scalable Serving of Agentic Workflows
- Chatty-KG: A Multi-Agent AI System for On-Demand Conversational Question Answering over Knowledge Graphs
- Efficient Multi-Adapter LLM Serving via Cross-Model KV-Cache Reuse with Activated LoRA
- Reinforcing Action Policies by Prophesying
- DiFR: Inference Verification Despite Nondeterminism
- A note on conditional PAC-efficient reasoning in large language model routing
- MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
- Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios
- Beluga: A CXL-Based Memory Architecture for Scalable and Efficient LLM KVCache Management
- Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation
- Beyond Relational: Semantic-Aware Multi-Modal Analytics with LLM-Native Query Optimization
- Revisiting Feedback Models for HyDE
- Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
- LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
- Latent Collaboration in Multi-Agent Systems
- SLMFix: Leveraging Small Language Models for Error Fixing with Reinforcement Learning
- ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models
- SWAN: Sparse Winnowed Attention for Reduced Inference Memory via Decompression-Free KV-Cache Compression
- Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models
- Periodic Asynchrony: An On-Policy Approach for Accelerating LLM Reinforcement Learning
- KernelBand: Steering LLM-based Kernel Optimization via Hardware-Aware Multi-Armed Bandits
- Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores
- VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL
- Efficient Multi-Hop Question Answering over Knowledge Graphs via LLM Planning and Embedding-Guided Search
- Kitty: Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost
- RAGPulse: An Open-Source RAG Workload Trace to Optimize RAG Serving Systems
- Deterministic Inference across Tensor Parallel Sizes That Eliminates Training-Inference Mismatch
- E3-Pruner: Towards Efficient, Economical, and Effective Layer Pruning for Large Language Models
- Arctic-Extract Technical Report
- Auditing Sex/Gender Disparities in Emergency Triage with LLM-based Paired Comparisons
- Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter
- Evolution Strategies at the Hyperscale
- On 10x Better Scalability: KV Stores Scale Up KV Cache
- Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning
- OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe
- AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization
- Mind the Motions: Benchmarking Theory-of-Mind in Everyday Body Language
- German General Social Survey Personas: A Survey-Derived Persona Prompt Collection for Population-Aligned LLM Studies
- Enhancing Reliability across Short and Long-Form QA via Reinforcement Learning
- EntroPIC: Towards Stable Long-Term Training of LLMs via Entropy Stabilization with Proportional-Integral Control
- Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning
- LiteCache: A Query Similarity-Driven, GPU-Centric KVCache Subsystem for Efficient LLM Inference
- Agent-R1: A Unified and Modular Framework for Agentic Reinforcement Learning
- ATLAS: A High-Difficulty, Multidisciplinary Benchmark for Frontier Scientific Reasoning
- NeuroPath: Neurobiology-Inspired Path Tracking and Reflection for Semantically Coherent Retrieval
- Beat the long tail: Distribution-Aware Speculative Decoding for RL Training
- Generalist Foundation Models Are Not Clinical Enough for Hospital Operations
- Reasoning Shapes Alignment: Investigating Cultural Alignment in Large Reasoning Models with Cultural Norms
- Dissecting and Re-architecting 3D NAND Flash PIM Arrays for Efficient Single-Batch Token Generation in LLMs
- Comparative Analysis of Large Language Model Inference Serving Systems: A Performance Study of vLLM and HuggingFace TGI
- Scaling Graph Chain-of-Thought Reasoning: A Multi-Agent Framework with Efficient LLM Serving
- TPS-Bench: Evaluating AI Agents' Tool Planning & Scheduling Abilities in Compounding Tasks
- Tailored Primitive Initialization is the Secret Key to Reinforcement Learning
- Optimal Self-Consistency for Efficient Reasoning with Large Language Models
- CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
- Fusionista2.0: Efficiency Retrieval System for Large-Scale Datasets
- On the Entropy Calibration of Language Models
- KVSwap: Disk-aware KV Cache Offloading for Long-Context On-device Inference
- FarSkip-Collective: Unhobbling Blocking Communication in Mixture of Experts Models
- BhashaKritika: Building Synthetic Pretraining Data at Scale for Indic Languages
- VIDEOP2R: Video Understanding from Perception to Reasoning
- Generative Caching for Structurally Similar Prompts and Responses
- Improving LLM's Attachment to External Knowledge In Dialogue Generation Tasks Through Entity Anonymization
- Optimizing Mixture of Block Attention
- ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
- Reasoning about Intent for Ambiguous Requests
- Efficient Thought Space Exploration Through Strategic Intervention
- Harli: SLO-Aware Co-location of LLM Inference and PEFT-based Finetuning on Model-as-a-Service Platforms
- SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models
- Lit Silicon: A Case Where Thermal Imbalance Couples Concurrent Execution in Multiple GPUs
- Understanding and Improving Communication Performance in Multi-node LLM Inference
- Seer Self-Consistency: Advance Budget Estimation for Adaptive Test-Time Scaling
- Bench360: Benchmarking Local LLM Inference from 360 Degrees
- PrefixNLI: Detecting Factual Inconsistencies as Soon as They Arise
- Beyond Task-Oriented and Chitchat Dialogues: Proactive and Transition-Aware Conversational Agents
- Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models
- The Path Not Taken: RLVR Provably Learns Off the Principals
- Understanding Inference Scaling for LLMs: Bottlenecks, Trade-offs, and Performance Principles
- Event Tensor: A Unified Abstraction for Compiling Dynamic Megakernel
- AlignSurvey: A Comprehensive Benchmark for Human Preferences Alignment in Social Surveys
- MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
- Judging by the Rules: Compliance-Aligned Framework for Modern Slavery Statement Monitoring
- Streaming Tensor Program: A streaming abstraction for dynamic parallelism
- Large Reasoning Models Struggle to Transfer Parametric Knowledge Across Scripts
- When, What, and How: Rethinking Retrieval-Enhanced Speculative Decoding
- TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine
- Selecting Auxiliary Data via Neural Tangent Kernels for Low-Resource Domains
- More Agents Helps but Adversarial Robustness Gap Persists
- Argus: Quality-Aware High-Throughput Text-to-Image Inference Serving System
- Textual Self-attention Network: Test-Time Preference Optimization through Textual Gradient-based Attention
- Data Trajectory Alignment for LLM Domain Adaptation: A Two-Phase Synthesis Framework for Telecommunications Mathematics
- LLMServingSim2.0: A Unified Simulator for Heterogeneous Hardware and Serving Techniques in LLM Infrastructure
- You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
- Confidence-Guided Stepwise Model Routing for Cost-Efficient Reasoning
- LUT-LLM: Efficient Large Language Model Inference with Memory-based Computations on FPGAs
- Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B
- Optimizing Long-context LLM Serving via Fine-grained Sequence Parallelism
- Lethe: Layer- and Time-Adaptive KV Cache Pruning for Reasoning-Intensive LLM Serving
- Kunlun Anomaly Troubleshooter: Enabling Kernel-Level Anomaly Detection and Causal Reasoning for Large Model Distributed Inference
- CoEdge-RAG: Optimizing Hierarchical Scheduling for Retrieval-Augmented LLMs in Collaborative Edge Computing
- Can a Small Model Learn to Look Before It Leaps? Dynamic Learning and Proactive Correction for Hallucination Detection
- Hilbert-Guided Sparse Local Attention
- CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization
- Learning from Online Videos at Inference Time for Computer-Use Agents
- The Future of Fully Homomorphic Encryption System: from a Storage I/O Perspective
- BudgetMem: Learning Selective Memory Policies for Cost-Efficient Long-Context Processing in Language Models
- LLMs as Packagers of HPC Software
- DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing
- Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing
- MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models
- NVIDIA Nemotron Nano V2 VL
- SynQuE: Estimating Synthetic Dataset Quality Without Annotations
- Surprisal reveals diversity gaps in image captioning and different scorers change the story
- What's in Common? Multimodal Models Hallucinate When Reasoning Across Scenes
- From Prompts to Power: Measuring the Energy Footprint of LLM Inference
- AnchorTP: Resilient LLM Inference with State-Preserving Elastic Tensor Parallelism
- CareMedEval dataset: Evaluating Critical Appraisal and Reasoning in the Biomedical Field
- CoPRIS: Efficient and Stable Reinforcement Learning via Concurrency-Controlled Partial Rollout with Importance Sampling
- Accelerating Physical Property Reasoning for Augmented Visual Cognition
- SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators
- UTF-8 Plumbing: Byte-level Tokenizers Unavoidably Enable LLMs to Generate Ill-formed UTF-8
- ContextPilot: Fast Long-Context Inference via Context Reuse
- Divide, Cache, Conquer: Dichotomic Prompting for Efficient Multi-Label LLM-Based Classification
- In Good GRACEs: Principled Teacher Selection for Knowledge Distillation
- CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
- Verifying LLM Inference to Prevent Model Weight Exfiltration
- From Models to Operators: Rethinking Autoscaling Granularity for Large Generative Models
- Opportunistic Expert Activation: Batch-Aware Expert Routing for Faster Decode Without Retraining
- Continuum: Efficient and Robust Multi-Turn LLM Agent Scheduling with KV Cache Time-to-Live
- Using Span Queries to Optimize for Cache and Attention Locality
- Can LLMs subtract numbers?
- Graph-Based Alternatives to LLMs for Human Simulation
- Flashlight: PyTorch Compiler Extensions to Accelerate Attention Variants
- Democratizing LLM Efficiency: From Hyperscale Optimizations to Universal Deployability
- KV Cache Transform Coding for Compact Storage in LLM Inference
- Knowledge Elicitation with Large Language Models for Interpretable Cancer Stage Identification from Pathology Reports
- IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation
- FlexiCache: Leveraging Temporal Stability of Attention Heads for Efficient KV Cache Management
- AGRAG: Advanced Graph-based Retrieval-Augmented Generation for LLMs
- FREESH: Fair, Resource- and Energy-Efficient Scheduling for LLM Serving on Heterogeneous GPUs
- Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
- Towards Understanding, Analyzing, and Optimizing Agentic AI Execution: A CPU-Centric Perspective
- Separate the Wheat from the Chaff: Winnowing Down Divergent Views in Retrieval Augmented Generation
- Leveraging Multi-Agent System (MAS) and Fine-Tuned Small Language Models (SLMs) for Automated Telecom Network Troubleshooting
- EPARA: Parallelizing Categorized AI Inference in Edge Clouds
- Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse
- ToM: Leveraging Tree-oriented MapReduce for Long-Context Reasoning in Large Language Models
- Sherlock: Reliable and Efficient Agentic Workflow Execution
- LingGym: How Far Are LLMs from Thinking Like Field Linguists?
- fabric-lib: RDMA Point-to-Point Communication for LLM Systems
- EncouRAGe: Evaluating RAG Local, Fast, and Reliable
- VCORE: Variance-Controlled Optimization-based Reweighting for Chain-of-Thought Supervision
- DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains
- Glia: A Human-Inspired AI for Automated Systems Design and Optimization
- Unstructured Data Analysis using LLMs: A Comprehensive Benchmark
- SpecAttn: Speculating Sparse Attention
- Independent Clinical Evaluation of General-Purpose LLM Responses to Signals of Suicide Risk
- FlowMesh: A Service Fabric for Composable LLM Workflows
- Defeating the Training-Inference Mismatch via FP16
- Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models
- Emu3.5: Native Multimodal Models are World Learners
- EdgeRunner 20B: Military Task Parity with GPT-5 while Running on the Edge
- Data-Efficient RLVR via Off-Policy Influence Guidance
- Counteracting Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing
- BOTS: A Unified Framework for Bayesian Online Task Selection in LLM Reinforcement Finetuning
- The Geometry of Dialogue: Graphing Language Models to Reveal Synergistic Teams for Multi-Agent Collaboration
- Pragmatic Theories Enhance Understanding of Implied Meanings in LLMs
- Angular Steering: Behavior Control via Rotation in Activation Space
- One Model to Critique Them All: Rewarding Agentic Tool-Use via Efficient Reasoning
- Beyond Benchmarks: The Economics of AI Inference
- Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail
- Loquetier: A Virtualized Multi-LoRA Framework for Unified LLM Fine-tuning and Serving
- Limits of Generalization in RLVR: Two Case Studies in Mathematical Reasoning
- PORTool: Tool-Use LLM Training with Rewarded Tree
- Roleplaying with Structure: Synthetic Therapist-Client Conversation Generation from Questionnaires
- PureKV: Plug-and-Play KV Cache Optimization with Spatial-Temporal Sparse Attention for Vision-Language Large Models
- Communication and Verification in LLM Agents towards Collaboration under Information Asymmetry
- Generalized Pseudo-Relevance Feedback
- NetEcho: From Real-World Streaming Side-Channels to Full LLM Conversation Recovery
- Serve Programs, Not Prompts
- Not ready for the bench: LLM legal interpretation is unstable and out of step with human judgments
- From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs
- CARE: A Multimodal Corpus for Studying Speech and Non-Verbal Communication Across Multiple Medical Conditions
- Cache Merging as a Convergent Replicated State for Multi-Agent Latent Reasoning
- BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
- LLMET: Enabling Cross-Layer Evaluation of Emerging M3D Memories for Energy-Efficient LLM Serving
- StrataCL: Fabric-Native Communication Library for Production Supernodes
- NELSSA: A GPU-PNM Heterogeneous System for Mixed-Length LLM Serving via Length-based Request Placement
- ServerlessT2I: Efficient Text-to-Image Workflow Serving on a Serverless Platform
- From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs
- Steering Instruction Hierarchies at Inference Time
- GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning
- Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models
- The Fabric Is the Cluster Driver: Cross-Layer eBPF Policies for GPU-CXL Fabrics
- RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention
- Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers
- RAPID: An Efficient Reinforcement Learning Algorithm for Small Language Models
- ElasticMoE: An Efficient Auto Scaling Method for Mixture-of-Experts Models
- AgentSnare: Learning to Delay, Divert, and Defuse Autonomous Penetration Agents
- Latent-IM: Latent Interaction Management for Speech LLMs
- Breaking the Ice: Analyzing Cold Start Latency in vLLM
- ThriftAttention: Selective Mixed Precision for Long-Context FP4 Attention
- SSV: Sparse Speculative Verification for Efficient LLM Inference
- The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration
- The Stretto Execution Engine for LLM-Augmented Data Systems
- TrajSelector: Harnessing Latent Representations for Efficient and Effective Best-of-N in Large Reasoning Model
- Parallel Context-of-Experts Decoding for Retrieval Augmented Generation
- Beyond One-Size-Fits-All: Personalized Harmful Content Detection with In-Context Learning
- MoEntwine: Unleashing the Potential of Wafer-scale Chips for Large-scale Expert Parallel Inference
- Opt4GPTQ: Co-Optimizing Memory and Computation for 4-bit GPTQ Quantized LLM Inference on Heterogeneous Platforms
- SPICE: Self-Play In Corpus Environments Improves Reasoning
- Optimizing Retrieval for RAG via Reinforced Contrastive Learning
- Instant Personalized Large Language Model Adaptation via Hypernetwork
- Long-Context Modeling with Dynamic Hierarchical Sparse Attention for On-Device LLMs
- What Limits Agentic Systems Efficiency?
- Parallel Loop Transformer for Efficient Test-Time Computation Scaling
- APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training
- zFLoRA: Zero-Latency Fused Low-Rank Adapters
- Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards
- MCP-Flow: Facilitating LLM Agents to Master Real-World, Diverse and Scaling MCP Tools
- Reinforcement Learning for Long-Horizon Multi-Turn Search Agents
- Beyond Neural Incompatibility: Easing Cross-Scale Knowledge Transfer in Large Language Models through Latent Semantic Alignment
- Beyond Line-Level Filtering for the Pretraining Corpora of LLMs
- Pie: A Programmable Serving System for Emerging LLM Applications
- ChessQA: Evaluating Large Language Models for Chess Understanding
- Fortytwo: Swarm Inference with Peer-Ranked Consensus
- Compiler.next: A Search-Based Compiler to Power the AI-Native Future of Software Engineering
- From Benchmarks to Business Impact: Deploying IBM Generalist Agent in Enterprise Production
- Beyond Understanding: Evaluating the Pragmatic Gap in LLMs' Cultural Processing of Figurative Language
- Magentic Marketplace: An Open-Source Environment for Studying Agentic Markets
- IPQA: A Benchmark for Core Intent Identification in Personalized Question Answering
- VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
- Learning to Reason Efficiently with Discounted Reinforcement Learning
- MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models
- Fast-MIA: Efficient and Scalable Membership Inference for LLMs
- Batch Speculative Decoding Done Right
- VEHME: A Vision-Language Model For Evaluating Handwritten Mathematics Expressions
- Iterative Layer Pruning for Efficient Translation Inference
- LooGLE v2: Are LLMs Ready for Real World Long Dependency Challenges?
- E2Rank: Your Text Embedding can Also be an Effective and Efficient Listwise Reranker
- Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests
- LightAgent: Mobile Agentic Foundation Models
- A Multimodal Benchmark for Framing of Oil & Gas Advertising and Potential Greenwashing Detection
- A Data-Centric Approach to Multilingual E-Commerce Product Search: Case Study on Query-Category and Query-Item Relevance
- Boosting Accuracy and Efficiency of Budget Forcing in LLMs via Reinforcement Learning for Mathematical Reasoning
- Excision Score: Evaluating Edits with Surgical Precision
- Embedding Trust: Semantic Isotropy Predicts Nonfactuality in Long-Form Text Generation
- Customizing Open Source LLMs for Quantitative Medication Attribute Extraction across Heterogeneous EHR Systems
- Stateful KV Cache Management for LLMs: Balancing Space, Time, Accuracy, and Positional Fidelity
- Assessing the Political Fairness of Multilingual LLMs: A Case Study based on a 21-way Multiparallel EuroParl Dataset
- GRATING: Low-Latency and Memory-Efficient Semantic Selection on Device
- FreeChunker: A Cross-Granularity Chunking Framework
- PartNeXt: A Next-Generation Dataset for Fine-Grained and Hierarchical 3D Part Understanding
- Rank-GRPO: Training LLM-based Conversational Recommender Systems with Reinforcement Learning
- AI PB: A Grounded Generative Agent for Personalized Investment Insights
- BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models
- Limits of PRM-Guided Tree Search for Mathematical Reasoning with LLMs
- RECALL: REpresentation-aligned Catastrophic-forgetting ALLeviation via Hierarchical Model Merging
- CoSense-LLM: Semantics at the Edge with Cost- and Uncertainty-Aware Cloud-Edge Cooperation
- LLavaCode: Compressed Code Representations for Retrieval-Augmented Code Generation
- Detecting Latin in Historical Books with Large Language Models: A Multimodal Benchmark
- MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs
- From Large to Small: Transferring CUDA Optimization Expertise via Reasoning Graph
- Unified Reinforcement and Imitation Learning for Vision-Language Models
- Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images
- AdaSPEC: Selective Knowledge Distillation for Efficient Speculative Decoders
- DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference
- SecureInfer: Heterogeneous TEE-GPU Architecture for Privacy-Critical Tensors for Large Language Model Deployment
- RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs
- DiSRouter: Distributed Self-Routing for LLM Selections
- Every Step Evolves: Scaling Reinforcement Learning for Trillion-Scale Thinking Model
- Reasoning Language Model Inference Serving Unveiled: An Empirical Study
- Tokencake: A KV-Cache-centric Serving Framework for LLM-based Multi-Agent Applications
- WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality
- EfficientNav: Towards On-Device Object-Goal Navigation with Navigation Map Caching and Retrieval
- SLICE: SLO-Driven Scheduling for LLM Inference on Edge Computing Devices
- From Retrieval to Generation: Unifying External and Parametric Knowledge for Medical Question Answering
- EdgeReasoning: Characterizing Reasoning LLM Deployment on Edge GPUs
- Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs
- RESCUE: Retrieval Augmented Secure Code Generation
- MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training
- PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions
- How Efficient Are Diffusion Language Models? A Critical Examination of Efficiency Evaluation Practices
- Zero‐ and few‐shot prompting of generative large language models provides weak assessment of risk of bias in clinical trials
- ReXMoE: Reusing Experts with Minimal Overhead in Mixture-of-Experts
- Disparities in Multilingual LLM-Based Healthcare Q&A
- Mamba4Net: Distilled Hybrid Mamba Large Language Models For Networking
- Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation
- Prompt-MII: Meta-Learning Instruction Induction for LLMs
- DeepAnalyze: Agentic Large Language Models for Autonomous Data Science
- Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
- Mixed-Precision Quantization for Language Models: Techniques and Prospects
- Accelerating Mobile Language Model via Speculative Decoding and NPU-Coordinated Execution
- MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
- Enhancing reliability in AI inference services: An empirical study on real production incidents
- Synera: Synergistic LLM Serving across Device and Cloud at Scale
- Adaptive Minds: Empowering Agents with LoRA-as-Tools
- Tail-Optimized Caching for LLM Inference
- Predicting Task Performance with Context-aware Scaling Laws
- Speculative Model Risk in Healthcare AI: Using Storytelling to Surface Unintended Harms
- xLLM Technical Report
- ScalePool: Hybrid XLink-CXL Fabric for Composable Resource Disaggregation in Unified Scale-up Domains
- MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving
- ToolTweak: An Attack on Tool Selection in LLM-based Agents
- Budget-aware Test-time Scaling via Discriminative Verification
- Cortex: Workflow-Aware Resource Pooling and Scheduling for Agentic Serving
- Efficiently Executing High-throughput Lightweight LLM Inference Applications on Heterogeneous Opportunistic GPU Clusters with Pervasive Context Management
- Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
- FIRST: Federated Inference Resource Scheduling Toolkit for Scientific AI Model Access
- Adaptive Rescheduling in Prefill-Decode Disaggregated LLM Inference
- NOSA: Native and Offloadable Sparse Attention
- Deflanderization for Game Dialogue: Balancing Character Authenticity with Task Execution in LLM-based NPCs
- M2PO: Multi-Perspective Multi-Pair Preference Optimization for Machine Translation
- F-BFQ: Flexible Block Floating-Point Quantization Accelerator for LLMs
- Protect: Towards Robust Guardrailing Stack for Trustworthy Enterprise LLM Systems
- BanaServe: Unified KV Cache and Dynamic Module Migration for Balancing Disaggregated LLM Serving in AI Infrastructure
- Confidence-Based Response Abstinence: Improving LLM Trustworthiness via Activation-Based Uncertainty Estimation
- BoN Appetit Team at LeWiDi-2025: Best-of-N Test-time Scaling Can Not Stomach Annotation Disagreements (Yet)
- Development and Benchmarking of a Blended Human-AI Qualitative Research Assistant
- KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems
- Laminar: A Scalable Asynchronous RL Post-Training Framework
- A Survey on Collaborating Small and Large Language Models for Performance, Cost-effectiveness, Cloud-edge Privacy, and Trustworthiness
- Locket: Robust Feature-Locking Technique for Language Models
- FlexPipe: Adapting Dynamic LLM Serving Through Inflight Pipeline Refactoring in Fragmented Serverless Clusters
- LLM Reasoning for Machine Translation: Synthetic Data Generation over Thinking Tokens
- Survey Response Generation: Generating Closed-Ended Survey Responses In-Silico with Large Language Models
- Representation-Based Exploration for Language Models: From Test-Time to Post-Training
- Enhancing Long Chain-of-Thought Reasoning through Multi-Path Plan Aggregation
- From to : Multidimensional Supervision of Reasoning Process for LLM Optimization
- Part II: ROLL Flash -- Accelerating RLVR and Agentic Training with Asynchrony
- Collaborative Shadows: Distributed Backdoor Attacks in LLM-Based Multi-Agent Systems
- XQuant: Achieving Ultra-Low Bit KV Cache Quantization with Cross-Layer Compression
- An Explorative Study on Distributed Computing Techniques in Training and Inference of Large Language Models
- How2: How to learn from procedural How-to questions
- From Reasoning LLMs to BERT: A Two-Stage Distillation Framework for Search Relevance
- LogiNumSynth: Synthesizing Joint Logical-Numerical Reasoning Problems for Language Models
- Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective
- The Social Cost of Intelligence: Emergence, Propagation, and Amplification of Stereotypical Bias in Multi-Agent Systems
- LLM Knowledge is Brittle: Truthfulness Representations Rely on Superficial Resemblance
- Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers
- KVComm: Enabling Efficient LLM Communication through Selective KV Sharing
- RePro: Training Language Models to Faithfully Recycle the Web for Pretraining
- DCP: Addressing Input Dynamism In Long-Context Training via Dynamic Context Parallelism
- Integrating Large Language Models and Reinforcement Learning for Sentiment-Driven Quantitative Trading
- SASER: Stego attacks on open-source LLMs
- Traj-CoA: Patient Trajectory Modeling via Chain-of-Agents for Lung Cancer Risk Prediction
- RECON: Reasoning with Condensation for Efficient Retrieval-Augmented Generation
- Clarifying Semantics of In-Context Examples for Unit Test Generation
- LLM-Friendly Knowledge Representation for Customer Support
- DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
- Grounded AI for Code Review: Resource-Efficient Large-Model Serving in Enterprise Pipelines
- CacheClip: Accelerating RAG with Effective KV Cache Reuse
- Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
- MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference
- Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
- AutoMegaKernel: A Statically-Checked Agent Harness for Self-Retargeting Megakernel Synthesis
- AURA: Action-Gated Memory for Robot Policies at Constant VRAM
- Attention Once Is All You Need: Efficient Streaming Inference with Stateful Transformers
- CCL-Bench 1.0: A Trace-Based Benchmark for LLM Infrastructure
- OntoLogX: Ontology-Guided Knowledge Graph Extraction from Cybersecurity Logs with Large Language Models
- Accelerating Attention with Basis Decomposition
- Faster LLM Inference via Sequential Monte Carlo
- Demystifying the Silence of Correctness Bugs in PyTorch Compiler
- Therefore I am. I Think
- NCCL EP: Towards a Unified Expert Parallel Communication API for NCCL
- DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference
- Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs
- DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning
- Token Is All You Price
- Doc2Query++: Topic-Coverage based Document Expansion and its Application to Dense Retrieval via Dual-Index Fusion
- DICE: Structured Reasoning in LLMs through SLM-Guided Chain-of-Thought Correction
- CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts
- Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic Evaluation
- TripScore: Benchmarking and rewarding real-world travel planning with fine-grained evaluation
- MIRAGE: Runtime Scheduling for Multi-Vector Image Retrieval with Hierarchical Decomposition
- CapGeo: A Caption-Assisted Approach to Geometric Reasoning
- On the Provable Performance Guarantee of Efficient Reasoning Models
- ProxRouter: Proximity-Weighted LLM Query Routing for Improved Robustness to Outliers
- Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
- DeepPrune: Parallel Scaling without Inter-trace Redundancy
- The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
- Fewer Weights, More Problems: A Practical Attack on LLM Pruning
- OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
- Self-Improving LLM Agents at Test-Time
- SPAD: Specialized Prefill and Decode Hardware for Disaggregated LLM Inference
- From Tokens to Layers: Redefining Stall-Free Scheduling for MoE Serving with Layered Prefill
- When to Reason: Semantic Router for vLLM
- Haystack Engineering: Context Engineering for Heterogeneous and Agentic Long-Context Evaluation
- Reasoning for Hierarchical Text Classification: The Case of Patents
- Opt-ICL at LeWiDi-2025: Maximizing In-Context Signal from Rater Examples via Meta-Learning
- VRPAgent: LLM-Driven Discovery of Heuristic Operators for Vehicle Routing Problems
- OpenJAI-v1.0: An Open Thai Large Language Model
- Experiential Reinforcement Learning
- Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
- TetriServe: Efficiently Serving Mixed DiT Workloads
- Executable Counterfactuals: Improving LLMs' Causal Reasoning Through Code
- Study on LLMs for Promptagator-Style Dense Retriever Training
- XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation
- Rethinking KL Regularization in RLHF: From Value Estimation to Gradient Optimization
- On the Role of Temperature Sampling in Test-Time Scaling
- What MLLMs Learn about When they Learn about Multimodal Reasoning
- LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference
- POME: Post Optimization Model Edit via Muon-style Projection
- OWL: Overcoming Window Length-Dependence in Speculative Decoding for Long-Context Inputs
- Expanding the Action Space of LLMs to Reason Beyond Language
- GAZE:Governance-Aware pre-annotation for Zero-shot World Model Environments
- FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering
- Instructional Goal-Aligned Question Generation for Student Evaluation in Virtual Lab Settings: How Closely Do LLMs Actually Align?
- Training Dynamics Impact Post-Training Quantization Robustness
- VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
- SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence Generation
- RoSE: Round-robin Synthetic Data Evaluation for Selecting LLM Generators without Human Test Sets
- CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credits
- lm-Meter: Unveiling Runtime Inference Latency for On-Device Language Models
- ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models
- The Anatomy of a Triton Attention Kernel
- On the Sensitivity of Instruction-tuned LLMs to Harmful Sentences in Long Inputs
- On the Role of Difficult Prompts in Self-Play Preference Optimization
- MixReasoning: Switching Modes to Think
- When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL
- Staircase Streaming for Low-Latency Multi-Agent Inference
- Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages
- Stratum: System-Hardware Co-Design with Tiered Monolithic 3D-Stackable DRAM for Efficient MoE Serving
- Reinforcement Learning for Clinical Reasoning: Aligning LLMs with ACR Imaging Appropriateness Criteria
- Exploring OCR-augmented Generation for Bilingual VQA
- Transformers Discover Molecular Structure Without Graph Priors
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- When Models Lie, We Learn: Multilingual Span-Level Hallucination Detection with PsiloQA
- Multilingual Routing in Mixture-of-Experts
- AlphaApollo: A System for Deep Agentic Reasoning
- Pushing on Multilingual Reasoning Models with Language-Mixed Chain-of-Thought
- PatternKV: Flattening KV Representation Expands Quantization Headroom
- Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs
- SPOGW: a Score-based Preference Optimization method via Group-Wise comparison for workflows
- Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
- Toward a unified framework for data-efficient evaluation of large language models
- Distilling Reasoning into Student LLMs: Local Naturalness for Selecting Teacher Data
- Evaluation of Clinical Trials Reporting Quality using Large Language Models
- Doctor-R1: Mastering Clinical Inquiry with Experiential Agentic Reinforcement Learning
- Exact Causal Attention with 10% Fewer Operations
- An Early Exploration of Deep-Learning-Driven Prefetching for Far Memory
- AgentRL: Scaling Agentic Reinforcement Learning with a Multi-Turn, Multi-Task Framework
- Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images
- Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation
- SATER: A Self-Aware and Token-Efficient Approach to Routing and Cascading
- Round-trip Reinforcement Learning: Self-Consistent Training for Better Chemical LLMs
- AudioToolAgent: An Agentic Framework for Audio-Language Models
- TokenFlow: Responsive LLM Text Streaming Serving under Request Burst via Preemptive Scheduling
- GRAD: Generative Retrieval-Aligned Demonstration Sampler for Efficient Few-Shot Reasoning
- Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?
- mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
- GEM: A Gym for Agentic LLMs
- QUASAR: Quantum Assembly Code Generation Using Tool-Augmented LLMs via Agentic RL
- When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
- Rethinking Reward Models for Multi-Domain Test-Time Scaling
- Automated Structured Radiology Report Generation with Rich Clinical Context
- In-Place Feedback: Reliable Refinement for Multi-Turn Expert-LLM Collaboration
- Beyond Majority Voting: LLM Aggregation by Leveraging Higher-Order Information
- Prompt Curriculum Learning for Efficient LLM Post-Training
- ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models
- HiSpec: Hierarchical Speculative Decoding for LLMs
- On The Fragility of Benchmark Contamination Detection in Reasoning Models
- BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
- AgentFlux: Decoupled Fine-Tuning & Inference for On-Device Agentic Systems
- Attention as a Compass: Efficient Exploration for Process-Supervised RL in Reasoning Models
- Recursive Self-Aggregation Unlocks Deep Thinking in Large Language Models
- DeepScientist: Advancing Frontier-Pushing Scientific Findings Progressively
- Rearchitecting Datacenter Lifecycle for AI: A TCO-Driven Framework
- Entropy After ⟨
/Think ⟩ for reasoning model early exiting - SCUBA: Salesforce Computer Use Benchmark
- Efficient and Transferable Agentic Knowledge Graph RAG via Reinforcement Learning
- Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
- Parallax: Efficient LLM Inference Service over Decentralized Environment
- Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
- Vocabulary Customization for Efficient Domain-Specific LLM Deployment
- CoLLM-NAS: Collaborative Large Language Models for Efficient Knowledge-Guided Neural Architecture Search
- RAGferee: Building Contextual Reward Models for Retrieval-Augmented Generation
- Accelerating LLM Inference with Precomputed Query Storage
- PerQ: Efficient Evaluation of Multilingual Text Personalization Quality
- SAIL: SRAM-Accelerated LLM Inference System with Lookup-Table-based GEMV
- Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
- Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling
- OPPO: Accelerating PPO-based RLHF via Pipeline Overlap
- TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
- Think Less, Label Better: Multi-Stage Domain-Grounded Synthetic Data Generation for Fine-Tuning Large Language Models in Telecommunications
- Nudging the Boundaries of LLM Reasoning
- LLM-Based Multi-Agent Blackboard System for Information Discovery in Data Science
- RouterArena: An Open Platform for Comprehensive Comparison of LLM Routers
- Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks
- RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs
- EasySteer: A Unified Framework for High-Performance and Extensible LLM Steering
- Scaling Synthetic Task Generation for Agents via Exploration
- GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference
- CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning
- Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
- Intra-request branch orchestration for efficient LLM reasoning
- When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training
- SemShareKV: Efficient KVCache Sharing for Semantically Similar Prompts via Token-Level LSH Matching
- Fidel-TS: A High-Fidelity Benchmark for Multimodal Time Series Forecasting
- SparseServe: Unlocking Parallelism for Dynamic Sparse Attention in Long-Context LLM Serving
- AdaThink-Med: Optimizing Inference-Time Compute for Medical Reasoning via Uncertainty Quantification
- GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners
- Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention
- RServe: Overlapping Encoding and Prefill for Efficient LMM Inference
- Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models
- SpecExit: Accelerating Large Reasoning Model via Speculative Exit
- ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
- VIVA+: Human-Centered Situational Decision-Making
- From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing
- Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards
- Reasoning or Retrieval? A Study of Answer Attribution on Large Reasoning Models
- PIPer: On-Device Environment Setup via Online Reinforcement Learning
- MACE: A Hybrid LLM Serving System with Colocated SLO-aware Continuous Retraining Alignment
- Zero-Waiting Load Balancing with Heterogeneous Servers in Heavy Traffic
- Beyond the Exploration-Exploitation Trade-off: A Hidden State Approach for LLM Reasoning in RLVR
- GUI-Shepherd: Reliable Process Reward and Verification for Long-Sequence GUI Tasks
- SafeSearch: Automated Red-Teaming for the Safety of LLM-Based Search Agents
- Evaluating Program Semantics Reasoning with Type Inference in System F
- PreScope: Unleashing the Power of Prefetching for Resource-Constrained MoE Inference
- Pretraining Scaling Laws for Generative Evaluations of Language Models
- CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems
- Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation
- Mapping Overlaps in Benchmarks through Perplexity in the Wild
- A Predictive and Synergistic Two-Layer Scheduling Framework for LLM Serving
- DentVLM: A Multimodal Vision-Language Model for Comprehensive Dental Diagnosis and Enhanced Clinical Practice
- SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts
- Leave No Observation Behind: Real-time Correction for VLA Action Chunks
- Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
- Hilbert: Recursively Building Formal Proofs with Informal Reasoning
- EditGRPO: Reinforcement Learning with Post-Rollout Edits for Clinically Accurate Chest X-Ray Report Generation
- Language Models Can Learn from Verbal Feedback Without Scalar Rewards
- Variational Reasoning for Language Models
- Beyond statistical significance: Quantifying uncertainty and statistical variability in multilingual and multitask NLP evaluation
- Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning
- Dynamic Experts Search: Enhancing Reasoning in Mixture-of-Experts LLMs at Test Time
- Boosting Pointer Analysis With LLM-Enhanced Allocation Function Detection
- Estimating the Empowerment of Language Model Agents
- FormalML: A Benchmark for Evaluating Formal Subgoal Completion in Machine Learning Theory
- InfiMed-Foundation: Pioneering Advanced Multimodal Medical Models with Compute-Efficient Pre-Training and Multi-Stage Fine-Tuning
- MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
- SK2Decompile: LLM-based Two-Phase Binary Decompilation from Skeleton to Skin
- S2J: Bridging the Gap Between Solving and Judging Ability in Generative Reward Models
- ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
- RISK: A Framework for GUI Agents in E-commerce Risk Management
- Think Smart, Not Hard: Difficulty Adaptive Reasoning for Large Audio Language Models
- AgentPack: A Dataset of Code Changes, Co-Authored by Agents and Humans
- Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
- RobustFlow: Towards Robust Agentic Workflow Generation
- Training-Free Multimodal Deepfake Detection via Graph Reasoning
- Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval
- The Bias is in the Details: An Assessment of Cognitive Bias in LLMs
- Semantic F1 Scores: Fair Evaluation Under Fuzzy Class Boundaries
- Learning GUI Grounding with Spatial Reasoning from Visual Feedback
- VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
- Nova: Real-Time Agentic Vision-Language Model Serving with Adaptive Cross-Stage Parallelization
- VC-Agent: An Interactive Agent for Customized Video Dataset Collection
- MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources
- Un-Doubling Diffusion: LLM-guided Disambiguation of Homonym Duplication
- Toward Robust and Efficient ML-Based GPU Caching for Modern Inference
- Prompt-Aware Scheduling for Low-Latency LLM Serving
- Generative AI for FFRDCs
- TyphoonMLA: A Mixed Naive-Absorb MLA Kernel For Shared Prefix
- RollPacker: Mitigating Long-Tail Rollouts for Fast, Synchronous RL Post-Training
- UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice
- When Instructions Multiply: Measuring and Estimating LLM Capabilities of Multiple Instructions Following
- Even More Kawaii than Real-Person-Driven VTubers? Understanding How Viewers Perceive AI-Driven VTubers
- ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning
- Experience Deploying Containerized GenAI Services at an HPC Center
- Automated Multi-Agent Workflows for RTL Design
- Causal Understanding by LLMs: The Role of Uncertainty
- FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
- Future Policy Aware Preference Learning for Mathematical Reasoning
- TRUEBench: Can LLM Response Meet Real-world Constraints as Productivity Assistant?
- SINAI at eRisk@CLEF 2025: Transformer-Based and Conversational Strategies for Depression Detection
- Gyges: Dynamic Cross-Instance Parallelism Transformation for Efficient LLM Inference
- Calibrated Reasoning: An Explanatory Verifier for Dynamic and Efficient Problem-Solving
- Embedding Domain Knowledge for Large Language Models via Reinforcement Learning from Augmented Generation
- Play by the Type Rules: Inferring Constraints for LLM Functions in Declarative Programs
- Are We Scaling the Right Thing? A System Perspective on Test-Time Scaling
- Advancing Speech Summarization in Multi-modal LLMs with Reinforcement Learning
- Look as You Leap: Planning Simultaneous Motion and Perception for High-DOF Robots
- Back from the Future: Key-Value Cache Management by Counter-Causal Surprise
- EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents
- SemPIC: Learning Semantic Position-Independent KV Caches
- Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale
- WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning
- Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game
- SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer
- Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO
- A Sparse Glimpse of the Whole: Train-Free Self-Speculative Decoding
- A Policy-Driven Runtime Layer for Agentic LLM Serving
- Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold
- Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset
- Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models
- Clairvoyant: Predictive Shortest-Job-First Admission for Serial LLM Inference
- KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation
- SuperThoughts: Reasoning Tokens in Superposition
- Benchmarking Open-Ended Multi-Agent Coordination in Language Agents
- Context Recycling for Long-Horizon LLM Inference
- QCalEval: Benchmarking Vision-Language Models for Quantum Calibration Plot Understanding
- How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data
- RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design
- DFlash: Block Diffusion for Flash Speculative Decoding
- GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving
- ILRe: Intermediate Layer Retrieval for Context Compression in Causal Language Models
- AtomRAG: atomic query decomposition for multi-hop retrieval-augmented generation
- Scalable Engine and the Performance of Different LLM Models in a SLURM based HPC architecture
- CompLLM: Compression for Long Context Q&A
- YAC: Bridging Natural Language and Interactive Visual Exploration with Generative AI for Biomedical Data Discovery
- Soft Tokens, Hard Truths
- PipelineRL: Faster On-policy Reinforcement Learning for Long Sequence Generation
- APRIL: Active Partial Rollouts in Reinforcement Learning to Tame Long-tail Generation
- The Ranking Blind Spot: Decision Hijacking in LLM-based Text Ranking
- Confidential LLM Inference: Performance and Cost Across CPU and GPU TEEs
- Introducing LongCat-Flash-Thinking: A Technical Report
- Investigating Test-Time Scaling with Reranking for Machine Translation
- Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
- A Multimodal Conversational Assistant for the Characterization of Agricultural Plots from Geospatial Open Data
- Disaggregated Prefill and Decoding Inference System for Large Language Model Serving on Multi-Vendor GPUs
- Correlation or Causation: Analyzing the Causal Structures of LLM and LRM Reasoning Process
- Cronus: Efficient LLM inference on Heterogeneous GPU Clusters via Partially Disaggregated Prefill
- Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
- Everyday Physics in Korean Contexts: A Culturally Grounded Physical Reasoning Benchmark
- Expert-as-a-Service: Towards Efficient, Scalable, and Robust Large-scale MoE Serving
- MapCoder-Lite: Distilling Multi-Agent Coding into a Single Small LLM
- Scaling, Simplification, and Adaptation: Lessons from Pretraining on Machine-Translated Text
- Cortex: Achieving Low-Latency, Cost-Efficient Remote Data Access For LLM via Semantic-Aware Knowledge Caching
- CFDA & CLIP at TREC iKAT 2025: Enhancing Personalized Conversational Search via Query Reformulation and Rank Fusion
- Qwen3-Omni Technical Report
- ExpertWeave: Efficiently Serving Expert-Specialized Fine-Tuned Adapters at Scale
- AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation
- ShadowServe: Interference-Free KV Cache Fetching for Distributed Prefix Caching
- Multi-level Diagnosis and Evaluation for Robust Tabular Feature Engineering with Large Language Models
- From Uniform to Heterogeneous: Tailoring Policy Optimization to Every Token's Nature
- SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning
- Advancing Reference-free Evaluation of Video Captions with Factual Analysis
- Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs
- Rethinking the Role of Text Complexity in Language Model Pretraining
- Shift Parallelism: Low-Latency, High-Throughput LLM Inference for Dynamic Workloads
- Randomized Smoothing Meets Vision-Language Models
- TradingGroup: A Multi-Agent Trading System with Self-Reflection and Data-Synthesis
- SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
- ChartMaster: Advancing Chart-to-Code Generation with Real-World Charts and Chart Similarity Reinforcement Learning
- Relevance to Utility: Process-Supervised Rewrite for RAG
- GPO: Learning from Critical Steps to Improve LLM Reasoning
- Overhearing LLM Agents: A Survey, Taxonomy, and Roadmap
- SERVAL: Surprisingly Effective Zero-Shot Visual Document Retrieval Powered by Large Vision and Language Models
- LLM-OREF: An Open Relation Extraction Framework Based on Large Language Models
- MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
- From Ground Trust to Truth: Disparities in Offensive Language Judgments on Contemporary Korean Political Discourse
- SALT4Decompile: Inferring Source-level Abstract Logic Tree for LLM-Based Binary Decompilation
- TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling
- ATTS: Asynchronous Test-Time Scaling via Conformal Prediction
- Adversarial Distilled Retrieval-Augmented Guarding Model for Online Malicious Intent Detection
- Synthetic bootstrapped pretraining
- DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards
- Mimicking the Physicist's Eye:A VLM-centric Approach for Physics Formula Discovery
- PiERN: Token-Level Routing for Integrating High-Precision Computation and Reasoning
- Latent Traits and Cross-Task Transfer: Deconstructing Dataset Interactions in LLM Fine-tuning
- Hala Technical Report: Building Arabic-Centric Instruction & Translation Models at Scale
- CodeLSI: Leveraging Foundation Models for Automated Code Generation with Low-Rank Optimization and Domain-Specific Instruction Tuning
- MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook
- Towards General Agentic Intelligence via Environment Scaling
- LATTS: Locally Adaptive Test-Time Scaling
- Scaling Up Throughput-oriented LLM Inference Applications on Heterogeneous Opportunistic GPU Clusters with Pervasive Context Management
- All Roads Lead to Rome: Graph-Based Confidence Estimation for Large Language Model Reasoning
- LLMs Can't Handle Peer Pressure: Crumbling under Multi-Agent Social Interactions
- ScaleDoc: Scaling LLM-based Predicates over Large Document Collections
- Gender-Neutral Rewriting in Italian: Models, Approaches, and Trade-offs
- AI Factories: It's time to rethink the Cloud-HPC divide
- TokenLake: A Unified Segment-level Prefix Cache Pool for Fine-grained Elastic Long-Context LLM Serving
- Reinforcement Learning enhanced Online Adaptive Clinical Decision Support via Digital Twin powered Policy and Treatment Effect optimized Reward
- The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
- BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens
- Graph-R1: Incentivizing the Zero-Shot Graph Learning Capability in LLMs via Explicit Reasoning
- FastMTP: Accelerating LLM Inference with Enhanced Multi-Token Prediction
- Biomedical Hypothesis Explainability with Graph-Based Context Retrieval
- Framing AI System Benchmarking as a Learning Task: FlexBench and the Open MLPerf Dataset
- Your Compiler is Backdooring Your Model: Understanding and Exploiting Compilation Inconsistency Vulnerabilities in Deep Learning Compilers
- Improving Table Understanding with LLMs and Entity-Oriented Search
- OpenHA: A Series of Open-Source Hierarchical Agentic Models in Minecraft
- VARCO-VISION-2.0 Technical Report
- Established Psychometric vs. Ecologically Valid Questionnaires: Rethinking Psychological Assessments in Large Language Models
- Dropping Experts, Recombining Neurons: Retraining-Free Pruning for Sparse Mixture-of-Experts LLMs
- Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
- LAVa: Layer-wise KV Cache Eviction with Dynamic Budget Allocation
- LLMs Don't Know Their Own Decision Boundaries: The Unreliability of Self-Generated Counterfactual Explanations
- Unbiased Reasoning for Knowledge-Intensive Tasks in Large Language Models via Conditional Front-Door Adjustment
- Clip Your Sequences Fairly: Enforcing Length Fairness for Sequence-Level RL
- Gradient-Attention Guided Dual-Masking Synergetic Framework for Robust Text-based Person Retrieval
- Benchmarking Energy Efficiency of Large Language Models Using vLLM
- Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism
- Mitigating Catastrophic Forgetting in Large Language Models with Forgetting-aware Pruning
- Building Large-Scale English-Romanian Literary Translation Resources with Open Models
- TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
- LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction
- Verbalized Algorithms: Classical Algorithms are All You Need (Mostly)
- Astra: A Multi-Agent System for GPU Kernel Performance Optimization
- DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance
- Toward Purpose-oriented Topic Model Evaluation enabled by Large Language Models
- COMPACT: Common-token Optimized Model Pruning Across Channels and Tokens
- RAFFLES: Reasoning-based Attribution of Faults for LLM Systems
- VehicleWorld: A Highly Integrated Multi-Device Environment for Intelligent Vehicle Interaction
- Ban&Pick: Ehancing Performance and Efficiency of MoE-LLMs via Smarter Routing
- FineServe: Precision-Aware KV Slab and Two-Level Scheduling for Heterogeneous Precision LLM Serving
- MaaSO: SLO-aware Orchestration of Heterogeneous Model Instances for MaaS
- IPR: Intelligent Prompt Routing with User-Controlled Quality-Cost Trade-offs
- Murakkab: Resource-Efficient Agentic Workflow Orchestration in Cloud Platforms
- From Long to Short: LLMs Excel at Trimming Own Reasoning Chains
- Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation
- Self-Aligned Reward: Towards Effective and Efficient Reasoners
- PLaMo 2 Technical Report
- VoltanaLLM: Energy-Efficient and SLO-Aware Disaggregated LLM Serving via Adaptive Frequency Control and State-Space Routing
- KVCompose: Efficient Structured KV Cache Compression with Composite Tokens
- Memorization ≠ Understanding: Do Large Language Models Have the Ability of Scenario Cognition?
- SpikingBrain: Spiking Brain-inspired Large Models
- PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
- MAGneT: Coordinated Multi-Agent Generation of Synthetic Multi-Turn Mental Health Counseling Sessions
- LibriQuote: A Speech Dataset of Fictional Character Utterances for Expressive Zero-Shot Speech Synthesis
- D-LiFT: Improving LLM-based Decompiler Backend via Code Quality-driven Fine-tuning
- GreenLLM: SLO-Aware Dynamic Frequency Scaling for Energy-Efficient LLM Serving
- Code Like Humans: A Multi-Agent Solution for Medical Coding
- Cetvel: A Unified Benchmark for Evaluating Language Understanding, Generation and Cultural Capacity of LLMs for Turkish
- Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents
- Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
- MoPEQ: Mixture of Mixed Precision Quantized Experts
- Scalable hybrid quantum Monte Carlo simulation of U(1) gauge field coupled to fermions on GPU
- Attributes as Textual Genes: Leveraging LLMs as Genetic Algorithm Simulators for Conditional Synthetic Data Generation
- LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference
- Batch Query Processing and Optimization for Agentic Workflows
- ProST: Progressive Sub-task Training for Pareto-Optimal Multi-agent Systems Using Small Language Models
- Jointly Reinforcing Diversity and Quality in Language Model Generations
- Baichuan-M2: Scaling Medical Capability with Large Verifier System
- Bridging the Gap in Ophthalmic AI: MM-Retinal-Reason Dataset and OphthaReason Model toward Dynamic Multimodal Reasoning
- Learned Hallucination Detection in Black-Box LLMs using Token-level Entropy Production Rate
- CYCLE-INSTRUCT: Fully Seed-Free Instruction Tuning via Dual Self-Training and Cycle Consistency
- ABCD-LINK: Annotation Bootstrapping for Cross-Document Fine-Grained Links
- KoBLEX: Open Legal Question Answering with Multi-hop Reasoning
- LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving
- DaMoC: Efficiently Selecting the Optimal Large Language Model for Fine-tuning Domain Tasks Based on Data and Model Compression
- Natural Context Drift Undermines the Natural Language Understanding of Large Language Models
- FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games
- Street-Level Geolocalization Using Multimodal Large Language Models and Retrieval-Augmented Generation
- GPT-OSS-20B: A Comprehensive Deployment-Centric Analysis of OpenAI's Open-Weight Mixture of Experts Model
- DPF-CM: A Data Processing Framework with Privacy-Preserving Vector Databases for Chinese Medical LLMs Training and Deployment
- DSDE: Dynamic Speculative Decoding with KLD Stability for Real-World Serving
- Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
- The Good, the Bad and the Constructive: Automatically Measuring Peer Review's Utility for Authors
- KVComp: A High-Performance, LLM-Aware, Lossy Compression Framework for KV Cache
- If We May De-Presuppose: Robustly Verifying Claims through Presupposition-Free Question Decomposition
- When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment
- ParaThinker: Native Parallel Thinking as a New Paradigm to Scale LLM Test-time Compute
- Scalable Option Learning in High-Throughput Environments
- FlexLink: Boosting your NVLink Bandwidth by 27% without accuracy concern
- Democratizing Agentic AI with Fast Test-Time Scaling on the Edge
- Do Cognitively Interpretable Reasoning Traces Improve LLM Performance?
- Automated Clinical Problem Detection from SOAP Notes using a Collaborative Multi-Agent LLM Architecture
- PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains
- Stairway to Fairness: Connecting Group and Individual Fairness
- Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning
- Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
- AI Compute Architecture and Evolution Trends
- The Complexity Trap: Simple Observation Masking Is as Efficient as LLM Summarization for Agent Context Management
- MOSAIC: A Multilingual, Taxonomy-Agnostic, and Computationally Efficient Approach for Radiological Report Classification
- Accelerating Mixture-of-Experts Inference by Hiding Offloading Latency with Speculative Decoding
- Improving Aviation Safety Analysis: Automated HFACS Classification Using Reinforcement Learning with Group Relative Policy Optimization
- HyperFlexis: Joint Design of Algorithms and Systems for Multi-SLO Serving and Fast Scaling
- Evaluating Structured Decoding for Text-to-Table Generation: Evidence from Three Datasets
- MSRS: Evaluating Multi-Source Retrieval-Augmented Generation
- Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
- AWorld: Orchestrating the Training Recipe for Agentic AI
- Revealing Potential Biases in LLM-Based Recommender Systems in the Cold Start Setting
- End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning
- AdaptCache: KV Cache Native Storage Hierarchy for Low-Delay and High-Quality Language Model Serving
- TinyServe: Query-Aware Cache Selection for Efficient LLM Serving
- cMALC-D: Contextual Multi-Agent LLM-Guided Curriculum Learning with Diversity-Based Context Blending
- DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis
- SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control
- HEAL: A Hypothesis-Based Preference-Aware Analysis Framework
- Secure Multi-LLM Agentic AI and Agentification for Edge General Intelligence by Zero-Trust: A Survey
- Analysing Chain of Thought Dynamics: Active Guidance or Unfaithful Post-hoc Rationalisation?
- Principled Personas: Defining and Measuring the Intended Effects of Persona Prompting on Task Performance
- Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference
- Alignment with Fill-In-the-Middle for Enhancing Code Generation
- Improving Low-Resource Translation with Dictionary-Guided Fine-Tuning and RL: A Spanish-to-Wayuunaiki Study
- Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies
- HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference
- LongReasonArena: A Long Reasoning Benchmark for Large Language Models
- Demystifying Scientific Problem-Solving in LLMs by Probing Knowledge and Reasoning
- ClusterFusion: Expanding Operator Fusion Scope for LLM Inference via Cluster-Level Collective Primitive
- Strata: Hierarchical Context Caching for Long Context Language Model Serving
- Rethinking Caching for LLM Serving Systems: Beyond Traditional Heuristics
- History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL
- Hermes 4 Technical Report
- FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel
- SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models
- How Quantization Shapes Bias in Large Language Models
- SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
- Position Bias Mitigates Position Bias:Mitigate Position Bias Through Inter-Position Knowledge Distillation
- Transduction is All You Need for Structured Data Workflows
- Correctness-Guaranteed Code Generation via Constrained Decoding
- PepThink-R1: LLM for Interpretable Cyclic Peptide Optimization with CoT SFT and Reinforcement Learning
- MoEcho: Exploiting Side-Channel Attacks to Compromise User Privacy in Mixture-of-Experts LLMs
- Powering Job Search at Scale: LLM-Enhanced Query Understanding in Job Matching Systems
- A Distributed Learned Hash Table
- InPars+: Supercharging Synthetic Data Generation for Information Retrieval Systems
- Equinox: Holistic Fair Scheduling in Serving Large Language Models
- ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs
- Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR
- Datarus-R1: An Adaptive Multi-Step Reasoning LLM for Automated Data Analysis
- Stands to Reason: Investigating the Effect of Reasoning on Idiomaticity Detection
- X-MoE: Enabling Scalable Training for Emerging Mixture-of-Experts Architectures on HPC Platforms
- Mitigating Hallucinations in Large Language Models via Causal Reasoning
- STEM: Efficient Relative Capability Evaluation of LLMs through Structured Transition Samples
- AgentMental: An Interactive Multi-Agent Framework for Explainable and Adaptive Mental Health Assessment
- SeamlessFlow: A Trainer Agent Isolation RL Framework Achieving Bubble-Free Pipelines via Tag Scheduling
- AI Agentic Programming: A Survey of Techniques, Challenges, and Opportunities
- DistFlow: A Fully Distributed RL Framework for Scalable and Efficient LLM Post-Training
- Searching for Privacy Risks in LLM Agents via Simulation
- EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
- Dataset Construction for Training LLM to Learn Analog Circuit Knowledge
- Meta-Metrics and Best Practices for System-Level Inference Performance Benchmarking
- Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization
- Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
- Amazon Nova AI Challenge -- Trusted AI: Advancing secure, AI-assisted software development
- LLMC+: Benchmarking Vision-Language Model Compression with a Plug-and-play Toolkit
- Teaching LLMs to Speak Spectroscopy
- Slow Tuning and Low-Entropy Masking for Safe Chain-of-Thought Distillation
- The Surprising Effectiveness of Membership Inference with Simple N-Gram Coverage
- NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
- Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
- CodeGrad: Integrating Multi-Step Verification with Gradient-Based LLM Refinement
- READER: Retrieval-Assisted Drafter for Efficient LLM Inference
- Compass-Thinker-7B Technical Report
- ASPD: Unlocking Adaptive Serial-Parallel Decoding by Exploring Intrinsic Parallelism in LLMs
- TopXGen: Topic-Diverse Parallel Data Generation for Low-Resource Machine Translation
- KG-o1: Enhancing Multi-hop Question Answering in Large Language Models via Knowledge Graph Integration
- MiGrATe: Mixed-Policy GRPO for Adaptation at Test-Time
- CPO: Addressing Reward Ambiguity in Role-playing Dialogue via Comparative Policy Optimization
- Profiling Large Language Model Inference on Apple Silicon: A Quantization Perspective
- Retrospective Sparse Attention for Efficient Long-Context Generation
- Towards Efficient and Practical GPU Multitasking in the Era of LLM
- Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions
- WeChat-YATT: A Scalable, Simple, Efficient, and Production Ready Training Library
- A Data-driven ML Approach for Maximizing Performance in LLM-Adapter Serving
- Semantic Caching for Low-Cost LLM Serving: From Offline Learning to Online Adaptation
- ThinkTuning: Instilling Cognitive Reflections without Distillation
- MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
- Selective KV-Cache Sharing to Mitigate Timing Side-Channels in LLM Inference
- Enhancing Small LLM Alignment through Margin-Based Objective Modifications under Resource Constraints
- CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation
- Dynamic Benchmark Construction for Evaluating Large Language Models on Real-World Codes
- Schema Lineage Extraction at Scale: Multilingual Pipelines, Composite Evaluation, and Language-Model Benchmarks
- ALOPE: Adaptive Layer Optimization for Translation Quality Estimation using Large Language Models
- PrLM: Learning Explicit Reasoning for Personalized RAG via Contrastive Reward Optimization
- Pushing the Envelope of LLM Inference on AI-PC
- Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models
- Multimodal learning with next-token prediction for large multimodal models
- What Builds Effective In-Context Examples for Code Generation?
- LLM-based Co-Evolution of Configurable Software Systems
- Meta-Learning for Speeding Up Large Model Inference in Decentralized Environments
- LLM Serving Optimization with Variable Prefill and Decode Lengths
- Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future
- Devstral: Fine-tuning Language Models for Coding Agent Applications
- Mediator-Guided Multi-Agent Collaboration among Open-Source Models for Medical Decision-Making
- Impact-driven Context Filtering For Cross-file Code Completion
- Pruning the Unsurprising: Efficient LLM Reasoning via First-Token Surprisal
- Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
- ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking
- Aligning LLMs on a Budget: Inference-Time Alignment with Heuristic Reward Models
- Attention Basin: Why Contextual Position Matters in Large Language Models
- Decoupling Understanding from Reasoning via Problem Space Mapping for Small-Scale Model Reasoning
- Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment
- Persistent Instability in LLM's Personality Measurements: Effects of Scale, Reasoning, and Conversation History
- Multi-module GRPO: Composing Policy Gradients and Prompt Optimization for Language Model Programs
- IFDECORATOR: Wrapping Instruction Following Reinforcement Learning with Verifiable Rewards
- A Hierarchical Probabilistic Framework for Incremental Knowledge Tracing in Classroom Settings
- Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
- PromptAL: Sample-Aware Dynamic Soft Prompts for Few-Shot Active Learning
- Accelerating Scientific Discovery with Multi-Document Summarization of Impact-Ranked Papers
- An Entity Linking Agent for Question Answering
- CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward
- Agent Lightning: Train ANY AI Agents with Reinforcement Learning
- Block: Balancing Load in LLM Serving with Context, Knowledge and Predictive Scheduling
- FilBench: Can LLMs Understand and Generate Filipino?
- Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning
- Frontier: Simulating the Next Generation of LLM Inference Systems
- Toward a Trustworthy Optimization Modeling Agent via Verifiable Synthetic Data Generation
- Survey of Large Language Models in Extended Reality: Technical Paradigms and Application Frontiers
- Mamba-X: An End-to-End Vision Mamba Accelerator for Edge Computing Devices
- CTTS: Collective Test-Time Scaling
- Huawei Cloud Model-as-a-Service on the CloudMatrix384 SuperPod
- NaviMaster: Learning a Unified Policy for GUI and Embodied Navigation Tasks
- Prefill-Decode Aggregation or Disaggregation? Unifying Both for Goodput-Optimized LLM Serving
- MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
- ReflecSched: Solving Dynamic Flexible Job-Shop Scheduling via LLM-Powered Hierarchical Reflection
- AGFT: An Adaptive GPU Frequency Tuner for Real-Time LLM Inference Optimization
- CoCoA: Collaborative Chain-of-Agents for Parametric-Retrieved Knowledge Synergy
- ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
- TorchAO: PyTorch-Native Training-to-Serving Model Optimization
- WarriorMath: Enhancing the Mathematical Ability of Large Language Models with a Defect-aware Framework
- The Promise of RL for Autoregressive Image Editing
- Optimal Scheduling Algorithms for LLM Inference: Theory and Practice
- GLiDRE: Generalist Lightweight model for Document-level Relation Extraction
- VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
- MELAC: Massive Evaluation of Large Language Models with Alignment of Culture in Persian Language
- Quality-of-Service Aware LLM Routing for Edge Computing with Multiple Experts
- ITDR: An Instruction Tuning Dataset for Enhancing Large Language Models in Recommendations
- EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes
- CoT-Self-Instruct: Building high-quality synthetic prompts for reasoning and non-reasoning tasks
- BAR Conjecture: the Feasibility of Inference Budget-Constrained LLM Services with Authenticity and Reasoning
- Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR
- OASIS: Outlier-Aware LUT-Based GEMM with Dual-Side Quantization for LLM Inference Acceleration
- Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning
- From Sufficiency to Reflection: Reinforcement-Guided Thinking Quality in Retrieval-Augmented Reasoning for LLMs
- BigTokDetect: A Clinically-Informed Vision-Language Modeling Framework for Detecting Pro-Bigorexia Videos on TikTok
- NeedleChain: Measuring Intact Long-Context Reasoning Capability of Large Language Models
- Hierarchical Verification of Speculative Beams for Accelerating LLM Inference
- VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
- G-Core: A Simple, Scalable and Balanced RLHF Trainer
- Trade-offs in Image Generation: How Do Different Dimensions Interact?
- Who's important? -- SUnSET: Synergistic Understanding of Stakeholder, Events and Time for Timeline Generation
- HRIPBench: Benchmarking LLMs in Harm Reduction Information Provision to Support People Who Use Drugs
- AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models
- Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models
- TriangleMix: Accelerating Prefilling via Decoding-time Contribution Sparsity
- MemShare: Memory Efficient Inference for Large Reasoning Models through KV Cache Reuse
- UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding
- LeMix: Unified Scheduling for LLM Training and Inference on Multi-GPU Systems
- ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts
- Enhancing Project-Specific Code Completion by Inferring Internal API Information
- Latent Inter-User Difference Modeling for LLM Personalization
- Multilingual Self-Taught Faithfulness Evaluators
- Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
- STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
- Metaphor and Large Language Models: When Surface Features Matter More than Deep Understanding
- RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
- SGPO: Self-Generated Preference Optimization based on Self-Improver
- Motion-example-controlled Co-speech Gesture Generation Leveraging Large Language Models
- Efficient Routing of Inference Requests across LLM Instances in Cloud-Edge Computing
- Efficient and Scalable Agentic AI with Heterogeneous Systems
- VLQA: The First Comprehensive, Large, and High-Quality Vietnamese Dataset for Legal Question Answering
- RoD-TAL: A Benchmark for Answering Questions in Romanian Driving License Exams
- Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes
- SelfRACG: Enabling LLMs to Self-Express and Retrieve for Code Generation
- Mitigating Geospatial Knowledge Hallucination in Large Language Models: Benchmarking and Dynamic Factuality Aligning
- Step-3 is Large yet Affordable: Model-system Co-design for Cost-effective Decoding
- Innovator: Scientific Continued Pretraining with Fine-grained MoE Upcycling
- Cloud Native System for LLM Inference Serving
- Unlock the Potential of Fine-grained LLM Serving via Dynamic Module Scaling
- Predictive Scaling Laws for Efficient GRPO Training of Large Reasoning Models
- MobileUse: A GUI Agent with Hierarchical Reflection for Autonomous Mobile Operation
- Technical Report of TeleChat2, TeleChat2.5 and T1
- System Report for CCL25-Eval Task 10: SRAG-MAV for Fine-Grained Chinese Hate Speech Recognition
- Checklists Are Better Than Reward Models For Aligning Language Models
- AQuilt: Weaving Logic and Self-Inspection into Low-Cost, High-Relevance Data Synthesis for Specialist LLMs
- The Invisible Leash: Why RLVR May or May Not Escape Its Origin
- Token Reduction Is Not Cost Reduction
- CTA-Pipelining: A Latency-Oriented Spatial Scaling Method for Multi-GPU Systems
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- Mitigating Factual Hallucination in Large Reasoning Models via Mixed-Mode Advantage Regularization
- Concordia: JIT-Compiled Persistent-Kernel Checkpointing for Fault-Tolerant LLM Inference
- MUR: Momentum Uncertainty guided Reasoning for Large Language Models
- SASFT: Sparse Autoencoder-guided Supervised Finetuning to Mitigate Unexpected Code-Switching in LLMs
- The Role of Feedback Alignment in Self-Distillation
- Tangram: Unlocking Non-Uniform KV Cache Compression for Efficient Multi-turn LLM Serving
- Dense Contexts Are Hard Contexts: Lexical Density Limits Effective Context in LLMs
- Stateful Inference for Low-Latency Multi-Agent Tool Calling
- Mellum2 Technical Report
- DeltaBox: Scaling Stateful AI Agents with Millisecond-Level Sandbox Checkpoint/Rollback
- Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost
- MeMo: Memory as a Model
- Evaluating CUDA Tile for AI Workloads on Hopper and Blackwell GPUs
- VDCores: Resource Decoupled Programming and Execution for Asynchronous GPU
- SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving
- LogAct: Enabling Agentic Reliability via Shared Logs
- BusterX++: Towards Unified Cross-Modal AI-Generated Content Detection and Explanation with MLLM
- Learning to Rewrite Tool Descriptions for Reliable LLM-Agent Tool Use
- K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model
- Characterizing WebGPU Dispatch Overhead for LLM Inference Across Four GPU Vendors, Three Backends, and Three Browsers
- QiMeng-MuPa: Mutual-Supervised Learning for Sequential-to-Parallel Code Translation
- Characterizing Communication Patterns in Distributed Large Language Model Inference
- DistrAttention: An Efficient and Flexible Self-Attention Mechanism on Modern GPUs
- BrownoutServe: SLO-Aware Inference Serving under Bursty Workloads for MoE-based LLMs
- DesignLab: Designing Slides Through Iterative Detection and Correction
- BucketServe: Bucket-Based Dynamic Batching for Smart and Efficient LLM Inference Serving
- TTS-1 Technical Report
- Marcel: A Lightweight and Open-Source Conversational Agent for University Student Support
- WGRAMMAR: Leverage Prior Knowledge to Accelerate Structured Decoding
- Voice-based AI Agents: Filling the Economic Gaps in Digital Health Delivery
- Know What You Don't Know: Uncertainty Calibration of Process Reward Models
- Resa: Transparent Reasoning Models via SAEs
- VAR-MATH: Probing True Mathematical Reasoning in LLMS via Symbolic Multi-Instance Benchmarks
- RePO: Replay-Enhanced Policy Optimization
- PolyServe: Efficient Multi-SLO Serving at Scale
- Vision-and-Language Training Helps Deploy Taxonomic Knowledge but Does Not Fundamentally Alter It
- Characterizing State Space Model (SSM) and SSM-Transformer Hybrid Language Model Performance with Long Context Length
- Improving Contextual ASR via Multi-grained Fusion with Large Language Models
- Arctic Inference with Shift Parallelism: Fast and Efficient Open Source Inference System for Enterprise AI
- On-the-Fly Adaptive Distillation of Transformer to Dual-State Linear Attention
- BlockBPE: Parallel BPE Tokenization
- Flipping Against All Odds: Reducing LLM Coin Flip Bias via Verbalized Rejection Sampling
- IAM: Efficient Inference through Attention Mapping between Different-scale LLMs
- Kevin: Multi-Turn RL for Generating CUDA Kernels
- SLED: A Speculative LLM Decoding Framework for Efficient Edge Serving
- ELK: Exploring the Efficiency of Inter-core Connected AI Chips with Deep Learning Compiler Techniques
- FasTUSS: Faster Task-Aware Unified Source Separation
- Autonomous Computer Vision Development with Agentic AI
- Med-REFL: Medical Reasoning Enhancement via Self-Corrected Fine-grained Reflection
- The Curious Language Model: Strategic Test-Time Information Acquisition
- SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning
- RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling
- mSTEB: Massively Multilingual Evaluation of LLMs on Speech and Text Tasks
- SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
- KV-Latent: Dimensional-level KV Cache Reduction with Frequency-aware Rotary Positional Embedding
- Oneiros: KV Cache Optimization through Parameter Remapping for Multi-tenant LLM Serving
- Dr.Copilot: A Multi-Agent Prompt Optimized Assistant for Improving Patient-Doctor Communication in Romanian
- Evaluating Generated Commit Messages with Large Language Models
- FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
- Mixture-of-Recursions: Learning Dynamic Recursive Depths for Adaptive Token-Level Computation
- Open-Source LLMs Collaboration Beats Closed-Source LLMs: A Scalable Multi-Agent System
- Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
- Past-Future Scheduler for LLM Serving under SLA Guarantees
- Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction
- Brevity is the soul of sustainability: Characterizing LLM response lengths
- Uncovering Causal Relation Shifts in Event Sequences under Out-of-Domain Interventions
- AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions
- ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism
- Draft-based Approximate Inference for LLMs
- Ref-Long: Benchmarking the Long-context Referencing Capability of Long-context Language Models
- Fine-tuning Large Language Model for Automated Algorithm Design
- Can Group Relative Policy Optimization Improve Thai Legal Reasoning and Question Answering?
- GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO
- Scalpel vs. Hammer: GRPO Amplifies Existing Capabilities, SFT Replaces Them
- SeerAttention-R: Sparse Attention Adaptation for Long Reasoning
- Atomic-to-Compositional Generalization for Mobile Agents with A New Benchmark and Scheduling System
- HedraRAG: Coordinating LLM Generation and Database Retrieval in Heterogeneous RAG Serving
- Reinforce LLM Reasoning through Multi-Agent Reflection
- TACTIC: Translation Agents with Cognitive-Theoretic Interactive Collaboration
- OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique
- Optimizing Sequential Multi-Step Tasks with Parallel LLM Agents
- From KMMLU-Redux to KMMLU-Pro: A Professional Korean Benchmark Suite for LLM Evaluation
- Multilingual Multimodal Software Developer for Code Generation
- InferLog: Accelerating LLM Inference for Online Log Parsing via ICL-oriented Prefix Caching
- A Third Paradigm for LLM Evaluation: Dialogue Game-Based Evaluation using clembench
- The Curious Case of Factuality Finetuning: Models' Internal Beliefs Can Improve Factuality
- Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
- FaithfulRAG: Fact-Level Conflict Modeling for Context-Faithful Retrieval-Augmented Generation
- On Evaluating Performance of LLM Inference Serving Systems
- Compactor: Calibrated Query-Agnostic KV Cache Compression with Approximate Leverage Scores
- MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation
- Quantile Reward Policy Optimization: Alignment with Pointwise Regression and Exact Partition Functions
- Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers
- Studying quantization trade-offs for efficient inference deployment in machine translation
- FrugalRAG: Learning to retrieve and reason for multi-hop QA
- Characterizing LLM Kernel Access and Memory Interaction in Multi-Partition NUMA GPUs
- KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows
- Krul: Efficient State Restoration for Multi-turn Conversations with Dynamic Cross-layer KV Sharing
- Scaling RL to Long Videos
- Stable Preference Optimization: A Bilevel Approach to Catastrophic Preference Shift
- Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
- Adaptive FastOPD: Progress-Aware Rollout Horizon Expansion for Efficient On-Policy Distillation
- Investigating the Robustness of Retrieval-Augmented Generation at the Query Level
- On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness
- ixi-GEN: Efficient Industrial sLLMs through Domain Adaptive Continual Pretraining
- Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving
- From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive Optimization
- Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Multi-Domain Machine Translation
- CCQ: Convolutional Code for Extreme Low-bit Quantization in LLMs
- A Semantic Parsing Framework for End-to-End Time Normalization
- Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
- CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization
- NeoBabel: A Multilingual Open Tower for Visual Generation
- High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning
- RecRankerEval: A Flexible and Extensible Framework for Top-k LLM-based Recommendation
- DRAGOn: Designing RAG On Periodically Updated Corpus
- Agentic-R1: Distilled Dual-Strategy Reasoning
- KERAGR: Knowledge-Enhanced Retrieval-Augmented Generation for Recommendation
- HIRAG: Hierarchical-Thought Instruction-Tuning Retrieval-Augmented Generation
- Chat-Ghosting: A Comparative Study of Methods for Auto-Completion in Dialog Systems
- CogniSQL-R1-Zero: Lightweight Reinforced Reasoning for Efficient SQL Generation
- SERUM: State Extraction and Refinement for User Modeling
- Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation
- The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models
- GTA1: GUI Test-time Scaling Agent
- Steering Information Utility in Key-Value Memory for Language Model Post-Training
- Selective KV Cache Protection for Noise-Resilient LLM Inference on Analog Compute-In-Memory Systems
- ChipSeek-R1: Generating Human-Surpassing RTL with LLM via Hierarchical Reward-Driven Reinforcement Learning
- Learning Latent Reasoning Traces for Scalar Reward Models End-to-End
- Reproducing LightMem: Naive RAG Is Just as Good for Memory Management
- On the Bias of Next-Token Predictors Toward Systematically Inefficient Reasoning: A Shortest-Path Case Study
- MoLink: Distributed and Efficient Serving Framework for Large Models
- An Ontology-Guided, Deduplication-Aware Extraction Layer for Knowledge Graph Construction from Heterogeneous Documents
- AXLearn: Modular, Hardware-Agnostic Large Model Training
- Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
- SpiritRAG: A Q&A System for Religion and Spirituality in the United Nations Archive
- Autonomous Repair for Multi-Agent Systems via Monte-Carlo Tree Search
- ESSA: Evolutionary Strategies for Scalable Alignment
- Can Large Language Models Automate the Refinement of Cellular Network Specifications?
- TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models
- Ready Jurist One: Benchmarking Language Agents for Legal Intelligence in Dynamic Environments
- Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models
- WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization
- CoreCodeBench: A Configurable Multi-Scenario Repository-Level Benchmark
- Making Sense of Korean Sentences: A Comprehensive Evaluation of LLMs through KoSEnd Dataset
- DeltaServe: Host-Agnostic Co-Serving of Inference and Fine-Tuning for LLMs
- RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs
- DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training
- Controlling Thinking Speed in Reasoning Models
- Why It Hurts: Identifying the Drivers of Negative Thoughts in Emotional Support Conversations
- BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset
- MemOS: A Memory OS for AI System
- Symbiosis: Multi-Adapter Inference and Fine-Tuning
- DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain
- Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs
- HGCA: Hybrid GPU-CPU Attention for Long Context LLM Inference
- DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment
- Meta SecAlign: A Secure Foundation LLM Against Prompt Injection Attacks
- AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models
- Reflective Unit Test Generation for Precise Type Error Detection with Large Language Models
- GDC Cohort Copilot: An AI Copilot for Curating Cohorts from the Genomic Data Commons
- ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
- RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents
- Cautious Next Token Prediction
- Kwai Keye-VL Technical Report
- Tuning without Peeking: Provable Generalization Bounds and Robust LLM Post-Training
- Topology-Aware Data Movement for Disaggregated GPU Inference
- Is External Information Useful for Stance Detection with LLMs?
- EdgeLoRA: An Efficient Multi-Tenant LLM Serving System on Edge Devices
- When Safety Becomes a Vulnerability: Exploiting LLM Alignment Homogeneity for Transferable Blocking in RAG
- Stem: Rethinking Causal Information Flow in Sparse Attention
- Rethinking All Evidence: Enhancing Trustworthy Retrieval-Augmented Generation via Conflict-Driven Summarization
- Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy
- On Reasoning Strength Planning in Large Reasoning Models
- A Hierarchical and Evolvable Benchmark for Fine-Grained Code Instruction Following with Multi-Turn Feedback
- Towards the Holographic Characteristic of LLMs for Efficient Short-text Generation
- Serving LLMs in HPC Clusters: A Comparative Study of Qualcomm Cloud AI 100 Ultra and NVIDIA Data Center GPUs
- Towards Resource-Efficient Serverless LLM Inference with SLINFER
- SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
- Ella: Embodied Social Agents with Lifelong Memory
- IMPACT: Inflectional Morphology Probes Across Complex Typologies
- QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA
- Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
- ATGen: A Framework for Active Text Generation
- AURA: Agent for Understanding, Reasoning, and Automated Tool Use in Voice-Driven Tasks
- MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning
- Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models
- Not All Water Consumption Is Equal: A Water Stress Weighted Metric for Sustainable Computing
- Seg-R1: Segmentation Can Be Surprisingly Simple with Reinforcement Learning
- Lost at the Beginning of Reasoning
- R1-Track: Direct Application of MLLMs to Visual Object Tracking via Reinforcement Learning
- SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference
- Through the Valley: Path to Effective Long CoT Training for Small Language Models
- Layer Importance for Mathematical Reasoning is Forged in Pre-Training and Invariant after Post-Training
- A Survey of LLM Inference Systems
- SEEA-R1: Tree-Structured Reinforcement Fine-Tuning for Self-Evolving Embodied Agents
- Coordinating Search-Informed Reasoning and Reasoning-Guided Search in Claim Verification
- Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions
- Explicit Preference Optimization: No Need for an Implicit Reward Model
- Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance
- DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
- Enhancing LLM Tool Use with High-quality Instruction Data from Knowledge Graph
- Bridging Offline and Online Reinforcement Learning for LLMs
- Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
- Double-Checker: Enhancing Reasoning of Slow-Thinking LLMs via Self-Critical Fine-Tuning
- π-CoT: Prolog-Initialized Chain-of-Thought Prompting for Multi-Hop Question-Answering
- When Life Gives You Samples: The Benefits of Scaling up Inference Compute for Multilingual LLMs
- The Decrypto Benchmark for Multi-Agent Reasoning and Theory of Mind
- MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts
- Fine-grained Token Allocation Via Operation Pruning for Efficient MLLMs
- Scaling Speculative Decoding with Lookahead Reasoning
- Adaptive Request Scheduling for CodeLLM Serving with SLA Guarantees
- Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction
- MNN-AECS: Energy Optimization for LLM Decoding on Mobile Devices via Adaptive Core Selection
- Prover Agent: An Agent-Based Framework for Formal Mathematical Proofs
- Why Do Open-Source LLMs Struggle with Data Analysis? A Systematic Empirical Study
- Controlled Retrieval-augmented Context Evaluation for Long-form RAG
- Real-Time Execution of Action Chunking Flow Policies
- HiMA-Ecom: Enabling Joint Training of Hierarchical Multi-Agent E-commerce Assistants
- SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
- ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation
- Context-Aware CodeLLM Eviction for AI-assisted Coding
- PARALLELPROMPT: Extracting Parallelism from Large Language Model Queries
- Harnessing the Power of Reinforcement Learning for Language-Model-Based Information Retriever via Query-Document Co-Augmentation
- A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models
- AViLA: Asynchronous Vision-Language Agent for Streaming Multimodal Data Interaction
- Worst-Case Symbolic Constraints Analysis and Generalisation with Large Language Models
- TIM: A Large-Scale Dataset and large Timeline Intelligence Model for Open-domain Timeline Summarization
- GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning
- AutoSDT: Scaling Data-Driven Discovery Tasks Toward Open Co-Scientists
- Exploring the Impact of Temperature on Large Language Models:Hot or Cold?
- Bayesian Social Deduction with Graph-Informed Language Models
- Resource-Friendly Dynamic Enhancement Chain for Multi-Hop Question Answering
- VeriLocc: End-to-End Cross-Architecture Register Allocation via LLM
- Fast ECoT: Efficient Embodied Chain-of-Thought via Thoughts Reuse
- Re-Evaluating Code LLM Benchmarks Under Semantic Mutation
- Instructing Large Language Models for Low-Resource Languages: A Systematic Study for Basque
- Differentiation-Based Extraction of Proprietary Data from Fine-Tuned LLMs
- Open World Scene Graph Generation using Vision Language Models
- OJBench: A Competition Level Code Benchmark For Large Language Models
- LazyEviction: Lagged KV Eviction with Attention Pattern Observation for Efficient Long Reasoning
- ViFusion: In-Network Tensor Fusion for Scalable Video Feature Indexing
- SLR: Automated Synthesis for Scalable Logical Reasoning
- cAST: Enhancing Code Retrieval-Augmented Generation with Structural Chunking via Abstract Syntax Tree
- Exploring and Exploiting the Inherent Efficiency within Large Reasoning Models for Self-Guided Efficiency Enhancement
- Gazal-R1: Achieving State-of-the-Art Medical Reasoning with Parameter-Efficient Two-Stage Training
- PentaRAG: Large-Scale Intelligent Knowledge Retrieval for Enterprise LLM Applications
- FindingDory: A Benchmark to Evaluate Memory in Embodied Agents
- SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification
- Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers
- eLLM: Elastic Memory Management Framework for Efficient LLM Serving
- MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents
- Utility-Driven Speculative Decoding for Mixture-of-Experts
- Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding
- Paged Attention Meets FlexAttention: Unlocking Long-Context Efficiency in Deployed Inference
- Efficient Serving of LLM Applications with Probabilistic Demand Modeling
- Expectation Confirmation Preference Optimization for Multi-Turn Conversational Recommendation Agent
- Essential-Web v1.0: 24T tokens of organized web data
- Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents
- Revisiting Chain-of-Thought Prompting: Zero-shot Can Be Stronger than Few-shot
- MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application
- Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
- SeqPE: Transformer with Sequential Position Encoding
- GeometryZero: Improving Geometry Solving for LLM with Group Contrastive Policy Optimization
- Watermarking LLM-Generated Datasets in Downstream Tasks
- BOW: Training Language Models to Reason Over Plausible Next Words
- Calibrated Predictive Lower Bounds on Time-to-Unsafe-Sampling in LLMs
- Are manual annotations necessary for statutory interpretations retrieval?
- Document-Level Tabular Numerical Cross-Checking: A Coarse-to-Fine Approach
- DDiT: Dynamic Resource Allocation for Diffusion Transformer Model Serving
- StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns
- Jailbreak Transferability Emerges from Shared Representations
- Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test
- Flexible Realignment of Language Models
- Strategic Scaling of Test-Time Compute: A Bandit Learning Approach
- Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
SPECS: Faster Test-Time Scaling through Speculative Drafts- HarMoEny: Efficient Multi-GPU Inference of MoE Models
- Efficient Reasoning Through Suppression of Self-Affirmation Reflections in Large Reasoning Models
- A Rigorous Evaluation of LLM Data Generation Strategies for Low-Resource Languages
- On the Performance of LLMs for Real Estate Appraisal
- Converting Annotated Clinical Cases into Structured Case Report Forms
- Personalized LLM Decoding via Contrasting Personal Preference
- Towards Understanding the Cognitive Habits of Large Reasoning Models
- Reviving DSP for Advanced Theorem Proving in the Era of Reasoning Models
- CentroidKV: Efficient Long-Context LLM Inference via KV Cache Clustering
- TongSearch-QR: Reinforced Query Reasoning for Retrieval
- Feedback Friction: LLMs Struggle to Fully Incorporate External Feedback
- RAG+: Enhancing Retrieval-Augmented Generation with Application-Aware Reasoning
- TreeRL: LLM Reinforcement Learning with On-Policy Tree Search
- Semantic Scheduling for LLM Inference
- How Well Can Reasoning Models Identify and Recover from Unhelpful Thoughts?
- OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics
- SwiftSpec: Ultra-Low Latency LLM Decoding by Scaling Asynchronous Speculative Decoding
- Learning a Continue-Thinking Token for Enhanced Test-Time Scaling
- Improving Speech Recognition of Named Entities in Classroom Speech with LLM Revision and Phonetic-Semantic Context
- PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
- A Study on Individual Spatiotemporal Activity Generation Method Using MCP-Enhanced Chain-of-Thought Large Language Models
- Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning
- TD-Pipe: Temporally-Disaggregated Pipeline Parallelism Architecture for High-Throughput LLM Inference
- Pareto Optimal Code Generation
- Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models
- Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference
- dots.llm1 Technical Report
- BestServe: Serving Strategies with Optimal Goodput in Collocation and Disaggregation Architectures
- SPRINT: Enabling Interleaved Planning and Parallelized Execution in Reasoning Models
- Efficient Online RFT with Plug-and-Play LLM Judges: Unlocking State-of-the-Art Performance
- Saffron-1: Safety Inference Scaling
- Do LLMs Really Forget? Evaluating Unlearning with Knowledge Correlation and Confidence Awareness
- Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library
- HMVLM: Multistage Reasoning-Enhanced Vision-Language Model for Long-Tailed Driving Scenarios
- Cartridges: Lightweight and general-purpose long context representations via self-study
- Proactive Assistant Dialogue Generation from Streaming Egocentric Videos
- MLLM-CL: Continual Learning for Multimodal Large Language Models
- From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems
- DiCoRe: Enhancing Zero-shot Event Detection via Divergent-Convergent LLM Reasoning
- TreeRPO: Tree Relative Policy Optimization
- Beyond the Buzz: A Pragmatic Take on Inference Disaggregation
- Multi-Layer GRPO: Enhancing Reasoning and Self-Correction in Large Language Models
- Inference-Time Hyper-Scaling with KV Cache Compression
- Kinetics: Rethinking Test-Time Scaling Laws
- Recycling the Web: A Method to Enhance Pre-training Data Quality and Quantity for Language Models
- ScaleRTL: Scaling LLMs with Reasoning Data and Test-Time Compute for Accurate RTL Code Generation
- Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations
- Selecting Demonstrations for Many-Shot In-Context Learning via Gradient Matching
- VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
- Multi-tenant Kubernetes Use Cases for AI, Secure Computing and Data Services, and More
- Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
- Osiris: A Lightweight Open-Source Hallucination Detection System
- R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
- SOAEsV2-7B/72B: Full-Pipeline Optimization for State-Owned Enterprise LLMs via Continual Pre-Training, Domain-Progressive SFT and Distillation-Enhanced Speculative Decoding
- AOSpec: Action and Observation Co-Speculation for Low-Latency Agent Serving
- NUNA: Characterizing and Mitigating Non-Uniform Network Access in Multi-Die GPU Scale-Up Systems
- FRAME: Feedback-Refined Agent Methodology for Enhancing Medical Research Insights
- DCE-LLM: Dead Code Elimination with Large Language Models
- ConsistentChat: Building Skeleton-Guided Consistent Multi-Turn Dialogues for Large Language Models from Scratch
- Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
- RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
- The Cost of Dynamic Reasoning: Demystifying AI Agents and Test-Time Scaling from an AI Infrastructure Perspective
- RewardAnything: Generalizable Principle-Following Reward Models
- Faster MoE LLM Inference for Extremely Large Models
- Parallel CPU-GPU Execution for LLM Inference on Constrained GPUs
- Grounded Vision-Language Interpreter for Long-Horizon Bimanual Task and Motion Planning
- Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective
- ORPP: Self-Optimizing Role-playing Prompts to Enhance Language Model Capabilities
- ReSpace: Text-Driven 3D Indoor Scene Synthesis and Editing with Preference Alignment
- CLONE: Customizing LLMs for Efficient Latency-Aware Inference at the Edge
- Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
- FlySearch: Exploring how vision-language models explore
- Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation
- HATA: Trainable and Hardware-Efficient Hash-Aware Top-k Attention for Scalable Large Model Inference
- Answer Convergence as a Signal for Early Stopping in Reasoning
- STORYTELLER: An Enhanced Plot-Planning Framework for Coherent and Cohesive Story Generation
- Open-Set Living Need Prediction with Large Language Models
- Cell-o1: Training LLMs to Solve Single-Cell Reasoning Puzzles with Reinforcement Learning
- DIAMOND: An LLM-Driven Agent for Context-Aware Baseball Highlight Summarization
- A Controllable Examination for Long-Context Language Models
- From Street Views to Urban Science: Discovering Road Safety Factors with Multimodal Large Language Models
- SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis
- KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
- Contra4: Evaluating Contrastive Cross-Modal Reasoning in Audio, Video, Image, and 3D
- Incentivizing LLMs to Self-Verify Their Answers
- Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation
- Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
- CleanS2S: Single-file Framework for Proactive Speech-to-Speech Interaction
- AdaRewriter: Unleashing the Power of Prompting-based Conversational Query Reformulation via Test-Time Adaptation
- Overcoming Multi-step Complexity in Multimodal Theory-of-Mind Reasoning: A Scalable Bayesian Planner
- NavBench: Probing Multimodal Large Language Models for Embodied Navigation
- Aligning VLM Assistants with Personalized Situated Cognition
- RARE: Retrieval-Aware Robustness Evaluation for Retrieval-Augmented Generation Systems
- Assembly of Experts: Linear-time construction of the Chimera LLM variants with emergent and adaptable behaviors
- Massively Multilingual Adaptation of Large Language Models Using Bilingual Translation Data
- CodeSense: a Real-World Benchmark and Dataset for Code Semantic Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs
- Inter-Passage Verification for Multi-evidence Multi-answer QA
- Temac: Multi-Agent Collaboration for Automated Web GUI Testing
- Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning
- RMoA: Optimizing Mixture-of-Agents through Diversity Maximization and Residual Compensation
- Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning
- Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding
- CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs
- SkyWalker: A Locality-Aware Cross-Region Load Balancer for LLM Inference
- RAST: Reasoning Activation in LLMs via Small-model Transfer
- NexusSum: Hierarchical LLM Agents for Long-Form Narrative Summarization
- AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
- ProxyThinker: Test-Time Guidance through Small Visual Reasoners
- ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
- Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards
- ClinBench-HPB: A Clinical Benchmark for Evaluating LLMs in Hepato-Pancreato-Biliary Diseases
- MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning
- MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM
- EmbAdvisor: Adaptive Cache Management for Sustainable LLM Serving
- AnchorAttention: Difference-Aware Sparse Attention with Stripe Granularity
- SLOT: Structuring the Output of Large Language Models
- GSO: Challenging Software Optimization Tasks for Evaluating SWE-Agents
- Fortune: Formula-Driven Reinforcement Learning for Symbolic Table Reasoning in Language Models
- D-AR: Diffusion via Autoregressive Models
- Position: Federated Foundation Language Model Post-Training Should Focus on Open-Source Models
- BioReason: Incentivizing Multimodal Biological Reasoning within a DNA-LLM Model
- Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition
- X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains
- KVzip: Query-Agnostic KV Cache Compression with Context Reconstruction
- Augment or Not? A Comparative Study of Pure and Augmented Large Language Model Recommenders
- A Practical Approach for Building Production-Grade Conversational Agents with Workflow Graphs
- Context-Robust Knowledge Editing for Language Models
- ARC: Argument Representation and Coverage Analysis for Zero-Shot Long Document Summarization with Instruction Following LLMs
- Elicit and Enhance: Advancing Multimodal Reasoning in Medical Scenarios
- Diversity-Aware Policy Optimization for Large Language Model Reasoning
- RetroInfer: A Vector-Storage Approach for Scalable Long-Context LLM Inference
- Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism
- EL4NER: Ensemble Learning for Named Entity Recognition via Multiple Small-Parameter Large Language Models
- ToolHaystack: Stress-Testing Tool-Augmented Language Models in Realistic Long-Term Interactions
- NestedFP: High-Performance, Memory-Efficient Dual-Precision Floating Point Support for LLMs
- Speeding up Model Loading with fastsafetensors
- RAGRouter: Learning to Route Queries to Multiple Retrieval-Augmented Language Models
- Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency Optimization
- LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations
- SCORPIO: Serving the Right Requests at the Right Time for Heterogeneous SLOs in LLM Inference
- Differential Information Distribution: A Bayesian Perspective on Direct Preference Optimization
- Let's Reason Formally: Natural-Formal Hybrid Reasoning Enhances LLM's Math Capability
- LUMION: Fast Fault Recovery for ML Jobs Using Programmable Optical Fabrics
- HiLDe: Intentional Code Generation via Human-in-the-Loop Decoding
- Pangu Embedded: An Efficient Dual-system LLM Reasoner with Metacognition
- Linear Layouts: Robust Code Generation of Efficient Tensor Computation Using \mathbbF2
- Evaluating the Retrieval Robustness of Large Language Models
- MemOS: An Operating System for Memory-Augmented Generation (MAG) in Large Language Models
- When Models Reason in Your Language: Controlling Thinking Language Comes at the Cost of Accuracy
- Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
- EFIM: Efficient Serving of LLMs for Infilling Tasks with Improved KV Cache Reuse
- OWL: Probing Cross-Lingual Recall of Memorized Texts via World Literature
- Reinforcement Learning for Out-of-Distribution Reasoning in LLMs: An Empirical Study on Diagnosis-Related Group Coding
- Tevatron 2.0: Unified Document Retrieval Toolkit across Scale, Language, and Modality
- WebDancer: Towards Autonomous Information Seeking Agency
- Comprehensive Evaluation on Lexical Normalization: Boundary-Aware Approaches for Unsegmented Languages
- Enhancing Study-Level Inference from Clinical Trial Papers via Reinforcement Learning-Based Numeric Reasoning
- Mustafar: Promoting Unstructured Sparsity for KV Cache Pruning in LLM Inference
- ClaimPKG: Enhancing Claim Verification via Pseudo-Subgraph Generation with Lightweight Specialized LLM
- 360-LLaMA-Factory: Plug & Play Sequence Parallelism for Long Post-Training
- Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training
- FlashFormer: Whole-Model Kernels for Efficient Low-Batch Inference
- How Does Alignment Enhance LLMs' Multilingual Capabilities? A Language Neurons Perspective
- Who Reasons in the Large Language Models?
- EasyDistill: A Comprehensive Toolkit for Effective Knowledge Distillation of Large Language Models
- FireQ: Fast INT4-FP8 Kernel and RoPE-aware Quantization for LLM Inference Acceleration
- CogniBench: A Legal-inspired Framework and Dataset for Assessing Cognitive Faithfulness of Large Language Models
- EntroLLM: Entropy Encoded Weight Compression for Efficient Large Language Model Inference on Edge Devices
- MSEarth: A Multimodal Scientific Dataset and Benchmark for Phenomena Uncovering in Earth Science
- Long Context Scaling: Divide and Conquer via Multi-Agent Question-driven Collaboration
- InstGenIE: Generative Image Editing Made Efficient with Mask-aware Caching and Scheduling
- SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
- Reinforcing General Reasoning without Verifiers
- Thinker: Learning to Think Fast and Slow
- DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
- FlashDLM: Accelerating Diffusion Language Model Inference via Efficient KV Caching and Guided Diffusion
- DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
- Unveiling Instruction-Specific Neurons & Experts: An Analytical Framework for LLM's Instruction-Following Capabilities
- A Course Correction in Steerability Evaluation: Revealing Miscalibration and Side Effects in LLMs
- How does Misinformation Affect Large Language Model Behaviors and Preferences?
- QwT-v2: Practical, Effective and Efficient Post-Training Quantization
- Evaluating LLM Adaptation to Sociodemographic Factors: User Profile vs. Dialogue History
- Hardware-Efficient Attention for Fast Decoding
- The Mirage of Multimodality: Where Truth is Tested and Honesty Unravels
- R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing
- ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows
- DGRAG: Distributed Graph-based Retrieval-Augmented Generation in Edge-Cloud Systems
- LeCoDe: A Benchmark Dataset for Interactive Legal Consultation Dialogue Evaluation
- An Explainable Diagnostic Framework for Neurodegenerative Dementias via Reinforcement-Optimized LLM Reasoning
- FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models
- HS-STaR: Hierarchical Sampling for Self-Taught Reasoners via Difficulty Estimation and Budget Reallocation
- Incentivizing Strong Reasoning from Weak Supervision
- Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models
- Does quantization affect models' performance on long-context tasks?
- Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking
- SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents
- MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE
- Does Rationale Quality Matter? Enhancing Mental Disorder Detection via Selective Reasoning Distillation
- Can Compressed LLMs Truly Act? An Empirical Evaluation of Agentic Capabilities in LLM Compression
- OmniFall: From Staged Through Synthetic to Wild, A Unified Multi-Domain Dataset for Robust Fall Detection
- Win Fast or Lose Slow: Balancing Speed and Accuracy in Latency-Sensitive Decisions of LLMs
- MA-RAG: Multi-Agent Retrieval-Augmented Generation via Collaborative Chain-of-Thought Reasoning
- StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
- CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation
- TCP: a Benchmark for Temporal Constraint-Based Planning
- TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
- Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
- FastCache: Fast Caching for Diffusion Transformer Through Learnable Linear Approximation
- Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective
- Automated CAD Modeling Sequence Generation from Text Descriptions via Transformer-Based Large Language Models
- Lifelong Safety Alignment for Language Models
- Delving into Multilingual Ethical Bias: The MSQAD with Statistical Hypothesis Tests for Large Language Models
- ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World
- Conventional Contrastive Learning Often Falls Short: Improving Dense Retrieval with Cross-Encoder Listwise Distillation and Synthetic Data
- Effective and Efficient Context Retrieval via Partial Dependency Graph for Repository-Level Code Generation
- RankLLM: A Python Package for Reranking with LLMs
- Behavior Injection: Preparing Language Models for Reinforcement Learning
- Does Accuracy Equal Evidence? Reasoning Faithfulness under KV Cache Compression
- Energy-Efficient LLM Serving via Disaggregated Attention--FFN and Flexible Frequency Scaling
- TRAM: Enhancing Multimodal Reasoning with Trajectory-Derived Auxiliary Memory
- Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning
- MASTER: Multi-Agent Security Through Exploration of Roles and Topological Structures -- A Comprehensive Framework
- Characterizing Treatment-Context Medication Evidence Across Clinic Notes and Structured EHR Medication History
- VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning
- Steering LLM Reasoning Through Bias-Only Adaptation
- G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning
- Reducing Storage of Pretrained Neural Networks by Rate-Constrained Quantization and Entropy Coding
- Not the Dimension, the Norm: What Matters in Gradient-Free Weight Perturbation of Language Models
- Large Language Models in the Task of Automatic Validation of Text Classifier Predictions
- Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
- MedScore: Generalizable Factuality Evaluation of Free-Form Medical Answers by Domain-adapted Claim Decomposition and Verification
- MorphServe: Efficient and Workload-Aware LLM Serving via Runtime Quantized Layer Swapping and KV Cache Resizing
- Thought calibration: Efficient and confident test-time scaling
- How Many Parameters Does Your Task Really Need? Task Specific Pruning with LLM-Sieve
- QwenLong-CPRS: Towards ∞-LLMs with Dynamic Context Optimization
- Training with Pseudo-Code for Instruction Following
- Towards Revealing the Effectiveness of Small-Scale Fine-tuning in R1-style Reinforcement Learning
- VeriThinker: Learning to Verify Makes Reasoning Model Efficient
- Towards Practical Defect-Focused Automated Code Review
- Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model
- Don't Overthink it. Preferring Shorter Thinking Chains for Improved LLM Reasoning
- The Real Barrier to LLM Agent Usability is Agentic ROI
- Resolving Conflicting Evidence in Automated Fact-Checking: A Study on Retrieval-Augmented LLMs
- HorizonServe: Coordinating Request Scheduling with GPU Sharing for Omni-Model Serving
- COUNTDOWN: Contextually Sparse Activation Filtering Out Unnecessary Weights in Down Projection
- Activation Control for Efficiently Eliciting Long Chain-of-thought Ability of Language Models
- FlashForge: Ultra-Efficient Prefix-Aware Attention for LLM Decoding
- Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments
- NeUQI: Near-Optimal Uniform Quantization Parameter Initialization for Low-Bit LLMs
- Reasoning Meets Personalization: Unleashing the Potential of Large Reasoning Model for Personalized Generation
- Speechless: Speech Instruction Training Without Speech for Low Resource Languages
- NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache
- On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning
- Think or Not? Exploring Thinking Efficiency in Large Reasoning Models via an Information-Theoretic Lens
- p2-TQA: A Process-based Preference Learning Framework for Self-Improving Table Question Answering Models
- Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training
- Trinity-RFT: A General-Purpose and Unified Framework for Reinforcement Fine-Tuning of Large Language Models
- Multimodal Conversation Structure Understanding
- Dynamic Risk Assessments for Offensive Cybersecurity Agents
- DAPD: Dual-Anchored Policy Distillation
- DEL-ToM: Inference-Time Scaling for Theory-of-Mind Reasoning via Dynamic Epistemic Logic
- Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT Reasoning
- ConciseRL: Conciseness-Guided Reinforcement Learning for Efficient Reasoning Models
- ExeSQL: Self-Taught Text-to-SQL Models with Execution-Driven Bootstrapping for SQL Dialects
- Effective Reinforcement Learning for Reasoning in Language Models
- Creatively Upscaling Images with Global-Regional Priors
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs
- Mesh-RFT: Enhancing Mesh Generation via Fine-grained Reinforcement Fine-Tuning
- Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning
- TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
- PaTH Attention: Position Encoding via Accumulating Householder Transformations
- Don't "Overthink" Passage Reranking: Is Reasoning Truly Necessary?
- Do Large Language Models Excel in Complex Logical Reasoning with Formal Language?
- Latent Principle Discovery for Language Model Self-Improvement
- AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning
- UNCLE: Benchmarking Uncertainty Expressions in Long-Form Generation
- CASTILLO: Characterizing Response Length Distributions of Large Language Models
- WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning
- xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding
- NQKV: A KV Cache Quantization Scheme Based on Normal Distribution Characteristics
- Augmenting LLM Reasoning with Dynamic Notes Writing for Complex QA
- LLM-Powered AI Agent Systems and Their Applications in Industry
- QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design
- Does Synthetic Data Help Named Entity Recognition for Low-Resource Languages?
- ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay
- DecoupledESC: Enhancing Emotional Support Generation via Strategy-Response Decoupled Preference Optimization
- Training Long-Context LLMs Efficiently via Chunk-wise Optimization
- Recursive Offloading for LLM Serving in Multi-tier Networks
- MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents
- CLEAR: A Clinically-Grounded Tabular Framework for Radiology Report Evaluation
- MASLab: A Unified and Comprehensive Codebase for LLM-based Multi-Agent Systems
- OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models
- Generalizable Process Reward Models via Formally Verified Training Data
- STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs
- Any Large Language Model Can Be a Reliable Judge: Debiasing with a Reasoning-based Bias Detector
- AvatarShield: Visual Reinforcement Learning for Human-Centric Synthetic Video Detection
- TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference
- Web-Shepherd: Advancing PRMs for Reinforcing Web Agents
- NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning
- Hallucinate at the Last in Long Response Generation: A Case Study on Long Document Summarization
- Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment
- Learning to Reason via Mixture-of-Thought for Logical Reasoning
- CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation
- DEBATE, TRAIN, EVOLVE: Self Evolution of Language Model Reasoning
- RAG or Fine-tuning? A Comparative Study on LCMs-based Code Completion in Industry
- From Problem-Solving to Teaching Problem-Solving: Aligning LLMs with Pedagogy using Reinforcement Learning
- Is (Selective) Round-To-Nearest Quantization All You Need?
- When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners
- VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
- Are Vision-Language Models Safe in the Wild? A Meme-Based Benchmark Study
- PrefixPlace: Provable Prefix Key-Value Placement for Large Language Model Serving under Heterogeneous Compute and Transfer Costs
- Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches
- Bole: Efficient Tree Speculation for Hybrid-Attention Language Models
- ConvSearch-R1: Enhancing Query Reformulation for Conversational Search with Reasoning via Reinforcement Learning
- Prefilled responses enhance zero-shot detection of AI-generated images
- Advancing Multi-Agent RAG Systems with Minimalist Reinforcement Learning
- Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models
- EmoGist: Efficient In-Context Learning for Visual Emotion Understanding
- Unifying Inference-Time Planning Language Generation
- Enhancing Learned Knowledge in LoRA Adapters Through Efficient Contrastive Decoding on Ascend NPUs
- SCAN: Semantic Document Layout Analysis for Textual and Visual Retrieval-Augmented Generation
- AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Momentum
- From Reasoning to Code: GRPO Optimization for Underrepresented Languages
- Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency
- Interpretable Traces, Unexpected Outcomes: Investigating the Disconnect in Trace-Based Knowledge Distillation
- Let LRMs Break Free from Overthinking via Self-Braking Tuning
- The Energy Cost of Reasoning: Analyzing Energy Usage in LLMs with Test-time Compute
- ThinkSwitcher: When to Think Hard, When to Think Fast
- s3: You Don't Need That Much Data to Train a Search Agent via RL
- Polar Sparsity: High Throughput Batched LLM Inferencing with Scalable Contextual Sparsity
- SHARP: Synthesizing High-quality Aligned Reasoning Problems for Large Reasoning Models Reinforcement Learning
- DecIF: Improving Instruction-Following through Meta-Decomposition
- AudSemThinker: Enhancing Audio-Language Models through Reasoning over Semantics of Sound
- The Role of Visualization in LLM-Assisted Knowledge Graph Systems: Effects on User Trust, Exploration, and Workflows
- CE-LSLM: Efficient Large-Small Language Model Inference and Communication via Cloud-Edge Collaboration
- SlangDIT: Benchmarking LLMs in Interpretative Slang Translation
- Reinforcement Learning vs. Distillation: Understanding Accuracy and Capability in LLM Reasoning
- Context-Free Synthetic Data Mitigates Forgetting
- Text Generation Beyond Discrete Token Sampling
- LLMSynthor: Macro-Aligned Micro-Records Synthesis with Large Language Models
- PandaGuard: Systematic Evaluation of LLM Safety against Jailbreaking Attacks
- SkyMemory: A LEO Edge Cache for Transformer Inference Optimization and Scale Out
- R2MED: A Benchmark for Reasoning-Driven Medical Retrieval
- Reasoning Models Better Express Their Confidence
- Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting
- Can Large Language Models Really Recognize Your Name?
- J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
- Occult: Optimizing Collaborative Communication across Experts for Accelerated Parallel MoE Training and Inference
- Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning
- Transparent and Robust RAG: Adaptive-Reward Reinforcement Learning for Decision Traceability
- AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning
- Alignment-Augmented Speculative Decoding with Alignment Sampling and Conditional Verification
- LLM-KG-Bench 3.0: A Compass for SemanticTechnology Capabilities in the Ocean of LLMs
- GuRE:Generative Query REwriter for Legal Passage Retrieval
- Bias Fitting to Mitigate Length Bias of Reward Model in RLHF
- BusterX: MLLM-Powered AI-Generated Video Forgery Detection and Explanation
- HydraInfer: Hybrid Disaggregated Scheduling for Multimodal Large Language Model Serving
- Decompile-Bench: Million-Scale Binary-Source Function Pairs for Real-World Binary Decompilation
- PIM-malloc: A Fast and Scalable Dynamic Memory Allocator for Processing-In-Memory (PIM) Architectures
- Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Understanding
- CSC-SQL: Corrective Self-Consistency in Text-to-SQL via Reinforcement Learning
- Retrieval Augmented Biomedical Question Answering with Weak Question Recovery and Neural Reranking for BioASQ Task 14b
- Fractured Chain-of-Thought Reasoning
- R3: Robust Rubric-Agnostic Reward Models
- BeamClean: Language Aware Embedding Reconstruction
- Optimizing Anytime Reasoning via Budget Relative Policy Optimization
- Sandwich: Joint Configuration Search and Hot-Switching for Efficient CPU LLM Serving
- Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards
- Celty: SpMspV GPU Kernel and SIMT Co-Design for Efficient Dual-Sparse LLM Inference
- Thinking Short and Right Over Thinking Long: Serving LLM Reasoning Efficiently and Accurately
- LEXam: Benchmarking Legal Reasoning on 340 Law Exams
- A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone
- HybridServe: Efficient Serving of Large AI Models with Confidence-Based Cascade Routing
- MARGE: Improving Math Reasoning for LLMs with Guided Exploration
- UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
- Augmented Backpressure for Decentralized Management of Agentic Networks
- Tevatron Meets Megatron: Expert-Parallel LLM Reranker Training on an Academic Budget
- Mining Intrinsic Rewards from LLM Hidden States for Efficient Best-of-N Sampling
- KVmix: Gradient-Based Layer Importance-Aware Mixed-Precision Quantization for KV Cache
- EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming
- LightRetriever: A LLM-based Text Retrieval Architecture with Extremely Faster Query Inference
- SLOT: Sample-specific Language Model Optimization at Test-time
- LLM-based Automated Theorem Proving Hinges on Scalable Synthetic Data Generation
- Solve-Detect-Verify: Inference-Time Scaling with Flexible Generative Verifier
- Fine-grained Contrastive Learning for ECG-Report Alignment with Waveform Enhancement
- Spatial Prefix Caching for Wireless Edge LLM Inference: A Stochastic-Geometry and Queueing Framework
- PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents
- Arrow: Adaptive Scheduling Mechanisms for Disaggregated LLM Inference Architecture
- Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
- GRACE: Generative Recommender Acceleration Engine for Real-Time Ads Retrieval
- Demystifying and Enhancing the Efficiency of Large Language Model Based Search Agents
- TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning
- MoE-CAP: Benchmarking Cost, Accuracy and Performance of Sparse Mixture-of-Experts Systems
- XtraGPT: Context-Aware and Controllable Academic Paper Revision via Human-AI Collaboration
- SpecEdge: Scalable Edge-Assisted Serving Framework for Interactive LLMs
- Follow the Path: Reasoning over Knowledge Graph Paths to Improve Large Language Model Factuality
- Rethinking the Role of Prompting Strategies in LLM Test-Time Scaling: A Perspective of Probability Theory
- Diagnose Before You Compress: Prediction-Independent Bottleneck Witness Refinement for LLM Serving Traces
- AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction
- AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications
- AttnLink: Turning Attention into Schema Links for Text-to-SQL
- Accurate KV Cache Quantization with Outlier Tokens Tracing
- Semantic Caching of Contextual Summaries for Efficient Question-Answering with Language Models
- OoO-Spec: Out-of-Order Semantic Speculation for Fast Tool Calling
- Disentangling Reasoning and Knowledge in Medical Large Language Models
- TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference
- Rethinking Optimal Verification Granularity for Compute-Efficient Test-Time Scaling
- MatTools: Benchmarking Large Language Models for Materials Science Tools
- Massive-STEPS: Massive Semantic Trajectories for Understanding POI Check-ins -- Dataset and Benchmarks
- BLEUBERI: BLEU is a surprisingly effective reward for instruction following
- Improve Rule Retrieval and Reasoning with Self-Induction and Relevance ReEstimate
- The Hitchhikers Guide to Production-ready Trustworthy Foundation Model powered Software (FMware)
- S4R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching
- ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production
- Hierarchical Document Refinement for Long-context Retrieval-augmented Generation
- TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation
- CrystalMem: Elastic Memory for Self-Evolving LLM Agents via Knowledge Crystallization
- J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning
- Action Chunk Scheduling for Batched Robot Policy Serving
- ELIS: Efficient LLM Iterative Scheduling System with Response Length Predictor
- Flash-VL 2B: Optimizing Vision-Language Model Performance for Ultra-Low Latency and High Throughput
- Analog Foundation Models
- Request-Level Energy Attribution for Batched LLM Serving
- Rewrite to Translate, Translate to Reward: Reinforcement Learning for Source Rewriting in Machine Translation
- GenPage: Towards End-to-End Generative Homepage Construction at Netflix
- Can LLMs Reliably Self-Report Adversarial Prefills, and How?
- HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval
- AgentCompile: An LLM-Guided Compiler for Direct CUDA Inference
- Streaming Communication in Multi-Agent Reasoning
- Toward Cost-Efficient Serving of Mixture-of-Experts with Asynchrony
- FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs
- AM-Thinking-v1: Advancing the Frontier of Reasoning at 32B Scale
- LibVulnWatch: A Deep Assessment Agent System and Leaderboard for Uncovering Hidden Vulnerabilities in Open-Source AI Libraries
- RubricReviewer: From Direct Critique to Objective and Comprehensive Rubric-Driven Peer Review
- Domain Regeneration: How well do LLMs match syntactic properties of text domains?
- Multimodal Cancer Modeling in the Age of Foundation Model Embeddings
- Synthetic Code Surgery: Repairing Bugs and Vulnerabilities with LLMs and Synthetic Data
- On the Robustness of Reward Models for Language Model Alignment
- PrefillOnly: An Inference Engine for Prefill-only Workloads in Large Language Model Applications
- ToolACE-DEV: Self-Improving Tool Learning via Decomposition and EVolution
- FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning
- Learning from Peers in Reasoning Models
- MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining
- OnPrem.LLM: A Privacy-Conscious Document Intelligence Toolkit
- SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models
- DriveSOTIF: Advancing Perception SOTIF Through Multimodal Large Language Models
- Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression
- I Know What You Said: Unveiling Hardware Cache Side-Channels in Local Large Language Model Inference
- LLM Output Detectability and Task Performance Can be Jointly Optimized
- Structured Recurrent Mixers for Massively Parallelized Sequence Generation
- CellVerse: Do Large Language Models Really Understand Cell Biology?
- Sparse Attention Remapping with Clustering for Efficient LLM Decoding on PIM
- The ML.ENERGY Benchmark: Toward Automated Inference Energy Measurement and Optimization
- When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models
- AutoFOAM: The Self-Refining Autonomous OpenFOAM Agent
- POSTCONDBENCH: Benchmarking Correctness and Completeness in Formal Postcondition Inference
- From OSS to Open Source AI: an Exploratory Study of Collaborative Development Paradigm Divergence
- Healthy LLMs? Benchmarking LLM Knowledge of UK Government Public Health Information
- Query-driven Document-level Scientific Evidence Extraction from Biomedical Studies
- MxMoE: Mixed-precision Quantization for MoE with Accuracy and Performance Co-Design
- MAPLE: Metadata Augmented Private Language Evolution
- HEXGEN-FLOW: Optimizing LLM Inference Request Scheduling for Agentic Text-to-SQL
- Towards Mitigating API Hallucination in Code Generated by LLMs with Hierarchical Dependency Aware
- WaterDrum: Watermarking for Data-centric Unlearning Metric
- StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training
- Large Language Models as Automatic Annotators and Annotation Adjudicators for Fine-Grained Opinion Analysis
- Small Clips, Big Gains: Learning Long-Range Refocused Temporal Information for Video Super-Resolution
- Adaptive Social Learning via Mode Policy Optimization for Language Agents
- R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation
- Contextual Drag: How Errors in the Context Affect LLM Reasoning
- Accelerating Large Language Model Reasoning via Speculative Search
- Multi-agents based User Values Mining for Recommendation
- Phantora: Maximizing Code Reuse in Simulation-based Machine Learning System Performance Estimation
- Llama-Nemotron: Efficient Reasoning Models
- PipeSpec: Breaking Stage Dependencies in Hierarchical LLM Decoding
- Always Tell Me The Odds: Fine-grained Conditional Probability Estimation
- NeMo-Inspector: A Visualization Tool for LLM Generation Analysis
- Patchwork: A Unified Framework for RAG Serving
- Sustainability Is Not Linear: Quantifying Performance, Energy, and Privacy Trade-offs in On-Device Intelligence
- AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation
- StepCache: Step-Level Reuse with Lightweight Verification and Selective Patching for LLM Serving
- Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models
- Lean4Agent: Formal Modeling and Verification for Agent Workflow and Trajectory
- Reasoning with Sampling: Cutting at Decision Points
- Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
- Recursive Multi-Agent Systems
- Secure On-Premise Deployment of Open-Weights Large Language Models in Radiology: An Isolation-First Architecture with Prospective Pilot Evaluation
- LLMs Can Learn to Reason Via Off-Policy RL
- Measuring and Eliminating Refusals in Military Large Language Models
- ProfInfer: An eBPF-based Fine-Grained LLM Inference Profiler
- Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting
- Output-Aware Rotation for INT2 KV-Cache Quantization
- Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment
- Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure
- Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model
- The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
- DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
- Elastic Gang: Per-Token Membership Change for a Hard-Barriered LLM Inference Gang Co-Scheduled with OS Processes
- On the Utility and Factual Reliability of Pruned Mixture-of-Experts Models in the Biomedical Domain
- When Context Returns: Toward Robust Internalization in On-Policy Distillation
- The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
- KernelSight-LM: A Kernel-Level LLM Inference Simulator
- Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving
- TERMINATOR: Learning Optimal Exit Points for Early Stopping in Chain-of-Thought Reasoning
- Generative Engine Optimization: A VLM and Agent Framework for Pinterest Acquisition Growth
- Epiphany-Aware KV Cache Eviction Without the Attention Matrix
- Scaling Laws for Task-Specific LLM Distillation
- RoPE-Aware Bit Allocation for KV-Cache Quantization
- Tmax: A simple recipe for terminal agents
- Scalable Physics-Inspired Transformers for Spin Glasses
- Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding
- Does Mixture-of-Experts Actually Help Inference on Consumer and Edge Hardware? An Empirical Study
- Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages
- Structured Inference with Large Language Gibbs
- EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts
- CloakLM: Obfuscating GPU Memory Layout to Mitigate Model Ex-filtration for Serving
- Beyond Per-Token Pricing: A Concurrency-Aware Methodology for LLM Infrastructure Cost Estimation
- GRPO Does Not Close the Multi-Agent Coordination Gap
- Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
- Scaling On-Device GPU Inference for Large Generative Models
- Sleeper Cell: Injecting Latent Malice Temporal Backdoors into Tool-Using LLMs
- AuroraRL: Fast, Fault-Tolerant, and Cost-Efficient Reinforcement Learning over Decentralized Network
- From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves
- PreAct-Bench: Benchmarking Predictive Monitoring in LLMs
- The Usefulness Gap in Proof-of-Useful-Work: An Empirical Study of Pearl's cuPOW Protocol
- Can Generalist Agents Automate Data Curation?
- OptiLeak: Efficient Prompt Reconstruction via Reinforcement Learning in Multi-tenant LLM Services
- UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods
- Speculative Pre-Positioning: Decoding Stateful Sessions to the Next Decision Point Off the Critical Path
- Fearless Concurrency on the GPU
- JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence
- Demystifying NVSHMEM: A System-Level Analysis on Symmetric Memory and Device-Initiated Operations in GPU Communication
- VeriCache: Turning Lossy KV Cache into Lossless LLM Inference
- Ada-MK: Adaptive MegaKernel Optimization via Automated DAG-based Search for LLM Inference
- MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems
- Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation
- Beyond Language Modeling: An Exploration of Multimodal Pretraining
- Can AI Agents Agree?
- LLMs Exhibit Significantly Lower Uncertainty in Creative Writing Than Professional Writers
- NetKV: Network-Aware Decode Instance Selection for Disaggregated LLM Inference
- DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference
- Traj-Evolve: A Self-Evolving Multi-Agent System for Patient Trajectory Modeling in Lung Cancer Early Detection
- SparseX: Efficient Segment-Level KV Cache Sharing for Interleaved LLM Serving
- Learning to Translate from Soft to Hard LLM Prompts
- ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System
- Idleness is Relative: Exploiting Tool-Call Idle Windows for Offloading in Agentic Systems with MORI
- GPIC: A Giant Permissive Image Corpus for Visual Generation
- Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation
- BIRDS: Characterizing and Understanding Biodiversity Impact of Large Language Model Serving
- ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling
- One prompt is not enough: Instruction Sensitivity Undermines Embedding Model Evaluation
- Trust The Typical
- The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?
- Axe: A Simple Unified Layout Abstraction for Machine Learning Compilers
- FlashInfer-Bench: Building the Virtuous Cycle for AI-driven LLM Systems
- When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
- DNB-AI-Project at SemEval-2025 Task 5: An LLM-Ensemble Approach for Automated Subject Indexing
- GPU Performance Portability needs Autotuning
- General Preference Reinforcement Learning
- TIDAL: Recovering Temporal Phase for Cloud Block Storage Placement from LLM-Derived Semantics
- Measuring Google AI Overviews: Activation, Source Quality, Claim Fidelity, and Publisher Impact
- MinT: Managed Infrastructure for Training and Serving Millions of LLMs
- Separating Intelligence from Inference: A Standard for Edge-Native AI Computing
- Pion: A Spectrum-Preserving Optimizer via Orthogonal Equivalence Transformation
- KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference
- Gradient Extrapolation-Based Policy Optimization
- Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games
- Tutti: Making SSD-Backed KV Cache Practical for Long-Context LLM Serving
- SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection
- When Is the Same Model Not the Same Service? A Measurement Study of Hosted Open-Weight LLM APIs
- On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length
- OpenThoughts-Agent: Data Recipes for Agentic Models
- Computational Reasoning of Large Language Models
- Silicon Showdown: Performance, Efficiency, and Ecosystem Barriers in Consumer-Grade LLM Inference
- Reinforcement Learning for Reasoning in Large Language Models with One Training Example
- TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions
- DMDTEval: An Evaluation and Analysis of LLMs on Disambiguation in Multi-domain Translation
- Beyond the Last Answer: Your Reasoning Trace Uncovers More than You Think
- SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
- NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference
- Efficient and Adaptable Overlapping for Computation and Communication via Signaling and Reordering
- BRIDGE: Benchmarking Large Language Models for Understanding Real-world Clinical Practice Text
- RaMP: Runtime-Aware Megakernel Polymorphism for Mixture-of-Experts
- Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling
- SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
- QuasiMoTTo: Quasi-Monte Carlo Test-Time Scaling
- When are likely answers right? On Sequence Probability and Correctness in LLMs
- Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents
- Do Thinking Tokens Help with Safety?
- Where Does the Signal Live? A Web Data Recipe for Medical Encoder Pretraining
- Beyond Parallel Sampling: Diverse Query Initialization for Agentic Search
- ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning
- SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning
- Arbor: Tree Search as a Cognition Layer for Autonomous Agents
- Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models
- Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads
- Low-Rank Adaptation Redux for Large Models
- Learning Agent-Compatible Context Management for Long-Horizon Tasks
- Thinking as Compression: Your Reasoning Model is Secretly a Context Compressor
- AAFLOW: Scalable Patterns for Agentic AI Workflows
- Learning to Communicate: Toward End-to-End Optimization of Multi-Agent Language Systems
- Anthropogenic Regional Adaptation in Multimodal Vision-Language Model
- TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training
- MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
- CodeScout: An Effective Recipe for Reinforcement Learning of Code Search Agents
- Beyond Creed: A Non-Identity Safety Condition A Strong Empirical Alternative to Identity Framing in Low-Data LoRA Fine-Tuning
- AI+HW 2035: Shaping the Next Decade
- The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?
- SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs
- Rethinking the Trust Region in LLM Reinforcement Learning
- Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
- Maximum Likelihood Reinforcement Learning
- Generative Visual Code Mobile World Models
- Large Language Model Agents Are Not Always Faithful Self-Evolvers
- Optimizing Agentic Workflows using Meta-tools
- VIBEVOICE-ASR Technical Report
- SciCoQA: Quality Assurance for Scientific Paper--Code Alignment
- semi-PD: Towards Efficient LLM Serving via Phase-Wise Disaggregated Computation and Unified Storage
- Taming the Titans: A Survey of Efficient LLM Inference Serving
- R-Sparse: Rank-Aware Activation Sparsity for Efficient LLM Inference
- Llama-3.1-FoundationAI-SecurityLLM-Base-8B Technical Report
- AutoJudge: Judge Decoding Without Manual Annotation
- FineQ: Software-Hardware Co-Design for Low-Bit Fine-Grained Mixed-Precision Quantization of LLMs
- PlanetServe: A Decentralized, Scalable, and Privacy-Preserving Overlay for Democratizing Large Language Model Serving
- Unsupervised Confidence Calibration for Reasoning LLMs from a Single Generation
- HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing
- Neural Garbage Collection: Learning to Forget while Learning to Reason
- Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU
- Scepsy: Serving Agentic Workflows Using Aggregate LLM Pipelines
- Muyan-TTS: A Trainable Text-to-Speech Model Optimized for Podcast Scenarios with a 50K Budget
- Development of an LLM-Based System for Automatic Code Generation from HEP Publications
- Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
- Streaming, Fast and Slow: Cognitive Load-Aware Streaming for Efficient LLM Serving
- EcoServe: Enabling Cost-effective LLM Serving with Proactive Intra- and Inter-Instance Orchestration
- MARS: Efficient, Adaptive Co-Scheduling for Heterogeneous Agentic Systems
- ProbeLogits: Kernel-Level LLM Inference Primitives for AI-Native Operating Systems
- Flow-Controlled Scheduling for LLM Inference with Provable Stability Guarantees
- Valve: Production Online-Offline Inference Colocation with Jointly-Bounded Preemption Latency and Rate
- Blink: CPU-Free LLM Inference by Delegating the Serving Stack to GPU and SmartNIC
- Cross-Platform Fused MoE Dispatch in Triton: Portable Expert Routing Without CUDA
- Debiasing LLMs by Fine-tuning
- ProphetKV: User-Query-Driven Selective Recomputation for Efficient KV Cache Reuse in Retrieval-Augmented Generation
- FOCUS: DLLMs Know How to Tame Their Compute Bound
- Where Do the Joules Go? Diagnosing Inference Energy Consumption
- SERA: Soft-Verified Efficient Repository Agents
- M2XFP: A Metadata-Augmented Microscaling Data Format for Efficient Low-bit Quantization
- SemanticALLI: Caching Reasoning, Not Just Responses, in Agentic Systems
- ContiguousKV: Accelerating LLM Prefill with Granularity-Aligned KV Cache Management
- LOGOS-CA: A Cellular Automaton Using Natural Language as State and Rule
- Failure Modes in Multi-Hop QA: The Weakest Link Effect and the Recognition Bottleneck
- Nixie: Efficient, Transparent Temporal Multiplexing for Consumer GPUs
- MultiGlobeQA: A Multilingual and Globally Diverse Benchmark for Geospatial Reasoning
- RelayLLM: Efficient Reasoning via Collaborative Decoding
- SieveIVF: Threshold-Aware IVF Execution for Large-Scale Training Data Deduplication
- Efficient Grammar-Constrained Decoding via Parser Stack Classification
- SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
- PAMT: Process-Aligned Reinforcement Learning for Multi-Domain Machine Translation
- The Frontier LLM Trap in Network Automation
- Diversity is Not Ambiguity: Toward Accurate and Efficient Ambiguity Detection for Open-Domain QA
- Predicting Multilingual Classification and Translation Performance of LLMs with Cross-Lingual Alignment \unicodex2013 Is English Enough?
- Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding
- Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention
- Energy Considerations of Large Language Model Inference and Efficiency Optimizations
- Revisiting Disaggregated Large Language Model Serving for Performance and Energy Implications
- Improving Large Language Model Planning with Action Sequence Similarity
- DualRAG: A Dual-Process Approach to Integrate Reasoning and Retrieval for Multi-Hop Question Answering
- The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs
- L3: DIMM-PIM Integrated Architecture and Coordination for Scalable Long-Context LLM Inference
- JITServe: SLO-aware LLM Serving with Imprecise Request Information
- Search, Inspect, Fetch: Exploiting Structure-Aware Boolean Retrieval for Deep-Research Agents
- Architectural Implications of Agentic AI Workflows
- Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference
- CommBench: Can LLMs Write Correct and Efficient GPU Communication Code?
- The Evaluator Is Part of the Experiment: Measuring Open-Ended LLM Conformity
- Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)
- A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models
- When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO
- A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination
- State2State: Environment-Derived Mid-Training for LLM Agents
- Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos
- Private Direct Preference Optimization for LLM Alignment
- AsymSpec: Efficient Cloud-Edge Speculative Decoding over Asymmetric Networks
- Recurrent Residual Quantization: A Progressive Multi-Precision Representation for LLMs
- Reasoning Models Know When They're Right: Probing Hidden States for Self-Verification
- Rethinking Reflection in Pre-Training
- Rethinking Multilingual Continual Pretraining: Data Mixing for Adapting LLMs Across Languages and Resources
- Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms
- Bidirectional Resource Scheduling for Disaggregated and Asynchronous RL Post-Training
- Tree of Thoughts as a Classical Heuristic Search Problem: Formal Foundations and Design Patterns
- Document Optimization for Black-Box Retrieval via Reinforcement Learning
- AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers
- XGrammar-2: Dynamic and Efficient Structured Generation Engine for Agentic LLMs
- Compass: SLO-aware Query Planner for Compound AI Serving at Scale
- Sparsity Forcing: Reinforcing Token Sparsity of MLLMs
- PARD: Accelerating LLM Inference with Low-Cost PARallel Draft Model Adaptation
- Distilling Specialized Orders for Visual Generation
- GreenMind: A Next-Generation Vietnamese Large Language Model for Structured and Logical Reasoning
- Optimizing LLMs for Italian: Reducing Token Fertility and Enhancing Efficiency Through Vocabulary Adaptation
- MIRAGE: A Metric-Intensive Benchmark for Retrieval-Augmented Generation Evaluation
- Hexcute: A Tile-based Programming Language with Automatic Layout and Task-Mapping Synthesis
- FinNLI: Novel Dataset for Multi-Genre Financial Natural Language Inference Benchmarking
- CAPO: Cost-Aware Prompt Optimization
- Geo-OLM: Enabling Sustainable Earth Observation Studies with Cost-Efficient Open Language Models & State-Driven Workflows
- ZeroED: Hybrid Zero-shot Error Detection through Large Language Model Reasoning
- PolyGuard: A Multilingual Safety Moderation Tool for 17 Languages
- Guillotine: Hypervisors for Isolating Malicious AIs
- StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation
- Dynamic Early Exit in Reasoning Models
- SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference
- Tina: Tiny Reasoning Models via LoRA
- From Human Memory to AI Memory: A Survey on Memory Mechanisms in the Era of LLMs
- Compass-V2 Technical Report
- KeyDiff: Key Similarity-Based KV Cache Eviction for Long-Context LLM Inference in Resource-Constrained Environments
- Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
- MrGuard: A Multilingual Reasoning Guardrail for Universal LLM Safety
- RainbowPlus: Enhancing Adversarial Prompt Generation via Evolutionary Quality-Diversity Search
- Efficient Pretraining Length Scaling
- POLYRAG: Integrating Polyviews into Retrieval-Augmented Generation for Medical Applications
- Hardware-based Heterogeneous Memory Management for Large Language Model Inference
- Efficient Function Orchestration for Large Language Models
- gLLM: Global Balanced Pipeline Parallelism System for Distributed LLM Serving with Token Throttling
- LLM-Assisted Translation of Legacy FORTRAN Codes to C++: A Cross-Platform Study
- Think2SQL: Reinforce LLM Reasoning Capabilities for Text2SQL
- Splitwiser: Efficient LM inference with constrained resources
- LongPerceptualThoughts: Distilling System-2 Reasoning for System-1 Perception
- Feeding LLM Annotations to BERT Classifiers at Your Own Risk
- Learning Adaptive Parallel Reasoning with Language Models
- CRUST-Bench: A Comprehensive Benchmark for C-to-safe-Rust Transpilation
- WindVE: Collaborative CPU-NPU Vector Embedding
- LLMSched: Uncertainty-Aware Workload Scheduling for Compound LLM Applications
- SlimPipe: Memory-Thrifty and Efficient Pipeline Parallelism for Long-Context LLM Training
- Towards High-Goodput LLM Serving with Prefill-decode Multiplexing
- Don't Retrieve, Generate: Prompting LLMs for Synthetic Training Data in Dense Retrieval
- Towards Explainable Fake Image Detection with Multi-Modal Large Language Models
- Direct Advantage Regression: Aligning LLMs with Online AI Reward
- SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM
- Improving the Serving Performance of Multi-LoRA Large Language Models via Efficient LoRA and KV Cache Management
- An Empirical Study of LLM Reasoning Ability Under Strict Output Length Constraint
- LLM-Enhanced Black-Litterman Portfolio Optimization
- Cloud based DevOps Framework for Identifying Risk Factors of Hospital Utilization
- Remedy: Learning Machine Translation Evaluation from Human Preferences with Reward Modeling
- Thought Manipulation: External Thought Can Be Efficient for Large Reasoning Models
- Compile Scene Graphs with Reinforcement Learning
- From Large to Super-Tiny: End-to-End Optimization for Cost-Efficient LLMs
- Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
- NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation
- Towards Understanding and Improving Refusal in Compressed Models via Mechanistic Interpretability
- SLOs-Serve: Optimized Serving of Multi-SLO LLMs
- Estimating Optimal Context Length for Hybrid Retrieval-augmented Multi-document Summarization
- Tilus: A Tile-Level GPGPU Programming Language for Low-Precision Computation
- MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models
- Activated LoRA: Fine-tuned LLMs for Intrinsics
- Shared Disk KV Cache Management for Efficient Multi-Instance Inference in RAG-Powered LLMs
- Characterizing and Optimizing LLM Inference Workloads on CPU-GPU Coupled Architectures
- GlotEval: A Test Suite for Massively Multilingual Evaluation of Large Language Models
- The Digital Cybersecurity Expert: How Far Have We Come?
- EdgePrompt: A Distributed Key-Value Inference Framework for LLMs in 6G Networks
- omni-macos: On-Device Omni-Modal Search on Apple Silicon
- Detecting Safety Training Modification in Language Models via Activation Analysis
- Breaking Customized LLMs for Coding: Automated Red Teaming for Instruction Backdoor Attacks
- TensorCast: The Missing Tensor Management Layer in Large Language Model Infrastructure
- Runtime Observability for Heterogeneous Attention Memory
- LLM Inference Under Bursty Workload Distribution: Modifying the WAIT Algorithm
- Escaping the Self-Repair Trap: Improving Test Oracle Generation via Dual-Context Awareness
- PLoRA: An NDP-Enhanced Pooled-Memory System for Cost-Efficient Multi-LoRA Serving
- PaDoc: Layout-Grounded Parallel Decoding for Document Parsing
- TriQua: Reconciling Granularity and Context in Factuality Evaluation
- Analysis of Numerical Localisation in LLM Translations
- Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment
- QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding
- Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents
- HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
- To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling
- LELA: an LLM-based Entity Linking Approach with Zero-Shot Domain Adaptation
- SpecPipe: Accelerating Pipeline Parallelism-based LLM Inference with Speculative Decoding
- Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning
- Optimizing LLM Inference: Fluid-Guided Online Scheduling with Memory Constraints
- Offline Learning and Forgetting for Reasoning with Large Language Models
- SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL
- Unchecked and Overlooked: Addressing the Checkbox Blind Spot in Large Language Models with CheckboxQA
- MIST: A Co-Design Framework for Heterogeneous, Multi-Stage LLM Inference
- Guiding Reasoning in Small Language Models with LLM Assistance
- Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
- KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
- SocioVerse: A World Model for Social Simulation Powered by LLM Agents and A Pool of 10 Million Real-World Users
- AlayaDB: The Data Foundation for Efficient and Effective Long-context LLM Inference
- Efficient LLM Serving on Hybrid Real-time and Best-effort Requests
- Towards Stepwise Domain Knowledge-Driven Reasoning Optimization and Reflection Improvement
- MSCCL++: Rethinking GPU Communication Abstractions for AI Inference
- VectorLiteRAG: Latency-Aware and Fine-Grained Resource Partitioning for Efficient RAG
- A Strategic Coordination Framework of Small LLMs Matches Large LLMs in Data Synthesis
- Out of Style: RAG's Fragility to Linguistic Variation
- SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
- Forecasting Conversation Derailments Through Generation
- SWAN-GPT: An Efficient and Scalable Approach for Long-Context Language Modeling
- Playpen: An Environment for Exploring Learning Through Conversational Interaction
- Porting an LLM based Application from ChatGPT to an On-Premise Environment
- MOSAIC: Modeling Social AI for Content Dissemination and Regulation in Multi-Agent Simulations
- A System for Comprehensive Assessment of RAG Frameworks
- NorEval: A Norwegian Language Understanding and Generation Evaluation Benchmark
- GPT Carry-On: Training Foundation Model for Customization Could Be Simple, Scalable and Affordable
- LLM4Ranking: An Easy-to-use Framework of Utilizing Large Language Models for Document Reranking
- Leveraging LLMs for Multimodal Retrieval-Augmented Radiology Report Generation via Key Phrase Extraction
- Throughput-Optimal Scheduling Algorithms for LLM Inference and AI Agents
- SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning
- SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
- SD2: Self-Distilled Sparse Drafters
- A Sober Look at Progress in Language Model Reasoning: Pitfalls and Paths to Reproducibility
- Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception
- FuseRL: Dense Preference Optimization for Heterogeneous Model Fusion
- FamilyTool: A Multi-hop Personalized Tool Use Benchmark
- Self-Steering Language Models
- S'MoRE: Structural Mixture of Residual Experts for Parameter-Efficient LLM Fine-tuning
- From Superficial to Deep: Integrating External Knowledge for Follow-up Question Generation Using Knowledge Graph and LLM
- Two Intermediate Translations Are Better Than One: Fine-tuning LLMs for Document-level Translation Refinement
- Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
- The bottlenecks of AI: challenges for embedded and real-time research in a data-centric age
- Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
- CARE: Multilingual Human Preference Learning for Cultural Awareness
- Transformer (deep learning) [wikipedia]
- PagedAttention [wikipedia]
- VLLM [wikipedia]
Discussions
- Efficient Memory Management for Large Language Model Serving with PagedAttention [hn, 102 points, 16 comments]
- I found the following paper fascinating to read: it details PagedAttention, a novel paging-inspired way to slash memory waste and boost LLM serving throughput 2–4×. See link below. #LLM #AIinfrastruct [bsky, 7 points, 2 comments]
- Efficient Memory Management for Large Language Model Serving with PagedAttention [hn, 2 points, 0 comments]
- feeling exhausted but also a dopamine hit cuz, I finished the paper "Efficient Memory Management for LLMs Serving with Paged Attention." It took a lot of time for me to understand and recreate some [bsky, 1 points, 0 comments]
Related