Qwen3 Technical Report
2025/05/14 by An Yang, Yang, An, Anfeng Li +123 · 1 voice · 1776 citations
Computer Science · Medicine · #Topic Modeling #Artificial Intelligence in Healthcare and Education #Multimodal Machine Learning Applications
paper · pdf · doi:10.48550/arxiv.2505.09388
Abstract
In this work, we present Qwen3, the latest version of the Qwen model family. Qwen3 comprises a series of large language models (LLMs) designed to advance performance, efficiency, and multilingual capabilities. The Qwen3 series includes models of both dense and Mixture-of-Expert (MoE) architectures, with parameter scales ranging from 0.6 to 235 billion. A key innovation in Qwen3 is the integration of thinking mode (for complex, multi-step reasoning) and non-thinking mode (for rapid, context-driven responses) into a unified framework. This eliminates the need to switch between different models--such as chat-optimized models (e.g., GPT-4o) and dedicated reasoning models (e.g., QwQ-32B)--and enables dynamic mode switching based on user queries or chat templates. Meanwhile, Qwen3 introduces a thinking budget mechanism, allowing users to allocate computational resources adaptively during inference, thereby balancing latency and performance based on task complexity. Moreover, by leveraging the knowledge from the flagship models, we significantly reduce the computational resources required to build smaller-scale models, while ensuring their highly competitive performance. Empirical evaluations demonstrate that Qwen3 achieves state-of-the-art results across diverse benchmarks, including tasks in code generation, mathematical reasoning, agent tasks, etc., competitive against larger MoE models and proprietary models. Compared to its predecessor Qwen2.5, Qwen3 expands multilingual support from 29 to 119 languages and dialects, enhancing global accessibility through improved cross-lingual understanding and generation capabilities. To facilitate reproducibility and community-driven research and development, all Qwen3 models are publicly accessible under Apache 2.0.
Cited by
- PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention
- From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
- DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes
- RemiAssist: A Therapist-Supporting System for Photo-Based Reminiscence Therapy in Dementia Care
- Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding
- Nested Browser-Use Learning for Agentic Information Seeking
- Memorization in 3D Shape Generation: An Empirical Study
- Enhancing Diversity of LLM-Generated Educational Tasks
- Same or Not? Enhancing Visual Perception in Vision-Language Models
- ThinkGen: Generalized Thinking for Visual Generation
- HY-Motion 1.0: Scaling Flow Matching Models for Text-To-Motion Generation
- Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following
- The Law of Multi-Model Collaboration: Scaling Limits of Model Ensembling for Large Language Models
- CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation
- GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation
- Bridging Global Intent with Local Details: A Hierarchical Representation Approach for Semantic Validation in Text-to-SQL
- Diversity or Precision? A Deep Dive into Next Token Prediction
- Towards Understanding Steering Strength
- A Brain-like Synergistic Core in LLMs Drives Behaviour and Learning
- Eliciting Behaviors in Multi-Turn Conversations
- Harnessing Large Language Models for Biomedical Named Entity Recognition
- M2G-Eval: Enhancing and Evaluating Multi-granularity Multilingual Code Generation
- Learning When Not to Attend Globally
- RollArt: Disaggregated Multi-Task Agentic RL Training at Scale
- Predicting LLM Correctness in Prosthodontics Using Metadata and Hallucination Signals
- Role-Based Fault Tolerance System for LLM RL Post-Training
- Completed Hyperparameter Transfer across Modules, Width, Depth, Batch and Duration
- SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents
- VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
- LLMBoost: Make Large Language Models Stronger with Boosting
- LiveProteinBench: A Contamination-Free Benchmark for Assessing Models' Specialized Capabilities in Protein Science
- Agentic Software Issue Resolution with Large Language Models: A Survey
- Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion
- Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
- Being-H0.7: A Latent World-Action Model from Egocentric Videos
- MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving
- Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV
- SpecFormer: Mitigating Embedding and Attention Collapse via Spectral-Aware Transformer for Recommendation
- Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents
- Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets
- LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding
- Hierarchical Group-Conditional Conformal Risk Control for Selective Prediction in Language Models
- FlowCTS: On-policy Continuous Trajectory Supervision of Flow Models
- TopoFE: topology-aware LLM-guided Automated Feature Engineering
- Libra: Taming Attention Workload Skew in Long-Context LLM Training with Bounded Sequence Pool
- Interpretable Column Annotation with LLM-Symbolized Decision Process Materialization
- GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding
- Tokenizing Numerical and Embedding Features for LLM RecSys
- Structure-aware Relative Policy Optimization for Ranking
- Decoding the Skew: Distribution-Aware MoE Inference with Adaptive Kernel Dispatch
- EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff
- CAST: Game Solvers as Turn-Level Teachers for LLM Agents
- Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization
- CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention
- Raven: High-Recall Sequence Modeling with Sparse Memory Routing
- HVM-GraphRAG: Holistic-View Multimodal Graph Retrieval-Augmented Generation on Complex Document
- AMPBench-MT: A Homology-Controlled Benchmark for Antimicrobial Peptide Potency, Spectrum, and Safety Prediction
- GAUGE: Grading Agent-Built Financial Models Without a Golden Answer
- HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research
- Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
- DispatchRAG: Grounding Emergency Dispatch Decisions in Real-World Protocols from Traffic Accident Video
- Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias
- Commitment To Cooperation With Self-Negotiated Contracts
- Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning
- Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks
- Test-Time Coverage: Test-Conditioned Data Curation for Deployment-Aware Learning
- How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift
- When Thinking Before Retrieval Hurts: TraceBound Diagnostics for Adaptive Knowledge-Graph Retrieval
- daVinci-kernel: Co-Evolving Skill Selection, Summarization, and Utilization via RL for GPU Kernel Optimization
- CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data
- Masked Distillation: Internalizing the Chain-of-Thought in Language Models
- Opti-Q: A Constraint-Based Optimization Framework for Multi-LLM Question Planning
- Chart Deception in Vision-Language Models: From Vulnerability to Mitigation
- AgentWatcher: A Rule-based Prompt Injection Monitor
- MIITA: Memory-Induced Inference-Time Adaptation for Continual Learning with Small Language Models
- LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent
- Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?
- DreamCAD: Scaling Multi-modal CAD Generation using Differentiable Parametric Surfaces
- LanteRn: Latent Visual Structured Reasoning
- An Efficient and Effective Evaluator for Text2SQL Models on Unseen and Unlabeled Data
- SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems
- Structured Observation Language for Efficient and Generalizable Vision-Language Navigation
- Agentic Reward Modeling: Verifying GUI Agent via Progressive Trajectory-Grounded Interaction
- Algorithmic Blindness in Large Language Models: A Calibration Study of Performance Prediction
- RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
- FUSCO: High-Performance Distributed Data Shuffling via Transformation-Communication Fusion
- PixelGen: Improving Pixel Diffusion with Perceptual Supervision
- LVLM-Aided Alignment of Task-Specific Vision Models
- Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
- CricBench: A Multilingual Benchmark for Evaluating LLMs in Cricket Analytics
- A Comedy of Estimators: On KL Regularization in RL Training of LLMs
- An Information Theoretic Perspective on Agentic System Design
- Gamayun's Path to Multilingual Mastery: Cost-Efficient Training of a 1.5B-Parameter LLM
- PERELMAN: Pipeline for scientific literature meta-analysis. Technical report
- Spatiotemporal-Untrammelled Mixture of Experts for Multi-Person Motion Prediction
- RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic
- UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters
- T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
- Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control
- GateBreaker: Gate-Guided Attacks on Mixture-of-Expert LLMs
- One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents
- VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
- SegMo: Segment-aligned Text to 3D Human Motion Generation
- TokSuite: Measuring the Impact of Tokenizer Choice on Language Model Behavior
- VL4Gaze: Unleashing Vision-Language Models for Gaze Following
- M3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation
- TableGPT-R1: Advancing Tabular Reasoning Through Reinforcement Learning
- SpatialTree: How Spatial Abilities Branch Out in MLLMs
- SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models
- PRISM: A Personality-Driven Multi-Agent Framework for Social Media Simulation
- From Retrieval to Reasoning: A Framework for Cyber Threat Intelligence NER with Explicit and Adaptive Instructions
- Scalable Stewardship of an LLM-Assisted Clinical Benchmark with Physician Oversight
- GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators
- Activations as Features: Probing LLMs for Generalizable Essay Scoring Representations
- AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards
- Recontextualization Mitigates Specification Gaming without Modifying the Specification
- VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
- MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking
- UCCL-EP: Portable Expert-Parallel Communication
- M3-Verse: A "Spot the Difference" Challenge for Large Multimodal Models
- X-Talk: On the Underestimated Potential of Modular Speech-to-Speech Dialogue System
- Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers
- Reflective Confidence: Correcting Reasoning Flaws via Online Self-Correction
- SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios
- MoE Pathfinder: Trajectory-driven Expert Pruning
- Sophia: A Persistent Agent Framework of Artificial Life
- Training LLMs with LogicReward for Faithful and Rigorous Reasoning
- LIR3AG: A Lightweight Rerank Reasoning Strategy Framework for Retrieval-Augmented Generation
- Shuttling Compiler for Trapped-Ion Quantum Computers Based on Large Language Models
- ShareChat: A Dataset of Chatbot Conversations in the Wild
- PathFLIP: Fine-grained Language-Image Pretraining for Versatile Computational Pathology
- A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs
- Understanding Generalization in Role-Playing Models via Information Theory
- Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V)LMs
- UmniBench: Unified Understand and Generation Model Oriented Omni-dimensional Benchmark
- UniRel: Relation-Centric Knowledge Graph Question Answering with RL-Tuned LLM Reasoning
- EasyV2V: A High-quality Instruction-based Video Editing Framework
- A Benchmark and Agentic Framework for Omni-Modal Reasoning and Tool Use in Long Videos
- GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
- Meta-RL Induces Exploration in Language Agents
- PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence
- DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI
- TimeSeries2Report prompting enables adaptive large language model management of lithium-ion batteries
- Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference
- Sigma-MoE-Tiny Technical Report
- Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis
- DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
- ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs
- WeMusic-Agent: Efficient Conversational Music Recommendation via Knowledge Internalization and Agentic Boundary Learning
- MultiPath Transfer Engine: Breaking GPU and Host-Memory Bandwidth Bottlenecks in LLM Services
- Auto-Vocabulary 3D Object Detection
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
- Explaining the Reasoning of Large Language Models Using Attribution Graphs
- GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models
- Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision
- EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence
- Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning
- Spatia: Video Generation with Updatable Spatial Memory
- Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation
- Evaluating the Capability of Video Question Generation for Expert Knowledge Elicitation
- V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions
- ART: Articulated Reconstruction Transformer
- ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
- VersatileFFN: Achieving Parameter Efficiency in LLMs via Adaptive Wide-and-Deep Reuse
- Vector Prism: Animating Vector Graphics by Stratifying Semantic Structure
- An Open and Reproducible Deep Research Agent for Long-Form Question Answering
- ScholarGym: Benchmarking Large Language Model Capabilities in the Information-Gathering Stage of Deep Research
- A First-Order Logic-Based Alternative to Reward Models in RLHF
- Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed
- What Affects the Effective Depth of Large Language Models?
- HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
- OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value
- MobileWorldBench: Towards Semantic World Modeling For Mobile Agents
- DTop-p MoE: Sparsity-Controlled Dynamic Top-p MoE for Foundation Model Pre-training
- HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering
- From Context to EDUs: Faithful and Structured Context Compression via Elementary Discourse Unit Decomposition
- A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning
- A Scientific Reasoning Model for Organic Synthesis Procedure Generation
- VLCache: Computing 2% Vision Tokens and Reusing 98% for Vision-Language Inference
- Janus: Disaggregating Attention and Experts for Scalable MoE Inference
- ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning
- Error-Driven Prompt Optimization for Arithmetic Reasoning
- ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement
- AIR: Post-training Data Selection for Reasoning via Attention Head Influence
- AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
- MAC: A Multi-Agent Framework for Interactive User Clarification in Multi-turn Conversations
- Sliding Window Recurrences for Sequence Models
- Sharpen the Spec, Cut the Code: A Case for Generative File System with SYSSPEC
- Are Large Language Models Really Effective for Training-Free Cold-Start Recommendation?
- ProServe: Unified Multi-Priority Request Scheduling for LLM Serving
- DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
- Resting Neurons, Active Insights: Improving Input Sparsification for Large Language Models
- NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
- Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- V-Rex: Real-Time Streaming Video LLM Acceleration via Dynamic KV Cache Retrieval
- Cluster-guided LLM-Based Anonymization of Software Analytics Data: Studying Privacy-Utility Trade-offs in JIT Defect Prediction
- CineLOG: A Training Free Approach for Cinematic Long Video Generation
- Made-in China, Thinking in America:U.S. Values Persist in Chinese LLMs
- BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding
- xGR: Efficient Generative Recommendation Serving at Scale
- Reconstruction as a Bridge for Event-Based Visual Question Answering
- Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
- Improving Translation Quality by Selecting Better Data for LLM Fine-Tuning: A Comparative Analysis
- AGAPI-Agents: An Open-Access Agentic AI Platform for Accelerated Materials Design on AtomGPT.org
- Breast-Rehab: A Postoperative Breast Cancer Rehabilitation Training Assessment System Based on Human Action Recognition
- Evolutionary Reinforcement Learning based AI tutor for Socratic Interdisciplinary Instruction
- FutureX: Enhance End-to-End Autonomous Driving via Latent Chain-of-Thought World Model
- FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modularized Collaboration
- KeyframeFace: Language-Driven Facial Animation via Semantic Keyframes
- Synthetic Vasculature and Pathology Enhance Vision-Language Model Reasoning
- Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving
- Enhancing Radiology Report Generation and Visual Grounding using Reinforcement Learning
- GLOW: Graph-Language Co-Reasoning for Agentic Workflow Performance Prediction
- LEO-RobotAgent: A General-purpose Robotic Agent for Language-driven Embodied Operator
- Causal Reasoning Favors Encoders: On The Limits of Decoder-Only Models
- LLM-Auction: Generative Auction towards LLM-Native Advertising
- Topology-Agnostic Animal Motion Generation from Text Prompt
- Investigating The Functional Roles of Attention Heads in Vision Language Models: Evidence for Reasoning Modules
- Latent Chain-of-Thought World Modeling for End-to-End Driving
- Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation
- Mixture of Lookup Key-Value Experts
- DFALLM: Achieving Generalizable Multitask Deepfake Detection by Optimizing Audio LLM Components
- BAMBO: Construct Ability and Efficiency LLM Pareto Set via Bayesian Adaptive Multi-objective Block-wise Optimization
- Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning
- CNFinBench: A Benchmark for Safety and Compliance of Large Language Models in Finance
- LogICL: Distilling LLM Reasoning to Bridge the Semantic Gap in Cross-Domain Log Anomaly Detection
- VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification
- SWEnergy: An Empirical Study on Energy Efficiency in Agentic Issue Resolution Frameworks with SLMs
- Efficient MoE Serving in the Memory-Bound Regime: Balance Activated Experts, Not Tokens
- Explaining the Unseen: Multimodal Vision-Language Reasoning for Situational Awareness in Underground Mining Disasters
- Unified Diffusion Transformer for High-fidelity Text-Aware Image Restoration
- Self-Evolving 3D Scene Generation from a Single Image
- CARLoS: Retrieval via Concise Assessment Representation of LoRAs at Scale
- Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology
- The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
- Information-Dense Reasoning for Efficient and Auditable Security Alert Triage
- No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
- Mind to Hand: Purposeful Robotic Control via Embodied Reasoning
- LASER: Language Model Regression for Semi-Structured Workflow Resource and Runtime Estimation
- ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning
- Guiding What Not to Generate: Automated Negative Prompting for Text-Image Alignment
- Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context LLMs
- LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
- Revolutionizing Mixed Precision Quantization: Towards Training-free Automatic Proxy Discovery via Large Language Models
- AutoICE: Automatically Synthesizing Verifiable C Code via LLM-driven Evolution
- Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
- ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation
- NeSTR: A Neuro-Symbolic Abductive Framework for Temporal Reasoning in Large Language Models
- ClinNoteAgents: An LLM Multi-Agent System for Predicting and Interpreting Heart Failure 30-Day Readmission from Clinical Notes
- Living the Novel: A System for Generating Self-Training Timeline-Aware Conversational Agents from Novels
- Pay Less Attention to Function Words for Free Robustness of Vision-Language Models
- Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
- UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
- RVLF: A Reinforcing Vision-Language Framework for Gloss-Free Sign Language Translation
- Reformulate, Retrieve, Localize: Agents for Repository-Level Bug Localization
- JT-DA: Enhancing Data Analysis with Tool-Integrated Table Reasoning Large Language Models
- Pseudo Anomalies Are All You Need: Diffusion-Based Generation for Weakly-Supervised Video Anomaly Detection
- Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning
- VDOT: Efficient Unified Video Creation via Optimal Transport Distillation
- PersonaMem-v2: Towards Personalized Intelligence via Learning Implicit User Personas and Agentic Memory
- WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving
- Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
- Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models
- M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG
- HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- Hyperparameter Transfer Enables Consistent Gains of Matrix-Preconditioned Optimizers Across Scales
- MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large Models
- ArtistMus: A Globally Diverse, Artist-Centric Benchmark for Retrieval-Augmented Music Question Answering
- The Dynamic Prior: Understanding 3D Structures for Casual Dynamic Videos
- Text Rationalization for Robust Causal Effect Estimation
- Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression
- ResearchArcade: Graph Interface for Academic Tasks
- RefineBench: Evaluating Refinement Capability of Language Models via Checklists
- Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens
- Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded Updates
- EMMA: Efficient Multimodal Understanding, Generation, and Editing with a Unified Architecture
- Qwen3.5-Omni Technical Report
- BioMedGPT-Mol: Multi-task Learning for Molecular Understanding and Generation
- Model Whisper: Steering Vectors Unlock Large Language Models' Potential in Test-time
- SignRoundV2: Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs
- OsmT: Bridging OpenStreetMap Queries and Natural Language with Open-source Tag-aware Language Models
- E3AD: An Emotion-Aware Vision-Language-Action Model for Human-Centric End-to-End Autonomous Driving
- Measuring the Unspoken: A Disentanglement Model and Benchmark for Psychological Analysis in the Wild
- Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning
- Towards Cross-View Point Correspondence in Vision-Language Models
- Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation
- CryptoTensors: A Light-Weight Large Language Model File Format for Highly-Secure Model Distribution
- VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management
- CARL: Criticality-Aware Agentic Reinforcement Learning
- Jina-VLM: Small Multilingual Vision Language Model
- Reason-Plan-ReAct: A Reasoner-Planner Supervising a ReAct Executor for Complex Enterprise Tasks
- Colon-X: Advancing Intelligent Colonoscopy toward Clinical Reasoning
- A Preliminary Study on the Promises and Challenges of Native Top-k Sparse Attention
- ProcObject-10K: Benchmarking Object-Centric Procedural Understanding in Instructional Videos
- Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles
- Multi-Aspect Knowledge-Enhanced Medical Vision-Language Pretraining with Multi-Agent Data Generation
- HarnessAgent: Scaling Automatic Fuzzing Harness Construction with Tool-Augmented LLM Pipelines
- ViDiC: Video Difference Captioning
- Cache What Lasts: Token Retention for Memory-Bounded KV Cache in LLMs
- Leveraging LLMs for Structured Data Extraction from Unstructured Patient Records
- PretrainZero: Reinforcement Active Pretraining
- DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle
- MarkTune: Improving the Quality-Detectability Trade-off in Open-Weight LLM Watermarking
- CrowdLLM: Building LLM-Based Digital Populations Augmented with Generative Models
- Plantain: Plan-Answer Interleaved Reasoning
- MagicQuillV2: Precise and Interactive Image Editing with Layered Visual Cues
- GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes
- Fairy2i: Training Complex LLMs from Real LLMs with All Parameters in \± 1, ± i\
- A benchmark dataset for evaluating Syndrome Differentiation and Treatment in large language models
- Radiologist Copilot: An Agentic Assistant with Orchestrated Tools for Radiology Reporting with Quality Control
- LumiX: Structured and Coherent Text-to-Intrinsic Generation
- Menta: A Small Language Model for On-Device Mental Health Prediction
- Learning What to Attend First: Modality-Importance-Guided Reasoning for Reliable Multimodal Emotion Understanding
- GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization
- TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
- CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning
- Guided Self-Evolving LLMs with Minimal Human Supervision
- Vision to Geometry: 3D Spatial Memory for Sequential Embodied MLLM Reasoning and Exploration
- Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation
- VACoT: Rethinking Visual Data Augmentation with VLMs
- SpecPV: Improving Self-Speculative Decoding for Long-Context Generation via Partial Verification
- Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
- When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers
- Think in Parallel, Answer as One: Logit Averaging for Open-Ended Reasoning
- LeechHijack: Covert Computational Resource Exploitation in Intelligent Agent Systems
- Towards Contextual Sensitive Data Detection
- Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
- PAI-Bench: A Comprehensive Benchmark For Physical AI
- Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models
- Rectifying LLM Thought from Lens of Optimization
- OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic
- Envision: Benchmarking Unified Understanding & Generation for Causal World Process Insights
- Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos
- Edge Deployment of Small Language Models, a comprehensive comparison of CPU, GPU and NPU backends
- Beware of Reasoning Overconfidence: Pitfalls in the Reasoning Process for Multi-solution Tasks
- StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
- A Systematic Characterization of LLM Inference on GPUs
- MAC-SLU: Multi-Intent Automotive Cabin Spoken Language Understanding Benchmark
- Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
- Kardia-R1: Unleashing LLMs to Reason toward Understanding and Empathy for Emotional Support via Rubric-as-Judge Reinforcement Learning
- Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe
- PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards
- AI-Trader: Benchmarking Autonomous Agents in Real-Time Financial Markets
- LLM2Fx-Tools: Tool Calling For Music Post-Production
- CoSineVerifier: Tool-Augmented Answer Verification for Computation-Oriented Scientific Questions
- Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis
- WaterSearch: A Quality-Aware Search-based Watermarking Framework for Large Language Models
- Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning
- Auxiliary-Hyperparameter-Free Sampling: Entropy Equilibrium for Text Generation
- What Is Preference Optimization Doing, How and Why?
- Multi-GRPO: Multi-Group Advantage Estimation for Text-to-Image Generation with Tree-Based Trajectories and Multiple Rewards
- SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs
- SCALE: Selective Resource Allocation for Overcoming Performance Bottlenecks in Mathematical Test-time Scaling
- OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
- G-KV: Decoding-Time KV Cache Eviction with Global Attention
- CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency
- RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards
- Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
- Efficient Kernel Mapping and Comprehensive System Evaluation of LLM Acceleration on a CGLA
- Progressive Code Integration for Abstractive Bug Report Summarization
- Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
- Video-CoM: Interactive Video Reasoning via Chain of Manipulations
- VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction
- Optimizing Multimodal Language Models through Attention-based Interpretability
- Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering
- TWEO: Transformers Without Extreme Outliers Enables FP8 Training And Quantization For Dummies
- Vision Bridge Transformer at Scale
- MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents
- Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework
- Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding
- Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models
- PRISM: Privacy-Aware Routing for Adaptive Cloud-Edge LLM Inference via Semantic Sketch Collaboration
- Invisible Hands: Gray-Box Bit Flip Attack for Steering LLMs Without Knowledge of Gradients, Data, and Weights
- AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model
- TAGFN: A Text-Attributed Graph Dataset for Fake News Detection in the Age of LLMs
- SuRe: Surprise-Driven Prioritised Replay for Continual LLM Learning
- Enhancing Trustworthiness with Mixed Precision: Benchmarks, Opportunities, and Challenges
- OmniInfer: System-Wide Acceleration Techniques for Optimizing LLM Serving Throughput and Latency
- ABounD: Adversarial Boundary-Driven Few-Shot Learning for Multi-Class Anomaly Detection
- Asking like Socrates: Socrates helps VLMs understand remote sensing images
- ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration
- Seeing without Pixels: Perception from Camera Trajectories
- UMind-VL: A Generalist Ultrasound Vision-Language Model for Unified Grounded Perception and Comprehensive Interpretation
- Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following
- GA2-CLIP: Generic Attribute Anchor for Efficient Prompt Tuningin Video-Language Models
- IntAttention: A Fully Integer Attention Pipeline for Efficient Edge Inference
- A Systematic Study of In-the-Wild Model Merging for Large Language Models
- MemFine: Memory-Aware Fine-Grained Scheduling for MoE Training
- Can LLMs extract human-like fine-grained evidence for evidence-based fact-checking?
- Controlling changes to attention logits
- Escaping the Verifier: Learning to Reason via Demonstrations
- Semantic Anchors in In-Context Learning: Why Small LLMs Cannot Flip Their Labels
- CaptionQA: Is Your Caption as Useful as the Image Itself?
- Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression
- GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision
- SingingSDS: A Singing-Capable Spoken Dialogue System for Conversational Roleplay Applications
- SPHINX: A Synthetic Environment for Visual Perception and Reasoning
- Memories Retrieved from Many Paths: A Multi-Prefix Framework for Robust Detection of Training Data Leakage in Large Language Models
- A Reason-then-Describe Instruction Interpreter for Controllable Video Generation
- Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization
- DiFR: Inference Verification Despite Nondeterminism
- BrowseSafe: Understanding and Preventing Prompt Injection Within AI Browser Agents
- A Tale of Two Geometries: Adaptive Optimizers and Non-Euclidean Descent
- DesignPref: Capturing Personal Preferences in Visual Design Generation
- MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
- Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts
- PromptMoG: Enhancing Diversity in Long-Prompt Image Generation via Prompt Embedding Mixture-of-Gaussian Sampling
- REFLEX: Self-Refining Explainable Fact-Checking via Disentangling Truth into Style and Substance
- Beluga: A CXL-Based Memory Architecture for Scalable and Efficient LLM KVCache Management
- Vision-Language Models for Automated 3D PET/CT Report Generation
- Boosting Reasoning in Large Multimodal Models via Activation Replay
- AppSelectBench: Application-Level Tool Selection Benchmark
- RPM-MCTS: Knowledge-Retrieval as Process Reward Model with Monte Carlo Tree Search for Code Generation
- Distilling Counterfactual Reasoning from Language to Vision: Causal Graph Guided Post-Training for Video Understanding
- LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling
- Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation
- Latent Collaboration in Multi-Agent Systems
- INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
- ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models
- Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration
- UniGame: Turning a Unified Multimodal Model Into Its Own Adversary
- DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
- PRInTS: Reward Modeling for Long-Horizon Information Seeking
- VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
- Orchestrating Dual-Boundaries: An Arithmetic Intensity Inspired Acceleration Framework for Diffusion Language Models
- OrdMoE: Preference Alignment via Hierarchical Expert Group Ranking in Multimodal Mixture-of-Experts LLMs
- Periodic Asynchrony: An On-Policy Approach for Accelerating LLM Reinforcement Learning
- VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
- SCoTER: Structured Chain-of-Thought Transfer for Enhanced Recommendation
- Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents
- Towards Efficient VLMs: Information-Theoretic Driven Compression via Adaptive Structural Pruning
- Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
- VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL
- Eliciting Chain-of-Thought in Base LLMs via Gradient-Based Representation Optimization
- Efficient Multi-Hop Question Answering over Knowledge Graphs via LLM Planning and Embedding-Guided Search
- An Invariant Latent Space Perspective on Language Model Inversion
- NEZHA: A Zero-sacrifice and Hyperspeed Decoding Architecture for Generative Recommendations
- What Helps Language Models Predict Human Beliefs: Demographics or Prior Stances?
- MindEval: Benchmarking Language Models on Multi-turn Mental Health Support
- MagicWand: A Universal Agent for Generation and Evaluation Aligned with User Preference
- AnyExperts: On-Demand Expert Allocation for Multimodal Language Models with Mixture of Expert
- Can Large Language Models Reason About Complex Execution Paths? An Empirical Study on Python
- Skypilot: Fine-Tuning LLM with Physical Grounding for AAV Coverage Search
- ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
- LLM Assisted Coding with Metamorphic Specification Mutation Agent
- VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging
- SPINE: Token-Selective Test-Time Reinforcement Learning with Entropy-Band Regularization
- FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Routing-Aware Token Pruning
- Equivalence of Context and Parameter Updates in Modern Transformer Blocks
- Deterministic Inference across Tensor Parallel Sizes That Eliminates Training-Inference Mismatch
- PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
- MultiGA: Leveraging Multi-Source Seeding in Genetic Algorithms
- A cross-species neural foundation model for end-to-end speech decoding
- M3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark
- HALO: High-Altitude Language-Conditioned Monocular Aerial Exploration and Navigation
- Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models
- IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation
- Estonian WinoGrande Dataset: Comparative Analysis of LLM Performance on Human and Machine Translation
- Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions
- R2Q: Towards Robust 2-Bit Large Language Models via Residual Refinement Quantization
- Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
- ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
- HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation
- OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
- MultiPriv: Benchmarking Individual-Level Privacy Reasoning in Vision-Language Models
- PathAgent: Toward Interpretable Analysis of Whole-slide Pathology Images via Large Language Model-based Agentic Reasoning
- Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation
- Lost in Translation and Noise: A Deep Dive into the Failure Modes of VLMs on Real-World Tables
- Learning to Think Fast and Slow for Visual Language Models
- Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO
- You Only Forward Once: An Efficient Compositional Judging Paradigm
- TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
- An Efficient LLM-based Evolutional Recommendation with Locate-Forget-Update Paradigm
- The Impact of Quantization on Large Reasoning Model Reinforcement Learning
- "To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
- Fast LLM Post-training via Decoupled and Fastest-of-N Speculation
- Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight
- JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
- Multidimensional Rubric-oriented Reward Model Learning via Geometric Projection Reference Constraints
- MuISQA: Multi-Intent Retrieval-Augmented Generation for Scientific Question Answering
- Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
- ChemLabs on ChemO: A Multi-Agent System for Multimodal Reasoning on IChO 2025
- Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning
- Think Visually, Reason Textually: Vision-Language Synergy in ARC
- Insight-A: Attribution-aware for Multimodal Misinformation Detection
- SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
- HV-Attack: Hierarchical Visual Attack for Multimodal Retrieval Augmented Generation
- IPR-1: Interactive Physical Reasoner
- Unveiling Inference Scaling for Difference-Aware User Modeling in LLM Personalization
- CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution
- Zero-Shot Open-Vocabulary Human Motion Grounding with Test-Time Training
- Enhancing Reliability across Short and Long-Form QA via Reinforcement Learning
- EntroPIC: Towards Stable Long-Term Training of LLMs via Entropy Stabilization with Proportional-Integral Control
- Finetuning LLMs for Automatic Form Interaction on Web-Browser in Selenium Testing Framework
- Teaching According to Students' Aptitude: Personalized Mathematics Tutoring via Persona-, Memory-, and Forgetting-Aware LLMs
- HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning
- MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
- AutoTool: Efficient Tool Selection for Large Language Model Agents
- ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing
- From Topology to Behavioral Semantics: Enhancing BGP Security by Understanding BGP's Language with LLMs
- Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement Learning
- ATLAS: A High-Difficulty, Multidisciplinary Benchmark for Frontier Scientific Reasoning
- ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation
- LogPurge: Log Data Purification for Anomaly Detection via Rule-Enhanced Filtering
- Jailbreaking Large Vision Language Models in Intelligent Transportation Systems
- TaoSearchEmb: A Multi-Objective Reinforcement Learning Framework for Dense Retrieval in Taobao Search
- P1: Mastering Physics Olympiads with Reinforcement Learning
- Beyond SELECT: A Comprehensive Taxonomy-Guided Benchmark for Real-World Text-to-SQL Translation
- Dropouts in Confidence: Moral Uncertainty in Human-LLM Alignment
- SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design
- Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation
- Cog-RAG: Cognitive-Inspired Dual-Hypergraph with Theme Alignment Retrieval-Augmented Generation
- OTARo: Once Tuning for All Precisions toward Robust On-Device LLMs
- MedGEN-Bench: Contextually entangled benchmark for open-ended multimodal medical generation
- TPS-Bench: Evaluating AI Agents' Tool Planning & Scheduling Abilities in Compounding Tasks
- BARD: budget-aware reasoning distillation
- "Don't Teach Minerva": Guiding LLMs Through Complex Syntax for Faithful Latin Translation with RAG
- HEDGE: Hallucination Estimation via Dense Geometric Entropy for VQA with Vision-Language Models
- Don't Think of the White Bear: Ironic Negation in Transformer Models Under Cognitive Load
- Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
- Fast Reasoning Segmentation for Images and Videos
- Reward and Guidance through Rubrics: Promoting Exploration to Improve Multi-Domain Reasoning
- MoralReason: Generalizable Moral Decision Alignment For LLM Agents Using Reasoning-Level Reinforcement Learning
- Better LLM Reasoning via Dual-Play
- MedPT: A Massive Medical Question Answering Dataset for Brazilian-Portuguese Speakers
- Rethinking Deep Alignment Through The Lens Of Incomplete Learning
- MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering
- MetaGDPO: Alleviating Catastrophic Forgetting with Metacognitive Knowledge through Group Direct Preference Optimization
- KVSwap: Disk-aware KV Cache Offloading for Long-Context On-device Inference
- VULPO: Context-Aware Vulnerability Detection via On-Policy LLM Optimization
- On the Notion that Language Models Reason
- MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling
- STaR: Towards Cognitive Table Reasoning via Slow-Thinking Large Language Models
- GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models
- ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
- SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation
- LocalBench: Benchmarking LLMs on County-Level Local Knowledge and Reasoning
- How Small Can You Go? Compact Language Models for On-Device Critical Error Detection in Machine Translation
- Enhancing the Medical Context-Awareness Ability of LLMs via Multifaceted Self-Refinement Learning
- Uncovering Strategic Egoism Behaviors in Large Language Models
- Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis for Large Reasoning Models
- Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models
- Steering Pretrained Drafters during Speculative Decoding
- Mastering Olympiad-Level Physics with Artificial Intelligence
- Black-Box On-Policy Distillation of Large Language Models
- ChineseErrorCorrector3-4B: State-of-the-Art Chinese Spelling and Grammar Corrector
- ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset
- Vendor-Aware Industrial Agents: RAG-Enhanced LLMs for Secure On-Premise PLC Code Generation
- Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models
- Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models
- AlphaResearch: Accelerating New Algorithm Discovery with Language Models
- Knowledge-Augmented Long-CoT Generation for Complex Biomolecular Reasoning
- ImagebindDC: Compressing Multi-modal Data with Imagebind-based Condensation
- Information Capacity: Evaluating the Efficiency of Large Language Models via Text Compression
- MSCR: Exploring the Vulnerability of LLMs' Mathematical Reasoning Abilities Using Multi-Source Candidate Replacement
- State of the Art in Text Classification for South Slavic Languages: Fine-Tuning or Prompting?
- Libra-MIL: Multimodal Prototypes Stereoscopic Infused with Task-specific Language Priors for Few-shot Whole Slide Image Classification
- Exploring the Underwater World Segmentation without Extra Training
- Streaming Tensor Program: A streaming abstraction for dynamic parallelism
- TreeWriter: AI-Assisted Hierarchical Planning and Writing for Long-Form Documents
- RedOne 2.0: Rethinking Domain-specific LLM Post-Training in Social Networking Services
- Selecting Auxiliary Data via Neural Tangent Kernels for Low-Resource Domains
- IterResearch: Rethinking Long-Horizon Agents via Markovian State Reconstruction
- When Bias Pretends to Be Truth: How Spurious Correlations Undermine Hallucination Detection in LLMs
- Think Consistently, Reason Efficiently: Energy-Based Calibration for Implicit Chain-of-Thought
- SRNN: Spatiotemporal Relational Neural Network for Intuitive Physics Understanding
- Data Trajectory Alignment for LLM Domain Adaptation: A Two-Phase Synthesis Framework for Telecommunications Mathematics
- RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
- FedRW: Efficient Privacy-Preserving Data Reweighting for Enhancing Federated Learning of Language Models
- Route Experts by Sequence, not by Token
- SAR-LM: Symbolic Audio Reasoning with Large Language Models
- DyKAF: Dynamical Kronecker Approximation of the Fisher Information Matrix for Gradient Preconditioning
- When AI Agents Collude Online: Financial Fraud Risks by Collaborative LLM Agents on Social Platforms
- DRIVE: Data Curation Best Practices for Reinforcement Learning with Verifiable Reward in Competitive Code Generation
- LPFQA: A Long-Tail Professional Forum-based Benchmark for LLM Evaluation
- ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
- Overview of CHIP 2025 Shared Task 2: Discharge Medication Recommendation for Metabolic Diseases Based on Chinese Electronic Health Records
- ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models
- NURBGen: High-Fidelity Text-to-CAD Generation through LLM-Driven NURBS Modeling
- LUT-LLM: Efficient Large Language Model Inference with Memory-based Computations on FPGAs
- Tiny Model, Big Logic: Diversity-Driven Optimization Elicits Large-Model Reasoning Ability in VibeThinker-1.5B
- LLaDA-Rec: Discrete Diffusion for Parallel Semantic ID Generation in Generative Recommendation
- Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning
- Klear-AgentForge: Forging Agentic Intelligence through Posttraining Scaling
- In-depth Analysis on Caching and Pre-fetching in Mixture of Experts Offloading
- Retrieval-Augmented Generation in Medicine: A Scoping Review of Technical Implementations, Clinical Applications, and Ethical Considerations
- FusionLog: Cross-System Log-based Anomaly Detection via Fusion of General and Proprietary Knowledge
- CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization
- Steering Language Models with Weight Arithmetic
- The Peril of Preference: Why GRPO fails on Ordinal Rewards
- Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results
- Deep Progressive Training: scaling up depth capacity of zero/one-layer models
- iFlyBot-VLM Technical Report
- Too Good to be Bad: On the Failure of LLMs to Role-Play Villains
- LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
- Motif 2 12.7B technical report
- Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale
- Explore Data Left Behind in Reinforcement Learning for Reasoning Language Models
- Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
- Enabling Dynamic Sparsity in Quantized LLM Inference
- Learning to reason about rare diseases through retrieval-augmented agents
- NVIDIA Nemotron Nano V2 VL
- GRAD: Graph-Retrieved Adaptive Decoding for Hallucination Mitigation
- LiveTradeBench: Seeking Real-World Alpha with Large Language Models
- AnchorTP: Resilient LLM Inference with State-Preserving Elastic Tensor Parallelism
- A Feedback-Control Framework for Efficient Dataset Collection from In-Vehicle Data Streams
- From Five Dimensions to Many: Large Language Models as Precise and Interpretable Psychological Profilers
- SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators
- Benchmarking the Thinking Mode of Multimodal Large Language Models in Clinical Tasks
- Discourse-Aware Scientific Paper Recommendation via QA-Style Summarization and Multi-Level Contrastive Learning
- Do Androids Dream of Unseen Puppeteers? Probing for a Conspiracy Mindset in Large Language Models
- MiRAGE: Misconception Detection with Retrieval-Guided Multi-Stage Reasoning and Ensemble Fusion
- AthenaBench: A Dynamic Benchmark for Evaluating LLMs in Cyber Threat Intelligence
- POLIS-Bench: Towards Multi-Dimensional Evaluation of LLMs for Bilingual Policy Tasks in Governmental Scenarios
- Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning
- Deep Ideation: Designing LLM Agents to Generate Novel Research Ideas on Scientific Concept Network
- Opportunistic Expert Activation: Batch-Aware Expert Routing for Faster Decode Without Retraining
- FATE: A Formal Benchmark Series for Frontier Algebra of Multiple Difficulty Levels
- Beyond Single Embeddings: Capturing Diverse Targets with Multi-Query Retrieval
- Rethinking LLM Human Simulation: When a Graph is What You Need
- DL4Proteins Jupyter Notebooks Teach how to use Artificial Intelligence for Biomolecular Structure Prediction and Design
- Prompt-R1: Collaborative Automatic Prompting Framework via End-to-end Reinforcement Learning
- The Riddle of Reflection: Evaluating Reasoning and Self-Awareness in Multilingual LLMs using Indian Riddles
- FlexiCache: Leveraging Temporal Stability of Attention Heads for Efficient KV Cache Management
- Pay for The Second-Best Service: A Game-Theoretic Approach Against Dishonest LLM Providers
- AGRAG: Advanced Graph-based Retrieval-Augmented Generation for LLMs
- Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
- A Systematic Literature Review of Code Hallucinations in LLMs: Characterization, Mitigation Methods, Challenges, and Future Directions for Reliable AI
- DTS: Enhancing Large Reasoning Models via Decoding Tree Sketching
- Leveraging the Cross-Domain & Cross-Linguistic Corpus for Low Resource NMT: A Case Study On Bhili-Hindi-English Parallel Corpus
- Saliency-R1: Incentivizing Unified Saliency Reasoning Capability in MLLM with Confidence-Guided Reinforcement Learning
- VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning
- MedRECT: A Medical Reasoning Benchmark for Error Correction in Clinical Texts
- Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
- PETAR: Localized Findings Generation with Mask-Aware Vision-Language Modeling for PET Automated Reporting
- On Selecting Few-Shot Examples for LLM-based Code Vulnerability Detection
- Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval
- MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
- FinPos: A Position-Aware Trading Agent System for Real Financial Markets
- MoRE: 3D Visual Geometry Reconstruction Meets Mixture-of-Experts
- LongCat-Flash-Omni Technical Report
- Diffusion LLMs are Natural Adversaries for any LLM
- Fints: Efficient Inference-Time Personalization for LLMs with Fine-Grained Instance-Tailored Steering
- Detecting Data Contamination in LLMs via In-Context Learning
- Value Drifts: Tracing Value Alignment During LLM Post-Training
- The Era of Agentic Organization: Learning to Organize with Language Models
- Agentic AI Home Energy Management System: A Large Language Model Framework for Residential Load Scheduling
- Emu3.5: Native Multimodal Models are World Learners
- InfoFlow: Reinforcing Search Agent Via Reward Density Optimization
- Rethinking Text-to-SQL: Dynamic Multi-turn SQL Interaction for Real-world Database Exploration
- ReSpec: Towards Optimizing Speculative Decoding in Reinforcement Learning Systems
- OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
- Chain-of-Thought Hijacking
- BOTS: A Unified Framework for Bayesian Online Task Selection in LLM Reinforcement Finetuning
- Empowering RepoQA-Agent based on Reinforcement Learning Driven by Monte-carlo Tree Search
- EgoExo-Con: Exploring View-Invariant Video Temporal Understanding
- QuantumBench: A Benchmark for Quantum Problem Solving
- Limits of Generalization in RLVR: Two Case Studies in Mathematical Reasoning
- PORTool: Tool-Use LLM Training with Rewarded Tree
- NeuronMM: High-Performance Matrix Multiplication for LLM Inference on AWS Trainium
- Revisiting Multilingual Data Mixtures in Language Model Pretraining
- Agentic Economic Modeling
- EHR-R1: A Reasoning-Enhanced Foundational Language Model for Electronic Health Record Analysis
- INT v.s. FP: A Comprehensive Study of Fine-Grained Low-bit Quantization Formats
- Zero Reinforcement Learning Towards General Domains
- Alibaba International E-commerce Product Search Competition DcuRAGONs Team Technical Report
- MemTX: Transactional Belief Commit for Stateful Agent Memory
- MemSFT: Mitigating Alignment Tax with an External Parametric Memory
- NormWorlds-CF: Solver-Verified Counterfactual Normative Reasoning with Metamorphic-Relation GRPO
- PILA: Plug-and-Play Insertion for LLM-native Advertising
- A Low-Cost Human-in-the-Loop Investigation of Toxicity on GitHub at Scale
- CARE: A Multimodal Corpus for Studying Speech and Non-Verbal Communication Across Multiple Medical Conditions
- HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
- DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space
- OrchBench: Evaluating Multi-Agent Orchestration Plans in Isolation via Deterministic Simulation
- LLM-as-a-Verifier: A General-Purpose Verification Framework
- From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models
- Voice Memory for Agentic Speech Recognition
- Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning
- ASARL: Autonomous Social-Aware Relevance Learning for QQ Search
- Living-Harness Is an Interactive-Agent Evolver
- Weak-to-Strong On-Policy Distillation
- DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues
- RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention
- EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
- Supporting Workflow Reproducibility by Linking Bioinformatics Tools across Papers and Executable Code
- SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution
- Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions
- ElasticMoE: An Efficient Auto Scaling Method for Mixture-of-Experts Models
- AgentSnare: Learning to Delay, Divert, and Defuse Autonomous Penetration Agents
- Latent-IM: Latent Interaction Management for Speech LLMs
- KletterMix: Climbing Toward High-Quality German Pretraining Data - The Full Report
- Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models
- The Scaling Properties of Implicit Deductive Reasoning in Transformers
- MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs
- ThriftAttention: Selective Mixed Precision for Long-Context FP4 Attention
- HRM-Text: Efficient Pretraining Beyond Scaling
- Expanding LLM Agent Boundaries with Strategy-Guided Exploration
- Structured Belief State and the First Precision-Aware Benchmark for LLM Memory Retrieval
- AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
- Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale
- Solving Physics Olympiad via Reinforcement Learning on Physics Simulators
- CresOWLve: Benchmarking Creative Problem-Solving Over Real-World Knowledge
- Understanding LoRA as Knowledge Memory: An Empirical Analysis
- SG-CoT: An Ambiguity-Aware Robotic Planning Framework using Scene Graph Representations
- Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration
- Prior Knowledge Makes It Possible: From Sublinear Graph Algorithms to LLM Test-Time Methods
- Atom-anchored LLMs speak Chemistry: A Retrosynthesis Demonstration
- Speech-XL: Towards Long-Form Speech Understanding in Large Speech Language Models
- NeurIPT: Foundation Model for Neural Interfaces
- RL makes MLLMs see better than SFT
- PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
- Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety
- Better Call Grep: Evaluating and Improving Grep-Like Lexical Retrieval for Repository-Level Code Completion
- DialectLLM: A Dialect-Aware Dialog[ue] Generation Framework Beyond Standard American English
- MoEntwine: Unleashing the Potential of Wafer-scale Chips for Large-scale Expert Parallel Inference
- Sharpness-Guided Group Relative Policy Optimization via Probability Shaping
- Beyond Length: Quantifying Long-Range Information for Long-Context LLM Pretraining Data
- RAVR: Reference-Answer-guided Variational Reasoning for Large Language Models
- NanoVLA: Routing Decoupled Vision-Language Understanding for Nano-sized Generalist Robotic Policies
- Uniform Discrete Diffusion with Metric Path for Video Generation
- Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents
- Tongyi DeepResearch Technical Report
- AgentFold: Long-Horizon Web Agents with Proactive Context Management
- AgentFrontier: Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data Synthesis
- STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence
- SPICE: Self-Play In Corpus Environments Improves Reasoning
- FunReason-MT Technical Report: Advanced Data Synthesis Solution for Real-world Multi-Turn Tool-use
- ReForm: Reflective Autoformalization with Prospective Bounded Sequence Optimization
- OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
- APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training
- Synergizing chemical and AI communities for advancing laboratories of the future
- ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
- Reinforcement Learning for Long-Horizon Multi-Turn Search Agents
- Conflict Adaptation in Vision-Language Models
- ChessQA: Evaluating Large Language Models for Chess Understanding
- SelecTKD: Selective Token-Weighted Knowledge Distillation for LLMs
- Key and Value Weights Are Probably All You Need: On the Necessity of the Query, Key, Value weight Triplet in Decoder-Only Transformers
- DynaStride: Dynamic Stride Windowing with MMCoT for Instructional Multi-Scene Captioning
- ReviewGuard: Enhancing Deficient Peer Review Detection via LLM-Driven Data Augmentation
- Magentic Marketplace: An Open-Source Environment for Studying Agentic Markets
- MUStReason: A Benchmark for Diagnosing Pragmatic Reasoning in Video-LMs for Multimodal Sarcasm Detection
- JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence
- Dexbotic: Open-Source Vision-Language-Action Toolbox
- VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
- Learning to Reason Efficiently with Discounted Reinforcement Learning
- MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding
- Revisiting Multimodal Positional Encoding in Vision-Language Models
- Lost in Tokenization: Context as the Key to Unlocking Biomolecular Understanding in Scientific LLMs
- Knocking-Heads Attention
- Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts
- From Prompt Optimization to Multi-Dimensional Credibility Evaluation: Enhancing Trustworthiness of Chinese LLM-Generated Liver MRI Reports
- CodeAD: Synthesize Code of Rules for Log-based Anomaly Detection with LLMs
- CompressionAttack: Exploiting Prompt Compression as a New Attack Surface in LLM-Powered Agents
- Batch Speculative Decoding Done Right
- Sparsity and Superposition in Mixture of Experts
- Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
- REVISION:Reflective Intent Mining and Online Reasoning Auxiliary for E-commerce Visual Search System Optimization
- RoboSVG: A Unified Framework for Interactive SVG Generation with Multi-modal Guidance
- FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning
- E2Rank: Your Text Embedding can Also be an Effective and Efficient Listwise Reranker
- SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery
- The Structural Scalpel: Automated Contiguous Layer Pruning for Large Language Models
- Modeling Hierarchical Thinking in Large Reasoning Models
- DynaSolidGeo: A Dynamic Benchmark for Genuine Spatial Mathematical Reasoning of VLMs in Solid Geometry
- SteerX: Disentangled Steering for LLM Personalization
- PACR: Progressively Ascending Confidence Reward for LLM Reasoning
- Emotions Where Art Thou: Understanding and Characterizing the Emotional Latent Space of Large Language Models
- OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
- Performance Trade-offs of Optimizing Small Language Models for E-Commerce
- Adversarial Déjà Vu: Jailbreak Dictionary Learning for Stronger Generalization to Unseen Attacks
- A Data-Centric Approach to Multilingual E-Commerce Product Search: Case Study on Query-Category and Query-Item Relevance
- PhysWorld: From Real Videos to World Models of Deformable Objects via Physics-Aware Demonstration Synthesis
- Flight Delay Prediction via Cross-Modality Adaptation of Large Language Models and Aircraft Trajectory Representation
- Magellan: Guided MCTS for Latent Space Exploration and Novelty Generation
- Multi-turn Training with Basic Human Feedback Helps Little on LLM Reasoning
- Understanding Network Behaviors through Natural Language Question-Answering
- Large Language Models Meet Text-Attributed Graphs: A Survey of Integration Frameworks and Applications
- Designing and Evaluating Hint Generation Systems for Science Education
- Bridging Language Gaps with Adaptive RAG: Improving Indonesian Language Question Answering
- The Virtues of Brevity: Avoid Overthinking in Parallel Test-Time Reasoning
- Customizing Open Source LLMs for Quantitative Medication Attribute Extraction across Heterogeneous EHR Systems
- Thought Communication in Multiagent Collaboration
- Generalizable Reasoning through Compositional Energy Minimization
- Assessing the Political Fairness of Multilingual LLMs: A Case Study based on a 21-way Multiparallel EuroParl Dataset
- GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs
- Teaching Language Models to Reason with Tools
- Citation Failure: Definition, Analysis and Efficient Mitigation
- PartNeXt: A Next-Generation Dataset for Fine-Grained and Hierarchical 3D Part Understanding
- Rank-GRPO: Training LLM-based Conversational Recommender Systems with Reinforcement Learning
- Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding
- SpeechAgent: An End-to-End Mobile Infrastructure for Speech Impairment Assistance
- AsyncHZP: Hierarchical ZeRO Parallelism with Asynchronous Scheduling for Scalable LLM Training
- BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models
- Code-enabled language models can outperform reasoning models on diverse tasks
- Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
- Analyticup E-commerce Product Search Competition Technical Report from Team TredenceAICOE
- Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning
- HybridEP: Scaling Expert Parallelism to Cross-Datacenter Scenario via Hybrid Expert/Data Transmission
- Not-a-Bandit: Provably No-Regret Drafter Selection in Speculative Decoding for LLMs
- From Forecasting to Planning: Policy World Model for Collaborative State-Action Prediction
- Style Attack Disguise: When Fonts Become a Camouflage for Adversarial Intent
- ELUTQ: Efficient LUT-Aware Quantization for Deploying Large Language Models on Edge Devices
- AutoMT: A Multi-Agent LLM Framework for Automated Metamorphic Testing of Autonomous Driving Systems
- Restoring Pruned Large Language Models via Lost Component Compensation
- MoE-Prism: Disentangling Monolithic Experts for Elastic MoE Services via Model-System Co-Designs
- GAPO: Robust Advantage Estimation for Real-World Code LLMs
- The Zero-Step Thinking: An Empirical Study of Mode Selection as Harder Early Exit in Reasoning Models
- Tibetan Language and AI: A Comprehensive Survey of Resources, Methods and Challenges
- LoongRL: Reinforcement Learning for Advanced Reasoning over Long Contexts
- DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference
- ARA: Adaptive Rank Allocation for Efficient Large Language Model SVD Compression
- LyriCAR: A Difficulty-Aware Curriculum Reinforcement Learning Framework For Controllable Lyric Translation
- SheetBrain: A Neuro-Symbolic Agent for Accurate Reasoning over Complex and Large Spreadsheets
- RailS: Load Balancing for All-to-All Communication in Distributed Mixture-of-Experts Training
- Every Attention Matters: An Efficient Hybrid Architecture for Long-Context Reasoning
- Are they lovers or friends? Evaluating LLMs' Social Reasoning in English and Korean Dialogues
- Can Reasoning Models Obfuscate Reasoning? Stress-Testing Chain-of-Thought Monitorability
- Search Self-play: Pushing the Frontier of Agent Capability without Supervision
- One Size Fits All? A Modular Adaptive Sanitization Kit (MASK) for Customizable Privacy-Preserving Phone Scam Detection
- Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients
- AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering
- MENTOR: A Reinforcement Learning Framework for Enabling Tool Use in Small Models via Teacher-Optimized Rewards
- UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
- Genesis: Evolving Attack Strategies for LLM Web Agent Red-Teaming
- Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
- EdgeReasoning: Characterizing Reasoning LLM Deployment on Edge GPUs
- StreamingTOM: Streaming Token Compression for Efficient Video Understanding
- Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs
- ActivationReasoning: Logical Reasoning in Latent Activation Spaces
- MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training
- PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions
- ChronoPlay: A Framework for Modeling Dual Dynamics and Authenticity in Game RAG Benchmarks
- UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding
- Hearing Health in Home Healthcare: Leveraging LLMs for Illness Scoring and ALMs for Vocal Biomarker Extraction
- Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
- LLM-as-a-Prophet: Understanding Predictive Intelligence with Prophet Arena
- Deep Self-Evolving Reasoning
- ReXMoE: Reusing Experts with Minimal Overhead in Mixture-of-Experts
- Disparities in Multilingual LLM-Based Healthcare Q&A
- EvoSyn: Generalizable Evolutionary Data Synthesis for Verifiable Learning
- Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
- Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations
- StreamingThinker: Large Language Models Can Think While Reading
- Rethinking On-policy Optimization for Query Augmentation
- Robustness in Text-Attributed Graph Learning: Insights, Trade-offs, and New Defenses
- Forget to Know, Remember to Use: Context-Aware Unlearning for Large Language Models
- See or Say Graphs: Agent-Driven Scalable Graph Understanding with Vision-Language Models
- Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning
- Language Confusion Gate: Language-Aware Decoding Through Model Self-Distillation
- QueST: Incentivizing LLMs to Generate Difficult Problems
- JT-Safe: Intrinsically Enhancing the Safety and Trustworthiness of LLMs
- TREAT: A Code LLMs Trustworthiness / Reliability Evaluation and Testing Framework
- MemoryBench: A Benchmark for Memory and Continual Learning in LLM Systems
- LexChain: Modeling Legal Reasoning Chains for Chinese Tort Case Analysis
- Leave It to the Experts: Detecting Knowledge Distillation via MoE Expert Signatures
- Finding Manifolds With Bilinear Autoencoders
- Structured yet Bounded Temporal Understanding in Large Language Models
- A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications
- When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling
- Neuronal Group Communication for Efficient Neural representation
- DAG-Math: Graph-of-Thought Guided Mathematical Reasoning in LLMs
- ProtoMol: Enhancing Molecular Property Prediction via Prototype-Guided Multimodal Learning
- Pursuing Minimal Sufficiency in Spatial Reasoning
- Planner and Executor: Collaboration between Discrete Diffusion And Autoregressive Models in Reasoning
- InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
- BLIP3o-NEXT: Next Frontier of Native Image Generation
- MergeMoE: Efficient Compression of MoE Models via Expert Output Merging
- Distractor Injection Attacks on Large Reasoning Models: Characterization and Defense
- MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
- Adaptive Minds: Empowering Agents with LoRA-as-Tools
- LSPO: Length-aware Dynamic Sampling for Policy Optimization in LLM Reasoning
- DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning
- LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
- Capturing Context-Aware Route Choice Semantics for Trajectory Representation Learning
- Cross-Scenario Unified Modeling of User Interests at Billion Scale
- Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning
- COIG-Writer: A High-Quality Dataset for Chinese Creative Writing with Thought Processes
- Beyond Multi-Token Prediction: Pretraining LLMs with Future Summaries
- Tawa: Automatic Warp Specialization for Modern GPUs with Asynchronous References
- xLLM Technical Report
- LLM Agents Beyond Utility: An Open-Ended Perspective
- Stealthy Dual-Trigger Backdoors: Attacking Prompt Tuning in LM-Empowered Graph Foundation Models
- ZeroFalse: Improving Precision in Static Analysis with LLMs
- Instructions are all you need: Self-supervised Reinforcement Learning for Instruction Following
- AI for Service: Proactive Assistance with AI Glasses
- Large Reasoning Embedding Models: Towards Next-Generation Dense Retrieval Paradigm
- Constraint-Driven Small Language Models Based on Agent and OpenAlex Knowledge Graph: Mining Conceptual Pathways and Discovering Innovation Points in Academic Papers
- Qwen3Guard Technical Report
- Identity-GRPO: Optimizing Multi-Human Identity-preserving Video Generation via Reinforcement Learning
- OpenEstimate: Evaluating LLMs on Reasoning Under Uncertainty with Real-World Data
- REAP the Experts: Why Pruning Prevails for One-Shot MoE compression
- BitNet Distillation
- InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
- Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
- Unlocking Public Catalogues: Instruction-Tuning LLMs for ICD Coding of German Tumor Diagnoses
- BioMedSearch: A Multi-Source Biomedical Retrieval Framework Based on LLMs
- NetMCP: Network-Aware Model Context Protocol Platform for LLM Capability Extension
- Make an Offer They Can't Refuse: Grounding Bayesian Persuasion in Real-World Dialogues without Pre-Commitment
- Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation
- Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms
- Putting on the Thinking Hats: A Survey on Chain of Thought Fine-tuning from the Perspective of Human Reasoning Mechanism
- Stable LLM Ensemble: Interaction between Example Representativeness and Diversity
- GatePro: Parameter-Free Expert Selection Optimization for Mixture-of-Experts Models
- Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking
- Towards Understanding Valuable Preference Data for Large Language Model Alignment
- CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
- Adaptive Reasoning Executor: A Collaborative Agent System for Efficient Reasoning
- The Art of Scaling Reinforcement Learning Compute for LLMs
- Max It or Miss It: Benchmarking LLM On Solving Extremal Problems
- RAG Meets Temporal Graphs: Time-Sensitive Modeling and Retrieval for Evolving Knowledge
- Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization
- Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences
- Generation Space Size: Understanding and Calibrating Open-Endedness of LLM Generations
- Demystifying Hybrid Thinking: Can LLMs Truly Switch Between Think and No-Think?
- HardcoreLogic: Challenging Large Reasoning Models with Long-tail Logic Puzzle Games
- Cautious Weight Decay
- The Harder The Better: Maintaining Supervised Fine-tuning Generalization with Less but Harder Data
- MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
- MultiFoodhat: A potential new paradigm for intelligent food quality inspection
- SAIL-Embedding Technical Report: Omni-modal Embedding Foundation Model
- MedKGEval: A Knowledge Graph-Based Multi-Turn Evaluation Framework for Open-Ended Patient Interactions with Clinical LLMs
- ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution
- Improving Text-to-Image Generation with Input-Side Inference-Time Scaling
- Are Large Reasoning Models Interruptible?
- Demystifying Reinforcement Learning in Agentic Reasoning
- ACADREASON: Exploring the Limits of Reasoning Models with Academic Research Problems
- BridgeCode: A Dual Speech Representation Paradigm for Autoregressive Zero-Shot Text-to-Speech Synthesis
- Bag of Tricks for Subverting Reasoning-based Safety Guardrails
- From to : Multidimensional Supervision of Reasoning Process for LLM Optimization
- What Generative Search Engines Like and How to Optimize Web Content Cooperatively
- Part II: ROLL Flash -- Accelerating RLVR and Agentic Training with Asynchrony
- InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models
- Automated Skill Decomposition Meets Expert Ontologies: Bridging the Granularity Gap with LLMs
- LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
- Neural Weight Compression for Language Models
- Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
- Refining Hybrid Genetic Search for CVRP via Reinforcement Learning-Finetuned LLM
- From Reasoning LLMs to BERT: A Two-Stage Distillation Framework for Search Relevance
- Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization
- Latent Refinement Decoding: Enhancing Diffusion-Based Language Models by Refining Belief States
- LogiNumSynth: Synthesizing Joint Logical-Numerical Reasoning Problems for Language Models
- Automating Structural Engineering Workflows with Large Language Model Agents
- DND: Boosting Large Language Models with Dynamic Nested Depth
- A Survey on Agentic Multimodal Large Language Models
- Judge Before Answer: Can MLLM Discern the False Premise in Question?
- Rediscovering Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning
- ExGRPO: Learning to Reason from Experience
- Direct Multi-Token Decoding
- StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
- RePro: Training Language Models to Faithfully Recycle the Web for Pretraining
- RISKTAGGER: Evidence-Guided LLM Agent for Post-Incident Forensic Analysis of Money Laundering in Web3
- Tracing the Traces: Latent Temporal Signals for Efficient and Accurate Reasoning
- SASER: Stego attacks on open-source LLMs
- LLM-Based Multi-Task Bangla Hate Speech Detection: Type, Severity, and Target
- UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language Models
- DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
- A Survey of Inductive Reasoning for Large Language Models
- TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
- Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective
- ReTabAD: A Benchmark for Restoring Semantic Context in Tabular Anomaly Detection
- Output Supervision Can Obfuscate the Chain of Thought
- ADEPT: Continual Pretraining via Adaptive Expansion and Dynamic Decoupled Tuning
- Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization
- RIPRAG: Hack a Black-box Retrieval-Augmented Generation Question-Answering System with Reinforcement Learning
- Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
- SLAP: Learning Speaker and Health-Related Representations from Natural Language Supervision
- Learning a Dense Reasoning Reward Model from Expert Demonstration via Inverse Reinforcement Learning
- Doc-to-Atom: Learning to Compile and Compose Memory Atoms
- Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning
- Sparse Query Attention (SQA): A Computationally Efficient Attention Mechanism with Query Heads Reduction
- SkillOS: Learning Skill Curation for Self-Evolving Agents
- On the Quantization Robustness of Diffusion Language Models in Coding Benchmarks
- Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL
- Synthetic Sandbox for Training Machine Learning Engineering Agents
- The Geometry of Reasoning: Flowing Logics in Representation Space
- NCCL EP: Towards a Unified Expert Parallel Communication API for NCCL
- PostTrainBench: Can LLM Agents Automate LLM Post-Training?
- Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search
- Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs
- HIPPD: Brain-Inspired Hierarchical Information Processing for Personality Detection
- Format Inertia: A Failure Mechanism of LLMs in Medical Pre-Consultation
- Prompting Test-Time Scaling Is A Strong LLM Reasoning Data Augmentation
- LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?
- AutoPR: Let's Automate Your Academic Promotion!
- FreeViS: Training-free Video Stylization with Inconsistent References
- Spotlight on Token Perception for Multimodal Reinforcement Learning
- When Retrieval Succeeds and Fails: Rethinking Retrieval-Augmented Generation for LLMs
- InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation
- Cross-Representation Benchmarking in Time-Series Electronic Health Records for Clinical Outcome Prediction
- SHERLOCK: Towards Dynamic Knowledge Adaptation in LLM-enhanced E-commerce Risk Management
- DualResearch: Entropy-Gated Dual-Graph Retrieval for Answer Reconstruction
- On the Provable Performance Guarantee of Efficient Reasoning Models
- When LLM Agents Meet Graph Optimization: An Automated Data Quality Improvement Approach
- PairSem: LLM-Guided Pairwise Semantic Matching for Scientific Document Retrieval
- Diffusion-Inspired Masked Fine-Tuning for Knowledge Injection in Autoregressive LLMs
- Coordinates from Context: Using LLMs to Ground Complex Location References
- Thinking Longer, Not Always Smarter: Evaluating LLM Capabilities in Hierarchical Legal Reasoning
- Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
- FlowSearch: Advancing deep research with dynamic structured knowledge flow
- First Try Matters: Revisiting the Role of Reflection in Reasoning Models
- Kelp: A Streaming Safeguard for Large Models via Latent Dynamics-Guided Risk Detection
- Neuron-Level Analysis of Cultural Understanding in Large Language Models
- Opponent Shaping in LLM Agents
- AI Knowledge Assist: An Automated Approach for the Creation of Knowledge Bases for Conversational AI Agents
- VoiceAgentBench: Are Voice Assistants ready for agentic tasks?
- Active Confusion Expression in Large Language Models: Leveraging World Models toward Better Social Reasoning
- SHE: Stepwise Hybrid Examination Reinforcement Learning Framework for E-commerce Search Relevance
- GCPO: When Contrast Fails, Go Gold
- Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
- ToolLibGen: Scalable Automatic Tool Creation and Aggregation for LLM Reasoning
- Test-Time Reasoners Are Strategic Multiple-Choice Test-Takers
- OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
- ToolExpander: Extending the Frontiers of Tool-Using Reinforcement Learning to Weak LLMs
- MemWeaver: A Hierarchical Memory from Textual Interactive Behaviors for Personalized Generation
- R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?
- Struc-EMB: The Potential of Structure-Aware Encoding in Language Embeddings
- MeSH: Memory-as-State-Highways for Recursive Transformers
- AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?
- Beyond Pass@k: Breadth-Depth Metrics for Reasoning Boundaries
- Self-Improving LLM Agents at Test-Time
- SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training
- Beyond Sunk Costs: Boosting LLM Pre-training Efficiency via Orthogonal Growth of Mixture-of-Experts
- Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
- PEAR: Phase Entropy Aware Reward for Efficient Reasoning
- Prepared mind, fast response: A temporal decoupling framework for adaptive knowledge orchestration in open-domain dialogue
- Beyond Textual CoT: Interleaved Text-Image Chains with Deep Confidence Reasoning for Image Editing
- Training-Free Group Relative Policy Optimization
- Chain-of-Trigger: An Agentic Backdoor that Paradoxically Enhances Agentic Robustness
- Haystack Engineering: Context Engineering for Heterogeneous and Agentic Long-Context Evaluation
- Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
- Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts
- Sunflower: A New Approach To Expanding Coverage of African Languages in Large Language Models
- AMAS: Adaptively Determining Communication Topology for LLM-based Multi-Agent System
- TALENT: Table VQA via Augmented Language-Enhanced Natural-text Transcription
- Accelerating Diffusion LLM Inference via Local Determinism Propagation
- VRPAgent: LLM-Driven Discovery of Heuristic Operators for Vehicle Routing Problems
- Search-R3: Unifying Reasoning and Embedding in Large Language Models
- LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
- Autoformalizer with Tool Feedback
- OpenJAI-v1.0: An Open Thai Large Language Model
- PERSONA: Dynamic and Compositional Inference-Time Personality Control via Activation Vector Algebra
- Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
- Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
- On Randomness in Agentic Evals
- CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
- IoDResearch: Deep Research on Private Heterogeneous Data via the Internet of Data
- Mid-Training of Large Language Models: A Survey
- Efficient numeracy in language models through single-token number embeddings
- FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline
- From Simulation to Strategy: Automating Personalized Interaction Planning for Conversational Agents
- SanDRA: Safe Large-Language-Model-Based Decision Making for Automated Vehicles Using Reachability Analysis
- XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation
- The Markovian Thinker: Architecture-Agnostic Linear Scaling of Reasoning
- Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them
- AsyncSpade: Efficient Test-Time Scaling with Asynchronous Sparse Decoding
- TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics
- SIGMA-GEN: Structure and Identity Guided Multi-subject Assembly for Image Generation
- Off-Trajectory Reasoning: Can LLMs Collaborate on Reasoning Trajectory?
- EVALUESTEER: Measuring Reward Model Steerability Towards Values and Preferences
- Reference Grounded Skill Discovery
- SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence Generation
- Pushing Test-Time Scaling Limits of Deep Search with Asymmetric Verification
- ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models
- Revisiting Long-context Modeling from Context Denoising Perspective
- Luth: Efficient French Specialization for Small Language Models and Cross-Lingual Transfer
- OneVision: An End-to-End Generative Framework for Multi-view E-commerce Vision Search
- ARMOR: High-Performance Semi-Structured Pruning via Adaptive Matrix Factorization
- LANTERN: Scalable Distillation of Large Language Models for Job-Person Fit and Explanation
- MixReasoning: Switching Modes to Think
- Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs
- When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL
- Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
- Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference
- Adversarial Reinforcement Learning for Large Language Model Agent Safety
- Boomerang Distillation Enables Zero-Shot Model Size Interpolation
- Let it Calm: Exploratory Annealed Decoding for Verifiable Reinforcement Learning
- Indirect Prompt Injections: Are Firewalls All You Need, or Stronger Benchmarks?
- SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
- RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
- Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning
- MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning
- Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails
- Detecting Distillation Data from Reasoning Models
- ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs
- Multi-Agent Tool-Integrated Policy Optimization
- FocusMed: A Large Language Model-based Framework for Enhancing Medical Question Summarization with Focus Identification
- FT-MDT: Extracting Decision Trees from Medical Texts via a Novel Low-rank Adaptation Method
- EduPersona: Benchmarking Subjective Ability Boundaries of Virtual Student Agents
- Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation
- TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling
- TBStar-Edit: From Image Editing Pattern Shifting to Consistency Enhancement
- LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
- MHA-RAG: Improving Efficiency, Accuracy, and Consistency by Encoding Exemplars as Soft Prompts
- Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
- TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
- Evaluating Self-Supervised Speech Models via Text-Based LLMS
- Graph-based LLM over Semi-Structured Population Data for Dynamic Policy Response
- Hybrid Architectures for Language Models: Systematic Analysis and Design Insights
- Multilingual Routing in Mixture-of-Experts
- AlphaApollo: Orchestrating Foundation Models and Professional Tools into a Self-Evolving System for Deep Agentic Reasoning
- Pushing on Multilingual Reasoning Models with Language-Mixed Chain-of-Thought
- SPOGW: a Score-based Preference Optimization method via Group-Wise comparison for workflows
- PoLi-RL: A Point-to-List Reinforcement Learning Framework for Conditional Semantic Textual Similarity
- LH-Deception: Simulating and Understanding LLM Deceptive Behaviors in Long-Horizon Interactions
- Distilling Reasoning into Student LLMs: Local Naturalness for Selecting Teacher Data
- Searching Meta Reasoning Skeleton to Guide LLM Reasoning
- Thai Semantic End-of-Turn Detection for Real-Time Voice Agents
- Can Linear Probes Measure LLM Uncertainty?
- RESTRAIN: From Spurious Votes to Signals -- Self-Driven RL with Self-Penalization
- What Shapes a Creative Machine Mind? Comprehensively Benchmarking Creativity in Foundation Models
- Decoding Emotion in the Deep: A Systematic Study of How LLMs Represent, Retain, and Express Emotion
- PsycholexTherapy: Simulating Reasoning in Psychotherapy with Small Language Models in Persian
- Can AI Truly Represent Your Voice in Deliberations? A Comprehensive Study of Large-Scale Opinion Aggregation with LLMs
- H-DDx: A Hierarchical Evaluation Framework for Differential Diagnosis
- MITS: Enhanced Tree Search Reasoning for LLMs via Pointwise Mutual Information
- Decoupling Task-Solving and Output Formatting in LLM Generation
- Best-of-Majority: Minimax-Optimal Strategy for Pass@k Inference Scaling
- AudioToolAgent: An Agentic Framework for Audio-Language Models
- TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency
- Self-Reflective Generation at Test Time
- CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning
- A Granular Study of Safety Pretraining under Model Abliteration
- To Compress or Not? Pushing the Frontier of Lossless GenAI Model Weights Compression with Exponent Concentration
- HALO: Memory-Centric Heterogeneous Accelerator with 2.5D Integration for Low-Batch LLM Inference
- Studying the Korean Word-Chain Game with RLVR: Mitigating Reward Conflicts via Curriculum Learning
- One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework
- StepChain GraphRAG: Reasoning Over Knowledge Graphs for Multi-Hop Question Answering
- Cache-to-Cache: Direct Semantic Communication Between Large Language Models
- Energy-Regularized Sequential Model Editing on Hyperspheres
- Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?
- mR3: Multilingual Rubric-Agnostic Reward Reasoning Models
- GEM: A Gym for Agentic LLMs
- Graph-S3: Enhancing Agentic textual Graph Retrieval with Synthetic Stepwise Supervision
- Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning
- Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics
- MASH: Modeling Abstention via Selective Help-Seeking
- ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards
- Flow of Knowledge: Federated Fine-Tuning of LLMs in Healthcare under Non-IID Conditions
- MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance
- Rethinking Reward Models for Multi-Domain Test-Time Scaling
- AP2O-Coder: Adaptively Progressive Preference Optimization for Reducing Compilation and Runtime Errors in LLM-Generated Code
- Automated Structured Radiology Report Generation with Rich Clinical Context
- PAL-UI: Planning with Active Look-back for Vision-Based GUI Agents
- AbsTopK: Rethinking Sparse Autoencoders For Bidirectional Features
- Generalized Parallel Scaling with Interdependent Generations
- Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs
- Rethinking Thinking Tokens: LLMs as Improvement Operators
- Learning Compact Representations of LLM Abilities via Item Response Theory
- A-VERT: Agnostic Verification with Embedding Ranking Targets
- Exploring System 1 and 2 communication for latent reasoning in LLMs
- Training Large Language Models To Reason In Parallel With Global Forking Tokens
- ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models
- HiSpec: Hierarchical Speculative Decoding for LLMs
- From Factoid Questions to Data Product Requests: Benchmarking Data Product Discovery over Tables and Text
- Free Draft-and-Verification: Toward Lossless Parallel Decoding for Diffusion Large Language Models
- Debunk the Myth of SFT Generalization
- AgentFlux: Decoupled Fine-Tuning & Inference for On-Device Agentic Systems
- Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training
- Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark
- Training Matryoshka Mixture-of-Experts for Elastic Inference-Time Expert Utilization
- Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation
- VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
- ACT: Agentic Classification Tree
- Communication-Efficient and Accurate Approach for Aggregation in Federated Low-Rank Adaptation
- Efficient and Transferable Agentic Knowledge Graph RAG via Reinforcement Learning
- Go with Your Gut: Scaling Confidence for Autoregressive Image Generation
- SDA-PLANNER: State-Dependency Aware Adaptive Planner for Embodied Task Planning
- Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing
- Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
- Parallax: Efficient LLM Inference Service over Decentralized Environment
- Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
- MEDAKA: Construction of Biomedical Knowledge Graphs Using Large Language Models
- Agent-based code generation for the Gammapy framework
- Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline
- RoRecomp: Enhancing Reasoning Efficiency via Rollout Response Recomposition in Reinforcement Learning
- Understanding the Mixture-of-Experts with Nadaraya-Watson Kernel
- RoleConflictBench: A Benchmark of Role Conflict Scenarios for Evaluating LLMs' Contextual Sensitivity
- Lita: Light Agent Uncovers the Agentic Coding Capabilities of LLMs
- Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
- More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
- Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling
- Think Less, Label Better: Multi-Stage Domain-Grounded Synthetic Data Generation for Fine-Tuning Large Language Models in Telecommunications
- Collaborative Compression for Large-Scale MoE Deployment on Edge
- LD-MoLE: Learnable Dynamic Routing for Mixture of LoRA Experts
- TraceDet: Hallucination Detection from the Decoding Trace of Diffusion Large Language Models
- Learning to Reason as Action Abstractions with Scalable Mid-Training RL
- Thinking Sparks!: Emergent Attention Heads in Reasoning Models During Post Training
- Planner-R1: Reward Shaping Enables Efficient Agentic RL with Smaller LLMs
- VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
- LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models
- SafeMind: Benchmarking and Mitigating Safety Risks in Embodied LLM Agents
- Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks
- Understanding Generative Recommendation with Semantic IDs from a Model-scaling View
- RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs
- InfoAgent: Advancing Autonomous Information-Seeking Agents
- SIRI: Scaling Iterative Reinforcement Learning with Interleaved Compression
- UniAPL: A Unified Adversarial Preference Learning Framework for Instruct-Following
- Rethinking Entropy Regularization in Large Reasoning Models
- MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
- Scaling with Collapse: Efficient and Predictable Training of LLM Families
- jina-reranker-v3: Last but Not Late Interaction for Listwise Document Reranking
- Scaling Generalist Data-Analytic Agents
- Cogito, Ergo Ludo: An Agent that Learns to Play by Reasoning and Planning
- GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference
- CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning
- Random Policy Valuation is Enough for LLM Reasoning with Verifiable Rewards
- SecInfer: Preventing Prompt Injection via Inference-time Scaling
- The Dialogue That Heals: A Comprehensive Evaluation of Doctor Agents' Inquiry Capability
- MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes
- Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval
- Fidel-TS: A High-Fidelity Benchmark for Multimodal Time Series Forecasting
- LatentEvolve: Self-Evolving Test-Time Scaling in Latent Space
- T-POP: Test-Time Personalization with Online Preference Feedback
- Reference-Free Rating of LLM Responses via Latent Information
- Bridging Developer Instructions and Code Completion Through Instruction-Aware Fill-in-the-Middle Paradigm
- GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners
- Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention
- From Static to Dynamic: Adaptive Monte Carlo Search for Mathematical Process Supervision
- MAS2: Self-Generative, Self-Configuring, Self-Rectifying Multi-Agent Systems
- SCI-Verifier: Scientific Verifier with Thinking
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models
- Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models
- Graph Optimization Foundation Model: Tokenizing Graph via A Language-Model Paradigm
- ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
- Humanline: Online Alignment as Perceptual Loss
- Can Large Language Models Express Uncertainty Like Human?
- Negative Pre-activations Differentiate Syntax
- Your thoughts tell who you are: Characterize the reasoning patterns of LRMs
- AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play
- ARS: Adaptive Reasoning Suppression for Efficient Large Reasoning Language Models
- Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
- G-reasoner: Foundation Models for Unified Reasoning over Graph-structured Knowledge
- FreeRet: MLLMs as Training-Free Retrievers
- Reasoning or Retrieval? A Study of Answer Attribution on Large Reasoning Models
- Pretraining with hierarchical memories: separating long-tail and common knowledge
- Sequential Diffusion Language Models
- Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
- Explore-Execute Chain: Towards an Efficient Structured Reasoning Paradigm
- Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
- Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning
- Understanding Textual Capability Degradation in Speech LLMs via Parameter Importance Analysis
- AdaPtis: Reducing Pipeline Bubbles with Adaptive Pipeline Parallelism on Heterogeneous Models
- SafeSearch: Automated Red-Teaming for the Safety of LLM-Based Search Agents
- Towards a Comprehensive Scaling Law of Mixture-of-Experts
- Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs
- ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
- Fast Thinking for Large Language Models
- Emergent Slow Thinking in LLMs as Inverse Tree Freezing
- Timber: Training-free Instruct Model Refining with Base via Effective Rank
- From What to Why: A Multi-Agent System for Evidence-based Chemical Reaction Condition Reasoning
- CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems
- RIV: Recursive Introspection Mask Diffusion Vision Language Model
- Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark
- Learning to Reason in Structured In-context Environments with Reinforcement Learning
- A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models
- Tree Reward-Aligned Search for TReASURe in Masked Diffusion Language Models
- The Matthew Effect of AI Programming Assistants: A Hidden Bias in Software Evolution
- Agentic AI Reasoning for Mobile Edge General Intelligence: Fundamentals, Approaches, and Directions
- From Harm to Help: Turning Reasoning In-Context Demos into Assets for Reasoning LMs
- Test-Time Policy Adaptation for Enhanced Multi-Turn Interactions with LLMs
- C2GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning
- Multiplayer Nash Preference Optimization
- PT2-LLM: Post-Training Ternarization for Large Language Models
- Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents
- CoDA: Coding LM via Diffusion Adaptation
- Quant-dLLM: Post-Training Extreme Low-Bit Quantization for Diffusion Large Language Models
- Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks
- SINQ: Sinkhorn-Normalized Quantization for Calibration-Free Low-Precision LLM Weights
- JE-IRT: A Geometric Lens on LLM Abilities through Joint Embedding Item Response Theory
- Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning
- WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level Feedback and Step-Level Reinforcement Learning
- Hierarchical Representation Matching for CLIP-based Class-Incremental Learning
- IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning
- Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning
- EPO: Entropy-regularized Policy Optimization for LLM Agents Reinforcement Learning
- StepORLM: A Self-Evolving Framework With Generative Process Supervision For Operations Research Language Models
- REMA: A Unified Reasoning Manifold Framework for Interpreting Large Language Model
- Group Critical-token Policy Optimization for Autoregressive Image Generation
- Partial Parameter Updates for Efficient Distributed Training
- MoveFM-R: Advancing Mobility Foundation Models via Language-driven Semantic Reasoning
- Meta-Awareness Enhances Reasoning Models: Self-Alignment Reinforcement Learning
- Jailbreaking on Text-to-Video Models via Scene Splitting Strategy
- Rule-Based Reinforcement Learning for Document Image Classification with Vision Language Models
- Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
- R-Capsule: Compressing High-Level Plans for Efficient Large Language Model Reasoning
- Does Generative Retrieval Overcome the Limitations of Dense Retrieval?
- SciTS: Scientific Time Series Understanding and Generation with LLMs
- The Rogue Scalpel: Activation Steering Compromises LLM Safety
- GenesisGeo: Technical Report
- AgentPack: A Dataset of Code Changes, Co-Authored by Agents and Humans
- QoNext: Towards Next-generation QoE for Foundation Models
- No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping
- LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals
- Abductive Logical Rule Induction by Bridging Inductive Logic Programming and Multimodal Large Language Models
- SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models
- DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents
- DiTraj: training-free trajectory control for video diffusion transformer
- RobustFlow: Towards Robust Agentic Workflow Generation
- PSRT: Accelerating LRM-based Guard Models via Prefilled Safe Reasoning Traces
- Retrieval-of-Thought: Efficient Reasoning via Reusing Thoughts
- Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval
- ChatInject: Abusing Chat Templates for Prompt Injection in LLM Agents
- RLP: Reinforcement as a Pretraining Objective
- What Should I Cite? A RAG Benchmark for Academic Citation Prediction
- InvBench: Can LLMs Accelerate Program Verification with Invariant Synthesis?
- Correct Reasoning Paths Visit Shared Decision Pivots
- Plan2Evolve: LLM Self-Evolution for Improved Planning Capability via Automated Domain Generation
- A circuit for predicting hierarchical structure in-context in Large Language Models
- Expert-guided Clinical Text Augmentation via Query-Based Model Collaboration
- Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training
- On Code-Induced Reasoning in LLMs
- Dual-Head Reasoning Distillation: Improving Classifier Accuracy with Train-Time-Only Reasoning
- A State-of-the-Art SQL Reasoning Model using RLVR
- VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
- Interactive Recommendation Agent with Active User Commands
- Data-Centric Elastic Pipeline Parallelism for Efficient Long-Context LLM Training
- LLMTrace: A Corpus for Classification and Fine-Grained Localization of AI-Written Text
- Tree Search for LLM Agent Reinforcement Learning
- Bidirectional Intention Inference Enhances LLMs' Defense Against Multi-Turn Jailbreak Attacks
- Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models
- Disagreements in Reasoning: How a Model's Thinking Process Dictates Persuasion in Multi-Agent Systems
- CORE: Full-Path Evaluation of LLM Agents Beyond Final State
- RLCracker: Evaluating the Worst-Case Vulnerability of LLM Watermarks with Adaptive RL Attacks
- StyleBench: Evaluating thinking styles in Large Language Models
- SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs
- DRES: Benchmarking LLMs for Disfluency Removal
- Stability of In-Context Learning: A Spectral Coverage Perspective
- Look Before you Leap: Estimating LLM Benchmark Scores from Descriptions
- RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards
- A Fano-Style Accuracy Upper Bound for LLM Single-Pass Reasoning in Multi-Hop QA
- On Theoretical Interpretations of Concept-Based In-Context Learning
- RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs
- ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning
- FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models
- Thinking Augmented Pre-training
- From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training
- FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
- PromptCoT 2.0: Scaling Prompt Synthesis for Large Language Model Reasoning
- Future Policy Aware Preference Learning for Mathematical Reasoning
- MMedFD: A Real-world Healthcare Benchmark for Multi-turn Full-Duplex Automatic Speech Recognition
- VCRL: Variance-based Curriculum Reinforcement Learning for Large Language Models
- SKYLENAGE Technical Report: Mathematical Reasoning and Contest-Innovation Benchmarks for Multi-Level Math Evaluation
- The Conductor and the Engine: A Path Towards Co-Designed Reasoning
- LOCA: Logical Chain Augmentation for Scientific Corpus Cleaning
- Are We Scaling the Right Thing? A System Perspective on Test-Time Scaling
- Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning
- ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning
- Foundation Models for Face Presentation Attack Detection: A Unified Linear-Probing Benchmark
- Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems
- SciSchema.org: A Multidisciplinary Collection of Schemas for Structured Scientific Process Descriptions
- Interpretable Representation via LLM-Driven Generative Disentanglement for Local-Life Service Recommendation
- Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models
- TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment
- From Understanding to Action: Feedback-Grounded Policy Discovery for Generative Recommendation
- Piggybacking on Perception: Stealthy Concurrent Audio Prompt Injections against Multimodal LLM Agents
- SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer
- Towards joint scaling laws with optimal batch size schedules
- Challenges in annotations by humans and LLMs: A case study of evaluative language
- Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models
- MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing
- Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold
- Flux-OPD: On-Policy Distillation with Evolving Contexts
- OneShot: Index-in-Ranking with Neural Scoring for Large-Scale Retrieval
- A dataset of rated conceptual arguments
- BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences
- PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models
- FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training
- Divergence Decoding: Training-Free Capability Fusion
- Multi-Head Attention Residuals
- Numbers Beat Words: A Rigorous On-Premise Benchmark for Coupled MIMO Controller Tuning
- Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation
- LASAR: Latent Adaptive Semantic Aligned Reasoning for Generative Recommendation
- Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting
- OPENXRD: a comprehensive benchmark framework for LLM/MLLM XRD question answering
- Defusing the Trigger: Tail-Risk-Informed Attention Rebalancing for LLM Backdoor Mitigation
- How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data
- RELISH: LLM REgression with a Latent Iterative State Head
- LLM2Vec-Gen: Generative Embeddings from Large Language Models
- Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs
- KuaiSearch: An E-Commerce Search Dataset with Authentic Queries and Product Texts for Recall, Ranking, and Relevance
- SHINE: A Scalable In-Context Hypernetwork for Mapping Context to LoRA in a Single Pass
- AMELIA: A Family of Multi-task End-to-end Language Models for Argumentation
- ILRe: Intermediate Layer Retrieval for Context Compression in Causal Language Models
- RepoTransAgent: Multi-Agent LLM Framework for Repository-Aware Code Translation
- Proximal Supervised Fine-Tuning
- GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
- DRQA: Dynamic Reasoning Quota Allocation for Controlling Overthinking in Reasoning Large Language Models
- CEIDM: A Controlled Entity and Interaction Diffusion Model for Enhanced Text-to-Image Generation
- Reinforcement Learning on Pre-Training Data
- HyKid: An Open MRI Dataset with Expert-Annotated Multi-Structure and Choroid Plexus in Pediatric Hydrocephalus
- Agentic Reinforcement Learning with Implicit Step Rewards
- CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure
- How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective
- MAPO: Mixed Advantage Policy Optimization
- Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions
- Hyper-Bagel: A Unified Acceleration Framework for Multimodal Understanding and Generation
- F2RVLM: Boosting Fine-grained Fragment Retrieval for Multi-Modal Long-form Dialogue with Vision Language Model
- OmniBridge: Unified Multimodal Understanding, Generation, and Retrieval via Latent Space Alignment
- Teaching Audio Models to Reason: A Unified Framework for Source- and Layer-wise Distillation
- APRIL: Active Partial Rollouts in Reinforcement Learning to Tame Long-tail Generation
- SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement
- TiKMiX: Take Data Influence into Dynamic Mixture for Language Model Pre-training
- Introducing LongCat-Flash-Thinking: A Technical Report
- WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
- Enhancing the NAO: Extending Capabilities of Legacy Robots for Long-Term Research
- ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs
- AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?
- EpiCache: Episodic KV Cache Management for Long Conversational Question Answering
- Correlation or Causation: Analyzing the Causal Structures of LLM and LRM Reasoning Process
- Generalizable End-to-End Tool-Use RL with Synthetic CodeGym
- Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
- The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies
- MLLM-Driven Semantic Identifier Generation for Generative Cross-Modal Retrieval
- Expert-as-a-Service: Towards Efficient, Scalable, and Robust Large-scale MoE Serving
- Variation in Verification: Understanding Verification Dynamics in Large Language Models
- D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models
- SilentStriker:Toward Stealthy Bit-Flip Attacks on Large Language Models
- LIMI: Less is More for Agency
- Qwen3-Omni Technical Report
- Dendritic Resonate-and-Fire Neuron for Effective and Efficient Long Sequence Modeling
- TactfulToM: Do LLMs Have the Theory of Mind Ability to Understand White Lies?
- Adaptive Overclocking: Dynamic Control of Thinking Path Length via Real-Time Reasoning Signals
- Improving User Interface Generation Models from Designer Feedback
- Semi-Supervised Synthetic Data Generation with Fine-Grained Relevance Control for Short Video Search Relevance Modeling
- Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle
- TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints
- Robust LLM Training Infrastructure at ByteDance
- SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
- SLM-Based Agentic AI with P-C-G: Optimized for Korean Tool Use
- Generating High-Quality Datasets for Code Editing via Open-Source Language Models
- BaseReward: A Strong Baseline for Multimodal Reward Model
- RLinf: Flexible and Efficient Large-scale Reinforcement Learning via Macro-to-Micro Flow Transformation
- RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation
- From Who Said What to Who They Are: Modular Training-free Identity-Aware LLM Refinement of Speaker Diarization
- Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue
- MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
- Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI
- Empathy-R1: A Chain-of-Empathy and Reinforcement Learning Framework for Long-Form Mental Health Support
- RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
- Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation
- DF-LLaVA: Unlocking MLLMs for Synthetic Image Detection via Knowledge Injection and Conflict-Driven Self-Reflection
- Ticket-Bench: A Kickoff for Multilingual and Regionalized Agent Evaluation
- Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision
- Fresh in memory: Training-order recency is linearly encoded in language model activations
- TGPO: Tree-Guided Preference Optimization for Robust Web Agent Reinforcement Learning
- Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
- THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
- Thinking in a Crowd: How Auxiliary Information Shapes LLM Reasoning
- FLAME: A Serving System Optimized for Large-Scale Generative Recommendation with Efficiency
- SAIL-VL2 Technical Report
- Hala Technical Report: Building Arabic-Centric Instruction & Translation Models at Scale
- CraftMesh: High-Fidelity Generative Mesh Manipulation via Poisson Seamless Fusion
- Early Stopping Chain-of-thoughts in Large Language Models
- LLM-I: LLMs are Naturally Interleaved Multimodal Creators
- Omne-R1: Learning to Reason with Memory for Multi-hop Question Answering
- Single-stream Policy Optimization
- xOffense: An AI-driven autonomous penetration testing framework with offensive knowledge-enhanced LLMs and multi agent systems
- Toward PDDL Planning Copilot
- FedMentor: Domain-Aware Differential Privacy for Heterogeneous Federated LLMs in Mental Health
- HistoryBankQA: Multilingual Temporal Question Answering on Historical Events
- The Sum Leaks More Than Its Parts: Compositional Privacy Risks and Mitigations in Multi-Agent Collaboration
- Shaping Explanations: Semantic Reward Modeling with Encoder-Only Transformers for GRPO
- WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning
- WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research
- Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
- WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon Agents
- FastMTP: Accelerating LLM Inference with Enhanced Multi-Token Prediction
- Scaling Agents via Continual Pre-training
- A Straightforward Pipeline for Targeted Entailment and Contradiction Detection
- Biomedical Hypothesis Explainability with Graph-Based Context Retrieval
- MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs
- HARP: Hallucination Detection via Reasoning Subspace Projection
- Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking
- Fun-ASR Technical Report
- ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
- Rethinking Technology Stack Selection with AI Coding Proficiency
- WeaveMuse: An Open Agentic System for Multimodal Music Understanding and Generation
- Continually Adding New Languages to Multilingual Language Models
- Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code Generation
- Evolution of Kernels: Automated RISC-V Kernel Optimization with Large Language Models
- CultureSynth: A Hierarchical Taxonomy-Guided and Retrieval-Augmented Framework for Cultural Question-Answer Synthesis
- OpenHA: A Series of Open-Source Hierarchical Agentic Models in Minecraft
- Decoding Alignment: A Critical Survey of LLM Development Initiatives through Value-setting and Data-centric Lens
- Prompt Injection Attacks on LLM Generated Reviews of Scientific Publications
- Towards Secure and Explainable Smart Contract Generation with Security-Aware Group Relative Policy Optimization
- Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
- Towards Understanding Visual Grounding in Visual Language Models
- FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
- Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference
- Attention Layers Add Into Low-Dimensional Residual Subspaces
- Probing Pre-trained Language Models on Code Changes: Insights from ReDef, a High-Confidence Just-in-Time Defect Prediction Dataset
- MR-UIE: Multi-Perspective Reasoning with Reinforcement Learning for Universal Information Extraction
- Merge-of-Thought Distillation
- Joint Learning using Mixture-of-Expert-Based Representation for Enhanced Speech Generation and Robust Emotion Recognition
- An Iterative LLM Framework for SIBT utilizing RAG-based Adaptive Weight Optimization
- AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
- Towards Generalized Routing: Model and Agent Orchestration for Adaptive and Efficient Inference
- Query Expansion in the Age of Pre-trained and Large Language Models: A Comprehensive Survey
- Parallel-R1: Towards Parallel Thinking via Reinforcement Learning
- PatchSeeker: Mapping NVD Records to their Vulnerability-fixing Commits with LLM Generated Commits and Embeddings
- PaVeRL-SQL: Text-to-SQL via Partial-Match Rewards and Verbal Reinforcement Learning
- FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations
- WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents
- Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
- Text4Seg++: Advancing Image Segmentation via Generative Language Modeling
- SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents
- FineServe: Precision-Aware KV Slab and Two-Level Scheduling for Heterogeneous Precision LLM Serving
- LoaQ: Layer-wise Output Approximation Quantization
- Interleaving Reasoning for Better Text-to-Image Generation
- AttestLLM: Efficient Attestation Framework for Billion-scale On-device LLMs
- OmniStyle2: Learning to Stylize by Learning to Destylize
- Llama-GENBA-10B: A Trilingual Large Language Model for German, English and Bavarian
- Self-Aligned Reward: Towards Effective and Efficient Reasoners
- Sticker-TTS: Learn to Utilize Historical Experience with a Sticker-driven Test-Time Scaling Framework
- VoltanaLLM: Feedback-Driven Frequency Control and State-Space Routing for Energy-Efficient LLM Serving
- Psychologically Enhanced AI Agents
- Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?
- Singular Value Few-shot Adaptation of Vision-Language Models
- OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval
- Emergent Hierarchical Reasoning in LLMs through Reinforcement Learning
- E-ARMOR: Edge case Assessment and Review of Multilingual Optical Character Recognition
- app.build: A Production Framework for Scaling Agentic Prompt-to-App Generation with Environment Scaffolding
- OneSearch: A Preliminary Exploration of the Unified End-to-End Generative Framework for E-commerce Search
- AetherCode: Evaluating LLMs' Ability to Win In Premier Programming Competitions
- VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities
- Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers
- On Entropy Control in LLM-RL Algorithms
- FLM-Audio: Natural Monologues Improves Native Full-Duplex Chatbots via Dual Training
- Confusion is the Final Barrier: Rethinking Jailbreak Evaluation and Investigating the Real Misuse Threat of LLMs
- Implicit Reasoning in Large Language Models: A Comprehensive Survey
- CMRAG: Co-modality-based visual document retrieval and question answering
- AgentScope 1.0: A Developer-Centric Framework for Building Agentic Applications
- FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot
- Batch Query Processing and Optimization for Agentic Workflows
- GRAM-R2: Self-Training Generative Foundation Reward Models for Reward Reasoning
- Baichuan-M2: Scaling Medical Capability with Large Verifier System
- Kwai Keye-VL 1.5 Technical Report
- CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
- Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions
- The AudioMOS Challenge 2025
- ReCap: Event-Aware Image Captioning with Article Retrieval and Semantic Gaussian Normalization
- Towards Open-World Retrieval-Augmented Generation on Knowledge Graph: A Multi-Agent Collaboration Framework
- Web Fraud Attacks Against LLM-Driven Multi-Agent Systems
- GPT-OSS-20B: A Comprehensive Deployment-Centric Analysis of OpenAI's Open-Weight Mixture of Experts Model
- LongCat-Flash Technical Report
- TableZoomer: A Collaborative Agent Framework for Large-scale Table Question Answering
- A Multimodal GUI Architecture for Interfacing with LLM-Based Conversational Assistants
- Exploring and Mitigating Fawning Hallucinations in Large Language Models
- Aligning Reasoning LLMs for Materials Discovery with Physics-aware Rejection Sampling
- CoreThink: A Symbolic Reasoning Layer to reason over Long Horizon Tasks with LLMs
- Prompt the Unseen: Evaluating Visual-Language Alignment Beyond Supervision
- EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions
- Text Reinforcement for Multimodal Time Series Forecasting
- ResearchQA: Evaluating Scholarly Question Answering at Scale Across 75 Fields with Survey-Mined Questions and Rubrics
- Reflective Paper-to-Code Reproduction Enabled by Fine-Grained Verification
- Open Data Synthesis For Deep Research
- Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
- Democratizing Agentic AI with Fast Test-Time Scaling on the Edge
- PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains
- Just-in-time and distributed task representations in language models
- R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning
- Intern-S1: A Scientific Multimodal Foundation Model
- AWorld: Orchestrating the Training Recipe for Agentic AI
- GDS Agent for Graph Algorithmic Reasoning
- OneRec-V2 Technical Report
- Veritas: Generalizable Deepfake Detection via Pattern-Aware Reasoning
- Learning to Generate Unit Test via Adversarial Reinforcement Learning
- Quantum Verifiable Rewards for Post-Training Qiskit Code Assistant
- Evaluating Language Model Reasoning about Confidential Information
- Analysing Chain of Thought Dynamics: Active Guidance or Unfaithful Post-hoc Rationalisation?
- Encouraging Good Processes Without the Need for Good Answers: Reinforcement Learning for LLM Agent Planning
- Position: The Pitfalls of Over-Alignment: Overly Caution Health-Related Responses From LLMs are Unethical and Dangerous
- Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference
- LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind
- CALR: Corrective Adaptive Low-Rank Decomposition for Efficient Large Language Model Layer Compression
- SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking
- Think in Blocks: Adaptive Reasoning from Direct Response to Deep Reasoning
- Understanding Tool-Integrated Reasoning
- Hybrid Deep Searcher: Integrating Parallel and Sequential Search Reasoning
- Can Structured Templates Facilitate LLMs in Tackling Harder Tasks? : An Exploration of Scaling Laws by Difficulty
- GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
- HAEPO: History-Aggregated Exploratory Policy Optimization
- MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use
- UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning
- Recall-Extend Dynamics: Enhancing Small Language Models through Controlled Exploration and Refined Offline Integration
- DualSparse-MoE: Coordinating Tensor/Neuron-Level Sparsity with Expert Partition and Reconstruction
- Training Language Model Agents to Find Vulnerabilities with CTF-Dojo
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- Hermes 4 Technical Report
- Type-Compliant Adaptation Cascades: Adapting Programmatic LM Workflows to Data
- FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel
- HLLM-Creator: Hierarchical LLM-based Personalized Creative Generation
- MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
- VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models
- SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
- Deep Think with Confidence
- Mitigating Hallucinations in LM-Based TTS Models via Distribution Alignment Using GFlowNets
- Transduction is All You Need for Structured Data Workflows
- Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs
- MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
- LeanGeo: Formalizing Competitional Geometry problems in Lean
- Linear Preference Optimization: Decoupled Gradient Control via Absolute Regularization
- Semantic Energy: Detecting LLM Hallucination Beyond Entropy
- CTA-Flux: Integrating Chinese Cultural Semantics into High-Quality English Text-to-Image Communities
- Organ-Agents: Virtual Human Physiology Simulator via LLMs
- ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
- RynnEC: Bringing MLLMs into Embodied World
- MMReview: A Multidisciplinary and Multimodal Benchmark for LLM-Based Peer Review Automation
- MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General Intelligence
- LLMind 2.0: Distributed IoT Automation with Natural Language M2M Communication and Lightweight LLM Agents
- From Scores to Skills: A Cognitive Diagnosis Framework for Evaluating Financial Large Language Models
- Toward Better EHR Reasoning in LLMs: Reinforcement Learning with Expert Attention Guidance
- EmoSLLM: Parameter-Efficient Adaptation of LLMs for Speech Emotion Recognition
- ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs
- ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents
- G2RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance
- CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance
- Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward
- Prompt-Induced Linguistic Fingerprints for LLM-Generated Fake News Detection
- RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models
- ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
- DESIGNER: Design-Logic-Guided Multidisciplinary Data Synthesis for LLM Reasoning
- Diagnostic-Guided Dynamic Profile Optimization for LLM-based User Simulators in Sequential Recommendation
- Deep Research: A Survey of Autonomous Research Agents
- Mini-Omni-Reasoner: Token-Level Thinking-in-Speaking in Large Speech Models
- Reinforcement Learning with Rubric Anchors
- Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models
- TaoSR1: The Thinking Model for E-commerce Relevance Search
- Fast, Slow, and Tool-augmented Thinking for LLMs: A Review
- Exploring Efficiency Frontiers of Thinking Budget in Medical Reasoning: Scaling Laws between Computational Resources and Reasoning Quality
- Mitigating Jailbreaks with Intent-Aware LLMs
- Talk Less, Fly Lighter: Autonomous Semantic Compression for UAV Swarm Communication via LLMs
- In-Context Examples Matter: Improving Emotion Recognition in Conversation with Instruction Tuning
- Causality Matters: How Temporal Information Emerges in Video Language Models
- SeamlessFlow: A Trainer Agent Isolation RL Framework Achieving Bubble-Free Pipelines via Tag Scheduling
- Inclusion Arena: An Open Platform for Evaluating Large Foundation Models with Real-World Apps
- Retrieval-augmented reasoning with lean language models
- ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism
- MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts
- Audio Flamingo Sound-CoT Technical Report: Improving Chain-of-Thought Reasoning in Sound Understanding
- Ovis2.5 Technical Report
- Speciesism in AI: Evaluating Discrimination Against Animals in Large Language Models
- Uncalibrated Reasoning: GRPO Induces Overconfidence for Stochastic Outcomes
- SSRL: Self-Search Reinforcement Learning
- Medico 2025: Visual Question Answering for Gastrointestinal Imaging
- FROGENT: An End-to-End Full-process Drug Design Agent
- MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
- ComoRAG: A Cognitive-Inspired Memory-Organized RAG for Stateful Long Narrative Reasoning
- Dataset Construction for Training LLM to Learn Analog Circuit Knowledge
- Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
- LeanRAG: Knowledge-Graph-Based Generation with Semantic Aggregation and Hierarchical Retrieval
- Transforming Questions and Documents for Semantically Aligned Retrieval-Augmented Generation
- Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
- TimeMKG: Knowledge-Infused Causal Reasoning for Multivariate Time Series Modeling
- HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap
- User-centric Subjective Leaderboard by Customizable Reward Modeling
- Episodic Memory Representation for Long-form Video Understanding
- CodeGrad: Integrating Multi-Step Verification with Gradient-Based LLM Refinement
- ASPD: Unlocking Adaptive Serial-Parallel Decoding by Exploring Intrinsic Parallelism in LLMs
- The Roots of International Perceptions: Simulating US Attitude Changes Towards China with LLM Agents
- Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
- First, Do No Harm: AI Supervisor Scaffolds Novice Growth in Counselor Education
- DepressLLM: Interpretable domain-adapted language model for depression detection from real-world narratives
- Scaling Learned Image Compression Models up to 1 Billion
- InternBootcamp Technical Report: Boosting LLM Reasoning with Verifiable Task Scaling
- Never compromise with vulnerabilities: a comprehensive survey on AI governance
- Jinx: Unlimited LLMs for Probing Alignment Failures
- VGGSounder: Audio-Visual Evaluations for Foundation Models
- BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks
- Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
- Interpreting Fedspeak with Confidence: A LLM-Based Uncertainty-Aware Framework Guided by Monetary Policy Transmission Paths
- AIS-LLM: A Unified Framework for Maritime Trajectory Prediction, Anomaly Detection, and Collision Risk Assessment with Explainable Forecasting
- Towards Multimodal Sentiment Analysis via Contrastive Cross-modal Retrieval Augmentation and Hierachical Prompts
- FEAT: A Multi-Agent Forensic AI System with Domain-Adapted Large Language Model for Automated Cause-of-Death Analysis
- MCPToolBench++: A Large Scale AI Agent Model Context Protocol MCP Tool Use Benchmark
- Large Language Models as Oracles for Ontology Alignment
- Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
- Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization
- Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D Generation
- The Cost of Thinking: Increased Jailbreak Risk in Large Language Models
- Find Them All: Unveiling MLLMs for Versatile Person Re-identification
- VASPilot: MCP-Facilitated Multi-Agent Intelligence for Autonomous VASP Simulations
- Sample-efficient LLM Optimization with Reset Replay
- LLMs vs. Chinese Anime Enthusiasts: A Comparative Study on Emotionally Supportive Role-Playing
- Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model
- EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance Generation
- When a Paper Has 1000 Authors: Rethinking Citation Metrics in the Era of LLMs
- Beyond Perplexity: Let the Reader Select Retrieval Summaries via Spectrum Projection Score
- Valid Inference with Imperfect Synthetic Data
- Pruning the Unsurprising: Efficient LLM Reasoning via First-Token Surprisal
- Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing
- KnapFormer: An Online Load Balancer for Efficient Diffusion Transformers Training
- BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent
- FineDialFact: A benchmark for Fine-grained Dialogue Fact Verification
- RL-MoE: An Image-Based Privacy Preserving Approach In Intelligent Transportation System
- LATTE: Learning Aligned Transactions and Textual Embeddings for Bank Clients
- TASE: Token Awareness and Structured Evaluation for Multilingual Language Models
- LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
- Decision-Making with Deliberation: Meta-reviewing as a Document-grounded Dialogue
- MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs
- CodeBoost: Boosting Code LLMs by Squeezing Knowledge from Code Snippets with RL
- ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking
- IAD-R1: Reinforcing Consistent Reasoning in Industrial Anomaly Detection
- Klear-CodeTest: Scalable Test Case Generation for Code Reinforcement Learning
- Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment
- IFDECORATOR: Wrapping Instruction Following Reinforcement Learning with Verifiable Rewards
- TURA: Tool-Augmented Unified Retrieval Agent for AI Search
- Training-Free Multimodal Large Language Model Orchestration
- Beyond Brainstorming: What Drives High-Quality Scientific Ideas? Lessons from Multi-Agent Collaboration
- SID: Benchmarking Guided Instruction Capabilities in STEM Education with a Socratic Interdisciplinary Dialogues Dataset
- Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
- AttriLens-Mol: Attribute Guided Reinforcement Learning for Molecular Property Prediction with Large Language Models
- Bridging Search and Recommendation through Latent Cross Reasoning
- Efficient Scaling for LLM-based ASR
- PAIRS: Parametric-Verified Adaptive Information Retrieval and Selection for Efficient RAG
- VeriGUI: Verifiable Long-Chain GUI Dataset
- Are Today's LLMs Ready to Explain Well-Being Concepts?
- Model Compression vs. Adversarial Robustness: An Empirical Study on Language Models for Code
- Sotopia-RL: Reward Design for Social Intelligence
- CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward
- R2GenKG: Hierarchical Multi-modal Knowledge Graph for LLM-based Radiology Report Generation
- Compressing Chain-of-Thought in LLMs via Step Entropy
- Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies
- Light-IF: Endowing LLMs with Generalizable Reasoning via Preview and Self-Checking for Complex Instruction Following
- CoTox: Chain-of-Thought-Based Molecular Toxicity Reasoning and Prediction
- ContractEval: Benchmarking LLMs for Clause-Level Legal Risk Identification in Commercial Contracts
- SustainableQA: A Comprehensive Question Answering Dataset for Corporate Sustainability and EU Taxonomy Reporting
- Bias Beyond Demographics: Probing Decision Boundaries in Black-Box LVLMs via Counterfactual VQA
- Thinking with Nothinking Calibration: A New In-Context Learning Paradigm in Reasoning Large Language Models
- On the Theory and Practice of GRPO: A Trajectory-Corrected Approach with Fast Convergence
- Large Reasoning Models Are Autonomous Jailbreak Agents
- CAMA: Enhancing Mathematical Reasoning in Large Language Models with Causal Knowledge
- Qwen-Image Technical Report
- CAMERA: Multi-Matrix Joint Compression for MoE Models via Micro-Expert Redundancy Analysis
- Balancing Information Accuracy and Response Timeliness in Networked LLMs
- CAAD: Context-Aware Adaptive Decoding for Truthful Text Generation
- Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models
- Everyone Contributes! Incentivizing Strategic Cooperation in Multi-LLM Systems via Sequential Public Goods Games
- SpectraLLM: Uncovering the Ability of LLMs for Molecular Structure Elucidation from Multi-Spectral Data
- MindShot: Multi-Shot Video Reconstruction from fMRI with LLM Decoding
- MedVLThinker: Simple Baselines for Multimodal Medical Reasoning
- MolReasoner: Toward Effective and Interpretable Reasoning for Molecular LLMs
- AGENTICT2S:Robust Text-to-SPARQL via Agentic Collaborative Reasoning over Heterogeneous Knowledge Graphs for the Circular Economy
- ReflecSched: Solving Dynamic Flexible Job-Shop Scheduling via LLM-Powered Hierarchical Reflection
- CultureGuard: Towards Culturally-Aware Dataset and Guard Model for Multilingual Safety Applications
- Enhancing Math Reasoning in Small-sized LLMs via Preview Difficulty-Aware Intervention
- Motif 2.6B Technical Report
- Advancing the Foundation Model for Music Understanding
- HyClone: Bridging LLM Understanding and Dynamic Execution for Semantic Code Clone Detection
- Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data
- Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
- DAMR: Efficient and Adaptive Context-Aware Knowledge Graph Question Answering with LLM-Guided MCTS
- FinKario: Event-Enhanced Automated Construction of Financial Knowledge Graph
- SynAdapt: Learning Adaptive Reasoning in Large Language Models via Synthetic Continuous Chain-of-Thought
- Dual Collaborative LLMs via Continual Fine-Tuning for Serendipitous Recommendation
- EdgeInfinite-Instruct: Bridging SFT-Based Optimization and NPU-Level Efficiency for Edge Devices
- PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning
- Multi-Agent Game Generation and Evaluation via Audio-Visual Recordings
- MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented Generation
- Llama-3.1-FoundationAI-SecurityLLM-8B-Instruct Technical Report
- Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models
- PhysicsEval: Inference-Time Techniques to Improve the Reasoning Proficiency of Large Language Models on Physics Problems
- XSpecMesh: Quality-Preserving Auto-Regressive Mesh Generation Acceleration via Multi-Head Speculative Decoding
- SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting
- CoT-Self-Instruct: Building high-quality synthetic prompts for reasoning and non-reasoning tasks
- Causal2Vec: Improving Decoder-only LLMs as Versatile Embedding Models
- Text-to-SQL Task-oriented Dialogue Ontology Construction
- Unveiling Super Experts in Mixture-of-Experts Large Language Models
Discussions
Related