Qwen2.5 Technical Report
2024/12/19 by Qwen, :, An Yang +88 · 4 voices · 864 citations
Computer Science · Medicine · #Topic Modeling #Artificial Intelligence in Healthcare and Education #Machine Learning and Data Classification
paper · pdf · doi:10.48550/arxiv.2412.15115
Abstract
In this report, we introduce Qwen2.5, a comprehensive series of large language models (LLMs) designed to meet diverse needs. Compared to previous iterations, Qwen 2.5 has been significantly improved during both the pre-training and post-training stages. In terms of pre-training, we have scaled the high-quality pre-training datasets from the previous 7 trillion tokens to 18 trillion tokens. This provides a strong foundation for common sense, expert knowledge, and reasoning capabilities. In terms of post-training, we implement intricate supervised finetuning with over 1 million samples, as well as multistage reinforcement learning. Post-training techniques enhance human preference, and notably improve long text generation, structural data analysis, and instruction following. To handle diverse and varied use cases effectively, we present Qwen2.5 LLM series in rich sizes. Open-weight offerings include base and instruction-tuned models, with quantized versions available. In addition, for hosted solutions, the proprietary models currently include two mixture-of-experts (MoE) variants: Qwen2.5-Turbo and Qwen2.5-Plus, both available from Alibaba Cloud Model Studio. Qwen2.5 has demonstrated top-tier performance on a wide range of benchmarks evaluating language understanding, reasoning, mathematics, coding, human preference alignment, etc. Specifically, the open-weight flagship Qwen2.5-72B-Instruct outperforms a number of open and proprietary models and demonstrates competitive performance to the state-of-the-art open-weight model, Llama-3-405B-Instruct, which is around 5 times larger. Qwen2.5-Turbo and Qwen2.5-Plus offer superior cost-effectiveness while performing competitively against GPT-4o-mini and GPT-4o respectively. Additionally, as the foundation, Qwen2.5 models have been instrumental in training specialized models such as Qwen2.5-Math, Qwen2.5-Coder, QwQ, and multimodal models.
Cited by
- Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation
- Agentic Entropy-Balanced Policy Optimization
- ATGen: Adversarial Reinforcement Learning for Test Case Generation
- Remedy-R: Generative Reasoning for Machine Translation Evaluation without Error Annotations
- Coupling Experts and Routers in Mixture-of-Experts via an Auxiliary Loss
- Reinforcement Learning via Self-Distillation
- Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance
- MindWatcher: Toward Smarter Multimodal Tool-Integrated Reasoning
- ViLaCD-R1: A Vision-Language Framework for Semantic Change Detection in Remote Sensing
- Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs
- Embodied Learning of Reward for Musculoskeletal Control with Vision Language Models
- Merge before Forget: A Single LoRA Continual Learning via Continual Merging
- Argus: Token Aware Distributed LLM Inference Optimization
- One Persona, Many Cues, Different Results: How Sociodemographic Cues Impact LLM Personalization
- FoldAct: Efficient and Stable Context Folding for Long-Horizon Search Agents
- DICE: Discrete Interpretable Comparative Evaluation with Probabilistic Scoring for Retrieval-Augmented Generation
- Role-Based Fault Tolerance System for LLM RL Post-Training
- SPECTRE: Spectral Pre-training Embeddings with Cylindrical Temporal Rotary Position Encoding for Fine-Grained sEMG-Based Movement Decoding
- DiRL: An Efficient Post-Training Framework for Diffusion Language Models
- VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
- Success Is Not Self-Explanatory: Auditing Success Provenance in Agent Evaluation
- Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV
- The Intruder Threshold: A Spectral Law for LoRA Fine-Tuning
- DeepFaith: Evidence-Grounded LLMs for Faithful Incident Reporting in Multi-Stage APT Defense
- Orient Anything V2: Unifying Orientation and Rotation Understanding
- Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation
- Towards Robust Reinforcement Learning for Small-Scale Language Model Agents
- Inverse RL Helps Align AI by Imitating Humans
- Mask2Shield: Strengthening LLM Safety against Neuron-Pruning Attacks
- Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests
- MPR-CiteG: Enhancing RAG with Multi-Portfolio Retrieval and Citation-Grounded Generation
- Aletheia: An Offline-First Clinical Decision Support System for Differential Diagnosis in Low-Resource Healthcare Settings
- How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift
- EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis
- Repeated-Token Counting Reveals a Dissociation Between Representations and Outputs
- Codifying the Judge: Scalable Evaluation via Program Distillation
- Procedural Knowledge at Scale Improves Reasoning
- Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
- Agentic Reward Modeling: Verifying GUI Agent via Progressive Trajectory-Grounded Interaction
- Algorithmic Blindness in Large Language Models: A Calibration Study of Performance Prediction
- RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
- CricBench: A Multilingual Benchmark for Evaluating LLMs in Cricket Analytics
- A Comedy of Estimators: On KL Regularization in RL Training of LLMs
- MoRAgent: Parameter Efficient Agent Tuning with Mixture-of-Roles
- Foundation Model-based Evaluation of Neuropsychiatric Disorders: A Lifespan-Inclusive, Multi-Modal, and Multi-Lingual Study
- Pioneering Multimodal Emotion Recognition in the Era of Large Models: From Closed Sets to Open Vocabularies
- Where Did This Sentence Come From? Tracing Provenance in LLM Reasoning Distillation
- Chain-of-Anomaly Thoughts with Large Vision-Language Models
- NotSoTiny: A Large, Living Benchmark for RTL Code Generation
- AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
- Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs
- Step-DeepResearch Technical Report
- Learning to Reason in LLMs by Expectation Maximization
- LoLA: Long Horizon Latent Action Learning for General Robot Manipulation
- Unified Multimodal Brain Decoding via Cross-Subject Soft-ROI Fusion
- GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators
- Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs
- JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
- R-GenIMA: Integrating Neuroimaging and Genetics with Interpretable Multimodal AI for Alzheimer's Disease Progression
- CienaLLM: Generative Climate-Impact Extraction from News Articles with Autoregressive LLMs
- X-Talk: On the Underestimated Potential of Modular Speech-to-Speech Dialogue System
- External Hippocampus: Topological Cognitive Maps for Guiding Large Language Model Reasoning
- Trust-Region Adaptive Policy Optimization
- 4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
- VERM: Leveraging Foundation Models to Create a Virtual Eye for Efficient 3D Robotic Manipulation
- Stackelberg Learning from Human Feedback: Preference Optimization as a Sequential Game
- WeMusic-Agent: Efficient Conversational Music Recommendation via Knowledge Internalization and Agentic Boundary Learning
- ContextLeak: Auditing Leakage in Private In-Context Learning Methods
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
- Beyond Fast and Slow: Cognitive-Inspired Elastic Reasoning for Large Language Models
- ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
- Learning to Extract Context for Context-Aware LLM Inference
- PerfCoder: Large Language Models for Interpretable Code Performance Optimization
- NL2SpaTiaL: Generating Geometric Spatio-Temporal Logic Specifications from Natural Language for Manipulation Tasks
- Do Reviews Matter for Recommendations in the Era of Large Language Models?
- VLCache: Computing 2% Vision Tokens and Reusing 98% for Vision-Language Inference
- From User Interface to Agent Interface: Efficiency Optimization of UI Representations for LLM Agents
- AIR: Post-training Data Selection for Reasoning via Attention Head Influence
- SIGMA: An AI-Empowered Training Stack on Early-Life Hardware
- On the Effectiveness of Membership Inference in Targeted Data Extraction from Large Language Models
- JoVA: Unified Multimodal Learning for Joint Video-Audio Generation
- JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
- CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence
- Shapley-based Data Valuation for LLM Alignment via Sequential Preference Optimization
- REMODEL-LLM: Transforming C code to Java using LLMs
- CAPTURE: A Benchmark and Evaluation for LVLMs in CAPTCHA Resolving
- PIAST: Rapid Prompting with In-context Augmentation for Scarce Training data
- Learning by Analogy: A Causal Framework for Composition Generalization
- Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors
- SCOPE: Language Models as One-Time Teacher for Hierarchical Planning in Text Environments
- ChronusOmni: Improving Time Awareness of Omni Large Language Models
- COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning
- Token Sugar: Making Source Code Sweeter for LLMs through Token-Efficient Shorthand
- Less Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe Prior
- AutoICE: Automatically Synthesizing Verifiable C Code via LLM-driven Evolution
- Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
- FOAM: Blocked State Folding for Memory-Efficient LLM Training
- ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction
- JT-DA: Enhancing Data Analysis with Tool-Integrated Table Reasoning Large Language Models
- CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks
- Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation
- Towards Efficient Hypergraph and Multi-LLM Agent Recommender Systems
- Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
- M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG
- PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation
- Fast SceneScript: Accurate and Efficient Structured Language Model via Multi-Token Prediction
- FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
- Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?
- RefineBench: Evaluating Refinement Capability of Language Models via Checklists
- OsmT: Bridging OpenStreetMap Queries and Natural Language with Open-source Tag-aware Language Models
- Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
- DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation
- Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space
- On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference
- On GRPO Collapse in Search-R1: The Lazy Likelihood-Displacement Death Spiral
- Context-Aware Hierarchical Learning: A Two-Step Paradigm towards Safer LLMs
- Cognitive Mirrors: Exploring the Diverse Functional Roles of Attention Heads in LLM Reasoning
- Large Language Models as Generalist Policies for Network Optimization
- DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling
- Towards Unification of Hallucination Detection and Fact Verification for Large Language Models
- RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence
- When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers
- Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models
- Lightweight Latent Reasoning for Narrative Tasks
- ChartAnchor: Chart Grounding with Structural-Semantic Fidelity
- Graph Queries from Natural Language using Constrained Language Models and Visual Editing
- Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation
- UMM-RM: An Upcycle-and-Merge MoE Reward Model for Mitigating Reward Hacking
- ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning
- DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation
- Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
- Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
- InstanceV: Instance-Level Video Generation
- Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models
- Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation
- Revisiting the Necessity of Lengthy Chain-of-Thought in Vision-centric Reasoning Generalization
- Beyond Real versus Fake Towards Intent-Aware Video Analysis
- From Compound Figures to Composite Understanding: Developing a Multi-Modal LLM from Biomedical Literature with Medical Multiple-Image Benchmarking and Validation
- Guiding the Inner Eye: A Framework for Hierarchical and Flexible Visual Grounded Reasoning
- Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
- ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning
- CDLM: Consistency Diffusion Language Models For Faster Sampling
- Block Cascading: Training Free Acceleration of Block-Causal Video Models
- Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios
- Revisiting Feedback Models for HyDE
- Robot-Powered Data Flywheels: Deploying Robots in the Wild for Continual Data Collection and Foundation Model Adaptation
- How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining
- VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
- VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking
- Mixture of Horizons in Action Chunking
- InstructAudio: Unified speech and music generation with natural language instruction
- SPINE: Token-Selective Test-Time Reinforcement Learning with Entropy-Band Regularization
- Plan-X: Instruct Video Generation via Semantic Planning
- PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
- Understanding Counting Mechanisms in Large Language and Vision-Language Models
- PARROT: Persuasion and Agreement Robustness Rating of Output Truth -- A Sycophancy Robustness Benchmark for LLMs
- E3-Pruner: Towards Efficient, Economical, and Effective Layer Pruning for Large Language Models
- Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter
- VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
- Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation
- Bridging VLMs and Embodied Intelligence with Deliberate Practice Policy Optimization
- TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
- "To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
- CoS: Towards Optimal Event Scheduling via Chain-of-Scheduling
- Unveiling Inference Scaling for Difference-Aware User Modeling in LLM Personalization
- From Solving to Verifying: A Unified Objective for Robust Reasoning in LLMs
- Weight Variance Amplifier Improves Accuracy in High-Sparsity One-Shot Pruning
- NeuroPath: Neurobiology-Inspired Path Tracking and Reflection for Semantically Coherent Retrieval
- TZ-LLM: Protecting On-Device Large Language Models with Arm TrustZone
- Dropouts in Confidence: Moral Uncertainty in Human-LLM Alignment
- Video Finetuning Improves Reasoning Between Frames
- MEGA-GUI: Multi-stage Enhanced Grounding Agents for GUI Elements
- Synthetic Eggs in Many Baskets: The Impact of Synthetic Data Diversity on LLM Fine-Tuning
- Analyzing Sustainability Messaging in Large-Scale Corporate Social Media
- Tailored Primitive Initialization is the Secret Key to Reinforcement Learning
- Better LLM Reasoning via Dual-Play
- POTSA: A Cross-Lingual Speech Alignment Framework for Low Resource Speech-to-Text Translation
- Beyond Elicitation: Provision-based Prompt Optimization for Knowledge-Intensive Tasks
- Text2SQL-Flow: A Robust SQL-Aware Data Augmentation Framework for Text-to-SQL
- EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
- Black-Box On-Policy Distillation of Large Language Models
- Towards Effective and Efficient Non-autoregressive decoders for Conformer and LLM-based ASR using Block-based Attention Mask
- Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models
- Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn Interaction
- ViPRA: Video Prediction for Robot Actions
- SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
- RedOne 2.0: Rethinking Domain-specific LLM Post-Training in Social Networking Services
- Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
- Think Consistently, Reason Efficiently: Energy-Based Calibration for Implicit Chain-of-Thought
- E2E-VGuard: Adversarial Prevention for Production LLM-based End-To-End Speech Synthesis
- P3-LLM: An Integrated NPU-PIM Accelerator for LLM Inference Using Hybrid Numerical Formats
- RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
- FedRW: Efficient Privacy-Preserving Data Reweighting for Enhancing Federated Learning of Language Models
- You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
- Confidence-Guided Stepwise Model Routing for Cost-Efficient Reasoning
- CoEdge-RAG: Optimizing Hierarchical Scheduling for Retrieval-Augmented LLMs in Collaborative Edge Computing
- Retrieval-Augmented Generation in Medicine: A Scoping Review of Technical Implementations, Clinical Applications, and Ethical Considerations
- DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning
- An Architectural Advantage of The Instruction-Tuned LLM in Containing The Readability-Accuracy Tension in Text Simplification
- MoE-DP: An MoE-Enhanced Diffusion Policy for Robust Long-Horizon Robotic Manipulation with Skill Decomposition and Failure Recovery
- Cambrian-S: Towards Spatial Supersensing in Video
- Logit-Entropy Adaptive Stopping Heuristic for Efficient Chain-of-Thought Reasoning
- CryptoMoE: Privacy-Preserving and Scalable Mixture of Experts Inference via Balanced Expert Routing
- LiveTradeBench: Seeking Real-World Alpha with Large Language Models
- CoPRIS: Efficient and Stable Reinforcement Learning via Concurrency-Controlled Partial Rollout with Importance Sampling
- QiMeng-NeuComBack: Self-Evolving Translation from IR to Assembly Code
- Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
- ReAcTree: Hierarchical LLM Agent Trees with Control Flow for Long-Horizon Task Planning
- LTD-Bench: Evaluating Large Language Models by Letting Them Draw
- When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs
- AGRAG: Advanced Graph-based Retrieval-Augmented Generation for LLMs
- Empowering LLMs with Structural Role Inference for Zero-Shot Graph Learning
- Reasoning Planning for Language Models
- Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs
- MedRECT: A Medical Reasoning Benchmark for Error Correction in Clinical Texts
- On Selecting Few-Shot Examples for LLM-based Code Vulnerability Detection
- Understanding the Implicit User Intention via Reasoning with Large Language Model for Image Editing
- Generative Semantic Coding for Ultra-Low Bitrate Visual Communication and Analysis
- MoRE: 3D Visual Geometry Reconstruction Meets Mixture-of-Experts
- GeoFM: Enhancing Geometric Reasoning of MLLMs via Synthetic Data Generation through Formal Language
- Scalable Processing-Near-Memory for 1M-Token LLM Inference: CXL-Enabled KV-Cache Management Beyond GPU Limits
- Detecting Data Contamination in LLMs via In-Context Learning
- ExpertFlow: Adaptive Expert Scheduling and Memory Coordination for Efficient MoE Inference
- OmniEduBench: A Comprehensive Chinese Benchmark for Evaluating Large Language Models in Education
- BOTS: A Unified Framework for Bayesian Online Task Selection in LLM Reinforcement Finetuning
- Angular Steering: Behavior Control via Rotation in Activation Space
- EgoExo-Con: Exploring View-Invariant Video Temporal Understanding
- Loquetier: A Virtualized Multi-LoRA Framework for Unified LLM Fine-tuning and Serving
- Grounded in Reality: Learning and Deploying Proactive LLM from Offline Logs
- MemTX: Transactional Belief Commit for Stateful Agent Memory
- RDQ: Residual Distribution Quantization for Large Language Models
- LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models
- Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR
- TS-Reasoner: Aligning Time Series Foundation Models with LLM Reasoning
- Will Scaling Improve Social Simulation with LLMs?
- ElasticMoE: An Efficient Auto Scaling Method for Mixture-of-Experts Models
- Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
- Two Calls Beat Five Agents: Evaluating Multi-Agent Pipelines Against Self-Refinement for Local Language Models
- Thought Virus: Viral Misalignment via Subliminal Prompting in Multi-Agent Systems
- LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs
- NeurIPT: Foundation Model for Neural Interfaces
- RL makes MLLMs see better than SFT
- Readability-Robust Code Summarization via Meta Curriculum Learning
- EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning
- Fantastic Reasoning Behaviors and Where to Find Them: Unsupervised Discovery of the Reasoning Process
- PRESTO: Preimage-Informed Instruction Optimization for Prompting Black-Box LLMs
- Optimizing Knowledge Utilization for Multi-Intent Comment Generation with Large Language Models
- Repurposing Synthetic Data for Fine-grained Search Agent Supervision
- Long-Context Modeling with Dynamic Hierarchical Sparse Attention for On-Device LLMs
- What Limits Agentic Systems Efficiency?
- MiniOneRec: An Open-Source Framework for Scaling Generative Recommendation
- ReCode: Unify Plan and Action for Universal Granularity Control
- Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
- A Video Is Not Worth a Thousand Words
- Process Reward Models for Sentence-Level Verification of LVLM Radiology Reports
- Beyond Higher Rank: Token-wise Input-Output Projections for Efficient Low-Rank Adaptation
- Think before Recommendation: Autonomous Reasoning-enhanced Recommender
- Advantage Shaping as Surrogate Reward Maximization: Unifying Pass@K Policy Gradients
- Can Language Models Compose Skills In-Context?
- Far from the Shallow: Brain-Predictive Reasoning Embedding through Residual Disentanglement
- FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning
- Accelerating Materials Design via LLM-Guided Evolutionary Search
- From Slides to Chatbots: Enhancing Large Language Models with University Course Materials
- SteerX: Disentangled Steering for LLM Personalization
- Edit Less, Achieve More: Dynamic Sparse Neuron Masking for Lifelong Knowledge Editing in LLMs
- Energy-Efficient Domain-Specific Artificial Intelligence Models and Agents: Pathways and Paradigms
- Few-Shot Knowledge Distillation of LLMs With Counterfactual Explanations
- FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
- Weak-to-Strong Generalization under Distribution Shifts
- Correlation Dimension of Auto-Regressive Large Language Models
- Chinese Discharge Drug Recommendation in Metabolic Diseases with Large Language Models
- Customizing Open Source LLMs for Quantitative Medication Attribute Extraction across Heterogeneous EHR Systems
- Towards Scalable Oversight with Collaborative Multi-Agent Debate in Error Detection
- LLM-Integrated Bayesian State Space Models for Multimodal Time-Series Forecasting
- Language Ranker: A Lightweight Ranking framework for LLM Decoding
- Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence
- AsyncHZP: Hierarchical ZeRO Parallelism with Asynchronous Scheduling for Scalable LLM Training
- Learning to Triage Taint Flows Reported by Dynamic Program Analysis in Node.js Packages
- Limits of PRM-Guided Tree Search for Mathematical Reasoning with LLMs
- Data-Centric Lessons To Improve Speech-Language Pretraining
- Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis
- Restoring Pruned Large Language Models via Lost Component Compensation
- NeSyPr: Neurosymbolic Proceduralization For Efficient Embodied Reasoning
- From Large to Small: Transferring CUDA Optimization Expertise via Reasoning Graph
- Balancing Rewards in Text Summarization: Multi-Objective Reinforcement Learning via HyperVolume Optimization
- Unified Reinforcement and Imitation Learning for Vision-Language Models
- Imbalanced Gradients in RL Post-Training of Multi-Task LLMs
- Search Self-play: Pushing the Frontier of Agent Capability without Supervision
- A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning
- Investigating LLM Capabilities on Long Context Comprehension for Medical Question Answering
- Reasoning Language Model Inference Serving Unveiled: An Empirical Study
- Sherlock Your Queries: Learning to Ask the Right Questions for Dialogue-Based Retrieval
- CORE: Reducing UI Exposure in Mobile Agents via Collaboration Between Cloud and Local LLMs
- Pay Attention to the Triggers: Constructing Backdoors That Survive Distillation
- From Quarter to All: Accelerating Speculative LLM Decoding via Floating-Point Exponent Remapping and Parameter Sharing
- Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption
- ACTG-ARL: Differentially Private Conditional Text Generation with RL-Boosted Control
- Contrastive Decoding Mitigates Score Range Bias in LLM-as-a-Judge
- Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
- MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training
- Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
- Mapping Post-Training Forgetting in Language Models at Scale
- Planned Diffusion
- Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
- PANER: A Paraphrase-Augmented Framework for Low-Resource Named Entity Recognition
- Small language models enable rapid and accurate extraction of structured data from unstructured text: an example with plants and their specialized metabolites
- DETree: DEtecting Human-AI Collaborative Texts via Tree-Structured Hierarchical Representation Learning
- Certified Self-Consistency: Statistical Guarantees and Test-Time Training for Reliable Reasoning in LLMs
- Strengthening LLMs for Tabular Prediction with Structural Priors
- From Preferences to Prejudice: The Role of Alignment Tuning in Shaping Social Bias in Video Diffusion Models
- SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
- Soft-Masked Diffusion Language Models
- TREAT: A Code LLMs Trustworthiness / Reliability Evaluation and Testing Framework
- CaMiT: A Time-Aware Car Model Dataset for Classification and Generation
- Utility-Diversity Aware Online Batch Selection for LLM Supervised Fine-tuning
- AutoGraph-R1: End-to-End Reinforcement Learning for Knowledge Graph Construction
- Accelerating Mobile Language Model via Speculative Decoding and NPU-Coordinated Execution
- LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding
- All You Need is One: Capsule Prompt Tuning with a Single Vector
- Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
- Foundation Models for Scientific Discovery: From Paradigm Enhancement to Paradigm Transition
- Planner and Executor: Collaboration between Discrete Diffusion And Autoregressive Models in Reasoning
- InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
- Train a Unified Multimodal Data Quality Classifier with Synthetic Data
- PoTS: Proof-of-Training-Steps for Backdoor Detection in Large Language Models
- Comprehensive language-image pre-training for 3D medical image understanding
- Stable but Miscalibrated: A Kantian View on Overconfidence from Filters to Large Language Models
- Benchmarking Multimodal Large Language Models for Face Recognition
- ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling
- MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving
- Constraint-Driven Small Language Models Based on Agent and OpenAlex Knowledge Graph: Mining Conceptual Pathways and Discovering Innovation Points in Academic Papers
- Qwen3Guard Technical Report
- OpenDerisk: An Industrial Framework for AI-Driven SRE, with Design, Implementation, and Case Studies
- Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation
- Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs
- Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms
- Grounding Long-Context Reasoning with Contextual Normalization for Retrieval-Augmented Generation
- Higher Satisfaction, Lower Cost: A Technical Report on How LLMs Revolutionize Meituan's Intelligent Interaction Systems
- Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking
- Tahakom LLM Guidelines and Recipes: From Pre-training Data to an Arabic LLM
- VLA-0: Building State-of-the-Art VLAs with Zero Modification
- CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
- Automated Network Protocol Testing with LLM Agents
- Don't Be Greedy, Just Relax! Pruning LLMs via Frank-Wolfe
- NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
- FreshTab: Sourcing Fresh Data for Table-to-Text Generation Evaluation
- Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences
- Dr.LLM: Dynamic Layer Routing in LLMs
- Demystifying Hybrid Thinking: Can LLMs Truly Switch Between Think and No-Think?
- ProtoSiTex: Learning Semi-Interpretable Prototypes for Multi-label Text Classification
- SpineBench: Benchmarking Multimodal LLMs for Spinal Pathology Analysis
- Reducing Belief Deviation in Reinforcement Learning for Active Reasoning
- Reinforced Preference Optimization for Recommendation
- Unifying Vision-Language Latents for Zero-label Image Caption Enhancement
- DiSTAR: Diffusion over a Scalable Token Autoregressive Representation for Speech Generation
- EduDial: Constructing a Large-scale Multi-turn Teacher-Student Dialogue Corpus
- UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
- CGBench: Benchmarking Language Model Scientific Reasoning for Clinical Genetics Research
- Representation-Based Exploration for Language Models: From Test-Time to Post-Training
- BridgeCode: A Dual Speech Representation Paradigm for Autoregressive Zero-Shot Text-to-Speech Synthesis
- A2FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning
- Enhancing Long Chain-of-Thought Reasoning through Multi-Path Plan Aggregation
- Test-Time Anchoring for Discrete Diffusion Posterior Sampling
- Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models
- Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model
- Uncertainty Quantification for Retrieval-Augmented Reasoning
- VeriCite: Towards Reliable Citations in Retrieval-Augmented Generation via Rigorous Verification
- LSVOS 2025 Challenge Report: Recent Advances in Complex Video Object Segmentation
- Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales
- Cog-Rethinker: Hierarchical Metacognitive Reinforcement Learning for LLM Reasoning
- StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
- KVComm: Enabling Efficient LLM Communication through Selective KV Sharing
- Preserving LLM Capabilities through Calibration Data Curation: From Analysis to Optimization
- UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
- Align2Act: Instruction-Tuned Models for Human-Aligned Autonomous Driving
- Trace Length is a Simple Uncertainty Signal in Reasoning Models
- RECON: Reasoning with Condensation for Efficient Retrieval-Augmented Generation
- RLFR: Extending Reinforcement Learning for LLMs with Flow Environment
- PermLLM: Learnable Channel Permutation for N:M Sparse Large Language Models
- Preference-driven Knowledge Distillation for Few-shot Node Classification
- Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
- Beyond the limitation of a single query: Train your LLM for query expansion with Reinforcement Learning
- Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL
- The Geometry of Forgetting
- LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?
- Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
- Stable Video Infinity: Infinite-Length Video Generation with Error Recycling
- Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation
- Auto-scaling Continuous Memory for GUI Agent
- MASA: LLM-Driven Multi-Agent Systems for Autoformalization
- Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping
- WUGNECTIVES: Novel Entity Inferences of Language Models from Discourse Connectives
- A Unified Biomedical Named Entity Recognition Framework with Large Language Models
- Decoupling Safety into Orthogonal Subspace: Cost-Efficient and Performance-Preserving Alignment for Large Language Models
- Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL
- BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception
- Serial-Parallel Dual-Path Architecture for Speaking Style Recognition
- Production-Grade Local LLM Inference on Apple Silicon: A Comparative Study of MLX, MLC-LLM, Ollama, llama.cpp, and PyTorch MPS
- TinyGraphEstimator: Adapting Lightweight Language Models for Graph Structure Inference
- NovaFlow: Zero-Shot Manipulation via Actionable Flow from Generated Videos
- Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation
- CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards
- dInfer: An Efficient Inference Framework for Diffusion Language Models
- Evaluating Small Vision-Language Models on Distance-Dependent Traffic Perception
- Lossless Vocabulary Reduction for Auto-Regressive Language Models
- Active Confusion Expression in Large Language Models: Leveraging World Models toward Better Social Reasoning
- Towards Human-Like Grading: A Unified LLM-Enhanced Framework for Subjective Question Evaluation
- Contrastive Weak-to-strong Generalization
- CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching
- SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training
- A2Search: Ambiguity-Aware Question Answering with Reinforcement Learning
- FlyLoRA: Boosting Task Decoupling and Parameter Efficiency via Implicit Rank-Wise Mixture-of-Experts
- RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models
- Don't Waste Mistakes: Leveraging Negative RL-Groups via Confidence Reweighting
- SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
- Measuring and Mitigating Identity Bias in Multi-Agent Debate via Anonymization
- MLLM4TS: Leveraging Vision and Multimodal Language Models for General Time-Series Analysis
- Artificial Hippocampus Networks for Efficient Long-Context Modeling
- Next Semantic Scale Prediction via Hierarchical Diffusion Language Models
- Don't Adapt Small Language Models for Tools; Adapt Tool Schemas to the Models
- TALENT: Table VQA via Augmented Language-Enhanced Natural-text Transcription
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- ExPO-HM: Learning to Explain-then-Detect for Hateful Meme Detection
- LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
- Small language models enable rapid and accurate extraction of structured data from unstructured text: An example with plants and their specialized metabolites
- Pool Me Wisely: On the Effect of Pooling in Transformer-Based Models
- Mid-Training of Large Language Models: A Survey
- Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs
- TalkCuts: A Large-Scale Dataset for Multi-Shot Human Speech Video Generation
- Expanding the Action Space of LLMs to Reason Beyond Language
- The Cognitive Bandwidth Bottleneck: Shifting Long-Horizon Agent from Planning with Actions to Planning with Schemas
- Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels
- FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering
- Belief-Calibrated Multi-Agent Consensus Seeking for Complex NLP Tasks
- Revisiting Long-context Modeling from Context Denoising Perspective
- EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget
- Flow4Agent: Long-form Video Understanding via Motion Prior from Optical Flow
- Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents
- Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
- SD-MVSum: Script-Driven Multimodal Video Summarization Method and Datasets
- D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI
- Stratum: System-Hardware Co-Design with Tiered Monolithic 3D-Stackable DRAM for Efficient MoE Serving
- SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
- A Set of Quebec-French Corpus of Regional Expressions and Terms
- MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning
- ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs
- Evaluating LLMs for Demographic-Targeted Social Bias Detection: A Comprehensive Benchmark Study
- Robustness assessment of large audio language models in multiple-choice evaluation
- KVLinC : KV Cache Quantization with Hadamard Rotation and Linear Correction
- Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
- COLE: a Comprehensive Benchmark for French Language Understanding Evaluation
- GRACE: Generative Representation Learning via Contrastive Policy Optimization
- Read the Scene, Not the Script: Outcome-Aware Safety for LLMs
- AlphaApollo: Orchestrating Foundation Models and Professional Tools into a Self-Evolving System for Deep Agentic Reasoning
- PatternKV: Flattening KV Representation Expands Quantization Headroom
- Exploring Chain-of-Thought Reasoning for Steerable Pluralistic Alignment
- Distilling Reasoning into Student LLMs: Local Naturalness for Selecting Teacher Data
- RLRF: Competitive Search Agent Design via Reinforcement Learning from Ranker Feedback
- LLM Microscope: What Model Internals Reveal About Answer Correctness and Context Utilization
- Activation Steering with a Feedback Controller
- Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders
- Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
- GuidedSampling: Steering LLMs Towards Diverse Candidate Solutions at Inference-Time
- Sample, Align, Synthesize: Graph-Based Response Synthesis with ConGrs
- Improving GUI Grounding with Explicit Position-to-Coordinate Mapping
- Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain
- TokenFlow: Responsive LLM Text Streaming Serving under Request Burst via Preemptive Scheduling
- Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner
- An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters
- CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation
- EMR-AGENT: Automating Cohort and Feature Extraction from EMR Databases
- Structuring Reasoning for Complex Rules Beyond Flat Representations
- LongCodeZip: Compress Long Context for Code Language Models
- TokMem: Tokenized Procedural Memory for Large Language Models
- Generalized Parallel Scaling with Interdependent Generations
- Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs
- Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
- Is It Thinking or Cheating? Detecting Implicit Reward Hacking by Measuring Reasoning Effort
- Apriel-1.5-15b-Thinker
- BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
- AgentFlux: Decoupled Fine-Tuning & Inference for On-Device Agentic Systems
- LoRAFusion: Efficient LoRA Fine-Tuning for LLMs
- GRPO-λ: Credit Assignment improves LLM Reasoning
- Thinkquel: A Model Dedicated to Text-to-dbt Using Synthetic Data and a Span-Aware Objective
- AuditAgent: Expert-Guided Multi-Agent Reasoning for Cross-Document Fraudulent Evidence Discovery
- Attention as a Compass: Efficient Exploration for Process-Supervised RL in Reasoning Models
- Are Robust LLM Fingerprints Adversarially Robust?
- Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation
- Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing
- Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
- Clip-Low Increases Entropy and Clip-High Decreases Entropy in Reinforcement Learning of Large Language Models
- Reinforced Strategy Optimization for Conversational Recommender Systems via Network-of-Experts
- RE-Searcher: Robust Agentic Search with Goal-oriented Planning and Self-reflection
- RoRecomp: Enhancing Reasoning Efficiency via Rollout Response Recomposition in Reinforcement Learning
- MAPLE: Multi-scale Attribute-enhanced Prompt Learning for Few-shot Whole Slide Image Classification
- Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling
- Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis
- PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection
- IRIS: Intrinsic Reward Image Synthesis
- Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
- MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
- Scaling with Collapse: Efficient and Predictable Training of LLM Families
- How Well Do LLMs Imitate Human Writing Style?
- When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training
- MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment
- DiaCDM: Cognitive Diagnosis in Teacher-Student Dialogues using the Initiation-Response-Evaluation Framework
- Vision Function Layer in Multimodal LLMs
- Fidel-TS: A High-Fidelity Benchmark for Multimodal Time Series Forecasting
- MemGen: Weaving Generative Latent Memory for Self-Evolving Agents
- Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
- AdaDetectGPT: Adaptive Detection of LLM-Generated Text with Statistical Guarantees
- Specialization after Generalization: Towards Understanding Test-Time Training in Foundation Models
- Knowledge Editing with Subspace-Aware Key-Value Mappings
- Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models
- Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding
- Let LLMs Speak Embedding Languages: Generative Text Embeddings via Iterative Contrastive Refinement
- VeriLLM: A Lightweight Framework for Publicly Verifiable Decentralized Inference
- Conda: Column-Normalized Adam for Training Large Language Models Faster
- MDD-Thinker: Towards Large Reasoning Models for Major Depressive Disorder Diagnosis
- Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends
- Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models
- NeMo: Needle in a Montage for Video-Language Understanding
- BPMN Assistant: An LLM-Based Approach to Business Process Modeling
- An AI-guided framework for automated map point symbol generation through template rendering
- AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play
- Pretraining with hierarchical memories: separating long-tail and common knowledge
- ReasonCACHE: Teaching LLMs To Reason Without Weight Updates
- Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems
- Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
- Knowledge-Level Consistency Reinforcement Learning: Dual-Fact Alignment for Long-Form Factuality
- Text-to-Code Generation for Modular Building Layouts in Building Information Modeling
- Evaluating Program Semantics Reasoning with Type Inference in System F
- Fast Thinking for Large Language Models
- Reasoning Scaffolding: Distilling the Flow of Thought from LLMs
- Clean First, Align Later: Benchmarking Preference Data Cleaning for Reliable LLM Alignment
- On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization
- CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems
- RIV: Recursive Introspection Mask Diffusion Vision Language Model
- MaskSQL: Safeguarding Privacy for LLM-Based Text-to-SQL via Abstraction
- Alignment through Meta-Weighted Online Sampling: Bridging the Gap between Data Generation and Preference Optimization
- Scaling LLM Test-Time Compute with Mobile NPU on Smartphones
- Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
- Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents
- WirelessMathLM: Teaching Mathematical Reasoning for LLMs in Wireless Communications with Reinforcement Learning
- Planning with Unified Multimodal Models
- Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks
- LLMSQL: Upgrading WikiSQL for the LLM Era of Text-to-SQL
- Robot Learning from Any Images
- JE-IRT: A Geometric Lens on LLM Abilities through Joint Embedding Item Response Theory
- See, Point, Fly: A Learning-Free VLM Framework for Universal Unmanned Aerial Navigation
- WebGen-Agent: Enhancing Interactive Website Generation with Multi-Level Feedback and Step-Level Reinforcement Learning
- Language Models Can Learn from Verbal Feedback Without Scalar Rewards
- Variational Reasoning for Language Models
- Think Socially via Cognitive Reasoning
- Do LLM Agents Know How to Ground, Recover, and Assess? A Benchmark for Epistemic Competence in Information-Seeking Agents
- Stochastic activations
- MesaTask: Towards Task-Driven Tabletop Scene Generation via 3D Spatial Reasoning
- Erase or Hide? Suppressing Spurious Unlearning Neurons for Robust Unlearning
- StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs
- Code once, Run Green: Automated Green Code Translation in Serverless Computing
- FailureAtlas:Mapping the Failure Landscape of T2I Models via Active Exploration
- LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals
- Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
- MolSpectLLM: A Molecular Foundation Model Bridging Spectroscopy, Molecule Elucidation, and 3D Structure Generation
- SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models
- Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval
- Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
- Hallucination reduction with CASAL: Contrastive Activation Steering For Amortized Learning
- A circuit for predicting hierarchical structure in-context in Large Language Models
- Tree Search for LLM Agent Reinforcement Learning
- TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them
- LogReasoner: Empowering LLMs with Expert-like Coarse-to-Fine Reasoning for Automated Log Analysis
- SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs
- RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs
- ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning
- Training Task Reasoning LLM Agents for Multi-turn Task Planning via Single-turn Reinforcement Learning
- Document Summarization with Conformal Importance Guarantees
- When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity
- Q-Palette: Fractional-Bit Quantizers Toward Optimal Bit Allocation for Efficient LLM Deployment
- Thinking Augmented Pre-training
- RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical Diagnosis
- PromptCoT 2.0: Scaling Prompt Synthesis for Large Language Model Reasoning
- PART: Progressive Alignment Representation Training for Multilingual Speech-To-Text with LLMs
- bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
- Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation
- Recall Before You Rank: Similarity-Guided Top-K Reuse for Efficient Long-Context Attention
- Back from the Future: Key-Value Cache Management by Counter-Causal Surprise
- TAPO: Transition-Aware Policy Optimization for LLM Agents
- Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems
- Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs
- Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation
- Divergence Decoding: Training-Free Capability Fusion
- Numbers Beat Words: A Rigorous On-Premise Benchmark for Coupled MIMO Controller Tuning
- AXIOM: A Trust-First Neuro-Symbolic Execution Architecture for Verifiable Mathematical Reasoning
- Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting
- OPENXRD: a comprehensive benchmark framework for LLM/MLLM XRD question answering
- Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
- References Improve LLM Alignment in Non-Verifiable Domains
- Linguistic properties and model scale in brain encoding: from small to compressed language models
- Large Language Model Automated Extraction of Clinical Signs and Symptoms From Emergency Department Reports for Machine Learning Prediction Models: Development and Validation Study
- Reading the unreadable: creating a dataset of 19th century English newspapers using image-to-text language models
- HD-PPT: Hierarchical Decoding of Content- and Prompt-Preference Tokens for Instruction-based TTS
- Agentic Reinforcement Learning with Implicit Step Rewards
- Soft Tokens, Hard Truths
- AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field
- PipelineRL: Faster On-policy Reinforcement Learning for Long Sequence Generation
- Harnessing Multimodal Large Language Models for Personalized Product Search with Query-aware Refinement
- Accurate and Efficient Low-Rank Model Merging in Core Space
- EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
- SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
- AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?
- Enhancing Cross-Lingual Transfer through Reversible Transliteration: A Huffman-Based Approach for Low-Resource Languages
- Vision Language Models Are Not (Yet) Spelling Correctors
- Correlation or Causation: Analyzing the Causal Structures of LLM and LRM Reasoning Process
- Chat-CBM: Towards Interactive Concept Bottleneck Models with Frozen Large Language Models
- A State-Update Prompting Strategy for Efficient and Robust Multi-turn Dialogue
- Understanding Post-Training Structural Changes in Large Language Models
- Probabilistic Token Alignment for Large Language Model Fusion
- PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
- The 1st Solution for 7th LSVOS RVOS Track: SaSaSa2VA
- Steering When Necessary: Flexible Steering Large Language Models with Backtracking
- Large Language Models as End-to-end Combinatorial Optimization Solvers
- VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation
- USB-Rec: An Effective Framework for Improving Conversational Recommendation Capability of Large Language Model
- Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs
- DiEP: Adaptive Mixture-of-Experts Compression through Differentiable Expert Pruning
- EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
- The Singing Voice Conversion Challenge 2025: From Singer Identity Conversion To Singing Style Conversion
- LiteLong: Resource-Efficient Long-Context Data Synthesis for LLMs
- BaseReward: A Strong Baseline for Multimodal Reward Model
- Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
- Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search
- SCENEFORGE: Enhancing 3D-text alignment with Structured Scene Compositions
- Generalizable Geometric Image Caption Synthesis
- Cross-Modal Knowledge Distillation for Speech Large Language Models
- From Hype to Insight: Rethinking Large Language Model Integration in Visual Speech Recognition
- TDRM: Smooth Reward Models with Temporal Difference for LLM RL and Inference
- Value-Guided KV Compression for LLMs via Approximated CUR Decomposition
- MoSA: Motion-Coherent Human Video Generation via Structure-Appearance Decoupling
- Masked Diffusion Models as Energy Minimization
- MICA: Multi-Agent Industrial Coordination Assistant
- Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
- Towards Rationale-Answer Alignment of LVLMs via Self-Rationale Calibration
- EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing
- Tool-R1: Sample-Efficient Reinforcement Learning for Agentic Tool Use
- SSFO: Self-Supervised Faithfulness Optimization for Retrieval-Augmented Generation
- ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization
- Scaling Agents via Continual Pre-training
- SENTRA: Selected-Next-Token Transformer for LLM Text Detection
- Pun Unintended: LLMs and the Illusion of Humor Understanding
- Igniting VLMs toward the Embodied Space
- Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
- HARP: Hallucination Detection via Reasoning Subspace Projection
- Pluralistic Off-policy Evaluation and Alignment
- MORABLES: A Benchmark for Assessing Abstract Moral Reasoning in LLMs with Fables
- DetectAnyLLM: Towards Generalizable and Robust Detection of Machine-Generated Text Across Domains and Models
- Reasoning Under Uncertainty: Exploring Probabilistic Reasoning Capabilities of LLMs
- DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL
- Decoding Alignment: A Critical Survey of LLM Development Initiatives through Value-setting and Data-centric Lens
- InPhyRe Discovers: Large Multimodal Models Struggle in Inductive Physical Reasoning
- Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
- LAVa: Layer-wise KV Cache Eviction with Dynamic Budget Allocation
- HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing
- GmSLM : Generative Marmoset Spoken Language Modeling
- Bridging the Gap Between Ideal and Real-world Evaluation: Benchmarking AI-Generated Image Detection in Challenging Scenarios
- BRoverbs -- Measuring how much LLMs understand Portuguese proverbs
- Low-Resource Fine-Tuning for Multi-Task Structured Information Extraction with a Billion-Parameter Instruction-Tuned Model
- RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation
- TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models
- VL Norm: Rethink Loss Aggregation in RLVR
- TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
- Interpreting the Effects of Quantization on LLMs
- Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems
- Performative Thinking? The Brittle Correlation Between CoT Length and Problem Complexity
- Unleashing the True Potential of LLMs: A Feedback-Triggered Self-Correction with Long-Term Multipath Decoding
- Reconstruction Alignment Improves Unified Multimodal Models
- Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm
- PLaID++: A Preference Aligned Language Model for Targeted Inorganic Materials Design
- Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
- COMPACT: Common-token Optimized Model Pruning Across Channels and Tokens
- Outcome-based Exploration for LLM Reasoning
- SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents
- Proof2Silicon: Prompt Repair for Verified Code and Hardware Generation via Reinforcement Learning
- From Long to Short: LLMs Excel at Trimming Own Reasoning Chains
- Exploring Subjective Tasks in Farsi: A Survey Analysis and Evaluation of Language Models
- MoLoRAG: Bootstrapping Document Understanding via Multi-modal Logic-aware Retrieval
- ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning
- SpikingBrain: Spiking Brain-inspired Large Models
- Delta Activations: A Representation for Finetuned Large Language Models
- AnomalyLMM: Bridging Generative Knowledge and Discriminative Retrieval for Text-Based Person Anomaly Search
- A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
- Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
- IPA: An Information-Reconstructive Input Projection Framework for Efficient Foundation Model Adaptation
- Sample-efficient Integration of New Modalities into Large Language Models
- Emergent Hierarchical Reasoning in LLMs through Reinforcement Learning
- OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation
- Are We SOLID Yet? An Empirical Study on Prompting LLMs to Detect Design Principle Violations
- Advancing SLM Tool-Use Capability using Reinforcement Learning
- TeRA: Rethinking Text-guided Realistic 3D Avatar Generation
- Implicit Reasoning in Large Language Models: A Comprehensive Survey
- RSCC: A Large-Scale Remote Sensing Change Caption Dataset for Disaster Events
- Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation
- DCPO: Dynamic Clipping Policy Optimization
- GradES: Significantly Faster Training in Transformers with Gradient-Based Early Stopping
- M3Ret: Unleashing Zero-shot Multimodal Medical Image Retrieval via Self-Supervision
- Robix: A Unified Model for Robot Interaction, Reasoning and Planning
- Congestion Control System Optimization with Large Language Models
- Reinforcement Learning for Machine Learning Engineering Agents
- CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention
- Can Large Language Models Master Complex Card Games?
- TableZoomer: A Collaborative Agent Framework for Large-scale Table Question Answering
- Vevo2: A Unified and Controllable Framework for Speech and Singing Voice Generation
- EviNote-RAG: Enhancing RAG Models via Answer-Supportive Evidence Notes
- Universal Properties of Activation Sparsity in Modern Large Language Models
- Transforming Agency. On the mode of existence of Large Language Models
- SHERPA: A Model-Driven Framework for Large Language Model Execution
- Safe-LLaVA: A Privacy-Preserving Vision-Language Dataset and Benchmark for Biometric Safety
- MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning
- Towards On-Device Personalization: Cloud-device Collaborative Data Augmentation for Efficient On-device Language Model
- PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
- Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning
- BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning
- HyperFlexis: Joint Design of Algorithms and Systems for Multi-SLO Serving and Fast Scaling
- MSRS: Evaluating Multi-Source Retrieval-Augmented Generation
- End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning
- CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
- SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation
- AudioStory: Generating Long-Form Narrative Audio with Large Language Models
- Forewarned is Forearmed: Pre-Synthesizing Jailbreak-like Instructions to Enhance LLM Safety Guardrail to Potential Attacks
- Analysing Chain of Thought Dynamics: Active Guidance or Unfaithful Post-hoc Rationalisation?
- Spotlight Attention: Towards Efficient LLM Generation via Non-linear Hashing-based KV Cache Retrieval
- Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models
- VibeVoice Technical Report
- LongReasonArena: A Long Reasoning Benchmark for Large Language Models
- StepWiser: Stepwise Generative Judges for Wiser Reasoning
- MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation
- Demystifying Scientific Problem-Solving in LLMs by Probing Knowledge and Reasoning
- APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
- Beyond Quality: Unlocking Diversity in Ad Headline Generation with Large Language Models
- ConfTuner: Training Large Language Models to Express Their Confidence Verbally
- Tracing Positional Bias in Financial Decision-Making: Mechanistic Insights from Qwen2.5
- SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models
- Self-Guided Function Calling in Large Language Models via Stepwise Experience Recall
- Mobile-Agent-v3: Fundamental Agents for GUI Automation
- LongRecall: A Structured Approach for Robust Recall Evaluation in Long-Form Text
- Multilingual Datasets for Custom Input Extraction and Explanation Requests Parsing in Conversational XAI Systems
- DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization
- ZPD-SCA: Unveiling the Blind Spots of LLMs in Assessing Students' Cognitive Abilities
- Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
- Mechanistic Exploration of Backdoored Large Language Model Attention Patterns
- GRILE: A Benchmark for Grammar Reasoning and Explanation in Romanian LLMs
- Expertise-aware Multi-LLM Recruitment and Collaboration for Medical Decision-Making
- ALIGN: Word Association Learning for Cultural Alignment in Large Language Models
- Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR
- Datarus-R1: An Adaptive Multi-Step Reasoning LLM for Automated Data Analysis
- Towards Unified Multimodal Financial Forecasting: Integrating Sentiment Embeddings and Market Indicators via Cross-Modal Attention
- Learning to Steer: Input-dependent Steering for Multimodal LLMs
- Cryfish: On deep audio analysis with Large Language Models
- Breaking Language Barriers: Equitable Performance in Multilingual Language Models
- ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
- MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models
- Can Large Models Teach Student Models to Solve Mathematical Problems Like Human Beings? A Reasoning Distillation Method via Multi-LoRA Interaction
- Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models
- Meet Your New Client: Writing Reports for AI -- Benchmarking Information Loss in Market Research Deliverables
- Wisdom of the Crowd: Reinforcement Learning from Coevolutionary Collective Feedback
- RadarQA: Multi-modal Quality Analysis of Weather Radar Forecasts
- LegalΔ: Enhancing Legal Reasoning in LLMs via Reinforcement Learning with Chain-of-Thought Guided Information Gain
- GraphCogent: Mitigating LLMs' Working Memory Constraints via Multi-Agent Collaboration in Complex Graph Understanding
- User-Assistant Bias in LLMs
- Mitigating Jailbreaks with Intent-Aware LLMs
- Benchmarking LLM-based Agents for Single-cell Omics Analysis
- CHBench: A Cognitive Hierarchy Benchmark for Evaluating Strategic Reasoning Capability of LLMs
- VideoAVE: A Multi-Attribute Video-to-Text Attribute Value Extraction Dataset and Benchmark Models
- On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
- Aware First, Think Less: Dynamic Boundary Self-Awareness Drives Extreme Reasoning Efficiency in Large Language Models
- Language models align with brain regions that represent concepts across modalities
- Defects4Log: Benchmarking LLMs for Logging Code Defect Detection and Reasoning
- Transsion Multilingual Speech Recognition System for MLC-SLM 2025 Challenge
- When Punctuation Matters: A Large-Scale Comparison of Prompt Robustness Methods for LLMs
- Dynamic Quality-Latency Aware Routing for LLM Inference in Wireless Edge-Device Networks
- ADMIRE-BayesOpt: Accelerated Data MIxture RE-weighting for Language Models with Bayesian Optimization
- Ovis2.5 Technical Report
- Improving Text Style Transfer using Masked Diffusion Language Models with Inference-time Scaling
- Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
- Reinforced Language Models for Sequential Decision Making
- Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models
- NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale
- Diversity First, Quality Later: A Two-Stage Assumption for Language Model Alignment
- Evaluating LLMs on Chinese Idiom Translation
- Dataset Construction for Training LLM to Learn Analog Circuit Knowledge
- Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization
- Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models
- RAGulating Compliance: A Multi-Agent Knowledge Graph for Regulatory QA
- The Perils of Chart Deception: How Misleading Visualizations Affect Vision-Language Models
- OSUM-EChat: Enhancing End-to-End Empathetic Spoken Chatbot via Understanding-Driven Spoken Dialogue
- Towards Self-cognitive Exploration: Metacognitive Knowledge Graph Retrieval Augmented Generation
- TFRank: Think-Free Reasoning Enables Practical Pointwise LLM Ranking
- ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning
- SMA: Who Said That? Auditing Membership Leakage in Semi-Black-box RAG Controlling
- Utilizing Multilingual Encoders to Improve Large Language Models for Low-Resource Languages
- Compass-Thinker-7B Technical Report
- Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
- Exploring Large Language Model Agents for Piloting Social Experiments
- PersRM-R1: Enhance Personalized Reward Modeling with Reinforcement Learning
- InternBootcamp Technical Report: Boosting LLM Reasoning with Verifiable Task Scaling
- KFFocus: Highlighting Keyframes for Enhanced Video Understanding
- OverFill: Two-Stage Models for Efficient Language Model Decoding
- SAEMark: Multi-bit LLM Watermarking with Inference-Time Scaling
- Data-Efficient Biomedical In-Context Learning: A Diversity-Enhanced Submodular Perspective
- A Data-driven ML Approach for Maximizing Performance in LLM-Adapter Serving
- AIS-LLM: A Unified Framework for Maritime Trajectory Prediction, Anomaly Detection, and Collision Risk Assessment with Explainable Forecasting
- EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning
- Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
- Reflect then Learn: Active Prompting for Information Extraction Guided by Introspective Confusion
- HealthBranches: Synthesizing Clinically-Grounded Question Answering Datasets via Decision Pathways
- SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding
- BoRA: Towards More Expressive Low-Rank Adaptation with Block Diversity
- Multimodal learning with next-token prediction for large multimodal models
- What Builds Effective In-Context Examples for Code Generation?
- UR2: Unify RAG and Reasoning through Reinforcement Learning
- Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding
- Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing
- LLMs for Resource Allocation: A Participatory Budgeting Approach to Inferring Preferences
- On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification
- LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
- CodeBoost: Boosting Code LLMs by Squeezing Knowledge from Code Snippets with RL
- VFlowOpt: A Token Pruning Framework for LMMs with Visual Information Flow-Guided Optimization
- SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images
- SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
- GeRe: Towards Efficient Anti-Forgetting in Continual Learning of LLM via General Samples Replay
- Training-Free Multimodal Large Language Model Orchestration
- UniTalker: Conversational Speech-Visual Synthesis
- SID: Benchmarking Guided Instruction Capabilities in STEM Education with a Socratic Interdisciplinary Dialogues Dataset
- SVGen: Interpretable Vector Graphics Generation with Large Language Models
- PersonaEval: Are LLM Evaluators Human Enough to Judge Role-Play?
- Forgetting: A New Mechanism Towards Better Large Language Model Fine-tuning
- CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward
- SAGE-HLS: Syntax-Aware AST-Guided LLM for High-Level Synthesis Code Generation
- NeuroSync: Intent-Aware Code-Based Problem Solving via Direct LLM Understanding Modification
- Who is a Better Player: LLM against LLM
- Augmenting Continual Learning of Diseases with LLM-Generated Visual Concepts
- Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning
- CTTS: Collective Test-Time Scaling
- PLoRA: Efficient LoRA Hyperparameter Tuning for Large Models
- Semantic Structure in Large Language Model Embeddings
- Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference
- VLM4D: Towards Spatiotemporal Awareness in Vision Language Models
- FPEdit: Robust LLM Fingerprinting through Localized Parameter Editing
- CompressKV: Semantic Retrieval Heads Know What Tokens are Not Important Before Generation
- Isolating Culture Neurons in Multilingual Large Language Models
- Alleviating Attention Hacking in Discriminative Reward Modeling through Interaction Distillation
- CUPID: Evaluating Personalized and Contextualized Alignment of LLMs from Interactions
- A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
- T-GRAG: A Dynamic GraphRAG Framework for Resolving Temporal Conflicts and Redundancy in Knowledge Retrieval
- MedSynth: Realistic, Synthetic Medical Dialogue-Note Pairs
- Aligning Language Models with Real-time Knowledge Editing
- The Promise of RL for Autoregressive Image Editing
- Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
- PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning
- Integrating clinical reasoning into large language model-based diagnosis through etiology-aware attention steering
- WMAS: A Multi-Agent System Towards Intelligent and Customized Wireless Networks
- From Individuals to Crowds: Dual-Level Public Response Prediction in Social Media
- Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs
- Self-Foveate: Enhancing Diversity and Difficulty of Synthesized Instructions from Unsupervised Text via Multi-Level Foveation
- Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval
Discussions
Related