The Llama 3 Herd of Models
2024/07/31 by Grattafiori, Aaron, Dubey, Abhimanyu, Jauhri, Abhinav +556 · 2735 citations
#Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences
paper · doi:10.48550/arxiv.2407.21783
Abstract
Modern artificial intelligence (AI) systems are powered by foundation models. This paper presents a new set of foundation models, called Llama 3. It is a herd of language models that natively support multilinguality, coding, reasoning, and tool usage. Our largest model is a dense Transformer with 405B parameters and a context window of up to 128K tokens. This paper presents an extensive empirical evaluation of Llama 3. We find that Llama 3 delivers comparable quality to leading language models such as GPT-4 on a plethora of tasks. We publicly release Llama 3, including pre-trained and post-trained versions of the 405B parameter language model and our Llama Guard 3 model for input and output safety. The paper also presents the results of experiments in which we integrate image, video, and speech capabilities into Llama 3 via a compositional approach. We observe this approach performs competitively with the state-of-the-art on image, video, and speech recognition tasks. The resulting models are not yet being broadly released as they are still under development.
Cited by
- Same or Not? Enhancing Visual Perception in Vision-Language Models
- Beyond Correctness: Exposing LLM-generated Logical Flaws in Reasoning via Multi-step Automated Theorem Proving
- Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision
- Entropy-Guided Token Dropout: Training Autoregressive Language Models with Limited Domain Data
- Directly Constructing Low-Dimensional Solution Subspaces in Deep Neural Networks
- CountGD++: Generalized Prompting for Open-World Counting
- The Law of Multi-Model Collaboration: Scaling Limits of Model Ensembling for Large Language Models
- Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation
- Robust LLM-based Column Type Annotation via Prompt Augmentation with LoRA Tuning
- Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs
- Reservoir Computing inspired Matrix Multiplication-free Language Model
- Problems With Large Language Models for Learner Modelling: Why LLMs Alone Fall Short for Responsible Tutoring in K--12 Education
- LENS: LLM-Enabled Narrative Synthesis for Mental Health by Aligning Multimodal Sensing with Language Models
- Characterizing Narrative Content in Web-scale LLM Pretraining Data
- Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics
- A Brain-like Synergistic Core in LLMs Drives Behaviour and Learning
- Fine-Tuning LLMs with Fine-Grained Human Feedback on Text Spans
- Debugging Tabular Log as Dynamic Graphs
- OptiNIC: A Resilient and Tail-Optimal RDMA NIC for Distributed ML Workloads
- SPECTRE: Spectral Pre-training Embeddings with Cylindrical Temporal Rotary Position Encoding for Fine-Grained sEMG-Based Movement Decoding
- EmoCtrl: Controllable Emotional Image Content Generation
- Towards Efficient Post-Training via Fourier-Driven Adapter Architectures
- Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
- SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents
- FETAL-GAUGE: A Benchmark for Assessing Vision-Language Models in Fetal Ultrasound
- LiveProteinBench: A Contamination-Free Benchmark for Assessing Models' Specialized Capabilities in Protein Science
- Agentic Software Issue Resolution with Large Language Models: A Survey
- Shape of Thought: When Distribution Matters More than Correctness in Reasoning Tasks
- VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
- Open-Source Multimodal Moxin Models with Moxin-VLM and Moxin-VLA
- MatKV: Trading Compute for Flash Storage in LLM Inference
- BitFlipScope: Scalable Fault Localization and Recovery for Bit-Flip Corruptions in LLMs
- Success Is Not Self-Explanatory: Auditing Success Provenance in Agent Evaluation
- Distributed Sparse Interventions in Language Models
- LLM as a Meta-Judge: Synthetic Data for NLP Evaluation Metric Validation
- BERT-based Models vs. Large Language Models for Low-Resource Named Entity Recognition: A Comparative Study on Marathi
- TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA+ Specification Generation
- Express Language Modeling
- Accelerating Language Model Workflows with Prompt Choreography
- Training Language Models to Cooperate with Inference-Time Controllers
- Offline-to-Online Creative Optimization with Generative Models and Adaptive Testing
- Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV
- DeepFaith: Evidence-Grounded LLMs for Faithful Incident Reporting in Multi-Stage APT Defense
- Beyond Aggregate Risk: Role-Stratified Conformal Risk Control for LLM Tool Calls
- Application-Driven Architecture Exploration for Cross-Layer Heterogeneous Systems
- StanceFlip: A Comprehensive Multi-Dimensional Benchmark for Multimodal Conversational Stance Flipping Forecasting
- TRACE-CTI: Auditable Post-Extraction Governance of TTP Claims with Knowledge Graphs
- LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding
- Hierarchical Group-Conditional Conformal Risk Control for Selective Prediction in Language Models
- D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models
- What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features
- Where Steering Signals Come From: Activation Source Selection in Activation Steering
- A scaling law of contextual persistence in human language
- PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention
- Retraction-Free Optimization over the Stiefel Manifold for the LoRA Fine-Tuning
- Grevo: A Unified Generative Recommendation Framework with Evolutionary Item Indexing
- Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization
- Raven: High-Recall Sequence Modeling with Sparse Memory Routing
- Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering
- At-the-Roofline Sparse Tensor Contractions on Vector Processors for Transformer Inference
- AMPBench-MT: A Homology-Controlled Benchmark for Antimicrobial Peptide Potency, Spectrum, and Safety Prediction
- Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference
- Learning from 53.6K Real-World Developer Edits of AI-Generated Code
- Mask2Shield: Strengthening LLM Safety against Neuron-Pruning Attacks
- In-Context Learning as Implicit Policy Gradient
- Traceable LLM Reasoning for Fake-Order Fraud Detection
- MedJudgeRAG: Option-Wise Evidence Judgment with Dynamic Knowledge Graphs for Medical MCQA
- Language-Routed RAG and Direct Option Scoring for Multilingual Financial QA: DS@GT at FinMMEval
- Agent Team Work Zone: An Automated, Persistent Workspace for Long-Lived Claude Code Agent Teams
- Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias
- Coordinated Networking for On-Device Agent-Augmented Real-Time Communication
- MPR-CiteG: Enhancing RAG with Multi-Portfolio Retrieval and Citation-Grounded Generation
- Unifying Learning Dynamics and Generalization in Transformers Scaling Law
- How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift
- Influence of Prompt Engineering on Small Language Models for Guarded Query Routing
- EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis
- CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data
- HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization
- Opti-Q: A Constraint-Based Optimization Framework for Multi-LLM Question Planning
- DynaResize: Runtime GPU Reallocation for Disaggregated LLM Post-Training
- Can LLMs Write Correct TLA+ Specifications? Evaluating Natural-Language-to-TLA+ Generation
- Reference Feature Atlases for Mechanistic Auditing of Language Models
- Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy
- StreamProfileBench: A Benchmark for Fine-Grained User Profile Inference in Real-World Streaming Scenarios
- Evaluating large language models for diagnostic reasoning from unstructured clinical narratives in epilepsy
- Procedural Knowledge at Scale Improves Reasoning
- Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models
- FlashEvaluator: Expanding Search Space with Parallel Sequence-Level Evaluation
- An Efficient and Effective Evaluator for Text2SQL Models on Unseen and Unlabeled Data
- SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems
- RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
- Compressing LLMs with MoP: Mixture of Pruners
- LIME:Accelerating Collaborative Lossless LLM Inference on Memory-Constrained Edge Devices
- Rare Word Recognition and Translation Without Fine-Tuning via Task Vector in Speech Models
- CricBench: A Multilingual Benchmark for Evaluating LLMs in Cricket Analytics
- A Comedy of Estimators: On KL Regularization in RL Training of LLMs
- Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models
- Rethinking Output Alignment For 1-bit Post-Training Quantization of Large Language Models
- Efficient MoE Inference with Fine-Grained Scheduling of Disaggregated Expert Parallelism
- RefineBridge: Generative Bridge Models Improve Financial Forecasting by Foundation Models
- Towards Responsible and Explainable AI Agents with Consensus-Driven Reasoning
- AutoBaxBuilder: Bootstrapping Code Security Benchmarking
- SPOT!: Map-Guided LLM Agent for Unsupervised Multi-CCTV Dynamic Object Tracking
- Foundation Model-based Evaluation of Neuropsychiatric Disorders: A Lifespan-Inclusive, Multi-Modal, and Multi-Lingual Study
- PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding
- Memory-Efficient Acceleration of Block Low-Rank Foundation Models on Resource Constrained GPUs
- LookPlanGraph: Embodied Instruction Following Method with VLM Graph Augmentation
- ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models
- Assessing the Software Security Comprehension of Large Language Models
- NotSoTiny: A Large, Living Benchmark for RTL Code Generation
- DIAL: Direct Iterative Adversarial Learning for Realistic Multi-Turn Dialogue Simulation
- TokSuite: Measuring the Impact of Tokenizer Choice on Language Model Behavior
- VL4Gaze: Unleashing Vision-Language Models for Gaze Following
- Automated stereotactic radiosurgery planning using a human-in-the-loop reasoning large language model agent
- Coherence in the brain unfolds across separable temporal regimes
- M3KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation
- Generative Digital Twins: Vision-Language Simulation Models for Executable Industrial Systems
- TableGPT-R1: Advancing Tabular Reasoning Through Reinforcement Learning
- FaithLens: Detecting and Explaining Faithfulness Hallucination
- Learning to Reason in LLMs by Expectation Maximization
- Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents
- Neuron-Guided Interpretation of Code LLMs: Where, Why, and How?
- TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation
- Making Large Language Models Efficient Dense Retrievers
- GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators
- Over++: Generative Video Compositing for Layer Interaction Effects
- RAPID-LLM: Resilience-Aware Performance analysis of Infrastructure for Distributed LLM Training and Inference
- HATS: High-Accuracy Triple-Set Watermarking for Large Language Models
- FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning
- Can abstract concepts from LLM improve SLM performance?
- Generation of Programmatic Rules for Document Forgery Detection Using Large Language Models
- Causal-Guided Detoxify Backdoor Attack of Open-Weight LoRA Models
- MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking
- Code2Doc: A Quality-First Curated Dataset for Code Documentation
- From Word to World: Can Large Language Models be Implicit Text-based World Models?
- Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback
- brat: Aligned Multi-View Embeddings for Brain MRI Analysis
- Solver-Independent Automated Problem Formulation via LLMs for High-Cost Simulation-Driven Design
- Large Language Models as Discounted Bayesian Filters
- Sophia: A Persistent Agent Framework of Artificial Life
- Training LLMs with LogicReward for Faithful and Rigorous Reasoning
- LLM Agents Implement an NLG System from Scratch: Building Interpretable Rule-Based RDF-to-Text Generators
- Holistic Evaluation of State-of-the-Art LLMs for Code Generation
- Accelerating End-to-End PDF to Markdown Conversion Through Assisted Generation
- Adversarial Robustness of Vision in Open Foundation Models
- When the Gold Standard Isn't Necessarily Standard: Challenges of Evaluating the Translation of User-Generated Content
- GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation
- AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens
- CodeGEMM: A Codebook-Centric Approach to Efficient GEMM in Quantized LLMs
- Video Detective: Seek Critical Clues Recurrently to Answer Question from Long Videos
- Direct Confidence Alignment: Aligning Verbalized Confidence with Internal Confidence In Large Language Models
- Atom: Efficient On-Device Video-Language Pipelines Through Modular Reuse
- UniRel: Relation-Centric Knowledge Graph Question Answering with RL-Tuned LLM Reasoning
- 4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
- Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification
- Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
- How Good is Post-Hoc Watermarking With Language Model Rephrasing?
- AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning
- TOGGLE: Temporal Logic-Guided Large Language Model Compression for Edge
- Meta-RL Induces Exploration in Language Agents
- PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence
- NRGPT: An Energy-based Alternative for GPT
- CitySeeker: How Do VLMS Explore Embodied Urban Navigation With Implicit Human Needs?
- DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI
- Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
- TimeSeries2Report prompting enables adaptive large language model management of lithium-ion batteries
- Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference
- Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs
- Pretrained Battery Transformer (PBT): A battery life prediction foundation model
- Trustworthy and Controllable Professional Knowledge Utilization in Large Language Models with TEE-GPU Execution
- Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
- DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack
- Scaling Laws for Energy Efficiency of Local LLMs
- LLM4Perf: Large Language Models Are Effective Samplers for Multi-Objective Performance Modeling
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
- DSO: Direct Steering Optimization for Bias Mitigation
- Spoken DialogSum: An Emotion-Rich Conversational Dataset for Spoken Dialogue Summarization
- Explaining the Reasoning of Large Language Models Using Attribution Graphs
- CangLing-KnowFlow: A Unified Knowledge-and-Flow-fused Agent for Comprehensive Remote Sensing Applications
- Yes-MT's Submission to the Low-Resource Indic Language Translation Shared Task in WMT 2024
- Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning
- Beyond Fast and Slow: Cognitive-Inspired Elastic Reasoning for Large Language Models
- Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation
- Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams
- Log Anomaly Detection with Large Language Models via Knowledge-Enriched Fusion
- DP-Bench: A Benchmark for Evaluating Data Product Creation Systems
- PADE: A Predictor-Free Sparse Attention Accelerator via Unified Execution and Stage Fusion
- Effect of Document Packing on the Latent Multi-Hop Reasoning Capabilities of Large Language Models
- DISCODE: Distribution-Aware Score Decoder for Robust Automatic Evaluation of Image Captioning
- Unified Semantic Transformer for 3D Scene Understanding
- TEMP: A Memory Efficient Physical-aware Tensor Partition-Mapping Framework on Wafer-scale Chips
- Gödel's Poetry
- Improving Semantic Uncertainty Quantification in LVLMs with Semantic Gaussian Processes
- Neural Chameleons: Language Models Can Learn to Hide Their Thoughts from Unseen Activation Monitors
- Neurosymbolic Inference On Foundation Models For Remote Sensing Text-to-image Retrieval With Complex Queries
- RADAR: Accelerating Large Language Model Inference With RL-Based Dynamic Draft Trees
- Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed
- OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value
- DTop-p MoE: Sparsity-Controlled Dynamic Top-p MoE for Foundation Model Pre-training
- Autonomous Construction-Site Safety Inspection Using Mobile Robots: A Multilayer VLM-LLM Pipeline
- HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering
- SuperCLIP: CLIP with Simple Classification Supervision
- Beyond surface form: A pipeline for semantic analysis in Alzheimer's Disease detection from spontaneous speech
- NL2SpaTiaL: Generating Geometric Spatio-Temporal Logic Specifications from Natural Language for Manipulation Tasks
- Do Reviews Matter for Recommendations in the Era of Large Language Models?
- Temporal Tokenization Strategies for Event Sequence Modeling with Large Language Models
- ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
- MiniLingua: A Small Open-Source LLM for European Languages
- Error-Driven Prompt Optimization for Arithmetic Reasoning
- MAC: A Multi-Agent Framework for Interactive User Clarification in Multi-turn Conversations
- Sliding Window Recurrences for Sequence Models
- MIDUS: Memory-Infused Depth Up-Scaling
- SliceMoE: Bit-Sliced Expert Caching under Miss-Rate Constraints for Efficient MoE Inference
- Quantigence: A Multi-Agent AI Framework for Quantum Security Research
- ProServe: Unified Multi-Priority Request Scheduling for LLM Serving
- On the Effectiveness of Membership Inference in Targeted Data Extraction from Large Language Models
- MineTheGap: Automatic Mining of Biases in Text-to-Image Models
- What Matters in Evaluating Book-Length Stories? A Systematic Study of Long Story Evaluation
- Resting Neurons, Active Insights: Improving Input Sparsification for Large Language Models
- HyperEdit: Unlocking Instruction-based Text Editing in LLMs via Hypernetworks
- Diverse LLMs vs. Vulnerabilities: Who Detects and Fixes Them Better?
- Generative Spatiotemporal Data Augmentation
- HetRL: Efficient Reinforcement Learning for LLMs in Heterogeneous Environments
- EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing
- Floorplan2Guide: LLM-Guided Floorplan Parsing for BLV Indoor Navigation
- Rethinking Label Consistency of In-Context Learning: An Implicit Transductive Label Propagation Perspective
- BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models
- Detecting the Disturbance: A Nuanced View of Introspective Abilities in LLMs
- The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior
- Bounding Hallucinations: Information-Theoretic Guarantees for RAG Systems via Merlin-Arthur Protocols
- Using GUI Agent for Electronic Design Automation
- The Effect of Document Summarization on LLM-Based Relevance Judgments
- CADMorph: Geometry-Driven Parametric CAD Editing via a Plan-Generate-Verify Loop
- Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization
- Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
- AGAPI-Agents: An Open-Access Agentic AI Platform for Accelerated Materials Design on AtomGPT.org
- Multi-Intent Spoken Language Understanding: Methods, Trends, and Challenges
- Mining Legal Arguments to Study Judicial Formalism
- Stronger Normalization-Free Transformers
- SoccerMaster: A Vision Foundation Model for Soccer Understanding
- CXL-SpecKV: A Disaggregated FPGA Speculative KV-Cache for Datacenter LLM Serving
- Textual Data Bias Detection and Mitigation -- An Extensible Pipeline with Experimental Evaluation
- Boosting RL-Based Visual Reasoning with Selective Adversarial Entropy Intervention
- GPG: Generalized Policy Gradient Theorem for Transformer-based Policies
- Multilingual VLM Training: Adapting an English-Trained VLM to French
- Local LLM Ensembles for Zero-shot Portuguese Named Entity Recognition
- Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap
- AutoMedic: An Automated Evaluation Framework for Clinical Conversational Agents with Medical Dataset Grounding
- Watermarks for Language Models via Probabilistic Automata
- T-pro 2.0: An Efficient Russian Hybrid-Reasoning Model and Playground
- XDoGE: Multilingual Data Reweighting to Enhance Language Inclusivity in LLMs
- Scaling Behavior of Discrete Diffusion Language Models
- Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning
- DynaMate: An Autonomous Agent for Protein-Ligand Molecular Dynamics Simulations
- FlipLLM: Efficient Bit-Flip Attacks on Multimodal LLMs using Reinforcement Learning
- RIFT: A Scalable Methodology for LLM Accelerator Fault Assessment using Reinforcement Learning
- Neurosymbolic Information Extraction from Transactional Documents
- CNFinBench: A Benchmark for Safety and Compliance of Large Language Models in Finance
- Can LLMs Evaluate What They Cannot Annotate? Revisiting LLM Reliability in Hate Speech Detection
- Chasing Shadows: Pitfalls in LLM Security Research
- Don't Throw Away Your Beams: Improving Consistency-based Uncertainties in LLMs via Beam Search
- WarmServe: Enabling One-for-Many GPU Prewarming for Multi-LLM Serving
- LLaDA2.0: Scaling Up Diffusion Language Models to 100B
- Text2Graph: Combining Lightweight LLMs and GNNs for Efficient Text Classification in Label-Scarce Scenarios
- Learning Unmasking Policies for Diffusion Language Models
- Fluent Alignment with Disfluent Judges: Post-training for Lower-resource Languages
- A Practical Guide for Designing, Developing, and Deploying Production-Grade Agentic AI Workflows
- LaMoSys3.5D: Enabling 3.5D-IC-Based Large Language Model Inference Serving Systems via Hardware/Software Co-Design
- Llama-based source code vulnerability detection: Prompt engineering vs Fine tuning
- Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs
- The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss
- SoMe: A Realistic Benchmark for LLM-based Social Media Agents
- MIRAGE: Misleading Retrieval-Augmented Generation via Black-box and Query-agnostic Poisoning Attacks
- Chopper: A Multi-Level GPU Characterization Tool & Derived Insights Into LLM Training Inefficiency
- GeoLoom: High-quality Geometric Diagram Generation from Textual Input
- Information-Dense Reasoning for Efficient and Auditable Security Alert Triage
- SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA
- ValuePilot: A Two-Phase Framework for Value-Driven Decision-Making
- LUNA: Linear Universal Neural Attention with Generalization Guarantees
- Provable Long-Range Benefits of Next-Token Prediction
- MoCoRP: Modeling Consistent Relations between Persona and Response for Persona-based Dialogue
- Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context LLMs
- Persian-Phi: Efficient Cross-Lingual Adaptation of Compact LLMs via Curriculum Learning
- FOAM: Blocked State Folding for Memory-Efficient LLM Training
- Dual Refinement Cycle Learning: Unsupervised Text Classification of Mamba and Community Detection on Text Attributed Graph
- JT-DA: Enhancing Data Analysis with Tool-Integrated Table Reasoning Large Language Models
- A Patient-Doctor-NLP-System to contest inequality for less privileged
- Graph-Regularized Sparse Autoencoders for LLM Safety Steering
- GradientSpace: Unsupervised Data Clustering for Improved Instruction Tuning
- Towards Efficient Hypergraph and Multi-LLM Agent Recommender Systems
- Uncovering Competency Gaps in Large Language Models and Their Benchmarks
- Classifying German Language Proficiency Levels Using Large Language Models
- Knowing What's Missing: Assessing Information Sufficiency in Question Answering
- Modeling Contextual Passage Utility for Multihop Question Answering
- Emergence of Language in the Developing Brain
- The Effect of Belief Boxes and Open-mindedness on Persuasion
- Greedy Alignment Principle for Optimizer Selection
- A Latent Variable Framework for Scaling Laws in Large Language Models
- WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
- Empathy by Design: Aligning Large Language Models for Healthcare Dialogue
- MaxShapley: Towards Incentive-compatible Generative Search with Fair Context Attribution
- SymPyBench: A Dynamic Benchmark for Scientific Reasoning with Executable Python Code
- PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation
- KQ-SVD: Compressing the KV Cache with Provable Guarantees on Attention Fidelity
- VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
- Capturing Classic Authorial Style in Long-Form Story Generation with GRPO Fine-Tuning
- Hyperparameter Transfer Enables Consistent Gains of Matrix-Preconditioned Optimizers Across Scales
- Fast SceneScript: Accurate and Efficient Structured Language Model via Multi-Token Prediction
- Ontology Learning with LLMs: A Benchmark Study on Axiom Identification
- Automated Identification of Incidentalomas Requiring Follow-Up: A Multi-Anatomy Evaluation of LLM-Based and Supervised Approaches
- Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment
- PrivCode: When Code Generation Meets Differential Privacy
- ArtistMus: A Globally Diverse, Artist-Centric Benchmark for Retrieval-Augmented Music Question Answering
- TV2TV: A Unified Framework for Interleaved Language and Video Generation
- Structured Document Translation via Format Reinforcement Learning
- Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
- ResearchArcade: Graph Interface for Academic Tasks
- Sell Data to AI Algorithms Without Revealing It: Secure Data Valuation and Sharing via Homomorphic Encryption
- FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization
- Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?
- Selecting User Histories to Generate LLM Users for Cold-Start Item Recommendation
- Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens
- Ask Safely: Privacy-Aware LLM Query Generation for Knowledge Graphs
- Are LLMs Truly Multilingual? Exploring Zero-Shot Multilingual Capability of LLMs for Information Retrieval: An Italian Healthcare Use Case
- Tracing the ongoing emergence of human-like reasoning in Large Language Models
- Verbalizing LLMs' assumptions to explain and control sycophancy
- Group Selection as a Safeguard Against AI Substitution
- EtCon: Edit-then-Consolidate for Reliable Knowledge Editing
- RLHFSpec: Breaking the Efficiency Bottleneck in RLHF Training via Adaptive Drafting
- SignRoundV2: Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs
- OsmT: Bridging OpenStreetMap Queries and Natural Language with Open-source Tag-aware Language Models
- Measuring the Unspoken: A Disentanglement Model and Benchmark for Psychological Analysis in the Wild
- Mitigating Object and Action Hallucinations in Multimodal LLMs via Self-Augmented Contrastive Alignment
- Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models
- Malicious Image Analysis via Vision-Language Segmentation Fusion: Detection, Element, and Location in One-shot
- Uncovering Students' Inquiry Patterns in GenAI-Supported Clinical Practice: An Integration of Epistemic Network Analysis and Sequential Pattern Mining
- Distance Is All You Need: Radial Dispersion for Uncertainty Estimation in Large Language Models
- Balancing Safety and Helpfulness in Healthcare AI Assistants through Iterative Preference Alignment
- Training-Free Policy Violation Detection via Activation-Space Whitening in LLMs
- CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding
- Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs
- AR-Med: Automated Relevance Enhancement in Medical Search via LLM-Driven Information Augmentation
- Tutorial on Large Language Model-Enhanced Reinforcement Learning for Wireless Networks
- FFTrainer: Fast Failover in Large-Language Model Training with Almost-Free State Management
- Cognitive Mirrors: Exploring the Diverse Functional Roles of Attention Heads in LLM Reasoning
- KVNAND: Efficient On-Device Large Language Model Inference Using DRAM-Free In-Flash Computing
- Data-Free Pruning of Self-Attention Layers in LLMs
- A Preliminary Study on the Promises and Challenges of Native Top-k Sparse Attention
- ProcObject-10K: Benchmarking Object-Centric Procedural Understanding in Instructional Videos
- AsymPuzl: An Asymmetric Puzzle for multi-agent cooperation
- Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
- Leveraging LLMs for Structured Data Extraction from Unstructured Patient Records
- Large Language Models as Generalist Policies for Network Optimization
- Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding
- MarkTune: Improving the Quality-Detectability Trade-off in Open-Weight LLM Watermarking
- From FLOPs to Footprints: The Resource Cost of Artificial Intelligence
- Action Anticipation at a Glimpse: To What Extent Can Multimodal Cues Replace Video?
- CrowdLLM: Building LLM-Based Digital Populations Augmented with Generative Models
- When Do Symbolic Solvers Enhance Reasoning in Large Language Models?
- SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
- Self-Improving VLM Judges Without Human Annotations
- SA-ADP: Sensitivity-Aware Adaptive Differential Privacy for Large Language Models
- Fairy2i: Training Complex LLMs from Real LLMs with All Parameters in \± 1, ± i\
- EngChain: A Symbolic Benchmark for Verifiable Multi-Step Reasoning in Engineering
- PPTBench: Towards Holistic Evaluation of Large Language Models for PowerPoint Layout and Design Understanding
- Menta: A Small Language Model for On-Device Mental Health Prediction
- CREST: Universal Safety Guardrails Through Cluster-Guided Cross-Lingual Transfer
- ADORE: Autonomous Domain-Oriented Relevance Engine for E-commerce
- CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning
- PopSim: Social Network Simulation for Social Media Popularity Prediction
- TaleFrame: An Interactive Story Generation System with Fine-Grained Control and Large Language Models
- COPE: Chain-Of-Thought Prediction Engine for Open-Source Large Language Model Based Stroke Outcome Prediction from Clinical Notes
- Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding
- SpecPV: Improving Self-Speculative Decoding for Long-Context Generation via Partial Verification
- Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
- Parameter-Efficient Subspace Optimization for LLM Fine-Tuning
- TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
- Guardian: Detecting Robotic Planning and Execution Errors with Vision-Language Models
- SVRG and Beyond via Posterior Correction
- OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation
- Cross-Lingual Interleaving for Speech Language Models
- How Does RL Post-training Induce Skill Composition? A Case Study on Countdown
- Edge Deployment of Small Language Models, a comprehensive comparison of CPU, GPU and NPU backends
- A Systematic Characterization of LLM Inference on GPUs
- MAC-SLU: Multi-Intent Automotive Cabin Spoken Language Understanding Benchmark
- Scaling and context steer LLMs along the same computational path as the human brain
- RoMe: Row Granularity Access Memory System for Large Language Models
- The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search
- EmoRAG: Evaluating RAG Robustness to Symbolic Perturbations
- CuES: A Curiosity-driven and Environment-grounded Synthesis Framework for Agentic RL
- Kardia-R1: Unleashing LLMs to Reason toward Understanding and Empathy for Emotional Support via Rubric-as-Judge Reinforcement Learning
- Knowledge Graph Augmented Large Language Models for Disease Prediction
- polyRETRO: a Language Model Approach to predict Polymerization Class and Monomer(s) for a Target Polymer
- LLM2Fx-Tools: Tool Calling For Music Post-Production
- CoSineVerifier: Tool-Augmented Answer Verification for Computation-Oriented Scientific Questions
- Multilingual Conversational AI for Financial Assistance: Bridging Language Barriers in Indian FinTech
- ChromouVQA: Benchmarking Vision-Language Models under Chromatic Camouflaged Images
- Joint Partitioning and Placement of Foundation Models for Real-Time Edge AI
- When Safety Blocks Sense: Measuring Semantic Confusion in LLM Refusals
- Chain of Unit-Physics: A Primitive-Centric Approach to Scientific Code Synthesis
- FOM-Nav: Frontier-Object Maps for Object Goal Navigation
- Advancing Academic Chatbots: Evaluation of Non Traditional Outputs
- Towards Active Synthetic Data Generation for Finetuning Language Models
- BioPro: Towards Difference-Aware Gender Fairness for Vision-Language Models
- Auxiliary-Hyperparameter-Free Sampling: Entropy Equilibrium for Text Generation
- What Is Preference Optimization Doing, How and Why?
- UMM-RM: An Upcycle-and-Merge MoE Reward Model for Mitigating Reward Hacking
- SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs
- When Human Preferences Flip: An Instance-Dependent Robust Loss for RLHF
- Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation
- ProEx: A Unified Framework Leveraging Large Language Model with Profile Extrapolation for Recommendation
- CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding
- SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models
- G-KV: Decoding-Time KV Cache Eviction with Global Attention
- Mitigating the Threshold Priming Effect in Large Language Model-Based Relevance Judgments via Personality Infusing
- Evidence-Guided Schema Normalization for Temporal Tabular Reasoning
- Progressive Code Integration for Abstractive Bug Report Summarization
- Beyond Code Pairs: Dialogue-Based Data Generation for LLM Code Translation
- VCWorld: A Biological World Model for Virtual Cell Simulation
- ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning
- EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
- Mammo-FM: Breast-specific foundational model for Integrated Mammographic Diagnosis, Prognosis, and Reporting
- Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
- Optimizing Multimodal Language Models through Attention-based Interpretability
- Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering
- TWEO: Transformers Without Extreme Outliers Enables FP8 Training And Quantization For Dummies
- Instruction Tuning of Large Language Models for Tabular Data Generation-in One Day
- Serving Heterogeneous LoRA Adapters in Distributed LLM Inference Systems
- Asm2SrcEval: Evaluating Large Language Models for Assembly-to-Source Code Translation
- An Electrocardiogram Multi-task Benchmark with Comprehensive Evaluations and Insightful Findings
- ORION: Teaching Language Models to Reason Efficiently in the Language of Thought
- Measuring What LLMs Think They Do: SHAP Faithfulness and Deployability on Financial Tabular Classification
- PRISM: Privacy-Aware Routing for Adaptive Cloud-Edge LLM Inference via Semantic Sketch Collaboration
- CoFiRec: Coarse-to-Fine Tokenization for Generative Recommendation
- Invisible Hands: Gray-Box Bit Flip Attack for Steering LLMs Without Knowledge of Gradients, Data, and Weights
- CacheTrap: Injecting Trojans in LLMs without Leaving any Traces in Inputs or Weights
- AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model
- SuRe: Surprise-Driven Prioritised Replay for Continual LLM Learning
- Mapping Clinical Doubt: Locating Linguistic Uncertainty in LLMs
- ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration
- SingleQuant: Efficient Quantization of Large Language Models in a Single Pass
- Swarms of Large Language Model Agents for Protein Sequence Design with Experimental Validation
- Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria-Following
- Focused Chain-of-Thought: Efficient LLM Reasoning via Structured Input Information
- Self-Transparency Failures in Expert-Persona LLMs: How Instruction-Following Overrides Disclosure
- A Systematic Study of In-the-Wild Model Merging for Large Language Models
- Can LLMs extract human-like fine-grained evidence for evidence-based fact-checking?
- Training Introspective Behavior: Fine-Tuning Induces Reliable Internal State Detection in a 7B Model
- Evaluation of Large Language Models for Numeric Anomaly Detection in Power Systems
- Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
- LLaMCAT: Optimizing Large Language Model Inference with Cache Arbitration and Throttling
- TEAR: Temporal-aware Automated Red-teaming for Text-to-Video Models
- A Unified Understanding of Offline Data Selection and Online Self-refining Generation for Post-training LLMs
- ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning
- Semantic Anchors in In-Context Learning: Why Small LLMs Cannot Flip Their Labels
- GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision
- SingingSDS: A Singing-Capable Spoken Dialogue System for Conversational Roleplay Applications
- Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code
- Representation Interventions Enable Lifelong Unstructured Knowledge Control
- ROOT: Robust Orthogonalized Optimizer for Neural Network Training
- DiFR: Inference Verification Despite Nondeterminism
- On Evaluating LLM Alignment by Evaluating LLMs as Judges
- A Tale of Two Geometries: Adaptive Optimizers and Non-Euclidean Descent
- CDLM: Consistency Diffusion Language Models For Faster Sampling
- From Words to Wisdom: Discourse Annotation and Baseline Models for Student Dialogue Understanding
- MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
- Fluid Intelligence: A Forward Look on AI Foundation Models in Computational Fluid Dynamics
- Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts
- Beluga: A CXL-Based Memory Architecture for Scalable and Efficient LLM KVCache Management
- M3Prune: Hierarchical Communication Graph Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation
- ParaBlock: Communication-Computation Parallel Block Coordinate Federated Learning for Large Language Models
- EfficientXpert: Efficient Domain Adaptation for Large Language Models via Propagation-Aware Pruning
- Complex Instruction Following with Diverse Style Policies in Football Games
- A Systematic Analysis of Large Language Models with RAG-enabled Dynamic Prompting for Medical Error Detection and Correction
- Mitigating hallucinations and omissions in LLMs for invertible problems: An application to hardware logic design automation
- SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA
- Latent Collaboration in Multi-Agent Systems
- HeaRT: A Hierarchical Circuit Reasoning Tree-Based Agentic Framework for AMS Design Optimization
- VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection
- Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
- AME: An Efficient Heterogeneous Agentic Memory Engine for Smartphones
- Orchestrating Dual-Boundaries: An Arithmetic Intensity Inspired Acceleration Framework for Diffusion Language Models
- Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation
- Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models
- CoreEval: Automatically Building Contamination-Resilient Datasets with Real-World Knowledge toward Reliable LLM Evaluation
- Cognitive Alpha Mining via LLM-Driven Code-Based Evolution
- Doubly Wild Refitting: Model-Free Evaluation of High Dimensional Black-Box Predictions under Convex Losses
- Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation
- Large-Scale In-Game Outcome Forecasting for Match, Team and Players in Football using an Axial Transformer Neural Network
- The Locally Deployable Virtual Doctor: LLM Based Human Interface for Automated Anamnesis and Database Conversion
- Majority of the Bests: Improving Best-of-N via Bootstrapping
- Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer
- Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
- An Invariant Latent Space Perspective on Language Model Inversion
- NEZHA: A Zero-sacrifice and Hyperspeed Decoding Architecture for Generative Recommendations
- What Helps Language Models Predict Human Beliefs: Demographics or Prior Stances?
- TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization
- Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning
- Xmodel-2.5: 1.3B Data-Efficient Reasoning SLM
- Building Resilient Information Ecosystems: Large LLM-Generated Dataset of Persuasion Attacks
- Table Comprehension in Building Codes using Vision Language Models and Domain-Specific Fine-Tuning
- What Can We Actually Steer? A Multi-Behavior Study of Activation Control
- SafeCiM: Investigating Resilience of Hybrid Floating-Point Compute-in-Memory Deep Learning Accelerators
- ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization
- Bringing Stability to Diffusion: Decomposing and Reducing Variance of Training Masked Diffusion Models
- Enhancing Automated Program Repair via Faulty Token Localization and Quality-Aware Patch Refinement
- Multi-speaker Attention Alignment for Multimodal Social Interaction
- MGA-VQA: Secure and Interpretable Graph-Augmented Visual Question Answering with Memory-Guided Protection Against Unauthorized Knowledge Use
- Pier: Efficient Large Language Model pretraining with Relaxed Global Communication
- Deterministic Inference across Tensor Parallel Sizes That Eliminates Training-Inference Mismatch
- PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
- Attention Guided Alignment in Efficient Vision-Language Models
- The Rapid Growth of AI Foundation Model Usage in Science
- Understanding Counting Mechanisms in Large Language and Vision-Language Models
- Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models
- REMSA: An LLM Agent for Foundation Model Selection in Remote Sensing
- Estonian WinoGrande Dataset: Comparative Analysis of LLM Performance on Human and Machine Translation
- Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
- Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions
- R2Q: Towards Robust 2-Bit Large Language Models via Residual Refinement Quantization
- Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
- Geometric-disentangelment Unlearning
- RoSA: Enhancing Parameter-Efficient Fine-Tuning via RoPE-aware Selective Adaptation in Large Language Models
- MUCH: A Multilingual Claim Hallucination Benchmark
- CREST: Improving Interpretability and Effectiveness of Troubleshooting at Ericsson through Criterion-Specific Trouble Report Retrieval
- OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
- Learning to Debug: LLM-Organized Knowledge Trees for Solving RTL Assertion Failures
- Nemotron Elastic: Towards Efficient Many-in-One Reasoning LLMs
- The Shifting Landscape of Vaccine Discourse: Insights From a Decade of Pre- to Post-COVID-19 Vaccine Posts on Social Media
- PromptTailor: Multi-turn Intent-Aligned Prompt Synthesis for Lightweight LLMs
- TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
- AICC: Parse HTML Finer, Make Models Better -- A 7.3T AI-Ready Corpus Built by a Model-Based HTML Parser
- "To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
- TS-PEFT: Unveiling Token-Level Redundancy in Parameter-Efficient Fine-Tuning
- Learning Tractable Distributions Of Language Model Continuations
- Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio
- JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
- Optimizing Federated Learning in the Era of LLMs: Message Quantization and Streaming
- Enhancing Breast Cancer Prediction with LLM-Inferred Confounders
- RescueLens: LLM-Powered Triage and Action on Volunteer Feedback for Food Rescue
- AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning
- CIMemories: A Compositional Benchmark for Contextual Integrity of Persistent Memory in LLMs
- ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions
- As If We've Met Before: LLMs Exhibit Certainty in Recognizing Seen Files
- Finetuning LLMs for Automatic Form Interaction on Web-Browser in Selenium Testing Framework
- Teaching According to Students' Aptitude: Personalized Mathematics Tutoring via Persona-, Memory-, and Forgetting-Aware LLMs
- Noise-Robust Abstractive Compression in Retrieval-Augmented Language Models
- HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning
- DEPO: Dual-Efficiency Preference Optimization for LLM Agents
- GigaEvo: An Open Source Optimization Framework Powered By LLMs And Evolution Algorithms
- AutoTool: Efficient Tool Selection for Large Language Model Agents
- Weight Variance Amplifier Improves Accuracy in High-Sparsity One-Shot Pruning
- N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator
- SymLoc: Symbolic Localization of Hallucination across HaluEval and TruthfulQA
- Jailbreaking Large Vision Language Models in Intelligent Transportation Systems
- RoboTidy : A 3D Gaussian Splatting Household Tidying Benchmark for Embodied Navigation and Action
- NeuroPath: Neurobiology-Inspired Path Tracking and Reflection for Semantically Coherent Retrieval
- Learning Skill-Attributes for Transferable Assessment in Video
- QwenCLIP: Boosting Medical Vision-Language Pretraining via LLM Embeddings and Prompt tuning
- Souper-Model: How Simple Arithmetic Unlocks State-of-the-Art LLM Performance
- Cog-RAG: Cognitive-Inspired Dual-Hypergraph with Theme Alignment Retrieval-Augmented Generation
- Large Language Models Meet Extreme Multi-label Classification: Scaling and Multi-modal Framework
- Zero-Shot Grammar Competency Estimation Using Large Language Model Generated Pseudo Labels
- Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction
- MACKO: Sparse Matrix-Vector Multiplication for Low Sparsity
- Synthetic Eggs in Many Baskets: The Impact of Synthetic Data Diversity on LLM Fine-Tuning
- Assessing Automated Fact-Checking for Medical LLM Responses with Knowledge Graphs
- When to Trust the Answer: Question-Aligned Semantic Nearest Neighbor Entropy for Safer Surgical VQA
- "Don't Teach Minerva": Guiding LLMs Through Complex Syntax for Faithful Latin Translation with RAG
- Can large language models be a cardinality estimator? An empirical study
- Exploring question answering: metric analysis and evaluation framework for enhanced interpretability
- Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge Editing
- Detecting LLM-Assisted Academic Dishonesty using Keystroke Dynamics
- Tailored Primitive Initialization is the Secret Key to Reinforcement Learning
- AI Text Detectors and the Misclassification of Slightly Polished Arabic Text
- Don't Think of the White Bear: Ironic Negation in Transformer Models Under Cognitive Load
- Optimal Self-Consistency for Efficient Reasoning with Large Language Models
- Suppressing VLM Hallucinations with Spectral Representation Filtering
- Multi-Value Alignment for LLMs via Value Decorrelation and Extrapolation
- MixAR: Mixture Autoregressive Image Generation
- Rethinking Deep Alignment Through The Lens Of Incomplete Learning
- MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering
- Preference Learning from Physics-Based Feedback: Tuning Language Models to Design BCC/B2 Superalloys
- A Multifaceted Analysis of Negative Bias in Large Language Models through the Lens of Parametric Knowledge
- KVSwap: Disk-aware KV Cache Offloading for Long-Context On-device Inference
- Identifying Imaging Follow-Up in Radiology Reports: A Comparative Analysis of Traditional ML and LLM Approaches
- TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models
- Non-Euclidean SGD for Structured Optimization: Unified Analysis and Improved Rates
- LAET: A Layer-wise Adaptive Ensemble Tuning Framework for Pretrained Language Models
- BhashaKritika: Building Synthetic Pretraining Data at Scale for Indic Languages
- VIDEOP2R: Video Understanding from Perception to Reasoning
- Draft and Refine with Visual Experts
- Flash-Fusion: Enabling Expressive, Low-Latency Queries on IoT Sensor Streams with LLMs
- Align to Misalign: Automatic LLM Jailbreak with Meta-Optimized LLM Judges
- ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
- Leveraging Large Language Models for Use Case Model Generation from Software Requirements
- AdvancedIF: Rubric-Based Benchmarking and Reinforcement Learning for Advancing LLM Instruction Following
- STAGE: A Symbolic Tensor grAph GEnerator for distributed AI system co-design
- Beyond Elicitation: Provision-based Prompt Optimization for Knowledge-Intensive Tasks
- Reasoning About Intent for Ambiguous Requests
- Persona-Aware Alignment Framework for Personalized Dialogue Generation
- Text2SQL-Flow: A Robust SQL-Aware Data Augmentation Framework for Text-to-SQL
- How Small Can You Go? Compact Language Models for On-Device Critical Error Detection in Machine Translation
- Enhancing the Medical Context-Awareness Ability of LLMs via Multifaceted Self-Refinement Learning
- GraphIF: Enhancing Multi-Turn Instruction Following for Large Language Models with Relation Graph Prompt
- Beyond ReAct: A Planner-Centric Framework for Complex Tool-Augmented LLM Reasoning
- Uncovering Strategic Egoism Behaviors in Large Language Models
- EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
- MoFa: A Unified Performance Modeling Framework for LLM Pretraining
- A3: Attention-Aware Accurate KV Cache Fusion for Fast Large Language Model Serving
- Black-Box On-Policy Distillation of Large Language Models
- Rethinking the Reliability of Multi-agent System: A Perspective from Byzantine Fault Tolerance
- Retrieval as a Decision: Training-Free Adaptive Gating for Efficient RAG
- LLM Inference Beyond a Single Node: From Bottlenecks to Mitigations with Fast All-Reduce Communication
- SynClaimEval: A Framework for Evaluating the Utility of Synthetic Data in Long-Context Claim Verification
- Towards Effective and Efficient Non-autoregressive decoders for Conformer and LLM-based ASR using Block-based Attention Mask
- Chain of Summaries: Summarization Through Iterative Questioning
- MCAD: Multimodal Context-Aware Audio Description Generation For Soccer
- DoPE: Denoising Rotary Position Embedding
- MACEval: A Multi-Agent Continual Evaluation Network for Large Models
- Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models
- HalluClean: A Unified Framework to Combat Hallucinations in LLMs
- Hierarchical Memorization in Large Language Models: Evidence from Citation Generation
- ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction
- Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention
- Understanding Inference Scaling for LLMs: Bottlenecks, Trade-offs, and Performance Principles
- General Intelligence-based Fragmentation (GIF): A framework for peak-labeled spectra simulation
- DPRM: A Dual Implicit Process Reward Model in Multi-Hop Question Answering
- JobSphere: An AI-Powered Multilingual Career Copilot for Government Employment Platforms
- AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
- SRE-Llama -- Fine-Tuned Meta's Llama LLM, Federated Learning, Blockchain and NFT Enabled Site Reliability Engineering(SRE) Platform for Communication and Networking Software Services
- ImagebindDC: Compressing Multi-modal Data with Imagebind-based Condensation
- ParliaBench: An Evaluation and Benchmarking Framework for LLM-Generated Parliamentary Speech
- Remodeling Semantic Relationships in Vision-Language Fine-Tuning
- Alignment-Aware Quantization for LLM Safety
- Relation as a Prior: A Novel Paradigm for LLM-based Document-level Relation Extraction
- Multimodal LLMs Do Not Compose Skills Optimally Across Modalities
- DynaAct: Large Language Model Reasoning with Dynamic Action Spaces
- Numerical Sensitivity and Robustness: Exploring the Flaws of Mathematical Reasoning in Large Language Models
- High-Quality Proposal Encoding and Cascade Denoising for Imaginary Supervised Object Detection
- NOTAM-Evolve: A Knowledge-Guided Self-Evolving Optimization Framework with LLMs for NOTAM Interpretation
- National Institute on Aging PREPARE Challenge: Early Detection of Cognitive Impairment Using Speech -- The SpeechCARE Solution
- A Circular Argument : Does RoPE need to be Equivariant for Vision?
- Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?
- Revisiting NLI: Towards Cost-Effective and Human-Aligned Metrics for Evaluating LLMs in Question Answering
- Exploring the AI Obedience: Why is Generating a Pure Color Image Harder than CyberPunk?
- Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs
- DigiData: Training and Evaluating General-Purpose Mobile Control Agents
- Voice-Interactive Surgical Agent for Multimodal Patient Data Control
- Selecting Auxiliary Data via Neural Tangent Kernels for Low-Resource Domains
- FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
- Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models
- Quantum Deep Learning Still Needs a Quantum Leap
- Think Consistently, Reason Efficiently: Energy-Based Calibration for Implicit Chain-of-Thought
- E2E-VGuard: Adversarial Prevention for Production LLM-based End-To-End Speech Synthesis
- Evaluating Large Language Models for Anxiety, Depression, and Stress Detection: Insights into Prompting Strategies and Synthetic Data
- Beyond English: Toward Inclusive and Scalable Multilingual Machine Translation with LLMs
- Optimizing GEMM for Energy and Performance on Versal ACAP Architectures
- Rethinking Retrieval-Augmented Generation for Medicine: A Large-Scale, Systematic Expert Evaluation and Practical Insights
- Evaluating Language Model Applications for Identifying Solution-Related Content in Issue Report Discussions
- Textual Self-attention Network: Test-Time Preference Optimization through Textual Gradient-based Attention
- Sensitivity of Small Language Models to Fine-tuning Data Contamination
- Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence
- FedRW: Efficient Privacy-Preserving Data Reweighting for Enhancing Federated Learning of Language Models
- MobileLLM-Pro Technical Report
- On the Analogy between Human Brain and LLMs: Spotting Key Neurons in Grammar Perception
- You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations
- EASE: Practical and Efficient Safety Alignment for Small Language Models
- Characterizing AI Manipulation Risks in Brazilian YouTube Climate Discourse
- DyKAF: Dynamical Kronecker Approximation of the Fisher Information Matrix for Gradient Preconditioning
- When AI Agents Collude Online: Financial Fraud Risks by Collaborative LLM Agents on Social Platforms
- SR-KI: Scalable and Real-Time Knowledge Integration into LLMs via Supervised Attention
- Optimizing Chain-of-Thought Confidence via Topological and Dirichlet Risk Analysis
- CG-TTRL: Context-Guided Test-Time Reinforcement Learning for On-Device Large Language Models
- What Makes Reasoning Invalid: Echo Reflection Mitigation for Large Language Models
- NURBGen: High-Fidelity Text-to-CAD Generation through LLM-Driven NURBS Modeling
- LUT-LLM: Efficient Large Language Model Inference with Memory-based Computations on FPGAs
- MoRA: Missing Modality Low-Rank Adaptation for Visual Recognition
- Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning
- Maestro: Learning to Collaborate via Conditional Listwise Policy Optimization for Multi-Agent LLMs
- Kunlun Anomaly Troubleshooter: Enabling Kernel-Level Anomaly Detection and Causal Reasoning for Large Model Distributed Inference
- CoEdge-RAG: Optimizing Hierarchical Scheduling for Retrieval-Augmented LLMs in Collaborative Edge Computing
- Retrieval-Augmented Generation in Medicine: A Scoping Review of Technical Implementations, Clinical Applications, and Ethical Considerations
- Open-World 3D Scene Graph Generation for Retrieval-Augmented Reasoning
- MCP-RiskCue: Can LLM Infer Risk Information From MCP Server System Logs?
- Can a Small Model Learn to Look Before It Leaps? Dynamic Learning and Proactive Correction for Hallucination Detection
- Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation
- MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling
- DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning
- Optimizing Diversity and Quality through Base-Aligned Model Collaboration
- MIMIC-SR-ICD11: A Dataset for Narrative-Based Diagnosis
- Dense Motion Captioning
- S2LM: Towards Semantic Steganography via Large Language Models
- Model Merging Improves Zero-Shot Generalization in Bioacoustic Foundation Models
- What About Our Bug? A Study on the Responsiveness of NPM Package Maintainers
- Deep Progressive Training: scaling up depth capacity of zero/one-layer models
- Scientific judgment drifts over time in AI ideation
- BudgetMem: Learning Selective Memory Policies for Cost-Efficient Long-Context Processing in Language Models
- Explore Data Left Behind in Reinforcement Learning for Reasoning Language Models
- SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding
- PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
- BanglaMedQA and BanglaMMedBench: Evaluating Retrieval-Augmented Generation Strategies for Bangla Biomedical Question Answering
- Large language models replicate and predict human cooperation across experiments in game theory
- Ground-Truth Subgraphs for Better Training and Evaluation of Knowledge Graph Augmented LLMs
- Reusing Pre-Training Data at Test Time is a Compute Multiplier
- E-CARE: An Efficient LLM-based Commonsense-Augmented Framework for E-Commerce
- Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing
- MIDI-LLM: Adapting Large Language Models for Text-to-MIDI Music Generation
- Exploring the Feasibility of End-to-End Large Language Model as a Compiler
- PEFA-AI: Advancing Open-source LLMs for RTL generation using Progressive Error Feedback Agentic-AI
- SENT Map -- Semantically Enhanced Topological Maps with Foundation Models
- Promoting Sustainable Web Agents: Benchmarking and Estimating Energy Consumption through Empirical and Theoretical Analysis
- GRAD: Graph-Retrieved Adaptive Decoding for Hallucination Mitigation
- Scaling Agent Learning via Experience Synthesis
- From Prompts to Power: Measuring the Energy Footprint of LLM Inference
- Leveraging LLM-based agents for social science research: insights from citation network simulations
- Diffusion Language Models are Super Data Learners
- A Feedback-Control Framework for Efficient Dataset Collection from In-Vehicle Data Streams
- IndicSuperTokenizer: An Optimized Tokenizer for Indic Multilingual LLMs
- SurgAnt-ViVQA: Learning to Anticipate Surgical Events through GRU-Driven Temporal Cross-Attention
- From Insight to Exploit: Leveraging LLM Collaboration for Adaptive Adversarial Text Generation
- Control Barrier Function for Aligning Large Language Models
- SnapStream: Efficient Long Sequence Decoding on Dataflow Accelerators
- Silenced Biases: The Dark Side LLMs Learned to Refuse
- From Measurement to Expertise: Empathetic Expert Adapters for Context-Based Empathy in Conversational AI Agents
- Surfacing Subtle Stereotypes: A Multilingual, Debate-Oriented Evaluation of Modern LLMs
- QiMeng-NeuComBack: Self-Evolving Translation from IR to Assembly Code
- Epidemiology of Large Language Models: A Benchmark for Observational Distribution Knowledge
- No-Human in the Loop: Agentic Evaluation at Scale for Recommendation
- Fine-Tuning Vision-Language Models for Multimodal Polymer Property Prediction
- Zero-shot data citation function classification using transformer-based large language models (LLMs)
- In Good GRACEs: Principled Teacher Selection for Knowledge Distillation
- Dynamic Reflections: Probing Video Representations with Text Alignment
- ConMeZO: Adaptive Descent-Direction Sampling for Gradient-Free Finetuning of Large Language Models
- Test-Time Steering for Lossless Text Compression via Weighted Product of Experts
- POLIS-Bench: Towards Multi-Dimensional Evaluation of LLMs for Bilingual Policy Tasks in Governmental Scenarios
- Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
- Understanding New-Knowledge-Induced Factual Hallucinations in LLMs: Analysis and Interpretation
- From the Laboratory to Real-World Application: Evaluating Zero-Shot Scene Interpretation on Edge Devices for Mobile Robotics
- ReAcTree: Hierarchical LLM Agent Trees with Control Flow for Long-Horizon Task Planning
- LTD-Bench: Evaluating Large Language Models by Letting Them Draw
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- Beyond Single Embeddings: Capturing Diverse Targets with Multi-Query Retrieval
- Rethinking LLM Human Simulation: When a Graph is What You Need
- DL4Proteins Jupyter Notebooks Teach how to use Artificial Intelligence for Biomolecular Structure Prediction and Design
- InsurAgent: A Large Language Model-Empowered Agent for Simulating Individual Behavior in Purchasing Flood Insurance
- Watermarking Discrete Diffusion Language Models
- Flashlight: PyTorch Compiler Extensions to Accelerate Attention Variants
- Efficient Tool-Calling Multi-Expert NPC Agent for Commonsense Persona-Grounded Dialogue
- Efficient Test-Time Retrieval Augmented Generation
- The Biased Oracle: Assessing LLMs' Understandability and Empathy in Medical Diagnoses
- Assessing LLM Reasoning Steps via Principal Knowledge Grounding
- FlexiCache: Leveraging Temporal Stability of Attention Heads for Efficient KV Cache Management
- Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
- A CPU-Centric Perspective on Agentic AI
- Do Methods to Jailbreak and Defend LLMs Generalize Across Languages?
- Separate the Wheat from the Chaff: Winnowing Down Divergent Views in Retrieval Augmented Generation
- Do You Know About My Nation? Investigating Multilingual Language Models' Cultural Literacy Through Factual Knowledge
- Zero-RAG: Towards Retrieval-Augmented Generation with Zero Redundant Knowledge
- Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs
- Superpositional Gradient Descent: Harnessing Quantum Principles for Model Training
- Word Salad Chopper: Reasoning Models Waste A Ton Of Decoding Budget On Useless Repetitions, Self-Knowingly
- Sherlock: Reliable and Efficient Agentic Workflow Execution
- LingGym: How Far Are LLMs from Thinking Like Field Linguists?
- BeetleFlow: An Integrative Deep Learning Pipeline for Beetle Image Processing
- Neural Transparency: Mechanistic Interpretability Interfaces for Anticipating Model Behaviors for Personalized AI
- Can SAEs reveal and mitigate racial biases of LLMs in healthcare?
- On Selecting Few-Shot Examples for LLM-based Code Vulnerability Detection
- Best Practices for Biorisk Evaluations on Open-Weight Bio-Foundation Models
- Data-Efficient Domain Adaptation for LLM-based MT using Contrastive Preference Optimization
- TetraJet-v2: Accurate NVFP4 Training for Large Language Models with Oscillation Suppression and Outlier Control
- Rethinking Robust Adversarial Concept Erasure in Diffusion Models
- Languages are Modalities: Cross-Lingual Alignment via Encoder Injection
- GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation
- Cognitive Alignment in Personality Reasoning: Leveraging Prototype Theory for MBTI Inference
- ParaScopes: What do Language Models Activations Encode About Future Text?
- SIGMA: Search-Augmented On-Demand Knowledge Integration for Agentic Mathematical Reasoning
- DocPrism: Multi-lingual Detection of Incorrectness Inconsistencies between Code and Documentation
- MolChord: Structure-Sequence Alignment for Protein-Guided Drug Design
- Diffusion LLMs are Natural Adversaries for any LLM
- H-FA: A Hybrid Floating-Point and Logarithmic Approach to Hardware Accelerated FlashAttention
- Scalable Processing-Near-Memory for 1M-Token LLM Inference: CXL-Enabled KV-Cache Management Beyond GPU Limits
- Fints: Efficient Inference-Time Personalization for LLMs with Fine-Grained Instance-Tailored Steering
- FlowMesh: A Service Fabric for Composable LLM Workflows
- Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
- Defeating the Training-Inference Mismatch via FP16
- STaMP: Sequence Transformation and Mixed Precision for Low-Precision Activation Quantization
- Evontree: Ontology Rule-Guided Self-Evolution of Large Language Models
- SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
- Normative Reasoning in Large Language Models: A Comparative Benchmark from Logical and Modal Perspectives
- Agentic AI Home Energy Management System: A Large Language Model Framework for Residential Load Scheduling
- Think Outside the Policy: In-Context Steered Policy Optimization
- Automated Extract Method Refactoring with Open-Source LLMs: A Comparative Study
- Chain-of-Thought Hijacking
- MisSynth: Improving MISSCI Logical Fallacies Classification with Synthetic Data
- GraphCompliance: Aligning Policy and Context Graphs for LLM-Based Regulatory Compliance
- CAS-Spec: Cascade Adaptive Self-Speculative Decoding for On-the-Fly Lossless Inference Acceleration of LLMs
- Pragmatic Theories Enhance Understanding of Implied Meanings in LLMs
- RCScore: Quantifying Response Consistency in Large Language Models
- CRAG-MM: Multi-modal Multi-turn Comprehensive RAG Benchmark
- Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking
- EgoExo-Con: Exploring View-Invariant Video Temporal Understanding
- QuantumBench: A Benchmark for Quantum Problem Solving
- Loquetier: A Virtualized Multi-LoRA Framework for Unified LLM Fine-tuning and Serving
- Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph
- Adaptively Robust LLM Monitoring via Activation Watermarking
- Retrieval-Augmented Search for Large-Scale Map Collections with ColPali
- Interpreting LLMs as Credit Risk Classifiers: Do Their Feature Explanations Align with Classical ML?
- EHR-R1: A Reasoning-Enhanced Foundational Language Model for Electronic Health Record Analysis
- Are Language Models Efficient Reasoners? A Perspective from Logic Programming
- FARSIQA: Faithful and Advanced RAG System for Islamic Question Answering
- INT v.s. FP: A Comprehensive Study of Fine-Grained Low-bit Quantization Formats
- Standardization of Psychiatric Diagnoses -- Role of Fine-tuned LLM Consortium and OpenAI-gpt-oss Reasoning LLM Enabled Decision Support System
- AGMark: Attention-Guided Dynamic Watermarking for Large Vision-Language Models
- Generalized Pseudo-Relevance Feedback
- More than a Moment: Towards Coherent Sequences of Audio Descriptions
- Serve Programs, Not Prompts
- CRMWeaver: Building Powerful Business Agent via Agentic RL and Shared Memories
- IRIS: Reusable Identity Representations from Frozen LLMs for Entity Alignment
- LLM-as-a-Judge for Evaluating System Responses in Conversational Music Recommendation
- RDQ: Residual Distribution Quantization for Large Language Models
- Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models
- Penelope: Localized Latent Recurrence for Efficient Structured Reasoning
- LLMET: Enabling Cross-Layer Evaluation of Emerging M3D Memories for Energy-Efficient LLM Serving
- Misalignment Has a Personality: A Big Five Account of Emergent Misalignment
- Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives
- PowerAtlas: Towards Electricity-Computing Co-Scheduling for Power Systems
- Steering Instruction Hierarchies at Inference Time
- Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback
- RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention
- Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI
- Semantic Similarity in Radiology Reports via LLMs and NER
- TS-Reasoner: Aligning Time Series Foundation Models with LLM Reasoning
- Supporting Workflow Reproducibility by Linking Bioinformatics Tools across Papers and Executable Code
- ReCo: Reweighting GRPO Against Distributional Concentration
- ToxScreen: Detecting Whether an LLM Has Been Poisoned
- Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
- Beyond the Final Layer: Intermediate Representations for Better Multilingual Calibration in Large Language Models
- DIRECT: Direct Decoding for Efficient and Aligned Sequence Labeling with Large Language Models
- IMFuse: Instance-Aware Multi-Layer Fusion for LLM-Enhanced Sequential Recommendation
- Linear-LLM-SCM: Benchmarking LLMs for Coefficient Elicitation in Linear-Gaussian Causal Models
- The Scaling Properties of Implicit Deductive Reasoning in Transformers
- Enhancing Multi-Agent Communication through Attention Steering with Context Relevance
- ThriftAttention: Selective Mixed Precision for Long-Context FP4 Attention
- HRM-Text: Efficient Pretraining Beyond Scaling
- SSV: Sparse Speculative Verification for Efficient LLM Inference
- Customizing an LLM for Enterprise Software Engineering
- Quantifying Concentration Phenomena of Mean-Field Transformers in the Low-Temperature Regime
- Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale
- Evaluation of Agents under Simulated AI Marketplace Dynamics
- CresOWLve: Benchmarking Creative Problem-Solving Over Real-World Knowledge
- BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence
- GroupRAG: Cognitively Inspired Group-Aware Retrieval and Reasoning via Knowledge-Driven Problem Structuring
- Understanding LoRA as Knowledge Memory: An Empirical Analysis
- State-Dependent Safety Failures in Multi-Turn Language Model Interaction
- Multilingual Large Language Models do not comprehend all natural languages to equal degrees
- Thought Virus: Viral Misalignment via Subliminal Prompting in Multi-Agent Systems
- Can Knowledge-Graph-based Retrieval Augmented Generation Really Retrieve What You Need?
- NeurIPT: Foundation Model for Neural Interfaces
- Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models
- RL makes MLLMs see better than SFT
- The Stretto Execution Engine for LLM-Augmented Data Systems
- On the Use of Large Language Models for Qualitative Synthesis
- CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding
- ReviewSense: Transforming Customer Review Dynamics into Actionable Business Insights
- Agents at Risk: How Users Unwittingly Undermine LLM Safety
- Ministral 3
- Concept Tokens: Learning Behavioral Embeddings Through Concept Definitions
- Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
- Teaching Sarcasm: Few-Shot Multimodal Sarcasm Detection via Distillation to a Parameter-Efficient Student
- PRESTO: Preimage-Informed Instruction Optimization for Prompting Black-Box LLMs
- Adapting Small Language Models to Low-Resource Domains: A Case Study in Hindi Tourism QA
- IBNorm: Information-Bottleneck Inspired Normalization for Representation Learning
- Hallucination Localization in Video Captioning
- GReF: A Unified Generative Framework for Efficient Reranking via Ordered Multi-token Prediction
- Beyond Length: Quantifying Long-Range Information for Long-Context LLM Pretraining Data
- Large Language Model for Verilog Code Generation: Literature Review and the Road Ahead
- LISTEN to Your Preferences: An LLM Framework for Multi-Objective Selection
- Continual Low-Rank Adapters for LLM-based Generative Recommender Systems
- H3M-SSMoEs: Hypergraph-based Multimodal Learning with LLM Reasoning and Style-Structured Mixture of Experts
- Opt4GPTQ: Co-Optimizing Memory and Computation for 4-bit GPTQ Quantized LLM Inference on Heterogeneous Platforms
- Emergence of Minimal Circuits for Indirect Object Identification in Attention-Only Transformers
- Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
- ComboBench: Can LLMs Manipulate Physical Devices to Play Virtual Reality Games?
- SPICE: Self-Play In Corpus Environments Improves Reasoning
- Optimizing Retrieval for RAG via Reinforced Contrastive Learning
- MISA: Memory-Efficient LLMs Optimization with Module-wise Importance Sampling
- Improving LLM Reasoning via Dependency-Aware Query Decomposition and Logic-Parallel Content Expansion
- Zero-Shot Cross-Lingual Transfer using Prefix-Based Adaptation
- Long-Context Modeling with Dynamic Hierarchical Sparse Attention for On-Device LLMs
- Quantum Combinatorial Reasoning for Large Language Models
- QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models
- Count Counts: Motivating Exploration in LLM Reasoning with Count-based Intrinsic Rewards
- LuxIT: A Luxembourgish Instruction Tuning Dataset from Monolingual Seed Data
- Calibrating and Rotating: A Unified Framework for Weight Conditioning in PEFT
- LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability
- Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
- Retrieval and Argumentation Enhanced Multi-Agent LLMs for Judgmental Forecasting
- MERGE: Minimal Expression-Replacement GEneralization Test for Natural Language Inference
- HACK: Hallucinations Along Certainty and Knowledge Axes
- Information-Theoretic Discrete Diffusion
- Pie: A Programmable Serving System for Emerging LLM Applications
- MeCeFO: Enhancing LLM Training Robustness via Fault-Tolerant Optimization
- Utilising Large Language Models for Generating Effective Counter Arguments to Anti-Vaccine Tweets
- PICOs-RAG: PICO-supported Query Rewriting for Retrieval-Augmented Generation in Evidence-Based Medicine
- Semi-Supervised Preference Optimization with Limited Feedback
- Uncovering the Potential Risks in Unlearning: Danger of English-only Unlearning in Multilingual LLMs
- ChessQA: Evaluating Large Language Models for Chess Understanding
- FLoRA: Fused forward-backward adapters for parameter efficient fine-tuning and reducing inference-time latencies of LLMs
- DynaStride: Dynamic Stride Windowing with MMCoT for Instructional Multi-Scene Captioning
- Assessing the Relational Abilities of Large Language Models and Large Reasoning Models
- ReviewGuard: Enhancing Deficient Peer Review Detection via LLM-Driven Data Augmentation
- On the Impossibility of Retrain Equivalence in Machine Unlearning
- Beyond Understanding: Evaluating the Pragmatic Gap in LLMs' Cultural Processing of Figurative Language
- ScaLoRA: Optimally Scaled Low-Rank Adaptation for Efficient High-Rank Fine-Tuning
- BitSkip: An Empirical Analysis of Quantization and Early Exit Composition
- ATA: A Neuro-Symbolic Approach to Implement Autonomous and Trustworthy Agents
- MUStReason: A Benchmark for Diagnosing Pragmatic Reasoning in Video-LMs for Multimodal Sarcasm Detection
- FARMER: Flow AutoRegressive Transformer over Pixels
- POPI: Personalizing LLMs via Optimized Natural Language Preference Inference
- JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence
- IPQA: A Benchmark for Core Intent Identification in Personalized Question Answering
- M4FC: a Multimodal, Multilingual, Multicultural, Multitask Real-World Fact-Checking Dataset
- VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
- COOPERA: Continual Open-Ended Human-Robot Assistance
- Learning to Reason Efficiently with Discounted Reinforcement Learning
- EMTSF:Extraordinary Mixture of SOTA Models for Time Series Forecasting
- The Best of N Worlds: Aligning Reinforcement Learning with Best-of-N Sampling via max@k Optimisation
- Large language model-based task planning for service robots: A review
- DCMM-SQL: Automated Data-Centric Pipeline and Multi-Model Collaboration Training for Text-to-SQL Model
- Increasing LLM Coding Capabilities through Diverse Synthetic Coding Tasks
- Beyond Higher Rank: Token-wise Input-Output Projections for Efficient Low-Rank Adaptation
- Quality-Aware Translation Tagging in Multilingual RAG system
- Simple Denoising Diffusion Language Models
- Can Language Models Compose Skills In-Context?
- Encoder-Decoder Diffusion Language Models for Efficient Training and Inference
- Agentic Meta-Orchestrator for Multi-task Copilots
- RaCoT: Plug-and-Play Contrastive Example Generation Mechanism for Enhanced LLM Reasoning Reliability
- Windsock is Dancing: Adaptive Multimodal Retrieval-Augmented Generation
- Agentsway -- Software Development Methodology for AI Agents-based Teams
- Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs
- STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
- LooGLE v2: Are LLMs Ready for Real World Long Dependency Challenges?
- FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning
- The Structural Scalpel: Automated Contiguous Layer Pruning for Large Language Models
- FAIR-RAG: Faithful Adaptive Iterative Refinement for Retrieval-Augmented Generation
- Beyond Hidden-Layer Manipulation: Semantically-Aware Logit Interventions for Debiasing LLMs
- From Slides to Chatbots: Enhancing Large Language Models with University Course Materials
- Efficient Low Rank Attention for Long-Context Inference in Large Language Models
- Edit Less, Achieve More: Dynamic Sparse Neuron Masking for Lifelong Knowledge Editing in LLMs
- Streaming Generation for Music Accompaniment
- Generalization or Memorization: Dynamic Decoding for Mode Steering
- Compositional Bias Control in Large Language Models: Preference Learning Fails, Supervision Succeeds
- ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality
- LightAgent: Mobile Agentic Foundation Models
- Distribution Shift Alignment Helps LLMs Simulate Survey Response Distributions
- Performance Trade-offs of Optimizing Small Language Models for E-Commerce
- Parallel Sampling from Masked Diffusion Models via Conditional Independence Testing
- Model-Aware Tokenizer Transfer
- Adversarial Déjà Vu: Jailbreak Dictionary Learning for Stronger Generalization to Unseen Attacks
- LLM-Generated Negative News Headlines Dataset: Creation and Benchmarking Against Real Journalism
- REVE: A Foundation Model for EEG -- Adapting to Any Setup with Large-Scale Pretraining on 25,000 Subjects
- Interpretable Multimodal Zero-Shot ECG Diagnosis via Structured Clinical Knowledge Alignment
- A Unified Model for Multi-Task Drone Routing in Post-Disaster Road Assessment
- Head Pursuit: Probing Attention Specialization in Multimodal Transformers
- Large Language Models as Model Organisms for Human Associative Learning
- REvolution: An Evolutionary Framework for RTL Generation driven by Large Language Models
- Flight Delay Prediction via Cross-Modality Adaptation of Large Language Models and Aircraft Trajectory Representation
- α-LoRA: Effective Fine-Tuning via Base Model Rescaling
- Weak-to-Strong Generalization under Distribution Shifts
- VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set
- Towards Reliable Code-as-Policies: A Neuro-Symbolic Framework for Embodied Task Planning
- Correlation Dimension of Auto-Regressive Large Language Models
- Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study
- How to Auto-optimize Prompts for Domain Tasks? Adaptive Prompting and Reasoning through Evolutionary Domain Knowledge Adaptation
- PanicToCalm: A Proactive Counseling Agent for Panic Attacks
- Large Language Models Meet Text-Attributed Graphs: A Survey of Integration Frameworks and Applications
- Beyond Pairwise: Empowering LLM Alignment With Ranked Choice Modeling
- R2ComSync: Improving Code-Comment Synchronization with In-Context Learning and Reranking
- Chain of Execution Supervision Promotes General Reasoning in Large Language Models
- Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
- Designing and Evaluating Hint Generation Systems for Science Education
- Chinese Discharge Drug Recommendation in Metabolic Diseases with Large Language Models
- Dynamic Retriever for In-Context Knowledge Editing via Policy Optimization
- Neural Mutual Information Estimation with Vector Copulas
- LLM-Integrated Bayesian State Space Models for Multimodal Time-Series Forecasting
- Shoot First, Ask Questions Later? Building Rational Agents that Explore and Act Like People
- Language Ranker: A Lightweight Ranking framework for LLM Decoding
- Topic-aware Large Language Models for Summarizing the Lived Healthcare Experiences Described in Health Stories
- Thought Communication in Multiagent Collaboration
- C-NAV: Towards Self-Evolving Continual Object Navigation in Open World
- Assessing the Political Fairness of Multilingual LLMs: A Case Study based on a 21-way Multiparallel EuroParl Dataset
- Ask a Strong LLM Judge when Your Reward Model is Uncertain
- ComProScanner: A multi-agent based framework for composition-property structured data extraction from scientific literature
- Citation Failure: Definition, Analysis and Efficient Mitigation
- HypoSpace: A Diagnostic Benchmark for Set-Valued Hypothesis Generation under Underdetermination and Sublinear Coverage Bounds
- Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding
- Falcon: A Comprehensive Chinese Text-to-SQL Benchmark for Enterprise-Grade Evaluation
- TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
- AsyncHZP: Hierarchical ZeRO Parallelism with Asynchronous Scheduling for Scalable LLM Training
- AI PB: A Grounded Generative Agent for Personalized Investment Insights
- Learning to Triage Taint Flows Reported by Dynamic Program Analysis in Node.js Packages
- Empathic Prompting: Non-Verbal Context Integration for Multimodal LLM Conversations
- LM-mixup: Text Data Augmentation via Language Model based Mixup
- Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models
- Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging
- Temporal Referential Consistency: Do LLMs Favor Sequences Over Absolute Time References?
- Not-a-Bandit: Provably No-Regret Drafter Selection in Speculative Decoding for LLMs
- Enhancing Reasoning Skills in Small Persian Medical Language Models Can Outperform Large-Scale Data Training
- Data-Centric Lessons To Improve Speech-Language Pretraining
- Latent Space Factorization in LoRA
- Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation
- Machine Text Detectors are Membership Inference Attacks
- ELUTQ: Efficient LUT-Aware Quantization for Deploying Large Language Models on Edge Devices
- LLM Unlearning with LLM Beliefs
- AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
- DaMo: Data Mixing Optimizer in Fine-tuning Multimodal LLMs for Mobile Phone Agents
- Slot Filling as a Reasoning Task for SpeechLLMs
- Unified Reinforcement and Imitation Learning for Vision-Language Models
- Difficulty-Controllable Multiple-Choice Question Generation Using Large Language Models and Direct Preference Optimization
- From Newborn to Impact: Bias-Aware Citation Prediction
- Imbalanced Gradients in RL Post-Training of Multi-Task LLMs
- Think Straight, Stop Smart: Structured Reasoning for Efficient Multi-Hop RAG
- Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
- LLM-Augmented Symbolic NLU System for More Reliable Continuous Causal Statement Interpretation
- C2T-ID: Converting Semantic Codebooks to Textual Document Identifiers for Generative Search
- Are they lovers or friends? Evaluating LLMs' Social Reasoning in English and Korean Dialogues
- Search Self-play: Pushing the Frontier of Agent Capability without Supervision
- A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning
- CAGE: Curvature-Aware Gradient Estimation For Accurate Quantization-Aware Training
- HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models
- Investigating LLM Capabilities on Long Context Comprehension for Medical Question Answering
- CORE: Reducing UI Exposure in Mobile Agents via Collaboration Between Cloud and Local LLMs
- Beyond the Explicit: A Bilingual Dataset for Dehumanization Detection in Social Media
- Pay Attention to the Triggers: Constructing Backdoors That Survive Distillation
- Alibaba International E-commerce Product Search Competition DILAB Team Technical Report
- Simple and Efficient Heterogeneous Temporal Graph Neural Network
- Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption
- From Retrieval to Generation: Unifying External and Parametric Knowledge for Medical Question Answering
- EdgeReasoning: Characterizing Reasoning LLM Deployment on Edge GPUs
- StreamingTOM: Streaming Token Compression for Efficient Video Understanding
- ssToken: Self-modulated and Semantic-aware Token Selection for LLM Fine-tuning
- Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs
- RESCUE: Retrieval Augmented Secure Code Generation
- Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
- MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training
- Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
- JAUNT: Joint Alignment of User Intent and Network State for QoE-centric LLM Tool Routing
- How Efficient Are Diffusion Language Models? A Critical Examination of Efficiency Evaluation Practices
- ScaleNet: Scaling up Pretrained Neural Networks with Incremental Parameters
- Engagement Undermines Safety: How Stereotypes and Toxicity Shape Humor in Language Models
- Hearing Health in Home Healthcare: Leveraging LLMs for Illness Scoring and ALMs for Vocal Biomarker Extraction
- Learning from Generalization Patterns: An Evaluation-Driven Approach to Enhanced Data Augmentation for Fine-Tuning Small Language Models
- Mapping Post-Training Forgetting in Language Models at Scale
- SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference
- Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth
- From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
- Unbiased Gradient Low-Rank Projection
- Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
- Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs
- This is Going to Sound Crazy, But What If We Used Large Language Models to Boost Automatic Database Tuning Algorithms By Leveraging Prior History? We Will Find Better Configurations More Quickly Than Retraining From Scratch!
- MARS-M: When Variance Reduction Meets Matrices
- MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
- PANER: A Paraphrase-Augmented Framework for Low-Resource Named Entity Recognition
- Multilingual Text-to-Image Person Retrieval via Bidirectional Relation Reasoning and Aligning
- AtlasKV: Augmenting LLMs with Billion-Scale Knowledge Graphs in 20GB VRAM
- DETree: DEtecting Human-AI Collaborative Texts via Tree-Structured Hierarchical Representation Learning
- Disparities in Multilingual LLM-Based Healthcare Q&A
- Certified Self-Consistency: Statistical Guarantees and Test-Time Training for Reliable Reasoning in LLMs
- EvoSyn: Generalizable Evolutionary Data Synthesis for Verifiable Learning
- Agentic Reinforcement Learning for Search Misaligns Instruction-Tuning
- Xihe: Scalable Zero-Shot Time Series Learner Via Hierarchical Interleaved Block Attention
- Multimodal Safety Is Asymmetric: Cross-Modal Exploits Unlock Black-Box MLLMs Jailbreaks
- Robustness in Text-Attributed Graph Learning: Insights, Trade-offs, and New Defenses
- CLAWS:Creativity detection for LLM-generated solutions using Attention Window of Sections
- The Ends Justify the Thoughts: RL-Induced Motivated Reasoning in LLM CoTs
- Forget to Know, Remember to Use: Context-Aware Unlearning for Large Language Models
- AION-1: Omnimodal Foundation Model for Astronomical Sciences
- ImaGGen: Zero-Shot Generation of Co-Speech Semantic Gestures Grounded in Language and Image Input
- OncoReason: Structuring Clinical Reasoning in LLMs for Robust and Interpretable Survival Prediction
- Language Confusion Gate: Language-Aware Decoding Through Model Self-Distillation
- PEACE: Towards Efficient Project-Level Efficiency Optimization via Hybrid Code Editing
- TREAT: A Code LLMs Trustworthiness / Reliability Evaluation and Testing Framework
- Saber: An Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model
- I-RAVEN-X: Benchmarking Generalization and Robustness of Analogical and Mathematical Reasoning in Large Language and Reasoning Models
- Reasoning Distillation and Structural Alignment for Improved Code Generation
- Annotation-Efficient Universal Honesty Alignment
- LexChain: Modeling Legal Reasoning Chains for Chinese Tort Case Analysis
- ToolCritic: Detecting and Correcting Tool-Use Errors in Dialogue Systems
- Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
- Online Learning Defense against Iterative Jailbreak Attacks via Prompt Optimization
- Training-free Online Video Step Grounding
- ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models
- SAKE: Towards Editing Auditory Attribute Knowledge of Large Audio-Language Models
- Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
- Who's Asking? Simulating Role-Based Questions for Conversational AI Evaluation
- Utility-Diversity Aware Online Batch Selection for LLM Supervised Fine-tuning
- When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling
- End-to-end Listen, Look, Speak and Act
- MuonBP: Faster Muon via Block-Periodic Orthogonalization
- DAG-Math: Graph-of-Thought Guided Mathematical Reasoning in LLMs
- ProtoMol: Enhancing Molecular Property Prediction via Prototype-Guided Multimodal Learning
- EMRRG: Efficient Fine-Tuning Pre-trained X-ray Mamba Networks for Radiology Report Generation
- LC-Eval: A Bilingual Multi-Task Evaluation Benchmark for Long-Context Understanding
- All You Need is One: Capsule Prompt Tuning with a Single Vector
- Prompt Optimization via Retrieved Reasoning Assets and Multi-Agent Analysis
- Accelerating Mobile Language Model via Speculative Decoding and NPU-Coordinated Execution
- Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
- Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
- Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
- Planner and Executor: Collaboration between Discrete Diffusion And Autoregressive Models in Reasoning
- Soundness-Aware Level: A Microscopic Signature that Predicts LLM Reasoning Potential
- Emergence of Linear Truth Encodings in Language Models
- LLM Latent Reasoning as Chain of Superposition
- DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios
- Distractor Injection Attacks on Large Reasoning Models: Characterization and Defense
- ScholarEval: Research Idea Evaluation Grounded in Literature
- SpeechLLMs for Large-scale Contextualized Zero-shot Slot Filling
- JudgeSQL: Reasoning over SQL Candidates with Weighted Consensus Tournament
- SNOO: Step-K Nesterov Outer Optimizer - The Surprising Effectiveness of Nesterov Momentum Applied to Pseudo-Gradients
- How Well Can Preference Optimization Generalize Under Noisy Feedback?
- Train a Unified Multimodal Data Quality Classifier with Synthetic Data
- PoTS: Proof-of-Training-Steps for Backdoor Detection in Large Language Models
- Internalizing World Models via Self-Play Finetuning for Agentic RL
- Attention Is All You Need for KV Cache in Diffusion LLMs
- DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation
- CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects
- You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction
- Benchmarking Multimodal Large Language Models for Face Recognition
- FraQAT: Quantization Aware Training with Fractional bits
- Beyond Multi-Token Prediction: Pretraining LLMs with Future Summaries
- Free-Grained Hierarchical Recognition
- Tawa: Automatic Warp Specialization for Modern GPUs with Asynchronous References
- Speculative Model Risk in Healthcare AI: Using Storytelling to Surface Unintended Harms
- Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling
- xLLM Technical Report
- Talking Points: Describing and Localizing Pixels
- Selective Labeling with False Discovery Rate Control
- ScalePool: Hybrid XLink-CXL Fabric for Composable Resource Disaggregation in Unified Scale-up Domains
- Assessing Socio-Cultural Alignment and Technical Safety of Sovereign LLMs
- MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving
- Stealthy Dual-Trigger Backdoors: Attacking Prompt Tuning in LM-Empowered Graph Foundation Models
- ToolTweak: An Attack on Tool Selection in LLM-based Agents
- Your Next Token Prediction: A Multilingual Benchmark for Personalized Response Generation
- AI for Service: Proactive Assistance with AI Glasses
- Rewriting History: A Recipe for Interventional Analyses to Study Data Effects on Model Behavior
- MatchAttention: Matching the Relative Positions for High-Resolution Cross-View Matching
- Large Scale Retrieval for the LinkedIn Feed using Causal Language Models
- ARM-FM: Automated Reward Machines via Foundation Models for Compositional Reinforcement Learning
- OpenEstimate: Evaluating LLMs on Reasoning Under Uncertainty with Real-World Data
- Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
- Generating Fair Consensus Statements with Social Choice on Token-Level MDPs
- Adaptive Obstacle-Aware Task Assignment and Planning for Heterogeneous Robot Teaming
- Think Globally, Group Locally: Evaluating LLMs Using Multi-Lingual Word Grouping Games
- Do Slides Help? Multi-modal Context for Automatic Transcription of Conference Talks
- BRIEF-Pro: Universal Context Compression with Short-to-Long Synthesis for Fast and Accurate Multi-Hop Reasoning
- Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
- Breaking Memorization Barriers in LLM Code Fine-Tuning via Information Bottleneck for Improved Generalization
- Training LLM Agents to Empower Humans
- NOSA: Native and Offloadable Sparse Attention
- To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language Models
- LiteraryQA: Towards Effective Evaluation of Long-document Narrative QA
- NetMCP: Network-Aware Model Context Protocol Platform for LLM Capability Extension
- Assessing LLM Reasoning Through Implicit Causal Chain Discovery in Climate Discourse
- Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
- Putting on the Thinking Hats: A Survey on Chain of Thought Fine-tuning from the Perspective of Human Reasoning Mechanism
- Stable LLM Ensemble: Interaction between Example Representativeness and Diversity
- Retrieval-in-the-Chain: Bootstrapping Large Language Models for Generative Retrieval
- Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking
- Tahakom LLM Guidelines and Recipes: From Pre-training Data to an Arabic LLM
- From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails
- Beyond Imitation: Recovering Dense Rewards from Demonstrations
- CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
- Adaptive Reasoning Executor: A Collaborative Agent System for Efficient Reasoning
- ConsintBench: Evaluating Language Models on Real-World Consumer Intent Understanding
- Hierarchical Frequency Tagging Probe (HFTP): A Unified Approach to Investigate Syntactic Structure Representations in Large Language Models and the Human Brain
- Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language Models
- FreshTab: Sourcing Fresh Data for Table-to-Text Generation Evaluation
- On the Role of Preference Variance in Preference Optimization
- Reference-Specific Unlearning Metrics Can Hide the Truth: A Reality Check
- Generation Space Size: Understanding and Calibrating Open-Endedness of LLM Generations
- KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems
- What If : Understanding Motion Through Sparse Interactions
- Dr.LLM: Dynamic Layer Routing in LLMs
- CARVQ: Corrective Adaptor with Group Residual Vector Quantization for LLM Embedding Compression
- Keep Calm and Avoid Harmful Content: Concept Alignment and Latent Manipulation Towards Safer Answers
- ACADATA: Parallel Dataset of Academic Data for Machine Translation
- ProtoSiTex: Learning Semi-Interpretable Prototypes for Multi-label Text Classification
- When Personalization Tricks Detectors: The Feature-Inversion Trap in Machine-Generated Text Detection
- Traveling Salesman-Based Token Ordering Improves Stability in Homomorphically Encrypted Language Models
- The Harder The Better: Maintaining Supervised Fine-tuning Generalization with Less but Harder Data
- Evolution of meta's llama models and parameter-efficient fine-tuning of large language models: a survey
- Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing
- Tracing Multilingual Knowledge Acquisition Dynamics in Domain Adaptation: A Case Study of English-Japanese Biomedical Adaptation
- MedKGEval: A Knowledge Graph-Based Multi-Turn Evaluation Framework for Open-Ended Patient Interactions with Clinical LLMs
- ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution
- DSAS: A Universal Plug-and-Play Framework for Attention Optimization in Multi-Document Question Answering
- 3-Model Speculative Decoding
- Toward LLM-Supported Automated Assessment of Critical Thinking Subskills
- Improving Text-to-Image Generation with Input-Side Inference-Time Scaling
- MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents
- Multi-stage Prompt Refinement for Mitigating Hallucinations in Large Language Models
- Evaluating Retrieval-Augmented Generation Systems on Unanswerable, Uncheatable, Realistic, Multi-hop Queries
- QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
- Survey Response Generation: Generating Closed-Ended Survey Responses In-Silico with Large Language Models
- Representation-Based Exploration for Language Models: From Test-Time to Post-Training
- FinVet: A Collaborative Framework of RAG and External Fact-Checking Agents for Financial Misinformation Detection
- Enhancing Long Chain-of-Thought Reasoning through Multi-Path Plan Aggregation
- Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks
- Investigating Large Language Models' Linguistic Abilities for Text Preprocessing
- From to : Multidimensional Supervision of Reasoning Process for LLM Optimization
- Beyond the Crowd: LLM-Augmented Community Notes for Governing Health Misinformation
- VeriCite: Towards Reliable Citations in Retrieval-Augmented Generation via Rigorous Verification
- Medical Interpretability and Knowledge Maps of Large Language Models
- LLM-Specific Utility: A New Perspective for Retrieval-Augmented Generation
- InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models
- Unlocking the Potential of Diffusion Language Models through Template Infilling
- LouisKV: Efficient KV Cache Retrieval for Long Input-Output Sequences
- Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality
- Neural Weight Compression for Language Models
- Fairness Metric Design Exploration in Multi-Domain Moral Sentiment Classification using Transformer-Based Models
- The Curious Case of Factual (Mis)Alignment between LLMs' Short- and Long-Form Answers
- Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations
- Addressing Pitfalls in the Evaluation of Uncertainty Estimation Methods for Natural Language Generation
- LogiNumSynth: Synthesizing Joint Logical-Numerical Reasoning Problems for Language Models
- COCO-Tree: Compositional Hierarchical Concept Trees for Enhanced Reasoning in Vision Language Models
- A Survey on Agentic Multimodal Large Language Models
- Secret-Protected Evolution for Differentially Private Synthetic Text Generation
- The Social Cost of Intelligence: Emergence, Propagation, and Amplification of Stereotypical Bias in Multi-Agent Systems
- LLM-Empowered Agentic MAC Protocols: A Dynamic Stackelberg Game Approach
- ExGRPO: Learning to Reason from Experience
- AccurateRAG: A Framework for Building Accurate Retrieval-Augmented Question-Answering Applications
- xLSTM Scaling Laws: Competitive Performance with Linear Time-Complexity
- More Than One Teacher: Adaptive Multi-Guidance Policy Optimization for Diverse Exploration
- HatLLM: Hierarchical Attention Masking for Enhanced Collaborative Modeling in LLM-based Recommendation
- QLENS: Towards A Quantum Perspective of Language Transformers
- Prompt-Guided Spatial Understanding with RGB-D Transformers for Fine-Grained Object Relation Reasoning
- Does LLM Focus on the Right Words? Mitigating Context Bias in LLM-based Recommenders
- LLM Knowledge is Brittle: Truthfulness Representations Rely on Superficial Resemblance
- UpSafe^∘C: Upcycling for Controllable Safety in Large Language Models
- Dynamic Target Attack
- KVComm: Enabling Efficient LLM Communication through Selective KV Sharing
- RePro: Training Language Models to Faithfully Recycle the Web for Pretraining
- FactAppeal: Identifying Epistemic Factual Appeals in News Media
- DCP: Addressing Input Dynamism In Long-Context Training via Dynamic Context Parallelism
- Preserving LLM Capabilities through Calibration Data Curation: From Analysis to Optimization
- GraphTracer: Graph-Guided Failure Tracing in LLM Agents for Robust Multi-Turn Deep Search
- Detecting Hallucinations in Authentic LLM-Human Interactions
- AnyBCQ: Hardware Efficient Flexible Binary-Coded Quantization for Multi-Precision LLMs
- f-INE: A Hypothesis Testing Framework for Estimating Influence under Training Randomness
- Align2Act: Instruction-Tuned Models for Human-Aligned Autonomous Driving
- AssoMem: Scalable Memory QA with Multi-Signal Associative Retrieval
- High-Dimensional Learning Dynamics of Quantized Models with Straight-Through Estimator
- LLM-Based Multi-Task Bangla Hate Speech Detection: Type, Severity, and Target
- STEAM: A Semantic-Level Knowledge Editing Framework for Large Language Models
- UltraLLaDA: Scaling the Context Length to 128K for Diffusion Large Language Models
- On-device System of Compositional Multi-tasking in Large Language Models
- DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
- ArtPerception: ASCII Art-based Jailbreak on LLMs with Recognition Pre-test
- PIXEL: Adaptive Steering Via Position-wise Injection with eXact Estimated Levels under Subspace Calibration
- Don't Just Fine-tune the Agent, Tune the Environment
- CompassNav: Steering From Path Imitation To Decision Understanding In Navigation
- PermLLM: Learnable Channel Permutation for N:M Sparse Large Language Models
- Preference-driven Knowledge Distillation for Few-shot Node Classification
- Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
- ADEPT: Continual Pretraining via Adaptive Expansion and Dynamic Decoupled Tuning
- Skill-Targeted Adaptive Training
- Beyond the limitation of a single query: Train your LLM for query expansion with Reinforcement Learning
- StelLA: Subspace Learning in Low-rank Adaptation using Stiefel Manifold
- Veri-R1: Toward Precise and Faithful Claim Verification via Online Reinforcement Learning
- Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
- Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers
- Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning
- Decoupled DiLoCo for Resilient Distributed Pre-training
- Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL
- The Geometry of Reasoning: Flowing Logics in Representation Space
- An Efficient Heterogeneous Co-Design for Fine-Tuning on a Single GPU
- Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search
- A Systematic Study on Generating Web Vulnerability Proof-of-Concepts Using Large Language Models
- LinearRAG: Linear Graph Retrieval Augmented Generation on Large-scale Corpora
- PatentVision: A multimodal method for drafting patent applications
- Doc2Query++: Topic-Coverage based Document Expansion and its Application to Dense Retrieval via Dual-Index Fusion
- Cross-Platform Narrative Prediction: Leveraging Platform-Invariant Discourse Networks
- Evaluating LLM-Based Process Explanations under Progressive Behavioral-Input Reduction
- ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering
- FLRC: Fine-grained Low-Rank Compressor for Efficient LLM Inference
- Diagnosing Shoulder Disorders Using Multimodal Large Language Models and Consumer-Grade Cameras
- Cross-Representation Benchmarking in Time-Series Electronic Health Records for Clinical Outcome Prediction
- Users as Annotators: LLM Preference Learning from Comparison Mode
- FrameEOL: Semantic Frame Induction using Causal Language Models
- Alif: Advancing Urdu Large Language Models via Multilingual Synthetic Data Distillation
- MEC3O: Multi-Expert Consensus for Code Time Complexity Prediction
- Value-State Gated Attention for Mitigating Extreme-Token Phenomena in Transformers
- Group-Adaptive Adversarial Learning for Robust Fake News Detection Against Malicious Comments
- MIRAGE: Runtime Scheduling for Multi-Vector Image Retrieval with Hierarchical Decomposition
- SHERLOCK: Towards Dynamic Knowledge Adaptation in LLM-enhanced E-commerce Risk Management
- Artificial Impressions: Evaluating Large Language Model Behavior Through the Lens of Trait Impressions
- WUGNECTIVES: Novel Entity Inferences of Language Models from Discourse Connectives
- A Unified Biomedical Named Entity Recognition Framework with Large Language Models
- Getting Your Indices in a Row: Full-Text Search for LLM Training Data for Real World
- Decoupling Safety into Orthogonal Subspace: Cost-Efficient and Performance-Preserving Alignment for Large Language Models
- Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness
- Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL
- SeCon-RAG: A Two-Stage Semantic Filtering and Conflict-Free Framework for Trustworthy RAG
- Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
- PairSem: LLM-Guided Pairwise Semantic Matching for Scientific Document Retrieval
- Diffusion-Inspired Masked Fine-Tuning for Knowledge Injection in Autoregressive LLMs
- PyMigTool: a tool for end-to-end Python library migration
- TinyGraphEstimator: Adapting Lightweight Language Models for Graph Structure Inference
- Exploring Cross-Client Memorization of Training Data in Large Language Models for Federated Learning
- Coordinates from Context: Using LLMs to Ground Complex Location References
- MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
- Which Heads Matter for Reasoning? RL-Guided KV Cache Compression
- dInfer: An Efficient Inference Framework for Diffusion Language Models
- Emotionally Charged, Logically Blurred: AI-driven Emotional Framing Impairs Human Fallacy Detection
- First Try Matters: Revisiting the Role of Reflection in Reasoning Models
- Kelp: A Streaming Safeguard for Large Models via Latent Dynamics-Guided Risk Detection
- Opponent Shaping in LLM Agents
- AI Knowledge Assist: An Automated Approach for the Creation of Knowledge Bases for Conversational AI Agents
- Everything is Plausible: Investigating the Impact of LLM Rationales on Human Notions of Plausibility
- TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance
- CREST-Search: Comprehensive Red-teaming for Evaluating Safety Threats in Large Language Models Powered by Web Search
- Fewer Weights, More Problems: A Practical Attack on LLM Pruning
- VoiceAgentBench: Are Voice Assistants ready for agentic tasks?
- Active Confusion Expression in Large Language Models: Leveraging World Models toward Better Social Reasoning
- From Defender to Devil? Unintended Risk Interactions Induced by LLM Defenses
- STEPER: Step-wise Knowledge Distillation for Enhancing Reasoning Ability in Multi-Step Retrieval-Augmented Language Models
- Metric Calculating Benchmark: Code-Verifiable Complicate Instruction Following Benchmark for Large Language Models
- Upfront Chain-of-Thought: A Cooperative Framework for Chain-of-Thought Compression
- Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents
- Textual Entailment and Token Probability as Bias Evaluation Metrics
- OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
- MemWeaver: A Hierarchical Memory from Textual Interactive Behaviors for Personalized Generation
- Causality Guided Representation Learning for Cross-Style Hate Speech Detection
- OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
- Simulating Teams with LLM Agents: Interactive 2D Environments for Studying Human-AI Dynamics
- Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
- AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming
- MeSH: Memory-as-State-Highways for Recursive Transformers
- Self-Improving LLM Agents at Test-Time
- SPAD: Specialized Prefill and Decode Hardware for Disaggregated LLM Inference
- FlyLoRA: Boosting Task Decoupling and Parameter Efficiency via Implicit Rank-Wise Mixture-of-Experts
- Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
- From Tokens to Layers: Redefining Stall-Free Scheduling for MoE Serving with Layered Prefill
- DACIP-RC: Domain Adaptive Continual Instruction Pre-Training via Reading Comprehension on Business Conversations
- Don't Waste Mistakes: Leveraging Negative RL-Groups via Confidence Reweighting
- SliceFine: The Universal Winning-Slice Hypothesis for Pretrained Networks
- ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation
- Toward Reliable Clinical Coding with Language Models: Verification and Lightweight Adaptation
- Measuring and Mitigating Identity Bias in Multi-Agent Debate via Anonymization
- Black-Box Detection of LLM-Generated Text Using Generalized Jensen-Shannon Divergence
- Haystack Engineering: Context Engineering for Heterogeneous and Agentic Long-Context Evaluation
- L2M-AID: Autonomous Cyber-Physical Defense by Fusing Semantic Reasoning of Large Language Models with Multi-Agent Reinforcement Learning (Preprint)
- Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
- Leveraging LLMs to Streamline the Review of Public Funding Applications
- Sunflower: A New Approach To Expanding Coverage of African Languages in Large Language Models
- Encode, Think, Decode: Scaling test-time reasoning with recursive latent thoughts
- AMAS: Adaptively Determining Communication Topology for LLM-based Multi-Agent System
- Accelerating Diffusion LLM Inference via Local Determinism Propagation
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- VRPAgent: LLM-Driven Discovery of Heuristic Operators for Vehicle Routing Problems
- Search-R3: Unifying Reasoning and Embedding in Large Language Models
- Pragyaan: Designing and Curating High-Quality Cultural Post-Training Datasets for Indian Languages
- SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
- Autoformalizer with Tool Feedback
- PERSONA: Dynamic and Compositional Inference-Time Personality Control via Activation Vector Algebra
- Syncopate: Efficient Multi-GPU AI Kernels via Automatic Chunk-Centric Compute-Communication Overlap
- End-to-End Test-Time Training for Long Context
- Pool Me Wisely: On the Effect of Pooling in Transformer-Based Models
- Mid-Training of Large Language Models: A Survey
- FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline
- From Simulation to Strategy: Automating Personalized Interaction Planning for Conversational Agents
- Adaptive LLM-Symbolic Reasoning via Dynamic Logical Solver Composition
- AWM: Accurate Weight-Matrix Fingerprint for Large Language Models
- XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation
- The Effect of Attention Head Count on Transformer Approximation
- StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering
- Ming-UniVision: Joint Image Understanding and Generation with a Unified Continuous Tokenizer
- KaVa: Latent Reasoning via Compressed KV-Cache Distillation
- Reusing Overtrained Language Models Saturates Scaling
- Drawing Conclusions from Draws: Rethinking Preference Semantics in Arena-Style LLM Evaluation
- VUGEN: Visual Understanding priors for GENeration
- LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics
- Modeling Sarcastic Speech: Semantic and Prosodic Cues in a Speech Synthesis Framework
- Get RICH or Die Scaling: Profitably Trading Inference Compute for Robustness
- Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs
- TalkCuts: A Large-Scale Dataset for Multi-Shot Human Speech Video Generation
- POME: Post Optimization Model Edit via Muon-style Projection
- PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing
- Self-signals Driven Multi-LLM Debate for Efficient and Accurate Reasoning
- Attention Sinks and Compression Valleys in LLMs are Two Sides of the Same Coin
- Test-Time Scaling of Reasoning Models for Machine Translation
- EVALUESTEER: Measuring Reward Model Steerability Towards Values and Preferences
- Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
- SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence Generation
- Influence Functions for Efficient Data Selection in Reasoning
- Controllable Audio-Visual Viewpoint Generation from 360° Spatial Information
- MatheMagic: Generating Dynamic Mathematics Benchmarks Robust to Memorization
- EARL: Efficient Agentic Reinforcement Learning Systems for Large Language Models
- Evaluating the Sensitivity of LLMs to Harmful Contents in Long Input
- DACP: Domain-Adaptive Continual Pre-Training of Large Language Models for Phone Conversation Summarization
- Luth: Efficient French Specialization for Small Language Models and Cross-Lingual Transfer
- Flow4Agent: Long-form Video Understanding via Motion Prior from Optical Flow
- Mixture of Neuron Experts
- Primal-Dual Direct Preference Optimization for Constrained LLM Alignment
- PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction
- Mnemosyne: An Unsupervised, Human-Inspired Long-Term Memory Architecture for Edge-Based LLMs
- Activation-Informed Pareto-Guided Low-Rank Compression for Efficient LLM/VLM
- ARMOR: High-Performance Semi-Structured Pruning via Adaptive Matrix Factorization
- NorMuon: Making Muon more efficient and scalable
- Vul-R2: A Reasoning LLM for Automated Vulnerability Repair
- Improving Chain-of-Thought Efficiency for Autoregressive Image Generation
- Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs
- The African Languages Lab: A Collaborative Approach to Advancing Low-Resource African NLP
- CDTP: A Large-Scale Chinese Data-Text Pair Dataset for Comprehensive Evaluation of Chinese LLMs
- Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
- Bridging the Synthesizability Gap in Perovskites by Combining Computations, Literature Data, and PU Learning
- The Valley of Code Reasoning: Scaling Knowledge Distillation of Large Language Models
- LLMs as Policy-Agnostic Teammates: A Case Study in Human Proxy Design for Heterogeneous Agent Teams
- When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
- CAM: A Constructivist View of Agentic Memory for LLM-Based Reading Comprehension
- Boomerang Distillation Enables Zero-Shot Model Size Interpolation
- Staircase Streaming for Low-Latency Multi-Agent Inference
- Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages
- Let it Calm: Exploratory Annealed Decoding for Verifiable Reinforcement Learning
- AI-to-AI Feedback: Amplified Intelligence — Prior Art and Governance Implications for Multi-Model Advisory Architectures
- Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning
- A Set of Quebec-French Corpus of Regional Expressions and Terms
- Imperceptible Jailbreaking against Large Language Models
- Adaptive Memory Momentum via a Model-Based Framework for Deep Learning Optimization
- Reinforcement Learning for Clinical Reasoning: Aligning LLMs with ACR Imaging Appropriateness Criteria
- Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails
- Detecting Distillation Data from Reasoning Models
- Demystifying Synthetic Data in LLM Pre-training: A Systematic Study of Scaling Laws, Benefits, and Pitfalls
- Trade in Minutes! Rationality-Driven Agentic System for Quantitative Financial Trading
- ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs
- LLM-Based Information Extraction to Support Scientific Literature Research and Publication Workflows
- FocusMed: A Large Language Model-based Framework for Enhancing Medical Question Summarization with Focus Identification
- Evaluating LLMs for Demographic-Targeted Social Bias Detection: A Comprehensive Benchmark Study
- Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation
- Robustness assessment of large audio language models in multiple-choice evaluation
- Activation Quantization of Vision Encoders Needs Prefixing Registers
- Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
- Contrastive Retrieval Heads Improve Attention-Based Re-Ranking
- Context Length Alone Hurts LLM Performance Despite Perfect Retrieval
- Making Mathematical Reasoning Adaptive
- LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
- COLE: a Comprehensive Benchmark for French Language Understanding Evaluation
- Representation Potentials of Foundation Models for Multimodal Alignment: A Survey
- GRACE: Generative Representation Learning via Contrastive Policy Optimization
- Demystifying MaskGIT Sampler and Beyond: Adaptive Order Selection in Masked Diffusion
- Hybrid Architectures for Language Models: Systematic Analysis and Design Insights
- RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection
- VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models
- AlphaApollo: Orchestrating Foundation Models and Professional Tools into a Self-Evolving System for Deep Agentic Reasoning
- Empowering Denoising Sequential Recommendation with Large Language Model Embeddings
- Scaling Sequence-to-Sequence Generative Neural Rendering
- Pushing on Multilingual Reasoning Models with Language-Mixed Chain-of-Thought
- Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs
- Unveiling LLMs' Metaphorical Understanding: Exploring Conceptual Irrelevance, Context Leveraging and Syntactic Influence
- Increasing LLM response trustworthiness using voting ensembles
- Distilling Reasoning into Student LLMs: Local Naturalness for Selecting Teacher Data
- RLRF: Competitive Search Agent Design via Reinforcement Learning from Ranker Feedback
- LLM Microscope: What Model Internals Reveal About Answer Correctness and Context Utilization
- Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
- Activation Steering with a Feedback Controller
- Thai Semantic End-of-Turn Detection for Real-Time Voice Agents
- LongTail-Swap: benchmarking language models' abilities on rare words
- SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations
- Can Linear Probes Measure LLM Uncertainty?
- WebRenderBench: Enhancing Web Interface Generation through Layout-Style Consistency and Reinforcement Learning
- MulVuln: Enhancing Pre-trained LMs with Shared and Language-Specific Knowledge for Multilingual Vulnerability Detection
- Quantitative Certification of Agentic Tool Selection
- MoME: Mixture of Matryoshka Experts for Audio-Visual Speech Recognition
- The Unseen Frontier: Pushing the Limits of LLM Sparsity with Surrogate-Free ADMM
- RESTRAIN: From Spurious Votes to Signals -- Self-Driven RL with Self-Penalization
- Decoding Emotion in the Deep: A Systematic Study of How LLMs Represent, Retain, and Express Emotion
- SATER: A Self-Aware and Token-Efficient Approach to Routing and Cascading
- Allocation of Parameters in Transformers
- On the Empirical Power of Goodness-of-Fit Tests in Watermark Detection
- Token Hidden Reward: Steering Exploration-Exploitation in Group Relative Deep Reinforcement Learning
- Can an LLM Induce a Graph? Investigating Memory Drift and Context Length
- Decoupling Task-Solving and Output Formatting in LLM Generation
- One More Question is Enough, Expert Question Decomposition (EQD) Model for Domain Quantitative Reasoning
- GuidedSampling: Steering LLMs Towards Diverse Candidate Solutions at Inference-Time
- LLM, Reporting In! Medical Information Extraction Across Prompting, Fine-tuning and Post-correction
- Sample, Align, Synthesize: Graph-Based Response Synthesis with ConGrs
- A Qualitative Comparative Evaluation of Cognitive and Generative Theories
- PLSemanticsBench: Large Language Models As Programming Language Interpreters
- MonSTeR: a Unified Model for Motion, Scene, Text Retrieval
- What Drives Compositional Generalization in Visual Generative Models?
- NonTextual Target Attack
- Grounding Large Language Models in Clinical Evidence: A Retrieval-Augmented Generation System for Querying UK NICE Clinical Guidelines
- External Data Extraction Attacks against Retrieval-Augmented Large Language Models
- Leave No TRACE: Black-box Detection of Copyrighted Dataset Usage in Large Language Models via Watermarking
- Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain
- Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
- A Granular Study of Safety Pretraining under Model Abliteration
- MALF: A Multi-Agent LLM Framework for Intelligent Fuzzing of Industrial Control Protocols
- To Compress or Not? Pushing the Frontier of Lossless GenAI Model Weights Compression with Exponent Concentration
- Fine-tuning LLMs with variational Bayesian last layer for high-dimensional Bayesian optimization
- One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework
- StepChain GraphRAG: Reasoning Over Knowledge Graphs for Multi-Hop Question Answering
- Cache-to-Cache: Direct Semantic Communication Between Large Language Models
- Fine-Tuning on Noisy Instructions: Effects on Generalization and Performance
- Brain-Language Model Alignment: Insights into the Platonic Hypothesis and Intermediate-Layer Advantage
- Dirichlet-Prior Shaping: Guiding Expert Specialization in Upcycled MoEs
- Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?
- Sample-Efficient Differentially Private Fine-Tuning via Gradient Matrix Denoising
- Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense
- An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters
- Large Reasoning Models Learn Better Alignment from Flawed Thinking
- Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving
- Graph-S3: Enhancing Agentic textual Graph Retrieval with Synthetic Stepwise Supervision
- CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation
- EMR-AGENT: Automating Cohort and Feature Extraction from EMR Databases
- Flow of Knowledge: Federated Fine-Tuning of LLMs in Healthcare under Non-IID Conditions
- Rethinking Reward Models for Multi-Domain Test-Time Scaling
- TokMem: Tokenized Procedural Memory for Large Language Models
- Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment
- Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs
- Generalized Parallel Scaling with Interdependent Generations
- Rethinking Thinking Tokens: LLMs as Improvement Operators
- Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability
- Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
- Beyond Log Likelihood: Probability-Based Objectives for Supervised Fine-Tuning across the Model Capability Continuum
- A-VERT: Agnostic Verification with Embedding Ranking Targets
- CodeChemist: Functional Knowledge Transfer for Low-Resource Code Generation via Test-Time Scaling
- Beyond Majority Voting: LLM Aggregation by Leveraging Higher-Order Information
- Exploring System 1 and 2 communication for latent reasoning in LLMs
- Apriel-1.5-15b-Thinker
- HiSpec: Hierarchical Speculative Decoding for LLMs
- DecepChain: Inducing Deceptive Reasoning in Large Language Models
- On The Fragility of Benchmark Contamination Detection in Reasoning Models
- Retrieval-Augmented Generation for Electrocardiogram-Language Models
- Delayed Attention Training Improves Length Generalization in Transformer--RNN Hybrids
- AgentFlux: Decoupled Fine-Tuning & Inference for On-Device Agentic Systems
- Scaling Spoken Language Models with Syllabic Speech Tokenization
- Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training
- Are Robust LLM Fingerprints Adversarially Robust?
- Estimating Dimensionality of Neural Representations from Finite Samples
- Revealing the Power of Post-Training for Small Language Models via Knowledge Distillation
- OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!
- Are neural scaling laws leading quantum chemistry astray?
- SDA-PLANNER: State-Dependency Aware Adaptive Planner for Embodied Task Planning
- TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics
- Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts
- Interactive Learning for LLM Reasoning
- QUARTZ : QA-based Unsupervised Abstractive Refinement for Task-oriented Dialogue Summarization
- SlimPack: Fine-Grained Asymmetric Packing for Balanced and Efficient Variable-Length LLM Training
- Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing
- Beyond Linear Probes: Dynamic Safety Monitoring for Language Models
- IMG: Calibrating Diffusion Models via Implicit Multimodal Guidance
- Auto-ARGUE: LLM-Based Report Generation Evaluation
- MEDAKA: Construction of Biomedical Knowledge Graphs Using Large Language Models
- Clip-Low Increases Entropy and Clip-High Decreases Entropy in Reinforcement Learning of Large Language Models
- CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
- MHINDR -- a DSM5 based mental health diagnosis and recommendation framework using LLM
- R-Log: Incentivizing Log Analysis Capability in LLMs via Reasoning-based Reinforcement Learning
- Accelerating LLM Inference with Precomputed Query Storage
- ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack
- Distillation of Large Language Models via Concrete Score Matching
- Improving Sampling Efficiency in RLVR through Adaptive Rollout and Response Reuse
- EchoingECG: An Electrocardiogram Cross-Modal Model for Echocardiogram Tasks
- TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
- Think Less, Label Better: Multi-Stage Domain-Grounded Synthetic Data Generation for Fine-Tuning Large Language Models in Telecommunications
- ProbMed: A Probabilistic Framework for Medical Multimodal Binding
- LD-MoLE: Learnable Dynamic Routing for Mixture of LoRA Experts
- GroundSight: Augmenting Vision-Language Models with Grounding Information and De-hallucination
- Nudging the Boundaries of LLM Reasoning
- QFrBLiMP: a Quebec-French Benchmark of Linguistic Minimal Pairs
- Layer-wise dynamic rank for compressing large language models
- Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis
- FlowMoE: A Scalable Pipeline Scheduling Framework for Distributed Mixture-of-Experts Training
- Learning to Reason as Action Abstractions with Scalable Mid-Training RL
- VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
- TRUE: A Reproducible Framework for LLM-Driven Relevance Judgment in Information Retrieval
- VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models
- BloomAPR: A Bloom's Taxonomy-based Framework for Assessing the Capabilities of LLM-Powered APR Solutions
- Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
- Rethinking Parameter Sharing for LLM Fine-Tuning with Multiple LoRAs
- Predicting Training Re-evaluation Curves Enables Effective Data Curriculums for LLMs
- From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
- Structural Reward Model: Enhancing Interpretability, Efficiency, and Scalability in Reward Modeling
- Spontaneous High-Order Generalization in Neural Theory-of-Mind Networks
- Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
- The Era of Real-World Human Interaction: RL from User Conversations
- Rethinking Entropy Regularization in Large Reasoning Models
- Scaling with Collapse: Efficient and Predictable Training of LLM Families
- Scaling Generalist Data-Analytic Agents
- Circuit Distillation
- A-MemGuard: A Proactive Defense Framework for LLM-Based Agent Memory
- SecInfer: Preventing Prompt Injection via Inference-time Scaling
- MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes
- Pushing LLMs to Their Logical Reasoning Bound: The Role of Data Reasoning Intensity
- SeaPO: Strategic Error Amplification for Robust Preference Optimization of Large Language Models
- UniPruning: Unifying Local Metric and Global Feedback for Scalable Sparse LLMs
- LatentEvolve: Self-Evolving Test-Time Scaling in Latent Space
- ProxyAttn: Guided Sparse Attention via Representative Heads
- T-POP: Test-Time Personalization with Online Preference Feedback
- Reference-Free Rating of LLM Responses via Latent Information
- Prompting Robot Teams with Natural Language
- AdaThink-Med: Medical Adaptive Thinking with Uncertainty-Guided Length Calibration
- AdaDetectGPT: Adaptive Detection of LLM-Generated Text with Statistical Guarantees
- Enabling Physical AI through Biological Principles
- Building Benchmarks from the Ground Up: Community-Centered Evaluation of LLMs in Healthcare Chatbot Settings
- Knowledge Editing with Subspace-Aware Key-Value Mappings
- AstroMMBench: A Benchmark for Evaluating Multimodal Large Language Models Capabilities in Astronomy
- CDT: A Comprehensive Capability Framework for Large Language Models Across Cognition, Domain, and Task
- GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners
- AlignX: Advancing Multilingual Large Language Models with Multilingual Representation Alignment
- Let LLMs Speak Embedding Languages: Generative Text Embeddings via Iterative Contrastive Refinement
- SCI-Verifier: Scientific Verifier with Thinking
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models
- Conda: Column-Normalized Adam for Training Large Language Models Faster
- Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends
- Negative Pre-activations Differentiate Syntax
- Chat to Chip: Large Language Model Based Design of Arbitrarily Shaped Metasurfaces
- Talk in Pieces, See in Whole: Disentangling and Hierarchical Aggregating Representations for Language-based Object Detection
- Your thoughts tell who you are: Characterize the reasoning patterns of LRMs
- NAIPv2: Debiased Pairwise Learning for Efficient Paper Quality Estimation
- DocPruner: A Storage-Efficient Framework for Multi-Vector Visual Document Retrieval via Adaptive Patch-Level Embedding Pruning
- BPMN Assistant: An LLM-Based Approach to Business Process Modeling
- AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play
- Calibrating Verbalized Confidence with Self-Generated Distractors
- Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards
- Optimizing Privacy-Preserving Primitives to Support LLM-Scale Applications
- Query Circuits: Explaining How Language Models Answer User Prompts
- Singleton-Optimized Conformal Prediction
- Analyzing and Evaluating Unbiased Language Model Watermark
- An Ensemble Framework for Unbiased Language Model Watermarking
- Sequential Diffusion Language Models
- Toward Preference-aligned Large Language Models via Residual-based Model Steering
- Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
- Reinforcement Learning with Inverse Rewards for World Model Post-training
- Explore-Execute Chain: Towards an Efficient Structured Reasoning Paradigm
- Assessing Large Language Models in Updating Their Forecasts with New Information
- Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
- Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer
- Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning
- Falcon: A Cross-Modal Evaluation Dataset for Comprehensive Safety Perception
- From Personal to Collective: On the Role of Local and Global Memory in LLM Personalization
- Understanding Textual Capability Degradation in Speech LLMs via Parameter Importance Analysis
- LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models
- AdaPtis: Reducing Pipeline Bubbles with Adaptive Pipeline Parallelism on Heterogeneous Models
- HomeSafeBench: A Benchmark for Embodied Vision-Language Models in Free-Exploration Home Safety Inspection
- Hedonic Neurons: A Mechanistic Mapping of Latent Coalitions in Transformer MLPs
- Towards a Comprehensive Scaling Law of Mixture-of-Experts
- PAT-Agent: Autoformalization for Model Checking
- Why Alignment Must Precede Distillation: A Minimal Working Explanation
- Aligning LLMs for Multilingual Consistency in Enterprise Applications
- Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models
- Fast Thinking for Large Language Models
- Timber: Training-free Instruct Model Refining with Base via Effective Rank
- StolenLoRA: Exploring LoRA Extraction Attacks via Synthetic Data
- Toward a Holistic Approach to Continual Model Merging
- Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning
- Training Optimal Large Diffusion Language Models
- Large-Scale Constraint Generation -- Can LLMs Parse Hundreds of Constraints?
- Enhancing LLM Steering through Sparse Autoencoder-Based Vector Refinement
- CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems
- RIV: Recursive Introspection Mask Diffusion Vision Language Model
- QuadEnhancer: Leveraging Quadratic Transformations to Enhance Deep Neural Networks
- Modeling the language cortex with form-independent and enriched representations of sentence meaning reveals remarkable semantic abstractness
- MaskSQL: Safeguarding Privacy for LLM-Based Text-to-SQL via Abstraction
- LOTFormer: Doubly-Stochastic Linear Attention via Low-Rank Optimal Transport
- PATCH: Learnable Tile-level Hybrid Sparsity for LLMs
- Your Dense Retriever is Secretly an Expeditious Reasoner
- Train Once, Answer All: Many Pretraining Experiments for the Cost of One
- Alignment through Meta-Weighted Online Sampling: Bridging the Gap between Data Generation and Preference Optimization
- Language, Culture, and Ideology: Personalizing Offensiveness Detection in Political Tweets with Reasoning LLMs
- Explanation-Driven Counterfactual Testing for Faithfulness in Vision-Language Model Explanations
- SDQ-LLM: Sigma-Delta Quantization for 1-bit LLMs of any size
- DentVLM: A Multimodal Vision-Language Model for Comprehensive Dental Diagnosis and Enhanced Clinical Practice
- Learning to Reason in Structured In-context Environments with Reinforcement Learning
- A Flexible Programmable Pipeline Parallelism Framework for Efficient DNN Training
- A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models
- FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments
- Tree Reward-Aligned Search for TReASURe in Masked Diffusion Language Models
- Tracing Uncertainty in Language Model "Reasoning"
- Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection
- p-less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding
- Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
- PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space
- ZeroSiam: An Efficient Siamese for Test-Time Entropy Optimization without Collapse
- RHYTHM: Reasoning with Hierarchical Temporal Tokenization for Human Mobility
- Effective Quantization of Muon Optimizer States
- Multiplayer Nash Preference Optimization
- PT2-LLM: Post-Training Ternarization for Large Language Models
- Peacemaker or Troublemaker: How Sycophancy Shapes Multi-Agent Debate
- Tracing the Representation Geometry of Language Models from Pretraining to Post-training
- WirelessMathLM: Teaching Mathematical Reasoning for LLMs in Wireless Communications with Reinforcement Learning
- LLM Watermark Evasion via Bias Inversion
- ARSS: Taming Decoder-only Autoregressive Visual Generation for View Synthesis From Single View
- Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks
- LLMSQL: Upgrading WikiSQL for the LLM Era of Text-to-SQL
- CrystalGym: A New Benchmark for Materials Discovery Using Reinforcement Learning
- Model Consistency as a Cheap yet Predictive Proxy for LLM Elo Scores
- LLMs Behind the Scenes: Enabling Narrative Scene Illustration
- Infusing Theory of Mind into Socially Intelligent LLM Agents
- Ringleader ASGD: The First Asynchronous SGD with Optimal Time Complexity under Data Heterogeneity
- MMPB: It's Time for Multi-Modal Personalization
- Fine-Grained Detection of Context-Grounded Hallucinations Using LLMs
- Optimizing Long-Form Clinical Text Generation with Claim-Based Rewards
- IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning
- Linear Causal Representation Learning by Topological Ordering, Pruning, and Disentanglement
- REMA: A Unified Reasoning Manifold Framework for Interpreting Large Language Model
- SpinGPT: A Large-Language-Model Approach to Playing Poker Correctly
- Detecting (Un)answerability in Large Language Models with Linear Directions
- Partial Parameter Updates for Efficient Distributed Training
- Meta-Awareness Enhances Reasoning Models: Self-Alignment Reinforcement Learning
- Advancing Natural Language Formalization to First Order Logic with Fine-tuned LLMs
- PRIME: Planning and Retrieval-Integrated Memory for Enhanced Reasoning
- Rule-Based Reinforcement Learning for Document Image Classification with Vision Language Models
- Erase or Hide? Suppressing Spurious Unlearning Neurons for Robust Unlearning
- Wavelet-Induced Rotary Encodings: RoPE Meets Graphs
- Context Parametrization with Compositional Adapters
- From Long to Lean: Performance-aware and Adaptive Chain-of-Thought Compression via Multi-round Refinement
- Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
- R-Capsule: Compressing High-Level Plans for Efficient Large Language Model Reasoning
- FoodSEM: Large Language Model Specialized in Food Named-Entity Linking
- Multilingual Vision-Language Models, A Survey
- SciTS: Scientific Time Series Understanding and Generation with LLMs
- Ground-Truthing AI Energy Consumption: Validating CodeCarbon Against External Measurements
- The Rogue Scalpel: Activation Steering Compromises LLM Safety
- Comprehend and Talk: Text to Speech Synthesis via Dual Language Modeling
- Think Smart, Not Hard: Difficulty Adaptive Reasoning for Large Audio Language Models
- Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach
- A High-Capacity and Secure Disambiguation Algorithm for Neural Linguistic Steganography
- AutoSCORE: Enhancing Automated Scoring with Multi-Agent Large Language Models via Structured Component Recognition
- You Can't Steal Nothing: Mitigating Prompt Leakages in LLMs via System Vectors
- No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping
- LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals
- SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models
- Zeppelin: Balancing Variable-length Workloads in Data Parallel Large Model Training
- SoK: Potentials and Challenges of Large Language Models for Reverse Engineering
- Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow
- PSRT: Accelerating LRM-based Guard Models via Prefilled Safe Reasoning Traces
- POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization
- How Accurate Are LLMs at Multi-Question Answering on Conversational Transcripts?
- Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
- Learning More with Less: A Dynamic Dual-Level Down-Sampling Framework for Efficient Policy Optimization
- ReviewScore: Misinformed Peer Review Detection with Large Language Models
- QueryGym: Step-by-Step Interaction with Relational Databases
- Tiny but Mighty: A Software-Hardware Co-Design Approach for Efficient Multimodal Inference on Battery-Powered Small Devices
- X-Streamer: Unified Human World Modeling with Audiovisual Interaction
- Hallucination reduction with CASAL: Contrastive Activation Steering For Amortized Learning
- A circuit for predicting hierarchical structure in-context in Large Language Models
- Expert-guided Clinical Text Augmentation via Query-Based Model Collaboration
- On Code-Induced Reasoning in LLMs
- Dual-Head Reasoning Distillation: Improving Classifier Accuracy with Train-Time-Only Reasoning
- Diagnosing the Performance Trade-off in Moral Alignment: A Case Study on Gender Stereotypes
- One Model, Many Morals: Uncovering Cross-Linguistic Misalignments in Computational Moral Reasoning
- Sycophancy Is Not One Thing: Causal Separation of Sycophantic Behaviors in LLMs
- Data-Centric Elastic Pipeline Parallelism for Efficient Long-Context LLM Training
- Decipher-MR: A Vision-Language Foundation Model for 3D MRI Representations
- Tree Search for LLM Agent Reinforcement Learning
- Acoustic-based Gender Differentiation in Speech-aware Language Models
- Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns
- TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them
- VoiceBBQ: Investigating Effect of Content and Acoustics in Social Bias of Spoken Language Model
- Best-of-∞ -- Asymptotic Performance of Test-Time Compute
- Fine-tuning of Large Language Models for Domain-Specific Cybersecurity Knowledge
- PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints
- Binary Autoencoder for Mechanistic Interpretability of Large Language Models
- AOT*: Efficient Synthesis Planning via LLM-Empowered AND-OR Tree Search
- RLCracker: Evaluating the Worst-Case Vulnerability of LLM Watermarks with Adaptive RL Attacks
- PseudoBridge: Pseudo Code as the Bridge for Better Semantic and Logic Alignment in Code Retrieval
- StyleBench: Evaluating thinking styles in Large Language Models
- Prompt-Aware Scheduling for Low-Latency LLM Serving
- LogReasoner: Empowering LLMs with Expert-like Coarse-to-Fine Reasoning for Automated Log Analysis
- Towards Atoms of Large Language Models
- SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs
- Kant: An Efficient Unified Scheduling System for Large-Scale AI Clusters
- On Theoretical Interpretations of Concept-Based In-Context Learning
- Mixture of Thoughts: Learning to Aggregate What Experts Think, Not Just What They Say
- Unlocking Financial Insights: An advanced Multimodal Summarization with Multimodal Output Framework for Financial Advisory Videos
- RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs
- Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation
- FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models
- Training Task Reasoning LLM Agents for Multi-turn Task Planning via Single-turn Reinforcement Learning
- SiniticMTError: A Machine Translation Dataset with Error Annotations for Sinitic Languages
- Document Summarization with Conformal Importance Guarantees
- EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
- DRES: Benchmarking LLMs for Disfluency Removal
- Q-Palette: Fractional-Bit Quantizers Toward Optimal Bit Allocation for Efficient LLM Deployment
- Thinking Augmented Pre-training
- Evaluating and Mitigating Errors in LLM-Generated Web API Integrations
- SafeSteer: Adaptive Subspace Steering for Efficient Jailbreak Defense in Vision-Language Models
- BurstEngine: an Efficient Distributed Framework for Training Transformers on Extremely Long Sequences of over 1M Tokens
- Tokenization and Representation Biases in Multilingual Models on Dialectal NLP Tasks
- Learnable Sampler Distillation for Discrete Diffusion Models
- FastEagle: Cascaded Drafting for Accelerating Speculative Decoding
- Bias in the Picture: Benchmarking VLMs with Social-Cue News Images and LLM-as-Judge Assessment
- PromptCoT 2.0: Scaling Prompt Synthesis for Large Language Model Reasoning
- Future Policy Aware Preference Learning for Mathematical Reasoning
- SINAI at eRisk@CLEF 2025: Transformer-Based and Conversational Strategies for Depression Detection
- Polarity Detection of Sustainable Detection Goals in News Text
- Unmasking Fake Careers: Detecting Machine-Generated Career Trajectories via Multi-layer Heterogeneous Graphs
- Do Before You Judge: Self-Reference as a Pathway to Better LLM Evaluation
- Let's Play Across Cultures: A Large Multilingual, Multicultural Benchmark for Assessing Language Models' Understanding of Sports
- Every Character Counts: From Vulnerability to Defense in Phishing Detection
- Play by the Type Rules: Inferring Constraints for LLM Functions in Declarative Programs
- CIFLEX: Contextual Instruction Flow for Sub-task Execution in Multi-Turn Interactions with a Single On-Device LLM
- Silent Tokens, Loud Effects: Padding in LLMs
- Multimodal Language Models with Modality-Specific Experts for Financial Forecasting from Interleaved Sequences of Text and Time Series
- Anatomy of a Feeling: Narrating Embodied Emotions via Large Vision-Language Models
- Discovery of Sustainable Refrigerants through Physics-Informed RL Fine-Tuning of Sequence Models
- Semantic-Aware Fuzzing: An Empirical Framework for LLM-Guided, Reasoning-Driven Input Mutation
- Beyond Sentiment: Structured Information Extraction from Financial News
- LLMs struggle to simulate human belief updates in controlled environments
- LightRot: A Light-Weighted Rotation Scheme and Architecture for Accurate Low-Bit Large Language Model Inference
- Recall Before You Rank: Similarity-Guided Top-K Reuse for Efficient Long-Context Attention
- Hidden APIs in Language Models: Discovering Reusable Causal Interfaces from Forked Futures
- Drawing-Recode: Annotation Grounding for Parametric CAD Code Generation from Raster 2D CAD Drawings
- Back from the Future: Key-Value Cache Management by Counter-Causal Surprise
- Σ-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems
- When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences
- MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck
- Semantic-Aligned Structural Abstraction for Multimodal Sentiment Analysis
- SemPIC: Learning Semantic Position-Independent KV Caches
- GGC: Selective Query Correction for Reliable Text-to-SPARQL Generation
- SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer
- FinSMART: Financial Sentiment Analysis for Algorithmic Trading through Market-Aligned Reinforcement Learning
- Rethinking LLM-Judged Helpfulness as a Pedagogy Signal: A Pre-Registered Audit Across Tutor Models
- Towards joint scaling laws with optimal batch size schedules
- ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents
- A Policy-Driven Runtime Layer for Agentic LLM Serving
- Gradient-free Task-Conditioned Retrieval for On-Device In-Context Learning
- Contrastive Reinforced Policy Optimization via Privileged Self-Distillation
- Belief Coevolution in a Social Network of Generalist and Specialist Large Language Models
- Models for minimalist RAG: B1ade 335M Embedding and 1B Parameter Small Language Models
- BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences
- Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs
- Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models
- FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training
- PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology
- Divergence Decoding: Training-Free Capability Fusion
- Numbers Beat Words: A Rigorous On-Premise Benchmark for Coupled MIMO Controller Tuning
- Benchmarking Open-Ended Multi-Agent Coordination in Language Agents
- How LoRA Remembers? A Parametric Memory Law for LLM Finetuning
- Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting
- Defusing the Trigger: Tail-Risk-Informed Attention Rebalancing for LLM Backdoor Mitigation
- HumorRank: A Tournament-Based Leaderboard for Evaluating Humor Generation in Large Language Models
- RELISH: LLM REgression with a Latent Iterative State Head
- Harm or Humor: A Multimodal, Multilingual Benchmark for Overt and Covert Harmful Humor
- An Extreme Multi-label Text Classification (XMTC) Library Dataset: What if we took "Use of Practical AI in Digital Libraries" seriously?
- GradMAP: Faster Layer Pruning with Gradient Metric and Projection Compensation
- Benchmark for Assessing Olfactory Perception of Large Language Models
- OPENXRD: a comprehensive benchmark framework for LLM/MLLM XRD question answering
- MentorCollab: Selective Large-to-Small Inference-Time Guidance for Efficient Reasoning
- KuaiSearch: An E-Commerce Search Dataset with Authentic Queries and Product Texts for Recall, Ranking, and Relevance
- Measuring Mid-2025 LLM-Assistance on Novice Performance in Biology
- A large-scale evaluation of commonsense knowledge in humans and large language models
- A Retail-Corpus for Aspect-Based Sentiment Analysis with Large Language Models
- A holistic perception system of internal and external monitoring for ground autonomous vehicles: AutoTRUST paradigm
- Language Models Coupled with Metacognition Can Outperform Reasoning Models
- Understanding Subword Compositionality of Large Language Models
- Debiasing Multilingual LLMs in Cross-lingual Latent Space
- AMELIA: A Family of Multi-task End-to-end Language Models for Argumentation
- Pandora: Leveraging Code-driven Knowledge Transfer for Unified Structured Knowledge Reasoning
- Bridging gaps in hate speech detection: meta-collections and benchmarks for low-resource Iberian languages
- Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs
- RepoTransAgent: Multi-Agent LLM Framework for Repository-Aware Code Translation
- How Do LLM-Generated Texts Impact Term-Based Retrieval Models?
- AtomRAG: atomic query decomposition for multi-hop retrieval-augmented generation
- InterFeat: a pipeline for finding interesting scientific features
- Proximal Supervised Fine-Tuning
- AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language Model for Multi-image Question Answering
- Reading the unreadable: creating a dataset of 19th century English newspapers using image-to-text language models
- GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
- Scalable Engine and the Performance of Different LLM Models in a SLURM based HPC architecture
- Speculating LLMs' Chinese Training Data Pollution from Their Tokens
- Reinforcement Learning on Pre-Training Data
- Soft Tokens, Hard Truths
- CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure
- LLM-based Agents Suffer from Hallucinations: A Survey of Taxonomy, Methods, and Directions
- Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions
- Hyper-Bagel: A Unified Acceleration Framework for Multimodal Understanding and Generation
- MECap-R1: Emotion-aware Policy with Reinforcement Learning for Multimodal Emotion Captioning
- OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation
- Who is In Charge? Dissecting Role Conflicts in Instruction Following
- Context-Aware Hierarchical Taxonomy Generation for Scientific Papers via LLM-Guided Multi-Aspect Clustering
- Experience Scaling: Post-Deployment Evolution For Large Language Models
- Financial Risk Relation Identification through Dual-view Adaptation
- Data Efficient Adaptation in Large Language Models via Continuous Low-Rank Fine-Tuning
- Agentic AutoSurvey: Let LLMs Survey LLMs
- Live-E2T: Real-time Threat Monitoring in Video via Deduplicated Event Reasoning and Chain-of-Thought
- TiKMiX: Take Data Influence into Dynamic Mixture for Language Model Pre-training
- A Good Plan is Hard to Find: Aligning Models with Preferences is Misaligned with What Helps Users
- Confidential LLM Inference: Performance and Cost Across CPU and GPU TEEs
- ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?
- Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
- ReGeS: Reciprocal Retrieval-Generation Synergy for Conversational Recommender Systems
- Accurate and Efficient Low-Rank Model Merging in Core Space
- When TableQA Meets Noise: A Dual Denoising Framework for Complex Questions and Large-scale Tables
- EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
- AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?
- AttnComp: Attention-Guided Adaptive Context Compression for Retrieval-Augmented Generation
- EpiCache: Episodic KV Cache Management for Long Conversational Question Answering
- Cronus: Efficient LLM inference on Heterogeneous GPU Clusters via Partially Disaggregated Prefill
- Clotho: Measuring Task-Specific Pre-Generation Test Adequacy for LLM Inputs
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction
- Everyday Physics in Korean Contexts: A Culturally Grounded Physical Reasoning Benchmark
- ReDepress: A Cognitive Framework for Detecting Depression Relapse from Social Media
- TASO: Task-Aligned Sparse Optimization for Parameter-Efficient Model Adaptation
- Memory-QA: Answering Recall Questions Based on Multimodal Memories
- Variation in Verification: Understanding Verification Dynamics in Large Language Models
- QWHA: Quantization-Aware Walsh-Hadamard Adaptation for Parameter-Efficient Fine-Tuning on Large Language Models
- Understanding Post-Training Structural Changes in Large Language Models
- Attention Consistency for LLMs Explanation
- CUTE: A Multilingual Dataset for Enhancing Cross-Lingual Knowledge Transfer in Low-Resource Languages
- TactfulToM: Do LLMs Have the Theory of Mind Ability to Understand White Lies?
- PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
- Preference Distillation via Value based Reinforcement Learning
- Steering When Necessary: Flexible Steering Large Language Models with Backtracking
- Difficulty-Aware Score Generation for Piano Sight-Reading
- KAHAN: Knowledge-Augmented Hierarchical Analysis and Narration for Financial Data Narration
- VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation
- MCTS-EP: Empowering Embodied Planning with Online Preference Optimization
- USB-Rec: An Effective Framework for Improving Conversational Recommendation Capability of Large Language Model
- ACCeLLiuM: Supervised Fine-Tuning for Automated OpenACC Pragma Generation
- Less Is More? Examining Fairness in Pruned Large Language Models for Summarising Opinions
- SCAN: Self-Denoising Monte Carlo Annotation for Robust Process Reward Learning
- GRIL: Knowledge Graph Retrieval-Integrated Learning with Large Language Models
- Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs
- ChemOrch: Empowering LLMs with Chemical Intelligence via Synthetic Instructions
- Enhancing Scientific Visual Question Answering via Vision-Caption aware Supervised Fine-Tuning
- Benchmarking Contextual and Paralinguistic Reasoning in Speech-LLMs: A Case Study with In-the-Wild Data
- DISCO: Disentangled Communication Steering for Large Language Models
- DoubleGen: Debiased Generative Modeling of Counterfactuals
- MPCG: Multi-Round Persona-Conditioned Generation for Modeling the Evolution of Misinformation with LLMs
- Domain-Specific Constitutional AI: Enhancing Safety in LLM-Powered Mental Health Chatbots
- 'Rich Dad, Poor Lad': How do Large Language Models Contextualize Socioeconomic Factors in College Admission ?
- FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation
- DiEP: Adaptive Mixture-of-Experts Compression through Differentiable Expert Pruning
- Randomized Smoothing Meets Vision-Language Models
- Robust LLM Training Infrastructure at ByteDance
- VoXtream: Full-Stream Text-to-Speech with Extremely Low Latency
- On Optimal Steering to Achieve Exact Fairness
- KITE: Kernelized and Information Theoretic Exemplars for In-Context Learning
- SLM-Based Agentic AI with P-C-G: Optimized for Korean Tool Use
- Toward Efficient Influence Function: Dropout as a Compression Tool
- LiteLong: Resource-Efficient Long-Context Data Synthesis for LLMs
- A method for improving multilingual quality and diversity of instruction fine-tuning datasets
- Reward Hacking Mitigation using Verifiable Composite Rewards
- How do Language Models Generate Slang: A Systematic Comparison between Human and Machine-Generated Slang Usages
- Sparse-Autoencoder-Guided Internal Representation Unlearning for Large Language Models
- Once Upon a Time: Interactive Learning for Storytelling with Small Language Models
- Can LLMs Judge Debates? Evaluating Non-Linear Reasoning via Argumentation Theory Semantics
- CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics
- Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
- Think, Verbalize, then Speak: Bridging Complex Thoughts and Comprehensible Speech
- Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models
- Concept Unlearning in Large Language Models via Self-Constructed Knowledge Triplets
- Temporal Reasoning with Large Language Models Augmented by Evolving Knowledge Graphs
- LNE-Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models
- RynnVLA-001: Using Human Demonstrations to Improve Robot Manipulation
- SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models
- Self-Improving Embodied Foundation Models
- Semantic Representation Attack against Aligned Large Language Models
- T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation
- Llama-Mimi: Speech Language Models with Interleaved Semantic and Acoustic Tokens
- From Hype to Insight: Rethinking Large Language Model Integration in Visual Speech Recognition
- LEAP: LLM Inference on Scalable PIM-NoC Architecture with Balanced Dataflow and Fine-Grained Parallelism
- Evaluating the Impact of Verbal Multiword Expressions on Machine Translation
- Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM
- LLM4MG: Adapting Large Language Model for Multipath Generation via Synesthesia of Machines
- Towards Human-like Multimodal Conversational Agent by Generating Engaging Speech
- SynBench: A Benchmark for Differentially Private Text Generation
- Walk and Read Less: Improving the Efficiency of Vision-and-Language Navigation via Tuning-Free Multimodal Token Pruning
- A Multi-To-One Interview Paradigm for Efficient MLLM Evaluation
- Listening, Imagining & Refining: A Heuristic Optimized ASR Correction Framework with LLMs
- Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
- ATTS: Asynchronous Test-Time Scaling via Conformal Prediction
- DeKeyNLU: Enhancing Natural Language to SQL Generation through Task Decomposition and Keyword Extraction
- TableDART: Dynamic Adaptive Multi-Modal Routing for Table Understanding
- Fair-GPTQ: Bias-Aware Quantization for Large Language Models
- Adversarial Distilled Retrieval-Augmented Guarding Model for Online Malicious Intent Detection
- Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision
- Fresh in memory: Training-order recency is linearly encoded in language model activations
- Do LLMs Align Human Values Regarding Social Biases? Judging and Explaining Social Biases with LLMs
- Masked Diffusion Models as Energy Minimization
- Exploring the Capabilities of LLM Encoders for Image-Text Retrieval in Chest X-rays
- Can Current AI Models Count What We Mean, Not What They See? A Benchmark and Systematic Evaluation
- PiERN: Token-Level Routing for Integrating High-Precision Computation and Reasoning
- Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies
- Summary on The Multilingual Conversational Speech Language Model Challenge: Datasets, Tasks, Baselines, and Methods
- Who Taught the Lie? Responsibility Attribution for Poisoned Knowledge in Retrieval-Augmented Generation
- Can Large Language Models Robustly Perform Natural Language Inference for Japanese Comparatives?
- CL2GEC: A Multi-Discipline Benchmark for Continual Learning in Chinese Literature Grammatical Error Correction
- Latent Traits and Cross-Task Transfer: Deconstructing Dataset Interactions in LLM Fine-tuning
- SAIL-VL2 Technical Report
- Learning the natural history of human disease with generative transformers
- SBVR: Summation of BitVector Representation for Efficient LLM Quantization
- Hala Technical Report: Building Arabic-Centric Instruction & Translation Models at Scale
- Estimating Semantic Alphabet Size for LLM Uncertainty Quantification
- Adding LLMs to the psycholinguistic norming toolbox: A practical guide to getting the most out of human ratings
- Translate, then Detect: Leveraging Machine Translation for Cross-Lingual Toxicity Classification
- Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
- Improving Context Fidelity via Native Retrieval-Augmented Reasoning
- Cinéaste: A Fine-grained Contextual Movie Question Answering Benchmark
- Mind the (Language) Gap: Towards Probing Numerical and Cross-Lingual Limits of LVLMs
- Chinese Court Simulation with LLM-Based Agent System
- Towards Rationale-Answer Alignment of LVLMs via Self-Rationale Calibration
- Benchmarking ChatGPT and DeepSeek in April 2025: A Novel Dual Perspective Sentiment Analysis Using Lexicon-Based and Deep Learning Approaches
- AERIS: Argonne Earth Systems Model for Reliable and Skillful Predictions
- The Few-shot Dilemma: Over-prompting Large Language Models
- HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
- Rethinking the Evaluation of Alignment Methods: Insights into Diversity, Generalisation, and Safety
- Beyond Data Privacy: New Privacy Risks for Large Language Models
- LTA-thinker: Latent Thought-Augmented Training Framework for Large Language Models on Complex Reasoning
- Leveraging Large Language Models to Effectively Generate Visual Data for Canine Musculoskeletal Diagnoses
- LLMs Can't Handle Peer Pressure: Crumbling under Multi-Agent Social Interactions
- HistoryBankQA: Multilingual Temporal Question Answering on Historical Events
- EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer
- Mitigating Strategy Preference Bias in Emotional Support Conversation via Uncertainty Estimations
- ScaleDoc: Scaling LLM-based Predicates over Large Document Collections
- Multimodal Hate Detection Using Dual-Stream Graph Neural Networks
- Reasoning with Preference Constraints: A Benchmark for Language Models in Many-to-One Matching Markets
- Do LLMs Understand Wine Descriptors Across Cultures? A Benchmark for Cultural Adaptations of Wine Reviews
- Shaping Explanations: Semantic Reward Modeling with Encoder-Only Transformers for GRPO
- Large Language Models Imitate Logical Reasoning, but at what Cost?
- Towards Better Correctness and Efficiency in Code Generation
- Exploring and Reshaping the Weight Distribution in LLM
- Metacognitive Reuse: Turning Recurring LLM Reasoning Into Concise Behaviors
- ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation
- Text Adaptation to Plain Language and Easy Read via Automatic Post-Editing Cycles
- Evaluating Large Language Models for Functional and Maintainable Code in Industrial Settings: A Case Study at ASML
- Character-Centric Understanding of Animated Movies
- RAGs to Riches: RAG-like Few-shot Learning for Large Language Model Role-playing
- Pun Unintended: LLMs and the Illusion of Humor Understanding
- GTA: Supervised-Guided Reinforcement Learning for Text Classification with Large Language Models
- FinGEAR: Financial Mapping-Guided Enhanced Answer Retrieval
- AMQ: Enabling AutoML for Mixed-precision Weight-Only Quantization of Large Language Models
- NeuroStrike: Neuron-Level Attacks on Aligned LLMs
- ProtoEHR: Hierarchical Prototype Learning for EHR-based Healthcare Predictions
- Biomedical Hypothesis Explainability with Graph-Based Context Retrieval
- CoachMe: Decoding Sport Elements with a Reference-Based Coaching Instruction Generation Model
- Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check
- Linguistic Neuron Overlap Patterns to Facilitate Cross-lingual Transfer on Low-resource Languages
- HiChunk: Evaluating and Enhancing Retrieval-Augmented Generation with Hierarchical Chunking
- HARP: Hallucination Detection via Reasoning Subspace Projection
- Preservation of Language Understanding Capabilities in Speech-aware Large Language Models
- Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Time
- Decoding in Latent Spaces for Efficient Inference in LLM-based Recommendation
- HalluDetect: Detecting, Mitigating, and Benchmarking Hallucinations in Conversational Systems in the Legal Domain
- What Matters in Data for DPO?
- MORABLES: A Benchmark for Assessing Abstract Moral Reasoning in LLMs with Fables
- UniPar: A Unified LLM-Based Framework for Parallel and Accelerated Code Translation in HPC
- ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
- DetectAnyLLM: Towards Generalizable and Robust Detection of Machine-Generated Text Across Domains and Models
- A Transformer-Based Cross-Platform Analysis of Public Discourse on the 15-Minute City Paradigm
- From Firewalls to Frontiers: AI Red-Teaming is a Domain-Specific Evolution of Cyber Red-Teaming
- Do Large Language Models Favor Recent Content? A Study on Recency Bias in LLM-Based Reranking
- Optimal Brain Restoration for Joint Quantization and Sparsification of LLMs
- Difficulty-Aware Agentic Orchestration for Query-Specific Multi-Agent Workflows
- Continually Adding New Languages to Multilingual Language Models
- LoRALib: A Standardized Benchmark for Evaluating LoRA-MoE Methods
- Improving Table Understanding with LLMs and Entity-Oriented Search
- LLMAP: LLM-Assisted Multi-Objective Route Planning with User Preferences
- From Parameters to Performance: A Data-Driven Study on LLM Structure and Development
- TrueSkin: Towards Fair and Accurate Skin Tone Recognition and Generation
- Testing for LLM response differences: the case of a composite null consisting of semantically irrelevant query perturbations
- CultureSynth: A Hierarchical Taxonomy-Guided and Retrieval-Augmented Framework for Cultural Question-Answer Synthesis
- Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction
- OpenHA: A Series of Open-Source Hierarchical Agentic Models in Minecraft
- HalluField: Detecting LLM Hallucinations via Field-Theoretic Modeling
- RECAP: Transparent Inference-Time Emotion Alignment for Medical Dialogue Systems
- Reasoning Under Uncertainty: Exploring Probabilistic Reasoning Capabilities of LLMs
- DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL
- Characterizing the Efficiency of Distributed Training: A Power, Performance, and Thermal Perspective
- SignMouth: Leveraging Mouthing Cues for Sign Language Translation by Multimodal Contrastive Fusion
- Prompt Injection Attacks on LLM Generated Reviews of Scientific Publications
- Explaining Black-box Language Models with Knowledge Probing Systems: A Post-hoc Explanation Perspective
- Approximate Graph Propagation Revisited: Dynamic Parameterized Queries, Tighter Bounds and Dynamic Updates
- Unsupervised Hallucination Detection by Inspecting Reasoning Processes
- Linguistic trajectories of bipolar disorder on social media
- The Hidden Width of Deep ResNets: Tight Error Bounds and Phase Diagram
- Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
- Scalable Training for Vector-Quantized Networks with 100% Codebook Utilization
- Towards Understanding Visual Grounding in Visual Language Models
- Measuring Epistemic Humility in Multimodal Large Language Models
- Fluent but Unfeeling: The Emotional Blind Spots of Language Models
- Modelling Analogies and Analogical Reasoning: Connecting Cognitive Science Theory and NLP Research
- Boosting Data Utilization for Multilingual Dense Retrieval
- Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs
- Curriculum-Based Multi-Tier Semantic Exploration via Deep Reinforcement Learning
- CESRec: Constructing Pseudo Interactions for Sequential Recommendation via Conversational Feedback
- DATE: Dynamic Absolute Time Enhancement for Long Video Understanding
- Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis
- CCF: A Context Compression Framework for Efficient Long-Sequence Language Modeling
- Probing Pre-trained Language Models on Code Changes: Insights from ReDef, a High-Confidence Just-in-Time Defect Prediction Dataset
- EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs
- A Knowledge Noise Mitigation Framework for Knowledge-based Visual Question Answering
- Sensitivity-LoRA: Low-Load Sensitivity-Based Fine-Tuning for Large Language Models
- TigerCoder: A Novel Suite of LLMs for Code Generation in Bangla
- Towards Confidential and Efficient LLM Inference with Dual Privacy Protection
- MR-UIE: Multi-Perspective Reasoning with Reinforcement Learning for Universal Information Extraction
- LLM-JEPA: Large Language Models Meet Joint Embedding Predictive Architectures
- CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
- BRoverbs -- Measuring how much LLMs understand Portuguese proverbs
- Building High-Quality Datasets for Portuguese LLMs: From Common Crawl Snapshots to Industrial-Grade Corpora
- Multimodal LLMs See Sentiment
- QFrCoLA: a Quebec-French Corpus of Linguistic Acceptability Judgments
- Generative Data Refinement: Just Ask for Better Data
- Memorization in Large Language Models in Medicine: Prevalence, Characteristics, and Implications
- BASIL: Bayesian Assessment of Sycophancy in LLMs
- Adversarial Attacks Against Automated Fact-Checking: A Survey
- Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics
- An Iterative LLM Framework for SIBT utilizing RAG-based Adaptive Weight Optimization
- Accelerating Mixture-of-Expert Inference with Adaptive Expert Split Mechanism
- Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing
- ALIGNS: Unlocking nomological networks in psychological measurement through a large language model
- PolicyStory: Leveraging Large Language Models to Generate Comprehensible Summaries of Policy-News in India
- EvolKV: Evolutionary KV Cache Compression for LLM Inference
- Aurora: Architecting Argonne's First Exascale Supercomputer for Accelerated Scientific Discovery
- CM-Align: Consistency-based Multilingual Alignment for Large Language Models
- Recurrence Meets Transformers for Universal Multimodal Retrieval
- Mitigating Catastrophic Forgetting in Large Language Models with Forgetting-aware Pruning
- TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models
- Bringing Multi-Modal Multi-Task Federated Foundation Models to Education Domain: Prospects and Challenges
- FLeW: Facet-Level and Adaptive Weighted Representation Learning of Scientific Documents
- Language Self-Play For Data-Free Training
- TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
- LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction
- PersonaFuse: A Personality Activation-Driven Framework for Enhancing Human-LLM Interactions
- Assess and Prompt: A Generative RL Framework for Improving Engagement in Online Mental Health Communities
- EyeMulator: Improving Code Language Models by Mimicking Human Visual Attention
- SCA-LLM: Spectral-Attentive LLM-Based Wireless World Modeling for Agentic Communications
- Guarding Your Conversations: Privacy Gatekeepers for Secure Interactions with Cloud-Based AI Models
- WebMMU: A Benchmark for Multimodal Multilingual Website Understanding and Code Generation
- Biased Tales: Cultural and Topic Bias in Generating Children's Stories
- Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems
- Testing chatbots on the creation of encoders for audio conditioned image generation
- Text2Touch: Tactile In-Hand Manipulation with LLM-Designed Reward Functions
- Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data
- Unleashing the True Potential of LLMs: A Feedback-Triggered Self-Correction with Long-Term Multipath Decoding
- PatchSeeker: Mapping NVD Records to their Vulnerability-fixing Commits with LLM Generated Commits and Embeddings
- Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm
- Towards EnergyGPT: A Large Language Model Specialized for the Energy Sector
- MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security
- Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization
- VehicleWorld: A Highly Integrated Multi-Device Environment for Intelligent Vehicle Interaction
- Toward a Metrology for Artificial Intelligence: Hidden-Rule Environments and Reinforcement Learning
- Small Vectors, Big Effects: A Mechanistic Study of RL-Induced Reasoning via Steering Vectors
- Outcome-based Exploration for LLM Reasoning
- Accelerate Scaling of LLM Finetuning via Quantifying the Coverage and Depth of Instruction Set
- Index-Preserving Lightweight Token Pruning for Efficient Document Understanding in Vision-Language Models
- Large Language Models as Virtual Survey Respondents: Evaluating Sociodemographic Response Generation
- RL Fine-Tuning Heals OOD Forgetting in SFT
- HyFedRAG: A Federated Retrieval-Augmented Generation Framework for Heterogeneous and Privacy-Sensitive Data
- Text-Trained LLMs Can Zero-Shot Extrapolate PDE Dynamics, Revealing a Three-Stage In-Context Learning Mechanism
- MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations
- mmBERT: A Modern Multilingual Encoder with Annealed Language Learning
- Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
- IntrEx: A Dataset for Modeling Engagement in Educational Conversations
- HANRAG: Heuristic Accurate Noise-resistant Retrieval-Augmented Generation for Multi-hop Question Answering
- SVGauge: Towards Human-Aligned Evaluation for SVG Generation
- Rethinking LLM Parametric Knowledge as Post-retrieval Confidence for Dynamic Retrieval and Reranking
- Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift
- AttestLLM: Efficient Attestation Framework for Billion-scale On-device LLMs
- An Explainable Deep Neural Network with Frequency-Aware Channel and Spatial Refinement for Flood Prediction in Sustainable Cities
- Murakkab: Resource-Efficient Agentic Workflow Orchestration in Cloud Platforms
- From Long to Short: LLMs Excel at Trimming Own Reasoning Chains
- RL Is Neither a Panacea Nor a Mirage: Understanding Supervised vs. Reinforcement Learning Fine-Tuning for LLMs
- Chatbot To Help Patients Understand Their Health
- Hyperbolic Large Language Models
- Exploring Subjective Tasks in Farsi: A Survey Analysis and Evaluation of Language Models
- Llama-GENBA-10B: A Trilingual Large Language Model for German, English and Bavarian
- A Survey of the State-of-the-Art in Conversational Question Answering Systems
- ZhiFangDanTai: Fine-tuning Graph-based Retrieval-Augmented Generation Model for Traditional Chinese Medicine Formula
- ToM-SSI: Evaluating Theory of Mind in Situated Social Interactions
- KGRAG-SC: Knowledge Graph RAG-Assisted Semantic Communication
- Rethinking Reasoning in LLMs: Neuro-Symbolic Local RetoMaton Beyond ICL and CoT
- Reverse Browser: Vector-Image-to-Code Generator
- ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning
- A Study of Large Language Models for Patient Information Extraction: Model Architecture, Fine-Tuning Strategy, and Multi-task Instruction Tuning
- Characterizing and Optimizing Realistic Workloads on a Commercial Compute-in-SRAM Device
- veScale: Consistent and Efficient Tensor Programming with Eager-Mode SPMD
- The Non-Determinism of Small LLMs: Evidence of Low Answer Consistency in Repetition Trials of Standard Multiple-Choice Benchmarks
- Can VLMs Recall Factual Associations From Visual References?
- CTCC: A Robust and Stealthy Fingerprinting Framework for Large Language Models via Cross-Turn Contextual Correlation Backdoor
- Direct-Scoring NLG Evaluators Can Use Pairwise Comparisons Too
- SpikingBrain: Spiking Brain-inspired Large Models
- FLAMES: Improving LLM Math Reasoning via a Fine-Grained Analysis of the Data Synthesis Pipeline
- Towards a Unified View of Large Language Model Post-Training
- KubeGuard: LLM-Assisted Kubernetes Hardening via Configuration Files and Runtime Logs Analysis
- TAGAL: Tabular Data Generation using Agentic LLM Methods
- How Small is Enough? Empirical Evidence of Quantized Small Language Models for Automated Program Repair
- HAMSA: Hijacking Aligned Compact Models via Stealthy Automation
- MultiWikiQA: A Reading Comprehension Benchmark in 300+ Languages
- Expanding Foundational Language Capabilities in Open-Source LLMs through a Korean Case Study
- MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors
- Weakly-Supervised Learning of Dense Functional Correspondences
- Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation
- A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
- MedVista3D: Vision-Language Modeling for Reducing Diagnostic Errors in 3D CT Disease Detection, Understanding and Reporting
- Evaluating the Robustness of Retrieval-Augmented Generation to Adversarial Evidence in the Health Domain
- Can Language Models Handle a Non-Gregorian Calendar? The Case of the Japanese wareki
- Evaluating NL2SQL via SQL2NL
- IPA: An Information-Reconstructive Input Projection Framework for Efficient Foundation Model Adaptation
- Aesthetic Image Captioning with Saliency Enhanced MLLMs
- PediatricsMQA: a Multi-modal Pediatrics Question Answering Benchmark
- Sample-efficient Integration of New Modalities into Large Language Models
- OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval
- Cetvel: A Unified Benchmark for Evaluating Language Understanding, Generation and Cultural Capacity of LLMs for Turkish
- Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators
- Emergent Hierarchical Reasoning in LLMs through Reinforcement Learning
- Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents
- Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training
- SESGO: Spanish Evaluation of Stereotypical Generative Outputs
- AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
- OneSearch: A Preliminary Exploration of the Unified End-to-End Generative Framework for E-commerce Search
- TeRA: Vector-based Random Tensor Network for High-Rank Adaptation of Large Language Models
- Expanding the WMT24++ Benchmark with Rumantsch Grischun, Sursilvan, Sutsilvan, Surmiran, Puter, and Vallader
- Adaptive KV-Cache Compression without Manually Setting Budget
- RecBase: Generative Foundation Model Pretraining for Zero-Shot Recommendation
- FlashRecovery: Fast and Low-Cost Recovery from Failures for Large-Scale Training of LLMs
- Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models
- ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly
- Mycroft: Tracing Dependencies in Collective Communication Towards Reliable LLM Training
- EverTracer: Hunting Stolen Large Language Models via Stealthy and Robust Probabilistic Fingerprint
- TRACE: Unlocking Effective CXL Bandwidth via Lossless Compression and Precision Scaling
- Decoding the Rule Book: Extracting Hidden Moderation Criteria from Reddit Communities
- Scaling behavior of large language models in emotional safety classification across sizes and tasks
- Unlearning That Lasts: Utility-Preserving, Robust, and Almost Irreversible Forgetting in LLMs
- Generative AI for Crystal Structures: A Review
- KubeIntellect: A Modular LLM-Orchestrated Agent Framework for End-to-End Kubernetes Management
- Implicit Reasoning in Large Language Models: A Comprehensive Survey
- Towards Fundamental Language Models: Does Linguistic Competence Scale with Model Size?
- How Instruction-Tuning Imparts Length Control: A Cross-Lingual Mechanistic Analysis
- Attributes as Textual Genes: Leveraging LLMs as Genetic Algorithm Simulators for Conditional Synthetic Data Generation
- Batch Query Processing and Optimization for Agentic Workflows
- Group Relative Policy Optimization for Speech Recognition
- Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation
- MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine
- Clustering Discourses: Racial Biases in Short Stories about Women Generated by Large Language Models
- LLM-Enhanced Space-Air-Ground-Sea Integrated Networks
- GRAM-R2: Self-Training Generative Foundation Reward Models for Reward Reasoning
- Abex-rat: Synergizing Abstractive Augmentation and Adversarial Training for Classification of Occupational Accident Reports
- GradES: Significantly Faster Training in Transformers with Gradient-Based Early Stopping
- Hardwired-Neurons Language Processing Units as General-Purpose Cognitive Substrates
- Succeed or Learn Slowly: Sample Efficient Off-Policy Reinforcement Learning for Mobile App Control
- Improving Large Vision and Language Models by Learning from a Panel of Peers
- Kwai Keye-VL 1.5 Technical Report
- CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
- The Fools are Certain; the Wise are Doubtful: Exploring LLM Confidence in Code Completion
- Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions
- Text Takes Over: A Study of Modality Bias in Multimodal Intent Detection
- IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra
- LLMs cannot spot math errors, even when allowed to peek into the solution
- FantasyHSI: Video-Generation-Centric 4D Human Synthesis In Any Scene through A Graph-based Multi-Agent Framework
- LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving
- DaMoC: Efficiently Selecting the Optimal Large Language Model for Fine-tuning Domain Tasks Based on Data and Model Compression
- Do Video Language Models Really Know Where to Look? Diagnosing Attention Failures in Video Language Models
- Zero-shot Cross-lingual NER via Mitigating Language Difference: An Entity-aligned Translation Perspective
- REFINESTAT: Efficient Exploration for Probabilistic Program Synthesis
- Bridging Thoughts and Words: Graph-Based Intent-Semantic Joint Learning for Fake News Detection
- CEQuest: Benchmarking Large Language Models for Construction Estimation
- Congestion Control System Optimization with Large Language Models
- A Privacy-Preserving Recommender for Filling Web Forms Using a Local Large Language Model
- When LLM Meets Time Series: Can LLMs Perform Multi-Step Time Series Reasoning and Inference
- Efficient Large Language Models with Zero-Shot Adjustable Acceleration
- Can Large Language Models Master Complex Card Games?
- MEPT: Mixture of Expert Prompt Tuning as a Manifold Mapper
- TableZoomer: A Collaborative Agent Framework for Large-scale Table Question Answering
- Exploring and Mitigating Fawning Hallucinations in Large Language Models
- The Good, the Bad and the Constructive: Automatically Measuring Peer Review's Utility for Authors
- Prompt the Unseen: Evaluating Visual-Language Alignment Beyond Supervision
- Text Reinforcement for Multimodal Time Series Forecasting
- LegalChainReasoner: A Legal Chain-guided Framework for Criminal Judicial Opinion Generation
- PREE: Towards Harmless and Adaptive Fingerprint Editing in Large Language Models via Knowledge Prefix Enhancement
- If We May De-Presuppose: Robustly Verifying Claims through Presupposition-Free Question Decomposition
- ConceptGuard: Neuro-Symbolic Safety Guardrails via Sparse Interpretable Jailbreak Concepts
- ResearchQA: Evaluating Scholarly Question Answering at Scale Across 75 Fields with Survey-Mined Questions and Rubrics
- Universal Properties of Activation Sparsity in Modern Large Language Models
- Metis: Training LLMs with FP4 Quantization
- Backdoor Samples Detection Based on Perturbation Discrepancy Consistency in Pre-trained Language Models
- GraphKV: Breaking the Static Selection Paradigm with Graph-Based KV Cache Eviction
- LLM-Driven Policy Diffusion: Enhancing Generalization in Offline Reinforcement Learning
- SHERPA: A Model-Driven Framework for Large Language Model Execution
- Standard vs. Modular Sampling: Best Practices for Reliable LLM Unlearning
- DriveQA: Passing the Driving Knowledge Test
- PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains
- EPIC: Generative AI Platform for Accelerating HPC Operational Data Analytics
- Odyssey: Adaptive Policy Selection for Resilient Distributed Training
- Evaluating Recabilities of Foundation Models: A Multi-Domain, Multi-Dataset Benchmark
- COCORELI: Cooperative, Compositional Reconstitution & Execution of Language Instructions
- Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
- Stairway to Fairness: Connecting Group and Individual Fairness
- PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
- PickleBall: Secure Deserialization of Pickle-based Machine Learning Models (Extended Report)
- Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
- BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning
- Rethinking Layer-wise Model Merging through Chain of Merges
- Emotionally-Aware Agents for Dispute Resolution
- ChainReaction: Causal Chain-Guided Reasoning for Modular and Explainable Causal-Why Video Question Answering
- ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents
- Text-Driven 3D Hand Motion Generation from Sign Language Data
- How Can Input Reformulation Improve Tool Usage Accuracy in a Complex Dynamic Environment? A Study on τ-bench
- MSRS: Evaluating Multi-Source Retrieval-Augmented Generation
- Looking Beyond the Obvious: A Survey on Abstract Concept Recognition for Video Understanding
- Specializing General-purpose LLM Embeddings for Implicit Hate Speech Detection across Datasets
- ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety
- CAPE: Context-Aware Personality Evaluation Framework for Large Language Models
- End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning
- CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification
- Research Challenges in Relational Database Management Systems for LLM Queries
- GDS Agent for Graph Algorithmic Reasoning
- SciTopic: Enhancing Topic Discovery in Scientific Literature through Advanced LLM
- GUARD: Glocal Uncertainty-Aware Robust Decoding for Effective and Efficient Open-Ended Text Generation
- SUMMA: A Multimodal Large Language Model for Advertisement Summarization
- SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models
- OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
- AraHealthQA 2025: The First Shared Task on Arabic Health Question Answering
- IntentionReasoner: Facilitating Adaptive LLM Safeguards through Intent Reasoning and Selective Query Refinement
- ReSURE: Regularizing Supervision Unreliability for Multi-turn Dialogue Fine-tuning
- Pruning Weights but Not Truth: Safeguarding Truthfulness While Pruning LLMs
- Assessing the Geolocation Capabilities, Limitations and Societal Risks of Generative Vision-Language Models
- SoK: Large Language Model Copyright Auditing via Fingerprinting
- Ontology-Based Concept Distillation for Radiology Report Retrieval and Labeling
- T2R-bench: A Benchmark for Generating Article-Level Reports from Real World Industrial Tables
- Bootstrapping Learned Cost Models with Synthetic SQL Queries
- Spotlight Attention: Towards Efficient LLM Generation via Non-linear Hashing-based KV Cache Retrieval
- Charting the Future of Scholarly Knowledge with AI: A Community Perspective
- Continuously Steering LLMs Sensitivity to Contextual Knowledge with Proxy Models
- An Effective Strategy for Modeling Score Ordinality and Non-uniform Intervals in Automated Speaking Assessment
- ArgCMV: An Argument Summarization Benchmark for the LLM-era
- IsoSched: Preemptive Tile Cascaded Scheduling of Multi-DNN via Subgraph Isomorphism
- Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models
- Emotion Transfer with Enhanced Prototype for Unseen Emotion Recognition in Conversation
- Alignment with Fill-In-the-Middle for Enhancing Code Generation
- LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind
- ELIXIR: Efficient and LIghtweight model for eXplaIning Recommendations
- Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization
- DeepThink3D: Enhancing Large Language Models with Programmatic Reasoning in Complex 3D Situated Reasoning Tasks
- SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking
- How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
- Inference Gap in Domain Expertise and Machine Intelligence in Named Entity Recognition: Creation of and Insights from a Substance Use-related Dataset
- Fine-Tuning Vision-Language Models for Neutrino Event Analysis in High-Energy Physics Experiments
- LongReasonArena: A Long Reasoning Benchmark for Large Language Models
- Autoregressive Universal Video Segmentation Model
- Demystifying Scientific Problem-Solving in LLMs by Probing Knowledge and Reasoning
- Beyond Memorization: Reasoning-Driven Synthesis as a Mitigation Strategy Against Benchmark Contamination
- SoccerNet 2025 Challenges Results
- APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration
- Enhancing Model Privacy in Federated Learning with Random Masking and Quantization
- Test-time Corpus Feedback: From Retrieval to RAG
- HAEPO: History-Aggregated Exploratory Policy Optimization
- Chronological Passage Assembling in RAG framework for Temporal Question Answering
- Harnessing Rule-Based Reinforcement Learning for Enhanced Grammatical Error Correction
- Dynamic Collaboration of Multi-Language Models based on Minimal Complete Semantic Units
- Rethinking Caching for LLM Serving Systems: Beyond Traditional Heuristics
- Beyond Tokens: Enhancing RTL Quality Estimation via Structural Graph Learning
- Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks
- UniC-RAG: Universal Knowledge Corruption Attacks to Retrieval-Augmented Generation
- History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL
- DrugReasoner: Interpretable Drug Approval Prediction with a Reasoning-augmented Language Model
- ConfTuner: Training Large Language Models to Express Their Confidence Verbally
- Principled Detection of Hallucinations in Large Language Models via Multiple Testing
- LLM-Driven Intrinsic Motivation for Sparse Reward Reinforcement Learning
- Latent Self-Consistency for Reliable Majority-Set Selection in Short- and Long-Answer Reasoning
- Integral Transformer: Denoising Attention, Not Too Much Not Too Little
- REALM: Recursive Relevance Modeling for LLM-based Document Re-Ranking
- Training Language Model Agents to Find Vulnerabilities with CTF-Dojo
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- Demographic Biases and Gaps in the Perception of Sexism in Large Language Models
- FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel
- Better Language Model-Based Judging Reward Modeling through Scaling Comprehension Boundaries
- SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models
- DiscussLLM: Teaching Large Language Models When to Speak
- Named Entity Recognition of Historical Text via Large Language Model
- Stand on The Shoulders of Giants: Building JailExpert from Previous Attack Experience
- SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
- An Empirical Study on How Video-LLMs Answer Video Questions
- Select to Know: An Internal-External Knowledge Self-Selection Framework for Domain-Specific Question Answering
- Mitigating Hallucinations in LM-Based TTS Models via Distribution Alignment Using GFlowNets
- Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset
- Mapping the Course for Prompt-based Structured Prediction
- LongRecall: A Structured Approach for Robust Recall Evaluation in Long-Form Text
- Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs
- Compute-Optimal Scaling for Value-Based Deep RL
- Universal and Transferable Adversarial Attack on Large Language Models Using Exponentiated Gradient Descent
- GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models
- Evaluating Multilingual and Code-Switched Alignment in LLMs via Synthetic Natural Language Inference
- Understanding Data Influence with Differential Approximation
- DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization
- MedCoT-RAG: Causal Chain-of-Thought RAG for Medical Question Answering
- Organ-Agents: Virtual Human Physiology Simulator via LLMs
- ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
- Virtual Community: An Open World for Humans, Robots, and Society
- CyPortQA: Benchmarking Multimodal Large Language Models for Cyclone Preparedness in Port Operation
- GRILE: A Benchmark for Grammar Reasoning and Explanation in Romanian LLMs
- Coarse-to-Fine Personalized LLM Impressions for Streamlined Radiology Reports
- Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models
- Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization
- Prompt Orchestration Markup Language
- InPars+: Supercharging Synthetic Data Generation for Information Retrieval Systems
- CARE: Contextual Adaptation of Recommenders for LLM-based Conversational Recommendation
- TracSum: A New Benchmark for Aspect-Based Summarization with Sentence-Level Traceability in Medical Domain
- Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration
- Expertise-aware Multi-LLM Recruitment and Collaboration for Medical Decision-Making
- Input-Time Scaling
- Toward Better EHR Reasoning in LLMs: Reinforcement Learning with Expert Attention Guidance
- ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs
- LM Agents May Fail to Act on Their Own Risk Knowledge
- COCO: Cognitive Operating System with Continuous Oversight for Multi-Agent Workflow Reliability
- ALIGN: Word Association Learning for Cultural Alignment in Large Language Models
- Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR
- NovoMolGen: Rethinking Molecular Language Model Pretraining
- GLASS: Global-Local Aggregation for Inference-time Sparsification of LLMs
- Stands to Reason: Investigating the Effect of Reasoning on Idiomaticity Detection
- DAIQ: Auditing Demographic Attribute Inference from Question in LLMs
- AI Agents for Photonic Integrated Circuit Design Automation
- DocHPLT: A Massively Multilingual Document-Level Translation Dataset
- PC-Sampler: Position-Aware Calibration of Decoding Bias in Masked Diffusion Models
- REACH: Reinforcement Learning for Efficient Allocation in Community and Heterogeneous Networks
- Involuntary Jailbreak: On Self-Prompting Attacks
- LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
- Breaking Language Barriers: Equitable Performance in Multilingual Language Models
- Score-informed Neural Operator for Enhancing Ordering-based Causal Discovery
- CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features
- FedSODA: Federated Fine-tuning of LLMs via Similarity Group Pruning and Orchestrated Distillation Alignment
- DESIGNER: Design-Logic-Guided Multidisciplinary Data Synthesis for LLM Reasoning
- Bridging Human and LLM Judgments: Understanding and Narrowing the Gap
- Signal and Noise: A Framework for Reducing Uncertainty in Language Model Evaluation
- Can Large Models Teach Student Models to Solve Mathematical Problems Like Human Beings? A Reasoning Distillation Method via Multi-LoRA Interaction
- EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding
- MIRAGE: Towards AI-Generated Image Detection in the Wild
- Wisdom of the Crowd: Reinforcement Learning from Coevolutionary Collective Feedback
- MAD: A Benchmark for Multi-Turn Audio Dialogue Fact-Checking
- Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position
- Standardization of Neuromuscular Reflex Analysis -- Role of Fine-Tuned Vision-Language Model Consortium and OpenAI gpt-oss Reasoning LLM Enabled Decision Support System
- ZigzagAttention: Efficient Long-Context Inference with Exclusive Retrieval and Streaming Heads
- LLM-as-a-Judge for Privacy Evaluation? Exploring the Alignment of Human and LLM Perceptions of Privacy in Textual Data
- User-Assistant Bias in LLMs
- Mitigating Jailbreaks with Intent-Aware LLMs
- AgentCDM: Enhancing Multi-Agent Collaborative Decision-Making via ACH-Inspired Structured Reasoning
- Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings
- CHBench: A Cognitive Hierarchy Benchmark for Evaluating Strategic Reasoning Capability of LLMs
- Mind the Generation Process: Fine-Grained Confidence Estimation During LLM Generation
- Controlling Multimodal LLMs via Reward-guided Decoding
- On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
- Defects4Log: Benchmarking LLMs for Logging Code Defect Detection and Reasoning
- Retrieval-augmented reasoning with lean language models
- Feedback Indicators: The Alignment between Llama and a Teacher in Language Learning
- ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal
- Dynamic Quality-Latency Aware Routing for LLM Inference in Wireless Edge-Device Networks
- FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation
- Hard Examples Are All You Need: Maximizing GRPO Post-Training Under Annotation Budgets
- MobQA: A Benchmark Dataset for Semantic Understanding of Human Mobility Data through Question Answering
- From Feedback to Failure: Automated Android Performance Issue Reproduction
- ADMIRE-BayesOpt: Accelerated Data MIxture RE-weighting for Language Models with Bayesian Optimization
- Tailoring Diagnostic Modeling to Individual Learners: Personalized Distractor Generation via MCTS-Guided Reasoning Reconstruction
- Speciesism in AI: Evaluating Discrimination Against Animals in Large Language Models
- Improving Text Style Transfer using Masked Diffusion Language Models with Inference-time Scaling
- BeyondWeb: Lessons from Scaling Synthetic Data for Trillion-scale Pretraining
- ChatENV: An Interactive Vision-Language Model for Sensor-Guided Environmental Monitoring and Scenario Simulation
- FuXi-β: Towards a Lightweight and Fast Large-Scale Generative Recommendation Model
- MSRS: Adaptive Multi-Subspace Representation Steering for Attribute Alignment in Large Language Models
- Towards Agentic AI for Multimodal-Guided Video Object Segmentation
- Bridging Solidity Evolution Gaps: An LLM-Enhanced Approach for Smart Contract Compilation Error Resolution
- Reverse Physician-AI Relationship: Full-process Clinical Diagnosis Driven by a Large Language Model
- XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization
- Improving Generative Cross-lingual Aspect-Based Sentiment Analysis with Constrained Decoding
- Advancing Cross-lingual Aspect-Based Sentiment Analysis with LLMs and Constrained Decoding for Sequence-to-Sequence Models
- Yet another algorithmic bias: A Discursive Analysis of Large Language Models Reinforcing Dominant Discourses on Gender and Race
- A learning-driven automatic planning framework for proton PBS treatments of H&N cancers
- Meta-Metrics and Best Practices for System-Level Inference Performance Benchmarking
- Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization
- Bridging Modality Gaps in e-Commerce Products via Vision-Language Alignment
- Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models
- VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
- A Comprehensive Evaluation framework of Alignment Techniques for LLMs
- Exploring the Potential of Large Language Models in Fine-Grained Review Comment Classification
- Physical Autoregressive Model for Robotic Manipulation without Action Pretraining
- Can LLM-Generated Textual Explanations Enhance Model Classification Performance? An Empirical Study
- Transforming Questions and Documents for Semantically Aligned Retrieval-Augmented Generation
- Preacher: Paper-to-Video Agentic System
- AINL-Eval 2025 Shared Task: Detection of AI-Generated Scientific Abstracts in Russian
- Towards Self-cognitive Exploration: Metacognitive Knowledge Graph Retrieval Augmented Generation
- Edge General Intelligence Through World Models and Agentic AI: Fundamentals, Solutions, and Challenges
- TFRank: Think-Free Reasoning Enables Practical Pointwise LLM Ranking
- LACA: Improving Cross-lingual Aspect-Based Sentiment Analysis with LLM Data Augmentation
- Verify Distributed Deep Learning Model Implementation Refinement with Iterative Relation Inference
- EGGS-PTP: An Expander-Graph Guided Structured Post-training Pruning Method for Large Language Models
- Shadow in the Cache: Unveiling and Mitigating Privacy Risks of KV-cache in LLM Inference
- ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning
- Flow-SLM: Joint Learning of Linguistic and Acoustic Information for Spoken Language Modeling
- LLM Empowered Prototype Learning for Zero and Few-Shot Tasks on Tabular Data
- SinLlama -- A Large Language Model for Sinhala
- SMA: Who Said That? Auditing Membership Leakage in Semi-Black-box RAG Controlling
- READER: Retrieval-Assisted Drafter for Efficient LLM Inference
- DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling with Large Language Models
- Compass-Thinker-7B Technical Report
- Interpretable Reward Model via Sparse Autoencoder
- First, Do No Harm: AI Supervisor Scaffolds Novice Growth in Counselor Education
- PersRM-R1: Enhance Personalized Reward Modeling with Reinforcement Learning
- M2LLM: Multi-view Molecular Representation Learning with Large Language Models
- Prompt-and-Check: Using Large Language Models to Evaluate Communication Protocol Compliance in Simulation-Based Training
- DepressLLM: Interpretable domain-adapted language model for depression detection from real-world narratives
- DeepFleet: Multi-Agent Foundation Models for Mobile Robots
- Fine-grained Video Dubbing Duration Alignment with Segment Supervised Preference Optimization
- Scaling Learned Image Compression Models up to 1 Billion
- Profiling Large Language Model Inference on Apple Silicon: A Quantization Perspective
- Hallucinations in Code Change to Natural Language Generation: Prevalence and Evaluation of Detection Metrics
- AgriGPT: a Large Language Model Ecosystem for Agriculture
- GRainsaCK: a Comprehensive Software Library for Benchmarking Explanations of Link Prediction Tasks on Knowledge Graphs
- LLM driven Text-to-Table Generation through Sub-Tasks Guidance and Iterative Refinement
- OverFill: Two-Stage Models for Efficient Language Model Decoding
- Mol-R1: Towards Explicit Long-CoT Reasoning in Molecule Discovery
- SAEMark: Multi-bit LLM Watermarking with Inference-Time Scaling
- Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions
- Data-Efficient Biomedical In-Context Learning: A Diversity-Enhanced Submodular Perspective
- \(X\)-evolve: Solution space evolution powered by large language models
- A Data-driven ML Approach for Maximizing Performance in LLM-Adapter Serving
- UniSVG: A Unified Dataset for Vector Graphic Understanding and Generation with Multimodal Large Language Models
- AIS-LLM: A Unified Framework for Maritime Trajectory Prediction, Anomaly Detection, and Collision Risk Assessment with Explainable Forecasting
- Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression
- Commentary Generation for Soccer Highlights
- Optimal Transport Regularization for Speech Text Alignment in Spoken Language Models
- 1-2-3 Check: Enhancing Contextual Privacy in LLM via Multi-Agent Reasoning
- Large Language Models for Subjective Language Understanding: A Survey
- Large Language Models for Czech Aspect-Based Sentiment Analysis
- FEAT: A Multi-Agent Forensic AI System with Domain-Adapted Large Language Model for Automated Cause-of-Death Analysis
- Dual Information Speech Language Models for Emotional Conversations
- Architecting Long-Context LLM Acceleration with Packing-Prefetch Scheduler and Ultra-Large Capacity On-Chip Memories
- Data Selection for LLM Alignment Using Fine-Grained Preferences
- EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning
- Expert Preference-based Evaluation of Automated Related Work Generation
- Tailored Emotional LLM-Supporter: Enhancing Cultural Sensitivity
- Pareto Multi-Objective Alignment for Language Models
- MIMIC: Multimodal Inversion for Model Interpretation and Conceptualization
- Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts
- ObfusQAte: A Proposed Framework to Evaluate LLM Robustness on Obfuscated Factual Question Answering
- Think Before You Talk: Enhancing Meaningful Dialogue Generation in Full-Duplex Speech Language Models with Planning-Inspired Text Guidance
- Lessons Learnt: Revisit Key Training Strategies for Effective Speech Emotion Recognition in the Wild
- Arce: Augmented Roberta with Contextualized Elucidations for Ner in Automated Rule Checking
- HealthBranches: Synthesizing Clinically-Grounded Question Answering Datasets via Decision Pathways
- BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
- Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges
- Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs
- CROP: Integrating Topological and Spatial Structures via Cross-View Prefixes for Molecular LLMs
- BoRA: Towards More Expressive Low-Rank Adaptation with Block Diversity
- SEADialogues: A Multilingual Culturally Grounded Multi-turn Dialogue Dataset on Southeast Asian Languages
- Synthesizing scientific literature with retrieval-augmented language models
- Leveraging LLMs for Smart Cities Qualitative Data Analysis
- Learning the Topic, Not the Language: How LLMs Classify Online Immigration Discourse Across Languages
- Sample-efficient LLM Optimization with Reset Replay
- LLM Unlearning Without an Expert Curated Dataset
- Deep Language Geometry: Constructing a Metric Space from LLM Weights
- LLMCARE: early detection of cognitive impairment via transformer models enhanced by LLM-generated synthetic data
- UR2: Unify RAG and Reasoning through Reinforcement Learning
- When a Paper Has 1000 Authors: Rethinking Citation Metrics in the Era of LLMs
- Efficient Knowledge Probing of Large Language Models by Adapting Pre-trained Embeddings
- Valid Inference with Imperfect Synthetic Data
- Do Biased Models Have Biased Thoughts?
- Automatic Semantic Alignment of Flow Pattern Representations for Exploration with Large Language Models
- Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing
- LLMs for Resource Allocation: A Participatory Budgeting Approach to Inferring Preferences
- AGI for the Earth, the path, possibilities and how to evaluate intelligence of models that work with Earth Observation Data?
- Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge
- FineDialFact: A benchmark for Fine-grained Dialogue Fact Verification
- On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification
- DART: Dual Adaptive Refinement Transfer for Open-Vocabulary Multi-Label Recognition
- LATTE: Learning Aligned Transactions and Textual Embeddings for Bank Clients
- Do Political Opinions Transfer Between Western Languages? An Analysis of Unaligned and Aligned Multilingual LLMs
- LAG: Logic-Augmented Generation from a Cartesian Perspective
- MoMA: A Mixture-of-Multimodal-Agents Architecture for Enhancing Clinical Prediction Modelling
- SONAR-LLM: Autoregressive Transformer that Thinks in Sentence Embeddings and Speaks in Tokens
- CodeBoost: Boosting Code LLMs by Squeezing Knowledge from Code Snippets with RL
- PrinciplismQA: A Philosophy-Grounded Approach to Assessing LLM-Human Clinical Medical Ethics Alignment
- Navigating Through Paper Flood: Advancing LLM-based Paper Evaluation through Domain-Aware Retrieval and Latent Reasoning
- BEE-RAG: Balanced Entropy Engineering for Retrieval-Augmented Generation
- Align, Don't Divide: Revisiting the LoRA Architecture in Multi-Task Learning
- Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?
- Tesserae: Scalable Placement Policies for Deep Learning Workloads
- Towards Robust Evaluation of Visual Activity Recognition: Resolving Verb Ambiguity with Sense Clustering
- iFairy: the First 2-bit Complex LLM with All Parameters in \±1, ± i\
- Adversarial Attacks and Defenses on Graph-aware Large Language Models (LLMs)
- Benchmarking Sociolinguistic Diversity in Swahili NLP: A Taxonomy-Guided Approach
- Provable Post-Training Quantization: Theoretical Analysis of OPTQ and Qronos
- SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
- Open Scene Graphs for Open-World Object-Goal Navigation
- GeRe: Towards Efficient Anti-Forgetting in Continual Learning of LLM via General Samples Replay
- IFDECORATOR: Wrapping Instruction Following Reinforcement Learning with Verifiable Rewards
- P-Aligner: Enabling Pre-Alignment of Language Models via Principled Instruction Synthesis
- Training-Free Multimodal Large Language Model Orchestration
- Do Recommender Systems Really Leverage Multimodal Content? A Comprehensive Analysis on Multimodal Representations for Recommendation
- SVGen: Interpretable Vector Graphics Generation with Large Language Models
- From "Aha Moments" to Controllable Thinking: Toward Meta-Cognitive Reasoning in Large Reasoning Models via Decoupled Reasoning and Control
- Are Large Language Models Dynamic Treatment Planners? An In Silico Study from a Prior Knowledge Injection Angle
- Evaluating, Synthesizing, and Enhancing for Customer Support Conversation
- Forgetting: A New Mechanism Towards Better Large Language Model Fine-tuning
- Fine-tuning for Better Few Shot Prompting: An Empirical Comparison for Short Answer Grading
- AttriLens-Mol: Attribute Guided Reinforcement Learning for Molecular Property Prediction with Large Language Models
- Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
- Efficient Scaling for LLM-based ASR
- LLM4ES: Learning User Embeddings from Event Sequences via Large Language Models
- Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?
- ASTRA: Autonomous Spatial-Temporal Red-teaming for AI Software Assistants
- Majority Bit-Aware Watermarking For Large Language Models
- CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward
- OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset
- VQA support to Arabic Language Learning Educational Tool
- VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations
- When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs
- From Legacy to Standard: LLM-Assisted Transformation of Cybersecurity Playbooks into CACAO Format
- Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models
- Pay What LLM Wants: Can LLM Simulate Economics Experiment with 522 Real-human Persona?
- RooseBERT: A New Deal For Political Language Modelling
- Estimating Worst-Case Frontier Risks of Open-Weight LLMs
- Landsat30-AU: A Vision-Language Dataset for Australian Landsat Imagery
- RegMean++: Enhancing Effectiveness and Generalization of Regression Mean for Model Merging
- ContractEval: Benchmarking LLMs for Clause-Level Legal Risk Identification in Commercial Contracts
- Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning
- Adaptive Command: Real-Time Policy Adjustment via Language Models in StarCraft II
- Beyond Policy Optimization: A Data Curation Flywheel for Sparse-Reward Long-Horizon Planning
- AGENTiGraph: A Multi-Agent Knowledge Graph Framework for Interactive, Domain-Specific LLM Chatbots
- On the Evaluation of Large Language Models in Multilingual Vulnerability Repair
- CTTS: Collective Test-Time Scaling
- MedBLINK: Probing Basic Perception in Multimodal Language Models for Medicine
- PLoRA: Efficient LoRA Hyperparameter Tuning for Large Models
- Can LLMs Generate High-Quality Task-Specific Conversations?
- Seemingly Simple Planning Problems are Computationally Challenging: The Countdown Game
- Semantic Structure in Large Language Model Embeddings
- Defending Against Knowledge Poisoning Attacks During Retrieval-Augmented Generation
- Large Reasoning Models Are Autonomous Jailbreak Agents
- CharBench: Evaluating the Role of Tokenization in Character-Level Tasks
- ReGate: Enabling Power Gating in Neural Processing Units
- Modular Arithmetic: Language Models Solve Math Digit by Digit
- CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
- LaMPE: Length-aware Multi-grained Positional Encoding for Adaptive Long-context Scaling Without Training
- I2CR: Intra- and Inter-modal Collaborative Reflections for Multimodal Entity Linking
- Balancing Information Accuracy and Response Timeliness in Networked LLMs
- VLM4D: Towards Spatiotemporal Awareness in Vision Language Models
- When Truth Is Overridden: Uncovering the Internal Origins of Sycophancy in Large Language Models
- Everyone Contributes! Incentivizing Strategic Cooperation in Multi-LLM Systems via Sequential Public Goods Games
- SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents
- Kron-LoRA: Hybrid Kronecker-LoRA Adapters for Scalable, Sustainable Fine-tuning
- FPEdit: Robust LLM Fingerprinting through Localized Parameter Editing
- CompressKV: Semantic Retrieval Heads Know What Tokens are Not Important Before Generation
- Charting 15 years of progress in deep learning for speech emotion recognition: A replication study
- Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models
- CABENCH: Benchmarking Composable AI for Solving Complex Tasks through Composing Ready-to-Use Models
- Isolating Culture Neurons in Multilingual Large Language Models
- TIBSTC-CoT: A Multi-Domain Instruction Dataset for Chain-of-Thought Reasoning in Language Models
- Alleviating Attention Hacking in Discriminative Reward Modeling through Interaction Distillation
- Large Language Model Guided Decoding for Self-Supervised Speech Recognition
- MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
- Context-Adaptive Multi-Prompt Embedding with Large Language Models for Vision-Language Alignment
- MLP Memory: A Retriever-Pretrained Memory for Large Language Models
- AGENTICT2S:Robust Text-to-SPARQL via Agentic Collaborative Reasoning over Heterogeneous Knowledge Graphs for the Circular Economy
- HateClipSeg: A Segment-Level Annotated Dataset for Fine-Grained Hate Video Detection
- CultureGuard: Towards Culturally-Aware Dataset and Guard Model for Multilingual Safety Applications
- DeepVIS: Bridging Natural Language and Data Visualization Through Step-wise Reasoning
- CUPID: Evaluating Personalized and Contextualized Alignment of LLMs from Interactions
- EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
- LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
- Enhancing Zero-Shot Brain Tumor Subtype Classification via Fine-Grained Patch-Text Alignment
- Am I Blue or Is My Hobby Counting Teardrops? Expression Leakage in Large Language Models as a Symptom of Irrelevancy Disruption
- T-GRAG: A Dynamic GraphRAG Framework for Resolving Temporal Conflicts and Redundancy in Knowledge Retrieval
- ProKG-Dial: Progressive Multi-Turn Dialogue Construction with Domain Knowledge Graphs
- Multi-turn Natural Language to Graph Query Language Translation
- Training Dynamics of the Cooldown Stage in Warmup-Stable-Decay Learning Rate Scheduler
- LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
- Foundation Models for Bioacoustics -- a Comparative Review
- Motif 2.6B Technical Report
- MeshLLM: Empowering Large Language Models to Progressively Understand and Generate 3D Mesh
- CSIRO-LT at SemEval-2025 Task 11: Adapting LLMs for Emotion Recognition for Multiple Languages
- DisTaC: Conditioning Task Vectors via Distillation for Robust Model Merging
- CM3: Calibrating Multimodal Recommendation
- Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data
- The Illusion of Progress: Re-evaluating Hallucination Detection in LLMs
- ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation
- Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
- SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
- DAMR: Efficient and Adaptive Context-Aware Knowledge Graph Question Answering with LLM-Guided MCTS
- LeakSealer: A Semisupervised Defense for LLMs Against Prompt Injection and Leakage Attacks
- Small sample-based adaptive text classification through iterative and contrastive description refinement
- Court of LLMs: Evidence-Augmented Generation via Multi-LLM Collaboration for Text-Attributed Graph Anomaly Detection
- SA-GCS: Semantic-Aware Gaussian Curriculum Scheduling for UAV Vision-Language Navigation
- PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning
- Accurate and Consistent Graph Model Generation from Text with Large Language Models
- Towards Higher Effective Rank in Parameter-efficient Fine-tuning using Khatri--Rao Product
- MELAC: Massive Evaluation of Large Language Models with Alignment of Culture in Persian Language
- ITUNLP at SemEval-2025 Task 8: Question-Answering over Tabular Data: A Zero-Shot Approach using LLM-Driven Code Generation
- Your other Left! Vision-Language Models Fail to Identify Relative Positions in Medical Images
- Llama-3.1-FoundationAI-SecurityLLM-8B-Instruct Technical Report
- NyayaRAG: Realistic Legal Judgment Prediction with RAG under the Indian Common Law System
- Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models
- A Context-Aware Dual-Metric Framework for Confidence Estimation in Large Language Models
- From Individuals to Crowds: Dual-Level Public Response Prediction in Social Media
- ITDR: An Instruction Tuning Dataset for Enhancing Large Language Models in Recommendations
- EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes
- XSpecMesh: Quality-Preserving Auto-Regressive Mesh Generation Acceleration via Multi-Head Speculative Decoding
- CoT-Self-Instruct: Building high-quality synthetic prompts for reasoning and non-reasoning tasks
- Deep Learning-based Prediction of Clinical Trial Enrollment with Uncertainty Estimates
- Self-Foveate: Enhancing Diversity and Difficulty of Synthesized Instructions from Unsupervised Text via Multi-Level Foveation
- Evaluating Contrast Localizer for Identifying Causal Units in Social & Mathematical Tasks in Language Models
- MUST-RAG: MUSical Text Question Answering with Retrieval Augmented Generation
- Fine-Grained Privacy Extraction from Retrieval-Augmented Generation Systems via Knowledge Asymmetry Exploitation
- Is neural semantic parsing good at ellipsis resolution, or isn't it?
- DynaSwarm: Dynamically Graph Structure Selection for LLM-based Multi-agent System
- P-ReMIS: Pragmatic Reasoning in Mental Health and a Social Implication
- On the Risk of Misleading Reports: Diagnosing Textual Biases in Multimodal Clinical AI
- Learning Like Humans: Resource-Efficient Federated Fine-Tuning through Cognitive Developmental Stages
- Distilling Knowledge from Large Language Models: A Concept Bottleneck Model for Hate and Counter Speech Recognition
- KLLM: Fast LLM Inference with K-Means Quantization
- Where to show Demos in Your Prompt: A Positional Bias of In-Context Learning
- The Multi-Agent Fault Localization System Based on Monte Carlo Tree Search Approach
- Quantifying surprise in clinical care: Detecting highly informative events in electronic health records with foundation models
- CUS-QA: Local-Knowledge-Oriented Open-Ended Question Answering Dataset
- GestureHYDRA: Semantic Co-speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation
- GPT-4.1 Sets the Standard in Automated Experiment Design Using Novel Python Libraries
- Multilingual Political Views of Large Language Models: Identification and Steering
- BALSAM: A Platform for Benchmarking Arabic Large Language Models
- Efficient Differentially Private Fine-Tuning of LLMs via Reinforcement Learning
- XAutoLM: Efficient Fine-Tuning of Language Models via Meta-Learning and AutoML
- Towards Simulating Social Influence Dynamics with LLM-based Multi-agents
- Towards Interpretable Renal Health Decline Forecasting via Multi-LMM Collaborative Reasoning Framework
- NeedleChain: Measuring Intact Long-Context Reasoning Capability of Large Language Models
- PersonaTwin: A Multi-Tier Prompt Conditioning Framework for Generating and Evaluating Personalized Digital Twins
- Goal-Based Vision-Language Driving
- Position: Stop Evaluating AI with Human Tests, Develop Principled, AI-specific Tests instead
- A Foundation Model for Material Fracture Prediction
- Argumentatively Coherent Judgmental Forecasting
- Strategic Deflection: Defending LLMs from Logit Manipulation
- TRIBE: TRImodal Brain Encoder for whole-brain fMRI response prediction
- RL from Teacher-Model Refinement: Gradual Imitation Learning for Machine Translation
- X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again
- Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security
- Rote Learning Considered Useful: Generalizing over Memorized Data in LLMs
Related