Llama 2: Open Foundation and Fine-Tuned Chat Models
2023/07/18 by Hugo Touvron, Louis Martin, Touvron, Hugo +133 · 1306 citations
Computer Science · #Topic Modeling #Natural Language Processing Techniques #Speech and dialogue systems
paper · pdf · doi:10.48550/arxiv.2307.09288
Abstract
In this work, we develop and release Llama 2, a collection of pretrained and fine-tuned large language models (LLMs) ranging in scale from 7 billion to 70 billion parameters. Our fine-tuned LLMs, called Llama 2-Chat, are optimized for dialogue use cases. Our models outperform open-source chat models on most benchmarks we tested, and based on our human evaluations for helpfulness and safety, may be a suitable substitute for closed-source models. We provide a detailed description of our approach to fine-tuning and safety improvements of Llama 2-Chat in order to enable the community to build on our work and contribute to the responsible development of LLMs.
Cited by
- DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding
- PIVOT: Efficient Query-Group Indexing for Token-Level Sparse Attention
- Instruction-Following Evaluation of Large Vision-Language Models
- Scoring, Reasoning, and Selecting the Best! Ensembling Large Language Models via a Peer-Review Process
- Reservoir Computing inspired Matrix Multiplication-free Language Model
- Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
- Merge before Forget: A Single LoRA Continual Learning via Continual Merging
- Towards Understanding Steering Strength
- Eliciting Behaviors in Multi-Turn Conversations
- HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery
- EmoCtrl: Controllable Emotional Image Content Generation
- Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
- Learning from Negative Examples: Why Warning-Framed Training Data Teaches What It Warns Against
- Calibrating LLM Judges: Linear Probes for Fast and Reliable Uncertainty Estimation
- On the Existence and Behavior of Secondary Attention Sinks
- Open-Source Multimodal Moxin Models with Moxin-VLM and Moxin-VLA
- Latent-LoRA: Compact Latent-Space Adapters with Gradient-Free Routing for Continual Learning
- TriShieldRAG: A Three-Ring Defense-in-Depth Framework Against Knowledge Corruption in Retrieval-Augmented Generation
- Scale Weight Decay and Train Better
- DeepFaith: Evidence-Grounded LLMs for Faithful Incident Reporting in Multi-Stage APT Defense
- D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models
- Every Time I Hire a Linguist, Inference Costs Go Down: On Linguistic Rules as Effective Prompt Compressors
- MixQuant: Adaptive Mixed-Precision Quantization for Large Language Models
- Unifying Learning Dynamics and Generalization in Transformers Scaling Law
- Evaluating large language models for diagnostic reasoning from unstructured clinical narratives in epilepsy
- When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models
- SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems
- SkipOPU: An FPGA-based Overlay Processor for Large Language Models with Dynamically Allocated Computation
- RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
- Compressing LLMs with MoP: Mixture of Pruners
- Responsible Intelligence in Practice: A Fairness Audit of Open Large Language Models for Library Reference Services
- PixelGen: Improving Pixel Diffusion with Perceptual Supervision
- Training-Free Adaptation of New-Generation LLMs using Legacy Clinical Models
- Explainability Methods for Hardware Trojan Detection: A Systematic Comparison
- PINA: Prompt Injection Attack Against Navigation Agents
- DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation
- Fast Inference of Visual Autoregressive Model with Adjacency-Adaptive Dynamical Draft Trees
- A Comedy of Estimators: On KL Regularization in RL Training of LLMs
- Rethinking Output Alignment For 1-bit Post-Training Quantization of Large Language Models
- Gamayun's Path to Multilingual Mastery: Cost-Efficient Training of a 1.5B-Parameter LLM
- Parallel Token Prediction for Language Models
- Casting a SPELL: Sentence Pairing Exploration for LLM Limitation-breaking
- ORCA: Object Recognition and Comprehension for Archiving Marine Species
- SPOT!: Map-Guided LLM Agent for Unsupervised Multi-CCTV Dynamic Object Tracking
- ALIVE: An Avatar-Lecture Interactive Video Engine with Content-Aware Retrieval for Real-Time Interaction
- Generative Digital Twins: Vision-Language Simulation Models for Executable Industrial Systems
- Beyond Language Boundaries: Uncovering Programming Language Families for Code Language Models
- Activations as Features: Probing LLMs for Generalizable Essay Scoring Representations
- HATS: High-Accuracy Triple-Set Watermarking for Large Language Models
- ReasonCD: A Multimodal Reasoning Large Model for Implicit Change-of-Interest Semantic Mining
- The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability
- MAGIC: Achieving Superior Model Merging via Magnitude Calibration
- Learning Hierarchical Procedural Memory for LLM Agents through Bayesian Selection and Contrastive Refinement
- Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
- MoE Pathfinder: Trajectory-driven Expert Pruning
- DACE For Railway Acronym Disambiguation
- Towards Benchmarking Privacy Vulnerabilities in Selective Forgetting with Large Language Models
- When the Gold Standard Isn't Necessarily Standard: Challenges of Evaluating the Translation of User-Generated Content
- Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors
- Incorporating Error Level Noise Embedding for Improving LLM-Assisted Robustness in Persian Speech Recognition
- Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers
- UniRel: Relation-Centric Knowledge Graph Question Answering with RL-Tuned LLM Reasoning
- 4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
- Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
- AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning
- Toward Systematic Counterfactual Fairness Evaluation of Large Language Models: The CAFFE Framework
- Efficient CPU-GPU Collaborative Inference for MoE-based LLMs on Memory-Limited Systems
- Collaborative Edge-to-Server Inference for Vision-Language Models
- Design and Evaluation of Cost-Aware PoQ for Decentralized LLM Inference
- Fast Collaborative Inference via Distributed Speculative Decoding
- LoPA: Scaling dLLM Inference via Lookahead Parallel Decoding
- Mitigating Hallucinations in Healthcare LLMs with Granular Fact-Checking and Domain-Specific Adaptation
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
- Spoken DialogSum: An Emotion-Rich Conversational Dataset for Spoken Dialogue Summarization
- LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
- Beyond Fast and Slow: Cognitive-Inspired Elastic Reasoning for Large Language Models
- An Exploratory Study of Bayesian Prompt Optimization for Test-Driven Code Generation with Large Language Models
- PADE: A Predictor-Free Sparse Attention Accelerator via Unified Execution and Stage Fusion
- TEMP: A Memory Efficient Physical-aware Tensor Partition-Mapping Framework on Wafer-scale Chips
- Georeferencing complex relative locality descriptions with large language models
- Neurosymbolic Inference On Foundation Models For Remote Sensing Text-to-image Retrieval With Complex Queries
- OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value
- Polypersona: Persona-Grounded LLM for Synthetic Survey Responses
- Autonomous Construction-Site Safety Inspection Using Mobile Robots: A Multilayer VLM-LLM Pipeline
- Counting Clues: A Lightweight Probabilistic Baseline Can Match an LLM
- Understanding Structured Financial Data with LLMs: A Case Study on Fraud Detection
- SliceMoE: Bit-Sliced Expert Caching under Miss-Rate Constraints for Efficient MoE Inference
- FlashFuser: Expanding the Scale of Kernel Fusion for Compute-Intensive Operators via Inter-Core Connection
- CTIGuardian: A Few-Shot Framework for Mitigating Privacy Leakage in Fine-Tuned LLMs
- SkipCat: Rank-Maximized Low-Rank Compression of Large Language Models via Shared Projection and Block Skipping
- Informing Acquisition Functions via Foundation Models for Molecular Discovery
- Curió-Edu 7B: Examining Data Selection Impacts in LLM Continued Pretraining
- Leader-driven or Leaderless: How Participation Structure Sustains Engagement and Shapes Narratives in Online Hate Communities
- WATOS: Efficient LLM Training Strategies and Architecture Co-exploration for Wafer-scale Chip
- Rethinking Label Consistency of In-Context Learning: An Implicit Transductive Label Propagation Perspective
- Multi-Intent Spoken Language Understanding: Methods, Trends, and Challenges
- An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges
- qa-FLoRA: Data-free query-adaptive Fusion of LoRAs for LLMs
- VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
- MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
- Stronger Normalization-Free Transformers
- Unlocking the Address Book: Dissecting the Sparse Semantic Structure of LLM Key-Value Caches via Sparse Autoencoders
- Openpi Comet: Competition Solution For 2025 BEHAVIOR Challenge
- Design Space Exploration of DMA based Finer-Grain Compute Communication Overlap
- XDoGE: Multilingual Data Reweighting to Enhance Language Inclusivity in LLMs
- GLaD: Geometric Latent Distillation for Vision-Language-Action Models
- Investigate the Low-level Visual Perception in Vision-Language based Image Quality Assessment
- Building Reasonable Inference for Vision-Language Models in Blind Image Quality Assessment
- Chasing Shadows: Pitfalls in LLM Security Research
- WarmServe: Enabling One-for-Many GPU Prewarming for Multi-LLM Serving
- MindShift: Analyzing Language Models' Reactions to Psychological Prompts
- Detecting Hallucinations in Graph Retrieval-Augmented Generation via Attention Patterns and Semantic Alignment
- Fed-SE: Federated Self-Evolution for Privacy-Constrained Multi-Environment LLM Agents
- Automatic Essay Scoring and Feedback Generation in Basque Language Learning
- Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancement
- Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs
- MolSculpt: Sculpting 3D Molecular Geometries from Chemical Syntax
- DermETAS-SNA LLM: A Dermatology Focused Evolutionary Transformer Architecture Search with StackNet Augmented LLM Assistant
- CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
- ValuePilot: A Two-Phase Framework for Value-Driven Decision-Making
- TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
- Training-Free Vector Quantization via Gaussian VAEs
- Persian-Phi: Efficient Cross-Lingual Adaptation of Compact LLMs via Curriculum Learning
- LUNE: Efficient LLM Unlearning via LoRA Fine-Tuning with Negative Examples
- Materium: An Autoregressive Approach for Material Generation
- See Once, Then Act: Vision-Language-Action Model with Task Learning from One-Shot Video Demonstrations
- ThinkTrap: Denial-of-Service Attacks against Black-box LLM Services via Infinite Thinking
- FOAM: Blocked State Folding for Memory-Efficient LLM Training
- Leveraging KV Similarity for Online Structured Pruning in LLMs
- Dual Refinement Cycle Learning: Unsupervised Text Classification of Mamba and Community Detection on Text Attributed Graph
- Large Language Model-Based Generation of Discharge Summaries
- Optimizing LLMs Using Quantization for Mobile Execution
- BitStopper: An Efficient Transformer Attention Accelerator via Stage-fusion and Early Termination
- Efficient Text Classification with Conformal In-Context Learning
- WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving
- KQ-SVD: Compressing the KV Cache with Provable Guarantees on Attention Fidelity
- Optimizing Medical Question-Answering Systems: A Comparative Study of Fine-Tuned and Zero-Shot Large Language Models with RAG Framework
- Scaling and Transferability of Annealing Strategies in Large Language Model Training
- HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- The Road of Adaptive AI for Precision in Cybersecurity
- HiPPO: Exploring A Novel Hierarchical Pronunciation Assessment Approach for Spoken Languages
- GeoPE:A Unified Geometric Positional Embedding for Structured Tensors
- STELLA: Guiding Large Language Models for Time Series Forecasting with Semantic Abstractions
- Qwen3.5-Omni Technical Report
- Group Selection as a Safeguard Against AI Substitution
- SignRoundV2: Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs
- LeMat-GenBench: A Unified Evaluation Framework for Crystal Generative Models
- MSME: A Multi-Stage Multi-Expert Framework for Zero-Shot Stance Detection
- Vision-Language-Action Models for Selective Robotic Disassembly: A Case Study on Critical Component Extraction from Desktops
- Towards better dense rewards in Reinforcement Learning Applications
- D-STEER - Preference Alignment Techniques Learn to Behave, not to Believe -- Beneath the Surface, DPO as Steering Vector Perturbation in Activation Space
- Teaching Old Tokenizers New Words: Efficient Tokenizer Adaptation for Pre-trained Models
- Enhancing Instruction-Following Capabilities in Seq2Seq Models: DoLA Adaptations for T5
- LSRS: Latent Scale Rejection Sampling for Visual Autoregressive Modeling
- PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention
- Context-Aware Hierarchical Learning: A Two-Step Paradigm towards Safer LLMs
- KVNAND: Efficient On-Device Large Language Model Inference Using DRAM-Free In-Flash Computing
- Exploring the Potential and Limitations of Large Language Models for Novice Program Fault Localization
- Large Language Models as Generalist Policies for Network Optimization
- UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
- MarkTune: Improving the Quality-Detectability Trade-off in Open-Weight LLM Watermarking
- GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes
- Fairy2i: Training Complex LLMs from Real LLMs with All Parameters in \± 1, ± i\
- Cross-Lingual Prompt Steerability: Towards Accurate and Robust LLM Behavior across Languages
- ESACT: An End-to-End Sparse Accelerator for Compute-Intensive Transformers via Local Similarity
- Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding
- VACoT: Rethinking Visual Data Augmentation with VLMs
- Parameter-Efficient Subspace Optimization for LLM Fine-Tuning
- Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
- Ensemble Privacy Defense for Knowledge-Intensive LLMs against Membership Inference Attacks
- Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models
- Med-VCD: Mitigating Hallucination for Medical Large Vision Language Models through Visual Contrastive Decoding
- Edge Deployment of Small Language Models, a comprehensive comparison of CPU, GPU and NPU backends
- DiG-Flow: Discrepancy-Guided Flow Matching for Robust VLA Models
- RoMe: Row Granularity Access Memory System for Large Language Models
- Securing Large Language Models (LLMs) from Prompt Injection Attacks
- KVReviver: Reversible KV Cache Compression with Sketch-Based Token Reconstruction
- Stay Unique, Stay Efficient: Preserving Model Personality in Multi-Task Merging
- Table as a Modality for Large Language Models
- AFRAgent : An Adaptive Feature Renormalization Based High Resolution Aware GUI agent
- Elastic Mixture of Rank-Wise Experts for Knowledge Reuse in Federated Fine-Tuning
- Hybrid-DMKG: A Hybrid Reasoning Framework over Dynamic Multimodal Knowledge Graphs for Multimodal Multihop QA with Knowledge Editing
- Clinical-R1: Empowering Large Language Models for Faithful and Comprehensive Reasoning with Clinical Objective Relative Policy Optimization
- WaterSearch: A Quality-Aware Search-based Watermarking Framework for Large Language Models
- UMM-RM: An Upcycle-and-Merge MoE Reward Model for Mitigating Reward Hacking
- SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs
- Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation
- Financial Text Classification Based On rLoRA Finetuning On Qwen3-8B model
- ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning
- DialBench: Towards Accurate Reading Recognition of Pointer Meter using Large Foundation Models
- Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
- TWEO: Transformers Without Extreme Outliers Enables FP8 Training And Quantization For Dummies
- SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
- Efficient Asynchronous Federated Evaluation with Strategy Similarity Awareness for Intent-Based Networking in Industrial Internet of Things
- Platinum: Path-Adaptable LUT-Based Accelerator Tailored for Low-Bit Weight Matrix Multiplication
- The Immutable Tensor Architecture: A Pure Dataflow Approach for Secure, Energy-Efficient AI Inference
- JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization
- Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models
- UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes
- Closed-Loop Transformers: Autoregressive Modeling as Iterative Latent Equilibrium
- Invisible Hands: Gray-Box Bit Flip Attack for Steering LLMs Without Knowledge of Gradients, Data, and Weights
- CacheTrap: Injecting Trojans in LLMs without Leaving any Traces in Inputs or Weights
- Generative models for crystalline materials
- Enhancing Trustworthiness with Mixed Precision: Benchmarks, Opportunities, and Challenges
- DSD: A Distributed Speculative Decoding Solution for Edge-Cloud Agile Large Model Serving
- Flowing Backwards: Improving Normalizing Flows via Reverse Representation Alignment
- SingleQuant: Efficient Quantization of Large Language Models in a Single Pass
- Swarms of Large Language Model Agents for Protein Sequence Design with Experimental Validation
- Co-Evolving Agents: Learning from Failures as Hard Negatives
- Attention-Guided Patch-Wise Sparse Adversarial Attacks on Vision-Language-Action Models
- E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Continuized Discrete Diffusion
- Bootstrapping LLMs via Preference-Based Policy Optimization
- ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning
- DOPD: A Dynamic PD-Disaggregation Architecture for Maximizing Goodput in LLM Inference Serving
- Graph-O1 : Monte Carlo Tree Search with Reinforcement Learning for Text-Attributed Graph Reasoning
- LAPA: Log-Domain Prediction-Driven Dynamic Sparsity Accelerator for Transformer Model
- Generating Querying Code from Text for Multi-Modal Electronic Health Record
- DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs
- MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models
- Copyright Detection in Large Language Models: An Ethical Approach to Generative AI Development
- The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment
- DesignPref: Capturing Personal Preferences in Visual Design Generation
- Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts
- Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios
- REFLEX: Self-Refining Explainable Fact-Checking via Disentangling Truth into Style and Substance
- Vision-Language Models for Automated 3D PET/CT Report Generation
- Cross-Contrastive Clustering for Multimodal Attributed Graphs with Dual Graph Filtering
- Boosting Reasoning in Large Multimodal Models via Activation Replay
- EfficientXpert: Efficient Domain Adaptation for Large Language Models via Propagation-Aware Pruning
- It Hears, It Sees too: Multi-Modal LLM for Depression Detection By Integrating Visual Understanding into Audio Language Models
- A Systematic Analysis of Large Language Models with RAG-enabled Dynamic Prompting for Medical Error Detection and Correction
- The Curious Case of Analogies: Investigating Analogical Reasoning in Large Language Models
- DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
- LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models
- ABM-LoRA: Activation Boundary Matching for Fast Convergence in Low-Rank Adaptation
- FastForward Pruning: Efficient LLM Pruning via Single-Step Reinforcement Learning
- AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
- BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
- Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models
- CoreEval: Automatically Building Contamination-Resilient Datasets with Real-World Knowledge toward Reliable LLM Evaluation
- Low-Rank GEMM: Efficient Matrix Multiplication via Low-Rank Approximation with FP8 Acceleration
- Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
- An Invariant Latent Space Perspective on Language Model Inversion
- TASO: Jailbreak LLMs via Alternative Template and Suffix Optimization
- Foundations of Artificial Intelligence Frameworks: Notion and Limits of AGI
- ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering
- ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization
- Vector Arithmetic in Concept and Token Subspaces
- Consolidating Diffusion-Generated Video Detection with Unified Multimodal Forgery Learning
- MGA-VQA: Secure and Interpretable Graph-Augmented Visual Question Answering with Memory-Guided Protection Against Unauthorized Knowledge Use
- Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction
- Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
- PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
- Layer-Wise High-Impact Parameter Ratio Optimization in Post-Training Quantization for Large Language Models
- PersonaAgent with GraphRAG: Community-Aware Knowledge Graphs for Personalized LLM
- SAVeD: Semantic Aware Version Discovery
- Estonian WinoGrande Dataset: Comparative Analysis of LLM Performance on Human and Machine Translation
- Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats
- LangMark: A Multilingual Dataset for Automatic Post-Editing
- VLA-4D: Embedding 4D Awareness into Vision-Language-Action Models for SpatioTemporally Coherent Robotic Manipulation
- Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
- Adaptive Layer-Wise Transformations for Post-Training Quantization of Large Language Models
- METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
- Nemotron Elastic: Towards Efficient Many-in-One Reasoning LLMs
- When Structure Doesn't Help: LLMs Do Not Read Text-Attributed Graphs as Effectively as We Expected
- You Only Forward Once: An Efficient Compositional Judging Paradigm
- TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
- AICC: Parse HTML Finer, Make Models Better -- A 7.3T AI-Ready Corpus Built by a Model-Based HTML Parser
- ELPO: Ensemble Learning Based Prompt Optimization for Large Language Models
- "To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
- AMS-KV: Adaptive KV Caching in Multi-Scale Visual Autoregressive Transformers
- Global Resolution: Optimal Multi-Draft Speculative Sampling via Convex Minimization
- Explore How to Inject Beneficial Noise in MLLMs
- Automatic Pruning Discovery for Large Language Models
- As If We've Met Before: LLMs Exhibit Certainty in Recognizing Seen Files
- GRPO-RM: Fine-Tuning Representation Models via GRPO-Driven Reinforcement Learning
- OEMA: Ontology-Enhanced Multi-Agent Collaboration Framework for Zero-Shot Clinical Named Entity Recognition
- Multi-Aspect Cross-modal Quantization for Generative Recommendation
- Strategic Innovation Management in the Age of Large Language Models Market Intelligence, Adaptive R&D, and Ethical Governance
- Steganographic Backdoor Attacks in NLP: Ultra-Low Poisoning and Defense Evasion
- Orion: A Unified Visual Agent for Multimodal Perception, Advanced Visual Reasoning and Execution
- Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models
- Insight-A: Attribution-aware for Multimodal Misinformation Detection
- T-SAR: A Full-Stack Co-design for CPU-Only Ternary LLM Inference via In-Place SIMD ALU Reorganization
- Building Egocentric Procedural AI Assistant: Methods, Benchmarks, and Challenges
- Souper-Model: How Simple Arithmetic Unlocks State-of-the-Art LLM Performance
- Evaluating Large Language Models for Diacritic Restoration in Romanian Texts: A Comparative Study
- OTARo: Once Tuning for All Precisions toward Robust On-Device LLMs
- MACKO: Sparse Matrix-Vector Multiplication for Low Sparsity
- PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
- EVLP:Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
- Medical Knowledge Intervention Prompt Tuning for Medical Image Classification
- CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
- Mitigating Length Bias in RLHF through a Causal Lens
- Seg-VAR: Image Segmentation with Visual Autoregressive Modeling
- GenSIaC: Toward Security-Aware Infrastructure-as-Code Generation with Large Language Models
- Rethinking Deep Alignment Through The Lens Of Incomplete Learning
- OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description
- PRISM of Opinions: A Persona-Reasoned Multimodal Framework for User-centric Conversational Stance Detection
- GateRA: Token-Aware Modulation for Parameter-Efficient Fine-Tuning
- Align3GR: Unified Multi-Level Alignment for LLM-based Generative Recommendation
- Defending Unauthorized Model Merging via Dual-Stage Weight Protection
- Aligning Machiavellian Agents: Behavior Steering via Test-Time Policy Shaping
- PAS : Prelim Attention Score for Detecting Object Hallucinations in Large Vision--Language Models
- CURENet: Combining Unified Representations for Efficient Chronic Disease Prediction
- On-Device Fine-Tuning via Backprop-Free Zeroth-Order Optimization
- Hindsight Distillation Reasoning with Knowledge Encouragement Preference for Knowledge-based Visual Question Answering
- Robustness of LLM-enabled vehicle trajectory prediction under data security threats
- Phantom Menace: Exploring and Enhancing the Robustness of VLA Models Against Physical Sensor Attacks
- ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
- Advanced Black-Box Tuning of Large Language Models with Limited API Calls
- Do Not Merge My Model! Safeguarding Open-Source LLMs Against Unauthorized Model Merging
- ChEmREF: Evaluating Language Model Readiness for Chemical Emergency Response
- Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
- EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models
- Mastering Olympiad-Level Physics with Artificial Intelligence
- Modeling Uncertainty Trends for Timely Retrieval in Dynamic RAG
- SlideBot: A Multi-Agent Framework for Generating Informative, Reliable, Multi-Modal Presentations
- MCAD: Multimodal Context-Aware Audio Description Generation For Soccer
- MACEval: A Multi-Agent Continual Evaluation Network for Large Models
- Convergence and Stability Analysis of Self-Consuming Generative Models with Heterogeneous Human Curation
- TransactionGPT
- HalluClean: A Unified Framework to Combat Hallucinations in LLMs
- DPRM: A Dual Implicit Process Reward Model in Multi-Hop Question Answering
- AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
- Remodeling Semantic Relationships in Vision-Language Fine-Tuning
- Relation as a Prior: A Novel Paradigm for LLM-based Document-level Relation Extraction
- A Small Leak Sinks All: Exploring the Transferable Vulnerability of Source Code Models
- HyCoRA: Hyper-Contrastive Role-Adaptive Learning for Role-Playing
- SERL: Self-Examining Reinforcement Learning on Open-Domain
- LoopLLM: Transferable Energy-Latency Attacks in LLMs via Repetitive Generation
- ViPRA: Video Prediction for Robot Actions
- Optimal Attention Temperature Enhances In-Context Learning under Distribution Shift
- Probabilities Are All You Need: A Probability-Only Approach to Uncertainty Estimation in Large Language Models
- Revisiting NLI: Towards Cost-Effective and Human-Aligned Metrics for Evaluating LLMs in Question Answering
- When, What, and How: Rethinking Retrieval-Enhanced Speculative Decoding
- Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs
- Voice-Interactive Surgical Agent for Multimodal Patient Data Control
- StreamKV: Streaming Video Question-Answering with Segment-based KV Cache Retrieval and Compression
- Synergy over Discrepancy: A Partition-Based Approach to Multi-Domain LLM Fine-Tuning
- GoCkpt: Gradient-Assisted Multi-Step overlapped Checkpointing for Efficient LLM Training
- HLPD: Aligning LLMs to Human Language Preference for Machine-Revised Text Detection
- Attention and Compression is all you need for Controllably Efficient Language Models
- LLMs vs. Traditional Sentiment Tools in Psychology: An Evaluation on Belgian-Dutch Narratives
- FedRW: Efficient Privacy-Preserving Data Reweighting for Enhancing Federated Learning of Language Models
- Ghost in the Transformer: Detecting Model Reuse with Invariant Spectral Signatures
- BuildingWorld: A Structured 3D Building Dataset for Urban Foundation Models
- EcoSpa: Efficient Transformer Training with Coupled Sparsity
- AdaDrive: Self-Adaptive Slow-Fast System for Language-Grounded Autonomous Driving
- Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models
- TimeSense:Making Large Language Models Proficient in Time-Series Analysis
- 10 Open Challenges Steering the Future of Vision-Language-Action Models
- Interaction-Centric Knowledge Infusion and Transfer for Open-Vocabulary Scene Graph Generation
- VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
- Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation
- DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning
- Steering Language Models with Weight Arithmetic
- EveryDayVLA: A Vision-Language-Action Model for Affordable Robotic Manipulation
- LiveStar: Live Streaming Assistant for Real-World Online Video Understanding
- 8bit-GPT: Exploring Human-AI Interaction on Obsolete Macintosh Operating Systems
- Linear Gradient Prediction with Control Variates
- Effectiveness of Chain-of-Thought in Distilling Reasoning Capability from Large Language Models
- Iterative Layer-wise Distillation for Efficient Compression of Large Language Models
- Scientific judgment drifts over time in AI ideation
- Leak@k: Unlearning Does Not Make LLMs Forget Under Probabilistic Decoding
- Personalized Image Editing in Text-to-Image Diffusion Models via Collaborative Direct Preference Optimization
- Cambrian-S: Towards Spatial Supersensing in Video
- An MLCommons Scientific Benchmarks Ontology
- From Model to Breach: Towards Actionable LLM-Generated Vulnerabilities Reporting
- Ground-Truth Subgraphs for Better Training and Evaluation of Knowledge Graph Augmented LLMs
- Advancing Equitable AI: Evaluating Cultural Expressiveness in LLMs for Latin American Contexts
- Plan of Knowledge: Retrieval-Augmented Large Language Models for Temporal Knowledge Graph Question Answering
- Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing
- Direct Semantic Communication Between Large Language Models via Vector Translation
- Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish
- ASVRI-Legal: Fine-Tuning LLMs with Retrieval Augmented Generation for Enhanced Legal Regulation
- From Prompts to Power: Measuring the Energy Footprint of LLM Inference
- Let the Bees Find the Weak Spots: A Path Planning Perspective on Multi-Turn Jailbreak Attacks against LLMs
- Automated Prompt Generation for Code Intelligence: An Empirical study and Experience in WeChat
- From Insight to Exploit: Leveraging LLM Collaboration for Adaptive Adversarial Text Generation
- Silenced Biases: The Dark Side LLMs Learned to Refuse
- Optimal Singular Damage: Efficient LLM Inference in Low Storage Regimes
- Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
- ECO Decoding: Entropy-Based Control for Controllability and Fluency in Controllable Dialogue Generation
- FP8-Flow-MoE: A Casting-Free FP8 Recipe without Double Quantization Error
- TabDSR: Decompose, Sanitize, and Reason for Complex Numerical Reasoning in Tabular Data
- Rethinking LLM Human Simulation: When a Graph is What You Need
- LLM Probing with Contrastive Eigenproblems: Improving Understanding and Applicability of CCS
- Rescuing the Unpoisoned: Efficient Defense against Knowledge Corruption Attacks on RAG Systems
- Improving Romanian LLM Pretraining Data using Diversity and Quality Filtering
- AI Progress Should Be Measured by Capability-Per-Resource, Not Scale Alone: A Framework for Gradient-Guided Resource Allocation in LLMs
- Efficient Test-Time Retrieval Augmented Generation
- ORANGE: An Online Reflection ANd GEneration framework with Domain Knowledge for Text-to-SQL
- G2rammar: Bilingual Grammar Modeling for Enhanced Text-attributed Graph Learning
- TriCon-Fair: Triplet Contrastive Learning for Mitigating Social Bias in Pre-trained Language Models
- Optimizing Native Sparse Attention with Latent Attention and Local Global Alternating Strategies
- Do You Know About My Nation? Investigating Multilingual Language Models' Cultural Literacy Through Factual Knowledge
- SpecDiff-2: Scaling Diffusion Drafter Alignment For Faster Speculative Decoding
- Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs
- Reimagining Safety Alignment with An Image
- SQLSpace: A Representation Space for Text-to-SQL to Discover and Mitigate Robustness Gaps
- Scalable Processing-Near-Memory for 1M-Token LLM Inference: CXL-Enabled KV-Cache Management Beyond GPU Limits
- SteerVLM: Robust Model Control through Lightweight Activation Steering for Vision Language Models
- LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits
- Emu3.5: Native Multimodal Models are World Learners
- Envisioning Future Interactive Web Development: Editing Webpage with Natural Language
- Chain-of-Thought Hijacking
- MossNet: Mixture of State-Space Experts is a Multi-Head Attention
- Beyond Benchmarks: The Economics of AI Inference
- Loquetier: A Virtualized Multi-LoRA Framework for Unified LLM Fine-tuning and Serving
- AttnCache: Accelerating Self-Attention Inference for LLM Prefill via Attention Cache
- Instance-Level Composed Image Retrieval
- Gaperon: A Peppered English-French Generative Language Model Suite
- Robotic Assistant: Completing Collaborative Tasks with Dexterous Vision-Language-Action Models
- MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities
- Mitigating privacy risks in Retrieval-Augmented Generation via locally private entity perturbation
- Towards accurate differential diagnosis with large language models
- Investigating the Validity Evidence of Automated Scoring Methods for Divergent Thinking Assessments
- Considering the ethics of large machine learning models in the chemical sciences
- Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes
- Relation Geometry in Semantic Space of Language Models
- Between Gradient and Natural Gradient: A Continuum of LoRA Initializations
- RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention
- Collaborating Foundation Models for Domain Generalized Semantic Segmentation
- Semantic Similarity in Radiology Reports via LLMs and NER
- Shades of zero: Distinguishing impossibility from inconceivability
- Why ‘open’ AI systems are actually closed, and why this matters
- Covenant-72B: Pre-Training a 72B LLM with Trustless Peers Over-the-Internet
- How do large-language models respond to moral dilemmas? Insights from the defining issues test
- Forecasting Trajectory-Level Safety Risks in Black-Box Multi-Turn Interactions
- Don't Just Chase "Highlighted Tokens" in MLLMs: Revisiting Visual Holistic Context Retention
- Can neurons speak? Semantic narration of vision at single-cell resolution
- Flows: Building Blocks of Reasoning and Collaborating AI
- Breaking the Ice: Analyzing Cold Start Latency in vLLM
- HRM-Text: Efficient Pretraining Beyond Scaling
- Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale
- CatPath‐GPT: A Mixture of Experts System for Computational Catalyst Design
- France or Spain or Germany or France: A Neural Account of Non-Redundant Redundant Disjunctions
- NeurIPT: Foundation Model for Neural Interfaces
- RL makes MLLMs see better than SFT
- EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning
- State of the Art of LLM-Enabled Interaction with Visualization
- IBNorm: Information-Bottleneck Inspired Normalization for Representation Learning
- MoEntwine: Unleashing the Potential of Wafer-scale Chips for Large-scale Expert Parallel Inference
- Optimizing Knowledge Utilization for Multi-Intent Comment Generation with Large Language Models
- DTKG: Dual-Track Knowledge Graph-Verified Reasoning Framework for Multi-Hop QA
- NanoVLA: Routing Decoupled Vision-Language Understanding for Nano-sized Generalist Robotic Policies
- Opt4GPTQ: Co-Optimizing Memory and Computation for 4-bit GPTQ Quantized LLM Inference on Heterogeneous Platforms
- SemCoT: Accelerating Chain-of-Thought Reasoning through Semantically-Aligned Implicit Tokens
- Greedy Sampling Is Provably Efficient for RLHF
- Improving LLM Reasoning via Dependency-Aware Query Decomposition and Logic-Parallel Content Expansion
- LoRA-DA: Data-Aware Initialization for Low-Rank Adaptation via Asymptotic Analysis
- From Cross-Task Examples to In-Task Prompts: A Graph-Based Pseudo-Labeling Framework for In-context Learning
- LuxIT: A Luxembourgish Instruction Tuning Dataset from Monolingual Seed Data
- MiniOneRec: An Open-Source Framework for Scaling Generative Recommendation
- Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
- Verifying Large Language Models' Reasoning Paths via Correlation Matrix Rank
- Evaluating LLMs on Generating Age-Appropriate Child-Like Conversations
- Kernelized Sparse Fine-Tuning with Bi-level Parameter Competition for Vision Models
- MeCeFO: Enhancing LLM Training Robustness via Fault-Tolerant Optimization
- PICOs-RAG: PICO-supported Query Rewriting for Retrieval-Augmented Generation in Evidence-Based Medicine
- Uncovering the Potential Risks in Unlearning: Danger of English-only Unlearning in Multilingual LLMs
- Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges
- Large Language Models, Agency, and Why Speech Acts are Beyond Them (For Now) – A Kantian-Cum-Pragmatist Case
- MoPHES:Leveraging on-device LLMs as Agent for Mobile Psychological Health Evaluation and Support
- MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- ScaLoRA: Optimally Scaled Low-Rank Adaptation for Efficient High-Rank Fine-Tuning
- RoboOmni: Proactive Robot Manipulation in Omni-modal Context
- A Survey on Efficient Vision-Language-Action Models
- FRONTIER-RevRec: A Large-scale Dataset for Reviewer Recommendation
- Larger and more instructable language models become less reliable
- Dexbotic: Open-Source Vision-Language-Action Toolbox
- Emotion-Coherent Reasoning for Multimodal LLMs via Emotional Rationale Verifier
- How AI Forecasts AI Jobs: Benchmarking LLM Predictions of Labor Market Changes
- Nested AutoRegressive Models
- Simple Denoising Diffusion Language Models
- Can Language Models Compose Skills In-Context?
- Probing Knowledge Holes in Unlearned LLMs
- SeeDNorm: Self-Rescaled Dynamic Normalization
- CANDI: Hybrid Discrete-Continuous Diffusion Models
- Frustratingly Easy Task-aware Pruning for Large Language Models
- The Structural Scalpel: Automated Contiguous Layer Pruning for Large Language Models
- Label Smoothing Improves Gradient Ascent in LLM Unlearning
- GigaEmbeddings: Efficient Russian Language Embedding Model
- DETECT: Determining Ease and Textual Clarity of German Text Simplifications
- Mitigating Coordinate Prediction Bias from Positional Encoding Failures
- Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers
- Brain-tuning Improves Generalizability and Efficiency of Brain Alignment in Speech Models
- FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
- MoniTor: Exploiting Large Language Models with Instruction for Online Video Anomaly Detection
- Large Language Models as Model Organisms for Human Associative Learning
- Flight Delay Prediction via Cross-Modality Adaptation of Large Language Models and Aircraft Trajectory Representation
- Evaluating Prompting Strategies and Large Language Models in Systematic Literature Review Screening: Relevance and Task-Stage Classification
- Bi-Level Optimization for Generative Recommendation: Bridging Tokenization and Generation
- Model Merging with Functional Dual Anchors
- The "Right" Discourse on Migration: Analysing Migration-Related Tweets in Right and Far-Right Political Movements
- Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency
- Large Language Models Meet Text-Attributed Graphs: A Survey of Integration Frameworks and Applications
- Robust Distortion-Free Watermark for Autoregressive Audio Generation Models
- Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
- The Gray Zone of Faithfulness: Taming Ambiguity in Unfaithfulness Detection
- Stateful KV Cache Management for LLMs: Balancing Space, Time, Accuracy, and Positional Fidelity
- Out-of-distribution Tests Reveal Compositionality in Chess Transformers
- HA-RAG: Hotness-Aware RAG Acceleration via Mixed Precision and Data Placement
- HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
- Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
- SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models
- StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback
- LM-mixup: Text Data Augmentation via Language Model based Mixup
- RECALL: REpresentation-aligned Catastrophic-forgetting ALLeviation via Hierarchical Model Merging
- The Impact of Negated Text on Hallucination with Large Language Models
- Do Prompts Reshape Representations? An Empirical Study of Prompting Effects on Embeddings
- LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments
- Energy-Efficient and Dequantization-Free Q-LLMs: A Spiking Neural Network Approach to Salient Value Mitigation
- Machine Text Detectors are Membership Inference Attacks
- KnowMol: Advancing Molecular Large Language Models with Multi-Level Chemical Knowledge
- ELUTQ: Efficient LUT-Aware Quantization for Deploying Large Language Models on Edge Devices
- LLM Unlearning with LLM Beliefs
- AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
- Conditions for Catastrophic Forgetting in Multilingual Translation
- Investigating LLM Capabilities on Long Context Comprehension for Medical Question Answering
- Pay Attention to the Triggers: Constructing Backdoors That Survive Distillation
- Simple and Efficient Heterogeneous Temporal Graph Neural Network
- From Retrieval to Generation: Unifying External and Parametric Knowledge for Medical Question Answering
- Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth
- From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
- Assessing Monotone Dependence: Area Under the Curve Meets Rank Correlation
- Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
- SparseVILA: Decoupling Visual Sparsity for Efficient VLM Inference
- Voice EHR: introducing multimodal audio data for health
- Protein Language Models: Is Scaling Necessary?
- ReXMoE: Reusing Experts with Minimal Overhead in Mixture-of-Experts
- Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations
- Select-Then-Decompose: From Empirical Analysis to Adaptive Selection Strategy for Task Decomposition in Large Language Models
- Forget to Know, Remember to Use: Context-Aware Unlearning for Large Language Models
- Wisdom is Knowing What not to Say: Hallucination-Free LLMs Unlearning via Attention Shifting
- VisiPruner: Decoding Discontinuous Cross-Modal Dynamics for Efficient Multimodal LLMs
- Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey
- Mapping from Meaning: Addressing the Miscalibration of Prompt-Sensitive Language Models
- Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning
- A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications
- QuanBench: Benchmarking Quantum Code Generation with Large Language Models
- MuonBP: Faster Muon via Block-Periodic Orthogonalization
- EMRRG: Efficient Fine-Tuning Pre-trained X-ray Mamba Networks for Radiology Report Generation
- Advances in Pre-trained Language Models for Domain-Specific Text Classification: A Systematic Review
- Accelerating Mobile Language Model via Speculative Decoding and NPU-Coordinated Execution
- AUGUSTUS: An LLM-Driven Multimodal Agent System with Contextualized User Memory
- InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
- Teaching Code LLMs to Use Autocompletion Tools in Repository-Level Code Generation
- Enhancing reliability in AI inference services: An empirical study on real production incidents
- Synera: Synergistic LLM Serving across Device and Cloud at Scale
- How Well Can Preference Optimization Generalize Under Noisy Feedback?
- Train a Unified Multimodal Data Quality Classifier with Synthetic Data
- From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
- Attention Is All You Need for KV Cache in Diffusion LLMs
- Predicting Task Performance with Context-aware Scaling Laws
- Purifying Task Vectors in Knowledge-Aware Subspace for Model Merging
- Can MLLMs Absorb Math Reasoning Abilities from LLMs as Free Lunch?
- Stop-RAG: Value-Based Retrieval Control for Iterative RAG
- Large Reasoning Embedding Models: Towards Next-Generation Dense Retrieval Paradigm
- MERLIN: A Testbed for Multilingual Multimodal Entity Recognition and Linking
- Kelle: Co-design KV Caching and eDRAM for Efficient LLM Serving in Edge Computing
- FedHFT: Efficient Federated Finetuning with Heterogeneous Edge Clients
- Think Globally, Group Locally: Evaluating LLMs Using Multi-Lingual Word Grouping Games
- MemoTime: Memory-Augmented Temporal Knowledge Graph Enhanced Large Language Model Reasoning
- Document Intelligence in the Era of Large Language Models: A Survey
- End-to-End Multi-Modal Diffusion Mamba
- Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms
- Information-Theoretic Reward Modeling for Stable RLHF: Detecting and Mitigating Reward Hacking
- Tahakom LLM Guidelines and Recipes: From Pre-training Data to an Arabic LLM
- Taming the Fragility of KV Cache Eviction in LLM Inference
- UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity MoE
- TRUSTVIS: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models
- MedREK: Retrieval-Based Editing for Medical LLMs with Key-Aware Prompts
- Beyond Static LLM Policies: Imitation-Enhanced Reinforcement Learning for Recommendation
- ConsintBench: Evaluating Language Models on Real-World Consumer Intent Understanding
- Hierarchical Frequency Tagging Probe (HFTP): A Unified Approach to Investigate Syntactic Structure Representations in Large Language Models and the Human Brain
- D-com: Accelerating Iterative Processing to Enable Low-rank Decomposition of Activations
- Repairing Reward Functions with Human Feedback to Mitigate Reward Hacking
- Litespark Technical Report: High-Throughput, Energy-Efficient LLM Training Framework
- RAID: Refusal-Aware and Integrated Decoding for Jailbreaking LLMs
- Cautious Weight Decay
- Pretraining in Actor-Critic Reinforcement Learning for Robot Locomotion
- Traveling Salesman-Based Token Ordering Improves Stability in Homomorphically Encrypted Language Models
- HiLoRA: Adaptive Hierarchical LoRA Routing for Training-Free Domain Generalization
- MoRA: On-the-fly Molecule-aware Low-Rank Adaptation Framework for LLM-based Multi-Modal Molecular Assistant
- Unveiling the Vulnerability of Graph-LLMs: An Interpretable Multi-Dimensional Adversarial Attack on TAGs
- Evolution of meta's llama models and parameter-efficient fine-tuning of large language models: a survey
- A Survey on Parallel Reasoning
- Precise Attribute Intensity Control in Large Language Models via Targeted Representation Editing
- Empowering LLM Agents with Geospatial Awareness: Toward Grounded Reasoning for Wildfire Response
- Hierarchical Alignment: Surgical Fine-Tuning via Functional Layer Specialization in Large Language Models
- CPR: Mitigating Large Language Model Hallucinations with Curative Prompt Refinement
- SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding
- OPLoRA: Orthogonal Projection LoRA Prevents Catastrophic Forgetting during Parameter-Efficient Fine-Tuning
- Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
- Multi-stage Prompt Refinement for Mitigating Hallucinations in Large Language Models
- FinVet: A Collaborative Framework of RAG and External Fact-Checking Agents for Financial Misinformation Detection
- Ontolearn-A Framework for Large-scale OWL Class Expression Learning in Python
- Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models
- Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap
- Neural Weight Compression for Language Models
- CoDefend: Cross-Modal Collaborative Defense via Diffusion Purification and Prompt Optimization
- Bolster Hallucination Detection via Prompt-Guided Data Augmentation
- AccurateRAG: A Framework for Building Accurate Retrieval-Augmented Question-Answering Applications
- xLSTM Scaling Laws: Competitive Performance with Linear Time-Complexity
- AMiD: Knowledge Distillation for LLMs with α-mixture Assistant Distribution
- Preserving LLM Capabilities through Calibration Data Curation: From Analysis to Optimization
- SASER: Stego attacks on open-source LLMs
- Long Exposure: Accelerating Parameter-Efficient Fine-Tuning for LLMs under Shadowy Sparsity
- Unlocking LLM Safeguards for Low-Resource Languages via Reasoning and Alignment with Minimal Training Data
- DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
- MetaBreak: Jailbreaking Online LLM Services via Special Token Manipulation
- Debiasing LLMs by Masking Unfairness-Driving Attention Heads
- PermLLM: Learnable Channel Permutation for N:M Sparse Large Language Models
- Diversity Augmentation of Dynamic User Preference Data for Boosting Personalized Text Summarizers
- Improving Speech Emotion Recognition with Mutual Information Regularized Generative Model
- Automated Glaucoma Report Generation via Dual-Attention Semantic Parallel-LSTM and Multimodal Clinical Data Integration
- StelLA: Subspace Learning in Low-rank Adaptation using Stiefel Manifold
- Detecting LLM-Generated Spam Reviews by Integrating Language Model Embeddings and Graph Neural Network
- Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
- Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL
- Benchmarking Language Modeling for Lossless Compression of Full-Fidelity Audio
- CoIDO: Efficient Data Selection for Visual Instruction Tuning via Coupled Importance-Diversity Optimization
- Steering Embedding Models with Geometric Rotation: Mapping Semantic Relationships Across Languages and Models
- SIMBA UQ: Similarity-Based Aggregation for Uncertainty Quantification in Large Language Models
- FLRC: Fine-grained Low-Rank Compressor for Efficient LLM Inference
- Entropy Meets Importance: A Unified Head Importance-Entropy Score for Stable and Efficient Transformer Pruning
- RoDyn: Taming Interactive Robot-Dynamic 2.5D World Model for Robotic Manipulation
- All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
- Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
- LLM Unlearning on Noisy Forget Sets: A Study of Incomplete, Rewritten, and Watermarked Data
- Bridging the Semantic Gap: Contrastive Rewards for Multilingual Text-to-SQL with GRPO
- Score-Based Density Estimation from Pairwise Comparisons
- Goal-oriented Backdoor Attack against Vision-Language-Action Models via Physical Objects
- Active Model Selection for Large Language Models
- Q-Router: Agentic Video Quality Assessment with Expert Model Routing and Artifact Localization
- AI-generated text boundary detection with RoFT
- Revisiting Hallucination Detection with Effective Rank-based Uncertainty
- Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling
- From Defender to Devil? Unintended Risk Interactions Induced by LLM Defenses
- LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
- MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
- OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
- RCPU: Rotation-Constrained Error Compensation for Structured Pruning of Large Language Models
- AutoRed: A Free-form Adversarial Prompt Generation Framework for Automated Red Teaming
- VisualDAN: Exposing Vulnerabilities in VLMs with Visual-Driven DAN Commands
- Don't Run with Scissors: Pruning Breaks VLA Models but They Can Be Recovered
- Learning What to Remember: Adaptive Probabilistic Memory Retention for Memory-Efficient Language Models
- TRIM: Token-wise Attention-Derived Saliency for Data-Efficient Instruction Tuning
- SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training
- RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models
- MLLM4TS: Leveraging Vision and Multimodal Language Models for General Time-Series Analysis
- Black-Box Detection of LLM-Generated Text Using Generalized Jensen-Shannon Divergence
- Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts
- Secure-Instruct: An Automated Pipeline for Synthesizing Instruction-Tuning Datasets Using LLMs for Secure Code Generation
- Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
- SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
- Unlocking Latent Discourse Translation in LLMs Through Quality-Aware Decoding
- SoftMatcha 2: A Fast and Soft Pattern Matcher for Trillion-Scale Corpora
- Growing Visual Generative Capacity for Pre-Trained MLLMs
- Mid-Training of Large Language Models: A Survey
- AWM: Accurate Weight-Matrix Fingerprint for Large Language Models
- PIKA: Expert-Level Synthetic Datasets for Post-Training Alignment from Scratch
- Reusing Overtrained Language Models Saturates Scaling
- Optimal Stopping vs Best-of-N for Inference Time Optimization
- Learning to Route LLMs from Bandit Feedback: One Policy, Many Trade-offs
- POME: Post Optimization Model Edit via Muon-style Projection
- Reward Model Perspectives: Whose Opinions Do Reward Models Reward?
- Leveraging Large Language Models for Cybersecurity Risk Assessment -- A Case from Forestry Cyber-Physical Systems
- TokenChain: A Discrete Speech Chain via Semantic Token Modeling
- Prompt reinforcing for long-term planning of large language models
- Mixture of Neuron Experts
- Primal-Dual Direct Preference Optimization for Constrained LLM Alignment
- Activation-Informed Pareto-Guided Low-Rank Compression for Efficient LLM/VLM
- ARMOR: High-Performance Semi-Structured Pruning via Adaptive Matrix Factorization
- From Principles to Practice: A Systematic Study of LLM Serving on Multi-core NPUs
- SD-MVSum: Script-Driven Multimodal Video Summarization Method and Datasets
- Latent Speech-Text Transformer
- The New Quant: A Survey of Large Language Models in Financial Prediction and Trading
- CAM: A Constructivist View of Agentic Memory for LLM-Based Reading Comprehension
- InvThink: Premortem Reasoning for Safer Language Models
- Test-Time Scaling in Diffusion LLMs via Hidden Semi-Autoregressive Experts
- Imperceptible Jailbreaking against Large Language Models
- HyperVLA: Efficient Inference in Vision-Language-Action Models via Hypernetworks
- Reproducibility Study of "XRec: Large Language Models for Explainable Recommendation"
- Demystifying Synthetic Data in LLM Pre-training: A Systematic Study of Scaling Laws, Benefits, and Pitfalls
- Beyond the Seen: Bounded Distribution Estimation for Open-Vocabulary Learning
- QuantAgents: Towards Multi-agent Financial System via Simulated Trading
- Compressed Convolutional Attention: Efficient Attention in a Compressed Latent Space
- KVLinC : KV Cache Quantization with Hadamard Rotation and Linear Correction
- Representation Potentials of Foundation Models for Multimodal Alignment: A Survey
- Evaluation of Clinical Trials Reporting Quality using Large Language Models
- LLM Microscope: What Model Internals Reveal About Answer Correctness and Context Utilization
- SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations
- The Unseen Frontier: Pushing the Limits of LLM Sparsity with Surrogate-Free ADMM
- Mechanistic Interpretability of Socio-Political Frames in Language Models
- Towards Sampling Data Structures for Tensor Products in Turnstile Streams
- Best-of-Majority: Minimax-Optimal Strategy for Pass@k Inference Scaling
- Knowledge Graph-Guided Multi-Agent Distillation for Reliable Industrial Question Answering with Datasets
- HALO: Memory-Centric Heterogeneous Accelerator with 2.5D Integration for Low-Batch LLM Inference
- Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach
- Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving
- Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning
- HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy
- MASH: Modeling Abstention via Selective Help-Seeking
- Characterizing Model Behavior Under Synthetic Data Training: An Empirical Study Across Scales and Mixing Ratios
- Automated Structured Radiology Report Generation with Rich Clinical Context
- ZQBA: Zero Query Black-box Adversarial Attack
- Facilitating Cognitive Accessibility with LLMs: A Multi-Task Approach to Easy-to-Read Text Generation
- Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning
- Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
- VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators
- HiSpec: Hierarchical Speculative Decoding for LLMs
- Debunk the Myth of SFT Generalization
- Communication-Efficient and Accurate Approach for Aggregation in Federated Low-Rank Adaptation
- SafeBehavior: Simulating Human-Like Multistage Reasoning to Mitigate Jailbreak Attacks in Large Language Models
- Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts
- Explaining novel senses using definition generation with open language models
- Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
- OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models
- CAST: Continuous and Differentiable Semi-Structured Sparsity-Aware Training for Large Language Models
- Reliability Crisis of Reference-free Metrics for Grammatical Error Correction
- Understanding the Mixture-of-Experts with Nadaraya-Watson Kernel
- SAIL: SRAM-Accelerated LLM Inference System with Lookup-Table-based GEMV
- TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
- Rotation Control Unlearning: Quantifying and Controlling Continuous Unlearning for LLM with The Cognitive Rotation Space
- Effective Model Pruning
- FlowMoE: A Scalable Pipeline Scheduling Framework for Distributed Mixture-of-Experts Training
- VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
- Judging by Appearances? Auditing and Intervening Vision-Language Models for Bail Prediction
- VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models
- Rethinking Parameter Sharing for LLM Fine-Tuning with Multiple LoRAs
- Rethinking Entropy Regularization in Large Reasoning Models
- Scaling with Collapse: Efficient and Predictable Training of LLM Families
- CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning
- MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes
- Case reports unlocked: Harnessing large language models to advance research on child maltreatment
- Vision Function Layer in Multimodal LLMs
- Fidel-TS: A High-Fidelity Benchmark for Multimodal Time Series Forecasting
- Neural Message-Passing on Attention Graphs for Hallucination Detection
- Understanding the Dilemma of Unlearning for Large Language Models
- SparseServe: Unlocking Parallelism for Dynamic Sparse Attention in Long-Context LLM Serving
- Knowledge Editing with Subspace-Aware Key-Value Mappings
- Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models
- HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
- Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning
- AlignX: Advancing Multilingual Large Language Models with Multilingual Representation Alignment
- Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding
- Multimodal Large Language Models Meet Multimodal Emotion Recognition and Reasoning: A Survey
- Exploring Similarity between Neural and LLM Trajectories in Language Processing
- Learning to Ponder: Adaptive Reasoning in Latent Space
- Conda: Column-Normalized Adam for Training Large Language Models Faster
- FM-FoG: A Real-Time Foundation Model-based Wearable System for Freezing-of-Gait Mitigation
- World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training
- Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs
- Beyond Repetition: Text Simplification and Curriculum Learning for Data-Constrained Pretraining
- Which course? Discourse! Teaching Discourse and Generation in the Era of LLMs
- Edge-FIT: Federated Instruction Tuning of Quantized LLMs for Privacy-Preserving Smart Home Environments
- Sequential Diffusion Language Models
- Detecting and Rectifying Noisy Labels: A Similarity-based Approach
- Dynamic Orthogonal Continual Fine-tuning for Mitigating Catastrophic Forgettings
- Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning
- Tequila: Trapping-free Ternary Quantization for Large Language Models
- Anchored Supervised Fine-Tuning
- AdaPtis: Reducing Pipeline Bubbles with Adaptive Pipeline Parallelism on Heterogeneous Models
- Beyond English-Centric Training: How Reinforcement Learning Improves Cross-Lingual Reasoning in LLMs
- Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models
- MotionVerse: A Unified Multimodal Framework for Motion Comprehension, Generation and Editing
- Toward a Holistic Approach to Continual Model Merging
- LLM Hallucination Detection: HSAD
- Internal Planning in Language Models: Characterizing Horizon and Branch Awareness
- Clean First, Align Later: Benchmarking Preference Data Cleaning for Reliable LLM Alignment
- RIV: Recursive Introspection Mask Diffusion Vision Language Model
- QuadEnhancer: Leveraging Quadratic Transformations to Enhance Deep Neural Networks
- Dual-Space Smoothness for Robust and Balanced LLM Unlearning
- p-less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding
- Decision Potential Surface: A Theoretical and Practical Approximation of LLM's Decision Boundary
- General Exploratory Bonus for Optimistic Exploration in RLHF
- PT2-LLM: Post-Training Ternarization for Large Language Models
- Boltz-1 Democratizing Biomolecular Interaction Modeling
- Adaptive Margin RLHF via Preference over Preferences
- Memory-Efficient Fine-Tuning via Low-Rank Activation Compression
- Fine-Grained Detection of Context-Grounded Hallucinations Using LLMs
- Language Models Can Learn from Verbal Feedback Without Scalar Rewards
- Variational Reasoning for Language Models
- Your RAG is Unfair: Exposing Fairness Vulnerabilities in Retrieval-Augmented Generation via Backdoor Attacks
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Beyond Textual Context: Structural Graph Encoding with Adaptive Space Alignment to alleviate the hallucination of LLMs
- Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
- Multilingual Vision-Language Models, A Survey
- Mind the Missing: Variable-Aware Representation Learning for Irregular EHR Time Series using Large Language Models
- Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation
- COSPADI: Compressing LLMs via Calibration-Guided Sparse Dictionary Learning
- A2R: An Asymmetric Two-Stage Reasoning Framework for Parallel Reasoning
- Effect of Model Merging in Domain-Specific Ad-hoc Retrieval
- Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
- Enhancing Low-Rank Adaptation with Structured Nonlinear Transformations
- SoK: Potentials and Challenges of Large Language Models for Reverse Engineering
- Backdoor Attribution: Elucidating and Controlling Backdoor in Language Models
- Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
- Learning Admissible Heuristics for A*: Theory and Practice
- We Think, Therefore We Align LLMs to Helpful, Harmless and Honest Before They Go Wrong
- Compute-Optimal Quantization-Aware Training
- Towards Transparent AI: A Survey on Explainable Language Models
- Preemptive Detection and Steering of LLM Misalignment via Latent Reachability
- VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
- VC-Agent: An Interactive Agent for Customized Video Dataset Collection
- Data-Centric Elastic Pipeline Parallelism for Efficient Long-Context LLM Training
- PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints
- FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction
- CLUE: Conflict-guided Localization for LLM Unlearning Framework
- A short survey on almost orthogonal vectors in a few specific large dimensions
- ArchGPT: Understanding the World's Architectures with Large Multimodal Models
- Towards Atoms of Large Language Models
- SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs
- IoT-MCP: Bridging LLMs and IoT Systems Through Model Context Protocol
- Beyond Stars: Bridging the Gap Between Ratings and Review Sentiment with LLM
- It's Not You, It's Clipping: A Soft Trust-Region via Probability Smoothing for LLM RL
- DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning
- Building Tailored Speech Recognizers for Japanese Speaking Assessment
- LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning
- Instruction Boundary: Quantifying Biases in LLM Reasoning under Various Coverage
- Beyond Sharp Minima: Robust LLM Unlearning via Feedback-Guided Multi-Point Optimization
- Q-Palette: Fractional-Bit Quantizers Toward Optimal Bit Allocation for Efficient LLM Deployment
- BurstEngine: an Efficient Distributed Framework for Training Transformers on Extremely Long Sequences of over 1M Tokens
- Exploration with Foundation Models: Capabilities, Limitations, and Hybrid Approaches
- SSTAG: Structure-Aware Self-Supervised Learning Method for Text-Attributed Graphs
- CoMelSinger: Discrete Token-Based Zero-Shot Singing Synthesis With Structured Melody Control and Guidance
- FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models
- RSAVQ: Riemannian Sensitivity-Aware Vector Quantization for Large Language Models
- RoboSSM: Scalable In-context Imitation Learning via State-Space Models
- The future of machine learning for small-molecule drug discovery will be driven by data
- LOCA: Logical Chain Augmentation for Scientific Corpus Cleaning
- Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
- bi-GRPO: Bidirectional Optimization for Jailbreak Backdoor Injection on LLMs
- Are We Scaling the Right Thing? A System Perspective on Test-Time Scaling
- Silent Tokens, Loud Effects: Padding in LLMs
- Parameter-Efficient Multi-Task Learning via Progressive Task-Specific Adaptation
- Harnessing the Potential of Optimizing Data Mixtures via Bayesian Domain Reweighting
- LightRot: A Light-Weighted Rotation Scheme and Architecture for Accurate Low-Bit Large Language Model Inference
- GyRot: Leveraging Hidden Synergy between Rotation and Fine-grained Group Quantization for Low-bit LLM Inference
- Comparing Llama-2 and GPT-3 LLMs for HPC kernels generation
- Conflicting feelings: sociological and computational sentiment in workplace sentiment surveillance
- Training Compute-Optimal Protein Language Models
- A semantic embedding space based on large language models for modelling human beliefs
- A large-scale evaluation of commonsense knowledge in humans and large language models
- Linguistic properties and model scale in brain encoding: from small to compressed language models
- Artificial intelligence-based biomarkers for treatment decisions in oncology
- Had Enough of Experts? Quantitative Knowledge Retrieval From Large Language Models
- Security and Privacy Challenges of Large Language Models: A Survey
- Understanding Subword Compositionality of Large Language Models
- How Do LLM-Generated Texts Impact Term-Based Retrieval Models?
- LLMulator: Generalizable Cost Modeling for Dataflow Accelerators with Input-Adaptive Control Flow
- A Knowledge Graph and a Tripartite Evaluation Framework Make Retrieval-Augmented Generation Scalable and Transparent
- CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure
- LLM-based Agents Suffer from Hallucinations: A Survey of Taxonomy, Methods, and Directions
- Consistency-Aware Parameter-Preserving Knowledge Editing Framework for Multi-Hop Question Answering
- COLT: Enhancing Video Large Language Models with Continual Tool Usage
- Enhancing LLM-Based Social Bot via an Adversarial Learning Framework
- OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation
- Experience Scaling: Post-Deployment Evolution For Large Language Models
- CoCoA: Confidence and Context-Aware Adaptive Decoding for Resolving Knowledge Conflicts in Large Language Models
- Code Driven Planning with Domain-Adaptive Critic
- Advances in Large Language Models for Medicine
- Confidential LLM Inference: Performance and Cost Across CPU and GPU TEEs
- Symphony-MoE: Harmonizing Disparate Pre-trained Models into a Coherent Mixture-of-Experts
- RL-Finetuned LLMs for Privacy-Preserving Synthetic Rewriting
- Bounded PCTL Model Checking of Large Language Model Outputs
- Model selection meets clinical semantics: Optimizing ICD-10-CM prediction via LLM-as-Judge evaluation, redundancy-aware sampling, and section-aware fine-tuning
- Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
- On-the-Fly Adaptation to Quantization: Configuration-Aware LoRA for Efficient Fine-Tuning of Quantized LLMs
- Enhancing Cross-Lingual Transfer through Reversible Transliteration: A Huffman-Based Approach for Low-Resource Languages
- Correlation or Causation: Analyzing the Causal Structures of LLM and LRM Reasoning Process
- Cronus: Efficient LLM inference on Heterogeneous GPU Clusters via Partially Disaggregated Prefill
- LLaVul: A Multimodal LLM for Interpretable Vulnerability Reasoning about Source Code
- Weights-Rotated Preference Optimization for Large Language Models
- MLLM-Driven Semantic Identifier Generation for Generative Cross-Modal Retrieval
- Training-free Truthfulness Detection via Sparse MLP Value Vectors
- DIWALI: Diversity and Inclusivity aWare cuLture specific Items for India: Dataset and Assessment of LLMs for Cultural Text Adaptation in Indian Context
- A State-Update Prompting Strategy for Efficient and Robust Multi-turn Dialogue
- PG-CE: A Progressive Generation Dataset with Constraint Enhancement for Controllable Text Generation
- Qwen3-Omni Technical Report
- Probabilistic Token Alignment for Large Language Model Fusion
- SnipSnap: A Joint Compression Format and Dataflow Co-Optimization Framework for Efficient Sparse LLM Accelerator Design
- CUTE: A Multilingual Dataset for Enhancing Cross-Lingual Knowledge Transfer in Low-Resource Languages
- PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
- Uncovering Implicit Bias in Large Language Models with Concept Learning Dataset
- ExpertWeave: Efficiently Serving Expert-Specialized Fine-Tuned Adapters at Scale
- Steering When Necessary: Flexible Steering Large Language Models with Backtracking
- Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception
- Adaptive Graph Convolution and Semantic-Guided Attention for Multimodal Risk Detection in Social Networks
- DecipherGuard: Understanding and Deciphering Jailbreak Prompts for a Safer Deployment of Intelligent Software Systems
- Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories
- Decoding Uncertainty: The Impact of Decoding Strategies for Uncertainty Estimation in Large Language Models
- MCP: A Control-Theoretic Orchestration Framework for Synergistic Efficiency and Interpretability in Multimodal Large Language Models
- Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels
- LLMsPark: A Benchmark for Evaluating Large Language Models in Strategic Gaming Contexts
- Can an Individual Manipulate the Collective Decisions of Multi-Agents?
- Rethinking the Role of Text Complexity in Language Model Pretraining
- HERO: Hierarchical Extrapolation and Refresh for Efficient World Models
- On Optimal Steering to Achieve Exact Fairness
- Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding
- LiteLong: Resource-Efficient Long-Context Data Synthesis for LLMs
- Brevity is the Soul of Wit: Condensing Code Changes to Improve Commit Message Generation
- On the Convergence of Muon and Beyond
- Generalizability of Large Language Model-Based Agents: A Comprehensive Survey
- DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
- LNE-Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models
- Understand Before You Generate: Self-Guided Training for Autoregressive Image Generation
- Semantic Representation Attack against Aligned Large Language Models
- From Hype to Insight: Rethinking Large Language Model Integration in Visual Speech Recognition
- Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages
- LEAP: LLM Inference on Scalable PIM-NoC Architecture with Balanced Dataflow and Fine-Grained Parallelism
- Evaluating Large Language Models for Cross-Lingual Retrieval
- Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM
- Controlling Language Difficulty in Dialogues with Linguistic Features
- LLM Jailbreak Detection for (Almost) Free!
- Adaptive LoRA Experts Allocation and Selection for Federated Fine-Tuning
- OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data
- TableDART: Dynamic Adaptive Multi-Modal Routing for Table Understanding
- Do LLMs Align Human Values Regarding Social Biases? Judging and Explaining Social Biases with LLMs
- UI-Level Evaluation of ALLaM 34B: Measuring an Arabic-Centric LLM via HUMAIN Chat
- ST-LINK: Spatially-Aware Large Language Models for Spatio-Temporal Forecasting
- Q-ROAR: Outlier-Aware Rescaling for RoPE Position Interpolation in Quantized Long-Context LLMs
- Keywords are not always the key: A metadata field analysis for natural language search on open data portals
- DSCC-HS: A Dynamic Self-Reinforcing Framework for Hallucination Suppression in Large Language Models
- Hala Technical Report: Building Arabic-Centric Instruction & Translation Models at Scale
- Do Large Language Models Understand Word Senses?
- Programmable Cognitive Bias in Social Agents
- Divergences between Language Models and Human Brains
- The Few-shot Dilemma: Over-prompting Large Language Models
- HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference
- EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer
- Beyond Artificial Misalignment: Detecting and Grounding Semantic-Coordinated Multimodal Manipulations
- A Systematic Evaluation of Parameter-Efficient Fine-Tuning Methods for the Security of Code LLMs
- Empowering LLMs with Parameterized Skills for Adversarial Long-Horizon Planning
- Module-Aware Parameter-Efficient Machine Unlearning on Transformers
- SSFO: Self-Supervised Faithfulness Optimization for Retrieval-Augmented Generation
- Memory-Efficient Federated Fine-Tuning of Large Language Models via Layer Pruning
- InfoGain-RAG: Boosting Retrieval-Augmented Generation via Document Information Gain-based Reranking and Filtering
- Towards Better Correctness and Efficiency in Code Generation
- Active Domain Knowledge Acquisition with 100-Dollar Budget: Enhancing LLMs via Cost-Efficient, Expert-Involved Interaction in Sensitive Domains
- Graph-R1: Incentivizing the Zero-Shot Graph Learning Capability in LLMs via Explicit Reasoning
- Natural Language Satisfiability: Exploring the Problem Distribution and Evaluating Transformer-based Language Models
- ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation
- Selective Risk Certification for LLM Outputs via Information-Lift Statistics: PAC-Bayes, Robustness, and Skeleton Design
- LLM Hallucination Detection: A Fast Fourier Transform Method Based on Hidden Layer Temporal Signals
- Character-Centric Understanding of Animated Movies
- CBP-Tuning: Efficient Local Customization for Black-box Large Language Models
- A New Benchmark for Evaluating Code Translation with Third-Party Libraries
- AMQ: Enabling AutoML for Mixed-precision Weight-Only Quantization of Large Language Models
- Neuromorphic Intelligence
- Dr.V: A Hierarchical Perception-Temporal-Cognition Framework to Diagnose Video Hallucination by Fine-grained Spatial-Temporal Grounding
- Bhaasha, Bhasa, Zaban: A Survey for Low-Resourced Languages in South Asia -- Current Stage and Challenges
- D2HScore: Reasoning-Aware Hallucination Detection via Semantic Breadth and Depth Analysis in LLMs
- Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Time
- Context-Aware Language Models for Forecasting Market Impact from Sequences of Financial News
- ToolRM: Outcome Reward Models for Tool-Calling Large Language Models
- Optimal Brain Restoration for Joint Quantization and Sparsification of LLMs
- ENJ: Optimizing Noise with Genetic Algorithms to Jailbreak LSMs
- Continually Adding New Languages to Multilingual Language Models
- Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations
- Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code Generation
- AI-Generated Content in Cross-Domain Applications: Research Trends, Challenges and Propositions
- HalluField: Detecting LLM Hallucinations via Field-Theoretic Modeling
- A Survey on Retrieval And Structuring Augmented Generation with Large Language Models
- DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL
- RefactorCoderQA: Benchmarking LLMs for Multi-Domain Coding Question Solutions in Cloud and Edge Deployment
- Decoding Alignment: A Critical Survey of LLM Development Initiatives through Value-setting and Data-centric Lens
- URL2Graph++: Unified Semantic-Structural-Character Learning for Malicious URL Detection
- Explaining Black-box Language Models with Knowledge Probing Systems: A Post-hoc Explanation Perspective
- Multi-Intent Recognition in Dialogue Understanding: A Comparison Between Smaller Open-Source LLMs
- Unsupervised Hallucination Detection by Inspecting Reasoning Processes
- MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness
- Towards Understanding Visual Grounding in Visual Language Models
- ButterflyQuant: Ultra-low-bit LLM Quantization through Learnable Orthogonal Butterfly Transforms
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- Boosting Embodied AI Agents through Perception-Generation Disaggregation and Asynchronous Pipeline Execution
- Combating the Memory Walls: Optimization Pathways for Long-Context Agentic LLM Inference
- ENSI: Efficient Non-Interactive Secure Inference for Large Language Models
- VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
- CESRec: Constructing Pseudo Interactions for Sequential Recommendation via Conversational Feedback
- LightAgent: Production-level Open-source Agentic AI Framework
- CCF: A Context Compression Framework for Efficient Long-Sequence Language Modeling
- HEFT: A Coarse-to-Fine Hierarchy for Enhancing the Efficiency and Accuracy of Language Model Reasoning
- Unbiased Reasoning for Knowledge-Intensive Tasks in Large Language Models via Conditional Front-Door Adjustment
- Compass-v3: Scaling Domain-Specific LLMs for Multilingual E-Commerce in Southeast Asia
- Towards Confidential and Efficient LLM Inference with Dual Privacy Protection
- CoDiCodec: Unifying Continuous and Discrete Compressed Representations of Audio
- When FinTech Meets Privacy: Securing Financial LLMs with Differential Private Fine-Tuning
- Toward a Multi-Echelon Cyber Warfare Theory: A Meta-Game-Theoretic Paradigm for Defense and Dominance
- Building High-Quality Datasets for Portuguese LLMs: From Common Crawl Snapshots to Industrial-Grade Corpora
- BitROM: Weight Reload-Free CiROM Architecture Towards Billion-Parameter 1.58-bit LLM Inference
- LLM-VeriPPA: Power, Performance, and Area Optimization aware Verilog Code Generation with Large Language Models
- RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation
- Two Facets of the Same Optimization Coin: Model Degradation and Representation Collapse in Graph Foundation Models
- MERLIN: Multi-Stage Curriculum Alignment for Multilingual Encoder-LLM Integration in Cross-Lingual Reasoning
- Visual Representation Alignment for Multimodal Large Language Models
- GENUINE: Graph Enhanced Multi-level Uncertainty Estimation for Large Language Models
- Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model
- Query Expansion in the Age of Pre-trained and Large Language Models: A Comprehensive Survey
- Getting In Contract with Large Language Models -- An Agency Theory Perspective On Large Language Model Alignment
- Theoretical Analysis on how Learning Rate Warmup Accelerates Convergence
- TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
- Interpreting the Effects of Quantization on LLMs
- XSRD-Net: EXplainable Stroke Relapse Detection
- Guarding Your Conversations: Privacy Gatekeepers for Secure Interactions with Cloud-Based AI Models
- Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm
- MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security
- HAVE: Head-Adaptive Gating and ValuE Calibration for Hallucination Mitigation in Large Language Models
- O3Afford: One-Shot 3D Object-to-Object Affordance Grounding for Generalizable Robotic Manipulation
- LoaQ: Layer-wise Output Approximation Quantization
- Text-Trained LLMs Can Zero-Shot Extrapolate PDE Dynamics, Revealing a Three-Stage In-Context Learning Mechanism
- Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint
- Rethinking LLM Parametric Knowledge as Post-retrieval Confidence for Dynamic Retrieval and Reranking
- LatinX: Aligning a Multilingual TTS Model with Direct Preference Optimization
- Icon2: Aligning Large Language Models Using Self-Synthetic Preference Data via Inherent Regulation
- A Survey of the State-of-the-Art in Conversational Question Answering Systems
- Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation
- SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
- LatticeWorld: A Multimodal Large Language Model-Empowered Framework for Interactive Complex World Generation
- HoPE: Hyperbolic Rotary Positional Encoding for Stable Long-Range Dependency Modeling in Large Language Models
- PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination
- A Study of Large Language Models for Patient Information Extraction: Model Architecture, Fine-Tuning Strategy, and Multi-task Instruction Tuning
- CTCC: A Robust and Stealthy Fingerprinting Framework for Large Language Models via Cross-Turn Contextual Correlation Backdoor
- SpikingBrain: Spiking Brain-inspired Large Models
- Polysemantic Dropout: Conformal OOD Detection for Specialized LLMs
- Communication-Efficient Collaborative LLM Inference via Distributed Speculative Decoding
- Towards a Unified View of Large Language Model Post-Training
- How Small is Enough? Empirical Evidence of Quantized Small Language Models for Automated Program Repair
- HAMSA: Hijacking Aligned Compact Models via Stealthy Automation
- FPC-VLA: A Vision-Language-Action Framework with a Supervisor for Failure Prediction and Correction
- Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
- IPA: An Information-Reconstructive Input Projection Framework for Efficient Foundation Model Adaptation
- Differentiable Entropy Regularization: A Complexity-Aware Approach for Neural Optimization
- Cetvel: A Unified Benchmark for Evaluating Language Understanding, Generation and Cultural Capacity of LLMs for Turkish
- An Empirical Analysis of Discrete Unit Representations in Speech Language Modeling Pre-training
- TeRA: Vector-based Random Tensor Network for High-Rank Adaptation of Large Language Models
- RecBase: Generative Foundation Model Pretraining for Zero-Shot Recommendation
- EverTracer: Hunting Stolen Large Language Models via Stealthy and Robust Probabilistic Fingerprint
- Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning
- OPRA-Vis: Visual Analytics System to Assist Organization-Public Relationship Assessment with Large Language Models
- LLMCDSR: Enhancing Cross-Domain Sequential Recommendation with Large Language Models
- MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall
- Generative AI for Crystal Structures: A Review
- Implicit Reasoning in Large Language Models: A Comprehensive Survey
- An Epidemiological Knowledge Graph extracted from the World Health Organization's Disease Outbreak News
- How Instruction-Tuning Imparts Length Control: A Cross-Lingual Mechanistic Analysis
- Behavioral Fingerprinting of Large Language Models
- Preserving Bilinear Weight Spectra with a Signed and Shrunk Quadratic Activation Function
- Extracting OPQRST in Electronic Health Records using Large Language Models with Reasoning
- The Fools are Certain; the Wise are Doubtful: Exploring LLM Confidence in Code Completion
- Spacetime-GR: A Spacetime-Aware Generative Model for Large Scale Online POI Recommendation
- Text Takes Over: A Study of Modality Bias in Multimodal Intent Detection
- LobRA: Multi-tenant Fine-tuning over Heterogeneous Data
- REFRAG: Rethinking RAG based Decoding
- Generative Foundation Model for Structured and Unstructured Electronic Health Records
- Enhancing Large Language Model for Knowledge Graph Completion via Structure-Aware Alignment-Tuning
- Identifying Origins of Place Names via Retrieval Augmented Generation
- Supervised In-Context Fine-Tuning for Generative Sequence Labeling
- Exploring and Mitigating Fawning Hallucinations in Large Language Models
- Unlocking the Effectiveness of LoRA-FP for Seamless Transfer Implantation of Fingerprints in Downstream Models
- Any-Order Flexible Length Masked Diffusion
- DTRNet: Dynamic Token Routing Network to Reduce Quadratic Costs in Transformers
- PREE: Towards Harmless and Adaptive Fingerprint Editing in Large Language Models via Knowledge Prefix Enhancement
- Make me an Expert: Distilling from Generalist Black-Box Models into Specialized Models for Semantic Segmentation
- Two Causes, Not One: Rethinking Omission and Fabrication Hallucinations in MLLMs
- SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding
- GraphKV: Breaking the Static Selection Paradigm with Graph-Based KV Cache Eviction
- Balanced Actor Initialization: Stable RLHF Training of Distillation-Based Reasoning Models
- What Are Research Hypotheses?
- Odyssey: Adaptive Policy Selection for Resilient Distributed Training
- Evaluating Recabilities of Foundation Models: A Multi-Domain, Multi-Dataset Benchmark
- MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning
- Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework
- PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
- Improving Fisher Information Estimation and Efficiency for LoRA-based LLM Unlearning
- Decoding Memories: An Efficient Pipeline for Self-Consistency Hallucination Detection
- PromptSleuth: Detecting Prompt Injection via Semantic Intent Invariance
- MSRS: Evaluating Multi-Source Retrieval-Augmented Generation
- Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution
- Improving Alignment in LVLMs with Debiased Self-Judgment
- OneRec-V2 Technical Report
- GUARD: Glocal Uncertainty-Aware Robust Decoding for Effective and Efficient Open-Ended Text Generation
- SUMMA: A Multimodal Large Language Model for Advertisement Summarization
- OLMoASR: Open Models and Data for Training Robust Speech Recognition Models
- Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- Model Science: getting serious about verification, explanation and control of AI systems
- Pruning Weights but Not Truth: Safeguarding Truthfulness While Pruning LLMs
- SoK: Large Language Model Copyright Auditing via Fingerprinting
- TComQA: Extracting Temporal Commonsense from Text
- PSO-Merging: Merging Models Based on Particle Swarm Optimization
- Spotlight Attention: Towards Efficient LLM Generation via Non-linear Hashing-based KV Cache Retrieval
- Charting the Future of Scholarly Knowledge with AI: A Community Perspective
- CrystalICL: Enabling In-Context Learning for Crystal Generation
- LFD: Layer Fused Decoding to Exploit External Knowledge in Retrieval-Augmented Generation
- IELDG: Suppressing Domain-Specific Noise with Inverse Evolution Layers for Domain Generalized Semantic Segmentation
- Bi-LoRA: Efficient Sharpness-Aware Minimization for Fine-Tuning Large-Scale Models
- Alignment with Fill-In-the-Middle for Enhancing Code Generation
- MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models
- Towards 6G Intelligence: The Role of Generative AI in Future Wireless Networks
- How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
- SynthCoder: A Synthetical Strategy to Tune LLMs for Code Completion
- Even Heads Fix Odd Errors: Mechanistic Discovery and Surgical Repair in Transformer Attention
- One Joke to Rule them All? On the (Im)possibility of Generalizing Humor
- MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation
- StepWiser: Stepwise Generative Judges for Wiser Reasoning
- ZeST: an LLM-based Zero-Shot Traversability Navigation for Unknown Environments
- An Investigation on Group Query Hallucination Attacks
- ClusterFusion: Expanding Operator Fusion Scope for LLM Inference via Cluster-Level Collective Primitive
- UniC-RAG: Universal Knowledge Corruption Attacks to Retrieval-Augmented Generation
- UrgenGo: Urgency-Aware Transparent GPU Kernel Launching for Autonomous Driving
- Principled Detection of Hallucinations in Large Language Models via Multiple Testing
- Better Language Model-Based Judging Reward Modeling through Scaling Comprehension Boundaries
- SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models
- Stand on The Shoulders of Giants: Building JailExpert from Previous Attack Experience
- VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models
- Self-Guided Function Calling in Large Language Models via Stepwise Experience Recall
- Multi-IaC-Eval: Benchmarking Cloud Infrastructure as Code Across Multiple Formats
- Select to Know: An Internal-External Knowledge Self-Selection Framework for Domain-Specific Question Answering
- SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks
- Reliable Unlearning Harmful Information in LLMs with Metamorphosis Representation Projection
- Transduction is All You Need for Structured Data Workflows
- Fine-tuning and prompt engineering for large language models-based code review automation
- Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
- S3LoRA: Safe Spectral Sharpness-Guided Pruning in Adaptation of Agent Planner
- Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs
- Universal and Transferable Adversarial Attack on Large Language Models Using Exponentiated Gradient Descent
- H2EAL: Hybrid-Bonding Architecture with Hybrid Sparse Attention for Efficient Long-Context LLM Inference
- Evaluating Sparse Autoencoders for Monosemantic Representation
- Two Birds with One Stone: Multi-Task Detection and Attribution of LLM-Generated Text
- The Collaboration Paradox: Why Generative AI Requires Both Strategic Intelligence and Operational Stability in Supply Chain Management
- ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents
- GLASS: Global-Local Aggregation for Inference-time Sparsification of LLMs
- Reinforced Context Order Recovery for Adaptive Reasoning and Planning
- ONG: One-Shot NMF-based Gradient Masking for Efficient Model Sparsification
- Hallucinations in medical devices
- Learning to Steer: Input-dependent Steering for Multimodal LLMs
- Involuntary Jailbreak: On Self-Prompting Attacks
- Prompt-Induced Linguistic Fingerprints for LLM-Generated Fake News Detection
- GTool: Graph Enhanced Tool Planning with Large Language Model
- Consiglieres in the Shadow: Understanding the Use of Uncensored Large Language Models in Cybercrimes
- Enhancing Cryptocurrency Sentiment Analysis with Multimodal Features
- Energy-Efficient Wireless LLM Inference via Uncertainty and Importance-Aware Speculative Decoding
- Can Large Models Teach Student Models to Solve Mathematical Problems Like Human Beings? A Reasoning Distillation Method via Multi-LoRA Interaction
- Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models
- Uncovering Emergent Physics Representations Learned In-Context by Large Language Models
- ReaLM: Reflection-Enhanced Autonomous Reasoning with Small Language Models
- Rethinking Safety in LLM Fine-tuning: An Optimization Perspective
- AI-Augmented CI/CD Pipelines: From Code Commit to Production with Autonomous Decisions
- Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings
- STEM: Efficient Relative Capability Evaluation of LLMs through Structured Transition Samples
- Human Centric General Physical Intelligence for Agile Manufacturing Automation
- MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts
- ADMIRE-BayesOpt: Accelerated Data MIxture RE-weighting for Language Models with Bayesian Optimization
- MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
- MSRS: Adaptive Multi-Subspace Representation Steering for Attribute Alignment in Large Language Models
- Reverse Physician-AI Relationship: Full-process Clinical Diagnosis Driven by a Large Language Model
- Dataset Construction for Training LLM to Learn Analog Circuit Knowledge
- Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation
- Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning
- XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization
- Improving Generative Cross-lingual Aspect-Based Sentiment Analysis with Constrained Decoding
- Meta-Metrics and Best Practices for System-Level Inference Performance Benchmarking
- Chain-of-Query: Unleashing the Power of LLMs in SQL-Aided Table Understanding via Multi-Agent Collaboration
- MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
- On Negative-aware Preference Optimization for Recommendation
- Preacher: Paper-to-Video Agentic System
- The Surprising Effectiveness of Membership Inference with Simple N-Gram Coverage
- A Chain of Diagnosis Framework for Accurate and Explainable Radiology Report Generation
- MiCo: End-to-End Mixed Precision Neural Network Co-Exploration Framework for Edge AI
- NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs
- EGGS-PTP: An Expander-Graph Guided Structured Post-training Pruning Method for Large Language Models
- Faster and Memory-Efficient Training of Sequential Recommendation Models for Large Catalogs
- A Signer-Invariant Conformer and Multi-Scale Fusion Transformer for Continuous Sign Language Recognition
- SMA: Who Said That? Auditing Membership Leakage in Semi-Black-box RAG Controlling
- Scaling Up Active Testing to Large Language Models
- READER: Retrieval-Assisted Drafter for Efficient LLM Inference
- Oblivionis: A Lightweight Learning and Unlearning Framework for Federated Large Language Models
- EditMF: Drawing an Invisible Fingerprint for Your Large Language Models
- Prompt-and-Check: Using Large Language Models to Evaluate Communication Protocol Compliance in Simulation-Based Training
- UWB at WASSA-2024 Shared Task 2: Cross-lingual Emotion Detection
- KFFocus: Highlighting Keyframes for Enhanced Video Understanding
- Large Language Models in the Data Science Lifecycle: A Systematic Mapping Study
- ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
- DiffractGPT: Atomic Structure Determination from X-ray Diffraction Patterns using Generative Pre-trained Transformer
- Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model
- A Data-driven ML Approach for Maximizing Performance in LLM-Adapter Serving
- Auditory Intelligence: Understanding the World Through Sound
- Towards Multimodal Sentiment Analysis via Contrastive Cross-modal Retrieval Augmentation and Hierachical Prompts
- MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling
- Large Language Models for Subjective Language Understanding: A Survey
- Large Language Models for Czech Aspect-Based Sentiment Analysis
- SynLLM: A Comparative Analysis of Large Language Models for Medical Tabular Synthetic Data Generation via Prompt Engineering
- VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models
- Pareto Multi-Objective Alignment for Language Models
- AimBot: A Simple Auxiliary Visual Cue to Enhance Spatial Awareness of Visuomotor Policies
- Modeling and Detecting Company Risks from News: A Case Study in Bloomberg News
- HSA-Net: Hierarchical and Structure-Aware Framework for Efficient and Scalable Molecular Language Modeling
- Large-scale Multi-sequence Pretraining for Generalizable MRI Analysis in Versatile Clinical Applications
- Enhancing Rumor Detection Methods with Propagation Structure Infused Language Model
- LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture-Dataflow Co-Optimization
- HealthBranches: Synthesizing Clinically-Grounded Question Answering Datasets via Decision Pathways
- Tasa: Thermal-aware 3D-Stacked Architecture Design with Bandwidth Sharing for LLM Inference
- Many-Turn Jailbreaking
- Position: Ideas Should be the Center of Machine Learning Research
- Multimodal learning with next-token prediction for large multimodal models
- Generative Artificial Intelligence Extracts Structure-Function Relationships from Plants for New Materials
- When a Paper Has 1000 Authors: Rethinking Citation Metrics in the Era of LLMs
- PASG: A Closed-Loop Framework for Automated Geometric Primitive Extraction and Semantic Anchoring in Robotic Manipulation
- ASAudio: A Survey of Advanced Spatial Audio Research
- NEP: Autoregressive Image Editing via Next Editing Token Prediction
- Comparing Knowledge Injection Methods for LLMs in a Low-Resource Regime
- Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing
- Learning by Teaching: Engaging Students as Instructors of Large Language Models in Computer Science Education
- Omni Geometry Representation Learning vs Large Language Models for Geospatial Entity Resolution
- LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
- UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
- CT-GRAPH: Hierarchical Graph Attention Network for Anatomy-Guided CT Report Generation
- Simulating LLM training workloads for heterogeneous compute and network infrastructure
- Decision-Making with Deliberation: Meta-reviewing as a Document-grounded Dialogue
- SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images
- Attention Basin: Why Contextual Position Matters in Large Language Models
- Align, Don't Divide: Revisiting the LoRA Architecture in Multi-Task Learning
- Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation
- Tesserae: Scalable Placement Policies for Deep Learning Workloads
- iFairy: the First 2-bit Complex LLM with All Parameters in \±1, ± i\
- Adversarial Attacks and Defenses on Graph-aware Large Language Models (LLMs)
- Enhancing Dialogue Annotation with Speaker Characteristics Leveraging a Frozen LLM
- SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
- FaST: Feature-aware Sampling and Tuning for Personalized Preference Alignment with Limited Data
- Open Scene Graphs for Open-World Object-Goal Navigation
- GeRe: Towards Efficient Anti-Forgetting in Continual Learning of LLM via General Samples Replay
- X-SAM: From Segment Anything to Any Segmentation
- A Reproducible, Scalable Pipeline for Synthesizing Autoregressive Model Literature
- GraphProp: Training the Graph Foundation Models using Graph Properties
- CARD: A Cache-Assisted Parallel Speculative Decoding Framework via Query-and-Correct Paradigm for Accelerating LLM Inference
- Boosting Visual Knowledge-Intensive Training for LVLMs Through Causality-Driven Visual Object Completion
- FlexQ: Efficient Post-training INT6 Quantization for LLM Serving via Algorithm-System Co-Design
- Forgetting: A New Mechanism Towards Better Large Language Model Fine-tuning
- Large Language Model's Multi-Capability Alignment in Biomedical Domain
- Audio Does Matter: Importance-Aware Multi-Granularity Fusion for Video Moment Retrieval
- Leveraging large language models for SQL behavior-based database intrusion detection
- Hierarchical Text Classification Using Black Box Large Language Models
- WARP -- Web-Augmented Real-time Program Repairer: A Real-Time Compilation Error Resolution using LLMs and Web-Augmented Synthesis
- Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
- Efficient Scaling for LLM-based ASR
- DTPA: Dynamic Token-level Prefix Augmentation for Controllable Text Generation
- Majority Bit-Aware Watermarking For Large Language Models
- Putnam-AXIOM: A Functional and Static Benchmark for Measuring Higher Level Mathematical Reasoning in LLMs
- LLMDistill4Ads: Using Cross-Encoders to Distill from LLM Signals for Advertiser Keyphrase Recommendations
- Draw Your Mind: Personalized Generation via Condition-Level Modeling in Text-to-Image Diffusion Models
- R2GenKG: Hierarchical Multi-modal Knowledge Graph for LLM-based Radiology Report Generation
- A Comparative Study of Neurosymbolic AI Approaches to Interpretable Logical Reasoning
- VLMQ: Efficient Post-Training Quantization for Large Vision-Language Models via Hessian Augmentation
- Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models
- MedBLINK: Probing Basic Perception in Multimodal Language Models for Medicine
- GrandJury: A Collaborative Machine Learning Model Evaluation Protocol for Dynamic Quality Rubrics
- A Multi-Agent System for Complex Reasoning in Radiology Visual Question Answering
- Defending Against Knowledge Poisoning Attacks During Retrieval-Augmented Generation
- ReGate: Enabling Power Gating in Neural Processing Units
- LaMPE: Length-aware Multi-grained Positional Encoding for Adaptive Long-context Scaling Without Training
- Kron-LoRA: Hybrid Kronecker-LoRA Adapters for Scalable, Sustainable Fine-tuning
- Charting 15 years of progress in deep learning for speech emotion recognition: A replication study
- Prefill-Decode Aggregation or Disaggregation? Unifying Both for Goodput-Optimized LLM Serving
- Isolating Culture Neurons in Multilingual Large Language Models
- Alleviating Attention Hacking in Discriminative Reward Modeling through Interaction Distillation
- PoeTone: A Framework for Constrained Generation of Structured Chinese Songci with LLMs
- GlaBoost: A multimodal Structured Framework for Glaucoma Risk Stratification
- MLP Memory: A Retriever-Pretrained Memory for Large Language Models
- Intention-Guided Cognitive Reasoning for Egocentric Long-Term Action Anticipation
- Enhancing the Preference Extractor in Multi-turn Dialogues: From Annotating Disasters to Accurate Preference Extraction
- EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
- MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning
- JSidentify-V2: Leveraging Dynamic Memory Fingerprinting for Mini-Game Plagiarism Detection
- Aligning Language Models with Real-time Knowledge Editing
- Multi-TW: Benchmarking Multimodal Models on Traditional Chinese Question Answering in Taiwan
- MeshLLM: Empowering Large Language Models to Progressively Understand and Generate 3D Mesh
- A Dynamic Allocation Scheme for Adaptive Shared-Memory Mapping on Kilo-core RV Clusters for Attention-Based Model Deployment
- Effective Damage Data Generation by Fusing Imagery with Human Knowledge Using Vision-Language Models
- CSIRO-LT at SemEval-2025 Task 11: Adapting LLMs for Emotion Recognition for Multiple Languages
- DisTaC: Conditioning Task Vectors via Distillation for Robust Model Merging
- ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation
- Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
- Latent Knowledge Scalpel: Precise and Massive Knowledge Editing for Large Language Models
- Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models
- From Individuals to Crowds: Dual-Level Public Response Prediction in Social Media
- CoT-Self-Instruct: Building high-quality synthetic prompts for reasoning and non-reasoning tasks
- Deep Learning-based Prediction of Clinical Trial Enrollment with Uncertainty Estimates
- Causal2Vec: Improving Decoder-only LLMs as Versatile Embedding Models
- Unveiling Super Experts in Mixture-of-Experts Large Language Models
- PixNerd: Pixel Neural Field Diffusion
- Fine-Grained Privacy Extraction from Retrieval-Augmented Generation Systems via Knowledge Asymmetry Exploitation
- Not Just What, But When: Integrating Irregular Intervals to LLM for Sequential Recommendation
- LENS: Learning Ensemble Confidence from Neural States for Multi-LLM Answer Integration
- Phi-Ground Tech Report: Advancing Perception in GUI Grounding
- Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems
- Learning Like Humans: Resource-Efficient Federated Fine-Tuning through Cognitive Developmental Stages
- Distilling Knowledge from Large Language Models: A Concept Bottleneck Model for Hate and Counter Speech Recognition
- KLLM: Fast LLM Inference with K-Means Quantization
- LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing
- Exploiting Synergistic Cognitive Biases to Bypass Safety in LLMs
- Beyond Single Labels: Improving Conversational Recommendation through LLM-Powered Data Augmentation
- IFEvalCode: Controlled Code Generation
- What is an "Abstract Reasoner"? Revisiting Experiments and Arguments about Large Language Models
Related