Self-Refine: Iterative Refinement with Self-Feedback
2023/03/30 by Aman Madaan, Niket Tandon, Madaan, Aman +29 · 1 voice · 564 citations
Computer Science · #Natural Language Processing Techniques #Speech and dialogue systems #Topic Modeling #cs.AI #cs.CL #cs.LG
paper · pdf · doi:10.48550/arxiv.2303.17651
arxiv published 2023/03/30 · arxiv updated 2023/05/25
Abstract
Like humans, large language models (LLMs) do not always generate the best output on their first try. Motivated by how humans refine their written text, we introduce Self-Refine, an approach for improving initial outputs from LLMs through iterative feedback and refinement. The main idea is to generate an initial output using an LLMs; then, the same LLMs provides feedback for its output and uses it to refine itself, iteratively. Self-Refine does not require any supervised training data, additional training, or reinforcement learning, and instead uses a single LLM as the generator, refiner, and feedback provider. We evaluate Self-Refine across 7 diverse tasks, ranging from dialog response generation to mathematical reasoning, using state-of-the-art (GPT-3.5, ChatGPT, and GPT-4) LLMs. Across all evaluated tasks, outputs generated with Self-Refine are preferred by humans and automatic metrics over those generated with the same LLM using conventional one-step generation, improving by ~20% absolute on average in task performance. Our work demonstrates that even state-of-the-art LLMs like GPT-4 can be further improved at test time using our simple, standalone approach.
Cited by
- Discrete prompt optimization using genetic algorithm for secure Python code generation
- Reinforcement Learning via Self-Distillation
- Single LLM Debate, MoLaCE: Mixture of Latent Concept Experts Against Confirmation Bias
- SPIRAL: Symbolic LLM Planning via Grounded and Reflective Search
- Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs
- NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Code
- FasterPy: An LLM-based Code Execution Efficiency Optimization Framework
- CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation
- Scaling Unverifiable Rewards: A Case Study on Visual Insights
- SANet: A Semantic-aware Agentic AI Networking Framework for Cross-layer Optimization in 6G
- From Unstructured Recall to Schema-Grounded Memory: Reliable AI Memory via Iterative, Schema-Aware Extraction
- Synthesizing Multi-Agent Harnesses for Vulnerability Discovery
- DualityCert: Verifier-Gated Language-Model Repair of Broken Duality Claims in Quantum Field Theory
- Training Language Models to Cooperate with Inference-Time Controllers
- Are Prompt Optimizers Blind? Cross-Modal Visual Feedback for Automatic Prompt Optimization
- CONSISTRE: A Unified Consistency-Aware Framework for Document-Level Relation Extraction with Large Language Models
- Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents
- Falsifiable Commitment Planning for Self-Correcting Web Agents
- Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets
- StanceFlip: A Comprehensive Multi-Dimensional Benchmark for Multimodal Conversational Stance Flipping Forecasting
- Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair
- SymStep: Symbolic Step Verification for Logical Reasoning
- ConsistencyGate: Preventing Memory Contamination in LLM Agents via Self-Consistency Admission Control
- Reason Popper-ly: Patching In-Context Reasoning with Inductive Logic Programming
- In-Context Learning as Implicit Policy Gradient
- AssumptionMiner: Extracting, Tracing, and Revising Implicit Assumptions in LLM Code Generation
- Agent Team Work Zone: An Automated, Persistent Workspace for Long-Lived Claude Code Agent Teams
- StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
- AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning
- AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities
- SourceMinds at CheckThat! 2026: NLI-Grounded Citation Auditing in a Multi-Agent Pipeline for Full Fact-Checking Article Generation
- When Thinking Before Retrieval Hurts: TraceBound Diagnostics for Adaptive Knowledge-Graph Retrieval
- Influence of Prompt Engineering on Small Language Models for Guarded Query Routing
- Do Language Models Converge to Themselves? Recursive Self-Refinement as Textual Relaxation
- Measuring and Improving Behavioral Consistency in Large Language Models through Fact-Heuristic-Emotion State Enforcement
- DeepLook: Deeper Thinking with Lookahead
- Procedural Knowledge at Scale Improves Reasoning
- StAR: Segment Anything Reasoner
- SERM: Self-Evolving Relevance Model with Agent-Driven Learning from Massive Query Streams
- Method Decoration (DeMe): A Framework for LLM-Driven Adaptive Method Generation in Dynamic IoT Environments
- From Shallow Humor to Metaphor: Towards Label-Free Harmful Meme Detection via LMM Agent Self-Improvement
- The AI Committee: A Multi-Agent Framework for Automated Validation and Remediation of Web-Sourced Data
- Policy-Conditioned Policies for Multi-Agent Task Solving
- Reflection Pretraining Enables Token-Level Self-Correction in Biological Sequence Models
- Pioneering Multimodal Emotion Recognition in the Era of Large Models: From Closed Sets to Open Vocabularies
- MAR:Multi-Agent Reflexion Improves Reasoning Abilities in LLMs
- Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
- Debate-Enhanced Pseudo Labeling and Frequency-Aware Progressive Debiasing for Weakly-Supervised Camouflaged Object Detection with Scribble Annotations
- Population-Evolve: a Parallel Sampling and Evolutionary Method for LLM Math Reasoning
- CienaLLM: Generative Climate-Impact Extraction from News Articles with Autoregressive LLMs
- OpenView: Empowering MLLMs with Out-of-view VQA
- LLMs on Drugs: Language Models Are Few-Shot Consumers
- Reflective Confidence: Correcting Reasoning Flaws via Online Self-Correction
- A Multi-agent Text2SQL Framework using Small Language Models and Execution Feedback
- Intelligent Human-Machine Partnership for Manufacturing: Enhancing Warehouse Planning through Simulation-Driven Knowledge Graphs and LLM Collaboration
- External Hippocampus: Topological Cognitive Maps for Guiding Large Language Model Reasoning
- NL2CA: Auto-formalizing Cognitive Decision-Making from Natural Language Using an Unsupervised CriticNL2LTL Framework
- Emergent Bias and Fairness in Multi-Agent Decision Systems
- Beyond Blind Spots: Analytic Hints for Mitigating LLM-Based Evaluation Pitfalls
- Step-GUI Technical Report
- SCOPE: Prompt Evolution for Enhancing Agent Effectiveness
- Evaluating LLMs for Zeolite Synthesis Event Extraction (ZSEE): A Systematic Analysis of Prompting Strategies
- The Meta-Prompting Protocol: Orchestrating LLMs via Adversarial Feedback Loops
- Re-opening open-source science through AI assisted development
- Grammar Search for Multi-Agent Systems
- Error-Driven Prompt Optimization for Arithmetic Reasoning
- MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents
- LOOPRAG: Enhancing Loop Transformation Optimization with Retrieval-Augmented Large Language Models
- FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modularized Collaboration
- AI-Native Inference States: A Cross-Architecture Qualitative Framework for Large Language Model Behavior
- Cooperative Retrieval-Augmented Generation for Question Answering: Mutual Information Exchange and Ranking by Contrasting Layers
- Fed-SE: Federated Self-Evolution for Privacy-Constrained Multi-Environment LLM Agents
- Metric-Fair Prompting: Treating Similar Samples Similarly
- Toward More Reliable Artificial Intelligence: Reducing Hallucinations in Vision-Language Models
- Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy Optimization
- VIGIL: A Reflective Runtime for Self-Healing Agents
- DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning
- Towards Small Language Models for Security Query Generation in SOC Workflows
- DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
- The Missing Layer of AGI: From Pattern Alchemy to Coordination Physics
- MARINE: Theoretical Optimization and Design for Multi-Agent Recursive IN-context Enhancement
- The Road of Adaptive AI for Precision in Cybersecurity
- Learning from Self Critique and Refinement for Faithful LLM Summarization
- RefineBench: Evaluating Refinement Capability of Language Models via Checklists
- SEAL: Self-Evolving Agentic Learning for Conversational Question Answering over Knowledge Graphs
- On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference
- Balancing Safety and Helpfulness in Healthcare AI Assistants through Iterative Preference Alignment
- Reason-Plan-ReAct: A Reasoner-Planner Supervising a ReAct Executor for Complex Enterprise Tasks
- Tutorial on Large Language Model-Enhanced Reinforcement Learning for Wireless Networks
- PARC: An Autonomous Self-Reflective Coding Agent for Robust Execution of Long-Horizon Tasks
- SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning
- Self-Improving VLM Judges Without Human Annotations
- Enhancing Automated Paper Reproduction via Prompt-Free Collaborative Agents
- WISE: Weighted Iterative Society-of-Experts for Robust Multimodal Multi-Agent Debate
- When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers
- LeechHijack: Covert Computational Resource Exploitation in Intelligent Agent Systems
- COACH: Collaborative Agents for Contextual Highlighting -- A Multi-Agent Framework for Sports Video Analysis
- DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks
- Real-Time Procedural Learning From Experience for AI Agents
- Evaluating LLMs for One-Shot Patching of Real and Artificial Vulnerabilities
- Toward a Safe Internet of Agents
- ThetaEvolve: Test-time Learning on Open Problems
- Towards Continuous Intelligence Growth: Self-Training, Continual Learning, and Dual-Scale Memory in SuperIntelliAgent
- Multi-chain Graph Refinement and Selection for Reliable Reasoning in Large Language Models
- Adapting Like Humans: A Metacognitive Agent with Test-time Reasoning
- DocVAL: Validated Chain-of-Thought Distillation for Grounded Document VQA
- Rethinking Test Time Scaling for Flow-Matching Generative Models
- Focused Chain-of-Thought: Efficient LLM Reasoning via Structured Input Information
- Statistical Independence Aware Caching for LLM Workflows
- On the Limits of Innate Planning in Large Language Models
- BAMAS: Structuring Budget-Aware Multi-Agent Systems
- EWE: An Agentic Framework for Extreme Weather Analysis
- Scaling Generative Verifiers For Natural Language Mathematical Proof Verification And Selection
- REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
- Semimage: HSV-Based Semantic Image Encoding for Disentangled Text Representation
- More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering
- Knowing How to Edit: Reliable Evaluation Signals for Diagnosing and Optimizing Prompts at Query Level
- Majority of the Bests: Improving Best-of-N via Bootstrapping
- A2Flow: Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- Towards a General Framework for HTN Modeling with LLMs
- SPINE: Token-Selective Test-Time Reinforcement Learning with Entropy-Band Regularization
- MultiGA: Leveraging Multi-Source Seeding in Genetic Algorithms
- Learning to Debug: LLM-Organized Knowledge Trees for Solving RTL Assertion Failures
- Budget-Aware Tool-Use Enables Effective Agent Scaling
- SDA: Steering-Driven Distribution Alignment for Open LLMs without Fine-Tuning
- PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization
- AutoBackdoor: Automating Backdoor Attacks via LLM Agents
- InfCode: Adversarial Iterative Refinement of Tests and Patches for Reliable Software Issue Resolution
- Reflexive Evidence-Based Multimodal Learning for Clean Energy Transitions: Causal Insights on Cooking Fuel Access, Urbanization, and Carbon Emissions
- From Solving to Verifying: A Unified Objective for Robust Reasoning in LLMs
- SVBRD-LLM: Self-Verifying Behavioral Rule Discovery for Autonomous Vehicle Identification
- Extending Test-Time Scaling: A 3D Perspective with Context, Batch, and Turn
- ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing
- Dynamic Template Selection for Output Token Generation Optimization: MLP-Based and Transformer Approaches
- TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
- Cost-Driven Synthesis of Sound Abstract Interpreters
- CorrectAD: A Self-Correcting Agentic System to Improve End-to-end Planning in Autonomous Driving
- Think with Self-Decoupling and Self-Verification: Automated RTL Design with Backtrack-ToT
- From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
- Prompt-Driven Domain Adaptation for End-to-End Autonomous Driving via In-Context RL
- Can large language models be a cardinality estimator? An empirical study
- Genomic Next-Token Predictors are In-Context Learners
- Consistency Is the Key: Detecting Hallucinations in LLM Generated Text By Checking Inconsistencies About Key Facts
- ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
- Beyond Elicitation: Provision-based Prompt Optimization for Knowledge-Intensive Tasks
- GPR: Towards a Generative Pre-trained One-Model Paradigm for Large-Scale Advertising Recommendation
- Efficient Thought Space Exploration Through Strategic Intervention
- Mastering Olympiad-Level Physics with Artificial Intelligence
- AI Annotation Orchestration: Evaluating LLM verifiers to Improve the Quality of LLM Annotations in Learning Analytics
- MM-CRITIC: A Holistic Evaluation of Large Multimodal Models as Multimodal Critique
- Chain of Summaries: Summarization Through Iterative Questioning
- Bot Meets Shortcut: How Can LLMs Aid in Handling Unknown Invariance OOD Scenarios?
- General Intelligence-based Fragmentation (GIF): A framework for peak-labeled spectra simulation
- Adaptive Multi-Agent Response Refinement in Conversational Systems
- Dual-Process Scaffold Reasoning for Enhancing LLM Code Debugging
- Accelerating Training Speed of Tiny Recursive Models with Curriculum Guided Adaptive Recursion
- AURORA: Autonomous Updating of ROM and Controller via Recursive Adaptation
- Investigating CoT Monitorability in Large Reasoning Models
- Ratchet: A Minimal Hygiene Recipe for Self-Evolving LLM Agents
- Beyond Detection: Exploring Evidence-based Multi-Agent Debate for Misinformation Intervention and Persuasion
- Steering LLMs toward Korean Local Speech: Iterative Refinement Framework for Faithful Dialect Translation
- S-DAG: A Subject-Based Directed Acyclic Graph for Multi-Agent Heterogeneous Reasoning
- Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement
- FLEX: Continuous Agent Evolution via Forward Learning from Experience
- Maestro: Learning to Collaborate via Conditional Listwise Policy Optimization for Multi-Agent LLMs
- ScRPO: From Errors to Insights
- Reflective Personalization Optimization: A Post-hoc Rewriting Framework for Black-Box Large Language Models
- Monitor-Generate-Verify (MGV): Formalising Metacognitive Theory for Language Model Reasoning
- Plan of Knowledge: Retrieval-Augmented Large Language Models for Temporal Knowledge Graph Question Answering
- Secure Code Generation at Scale with Reflexion
- Analyzing the Power of Chain of Thought through Memorization Capabilities
- How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals
- The ORCA Benchmark: Evaluating Real-World Calculation Accuracy in Large Language Models
- ReAcTree: Hierarchical LLM Agent Trees with Control Flow for Long-Horizon Task Planning
- The Sequential Edge: Inverse-Entropy Voting Beats Parallel Self-Consistency at Matched Compute
- Context-Guided Decompilation: A Step Towards Re-executability
- Knowledge Elicitation with Large Language Models for Interpretable Cancer Stage Identification from Pathology Reports
- How Focused Are LLMs? A Quantitative Study via Repetitive Deterministic Prediction Tasks
- Separate the Wheat from the Chaff: Winnowing Down Divergent Views in Retrieval Augmented Generation
- Test-time Scaling of LLMs: A Survey from A Subproblem Structure Perspective
- GDPR-Bench-Android: A Benchmark for Evaluating Automated GDPR Compliance Detection in Android
- Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
- Sherlock: Reliable and Efficient Agentic Workflow Execution
- Inverse Knowledge Search over Verifiable Reasoning: Synthesizing a Scientific Encyclopedia from a Long Chains-of-Thought Knowledge Base
- CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments
- InfoFlow: Reinforcing Search Agent Via Reward Density Optimization
- LoCoT2V-Bench: A Benchmark for Long-Form and Complex Text-to-Video Generation
- RCScore: Quantifying Response Consistency in Large Language Models
- QCoder Benchmark: Bridging Language Generation and Quantum Hardware through Simulator-Based Feedback
- Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph
- RECAP: Reproducing Copyrighted Data from LLMs Training with an Agentic Pipeline
- Debate2Create: Robot Co-design via Large Language Model Debates
- A Survey on Efficient Large Language Model Training: From Data-centric Perspectives
- LLM-as-a-Verifier: A General-Purpose Verification Framework
- Rethinking the Evaluation of Harness Evolution for Agents
- Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents
- AgenticCANN: Automated Ascend C Operator Generation via Knowledge-Augmented Agentic Evolution
- Try Again, Don't Look Back: Blind Resampling Outperforms Self-Repair in Small Code Models
- TraceCoder: Explainable and Auditable Code Generation with Position-Key Snippet Versioning
- EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
- Lang-PINN: From Language to Physics-Informed Neural Networks via a Multi-Agent Framework
- Enhancing Generative Information Extraction with Two-step Validation: A Product Attribute Use Case
- Truth-Aware Decoding: A Program-Logic Approach to Factual Language Generation
- Two Calls Beat Five Agents: Evaluating Multi-Agent Pipelines Against Self-Refinement for Local Language Models
- Beyond Action Imitation: Learning a Decision-Aware User Simulator for Online Advertising
- Autodata: An agentic data scientist to create high quality synthetic data
- SkillCAT: Contrastive, Assessment-Augmented and Topology-AwareSkill Self-Evolution for LLM Agents
- Flows: Building Blocks of Reasoning and Collaborating AI
- Library Drift: Diagnosing and Fixing a Silent Failure Mode in Self-Evolving LLM Skill Libraries
- SkillOpt: Executive Strategy for Self-Evolving Agent Skills
- optimizeanything: Unified Text Optimization can Outperform Specialized Systems
- STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision
- Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft
- LANPO: Bootstrapping Language and Numerical Feedback for Reinforcement Learning in LLMs
- FELA: A Multi-Agent Evolutionary System for Feature Engineering of Industrial Event Log Data
- Adaptive Proof Refinement with LLM-Guided Strategy Selection
- StorageXTuner: An LLM Agent-Driven Automatic Tuning Framework for Heterogeneous Storage Systems
- Aligning Large Language Models with Procedural Rules: An Autoregressive State-Tracking Prompting for In-Game Trading
- FT-ARM: Fine-Tuned Agentic Reflection Multimodal Language Model for Pressure Ulcer Severity Classification with Reasoning
- CritiCal: Can Critique Help LLM Uncertainty or Confidence Calibration?
- VDSAgents: A PCS-Guided Multi-Agent System for Veridical Data Science Automation
- Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
- Before you , monitor: Implementing Flavell's metacognitive framework in LLMs
- Is Your Prompt Poisoning Code? Defect Induction Rates and Security Mitigation Strategies
- Language Server CLI Empowers Language Agents with Process Rewards
- Scalable Supervising Software Agents with Patch Reasoner
- Accelerating Materials Design via LLM-Guided Evolutionary Search
- Scalable Oversight via Partitioned Human Supervision
- Hollywood Town: Long-Video Generation via Cross-Modal Multi-Agent Orchestration
- FLAMES: Fine-tuning LLMs to Synthesize Invariants for Smart Contract Security
- Boosting Accuracy and Efficiency of Budget Forcing in LLMs via Reinforcement Learning for Mathematical Reasoning
- VISTA: A Test-Time Self-Improving Video Generation Agent
- AgentArcEval: An Architecture Evaluation Method for Foundation Model based Agents
- Automated Cloud Infrastructure-as-Code Reconciliation with AI Agents
- Finding the Sweet Spot: Trading Quality, Cost, and Speed During Inference-Time LLM Reflection
- Code-enabled language models can outperform reasoning models on diverse tasks
- Learning from Supervision with Semantic and Episodic Memory: A Reflective Approach to Agent Adaptation
- Learning Affordances at Inference-Time for Vision-Language-Action Models
- Knowledge-Guided Multi-Agent Framework for Application-Level Software Code Generation
- Communication to Completion: Modeling Collaborative Workflows with Intelligent Multi-Agent Communication
- WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality
- Prompting the Priorities: A First Look at Evaluating LLMs for Vulnerability Triage and Prioritization
- PlanU: Large Language Model Reasoning through Planning under Uncertainty
- Chain-of-Conceptual-Thought Elicits Daily Conversation in Large Language Models
- Med-VRAgent: A Framework for Medical Visual Reasoning-Enhanced Agents
- InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration
- Illusions of reflection: open-ended task reveals systematic failures in Large Language Models' reflective reasoning
- Deep Self-Evolving Reasoning
- Empowering Real-World: A Survey on the Technology, Practice, and Evaluation of LLM-driven Industry Agents
- Certified Self-Consistency: Statistical Guarantees and Test-Time Training for Reliable Reasoning in LLMs
- Auto-Rubric: Learning From Implicit Weights to Explicit Rubrics for Reward Modeling
- StreamingThinker: Large Language Models Can Think While Reading
- Integrating Performance Tools in Model Reasoning for GPU Kernel Optimization
- An Agentic Framework with LLMs for Solving Complex Vehicle Routing Problems
- Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
- Rewiring Experts on the Fly:Continuous Rerouting for Better Online Adaptation in Mixture-of-Expert models
- LSPO: Length-aware Dynamic Sampling for Policy Optimization in LLM Reasoning
- Stable but Miscalibrated: A Kantian View on Overconfidence from Filters to Large Language Models
- Are My Optimized Prompts Compromised? Exploring Vulnerabilities of LLM-based Optimizers
- LLM-ERM: Sample-Efficient Program Learning via LLM-Guided Search
- CodeEvolve: An open source evolutionary coding agent for algorithm discovery and optimization
- Training LLM Agents to Empower Humans
- Retrieval-in-the-Chain: Bootstrapping Large Language Models for Generative Retrieval
- Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling
- Generative Universal Verifier as Multimodal Meta-Reasoner
- LLM Prompt Duel Optimizer: Efficient Label-Free Prompt Optimization
- BoN Appetit Team at LeWiDi-2025: Best-of-N Test-time Scaling Can Not Stomach Annotation Disagreements (Yet)
- Self-Verifying Reflection Helps Transformers with CoT Reasoning
- Multi-stage Prompt Refinement for Mitigating Hallucinations in Large Language Models
- LLM Reasoning for Machine Translation: Synthetic Data Generation over Thinking Tokens
- DMAS-Forge: A Framework for Transparent Deployment of AI Applications as Distributed Systems
- ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
- KnowRL: Teaching Language Models to Know What They Know
- FOSSIL: Harnessing Feedback on Suboptimal Samples for Data-Efficient Generalisation with Imitation Learning for Embodied Vision-and-Language Tasks
- Generative AI for Biosciences: Emerging Threats and Roadmap to Biosecurity
- Tracing the Traces: Latent Temporal Signals for Efficient and Accurate Reasoning
- Towards Self-Refinement of Vision-Language Models with Triangular Consistency
- PrediQL: Automated Testing of GraphQL APIs with LLMs
- Generating Findings for Jaw Cysts in Dental Panoramic Radiographs Using GPT-4o: Building a Two-Stage Self-Correction Loop with Structured Output (SLSO) Framework
- MatryoshkaThinking: Recursive Test-Time Scaling Enables Efficient Reasoning
- Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models
- Failure-Driven Workflow Refinement
- Reallocating Attention Across Layers to Reduce Multimodal Hallucination
- Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
- MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
- SIA: Self Improving AI with Harness & Weight Updates
- Signals: Trajectory Sampling and Triage for Agentic Interactions
- Meta-Harness: End-to-End Optimization of Model Harnesses
- The Price Reversal Phenomenon: When Cheaper Reasoning Models Cost More
- Enhancing Faithfulness in Abstractive Summarization via Span-Level Fine-Tuning
- Autonomous Agents for Scientific Discovery: Orchestrating Scientists, Language, Code, and Physics
- MEC3O: Multi-Expert Consensus for Code Time Complexity Prediction
- Automated Refinement of Essay Scoring Rubrics for Language Models via Reflect-and-Revise
- Fundamentals of Building Autonomous LLM Agents
- FOR-Prompting: From Objection to Revision via an Asymmetric Prompting Protocol
- COMPASS: Enhancing Agent Long-Horizon Reasoning with Evolving Context
- Agent Learning via Early Experience
- Detecting and Mitigating Insertion Hallucination in Video-to-Audio Generation
- LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
- Haibu Mathematical-Medical Intelligent Agent:Enhancing Large Language Model Reliability in Medical Tasks via Verifiable Reasoning Chains
- Selection, Reflection and Self-Refinement: Revisit Reasoning Tasks via a Causal Lens
- ReInAgent: A Context-Aware GUI Agent Enabling Human-in-the-Loop Mobile Task Navigation
- Towards Reliable LLM-based Robot Planning via Combined Uncertainty Estimation
- Traceability and Accountability in Role-Specialized Multi-Agent LLM Pipelines
- An Adaptive Multi Agent Bitcoin Trading System
- MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding
- Training-Free Group Relative Policy Optimization
- AgentAsk: Multi-Agent Systems Need to Ask
- MAPRO: Recasting Multi-Agent Prompt Optimization as Maximum a Posteriori Inference
- TS-Agent: Understanding and Reasoning Over Raw Time Series via Iterative Insight Gathering
- On the Convergence of Moral Self-Correction in Large Language Models
- Don't Adapt Small Language Models for Tools; Adapt Tool Schemas to the Models
- CARPAS: Towards Content-Aware Refinement of Provided Aspects for Summarization in Large Language Models
- Experiential Reinforcement Learning
- CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
- Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation
- GRACE: A Language Model Framework for Explainable Inverse Reinforcement Learning
- Prompt reinforcing for long-term planning of large language models
- ARM: Discovering Agentic Reasoning Modules for Generalizable Multi-Agent Systems
- RareAgent: Self-Evolving Reasoning for Drug Repurposing in Rare Diseases
- RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
- Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails
- Trade in Minutes! Rationality-Driven Agentic System for Quantitative Financial Trading
- Bridging Reasoning to Learning: Unmasking Illusions using Complexity Out of Distribution Generalization
- AlphaApollo: Orchestrating Foundation Models and Professional Tools into a Self-Evolving System for Deep Agentic Reasoning
- Large Language Models Hallucination: A Comprehensive Survey
- SPOGW: a Score-based Preference Optimization method via Group-Wise comparison for workflows
- Searching Meta Reasoning Skeleton to Guide LLM Reasoning
- JEF-Hinter: Leveraging Offline Knowledge for Improving Web Agents Adaptation
- A global log for medical AI
- LLM Chemistry Estimation for Multi-LLM Recommendation
- Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models
- Adversarial Agent Collaboration for C to Rust Translation
- Proactive Conversational AI: A Comprehensive Survey of Advancements and Opportunities
- Lateral Tree-of-Thoughts Surpasses ToT by Incorporating Logically-Consistent, Low-Utility Candidates
- Self-Reflective Generation at Test Time
- AutoMaAS: Self-Evolving Multi-Agent Architecture Search for Large Language Models
- Test-Time Search in Neural Graph Coarsening Procedures for the Capacitated Vehicle Routing Problem
- Rethinking Reward Models for Multi-Domain Test-Time Scaling
- Structuring Reasoning for Complex Rules Beyond Flat Representations
- In-Place Feedback: Reliable Refinement for Multi-Turn Expert-LLM Collaboration
- Rethinking Thinking Tokens: LLMs as Improvement Operators
- Recursive Self-Aggregation Unlocks Deep Thinking in Large Language Models
- ACT: Agentic Classification Tree
- Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts
- DyFlow: Dynamic Workflow Framework for Agentic Reasoning
- Scalable and Robust LLM Unlearning by Correcting Responses with Retrieved Exclusions
- ReNF: Rethinking the Design of Neural Long-Term Time Series Forecasters
- MADS: Multi-Agent Dialogue Simulation for Diverse Persuasion Data Generation
- TUMIX: Multi-Agent Test-Time Scaling with Tool-Use Mixture
- ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory
- SecInfer: Preventing Prompt Injection via Inference-time Scaling
- PhysicsMinions: Winning Gold Medals in the Latest Physics Olympiads with a Coevolutionary Multimodal Multi-Agent System
- Learning to Ponder: Adaptive Reasoning in Latent Space
- ContextPRM: Leveraging Contextual Coherence for multi-domain Test-Time Scaling
- Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards
- Agentar-Scale-SQL: Advancing Text-to-SQL through Orchestrated Test-Time Scaling
- MASH: A Multiplatform and Multimodal Annotated Dataset for Societal Impact of Hurricane
- Large-Scale Constraint Generation -- Can LLMs Parse Hundreds of Constraints?
- GUI-PRA: Process Reward Agent for GUI Tasks
- Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection
- LAGEA: Language Guided Embodied Agents for Robotic Manipulation
- HEART: Emotionally-driven test-time scaling of Language Models
- Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning
- InfiAgent: Self-Evolving Pyramid Agent Framework for Infinite Scenarios
- PRIME: Planning and Retrieval-Integrated Memory for Enhanced Reasoning
- Think Right, Not More: Test-Time Scaling for Numerical Claim Verification
- A2R: An Asymmetric Two-Stage Reasoning Framework for Parallel Reasoning
- Teaching Transformers to Solve Combinatorial Problems through Efficient Trial & Error
- Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
- FlexMind: Supporting Deeper Creative Thinking with LLMs
- Correct Reasoning Paths Visit Shared Decision Pivots
- A Fano-Style Accuracy Upper Bound for LLM Single-Pass Reasoning in Multi-Hop QA
- PALADIN: Self-Correcting Language Model Agents to Cure Tool-Failure Cases
- Hallucination-Resistant, Domain-Specific Research Assistant with Self-Evaluation and Vector-Grounded Retrieval
- Few-Shot and Training-Free Review Generation via Conversational Prompting
- Automated Multi-Agent Workflows for RTL Design
- Calibrated Reasoning: An Explanatory Verifier for Dynamic and Efficient Problem-Solving
- SIM-CoT: Supervised Implicit Chain-of-Thought
- LOCA: Logical Chain Augmentation for Scientific Corpus Cleaning
- Evaluating Agentic Bioinformatics through Function, Evidence, and Validation
- What makes prompts a graph: necessary and sufficient conditions for prompt graph engineering
- Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch
- LabEvolver: Training-Free Experience Evolution for Safe and Grounded Wet-Lab Agents
- LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger
- SKIMIX: Multi-Agent Harness-Time Scaling with Skill Mixture for Dynamic Harness Engineering
- Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents
- Auditing Emergent LLM-Agent Collaboration through Cooperation-Obligation Coupling
- Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs
- SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge
- Can Large Language Models Resolve Semantic Discrepancy in Self-Destructive Subcultures? Evidence from Jirai Kei
- Co-FactChecker: A Framework for Human-AI Collaborative Claim Verification Using Large Reasoning Models
- In Situ Graph Reasoning and Knowledge Expansion Using Graph‐PRefLexOR
- Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions
- Reflect before Act: Proactive Error Correction in Language Models
- Agentic AutoSurvey: Let LLMs Survey LLMs
- CCQA: Generating Question from Solution Can Improve Inference-Time Reasoning in SLMs
- Autonomous Data Agents: A New Opportunity for Smart Data
- Investigating Test-Time Scaling with Reranking for Machine Translation
- GnnXemplar: Exemplars to Explanations -- Natural Language Rules for Global GNN Interpretability
- OnePiece: Bringing Context Engineering and Reasoning to Industrial Cascade Ranking System
- Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models
- From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations
- REFER: Mitigating Bias in Opinion Summarisation via Frequency Framed Prompting
- Generalizability of Large Language Model-Based Agents: A Comprehensive Survey
- SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models
- (P)rior(D)yna(F)low: A Priori Dynamic Workflow Construction via Multi-Agent Collaboration
- Large Language Models in Operations Research: Methods, Applications, and Challenges
- DSCC-HS: A Dynamic Self-Reinforcing Framework for Hallucination Suppression in Large Language Models
- VerilogMonkey: Exploring Parallel Scaling for Automated Verilog Code Generation with LLMs
- Slim-SC: Thought Pruning for Efficient Scaling with Self-Consistency
- FVDebug: An LLM-Driven Debugging Assistant for Automated Root Cause Analysis of Formal Verification Failures
- An LLM Agentic Approach for Legal-Critical Software: A Case Study for Tax Prep Software
- PREFINE: Personalized Story Generation via Simulated User Critics and User-Specific Rubric Generation
- REFINER: Reasoning Feedback on Intermediate Representations
- The LLM Already Knows: Estimating LLM-Perceived Question Difficulty via Hidden Representations
- Routing Distilled Knowledge via Mixture of LoRA Experts for Large Language Model based Bundle Generation
- EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer
- Mitigating Strategy Preference Bias in Emotional Support Conversation via Uncertainty Estimations
- Large Language Model-Based Automatic Formulation for Stochastic Optimization Models
- FLAIRR-TS -- Forecasting LLM-Agents with Iterative Refinement and Retrieval for Time Series
- Audited Reasoning Refinement: Fine-Tuning Language Models via LLM-Guided Step-Wise Evaluation and Correction
- AgenticIE: An Adaptive Agent for Information Extraction from Complex Regulatory Documents
- Self-Evolving LLMs via Continual Instruction Tuning
- The Prompt Engineering Report Distilled: Quick Start Guide for Life Sciences
- Free-MAD: Consensus-Free Multi-Agent Debate
- Difficulty-Aware Agentic Orchestration for Query-Specific Multi-Agent Workflows
- Towards Automated Error Discovery: A Study in Conversational AI
- Contrastive Prompt Clustering for Weakly Supervised Semantic Segmentation
- Unveiling the Latent Directions of Reflection in Large Language Models
- MusicScaffold: Bridging Machine Efficiency and Human Growth in Adolescent Creative Education through Generative AI
- XAgents: A Unified Framework for Multi-Agent Cooperation via IF-THEN Rules and Multipolar Task Processing Graph
- Bridging the Capability Gap: Joint Alignment Tuning for Harmonizing LLM-based Multi-Agent Systems
- AI Reasoning for Wireless Communications and Networking: A Survey and Perspectives
- Dream to Chat: Model-based Reinforcement Learning on Dialogues with User Belief Modeling
- PromptGuard: An Orchestrated Prompting Framework for Principled Synthetic Text Generation for Vulnerable Populations using LLMs with Enhanced Safety, Fairness, and Controllability
- Evaluating LLMs Without Oracle Feedback: Agentic Annotation Evaluation Through Unsupervised Consistency Signals
- Co-Investigator AI: The Rise of Agentic AI for Smarter, Trustworthy AML Compliance Narratives
- Agents of Discovery
- Unleashing the True Potential of LLMs: A Feedback-Triggered Self-Correction with Long-Term Multipath Decoding
- RAFFLES: Reasoning-based Attribution of Faults for LLM Systems
- UNH at CheckThat! 2025: Fine-tuning Vs Prompting in Claim Extraction
- Another Turn, Better Output? A Turn-Wise Analysis of Iterative LLM Prompting
- Empirical Study of Code Large Language Models for Binary Security Patch Detection
- Reverse-Engineered Reasoning for Open-Ended Generation
- Orchestrator: Active Inference for Multi-Agent Systems in Long-Horizon Tasks
- Talk Isn't Always Cheap: Understanding Failure Modes in Multi-Agent Debate
- Guideline-Consistent Segmentation via Multi-Agent Refinement
- Conceptual Schema Inference for Tabular Datasets using Large Language Models
- ArcMemo: Abstract Reasoning Composition with Lifelong LLM Memory
- KubeGuard: LLM-Assisted Kubernetes Hardening via Configuration Files and Runtime Logs Analysis
- TAGAL: Tabular Data Generation using Agentic LLM Methods
- Long-Horizon Visual Imitation Learning via Plan and Code Reflection
- A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
- A Probabilistic Inference Scaling Theory for LLM Self-Correction
- Code Like Humans: A Multi-Agent Solution for Medical Coding
- Instance-Wise Adaptive Sampling for Dataset Construction in Approximating Inverse Problem Solutions
- AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
- Mitigation of Gender and Ethnicity Bias in AI-Generated Stories through Model Explanations
- Planning with Reasoning using Vision Language World Model
- ProST: Progressive Sub-task Training for Pareto-Optimal Multi-agent Systems Using Small Language Models
- Inducing Faithfulness in Structured Reasoning via Counterfactual Sensitivity
- Vis-CoT: A Human-in-the-Loop Framework for Interactive Visualization and Intervention in LLM Chain-of-Thought Reasoning
- RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness
- QueryBandits for Hallucination Mitigation: Exploiting Semantic Features for No-Regret Rewriting
- LLM-Assisted Iterative Evolution with Swarm Intelligence Toward SuperBrain
- GIER: Gap-Driven Self-Refinement for Large Language Models
- Scaling Up, Speeding Up: A Benchmark of Speculative Decoding for Efficient LLM Test-Time Scaling
- Transforming Agency. On the mode of existence of Large Language Models
- PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains
- Challenges and Applications of Large Language Models: A Comparison of GPT and DeepSeek family of models
- MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning
- Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework
- HiVA: Self-organized Hierarchical Variable Agent via Goal-driven Semantic-Topological Evolution
- Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision
- Language-Enhanced Mobile Manipulation for Efficient Object Search in Indoor Environments
- Prompting Strategies for Language Model-Based Item Generation in K-12 Education: Bridging the Gap Between Small and Large Language Models
- Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs
- Entropy-Guided Loop: Achieving Reasoning through Uncertainty-Aware Generation
- GENIE-ASI: Generative Instruction and Executable Code for Analog Subcircuit Identification
- Test-time Corpus Feedback: From Retrieval to RAG
- Dynamic Collaboration of Multi-Language Models based on Minimal Complete Semantic Units
- Thinking Before You Speak: A Proactive Test-time Scaling Approach
- Adaptive Originality Filtering: Rejection Based Prompting and RiddleScore for Culturally Grounded Multilingual Riddle Generation
- Type-Compliant Adaptation Cascades: Adapting Programmatic LM Workflows to Data
- Transduction is All You Need for Structured Data Workflows
- Trust but Verify! A Survey on Verification Design for Test-time Scaling
- Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
- Improved Generalized Planning with LLMs through Strategy Refinement and Reflection
- HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes
- COCO: Cognitive Operating System with Continuous Oversight for Multi-Agent Workflow Reliability
- AI Agents for Photonic Integrated Circuit Design Automation
- CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance
- Involuntary Jailbreak: On Self-Prompting Attacks
- A Stitch in Time Saves Nine: Proactive Self-Refinement for Language Models
- TASER: Table Agents for Schema-guided Extraction and Recommendation
- Uncovering Systematic Failures of LLMs in Verifying Code Against Natural Language Specifications
- Exploring Efficiency Frontiers of Thinking Budget in Medical Reasoning: Scaling Laws between Computational Resources and Reasoning Quality
- Chart-CoCa: Self-Improving Chart Understanding of Vision LMs via Code-Driven Synthesis and Candidate-Conditioned Answering
- Overcoming Knowledge Discrepancies: Structuring Reasoning Threads through Knowledge Balancing in Interactive Scenarios
- Learning Wisdom from Errors: Promoting LLM's Continual Relation Learning through Exploiting Error Cases
- AI Agentic Programming: A Survey of Techniques, Challenges, and Opportunities
- Hell or High Water: Evaluating Agentic Recovery from External Failures
- DiFaR: Enhancing Multimodal Misinformation Detection with Diverse, Factual, and Relevant Rationales
- Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning
- ALAS: Autonomous Learning Agent for Self-Updating Language Models
- CS-Agent: LLM-based Community Search via Dual-agent Collaboration
- TEN: Table Explicitization, Neurosymbolically
- LLM-Driven Adaptive 6G-Ready Wireless Body Area Networks: Survey and Framework
- Rational Inverse Reasoning: Few-Shot Imitation by Inferring Intent through Planning
- Train Long, Think Short: Curriculum Learning for Efficient Reasoning
- LLM driven Text-to-Table Generation through Sub-Tasks Guidance and Iterative Refinement
- Time Is a Feature: Exploiting Temporal Dynamics in Diffusion Language Models
- Evaluating Large Language Models as Expert Annotators
- ThinkTuning: Instilling Cognitive Reflections without Distillation
- Towards Theoretical Understanding of Transformer Test-Time Computing: Investigation on In-Context Linear Regression
- Uncertainty-Aware Semantic Decoding for LLM-Based Sequential Recommendation
- Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges
- Assessing the Quality of AI-Generated Exams: A Large-Scale Field Study
- SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning
- Devstral: Fine-tuning Language Models for Coding Agent Applications
- Optimizing Prompt Sequences using Monte Carlo Tree Search for LLM-Based Optimization
- Prosocial Behavior Detection in Player Game Chat: From Aligning Human-AI Definitions to Efficient Annotation at Scale
- Learning by Teaching: Engaging Students as Instructors of Large Language Models in Computer Science Education
- Test-Time Reinforcement Learning for GUI Grounding via Region Consistency
- MV-Debate: Multi-view Agent Debate with Dynamic Reflection Gating for Multimodal Harmful Content Detection in Social Media
- Decision-Making with Deliberation: Meta-reviewing as a Document-grounded Dialogue
- Incident Response Planning Using a Lightweight Large Language Model with Reduced Hallucination
- Can Large Language Models Integrate Spatial Data? Empirical Insights into Reasoning Strengths and Computational Weaknesses
- Sculptor: Empowering LLMs with Cognitive Agency via Active Context Management
- GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
- Multi-Agent Taskforce Collaboration: Self-Correction of Compounding Errors in Long-Form Literature Review Generation
- Causal Reward Adjustment: Mitigating Reward Hacking in External Reasoning via Backdoor Correction
- AD-FM: Multimodal LLMs for Anomaly Detection via Multi-Stage Reasoning and Fine-Grained Reward Optimization
- GeoSR: Cognitive-Agentic Framework for Probing Geospatial Knowledge Boundaries via Iterative Self-Refinement
- Enhancing Serendipity Recommendation System by Constructing Dynamic User Knowledge Graphs with Large Language Models
- More Than a Score: Probing the Impact of Prompt Specificity on LLM Code Generation
- A DbC Inspired Neurosymbolic Layer for Trustworthy Agent Design
- EmbedGrad: Gradient-Based Prompt Optimization in Embedding Space for Large Language Models
- Error Detection and Correction for Interpretable Mathematics in Large Language Models
- SustainableQA: A Comprehensive Question Answering Dataset for Corporate Sustainability and EU Taxonomy Reporting
- A Rolling Stone Gathers No Moss: Adaptive Policy Optimization for Stable Self-Evaluation in Large Multimodal Models
- CTTS: Collective Test-Time Scaling
- Polymath: A Self-Optimizing Agent with Dynamic Hierarchical Workflow
- HyCodePolicy: Hybrid Language Controllers for Multimodal Monitoring and Decision in Embodied Agents
- I2CR: Intra- and Inter-modal Collaborative Reflections for Multimodal Entity Linking
- HealthFlow: A Self-Evolving AI Agent with Meta Planning for Autonomous Healthcare Research
- Refine-n-Judge: Curating High-Quality Preference Chains for LLM-Fine-Tuning
- Tuning LLM-based Code Optimization via Meta-Prompting: An Industrial Perspective
- Video-based Vehicle Surveillance in the Wild: License Plate, Make, and Model Recognition with Self Reflective Vision-Language Models
- MCeT: Behavioral Model Correctness Evaluation using Large Language Models
- Thinking Machines: Mathematical Reasoning in the Age of LLMs
- Cascaded Information Disclosure for Generalized Evaluation of Problem Solving Capabilities
- How Far Are AI Scientists from Changing the World?
- Distributed AI Agents for Cognitive Underwater Robot Autonomy
- MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines
- An Explainable Emotion Alignment Framework for LLM-Empowered Agent in Metaverse Service Ecosystem
- DeepSieve: Information Sieving via LLM-as-a-Knowledge-Router
- Helping or Homogenizing? GenAI as a Design Partner to Pre-Service SLPs for Just-in-Time Programming of AAC
- Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
- MoL-RL: Distilling Multi-Step Environmental Feedback into LLMs for Feedback-Independent Reasoning
- Post-Completion Learning for Language Models
- Diversity-Enhanced Reasoning for Subjective Questions
- AgentTTS: Large Language Model Agent for Test-time Compute-optimal Scaling Strategy in Complex Tasks
Discussions
Related