MuSiQue: Multihop Questions via Single-hop Question Composition
2021/08/02 by Harsh Trivedi, Trivedi, Harsh, Niranjan Balasubramanian +5 · 216 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
paper · pdf · doi:10.48550/arxiv.2108.00573
openalex publication_date 2021/08/02 · openalex created_date 2025/10/10 · openalex updated_date 2026/07/28
Abstract
Multihop reasoning remains an elusive goal as existing multihop benchmarks are known to be largely solvable via shortcuts. Can we create a question answering (QA) dataset that, by construction, requires proper multihop reasoning? To this end, we introduce a bottom-up approach that systematically selects composable pairs of single-hop questions that are connected, i.e., where one reasoning step critically relies on information from another. This bottom-up methodology lets us explore a vast space of questions and add stringent filters as well as other mechanisms targeting connected reasoning. It provides fine-grained control over the construction process and the properties of the resulting k-hop questions. We use this methodology to create MuSiQue-Ans, a new multihop QA dataset with 25K 2-4 hop questions. Relative to existing datasets, MuSiQue-Ans is more difficult overall (3x increase in human-machine gap), and harder to cheat via disconnected reasoning (e.g., a single-hop model has a 30 point drop in F1). We further add unanswerable contrast questions to produce a more stringent dataset, MuSiQue-Full. We hope our datasets will help the NLP community develop models that perform genuine multihop reasoning.
Cited by
- From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
- Delegation Intelligence in Deep Search: A Controllable Framework for Disentangled Capability Diagnosis
- When Should Active RAG Retrieve? A Budget-Aware Evaluation of Utility, Calibration, and Cost
- Do Current Retrievers Cover All the Evidence? A Controlled Study of Conjunctive Cross-Page Retrieval
- EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff
- ScalableRAG: High-Quality RAG at Zero Ingestion Cost
- Coordinated Networking for On-Device Agent-Augmented Real-Time Communication
- Aethel: A Reproducible Graph-Retrieval Framework for Multi-Hop Financial Diligence
- ATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic Tasks
- LIR3AG: A Lightweight Rerank Reasoning Strategy Framework for Retrieval-Augmented Generation
- AdaSearch: Balancing Parametric Knowledge and Search in Large Language Models via Reinforcement Learning
- DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI
- Needle in the Web: A Benchmark for Retrieving Targeted Web Pages in the Wild
- Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference
- ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs
- Leveraging Spreading Activation for Improved Document Retrieval in Knowledge-Graph-Based RAG Systems
- Dynamic Context Selection for Retrieval-Augmented Generation: Mitigating Distractors and Positional Bias
- Context-Picker: Dynamic context selection using multi-stage reinforcement learning
- CoDA: A Context-Decoupled Hierarchical Agent with Reinforcement Learning
- How Prompts Move Language Model Behavior: Frames, Salience, and Construal as Semantic Control
- PathFinder: MCTS and LLM Feedback-based Path Selection for Multi-Hop Question Answering
- GPG: Generalized Policy Gradient Theorem for Transformer-based Policies
- Cooperative Retrieval-Augmented Generation for Question Answering: Mutual Information Exchange and Ranking by Contrasting Layers
- LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
- An Index-based Approach for Efficient and Effective Web Content Extraction
- LightSearcher: Efficient DeepSearch via Experiential Memory
- Knowing What's Missing: Assessing Information Sufficiency in Question Answering
- Modeling Contextual Passage Utility for Multihop Question Answering
- MaxShapley: Towards Incentive-compatible Generative Search with Fair Context Attribution
- Beyond Factual Accuracy: Evaluating Global Reasoning Integrity in RAG Systems with LogicScore
- CARL: Criticality-Aware Agentic Reinforcement Learning
- On GRPO Collapse in Search-R1: The Lazy Likelihood-Displacement Death Spiral
- Agentic Policy Optimization via Instruction-Policy Co-Evolution
- Latent Debate: A Surrogate Framework for Interpreting LLM Thinking
- AI-Trader: Benchmarking Autonomous Agents in Real-Time Financial Markets
- Multi-chain Graph Refinement and Selection for Reliable Reasoning in Large Language Models
- Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design
- CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning
- HyperbolicRAG: Enhancing Retrieval-Augmented Generation with Hyperbolic Representations
- SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation
- MuISQA: Multi-Intent Retrieval-Augmented Generation for Scientific Question Answering
- NeuroPath: Neurobiology-Inspired Path Tracking and Reflection for Semantically Coherent Retrieval
- LiveSearchBench: An Automatically Constructed Benchmark for Retrieval and Reasoning over Dynamic Knowledge
- A Multifaceted Analysis of Negative Bias in Large Language Models through the Lens of Parametric Knowledge
- MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling
- Retrieval as a Decision: Training-Free Adaptive Gating for Efficient RAG
- Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning
- Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn Interaction
- From Experience to Strategy: Empowering LLM Agents with Trainable Graph Memory
- Structured RAG for Answering Aggregative Questions
- Beyond Fact Retrieval: Episodic Memory for RAG with Generative Semantic Workspaces
- Q-RAG: Long Context Multi-step Retrieval via Value-based Embedder Training
- Confidence-Guided Stepwise Model Routing for Cost-Efficient Reasoning
- LGM: Enhancing Large Language Models with Conceptual Meta-Relations and Iterative Retrieval
- MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
- KV Cache Transform Coding for Compact Storage in LLM Inference
- Prompt-R1: Collaborative Automatic Prompting Framework via End-to-end Reinforcement Learning
- Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval
- InfoFlow: Reinforcing Search Agent Via Reward Density Optimization
- Empowering RepoQA-Agent based on Reinforcement Learning Driven by Monte-carlo Tree Search
- Graph-Enhanced Policy Optimization in LLM Agent Training
- BambooKG: A Neurobiologically-inspired Frequency-Weight Knowledge Graph
- CMT-RAG: Complementary Memory Traces for Multi-turn Multi-hop RAG
- Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs
- WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback
- Metis: Memory Foundation Model
- SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search
- RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention
- OrgForge: A Multi-Agent Simulation Framework for Verifiable Synthetic Corporate Corpora
- CREATE: Testing LLMs for Associative Creativity
- Enhancing Multi-Agent Communication through Attention Steering with Context Relevance
- Sharpness-Guided Group Relative Policy Optimization via Probability Shaping
- DTKG: Dual-Track Knowledge Graph-Verified Reasoning Framework for Multi-Hop QA
- Repurposing Synthetic Data for Fine-grained Search Agent Supervision
- SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models
- BMGQ: A Bottom-up Method for Generating Complex Multi-hop Reasoning Questions from Semi-structured Data
- Graph-Guided Concept Selection for Efficient Retrieval-Augmented Generation
- ChessQA: Evaluating Large Language Models for Chess Understanding
- Rethinking the Design of Reinforcement Learning-Based Deep Research Agents
- Bridging Language Gaps with Adaptive RAG: Improving Indonesian Language Question Answering
- Citation Failure: Definition, Analysis and Efficient Mitigation
- Think Straight, Stop Smart: Structured Reasoning for Efficient Multi-Hop RAG
- LoongRL: Reinforcement Learning for Advanced Reasoning over Long Contexts
- Search Self-play: Pushing the Frontier of Agent Capability without Supervision
- WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
- Annotation-Efficient Universal Honesty Alignment
- A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications
- AutoGraph-R1: End-to-End Reinforcement Learning for Knowledge Graph Construction
- Explore to Evolve: Scaling Evolved Aggregation Logic via Proactive Online Exploration for Deep Research Agents
- Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval Depth
- EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle
- Structure-R1: Dynamically Leveraging Structural Knowledge in LLM Reasoning through Reinforcement Learning
- Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents
- Stop-RAG: Value-Based Retrieval Control for Iterative RAG
- PRISM: Agentic Retrieval with LLMs for Multi-Hop Question Answering
- Towards Agentic Self-Learning LLMs in Search Environment
- BRIEF-Pro: Universal Context Compression with Short-to-Long Synthesis for Fast and Accurate Multi-Hop Reasoning
- Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation
- Taming the Fragility of KV Cache Eviction in LLM Inference
- PIShield: Detecting Prompt Injection Attacks via Intrinsic LLM Features
- Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks
- DSAS: A Universal Plug-and-Play Framework for Attention Optimization in Multi-Document Question Answering
- Evaluating Retrieval-Augmented Generation Systems on Unanswerable, Uncheatable, Realistic, Multi-hop Queries
- Query-Specific GNN: A Comprehensive Graph Representation Learning Method for Retrieval Augmented Generation
- Uncertainty Quantification for Retrieval-Augmented Reasoning
- VeriCite: Towards Reliable Citations in Retrieval-Augmented Generation via Rigorous Verification
- Proof-of-Use: Mitigating Tool-Call Hacking in Deep Research Agents
- KVComm: Enabling Efficient LLM Communication through Selective KV Sharing
- BrowserAgent: Building Web Agents with Human-Inspired Web Browsing Actions
- RECON: Reasoning with Condensation for Efficient Retrieval-Augmented Generation
- Beyond the limitation of a single query: Train your LLM for query expansion with Reinforcement Learning
- Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe
- LinearRAG: Linear Graph Retrieval Augmented Generation on Large-scale Corpora
- DSPO: Stable and Efficient Policy Optimization for Agentic Search and Reasoning
- EcphoryRAG: Re-Imagining Knowledge-Graph RAG via Human Associative Memory
- Agent Learning via Early Experience
- HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation
- Understanding DeepResearch via Reports
- SUBQRAG: Sub-Question Driven Dynamic Graph RAG
- Struc-EMB: The Potential of Structure-Aware Encoding in Language Embeddings
- A2Search: Ambiguity-Aware Question Answering with Reinforcement Learning
- Haystack Engineering: Context Engineering for Heterogeneous and Agentic Long-Context Evaluation
- Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them
- Adaptive Tool Generation with Models as Tools and Reinforcement Learning
- Stratified GRPO: Handling Structural Heterogeneity in Reinforcement Learning of LLM Search Agents
- CAM: A Constructivist View of Agentic Memory for LLM-Based Reading Comprehension
- MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning
- Beyond Outcome Reward: Decoupling Search and Answering Improves LLM Agents
- Multi-Agent Tool-Integrated Policy Optimization
- Contrastive Retrieval Heads Improve Attention-Based Re-Ranking
- Multi-Hop Question Answering: When Can Humans Help, and Where do They Struggle?
- Improving Consistency in Retrieval-Augmented Systems with Group Similarity Rewards
- StepChain GraphRAG: Reasoning Over Knowledge Graphs for Multi-Hop Question Answering
- Social Welfare Function Leaderboard: When LLM Agents Allocate Social Welfare
- Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics
- ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards
- Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs
- RE-Searcher: Robust Agentic Search with Goal-oriented Planning and Self-reflection
- RoRecomp: Enhancing Reasoning Efficiency via Rollout Response Recomposition in Reinforcement Learning
- TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning
- Hybrid Reward Normalization for Process-supervised Non-verifiable Agentic Tasks
- Beyond Static Retrieval: Opportunities and Pitfalls of Iterative Retrieval in GraphRAG
- AceSearcher: Bootstrapping Reasoning and Search for LLMs via Reinforced Self-Play
- G-reasoner: Foundation Models for Unified Reasoning over Graph-structured Knowledge
- CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems
- Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs
- Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning
- Learn the Ropes, Then Trust the Wins: Self-imitation with Progressive Exploration for Agentic Reinforcement Learning
- Do LLM Agents Know How to Ground, Recover, and Assess? A Benchmark for Epistemic Competence in Information-Seeking Agents
- GraphSearch: An Agentic Deep Searching Workflow for Graph Retrieval-Augmented Generation
- Graph of Agents: Principled Long Context Modeling by Emergent Multi-Agent Collaboration
- Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval
- Tree Search for LLM Agent Reinforcement Learning
- A Fano-Style Accuracy Upper Bound for LLM Single-Pass Reasoning in Multi-Hop QA
- Harness-G: A Graph-Structured Harness for Search Agents
- SemPIC: Learning Semantic Position-Independent KV Caches
- Group-Reflective Self-Distillation for Agentic Reinforcement Learning
- Contrastive Reinforced Policy Optimization via Privileged Self-Distillation
- Dr-DCI: Scaling Direct Corpus Interaction via Dynamic Workspace Expansion
- Retrieval from Within: An Intrinsic Capability of Attention-Based Models
- SHINE: A Scalable In-Context Hypernetwork for Mapping Context to LoRA in a Single Pass
- CompLLM: Compression for Long Context Q&A
- TERAG: Token-Efficient Graph-Based Retrieval-Augmented Generation
- Value-Guided KV Compression for LLMs via Approximated CUR Decomposition
- From Language to Action: A Review of Large Language Models as Autonomous Agents and Tool Users
- DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL
- Unbiased Reasoning for Knowledge-Intensive Tasks in Large Language Models via Conditional Front-Door Adjustment
- EvolKV: Evolutionary KV Cache Compression for LLM Inference
- AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
- Reinforcement Learning Foundations for Deep Research Systems: A Survey
- RTQA : Recursive Thinking for Complex Temporal Knowledge Graph Question Answering with Large Language Models
- OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval
- Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
- VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
- DeepResearch Arena: The First Exam of LLMs' Research Abilities via Seminar-Grounded Tasks
- Decomposing and Revising What Language Models Generate
- EviNote-RAG: Enhancing RAG Models via Answer-Supportive Evidence Notes
- Open Data Synthesis For Deep Research
- PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
- InSQuAD: In-Context Learning for Efficient Retrieval via Submodular Mutual Information to Enforce Quality and Diversity
- MSRS: Evaluating Multi-Source Retrieval-Augmented Generation
- PVPO: Pre-Estimated Value-Based Policy Optimization for Agentic Reasoning
- AI-SearchPlanner: Modular Agentic Search via Pareto-Optimal Multi-Objective Reinforcement Learning
- DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis
- Youtu-GraphRAG: Vertically Unified Agents for Graph Retrieval-Augmented Complex Reasoning
- Hybrid Deep Searcher: Integrating Parallel and Sequential Search Reasoning
- DocHop-QA: Towards Multi-Hop Reasoning over Multimodal Document Collections
- Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization
- Explicit v.s. Implicit Memory: Exploring Multi-hop Complex Reasoning Over Personalized Information
- Atom-Searcher: Enhancing Agentic Deep Research via Fine-Grained Atomic Thought Reward
- MoNaCo: More Natural and Complex Questions for Reasoning Across Dozens of Documents
- SSRL: Self-Search Reinforcement Learning
- Transforming Questions and Documents for Semantically Aligned Retrieval-Augmented Generation
- Format as a Prior: Quantifying and Analyzing Bias in LLMs for Heterogeneous Data
- From Ranking to Selection: A Simple but Efficient Dynamic Passage Selector for Retrieval Augmented Generation
- ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning
- Reveal-Bangla: A Dataset for Cross-Lingual Multi-Step Reasoning Evaluation
- BrowseMaster: Towards Scalable Web Browsing via Tool-Augmented Programmatic Agent Pair
- Careful Queries, Credible Results: Teaching RAG Models Advanced Web Search Tools with Reinforcement Learning
- WideSearch: Benchmarking Agentic Broad Info-Seeking
- HierSearch: A Hierarchical Enterprise Deep Search Framework Integrating Local and Web Searches
- Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
- UR2: Unify RAG and Reasoning through Reinforcement Learning
- Beyond Perplexity: Let the Reader Select Retrieval Summaries via Spectrum Projection Score
- You Don't Need Pre-built Graphs for RAG: Retrieval Augmented Generation with Adaptive Reasoning Structures
- LAG: Logic-Augmented Generation from a Cartesian Perspective
- VeriGUI: Verifiable Long-Chain GUI Dataset
- RCR-Router: Efficient Role-Aware Context Routing for Multi-Agent LLM Systems with Structured Memory
- AttnTrace: Attention-based Context Traceback for Long-Context LLMs
- Agent Lightning: Train ANY AI Agents with Reinforcement Learning
- Beyond Chunks and Graphs: Retrieval-Augmented Generation through Triplet-Driven Thinking
- From Query to Logic: Ontology-Driven Multi-Hop Reasoning in LLMs
- MAO-ARAG: Multi-Agent Orchestration for Adaptive Retrieval-Augmented Generation
- Lucy: edgerunning agentic web search on mobile with machine generated task vectors
- GraphRAG-R1: Graph Retrieval-Augmented Generation with Process-Constrained Reinforcement Learning
- Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning
Related