{"as_of":"2026-08-04T23:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec09f1108c03f2e659108be6c7f16ae073b79166b27a269e405a3a9fd41d93cc","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T07:39:58.366423Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":52,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:53:28.604509Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:17:50.841893Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-05-24T05:10:25.171044Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2312.10997"},"observation_digest":"sha256:38bd439a538fb773becd918682988bf5de7ea40ac00cf422261a3c747deefa2c","observation_id":"ae5eec23-4273-41eb-9d42-1e5ef63d67eb","resolution":{"observed_at":"2026-05-24T05:13:57.263558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T17:44:13.310155Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2505.04588"},"observation_digest":"sha256:6b2fb844900d7e2b16643c6f1557314ac8845eb5da2777350fcf49454e82c9c4","observation_id":"dd0020fb-070e-4471-8847-de50cade18db","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T16:05:04.715678Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2505.04588"},"observation_digest":"sha256:d1956789c37209a08351d68246058032f5521b42c3d6052633f0fcd1d4275c9c","observation_id":"d28a5430-c1ac-4c5e-8573-a16d1fc5e446","resolution":{"observed_at":"2026-05-22T16:06:45.837584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-11T09:15:08.193357Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2505.10978"},"observation_digest":"sha256:d7632ba4ebd02d627bc26ed63eb437ebbf5c09a58fab3159c4a04f54d7adad64","observation_id":"3d86b65a-ddb7-49e1-992b-ec0509af1c5d","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2505.22095","last_updated":"2026-04-06T12:52:40Z","snapshot_observed_at":"2026-08-02T15:44:17.473900Z","submitted_at":"2025-05-28T08:17:57Z","title":"Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T13:50:30.090068Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2505.22095"},"observation_digest":"sha256:ea90d32babffc465d6f3cfed30a7f8fc4ee6ca145d0d8c712245dcc16b6c1ed7","observation_id":"80f108ca-f080-49c1-9fb5-deb496e9de7a","resolution":{"observed_at":"2026-05-19T13:52:19.986230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2506.04565","last_updated":"2026-05-08T15:50:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T02:34:43Z","title":"From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T11:49:36.574471Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2506.04565"},"observation_digest":"sha256:0fe2e364b16f4b41f4dbdbdeff645ec67292de91cbe2e8ea5f67a613559775f7","observation_id":"da03794f-a6c1-433d-a9b3-e7bf9a975659","resolution":{"observed_at":"2026-05-19T11:52:16.266090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-04T20:53:28.604509Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-04T20:53:17.807634Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:28.604509Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:1158749b07b3534433f93fde6be05e0f3b6da0b19648c5b5b2c1fe652f394220","observation_id":"88d67d04-10e9-4b9e-91fb-5cbfd1af2c05","resolution":{"observed_at":"2026-08-04T20:53:28.604509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-04T19:58:53.792689Z","title":"D., Sugawara, S., and Aizawa, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08960","last_updated":"2025-09-10T19:47:46Z","snapshot_observed_at":"2026-08-04T19:58:51.260565Z","submitted_at":"2025-09-10T19:47:46Z","title":"BRoverbs -- Measuring how much LLMs understand Portuguese proverbs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T19:58:53.792689Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2509.08960"},"observation_digest":"sha256:20e8f08c908865606bc3417c0749fabac88b509902fbb3553a6e90899fb63a87","observation_id":"59ce93f3-c8e8-4245-86b5-a06d6cbc2b90","resolution":{"observed_at":"2026-08-04T19:58:53.792689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-04T19:28:57.112469Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-04T19:28:55.084329Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:57.112469Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:f29f6efb4222b8b5994fd3103298634aafd552f7336530adfa8d1640212fee60","observation_id":"8a1376b0-98e0-453f-9a7b-6f45d307f65a","resolution":{"observed_at":"2026-08-04T19:28:57.112469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-04T17:57:52.365586Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.14257","last_updated":"2026-07-23T12:32:53Z","snapshot_observed_at":"2026-08-04T17:57:40.294406Z","submitted_at":"2025-09-12T15:34:07Z","title":"Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T17:57:52.365586Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2509.14257"},"observation_digest":"sha256:e95513eab232def0245f46d3e91db6f0c05d1b9611870d4c43f65a8ceb2d6806","observation_id":"2f9bd869-8670-4d95-b032-6ec5bd7a3aa5","resolution":{"observed_at":"2026-08-04T17:57:52.365586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2510.00861","last_updated":"2026-04-20T08:17:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-01T13:10:36Z","title":"Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T11:06:20.058342Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2510.00861"},"observation_digest":"sha256:7cf289c73e679693dd757dbb3e68dd824c161eb10250ede5efb3caee294a3c03","observation_id":"43168c99-88ac-4736-9b1b-7433bd3e196b","resolution":{"observed_at":"2026-05-18T11:11:18.210123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2510.11541","last_updated":"2026-04-27T10:34:30Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T15:41:15Z","title":"Question-Adaptive Graph Learning for Multi-hop Retrieval Augmented Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T07:11:48.249136Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2510.11541"},"observation_digest":"sha256:a845c9f569b737fda28312e14086cde41ff64fa2864db0464d188b2b6bd293f0","observation_id":"b003c741-9e5f-46c9-88f4-8ef24f77c6b4","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2510.16079","last_updated":"2026-05-16T02:57:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-17T12:03:16Z","title":"EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T06:19:44.360734Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2510.16079"},"observation_digest":"sha256:582ae1ca0f0080d30dac78d17d52c9601ff3b4c06a65098a37f2c51319910635","observation_id":"a98880f0-e466-4bcf-984d-e1e9c9050839","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2510.16079","last_updated":"2026-05-16T02:57:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-17T12:03:16Z","title":"EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T20:50:06.642976Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2510.16079"},"observation_digest":"sha256:44fca85c01d587ed5001f4c99ecb727754aca794329d5aa116e64fcde7190fe5","observation_id":"2cabc30a-8a71-4219-a5ee-ae8465f18a02","resolution":{"observed_at":"2026-05-21T20:50:36.439332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2511.00066","last_updated":"2026-05-13T07:57:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-29T08:07:47Z","title":"Sharpness-Guided Group Relative Policy Optimization via Probability Shaping","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T03:10:57.839146Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2511.00066"},"observation_digest":"sha256:99bb6b334aacd64e9d7e209fb7ccbe68d7a2bafeab5de40edc99ed2f9ee30b74","observation_id":"9e879b36-c0bc-45f1-9f7b-7eccd5082b8e","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2511.02805","last_updated":"2026-05-08T08:08:53Z","snapshot_observed_at":"2026-08-02T15:47:22.171069Z","submitted_at":"2025-11-04T18:27:39Z","title":"MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T00:57:25.902674Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2511.02805"},"observation_digest":"sha256:62d143dd11acd3ad005d3fc7d99fded370c387a92699765c6c98b1ed3ec73bb8","observation_id":"461e1e52-7266-457c-a79f-6bfbbb36bcac","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2511.11793","last_updated":"2026-04-21T16:02:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-14T18:52:07Z","title":"MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T21:44:18.744201Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2511.11793"},"observation_digest":"sha256:1808d9c6556688ef4674475566277c770ff09cb311d227246e6cf48962ad5376","observation_id":"0e924b27-a3d9-4b1d-961a-a6bb325df8f7","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-03T21:38:56.042227Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps.arXiv preprint arXiv:2011.01060, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2511.14460","last_updated":"2026-05-30T06:08:55Z","snapshot_observed_at":"2026-08-03T21:38:54.007115Z","submitted_at":"2025-11-18T13:03:15Z","title":"Agent-R1: A Unified and Modular Framework for Agentic Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T21:38:56.042227Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2511.14460"},"observation_digest":"sha256:34abe96587d36ee177b4e181c1d1b98ebba62392cb57b4ab1cf5e42b87be9782","observation_id":"9be4fa95-cb86-4366-bc53-2f5f809e3e78","resolution":{"observed_at":"2026-08-03T21:38:56.042227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-03T18:00:21.132323Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.07436","last_updated":"2026-05-31T11:02:36Z","snapshot_observed_at":"2026-08-03T18:00:14.501599Z","submitted_at":"2025-12-08T11:12:39Z","title":"LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T18:00:21.132323Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2512.07436"},"observation_digest":"sha256:e0fa0bb2e66518f9adb54db1ad791cee51c8de61191dc49f3d68a2c4db46e394","observation_id":"bee7e3bc-b35a-4479-97aa-965fc489d581","resolution":{"observed_at":"2026-08-03T18:00:21.132323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-03T16:30:38.105728Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2512.13278","last_updated":"2026-06-05T03:56:56Z","snapshot_observed_at":"2026-08-03T16:30:33.694000Z","submitted_at":"2025-12-15T12:38:04Z","title":"AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T16:30:38.105728Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2512.13278"},"observation_digest":"sha256:6ec50ca737c853227cd6e25720a5926549615c831380d59da4150bf2987861bc","observation_id":"c98c48de-7d5b-41cb-a0df-86cef427f83a","resolution":{"observed_at":"2026-08-03T16:30:38.105728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-03T15:45:17.483759Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps.arXiv preprint arXiv:2011.01060, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2512.15922","last_updated":"2026-05-24T16:47:21Z","snapshot_observed_at":"2026-08-03T15:45:12.612236Z","submitted_at":"2025-12-17T19:38:35Z","title":"Leveraging Spreading Activation for Improved Document Retrieval in Knowledge-Graph-Based RAG Systems","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T15:45:17.483759Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2512.15922"},"observation_digest":"sha256:f0a9e4fa0e53af6a04edd947f56b0e6e5af0722264d51061e3a384e18230e8ac","observation_id":"f322f208-5048-4895-9dba-2754ff805845","resolution":{"observed_at":"2026-08-03T15:45:17.483759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2602.01203","last_updated":"2026-05-27T09:56:04Z","snapshot_observed_at":"2026-08-04T22:42:52.512248Z","submitted_at":"2026-02-01T12:45:39Z","title":"Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T08:47:29.236561Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2602.01203"},"observation_digest":"sha256:e36072d4e538cd798ab3d50693a49c91b8c882e8a64699d6582cc7e05c9f17d2","observation_id":"7e9f187f-9e0d-4882-8e7a-cff50d3c057c","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-03T05:50:23.846039Z","title":"Con- structing a multi-hop qa dataset for comprehensive evalu- ation of reasoning steps.ArXiv, abs/2011.01060,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.01203","last_updated":"2026-05-27T09:56:04Z","snapshot_observed_at":"2026-08-04T22:42:52.512248Z","submitted_at":"2026-02-01T12:45:39Z","title":"Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T05:50:23.846039Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2602.01203"},"observation_digest":"sha256:3b4df57894721602aab08cb11f95d9a5a89bb1079af3d978e465df39e6cfbe58","observation_id":"44943469-5037-495a-9788-3dac570e3991","resolution":{"observed_at":"2026-08-03T05:50:23.846039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-03T05:39:27.537439Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps.arXiv preprint arXiv:2011.01060, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.01672","last_updated":"2026-06-03T03:49:17Z","snapshot_observed_at":"2026-08-03T05:39:25.493523Z","submitted_at":"2026-02-02T05:40:38Z","title":"Adaptive Information Control for Search-Augmented LLM Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T05:39:27.537439Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2602.01672"},"observation_digest":"sha256:5e6e8098be20e2c407a87854bccdabe90fd052fede2654d36ba0d195af90bfe6","observation_id":"40674f8f-a68f-4f4f-8132-81250b5f2863","resolution":{"observed_at":"2026-08-03T05:39:27.537439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-02T19:46:38.547858Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.01152","last_updated":"2026-06-20T09:26:23Z","snapshot_observed_at":"2026-08-02T19:46:35.403390Z","submitted_at":"2026-03-01T15:36:10Z","title":"DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T19:46:38.547858Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2603.01152"},"observation_digest":"sha256:c2f9dec20266c7adfe26ebf2a5228c83fc36605276ecd811b5466b4f92f1cb64","observation_id":"ccecdd0d-125a-4631-a6ce-5cd4740c5371","resolution":{"observed_at":"2026-08-02T19:46:38.547858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2603.23516","last_updated":"2026-04-13T03:01:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-06T02:29:54Z","title":"MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T16:00:03.578685Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2603.23516"},"observation_digest":"sha256:f5f989646f8479d0e8a9e122afc90c7a8d792d49cfcf6a9cc8af343d8372d502","observation_id":"956d9de2-e2f6-47ee-bd88-f3450e643a6b","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-13T13:59:01.287449Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.02091","last_updated":"2026-07-02T17:08:51Z","snapshot_observed_at":"2026-07-13T13:58:56.096753Z","submitted_at":"2026-04-02T14:19:47Z","title":"Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-13T13:59:01.287449Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2604.02091"},"observation_digest":"sha256:ca28dd8f2eb77334f8aa2ee068c9b18a9f7f334ac117baf53546f0efadca64f2","observation_id":"8fc202cb-85db-4836-96c9-7cbe4707b7b6","resolution":{"observed_at":"2026-07-13T13:59:01.287449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2604.03675","last_updated":"2026-05-23T06:41:17Z","snapshot_observed_at":"2026-08-03T22:30:44.538626Z","submitted_at":"2026-04-04T10:23:46Z","title":"OASES: Outcome-Aligned Search-Evaluation Co-Training for Agentic Search","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T17:16:09.927267Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2604.03675"},"observation_digest":"sha256:b54f875eea2ccf0bb715433c31089df7570fc59b0a3c29e10643542fcd0f1f84","observation_id":"2b25c39b-d3e0-4bbb-9739-9083f855146b","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"orphan_title_repair","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2604.09666","last_updated":"2026-04-01T07:21:32Z","snapshot_observed_at":"2026-07-06T22:58:29.952947Z","submitted_at":"2026-04-01T07:21:32Z","title":"Do We Still Need GraphRAG? Benchmarking RAG and GraphRAG for Agentic Search Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T22:35:18.954951Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2604.09666"},"observation_digest":"sha256:bf126da0ae1c6c0eb39a218acbf537cb19bfdddaadaaddc40d4bd3726a23bc6c","observation_id":"3eacbc76-875d-4df7-ac24-333baa2b351a","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2604.12610","last_updated":"2026-04-14T11:36:29Z","snapshot_observed_at":"2026-08-02T05:17:11.221332Z","submitted_at":"2026-04-14T11:36:29Z","title":"Transforming External Knowledge into Triplets for Enhanced Retrieval in RAG of LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:42:59.063869Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2604.12610"},"observation_digest":"sha256:2b8e00b1ee9b09a7bc29823fd51005827a446000c91c7641bc8e1f208d9b87f2","observation_id":"a446c81c-b306-4b3f-9e82-29d563975943","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2604.17237","last_updated":"2026-05-19T06:36:57Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:43:42Z","title":"HeadRank: Decoding-Free Passage Reranking via Preference-Aligned Attention Heads","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-10T06:36:22.111810Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2604.17237"},"observation_digest":"sha256:2de2680409bd2e83647381f9063a8e4e25d82bbe47d6830f20df86c5a683b0c0","observation_id":"0c1ea5b9-cf19-424e-86ff-6ea1ba61678e","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2604.17265","last_updated":"2026-05-12T13:20:03Z","snapshot_observed_at":"2026-08-02T13:37:40.268419Z","submitted_at":"2026-04-19T05:35:06Z","title":"MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-10T06:15:11.432788Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2604.17265"},"observation_digest":"sha256:6d492139b1220d786f9c0832dc88ba871b8bc0a8ec8da3bd5760fa7921e4bd27","observation_id":"b437cd33-2d0b-4b5e-b03a-e836aeba4b31","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2604.17458","last_updated":"2026-04-21T06:43:15Z","snapshot_observed_at":"2026-07-06T23:04:32.734175Z","submitted_at":"2026-04-19T14:18:49Z","title":"EHRAG: Bridging Semantic Gaps in Lightweight GraphRAG via Hybrid Hypergraph Construction and Retrieval","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T05:43:04.813867Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2604.17458"},"observation_digest":"sha256:8cd52aff448b9da8a3b38c770f6a1f667c5fb9ae9a8604ffa86cec21f873a20f","observation_id":"46c4525e-fb01-4b87-9bc9-ff19219d2ba7","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2604.20844","last_updated":"2026-02-10T05:57:47Z","snapshot_observed_at":"2026-07-30T13:19:44.535367Z","submitted_at":"2026-02-10T05:57:47Z","title":"AtomicRAG: Atom-Entity Graphs for Retrieval-Augmented Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-16T03:43:36.163220Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2604.20844"},"observation_digest":"sha256:852cfca3e0311f4797d135f1a2180bf7a2a5cfe15c14000d4dbd45fb11a5c107","observation_id":"5a18daf1-b189-4fb4-9b8c-256aee05d83b","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2605.07234","last_updated":"2026-05-08T04:37:22Z","snapshot_observed_at":"2026-07-30T10:52:28.624841Z","submitted_at":"2026-05-08T04:37:22Z","title":"Reformulating KV Cache Eviction Problem for Long-Context LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T02:37:52.545943Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2605.07234"},"observation_digest":"sha256:e229596954a1aab503c41667f4792d1b0a3f7b9bf625d876083634a88bbb8dc7","observation_id":"71898f25-1322-4658-9064-4eab9dabec81","resolution":{"observed_at":"2026-05-18T07:39:58.458269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2605.27164","last_updated":"2026-05-26T15:22:42Z","snapshot_observed_at":"2026-07-06T23:36:53.330986Z","submitted_at":"2026-05-26T15:22:42Z","title":"Query Symbolically or Retrieve Semantically? A Dataset and Method for Semi-Structured Question Answering","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-29T17:03:46.019948Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2605.27164"},"observation_digest":"sha256:e4d67f900778fb4f3932d413c1c1037cb95d57d45314ec406c64948040acd69f","observation_id":"34be19f9-2c42-48e1-bc6d-cf50ad4c0d76","resolution":{"observed_at":"2026-06-29T17:13:44.963412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2605.31010","last_updated":"2026-05-29T08:43:12Z","snapshot_observed_at":"2026-07-06T23:40:12.939143Z","submitted_at":"2026-05-29T08:43:12Z","title":"MoG: Mixture of Experts for Graph-based Retrieval-Augmented Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T22:24:25.409345Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2605.31010"},"observation_digest":"sha256:b61afd7b0f9cf3f500dfab34ef0d9c843372334559021ca6f31cb0b73246b081","observation_id":"840b8620-2233-4ff9-b976-b6626e99a153","resolution":{"observed_at":"2026-07-01T19:36:08.106342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2606.00610","last_updated":"2026-05-30T08:18:53Z","snapshot_observed_at":"2026-07-30T06:25:04.849303Z","submitted_at":"2026-05-30T08:18:53Z","title":"MemGraphRAG: Memory-based Multi-Agent System for Graph Retrieval-Augmented Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T18:20:43.092561Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2606.00610"},"observation_digest":"sha256:8d7d4235e7ff2e312bf80c5b75b7db531f99b2db00456545c195841d3be0f092","observation_id":"922a8a2a-aefe-4b32-a77a-6bb10bdbfe9a","resolution":{"observed_at":"2026-06-28T20:42:37.996504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2606.01240","last_updated":"2026-05-31T13:42:36Z","snapshot_observed_at":"2026-08-02T06:51:34.323150Z","submitted_at":"2026-05-31T13:42:36Z","title":"Efficient RAG with Intent-Aware Retrieval and Semantics-Preserving Chunking","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:21.242007Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2606.01240"},"observation_digest":"sha256:9ae1521bbadd9c48d924bb663aae194af49c6a9568b6fe0dfc86fab764137fd4","observation_id":"e3366a89-d66a-4fe9-8fb0-8e132299b4a6","resolution":{"observed_at":"2026-07-01T20:56:13.837176Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-01T19:32:54.241045Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:fac501b8dc89ffd85f298455fd0bb65f223d423c87eb4bfd8a98a39713db0043","observation_id":"76007fe2-3744-45f9-827d-38802c53fbe5","resolution":{"observed_at":"2026-07-01T22:06:17.178935Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-07-06T23:45:47.161248Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:2e0d6e44cb4df527cddf1f0a9cea52cfdf23fb7fbe516e75e430f8fb6aca6d1d","observation_id":"155c6d3f-b9e7-43e3-a831-2cd7182b4323","resolution":{"observed_at":"2026-07-02T12:46:57.465624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2606.12290","last_updated":"2026-06-10T16:26:46Z","snapshot_observed_at":"2026-08-02T00:16:37.704294Z","submitted_at":"2026-06-10T16:26:46Z","title":"Selection Integrity for LLM Graph Memory: An Accumulability Criterion for Information-Flow-Blind Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T09:13:58.485088Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2606.12290"},"observation_digest":"sha256:5f5f5b3d30df81d1edac3d28210966334014b790383b45a13fb5540b7190dcbf","observation_id":"42bded46-782b-4d79-9915-8adf1c24620f","resolution":{"observed_at":"2026-07-03T11:58:06.265956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2606.13669","last_updated":"2026-07-17T03:48:22Z","snapshot_observed_at":"2026-08-02T19:25:51.192397Z","submitted_at":"2026-06-11T17:58:35Z","title":"Agents-K1: Towards Agent-native Knowledge Orchestration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T06:32:47.387422Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2606.13669"},"observation_digest":"sha256:d5fde4ea3741098d73d8bab2875be735b1b4d04fe92320a4d526b643c9a07c25","observation_id":"1fb04bc6-912e-4048-9266-453a5115a3d8","resolution":{"observed_at":"2026-07-03T15:18:33.948394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2606.13669","last_updated":"2026-07-17T03:48:22Z","snapshot_observed_at":"2026-08-02T19:25:51.192397Z","submitted_at":"2026-06-11T17:58:35Z","title":"Agents-K1: Towards Agent-native Knowledge Orchestration","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T11:16:50.072447Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2606.13669"},"observation_digest":"sha256:af23f1f81943f6281d3ec77cac2b7323964c5b0bea9a1912f1d7c3d00f1b99fd","observation_id":"c6885ddd-dfcd-44ff-895b-b47c24e904d8","resolution":{"observed_at":"2026-06-30T11:24:38.430155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-02T11:40:44.791538Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.13669","last_updated":"2026-07-17T03:48:22Z","snapshot_observed_at":"2026-08-02T19:25:51.192397Z","submitted_at":"2026-06-11T17:58:35Z","title":"Agents-K1: Towards Agent-native Knowledge Orchestration","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T11:40:44.791538Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2606.13669"},"observation_digest":"sha256:026edcc17028ec23ace7f5ebf1a00e1ea6d21313e6aca03adab8f9a319c6cf25","observation_id":"f1300452-95d2-46e2-a638-26489191cced","resolution":{"observed_at":"2026-08-02T11:40:44.791538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2606.17856","last_updated":"2026-06-16T12:28:14Z","snapshot_observed_at":"2026-08-02T10:13:33.935710Z","submitted_at":"2026-06-16T12:28:14Z","title":"FlowRAG: Synergizing Explicit Reasoning via Frequency-Aware Multi-Granularity Graph Flow","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T00:32:36.540334Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2606.17856"},"observation_digest":"sha256:5fc7c9bfc199f3235ec3a90247778dc75f1fb6f4a16702ea2a16430a56a97bd2","observation_id":"0d3a9853-1de3-4856-88e9-53f07e45e6cb","resolution":{"observed_at":"2026-07-03T21:28:58.887483Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2606.28566","last_updated":"2026-06-26T19:44:34Z","snapshot_observed_at":"2026-08-02T14:59:42.646608Z","submitted_at":"2026-06-26T19:44:34Z","title":"R$^2$-Searcher: Calibrating Retrieval and Reasoning Boundaries for Agentic Search","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T00:33:59.778294Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2606.28566"},"observation_digest":"sha256:5a3ce6dbe54884e13d2ef2b46bf9b69f107c9f21f61fcb0bc2857935a5fb04fa","observation_id":"21d41ae4-e7c1-4b7a-90ad-7ded4e39e8af","resolution":{"observed_at":"2026-06-30T00:34:05.227281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2011.01060 , year=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-03T04:57:20.508738Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:30eeba701bcc68bb22068755da4e39764993b7edfff7dd3e0e241943603ec1ef","observation_id":"ede3a1b8-1754-4d9b-aea1-d9301445b575","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2607.05712","last_updated":"2026-07-07T00:37:45Z","snapshot_observed_at":"2026-08-04T04:23:59.819969Z","submitted_at":"2026-07-07T00:37:45Z","title":"Retrieving a Set, Not Independent Passages: Set-Level Compatibility Learning for Efficient Set Exploration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T03:17:20.012125Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2607.05712"},"observation_digest":"sha256:d49fbbf7db2a1ccd0226b27ccc21b9e7afb58778772b54c6e0cf276407efcb35","observation_id":"472c4520-63b8-4094-9577-a4ce9154dbf7","resolution":{"observed_at":"2026-07-11T03:17:50.867183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-14T10:51:16.019022Z","title":"arXiv preprint arXiv:2011.01060 , year=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.10557","last_updated":"2026-07-12T04:13:27Z","snapshot_observed_at":"2026-08-02T22:23:29.279042Z","submitted_at":"2026-07-12T04:13:27Z","title":"UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T10:51:16.019022Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2607.10557"},"observation_digest":"sha256:f623f53c6daaa3e174fab591e3ecbe836be9335e920d436ff0c430b3b7e977af","observation_id":"04829529-6ee2-487f-bc6f-849892b168f8","resolution":{"observed_at":"2026-07-14T10:51:16.019022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-02T14:32:13.855193Z","title":"Constructing a multi- hop QA dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16209","last_updated":"2026-05-10T13:27:01Z","snapshot_observed_at":"2026-08-04T15:59:45.794846Z","submitted_at":"2026-05-10T13:27:01Z","title":"Shapley Context Pruning: A Cooperative Game Perspective for Context Reranking and Pruning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T14:32:13.855193Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2607.16209"},"observation_digest":"sha256:5a97d1a93ffb23f32224350d723a6b292ae544256c6f6d6d65f3acacd040e0b9","observation_id":"435da1a2-d03b-4139-a24d-6d6fb00a3ecf","resolution":{"observed_at":"2026-08-02T14:32:13.855193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-02T09:45:49.539339Z","title":"D., Sugawara, S., and Aizawa, A","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.539339Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:19eaeb6e53c57f03c14e3ae88807ac54c50a01e07dddc8cfb0d9e678bca56f94","observation_id":"a74b787b-e60c-4ba7-88e0-0eee59648c1b","resolution":{"observed_at":"2026-08-02T09:45:49.539339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2011.01060/citation-record","integrity":"/paper/2011.01060/integrity","json":"/paper/2011.01060/citation-record.json","paper":"/paper/2011.01060"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Proceedings of the 1993 ACM SIGMOD International Conference on Management of Data, SIGMOD ’93, page 207–216, New York, NY , USA","venue":null,"work_id":"98128415-244d-4c92-a5dc-b51ec85147d9","year":1993},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:6633c194962542a1a571c79e94807b0000d9bd19503b8fab724b72112ac03fb8","observation_id":"b36a629a-3b0f-4c30-bbd9-ae4fa763a8e7","resolution":{"observed_at":"2026-05-18T07:39:58.446622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Proceedings of the 2013 Conference on Empirical Methods in Natural Language Processing , pages 1533–1544, Seattle, Washington, USA, October","venue":null,"work_id":"db3cb5c8-c6d0-497e-8e68-42ba546da6b4","year":2013},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:d0d7fb4d2b1d438c9d500cae66177f3b6f7e5ba284bea4a728be740d04322d22","observation_id":"7432c0d9-f441-4f71-bf49-e932fe90b9f0","resolution":{"observed_at":"2026-05-18T07:39:58.453648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02075","last_updated":"2015-06-05T21:48:39Z","snapshot_observed_at":"2026-07-06T04:20:05.457426Z","submitted_at":"2015-06-05T21:48:39Z","title":"Large-scale Simple Question Answering with Memory Networks","version":1},"cited_work":{"arxiv_id":"1506.02075","doi":"10.48550/arxiv.1506.02075","metadata_source":"pith","pith_arxiv_id":"1506.02075","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Large-scale Simple Question Answering with Memory Networks","venue":"cs.LG","work_id":"f99ac6ec-9a3c-47f6-8a5d-d44a87cc5310","year":2015},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"cited_paper":"/paper/1506.02075","citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:be0e811f82864f542f5bb7364bb666e4c389c5bd3a9e5f23929494760b7872a4","observation_id":"99b0b215-057c-451f-94e2-d0cca7acc3e1","resolution":{"observed_at":"2026-05-18T07:39:58.399296Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"13612f84-0843-42c4-8425-d7a493498569","year":2019},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:3c03f9bf0d4e104376b1693803fb4534d64282a496ed375ef191c99635768376","observation_id":"9df89687-67e3-4778-8798-3decd40b9cc9","resolution":{"observed_at":"2026-05-18T07:39:58.457160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07347","last_updated":"2021-05-11T23:29:14Z","snapshot_observed_at":"2026-07-06T09:12:41.346393Z","submitted_at":"2020-04-15T21:18:15Z","title":"HybridQA: A Dataset of Multi-Hop Question Answering over Tabular and Textual Data","version":3},"cited_work":{"arxiv_id":"2004.07347","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.07347","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ArXiv, abs/2004.07347","venue":null,"work_id":"5fcb8daa-ece5-40c8-8a10-83174824aaf5","year":2004},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"cited_paper":"/paper/2004.07347","citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:16065df59aa87ef632d7dba72cd1c3f2b0465977d794a9a1434860dbed699685","observation_id":"8b5b711c-46c3-41b4-946f-a7fd4c879c23","resolution":{"observed_at":"2026-05-18T07:39:58.388251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"10fca75e-70dc-412e-86ca-67f201993f80","year":2019},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:a4d799fdcb77588330d6532d0c1c92c4b1c5b95a0efb6c421382d57365cf7e56","observation_id":"552106ad-af2d-481e-8349-27bae1bc1adb","resolution":{"observed_at":"2026-05-18T07:39:58.410989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Proceedings of COLING 2016, the 26th International Conference on Computational Linguistics: Technical Papers , pages 2956–2965, Osaka, Japan, December","venue":null,"work_id":"68e879cf-750a-4a28-a5bb-091c2d5155e8","year":2016},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:f9ae99464f20f82f504bfbe2a33fca3f70403d2cb19d32bc673b98b3117bc5bb","observation_id":"7a87f1b8-3a3e-4485-86e7-8d24c8a0541a","resolution":{"observed_at":"2026-05-18T07:39:58.416128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing, pages 2021–2031, Copenhagen, Denmark, September","venue":null,"work_id":"44c1461d-c1ed-4798-a42f-f4aad81a5de6","year":2017},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:4a085fddb67756d691274af96c42ad2786afc4c4f9a95bfc541d4d2e39e9c3e5","observation_id":"c076e7a4-fb88-4667-a4fe-3aeaeca42fdf","resolution":{"observed_at":"2026-05-18T07:39:58.421682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":"1907.11692","doi":"10.1007/s10489-02203627-9","metadata_source":"pith","pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","venue":"cs.CL","work_id":"41fe12c4-e538-4890-a244-480650ed3078","year":2019},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:6ed87ce021b37efd59d28cbea52e8a20d9846596444173a04f501b31cef1dcd8","observation_id":"2329a960-8cb7-4f8a-8101-57f7deb6abee","resolution":{"observed_at":"2026-05-18T07:39:58.406542Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing, pages 2383–2392, Austin, Texas, November","venue":null,"work_id":"7615aa22-d623-4a6b-8010-2712ddc46f58","year":2016},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:3f22bbaabc399ffc7dac0a59d8eeb790cc3f73988dfd25ad7d073c5983dfe754","observation_id":"4e3d2b22-2778-40bc-961b-99321182a240","resolution":{"observed_at":"2026-05-18T07:39:58.426466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Proceedings of the 2010 Conference on Empirical Methods in Natural Language Processing, pages 1088–1098, Cambridge, MA, October","venue":null,"work_id":"8fe899c8-61a9-4344-9c55-67db30af5c05","year":2010},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:8e28e36e2f967fd619e7974159111c6ec02376af3bbe55c5c31dde2c3f80298a","observation_id":"45f0188f-60ca-4dbc-8da8-c4d64668043e","resolution":{"observed_at":"2026-05-18T07:39:58.431050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Association for Computational Linguistics","venue":null,"work_id":"856a337c-be93-4d54-882c-d2cece4a57df","year":2018},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:bad9fe79bdf08040c21bb2bbb0ade2dbff4f55acc4a9910f3bd456858c800748","observation_id":"70991d22-2845-4549-9c7c-e4999d799c4c","resolution":{"observed_at":"2026-05-18T07:39:58.434892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"40031ed4-d1f2-4b16-ad0e-3b3f2cc3536b","year":2018},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:cdc50a6f8fdeb4025ed1f6a068902c83f638c2af68b8cf56f4afadd1b19316d0","observation_id":"4da38f82-70cc-4859-9f23-aa44603f3a31","resolution":{"observed_at":"2026-05-18T07:39:58.438862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing , pages 2369–2380, Brussels, Belgium, October-November","venue":null,"work_id":"7334b25b-b129-4ca6-8ae2-fc6db91900c2","year":2018},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:b14d20fa1dd7702983a384aa7644a2c2e5308589c1ed349c2c8a17ba7479de60","observation_id":"6bcf5f79-439d-490a-9bf2-a5433923ad3c","resolution":{"observed_at":"2026-05-18T07:39:58.442595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a40499cc-648a-48d8-9400-5820d82ccca9","year":2020},"citing_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T07:39:58.366423Z"},"links":{"citing_paper":"/paper/2011.01060"},"observation_digest":"sha256:7ecf40246893c406ac23514718473ca2d45f3cb3cdb2182eaab29200f157bc64","observation_id":"ad1860ed-25b2-4403-89d6-0d2c59d374c8","resolution":{"observed_at":"2026-05-18T07:39:58.450122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 52 inbound Pith citation observations for arXiv:2011.01060."}