{"as_of":"2026-08-07T23:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee04aa89fedc0b1f7c0e4280ff580d276a20da16f6a8d2d95059b0ec1d508092","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:31:45.191937Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02000/citation-record","integrity":"/paper/2506.02000/integrity","json":"/paper/2506.02000/citation-record.json","paper":"/paper/2506.02000"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.11088","last_updated":"2023-10-04T10:04:25Z","snapshot_observed_at":"2026-07-06T15:56:38.019661Z","submitted_at":"2023-07-20T17:59:41Z","title":"L-Eval: Instituting Standardized Evaluation for Long Context Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11088","snapshot_observed_at":"2026-08-07T15:31:42.196733Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.196733Z"},"links":{"cited_paper":"/paper/2307.11088","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:e722f7c8c512869b6fe2dba77573f1ed3fa6b742629b2c769419b0075d53a62b","observation_id":"bdf90adb-491d-4380-8de7-725ff8812b0c","resolution":{"observed_at":"2026-08-07T15:31:42.196733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:48.916268Z","title":null,"venue":null,"work_id":"b53646da-82d9-41f6-ba49-7fb0b80c3e76","year":2023},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.259177Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:ec55ce73c84a3613d72d3a0984e682990d772f8660b1a39e8bddf117e0b1a390","observation_id":"4bfa2222-e7cb-441d-981c-dda2d9e3b3a4","resolution":{"observed_at":"2026-08-07T15:31:48.981200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-02T11:20:36.216220Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-07T15:31:42.323817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.323817Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:22fb142e1409746b2855ed059e50b6c354697ef5e57652322359d15a446c3c48","observation_id":"6a246a3d-f5e8-40bc-a3c9-31178427557d","resolution":{"observed_at":"2026-08-07T15:31:42.323817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T15:31:42.391811Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.391811Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:42963cbee55c47daaad3cf461263ff415cfd15d80fce91ed7b2bdde567947ccd","observation_id":"9cca8458-b8f9-41d0-8186-0a909cd0acc8","resolution":{"observed_at":"2026-08-07T15:31:42.391811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-07T15:31:42.483574Z","title":"Le, and Ruslan Salakhutdinov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.483574Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:f0d1f4d8006e55a750fbe7eaa24b1cde29d80cde96ca0126f5d5614d1dab456d","observation_id":"cd6a0f39-8641-449a-b3e6-64e5d9eb0c55","resolution":{"observed_at":"2026-08-07T15:31:42.483574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:48.658227Z","title":null,"venue":null,"work_id":"da580fa7-63a2-4aa5-ac42-22c0fbb2651e","year":2025},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.578742Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:af2706d950bec5113415820a24e805d0ed94e854d7377cd0d01b6d908e513940","observation_id":"f582631c-bdcd-4b32-91b4-cfe7c5b2df20","resolution":{"observed_at":"2026-08-07T15:31:48.792392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:48.416532Z","title":null,"venue":null,"work_id":"c4f99446-8fb1-40c5-a950-85cff1d21b05","year":2025},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.681448Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:986acc37550a4a0455466618b05256d644de17dc21d38794641ed15544664610","observation_id":"4ca6d699-4ec4-4609-8dd3-3d697496675a","resolution":{"observed_at":"2026-08-07T15:31:48.484142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-07T15:31:42.756912Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.756912Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:4bf1125eea96a11f10446a14e85fa128d7082ed18b5ad0aaa07a8cfb6c5ce255","observation_id":"071381ea-b736-4724-b2e0-c4d4e06a518d","resolution":{"observed_at":"2026-08-07T15:31:42.756912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07100","last_updated":"2025-02-25T23:48:33Z","snapshot_observed_at":"2026-08-07T17:48:40.636376Z","submitted_at":"2025-02-25T23:48:33Z","title":"EnDive: A Cross-Dialect Benchmark for Fairness and Performance in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07100","snapshot_observed_at":"2026-08-07T15:31:42.825940Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.825940Z"},"links":{"cited_paper":"/paper/2504.07100","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:571a148baa575f4b4dbce41a9cede7a2f89cb7b0685fdbf82f33c7b6f7966c00","observation_id":"75c8e2a6-0592-48b2-b12b-00e8ac1a680e","resolution":{"observed_at":"2026-08-07T15:31:42.825940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:42.900418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.900418Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:d9735fe13a04ba52353307c1891dfdb0daccaca1acfd6e4cdef98ce2675f2ff7","observation_id":"f1fee9ab-7475-48f8-a9c8-70c0d1062e74","resolution":{"observed_at":"2026-08-07T15:31:42.900418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:48.146949Z","title":null,"venue":null,"work_id":"edd05ca8-127d-4a18-8725-929bcdfe8bfe","year":2025},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:42.958223Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:080bc1bff382d63db376701f813123c240a291ac752de4b3121326afdaaddbcb","observation_id":"06748e38-5412-4ddc-bcb9-28dadad64678","resolution":{"observed_at":"2026-08-07T15:31:48.292313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-07T15:31:43.018867Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.018867Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:738b983dceb161ac2a9f6d3ed6e46a1d90ac2b7b037d69fee467f0fcbed2874a","observation_id":"37e3e0ab-b28e-4f8d-ab60-48725b56b11a","resolution":{"observed_at":"2026-08-07T15:31:43.018867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16264","last_updated":"2024-10-22T15:09:58Z","snapshot_observed_at":"2026-08-06T16:33:35.827574Z","submitted_at":"2024-06-24T02:03:57Z","title":"One Thousand and One Pairs: A \"novel\" challenge for long-context language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16264","snapshot_observed_at":"2026-08-07T15:31:43.077816Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.077816Z"},"links":{"cited_paper":"/paper/2406.16264","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:3ff96aaacdb2d46aca3eede0ba10c7457bc5855ee14f360cac99c9cb3473febe","observation_id":"041d8801-d5db-41c0-acae-fa4c3265b030","resolution":{"observed_at":"2026-08-07T15:31:43.077816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.07040","last_updated":"2017-12-19T16:48:05Z","snapshot_observed_at":"2026-07-31T01:20:29.856066Z","submitted_at":"2017-12-19T16:48:05Z","title":"The NarrativeQA Reading Comprehension Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.07040","snapshot_observed_at":"2026-08-07T15:31:43.137091Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.137091Z"},"links":{"cited_paper":"/paper/1712.07040","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:e0c5ce0ebe067168d021cd348c08094b1ddba7de9da7d47d1cb61ca37a8a838d","observation_id":"e0e4f0b7-fa54-45f8-98ff-be9aacc1dd34","resolution":{"observed_at":"2026-08-07T15:31:43.137091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10149","last_updated":"2024-11-06T14:50:40Z","snapshot_observed_at":"2026-08-06T20:22:33.555366Z","submitted_at":"2024-06-14T16:00:29Z","title":"BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10149","snapshot_observed_at":"2026-08-07T15:31:43.210471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.210471Z"},"links":{"cited_paper":"/paper/2406.10149","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:f429759e8da473557dd156803daa6dba80dce0d98be4d0ec3b94c803cad49103","observation_id":"37534588-8791-4d18-a9c2-29caca12fa5e","resolution":{"observed_at":"2026-08-07T15:31:43.210471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-07T15:31:43.267912Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.267912Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:1cc23032920ac98c30daadc91f5b0428f6a63303538ee62f5d9d03c3827543c3","observation_id":"fbefefc8-41f3-446a-9377-e2ec961d736b","resolution":{"observed_at":"2026-08-07T15:31:43.267912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04939","last_updated":"2024-09-06T05:06:51Z","snapshot_observed_at":"2026-07-06T16:44:55.494764Z","submitted_at":"2023-11-08T01:45:37Z","title":"LooGLE: Can Long-Context Language Models Understand Long Contexts?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04939","snapshot_observed_at":"2026-08-07T15:31:43.324780Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.324780Z"},"links":{"cited_paper":"/paper/2311.04939","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:4aff2a31c7a1b80d628c8a6dcc7dbeb34aff24e965fa3e1a240f70c1fd343031","observation_id":"15cd5cb7-6c85-4d8e-998e-4bf9a0f4ecde","resolution":{"observed_at":"2026-08-07T15:31:43.324780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:43.379678Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.379678Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:377a22196b7f455221be3cc9f22cf528dc868f22c2b66f940949b602b8016169","observation_id":"82393d29-4155-4ee5-88d5-97d148794423","resolution":{"observed_at":"2026-08-07T15:31:43.379678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03246","last_updated":"2024-08-06T15:06:40Z","snapshot_observed_at":"2026-07-06T18:57:31.323769Z","submitted_at":"2024-08-06T15:06:40Z","title":"Making Long-Context Language Models Better Multi-Hop Reasoners","version":1},"cited_work":{"arxiv_id":"2408.03246","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.03246","snapshot_observed_at":"2026-08-07T15:31:45.878386Z","title":"Making Long-Context Language Models Better Multi-Hop Reasoners","venue":"cs.CL","work_id":"d8a93ca4-4608-4840-ae6e-645ac377065b","year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.438051Z"},"links":{"cited_paper":"/paper/2408.03246","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:f9fdd8c64617423c25b10734b058056b040f15c163c85dacb817ef91978b1ad7","observation_id":"48ac52bb-5647-451b-98ea-0052fb0bfbf5","resolution":{"observed_at":"2026-08-07T15:31:46.057841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-07T15:31:43.593760Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.593760Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:9d747a34bb2b05423ef4502318e9d54beb36f7b947aff4b29a1b0bc998a26b39","observation_id":"83efaa79-557c-479d-8e13-c36d6c8758f4","resolution":{"observed_at":"2026-08-07T15:31:43.593760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:47.746737Z","title":null,"venue":null,"work_id":"39e4babb-3153-49fc-9b19-2ac5b7b1ccb5","year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.665498Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:fa609ee9929e0a804ce524cbac37e166f32dc71d690ff5e4f47395b4808874e6","observation_id":"dd451ad6-6fed-415e-bc01-b57e1d81c82e","resolution":{"observed_at":"2026-08-07T15:31:47.972259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:31:43.724505Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.724505Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:952df95c1fbea97860f83e69de15cc98ecf627b604783b31e77ca6b02eef7365","observation_id":"f01e73c1-716e-4e4c-a9cd-3dde364aaf0d","resolution":{"observed_at":"2026-08-07T15:31:43.724505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:47.378766Z","title":null,"venue":null,"work_id":"c86d8ed0-82d5-49e2-8bf1-20f5bd2fb99c","year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.810014Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:8d54c73f8a3a8142f67a5a7e3ea6492d64cbf6fc329c3344f7a4ee8a5e8e790b","observation_id":"67c01229-56bb-4924-a0dc-e91351698c36","resolution":{"observed_at":"2026-08-07T15:31:47.557596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:46.969994Z","title":null,"venue":null,"work_id":"2aba4373-a114-4480-91e9-817deeecf76e","year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.875143Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:17baaf925e99fdda251c7d06d6fecb85576b71810874b56e9298a8d4955e59c1","observation_id":"de9afda2-7828-471d-a59d-7f08b679dea1","resolution":{"observed_at":"2026-08-07T15:31:47.160960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08608","last_updated":"2022-05-11T04:59:10Z","snapshot_observed_at":"2026-08-04T03:33:22.619513Z","submitted_at":"2021-12-16T04:14:38Z","title":"QuALITY: Question Answering with Long Input Texts, Yes!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08608","snapshot_observed_at":"2026-08-07T15:31:43.967050Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:43.967050Z"},"links":{"cited_paper":"/paper/2112.08608","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:f4fd03a100ba89a18cdd3199f771a978e3206ef4ffd28db23457e5e57a4245a4","observation_id":"7ac20032-db84-4839-b3d8-6f59f3fbc621","resolution":{"observed_at":"2026-08-07T15:31:43.967050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:46.681244Z","title":null,"venue":null,"work_id":"f5172d2d-b9e9-4226-af4a-661b22675d3e","year":2017},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.038710Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:818f138cc263ab782c740ddff46f5bfa3627c0450c5c1af9599aa235849707a1","observation_id":"25f096e5-05cd-4146-bdfb-a0e5a630a30c","resolution":{"observed_at":"2026-08-07T15:31:46.779048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00573","last_updated":"2022-05-05T05:50:50Z","snapshot_observed_at":"2026-08-05T14:23:49.315145Z","submitted_at":"2021-08-02T00:33:27Z","title":"MuSiQue: Multihop Questions via Single-hop Question Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.00573","snapshot_observed_at":"2026-08-07T15:31:44.114430Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.114430Z"},"links":{"cited_paper":"/paper/2108.00573","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:49759bfd7a31817b7492ff6b0ccdb8e0381145e9827852e4e2e63ae03ee903ff","observation_id":"2ef4bcdd-f7fc-43c1-bf0f-47719216ef2b","resolution":{"observed_at":"2026-08-07T15:31:44.114430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12766","last_updated":"2025-04-23T12:52:18Z","snapshot_observed_at":"2026-07-06T17:47:02.560132Z","submitted_at":"2024-03-18T17:32:32Z","title":"NovelQA: Benchmarking Question Answering on Documents Exceeding 200K Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12766","snapshot_observed_at":"2026-08-07T15:31:44.178221Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.178221Z"},"links":{"cited_paper":"/paper/2403.12766","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:84bef4bf106fd1cbdb6ec628d1f3ed570b28943871920008641ff14532bd6220","observation_id":"cbd023b7-282d-4cc8-8988-8356a1ee77bf","resolution":{"observed_at":"2026-08-07T15:31:44.178221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17419","last_updated":"2024-10-03T06:03:14Z","snapshot_observed_at":"2026-07-06T18:36:38.636181Z","submitted_at":"2024-06-25T09:42:56Z","title":"Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17419","snapshot_observed_at":"2026-08-07T15:31:44.194237Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.194237Z"},"links":{"cited_paper":"/paper/2406.17419","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:5bc55f4e84fad29033b5fc3127cc189b515645a9c58afc9e1b28a3a2ddaecd9f","observation_id":"4b1bcb33-ba5a-42d5-a058-b33a85c2f86c","resolution":{"observed_at":"2026-08-07T15:31:44.194237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06481","last_updated":"2018-06-11T17:08:20Z","snapshot_observed_at":"2026-07-06T06:04:45.729921Z","submitted_at":"2017-10-17T19:35:07Z","title":"Constructing Datasets for Multi-hop Reading Comprehension Across Documents","version":2},"cited_work":{"arxiv_id":"1710.06481","doi":null,"metadata_source":"pith","pith_arxiv_id":"1710.06481","snapshot_observed_at":"2026-08-07T15:31:45.503274Z","title":"Constructing Datasets for Multi-hop Reading Comprehension Across Documents","venue":"cs.CL","work_id":"e6103c6a-3757-4d4d-8b57-e4ad39e48f81","year":2017},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.246400Z"},"links":{"cited_paper":"/paper/1710.06481","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:bdbc2221236cb2ac2cad9d85e9a85aaea0a63f06ff1faddd4842457777c958e5","observation_id":"b9581f1e-2f10-4153-8766-480f809f0ba6","resolution":{"observed_at":"2026-08-07T15:31:45.621660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08913","last_updated":"2022-03-16T19:54:35Z","snapshot_observed_at":"2026-08-05T11:47:40.727016Z","submitted_at":"2022-03-16T19:54:35Z","title":"Memorizing Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08913","snapshot_observed_at":"2026-08-07T15:31:44.312581Z","title":"Rabe, DeLesley Hutchins, and Christian Szegedy","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.312581Z"},"links":{"cited_paper":"/paper/2203.08913","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:b5b1aef7dbfcceeeded9cc5c3eaa70be4cd888024a01c46192ce71dd42822149","observation_id":"5ff3d9e1-8d88-46ad-9254-180582f74010","resolution":{"observed_at":"2026-08-07T15:31:44.312581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03025","last_updated":"2024-01-23T07:49:13Z","snapshot_observed_at":"2026-08-06T04:59:02.070453Z","submitted_at":"2023-10-04T17:59:41Z","title":"Retrieval meets Long Context Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03025","snapshot_observed_at":"2026-08-07T15:31:44.407153Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.407153Z"},"links":{"cited_paper":"/paper/2310.03025","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:372e85cc35b18225260512e9c28f193cfc954f3abcf79d3e3437ff731fe2956d","observation_id":"56785ef9-37ba-433d-8bfc-7cc9266b1d39","resolution":{"observed_at":"2026-08-07T15:31:44.407153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-07-31T11:19:06.421362Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-07T15:31:44.488966Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.488966Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:32cb07634d583a0436242a16f627978908bedd2e2530d96530745534905198e3","observation_id":"a4e40009-68b7-40be-bbd4-977788e6046e","resolution":{"observed_at":"2026-08-07T15:31:44.488966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:44.581369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.581369Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:22b1bbdc6aeb88b078d649ba0de1d7c3df52f10c2d065e7d53040253bb856546","observation_id":"e8e23118-a6f0-417a-ba76-045f36f4d1ea","resolution":{"observed_at":"2026-08-07T15:31:44.581369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.14062","last_updated":"2021-01-08T07:41:50Z","snapshot_observed_at":"2026-07-06T09:42:23.296738Z","submitted_at":"2020-07-28T08:34:04Z","title":"Big Bird: Transformers for Longer Sequences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.14062","snapshot_observed_at":"2026-08-07T15:31:44.720004Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.720004Z"},"links":{"cited_paper":"/paper/2007.14062","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:e959c09e7e7ebe4bd42de6af8e2de44d508e88e3adc517c040928de0814cfa9f","observation_id":"6dd3275c-d11d-4ba1-a9c9-f1f20bed4d6c","resolution":{"observed_at":"2026-08-07T15:31:44.720004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09542","last_updated":"2024-06-26T04:48:11Z","snapshot_observed_at":"2026-07-06T17:02:30.471098Z","submitted_at":"2023-12-15T05:30:14Z","title":"Marathon: A Race Through the Realm of Long Context with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09542","snapshot_observed_at":"2026-08-07T15:31:44.836384Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.836384Z"},"links":{"cited_paper":"/paper/2312.09542","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:29a599651135ed471487e7d1d14fc9fa17cbf170c70ace4d353841669f52b45a","observation_id":"72a004f4-ea60-4886-ac44-e919bf40462d","resolution":{"observed_at":"2026-08-07T15:31:44.836384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14116","last_updated":"2024-06-06T16:41:21Z","snapshot_observed_at":"2026-08-05T07:14:49.201751Z","submitted_at":"2024-02-21T20:30:45Z","title":"FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14116","snapshot_observed_at":"2026-08-07T15:31:44.948205Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:44.948205Z"},"links":{"cited_paper":"/paper/2402.14116","citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:cc982a4fb3264cf7ba9f77677b92a06de76f3f41521be65fb051277beb7f46ee","observation_id":"9019518f-0e40-4776-96d6-5b58b9a00648","resolution":{"observed_at":"2026-08-07T15:31:44.948205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:45.066367Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:45.066367Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:623052381558ee41f78fd5232e287a68864978055c537489b5b8922a3230e508","observation_id":"6401e0da-9b36-47da-ab4a-61d95f037865","resolution":{"observed_at":"2026-08-07T15:31:45.066367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:31:45.191937Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:31:45.191937Z"},"links":{"citing_paper":"/paper/2506.02000"},"observation_digest":"sha256:0fe406126b084e951d6803fe7bf5b1e6faf3b132ca7d58ec542814c0524cc721","observation_id":"5adbf85b-d3d8-4f0e-9ad2-0e3d1f172064","resolution":{"observed_at":"2026-08-07T15:31:45.191937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02000","last_updated":"2025-06-23T01:41:05Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T15:25:33.498661Z","submitted_at":"2025-05-20T20:54:37Z","title":"NovelHopQA: Diagnosing Multi-Hop Reasoning Failures in Long Narrative Contexts"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2506.02000."}