{"as_of":"2026-08-10T03:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e591fee704991aa117f80d3491b15cd43353cdc76bdeb02784f3e117a49c4f0b","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:51:32.176410Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T17:12:24.565155Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T17:15:51.605247Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.19363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19363","snapshot_observed_at":"2026-07-01T17:15:51.605247Z","title":"Lon- gReasonArena: A Long Reasoning Benchmark for Large Language Models.arXiv preprint arXiv:2508.19363","venue":null,"work_id":"f2c3fd1c-e353-4a36-b6a9-0d12fac8d47b","year":null},"citing_paper":{"arxiv_id":"2601.20251","last_updated":"2026-05-08T20:35:11Z","snapshot_observed_at":"2026-07-06T22:43:17.026472Z","submitted_at":"2026-01-28T04:59:20Z","title":"Efficient Evaluation of LLM Performance with Statistical Guarantees","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T10:58:40.958435Z"},"links":{"cited_paper":"/paper/2508.19363","citing_paper":"/paper/2601.20251"},"observation_digest":"sha256:4232026b6c1f90376b65a5260ff9a8299b1cc40cced3103c6d13db80d91b7e67","observation_id":"90c34bf1-150e-42b7-9342-24f0518e0937","resolution":{"observed_at":"2026-05-16T11:00:51.735759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.19363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19363","snapshot_observed_at":"2026-07-01T17:15:51.605247Z","title":"Lon- gReasonArena: A Long Reasoning Benchmark for Large Language Models.arXiv preprint arXiv:2508.19363","venue":null,"work_id":"f2c3fd1c-e353-4a36-b6a9-0d12fac8d47b","year":null},"citing_paper":{"arxiv_id":"2606.28186","last_updated":"2026-07-11T22:18:18Z","snapshot_observed_at":"2026-07-16T23:17:54.586391Z","submitted_at":"2026-06-26T15:32:17Z","title":"Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T03:58:32.372896Z"},"links":{"cited_paper":"/paper/2508.19363","citing_paper":"/paper/2606.28186"},"observation_digest":"sha256:9888c8d897ae545579364d6717c946c6ebca86212c47a73bdc06792c6a862d56","observation_id":"64e5264d-9d28-4c1e-91f4-950aeb31e9a3","resolution":{"observed_at":"2026-07-01T17:15:51.607478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19363","snapshot_observed_at":"2026-07-14T17:12:24.565155Z","title":"Longreasonarena: A long reasoning benchmark for large language models.arXiv preprint arXiv:2508.19363,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28186","last_updated":"2026-07-11T22:18:18Z","snapshot_observed_at":"2026-07-16T23:17:54.586391Z","submitted_at":"2026-06-26T15:32:17Z","title":"Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T17:12:24.565155Z"},"links":{"cited_paper":"/paper/2508.19363","citing_paper":"/paper/2606.28186"},"observation_digest":"sha256:571ea1afb0492992d400c699721b0c26af88e53c63123cf73d25c5a05eea2bf0","observation_id":"b887b421-a269-4587-a575-485520251693","resolution":{"observed_at":"2026-07-14T17:12:24.565155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19363/citation-record","integrity":"/paper/2508.19363/integrity","json":"/paper/2508.19363/citation-record.json","paper":"/paper/2508.19363"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.855643Z","title":"L-eval: Instituting standardized evaluation for long context language models","venue":null,"work_id":"3716b1bc-4d10-40bb-8bd6-42b20245551b","year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.008462Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:592c4f2689aa447e6433d8095f844a86c83a855e33f622666a3ee1a8271c7482","observation_id":"11ef3de4-451f-432f-94a9-e05fefabb761","resolution":{"observed_at":"2026-08-05T15:51:32.861933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.014136Z","title":"Claude 3.7 sonnet system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.014136Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:f60fd4fecdf428e9be6ae4088465b4dc7b7c0321b1ac97e700396aa8df24187d","observation_id":"83b9d2d6-6fee-483c-b6d4-057613265663","resolution":{"observed_at":"2026-08-05T15:51:32.014136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.019484Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.019484Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:eae888126ac002cb4f2f49ad0cb832ec52223601a5f570b04106240a6cca5e74","observation_id":"f04d89fb-afaa-4542-8e93-f7255cdc5847","resolution":{"observed_at":"2026-08-05T15:51:32.019484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.810469Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"d7412164-4cdf-4982-ad56-609b602d5bcd","year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.025654Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:b1c9eed97db648675ce9e9c104773d7a02ef31c96052b3fa96214ea6636692c0","observation_id":"9e3bdcfd-9c47-4dff-ba7d-6eeeda6934bf","resolution":{"observed_at":"2026-08-05T15:51:32.817698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.031629Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.031629Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:28057a4150da4c4e87f07a713e531cbafdcaed9f01c1d5aef8853dcd2f46d26e","observation_id":"37d218c6-2947-44f0-99b2-e246952933e1","resolution":{"observed_at":"2026-08-05T15:51:32.031629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.779673Z","title":"LR B ench: Evaluating long-chain reflective reasoning capabilities of large language models via constraint satisfaction problems","venue":null,"work_id":"720b2c0e-6c5d-44f3-a8b9-a1db874fd1d4","year":2025},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.036864Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:c9f0d75fef661589c05febded18aefd0de3d692905e22d826651db83c4e8c3e8","observation_id":"22942380-c5c6-4ad2-93db-3d973e3a7bd7","resolution":{"observed_at":"2026-08-05T15:51:32.785049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.042642Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.042642Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:7856119220b65712fd574281cc47389873a94b66927abe69f35cd5822005f000","observation_id":"9086b855-b637-48ae-8fab-424d8e9deb8a","resolution":{"observed_at":"2026-08-05T15:51:32.042642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.749778Z","title":"Zhang, Hanwei Xu, Hao Yang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":"05108699-ea67-46e0-a3cc-65bb0fc957cf","year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.048204Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:4483dd6107b78d09d792163c6ac3d7b662a5156b70ac35f4ae328a8058591e25","observation_id":"da4897a4-a170-4645-ba63-efc47f0ed0a0","resolution":{"observed_at":"2026-08-05T15:51:32.755102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T15:51:32.053211Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.053211Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:0895f03593eae76a0dcefc8a8425fa152a8ee7fa52c3cb3c374c05d34191a92e","observation_id":"b56c4e72-9614-4507-9c6a-3c851a8248c7","resolution":{"observed_at":"2026-08-05T15:51:32.053211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.733599Z","title":"Measuring coding challenge competence with apps","venue":null,"work_id":"3cdee620-83e5-4b2a-a548-83840c947734","year":2021},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.058557Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:0de9adacd238b7e41ec3936a0b5b23328409647927702ccc8553f4cc94a96fe8","observation_id":"9d3662b6-92dc-4e8f-bda7-ff9e42432c56","resolution":{"observed_at":"2026-08-05T15:51:32.738819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.716567Z","title":"Ruler: What’s the real context size of your long-context language models? In First Conference on Language Modeling , 2024","venue":null,"work_id":"68bc7e93-4fae-4f0b-aed9-4f70b5f5f91d","year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.063645Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:819b1be6056dcf40feb8faf5d410ed63d3722a0d603b8c74295d76705ffe3a23","observation_id":"007f3dc9-ac80-485e-b61e-b99be5be8f9c","resolution":{"observed_at":"2026-08-05T15:51:32.721688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-05T15:51:32.069073Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.069073Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:bd3d51e557c82e512e51b0b32a6cb5d8cdf637a650107a5d2a5f33bc147246bb","observation_id":"8e8f6709-e8a3-46eb-8d97-95febb8296d2","resolution":{"observed_at":"2026-08-05T15:51:32.069073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.699969Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"a47749f7-b52c-4dd6-ba80-8f7ebc72b9d5","year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.074814Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:a0fce34cd7bdab2e6abd10c48a21c7b8cca25b976b2a69180e5d2fdc73b56956","observation_id":"aa31b8e0-2957-483c-b73d-525ff64a29ce","resolution":{"observed_at":"2026-08-05T15:51:32.705364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.682800Z","title":"Needle In A Haystack - pressure testing LLM s","venue":null,"work_id":"81ed7006-8c94-46e5-ac4a-13c43fd9e13b","year":2023},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.079513Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:ed5cd55bc820715b654fe0cc1146bb4b83f9fa2c70f15de048a9915eedc73694","observation_id":"82128b88-5087-4324-a59e-86ccf3fc497a","resolution":{"observed_at":"2026-08-05T15:51:32.687647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.666591Z","title":"Babilong: Testing the limits of llms with long context reasoning-in-a-haystack","venue":null,"work_id":"2af2cab5-35a6-4200-8841-74ab55712ed1","year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.084762Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:fbe1819680ff0c02400d51c3f42d7c6627d43729f601796e7d74b69a6f541267","observation_id":"cde42c8e-5be1-4a33-ad16-f3fdeee6ab84","resolution":{"observed_at":"2026-08-05T15:51:32.671975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.650791Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"3fa3417b-9dbb-49db-ad8b-24f598964de3","year":2023},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.089749Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:c4bd147563d892959e202d2059f40c56c937033680496eb46fbbe11511637cc4","observation_id":"587cae72-04bb-4b6c-a35d-1a70eee7464c","resolution":{"observed_at":"2026-08-05T15:51:32.655989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.633812Z","title":"Longgenbench: Long-context generation benchmark","venue":null,"work_id":"a4f54c63-2872-403d-a065-1a35cc4b3ea3","year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.094827Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:f543433f57f47ab8947930f9371b2dc8c50e2d0817a159c0ecb92c479b7457a7","observation_id":"7369c73c-db9a-48ec-82b6-ce5e909688fc","resolution":{"observed_at":"2026-08-05T15:51:32.639951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.617763Z","title":"Codei/o: Condensing reasoning patterns via code input-output prediction, 2025","venue":null,"work_id":"2b542022-9ef6-4b1b-b5d1-9f3b38e2705b","year":2025},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.100330Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:f0e089dc5d357f28bc5a439b0733aa88dc60fdad810ccc5f8f22f8f11f3ce708","observation_id":"d530507a-6eb7-49d2-8df3-d70b33244b23","resolution":{"observed_at":"2026-08-05T15:51:32.622635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.106332Z","title":"Longreason: A synthetic long-context reasoning benchmark via context expansion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.106332Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:f5174c7287beb1ac664fdad41ac9aff1f3075d6482e3d6cc70252c8e22cde6ed","observation_id":"afd5edd6-3041-45d2-a19e-bfe4605685c2","resolution":{"observed_at":"2026-08-05T15:51:32.106332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03227","last_updated":"2024-10-04T08:29:12Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:29:12Z","title":"ALR$^2$: A Retrieve-then-Reason Framework for Long-context Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03227","snapshot_observed_at":"2026-08-05T15:51:32.111596Z","title":"ALR^2 : A retrieve-then-reason framework for long-context question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.111596Z"},"links":{"cited_paper":"/paper/2410.03227","citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:90c695e8fbe748fc335be3a14a9a10779ffe6d35bd545ed0654920c17c8d4d75","observation_id":"fb36d692-747d-4768-a391-949e6895bfd3","resolution":{"observed_at":"2026-08-05T15:51:32.111596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06667","last_updated":"2024-10-10T05:12:44Z","snapshot_observed_at":"2026-08-07T18:44:02.722182Z","submitted_at":"2024-10-09T08:23:22Z","title":"Large Language Models as Code Executors: An Exploratory Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06667","snapshot_observed_at":"2026-08-05T15:51:32.116702Z","title":"Large language models as code executors: An exploratory study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.116702Z"},"links":{"cited_paper":"/paper/2410.06667","citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:700a8bab74e13251a7beac1cd0fd8662634e9b14a367b817bb4470b9710809ad","observation_id":"0bbb19dd-f518-456a-895a-dd56813da96e","resolution":{"observed_at":"2026-08-05T15:51:32.116702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T15:51:32.121877Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.121877Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:833ef769b6de836e8d5fc78f52bc1ddce9b594aaa9472c34a917fdaf81766c07","observation_id":"62d65c44-5632-4c15-96dd-8b952bc853cf","resolution":{"observed_at":"2026-08-05T15:51:32.121877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T15:51:32.127034Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.127034Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:134f03be61d3f83ec5299285de52c5a3425b94263762e193e9fd78bf42abd0a6","observation_id":"07dddfad-b035-405d-9d03-1cec5bda189b","resolution":{"observed_at":"2026-08-05T15:51:32.127034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.600297Z","title":"QwQ-32B : Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":"dba53b9a-acfc-49f8-876a-1cf8bd168381","year":2025},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.132367Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:64603bd04f9f2ce51a2f46c97e8b0ab43d67e91e4d1f142db75b4b153d9bb118","observation_id":"68c2adb3-59fc-4371-99b8-a3b3b0b3d0e8","resolution":{"observed_at":"2026-08-05T15:51:32.606333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.579962Z","title":"Longgenbench: Benchmarking long-form generation in long context llms, 2025","venue":null,"work_id":"405b8505-3e6a-4d23-b247-06516bb64899","year":2025},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.137583Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:6e0b2ca5a5053a5e7e3f50ad5265909ed3b3e45a1ff73945c4b02679222224ec","observation_id":"51b21b92-873c-4ea0-a5cb-cdc7dd413440","resolution":{"observed_at":"2026-08-05T15:51:32.585678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.561200Z","title":"Thoughts are all over the place: On the underthinking of o1-like llms, 2025","venue":null,"work_id":"956ddf1c-22ea-4aa4-9bd1-3c04ad2d5c9f","year":2025},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.143425Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:2bcb814a5c6368425769e038ce1f6bf8e8ba16543d86f0711069ad73fd69e054","observation_id":"ba883100-1b0f-45d7-b249-02cb092fba8e","resolution":{"observed_at":"2026-08-05T15:51:32.566596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.543586Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"b14fc4b4-d7b3-42e5-b547-b2e13587ac78","year":2022},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.148617Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:f648beb24db547624a3ab10502c34a4bae3f19dc38bc43e92643e32e545787e5","observation_id":"c6f8f972-9d78-458d-8b70-9aa23eaf3561","resolution":{"observed_at":"2026-08-05T15:51:32.549943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.526785Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"ae1a5e76-7b68-4aef-aea9-dff93d6f14af","year":2023},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.155937Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:a0b99aa5786e3aa5c0109ce727c7cc9b980e046b3f2ab12e82249b8d5f7928d6","observation_id":"2d3677ff-fa16-463b-99da-667f05f9e955","resolution":{"observed_at":"2026-08-05T15:51:32.532111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T15:51:32.161124Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.161124Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:ab9c21eb73b95e643a408e31e2ae3a4610c984fef7cba3da74609851769508d8","observation_id":"ed79a072-bcfb-4a41-bc25-554558b72305","resolution":{"observed_at":"2026-08-05T15:51:32.161124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:51:32.510785Z","title":"bench: Extending long context evaluation beyond 100k tokens","venue":null,"work_id":"14642de9-6431-4d77-be0d-8b5ddbe72ca2","year":2024},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.166762Z"},"links":{"citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:4d69ca8602c36103be38cc6d8fc601b78a54ceb1553ab9b9455d1c5c719f66bf","observation_id":"c9be9688-3096-4da2-9b6f-978494eda5b0","resolution":{"observed_at":"2026-08-05T15:51:32.515796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17807","last_updated":"2025-02-25T03:29:53Z","snapshot_observed_at":"2026-08-07T17:51:24.626878Z","submitted_at":"2025-02-25T03:29:53Z","title":"DocPuzzle: A Process-Aware Benchmark for Evaluating Realistic Long-Context Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2502.17807","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.17807","snapshot_observed_at":"2026-08-05T15:51:32.265966Z","title":"DocPuzzle: A Process-Aware Benchmark for Evaluating Realistic Long-Context Reasoning Capabilities","venue":"cs.AI","work_id":"608e44fe-7ea2-4022-9b6c-f2792d785345","year":2025},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.171536Z"},"links":{"cited_paper":"/paper/2502.17807","citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:11aa015851dfd2794ca9c71e867d12b5d03b6c67a892c423e2152eabbf5acb92","observation_id":"c9c1372d-36af-4af5-b030-0f44c37b9f30","resolution":{"observed_at":"2026-08-05T15:51:32.274409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05252","last_updated":"2025-02-07T17:05:25Z","snapshot_observed_at":"2026-08-09T01:20:28.151253Z","submitted_at":"2025-02-07T17:05:25Z","title":"GSM-Infinite: How Do Your LLMs Behave over Infinitely Increasing Context Length and Reasoning Complexity?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05252","snapshot_observed_at":"2026-08-05T15:51:32.176410Z","title":"Gsm-infinite: How do your llms behave over infinitely increasing context length and reasoning complexity? arXiv preprint arXiv:2502.05252 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T15:51:32.176410Z"},"links":{"cited_paper":"/paper/2502.05252","citing_paper":"/paper/2508.19363"},"observation_digest":"sha256:597ddc6545cdeb3fd2c4dc270ee5e1a813a0e6d7da6a57e01082da9d05cf3b8f","observation_id":"2448123f-d8e5-4f46-ada2-a791e302adcd","resolution":{"observed_at":"2026-08-05T15:51:32.176410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19363","last_updated":"2025-08-26T18:41:53Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T15:51:17.708655Z","submitted_at":"2025-08-26T18:41:53Z","title":"LongReasonArena: A Long Reasoning Benchmark for Large Language Models"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 3 inbound Pith citation observations for arXiv:2508.19363."}