{"as_of":"2026-08-08T16:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f2ae6e7fe8db307152f30eea8cc8a5a9dba195f10183d044a00f1f45af5004f9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:20:25.752009Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:00:21.837128Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.11802","last_updated":"2024-12-24T01:41:28Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:01:45Z","title":"Counting-Stars: A Multi-evidence, Position-aware, and Scalable Benchmark for Evaluating Long-Context Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11802","snapshot_observed_at":"2026-08-07T14:20:25.752009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.752009Z"},"links":{"cited_paper":"/paper/2403.11802","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:3acadd41f8184dc501ab969f5b07fe7516c5b8f3f29302c74a397b065c8313e9","observation_id":"16b931d1-cca0-4832-86c7-03529d525cb7","resolution":{"observed_at":"2026-08-07T14:20:25.752009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11802","last_updated":"2024-12-24T01:41:28Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:01:45Z","title":"Counting-Stars: A Multi-evidence, Position-aware, and Scalable Benchmark for Evaluating Long-Context Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11802","snapshot_observed_at":"2026-08-07T14:08:12.726053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19959","last_updated":"2025-07-30T16:46:12Z","snapshot_observed_at":"2026-08-07T23:10:33.455433Z","submitted_at":"2025-05-26T13:21:18Z","title":"MiniLongBench: The Low-cost Long Context Understanding Benchmark for Large Language Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:12.726053Z"},"links":{"cited_paper":"/paper/2403.11802","citing_paper":"/paper/2505.19959"},"observation_digest":"sha256:d478bc37ecd3ca0f8593e76acf405b870b6971822942d6e4b0513b1ae98e923d","observation_id":"9ccd3baa-49a3-4c3f-aabd-9f5bb6097bfc","resolution":{"observed_at":"2026-08-07T14:08:12.726053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11802","last_updated":"2024-12-24T01:41:28Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:01:45Z","title":"Counting-Stars: A Multi-evidence, Position-aware, and Scalable Benchmark for Evaluating Long-Context Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11802","snapshot_observed_at":"2026-08-06T17:59:55.426052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09506","last_updated":"2025-08-04T01:12:15Z","snapshot_observed_at":"2026-08-06T17:51:50.204391Z","submitted_at":"2025-07-13T06:17:53Z","title":"Ref-Long: Benchmarking the Long-context Referencing Capability of Long-context Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:59:55.426052Z"},"links":{"cited_paper":"/paper/2403.11802","citing_paper":"/paper/2507.09506"},"observation_digest":"sha256:1b044f4c2e81fab7c9bd38cac00f74419451675ce47c273b4aacb1c9a7cb835f","observation_id":"12fa92ed-3aa3-45b5-b1e3-ed4622414560","resolution":{"observed_at":"2026-08-06T17:59:55.426052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11802","last_updated":"2024-12-24T01:41:28Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:01:45Z","title":"Counting-Stars: A Multi-evidence, Position-aware, and Scalable Benchmark for Evaluating Long-Context Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11802","snapshot_observed_at":"2026-08-04T13:54:21.003595Z","title":", Zheng , M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24563","last_updated":"2026-07-15T12:54:15Z","snapshot_observed_at":"2026-08-05T23:40:26.873053Z","submitted_at":"2025-09-29T10:16:05Z","title":"NeMo: Needle in a Montage for Video-Language Understanding","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:21.003595Z"},"links":{"cited_paper":"/paper/2403.11802","citing_paper":"/paper/2509.24563"},"observation_digest":"sha256:21cd7791b0b30e40f9fc15789563a5e4e673dd978fe6a23548212fb626cae16d","observation_id":"8075076c-ab8c-42af-9475-5807a2d90d83","resolution":{"observed_at":"2026-08-04T13:54:21.003595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11802","last_updated":"2024-12-24T01:41:28Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:01:45Z","title":"Counting-Stars: A Multi-evidence, Position-aware, and Scalable Benchmark for Evaluating Long-Context Large Language Models","version":5},"cited_work":{"arxiv_id":"2403.11802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11802","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fc29fd2b-402a-41d6-a8bb-50d39fefae3d","year":2025},"citing_paper":{"arxiv_id":"2605.23170","last_updated":"2026-05-22T02:42:41Z","snapshot_observed_at":"2026-08-03T03:47:34.013785Z","submitted_at":"2026-05-22T02:42:41Z","title":"Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-25T04:58:15.184063Z"},"links":{"cited_paper":"/paper/2403.11802","citing_paper":"/paper/2605.23170"},"observation_digest":"sha256:44ddf5985dbe9ebc397c62f1516f60af85e2a43080303cd6b8ec4a4bffc5093c","observation_id":"89425d64-ea27-4ecb-a284-01e938271b2d","resolution":{"observed_at":"2026-05-25T05:00:21.839923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2403.11802/citation-record","integrity":"/paper/2403.11802/integrity","json":"/paper/2403.11802/citation-record.json","paper":"/paper/2403.11802"},"outbound":[],"paper":{"arxiv_id":"2403.11802","last_updated":"2024-12-24T01:41:28Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:01:45Z","title":"Counting-Stars: A Multi-evidence, Position-aware, and Scalable Benchmark for Evaluating Long-Context Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2403.11802."}