{"as_of":"2026-08-07T22:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f8327c7011b9ae1e798c4f57a61a91c400f26c71d08407e1201f61599965996","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:20:57.091933Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T07:54:22.417988Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2502.06428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-06-30T07:54:22.417988Z","title":"In NeurIPS","venue":null,"work_id":"cee13512-3e7d-4d12-b580-0f32530fd12e","year":2025},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:9ec15ec84985c5c147077b9a016dab452808122e2fca7f2d102a7d70d504d013","observation_id":"3beebf5b-6499-41ad-95b5-4d720e775111","resolution":{"observed_at":"2026-05-15T17:18:53.141676Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-07T15:20:57.091933Z","title":"Cos: Chain-of-shot prompting for long video understanding.arXiv preprint arXiv:2502.06428, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.091933Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:d9507253f26bed6b5b9672e51c3a350bbd3f537a9b7dd06e94ec56ddb77fd006","observation_id":"db2ab293-089b-4639-b534-f9246a05f5a8","resolution":{"observed_at":"2026-08-07T15:20:57.091933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-07T05:26:47.111365Z","title":"Cos: Chain-of-shot prompting for long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.111365Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:6671cc2767b21d47b13a811620adee7be87f317e00c3c91bc36d2b63c37e4df1","observation_id":"86481275-9056-4f32-9893-441e6d675a85","resolution":{"observed_at":"2026-08-07T05:26:47.111365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-06T17:49:34.796119Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09876","last_updated":"2025-07-14T03:21:13Z","snapshot_observed_at":"2026-08-06T17:42:42.583231Z","submitted_at":"2025-07-14T03:21:13Z","title":"ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:34.796119Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2507.09876"},"observation_digest":"sha256:f013e94327ec58f7c9c61e09ea2841af1c5ed7da1d4bac4fe13546a8468094f4","observation_id":"2608cca2-ea4e-443e-af2f-9c56d48093d5","resolution":{"observed_at":"2026-08-06T17:49:34.796119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-05T22:54:32.335081Z","title":"Cos: Chain-of-shot prompting for long video understanding.arXiv preprint arXiv:2502.06428, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06317","last_updated":"2025-08-08T13:47:00Z","snapshot_observed_at":"2026-08-07T09:55:36.226227Z","submitted_at":"2025-08-08T13:47:00Z","title":"Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:54:32.335081Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2508.06317"},"observation_digest":"sha256:27908ae60b341c49643213ca2ae2566036f09caa3a9fa3b3829bc0e8faefb348","observation_id":"9419f8c6-e79c-4b8a-87e9-0244b78e9076","resolution":{"observed_at":"2026-08-05T22:54:32.335081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-05T20:28:58.207978Z","title":"Hu et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-07T18:23:08.889281Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-08-05T20:28:58.207978Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:9f6509eeab2b67bddc6741be68891d8dde92018a1c7f9f1714d5a888f042040c","observation_id":"43fd0233-742b-426d-9870-781e792e941d","resolution":{"observed_at":"2026-08-05T20:28:58.207978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-04T20:20:36.731548Z","title":"Cos: Chain-of-shot prompting for long video under- standing.arXiv preprint arXiv:2502.06428, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08621","last_updated":"2025-09-10T14:17:53Z","snapshot_observed_at":"2026-08-06T13:15:27.312512Z","submitted_at":"2025-09-10T14:17:53Z","title":"AdsQA: Towards Advertisement Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:20:36.731548Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2509.08621"},"observation_digest":"sha256:54d016a643cfdb550998777184dcf8037061af0263fe25c01fd1209882f09968","observation_id":"514acf4c-28ec-443f-9c54-f96477d49094","resolution":{"observed_at":"2026-08-04T20:20:36.731548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2502.06428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-06-30T07:54:22.417988Z","title":"In NeurIPS","venue":null,"work_id":"cee13512-3e7d-4d12-b580-0f32530fd12e","year":2025},"citing_paper":{"arxiv_id":"2605.01657","last_updated":"2026-05-03T00:52:51Z","snapshot_observed_at":"2026-08-02T06:05:08.178689Z","submitted_at":"2026-05-03T00:52:51Z","title":"Act2See: Emergent Active Visual Perception for Video Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T19:34:53.683729Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2605.01657"},"observation_digest":"sha256:887ff50d37f3972ef919f7209b2d3b15c0f9425d3f727c093e26df508d73cd34","observation_id":"5985101b-e687-4c51-ad81-83573ef7fe84","resolution":{"observed_at":"2026-05-09T05:45:23.124557Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2502.06428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-06-30T07:54:22.417988Z","title":"In NeurIPS","venue":null,"work_id":"cee13512-3e7d-4d12-b580-0f32530fd12e","year":2025},"citing_paper":{"arxiv_id":"2605.22013","last_updated":"2026-05-21T05:19:51Z","snapshot_observed_at":"2026-07-06T23:32:25.286443Z","submitted_at":"2026-05-21T05:19:51Z","title":"PointLLM-R: Enhancing 3D Point Cloud Reasoning via Chain-of-Thought","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T07:26:17.850942Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2605.22013"},"observation_digest":"sha256:86400738c2a3abb481870de9e593dd3de59a5468b6531d7d1217356318897e03","observation_id":"5ed05f66-4101-4cf6-910a-c0112a66b507","resolution":{"observed_at":"2026-05-22T07:31:14.211557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2502.06428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-06-30T07:54:22.417988Z","title":"In NeurIPS","venue":null,"work_id":"cee13512-3e7d-4d12-b580-0f32530fd12e","year":2025},"citing_paper":{"arxiv_id":"2605.22678","last_updated":"2026-05-21T16:20:31Z","snapshot_observed_at":"2026-08-01T16:56:58.243776Z","submitted_at":"2026-05-21T16:20:31Z","title":"Swift Sampling: Selecting Temporal Surprises via Taylor Series","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T05:55:23.479344Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2605.22678"},"observation_digest":"sha256:39707ea5a51d84b35954e612e0b1b684bcbec07f6cb00f5acd67cac45f23ecad","observation_id":"27bcad07-30e0-45fa-b29d-75c5862742ff","resolution":{"observed_at":"2026-05-22T05:56:07.910455Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":"2502.06428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-06-30T07:54:22.417988Z","title":"In NeurIPS","venue":null,"work_id":"cee13512-3e7d-4d12-b580-0f32530fd12e","year":2025},"citing_paper":{"arxiv_id":"2606.29445","last_updated":"2026-06-28T15:11:19Z","snapshot_observed_at":"2026-08-02T18:05:44.581086Z","submitted_at":"2026-06-28T15:11:19Z","title":"Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T07:48:01.719339Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2606.29445"},"observation_digest":"sha256:2174d1e3e4c4ef26bc5428485a69c730bedf3e28def6c58fa1862f1ca82e8d22","observation_id":"a3bf1934-716b-4c9b-a41b-98b311482ab2","resolution":{"observed_at":"2026-06-30T07:54:22.419385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-01T22:38:42.688411Z","title":"arXiv preprint arXiv:2502.06428 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.688411Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:8b485fa6749f90d6a7a5208dd2cdb4cef25b877e3416e67aa04148d156985bc5","observation_id":"023e1e81-9023-4cee-9360-1e5ca636e1a5","resolution":{"observed_at":"2026-08-01T22:38:42.688411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06428/citation-record","integrity":"/paper/2502.06428/integrity","json":"/paper/2502.06428/citation-record.json","paper":"/paper/2502.06428"},"outbound":[],"paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2502.06428."}