{"as_of":"2026-08-10T18:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3fc26fc94505e492107fe28329e98e54865e8fc70585c9b7195e94e7eaa368b7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:32:55.522442Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T22:53:33.136794Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":"2304.14407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understanding system","venue":null,"work_id":"bd186832-fce9-4e7a-845b-19a5d5673de2","year":2023},"citing_paper":{"arxiv_id":"2407.08101","last_updated":"2026-04-14T18:39:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-11T00:10:45Z","title":"What to Say and When to Say it: Live Fitness Coaching as a Testbed for Situated Interaction","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-23T22:51:08.753650Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2407.08101"},"observation_digest":"sha256:058584828f1bf206de3b06360bac4652cfad5258a780c11a53210d28faf32f10","observation_id":"19efc1b1-4ac3-49c7-892a-bae99dec71b5","resolution":{"observed_at":"2026-05-23T22:53:33.140158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-10T15:32:55.522442Z","title":"Chatvideo: A tracklet-centric multimodal and ver- satile video understanding system","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13893","last_updated":"2025-01-23T18:08:57Z","snapshot_observed_at":"2026-08-10T15:27:33.894568Z","submitted_at":"2025-01-23T18:08:57Z","title":"Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T15:32:55.522442Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2501.13893"},"observation_digest":"sha256:beaecf532cc37f457faf171675742fcfb43579196f510f81d51fc2ce1bc0eab2","observation_id":"b3f9c2bb-b7c7-4305-b561-1d2bbde3d384","resolution":{"observed_at":"2026-08-10T15:32:55.522442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-08T20:06:35.185621Z","title":"Wang, P., Bai, S., Tan, S., Wang, S., Fan, Z., Bai, J., Chen, K., Liu, X., Wang, J., Ge, W., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.185621Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:39018be5f2efab7f7c21c0ca422b1e5beb92e5dc5d57cb18f37b1e62214f9fce","observation_id":"ec2a373d-f810-4828-a02f-1d37a7f2e28d","resolution":{"observed_at":"2026-08-08T20:06:35.185621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-08T15:31:16.967715Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understanding system","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-10T08:26:15.411427Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T15:31:16.967715Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2502.06428"},"observation_digest":"sha256:a8970f76d2569c761563631b14bae2d3c52ae9471f201dba7df0f0cf9b3b5c19","observation_id":"cd22ef6a-5f86-4416-ad29-b5ba31469af1","resolution":{"observed_at":"2026-08-08T15:31:16.967715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-07T05:05:51.278905Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-10T09:10:24.911665Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:51.278905Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:f8cc7cb3677ac264268c91ad64898fcfcc4d22c70ecfc13e502d9e038dc18b47","observation_id":"06d262f9-5160-4354-bb14-4ce73c8dbb54","resolution":{"observed_at":"2026-08-07T05:05:51.278905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-06T04:49:41.124471Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.124471Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:fbf360f1e4d7234e4545273e5efc3bd1b1fc78e4c16fcf4226c76f910a248090","observation_id":"0dd44e4c-e53b-44f3-be17-484d8fd9ff9b","resolution":{"observed_at":"2026-08-06T04:49:41.124471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-05T20:29:09.748930Z","title":"Wang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-09T12:54:37.629481Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":269,"source":"arxiv_source","source_observed_at":"2026-08-05T20:29:09.748930Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:d286b865145e69c8f82f5ef71b5317a527a7a4b4c1bc6ab4c556a2415ff676c7","observation_id":"ac6a474e-5933-453f-9972-1f4d49aeb7e2","resolution":{"observed_at":"2026-08-05T20:29:09.748930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-08-05T13:46:03.282561Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understanding system","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-09T06:09:58.396638Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:03.282561Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:6231c6c8a5f5ae89c774487aef90bbdc64f68e88cd4d353d73a96aa0c50477b8","observation_id":"c9e2d0ce-b931-4d3f-84e6-2435b6d1b4d1","resolution":{"observed_at":"2026-08-05T13:46:03.282561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":"2304.14407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understanding system","venue":null,"work_id":"bd186832-fce9-4e7a-845b-19a5d5673de2","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-07T14:16:18.120869Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:c0ec008d17c6f3066a6afc37eb9e06fb839d408975a7cf6663c0147e6bf611a5","observation_id":"5763ab29-2d37-442c-86c7-bfe7cc13504d","resolution":{"observed_at":"2026-05-15T18:26:27.035766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":"2304.14407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understanding system","venue":null,"work_id":"bd186832-fce9-4e7a-845b-19a5d5673de2","year":2023},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:a66aae6106fc5bdfd776cbb64f6645cf05b6c65105edb99f3e696040b2b9b156","observation_id":"1f8f433f-4812-4bc4-8563-c4b538c5550d","resolution":{"observed_at":"2026-05-15T18:10:13.132631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":"2304.14407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understanding system","venue":null,"work_id":"bd186832-fce9-4e7a-845b-19a5d5673de2","year":2023},"citing_paper":{"arxiv_id":"2605.07897","last_updated":"2026-05-08T15:40:40Z","snapshot_observed_at":"2026-08-09T07:41:26.425560Z","submitted_at":"2026-05-08T15:40:40Z","title":"Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T02:12:20.651111Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2605.07897"},"observation_digest":"sha256:340e0665511e37626dff20da6f8a65199b49f4f17a143ca74c0bc90eb6bae1f6","observation_id":"46f6a05a-b353-4bc2-8862-e30fd90d321a","resolution":{"observed_at":"2026-05-11T03:50:56.473686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2304.14407/citation-record","integrity":"/paper/2304.14407/integrity","json":"/paper/2304.14407/citation-record.json","paper":"/paper/2304.14407"},"outbound":[],"paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2304.14407."}