{"as_of":"2026-08-08T13:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:96decba421e769c6ad78196969adf5cdbc4c473a58ffd898f5a686897aa4ebb9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:03:02.474751Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T00:25:09.414000Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-07T14:03:02.474751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:02.474751Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:fa8f9174dfa504bac0e8b8153365d83a222fb08d55799dd10fd2d3af8843f6c6","observation_id":"f82032cd-ba4f-40fb-82a5-c206f06c27c6","resolution":{"observed_at":"2026-08-07T14:03:02.474751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-07T12:41:51.313475Z","title":"Rawat, and Thomas B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23952","last_updated":"2025-05-29T19:02:48Z","snapshot_observed_at":"2026-08-07T12:35:45.450197Z","submitted_at":"2025-05-29T19:02:48Z","title":"Leveraging Auxiliary Information in Text-to-Video Retrieval: A Review","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:51.313475Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2505.23952"},"observation_digest":"sha256:6e4f6d2f847d53e50131338d6c8a05911101a54fe8933f2c3eb21fd552a51824","observation_id":"a0f8d93c-3dd1-4fe1-99ee-bb4195847a37","resolution":{"observed_at":"2026-08-07T12:41:51.313475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-06T22:47:34.195792Z","title":"Foundation models for video understanding: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20795","last_updated":"2025-06-25T19:36:45Z","snapshot_observed_at":"2026-08-06T22:39:23.894498Z","submitted_at":"2025-06-25T19:36:45Z","title":"How do Foundation Models Compare to Skeleton-Based Approaches for Gesture Recognition in Human-Robot Interaction?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:47:34.195792Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2506.20795"},"observation_digest":"sha256:147d9b75c37ebf40d148765c106a30e1a4f9e57b477a88d7b4ec5a5a17b843de","observation_id":"d9c5ec05-8374-4726-822d-161b0b5cbc8d","resolution":{"observed_at":"2026-08-06T22:47:34.195792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-06T20:15:08.167795Z","title":"Foundation mod- els for video understanding: A survey.arXiv preprint arXiv:2405.03770, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03578","last_updated":"2025-07-04T13:48:12Z","snapshot_observed_at":"2026-08-07T05:28:01.157841Z","submitted_at":"2025-07-04T13:48:12Z","title":"SciVid: Cross-Domain Evaluation of Video Models in Scientific Applications","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:08.167795Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2507.03578"},"observation_digest":"sha256:2869104b1c8a47da5db65ca03e7dff6cb3f478b702358f16085c533db330d684","observation_id":"d21fed4b-9c62-4799-aaf2-71ddaa2232ec","resolution":{"observed_at":"2026-08-06T20:15:08.167795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-06T16:24:44.013977Z","title":"Available: https://arxiv.org/abs/2405.03770","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13637","last_updated":"2026-06-24T08:13:26Z","snapshot_observed_at":"2026-08-07T22:35:50.548609Z","submitted_at":"2025-07-18T03:50:29Z","title":"Towards channel foundation models (CFMs): Motivations, methodologies and opportunities","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T16:24:44.013977Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2507.13637"},"observation_digest":"sha256:6f431be600adbe8bb7100ebddfe970d672413dd94ca2dd84ca05d9817cc1cf5b","observation_id":"95461f5d-2fd6-4227-a5dc-1a5feab35128","resolution":{"observed_at":"2026-08-06T16:24:44.013977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-06T04:49:40.068720Z","title":"Rawat, and Thomas B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:40.068720Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:03c3b9c68dcee9eba8d40f64fcd6c070e1f71e3aabce7bc5948cc2fa89313218","observation_id":"085a55b7-2b21-43a7-8a36-80c70466fbb1","resolution":{"observed_at":"2026-08-06T04:49:40.068720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-04T20:32:56.695590Z","title":"Rawat, and Thomas B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-08T09:10:30.973101Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.695590Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:56ba1c4d2223b1fed17a56ec9df1390a421ca33867dbbd96293ff98170dedaf4","observation_id":"0ee60542-d7c1-4097-af91-440d060e6b87","resolution":{"observed_at":"2026-08-04T20:32:56.695590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-04T19:37:41.600749Z","title":"Foundation models for video understanding: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-08T05:57:49.794416Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.600749Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:f1d20e113418196a4c62778dd1b0ae05348fed3efaba76ad61f3b214959bb251","observation_id":"217712fc-9fa7-468a-8a99-833d6bb663f6","resolution":{"observed_at":"2026-08-04T19:37:41.600749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":"2405.03770","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-07-01T00:25:09.414000Z","title":"Foundation models for video understanding: A survey","venue":null,"work_id":"806ec0cf-6d51-4549-9e60-a805a6a8d683","year":2024},"citing_paper":{"arxiv_id":"2512.13511","last_updated":"2026-05-01T11:23:38Z","snapshot_observed_at":"2026-07-06T22:39:04.164003Z","submitted_at":"2025-12-15T16:38:59Z","title":"Adapting MLLMs for Nuanced Video Retrieval","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:09.051957Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2512.13511"},"observation_digest":"sha256:b993ae2cbc2558849f6487f42919484936d5e2d753c7d11f002a52abe8992f39","observation_id":"d40b607d-74ce-4e26-acbf-e826b0c92f83","resolution":{"observed_at":"2026-05-16T22:21:18.854630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":"2405.03770","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-07-01T00:25:09.414000Z","title":"Foundation models for video understanding: A survey","venue":null,"work_id":"806ec0cf-6d51-4549-9e60-a805a6a8d683","year":2024},"citing_paper":{"arxiv_id":"2604.24002","last_updated":"2026-04-27T03:34:33Z","snapshot_observed_at":"2026-08-04T20:04:45.149292Z","submitted_at":"2026-04-27T03:34:33Z","title":"IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T02:32:05.523343Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2604.24002"},"observation_digest":"sha256:5bc288f5de239c3ca3b3966536d6149f388cc094f02131ca4ae9d465bc863640","observation_id":"2f579b52-7fdf-4d0e-a219-75c2105d3562","resolution":{"observed_at":"2026-05-11T22:46:11.501822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":"2405.03770","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-07-01T00:25:09.414000Z","title":"Foundation models for video understanding: A survey","venue":null,"work_id":"806ec0cf-6d51-4549-9e60-a805a6a8d683","year":2024},"citing_paper":{"arxiv_id":"2604.26707","last_updated":"2026-04-29T14:15:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-29T14:15:45Z","title":"CurEvo: Curriculum-Guided Self-Evolution for Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-07T11:52:26.828633Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2604.26707"},"observation_digest":"sha256:9408fa6fb66a8e4fd7c4486f50f0b8413c78c56d9339d0cfb3c38a9d9cdf7d7a","observation_id":"5fff32ad-f7d2-408f-86d0-413567330b0e","resolution":{"observed_at":"2026-05-12T09:11:27.610362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":"2405.03770","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-07-01T00:25:09.414000Z","title":"Foundation models for video understanding: A survey","venue":null,"work_id":"806ec0cf-6d51-4549-9e60-a805a6a8d683","year":2024},"citing_paper":{"arxiv_id":"2605.00826","last_updated":"2026-03-07T12:28:35Z","snapshot_observed_at":"2026-08-08T07:16:50.125784Z","submitted_at":"2026-03-07T12:28:35Z","title":"Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis","version":1},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-15T15:05:37.964883Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2605.00826"},"observation_digest":"sha256:0edca48a603fca58e97e7cae69e36aae9ae943bd0b94035bce7f61bd902bb643","observation_id":"0bcab266-27a7-4fab-8856-88bbeeff037e","resolution":{"observed_at":"2026-05-15T15:06:09.612224Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":"2405.03770","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-07-01T00:25:09.414000Z","title":"Foundation models for video understanding: A survey","venue":null,"work_id":"806ec0cf-6d51-4549-9e60-a805a6a8d683","year":2024},"citing_paper":{"arxiv_id":"2605.01391","last_updated":"2026-06-11T07:06:15Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T11:28:20Z","title":"VISTA: Video Interaction Spatio-Temporal Analysis Benchmark","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-09T15:18:00.436343Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2605.01391"},"observation_digest":"sha256:bd4024a3552641be10bc3ceb5975b06891ea25196642b0cfcf82a3401c0b93cc","observation_id":"af3879f6-b6b7-4e58-a6a4-0367716f0e62","resolution":{"observed_at":"2026-05-11T16:41:23.343071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":"2405.03770","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-07-01T00:25:09.414000Z","title":"Foundation models for video understanding: A survey","venue":null,"work_id":"806ec0cf-6d51-4549-9e60-a805a6a8d683","year":2024},"citing_paper":{"arxiv_id":"2605.01391","last_updated":"2026-06-11T07:06:15Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T11:28:20Z","title":"VISTA: Video Interaction Spatio-Temporal Analysis Benchmark","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-01T00:24:25.203292Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2605.01391"},"observation_digest":"sha256:98a3983674e5d82644e0ec4f543d9675cf429a66993e5264f0bc70f77ba02819","observation_id":"5205c761-7247-497a-a491-565ce0053d5f","resolution":{"observed_at":"2026-07-01T00:25:09.415571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":"2405.03770","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-07-01T00:25:09.414000Z","title":"Foundation models for video understanding: A survey","venue":null,"work_id":"806ec0cf-6d51-4549-9e60-a805a6a8d683","year":2024},"citing_paper":{"arxiv_id":"2605.17095","last_updated":"2026-05-16T17:45:10Z","snapshot_observed_at":"2026-08-03T09:43:37.063787Z","submitted_at":"2026-05-16T17:45:10Z","title":"Visual Timelines of Police Encounters in Body-Worn Camera Footage: Operational Context and Activity Cataloging for Training and Analysis in OpenBWC","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T15:31:45.565641Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2605.17095"},"observation_digest":"sha256:bc211ba41751a42bf356b76b0afd99ce4d7318b32c407f5d1f91f728d81aaed0","observation_id":"cdcf1409-f6e6-4da9-baab-aed54170f6a1","resolution":{"observed_at":"2026-05-20T15:33:25.410861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-07-14T12:48:58.688011Z","title":"arXiv preprint arXiv:2405.03770 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10299","last_updated":"2026-07-11T13:04:24Z","snapshot_observed_at":"2026-08-06T08:13:12.036559Z","submitted_at":"2026-07-11T13:04:24Z","title":"Empowering Long-form Omni-modal Understanding with Robust Audio Perception","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T12:48:58.688011Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2607.10299"},"observation_digest":"sha256:2d0c81905c24eb14196704959759d6a8fb117379e87246f8da55a9dded4d6012","observation_id":"bc24fa89-09ca-4088-b910-5e1e172959bc","resolution":{"observed_at":"2026-07-14T12:48:58.688011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.03770/citation-record","integrity":"/paper/2405.03770/integrity","json":"/paper/2405.03770/citation-record.json","paper":"/paper/2405.03770"},"outbound":[],"paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2405.03770."}