{"as_of":"2026-08-08T01:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ac706cc755b04c20159c6ebc4ae29e841162d341a7191e2337e08b03fe08c55","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:34:43.251039Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:39:37.682244Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T19:55:26.333923Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2406.04264"},"observation_digest":"sha256:090f1bb2a4d1025c28e54177e76aeacaebd1e365722f742f09dbf6ac75f73a1c","observation_id":"60d92558-0dc5-40b6-b968-b9685ac8c8b2","resolution":{"observed_at":"2026-05-14T19:55:26.433404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:266a35197dad455add68ce6cfed4f3338e11f5505e3f4535f60f612dd0987122","observation_id":"1cf91e4a-058b-46e0-825a-d4ae68ca3742","resolution":{"observed_at":"2026-05-23T07:42:42.987016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T04:02:43.261543Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2501.00574"},"observation_digest":"sha256:af41057ca223dc4cd6272a147dabc0aefac3b76ecfd33241d316b3893f8b9d37","observation_id":"731ff6fb-eb7b-48c7-b925-bcf2ff8d0414","resolution":{"observed_at":"2026-05-18T04:02:43.503594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:91dc76369bc4dc67f186ecf6b03bd523f6c735ebe6d3396fb036bf0c52db3cff","observation_id":"8467a30b-0658-47f3-8e17-081184e9bdde","resolution":{"observed_at":"2026-05-17T02:52:20.770114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T15:34:43.251039Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14640","last_updated":"2025-05-20T17:26:32Z","snapshot_observed_at":"2026-08-07T15:28:25.992115Z","submitted_at":"2025-05-20T17:26:32Z","title":"VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:43.251039Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2505.14640"},"observation_digest":"sha256:3de4e5aa223864533b8d68d2649d4f0b85ea58c079c61f6b54a42e06c6d06c26","observation_id":"5523b6de-9a63-4e83-8221-c14dd59cc6bc","resolution":{"observed_at":"2026-08-07T15:34:43.251039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T15:20:58.584507Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-07T15:15:18.405516Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:58.584507Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:bd31dc22658ad2679d56bc3c50f48702459513db26b6f16c75089507ca62c6ed","observation_id":"8d9c289e-2d5a-4082-a8ec-fcc72a4a1192","resolution":{"observed_at":"2026-08-07T15:20:58.584507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T12:37:20.806587Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24158","last_updated":"2025-05-30T03:04:28Z","snapshot_observed_at":"2026-08-07T12:29:44.012678Z","submitted_at":"2025-05-30T03:04:28Z","title":"Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.806587Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2505.24158"},"observation_digest":"sha256:b46eb4ee68d81fff9d7dd7c024b5b2db77cffa952ff4d8cbcb0a015afe6cd23f","observation_id":"f19b5cbc-5429-425a-8010-6d84e9d4ed61","resolution":{"observed_at":"2026-08-07T12:37:20.806587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T11:59:08.637236Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T00:45:30.620269Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:08.637236Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:ad11136053ea0a67becc8b80360a3eab87d1ef3c4ad2e801de0c2897a76ad9f2","observation_id":"358355fd-9998-444c-aae7-b87c1418de3a","resolution":{"observed_at":"2026-08-07T11:59:08.637236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T12:50:04.246155Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03179","last_updated":"2025-05-29T13:17:25Z","snapshot_observed_at":"2026-08-08T00:26:20.360231Z","submitted_at":"2025-05-29T13:17:25Z","title":"Vid-SME: Membership Inference Attacks against Large Video Understanding Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:04.246155Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.03179"},"observation_digest":"sha256:ab3d2148bcb078c6b2b5be02296539b62f71cbb85e48a8c82b3e46177eeefeaf","observation_id":"c8017646-7848-455d-855d-be4096fd1aca","resolution":{"observed_at":"2026-08-07T12:50:04.246155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T05:26:47.226160Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.226160Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:d7d886cae204c72a7dfdbbfee82dfa790537f58fac00a9fb1454942d1872f20f","observation_id":"e951b058-651e-41cb-82f6-f9ca968c09dd","resolution":{"observed_at":"2026-08-07T05:26:47.226160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T22:36:38.507321Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:38.507321Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:501a237f69830202c0ccf4126e24bc4cb2c56f0eb0f218c2a27bc60d109e3a40","observation_id":"b3b21a56-e1ad-4778-a6ce-c322c3a42042","resolution":{"observed_at":"2026-08-06T22:36:38.507321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T22:15:03.755141Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.755141Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:168038c62d30b8936bfd1cf0eacf87d7546cc8d3e649bd795a65cf69591bfb89","observation_id":"51b1b8f9-be18-4d35-bc41-a649916768d0","resolution":{"observed_at":"2026-08-06T22:15:03.755141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T22:00:07.069669Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00068","last_updated":"2025-06-28T12:12:06Z","snapshot_observed_at":"2026-08-07T14:17:56.782121Z","submitted_at":"2025-06-28T12:12:06Z","title":"MANTA: Cross-Modal Semantic Alignment and Information-Theoretic Optimization for Long-form Multimodal Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T22:00:07.069669Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.00068"},"observation_digest":"sha256:ef3b6ab88e570147ae953920d66431db935e969698ddabd6fe4251f39520f684","observation_id":"bee69751-5848-4f41-9434-e3ee6d7c25b8","resolution":{"observed_at":"2026-08-06T22:00:07.069669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T20:44:02.472353Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.472353Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:45f3c304937b7338bb65aad5971c54e75fc1269f09b5e02dee2a1aeee7c21e35","observation_id":"402060c6-11ee-452e-afb6-8d77ad4cb01e","resolution":{"observed_at":"2026-08-06T20:44:02.472353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T20:29:54.223612Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-07T06:17:01.457380Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:54.223612Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:1f8fb9150cbbf62e81b2214168f47e19de4a2eea4441e4ee9463f30733028a73","observation_id":"11789708-fe6c-41c0-b5a3-1c112e649775","resolution":{"observed_at":"2026-08-06T20:29:54.223612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T21:59:16.899236Z","title":"arXiv preprint arXiv:2409.14485","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-08T00:43:49.554763Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.899236Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:b9f0b3fcffb8146fc2ad3211a6f495d3d366c015b8b8a03262ecea51a4438f1b","observation_id":"a03ecc67-4006-4690-9bf6-bdae02f2ad6f","resolution":{"observed_at":"2026-08-06T21:59:16.899236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T18:10:13.296306Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.296306Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:3bf44d118a916e86401405413b380bed12d382ba31993d6b0eee8b2a6f63fff6","observation_id":"c2df738d-2eb6-4bef-b7fd-a788422984d2","resolution":{"observed_at":"2026-08-06T18:10:13.296306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T17:55:45.402521Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09693","last_updated":"2025-07-13T16:09:58Z","snapshot_observed_at":"2026-08-06T19:46:33.050466Z","submitted_at":"2025-07-13T16:09:58Z","title":"ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:55:45.402521Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.09693"},"observation_digest":"sha256:1278b398de1a5e07b49663a40abe4bb9c7c506634851cfadc21bdc2ee9848fc1","observation_id":"e6347225-408e-4c8d-a637-f6576a7f0245","resolution":{"observed_at":"2026-08-06T17:55:45.402521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T17:52:02.738153Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09815","last_updated":"2025-07-22T17:15:14Z","snapshot_observed_at":"2026-08-06T17:44:26.270886Z","submitted_at":"2025-07-13T22:14:35Z","title":"VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:02.738153Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.09815"},"observation_digest":"sha256:92bbfd4d470130036b4b07456be56554dd21ca219fdb4065e919ded7d826ce47","observation_id":"dab9472d-2449-4130-acf1-d9b6d776d216","resolution":{"observed_at":"2026-08-06T17:52:02.738153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T12:46:19.505318Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21507","last_updated":"2025-07-29T05:17:48Z","snapshot_observed_at":"2026-08-06T12:46:18.741677Z","submitted_at":"2025-07-29T05:17:48Z","title":"VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:46:19.505318Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.21507"},"observation_digest":"sha256:6cb2f430168fd56353a06cdb0da5006ad6c95bb7e1de42ccd2b510b0aac8fba6","observation_id":"e27b375b-5317-4540-b42d-d6fe98846f67","resolution":{"observed_at":"2026-08-06T12:46:19.505318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-04T20:32:56.818052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.818052Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:a98593f5ec7269f0f55f8fa46e1852ecf7ed4ca14985d7dd303ff18e8095c665","observation_id":"b7efc35b-e33d-4610-9fea-8e2297ab618c","resolution":{"observed_at":"2026-08-04T20:32:56.818052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-03T18:22:29.150095Z","title":"Video- xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:29.150095Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:e2c1550fdf4d10ee51c888eba4b1e39fcdcdce4e775a03ec1f24643aa08ab219","observation_id":"b0b2081b-5f53-4d21-8b42-08d2cc83303b","resolution":{"observed_at":"2026-08-03T18:22:29.150095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:bf81882fb848c5bd78554ae15b8dad0fadd3459eb4217e85f1e26f9ee825aa00","observation_id":"be7f6567-0ae3-4f92-81cc-1cc6f5346e46","resolution":{"observed_at":"2026-05-14T22:08:04.322261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:bd79fa320fcf9eed3aeb68c72d84f71c7c0af8692bdfc60aa814762e26523644","observation_id":"32f16455-d6c1-4bea-9e65-a38aff7fcc5c","resolution":{"observed_at":"2026-05-11T10:41:04.170343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2604.14149","last_updated":"2026-04-16T15:48:38Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:52Z","title":"One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T13:28:58.920442Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2604.14149"},"observation_digest":"sha256:c4fa8844d8171acab45fbcf329ef1a5ab350b3f52dc5fadc3633b6a334c01ec3","observation_id":"eb07d3ab-fd95-49e8-babd-079361566bca","resolution":{"observed_at":"2026-05-10T13:30:26.608836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2606.06532","last_updated":"2026-06-03T17:47:49Z","snapshot_observed_at":"2026-08-07T12:55:44.925060Z","submitted_at":"2026-06-03T17:47:49Z","title":"GOPAgen: Motion-Aware and Efficient Agentic Long-Video Understanding with Structural Memory and Hierarchical Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T06:33:32.090913Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2606.06532"},"observation_digest":"sha256:c6cb151ebcb9d0e442b9572e19b793343fa55a677d06d764580e9e257bb3c9a8","observation_id":"396f883b-4be0-4ea3-8768-009ca23e2b43","resolution":{"observed_at":"2026-07-02T07:56:47.379342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2606.11740","last_updated":"2026-06-10T07:16:27Z","snapshot_observed_at":"2026-08-02T02:17:16.809620Z","submitted_at":"2026-06-10T07:16:27Z","title":"UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-06-27T10:21:12.782864Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2606.11740"},"observation_digest":"sha256:f9b3812559995aefe1837634bac805f1caaedcd120f0dd51cf3752e426e80e4a","observation_id":"6dc7a3a2-5fda-4960-a6a6-90e408212562","resolution":{"observed_at":"2026-07-03T09:47:59.401036Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":253,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:ea8275ee57b42a7481da0a588edefcbdb7ad2e2e98122d2cd0f9c55dc6682009","observation_id":"a4d5c3f9-8265-4d0c-8731-2cf740e7b81c","resolution":{"observed_at":"2026-07-03T10:48:02.928923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":"2409.14485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-07-04T06:39:37.682244Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","venue":null,"work_id":"1974d26a-10e2-4170-b1ee-626217ce7f74","year":2024},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:f01e0e6bfd25ac7168da28f682e1e303c0e4aeba2aef5b4711fce92582e07a5b","observation_id":"73de4bda-be24-4798-8bc7-9b58a48d0114","resolution":{"observed_at":"2026-07-04T06:39:37.683787Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-04T23:46:51.608318Z","title":"IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-06T23:32:52.420159Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.608318Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:7c8adbc87b6a43b2a32f5170bebd9962414c2b3d5084423d239f58840fe3a62f","observation_id":"7dc63e75-60e7-488f-827d-82080ef78b28","resolution":{"observed_at":"2026-08-04T23:46:51.608318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.14485/citation-record","integrity":"/paper/2409.14485/integrity","json":"/paper/2409.14485/citation-record.json","paper":"/paper/2409.14485"},"outbound":[],"paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:2409.14485."}