{"as_of":"2026-08-07T05:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:493cd1a36fad73974a0c5bb2379db56611212fb35b0581773e23f3db867f8362","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:10:14.919272Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09068/citation-record","integrity":"/paper/2507.09068/integrity","json":"/paper/2507.09068/citation-record.json","paper":"/paper/2507.09068"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07811","last_updated":"2025-02-08T06:15:39Z","snapshot_observed_at":"2026-08-07T05:26:44.930886Z","submitted_at":"2025-02-08T06:15:39Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","version":1},"cited_work":{"arxiv_id":"2502.07811","doi":"10.48550/arxiv.2502.07811","metadata_source":"pith","pith_arxiv_id":"2502.07811","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"CrossVideoMAE: Self-Supervised Image-Video Representation Learning with Masked Autoencoders","venue":"cs.CV","work_id":"86a6a47a-f7f0-4fda-9117-95bc376dc0bd","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.061419Z"},"links":{"cited_paper":"/paper/2502.07811","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:574c7bfd3fd36461beded15e57d6a3e9efc3792d4900bba972ee50ca66e1cacb","observation_id":"ff0a1ede-3856-4a74-ad1e-e3544cd0a8b4","resolution":{"observed_at":"2026-08-06T18:10:16.731929Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:18.233500Z","title":null,"venue":null,"work_id":"e19ff185-08e7-4d75-b66b-29ecd8f1f848","year":2011},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.114356Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:96d9cdb52eaff9aa6511a972eaed34083754cbdd35b576d53abb6b237f383e1f","observation_id":"c25e915d-4ba9-493f-847b-51365e8f7fda","resolution":{"observed_at":"2026-08-06T18:10:18.299149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04998","last_updated":"2024-11-07T18:59:16Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:59:16Z","title":"HourVideo: 1-Hour Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04998","snapshot_observed_at":"2026-08-06T18:09:18.211447Z","title":"Hadzic, Taran Kota, Jimming He, Cristóbal Eyzaguirre, Zane Durante, Manling Li, Jiajun Wu, and Li Fei-Fei","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.211447Z"},"links":{"cited_paper":"/paper/2411.04998","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:8a8f5fb80c10423b57ec8cea84153e16e6fb2edc084df5861b59c9705a2b4551","observation_id":"01bcc5ab-e0c7-4408-a60e-48774759a8fe","resolution":{"observed_at":"2026-08-06T18:09:18.211447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-06T18:09:18.313230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.313230Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:f119e54f21f87277f448ac64cb373764621a4a5a0ffb36e85a7042ed4ee63b16","observation_id":"339e7bb3-dc67-4a6f-8af4-aff75a9dfa3c","resolution":{"observed_at":"2026-08-06T18:09:18.313230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-07-06T21:03:35.698923Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-06T18:09:18.568750Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.568750Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:32aa4880a4321978e793e16f3efa719d513345f4bf4d413ad0a9e39ec9d72bed","observation_id":"809b2dcf-8bb2-479b-964a-3488ccdb6144","resolution":{"observed_at":"2026-08-06T18:09:18.568750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-06T04:32:21.352745Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21374","snapshot_observed_at":"2026-08-06T18:09:18.954541Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.954541Z"},"links":{"cited_paper":"/paper/2505.21374","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:ba7eea2e797fdfd07b9e442e80b39d65b45f0bdb3feff021a21b2118c6c54165","observation_id":"8d053b18-1eb2-430a-9e88-2a6c782636e8","resolution":{"observed_at":"2026-08-06T18:09:18.954541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00937","last_updated":"2023-12-01T21:34:10Z","snapshot_observed_at":"2026-08-02T08:12:01.084894Z","submitted_at":"2023-12-01T21:34:10Z","title":"Zero-Shot Video Question Answering with Procedural Programs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00937","snapshot_observed_at":"2026-08-06T18:09:19.409539Z","title":"Kitani, and László A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:19.409539Z"},"links":{"cited_paper":"/paper/2312.00937","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:690631fc3779d1b48211957782838b8e06a36addfa596d86cc136f57d656a188","observation_id":"dbef02ca-88ff-488e-a914-02db772cb241","resolution":{"observed_at":"2026-08-06T18:09:19.409539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-06T18:10:11.725676Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:11.725676Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:8b52db6830c8daa880b38335b6a5658ef9ac91e77d0889eab1363b9034652acc","observation_id":"68494767-b952-4b9b-bba1-bbddf06ed232","resolution":{"observed_at":"2026-08-06T18:10:11.725676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17823","last_updated":"2024-07-18T08:56:11Z","snapshot_observed_at":"2026-07-06T17:51:24.261505Z","submitted_at":"2024-03-26T16:04:19Z","title":"Efficient Image Pre-Training with Siamese Cropped Masked Autoencoders","version":2},"cited_work":{"arxiv_id":"2403.17823","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.17823","snapshot_observed_at":"2026-08-06T18:10:17.107296Z","title":"Efficient Image Pre-Training with Siamese Cropped Masked Autoencoders","venue":"cs.CV","work_id":"1e1134ce-965f-497a-90e4-7b5e02f2c250","year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:11.854309Z"},"links":{"cited_paper":"/paper/2403.17823","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:b286cca0a0c8b8b7111d112e2e299e5b56ff11ae0d87fe6628739e6146922100","observation_id":"545305b2-f2bb-4383-9be8-639125a12ebf","resolution":{"observed_at":"2026-08-06T18:10:17.212457Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:18.071567Z","title":null,"venue":null,"work_id":"272bf45e-ebb2-436b-a73c-48daf99c3989","year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:11.899351Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:cfa8f8301b682a4ea02b7fdd087431abdc3174c8bcfa621d645d87ee8b0920b7","observation_id":"316ad4f0-026d-4451-84aa-0b1e8874df9e","resolution":{"observed_at":"2026-08-06T18:10:18.130805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T18:10:12.056934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.056934Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:b695fa5970901c184d128bd47e45ebae98219a907395d98ec7638103179d0f5e","observation_id":"276abd28-1608-4fa1-8d37-0830654d553a","resolution":{"observed_at":"2026-08-06T18:10:12.056934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16244","last_updated":"2024-04-28T18:28:33Z","snapshot_observed_at":"2026-08-06T06:48:41.511859Z","submitted_at":"2024-04-24T23:18:46Z","title":"The Ethics of Advanced AI Assistants","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16244","snapshot_observed_at":"2026-08-06T18:10:12.125589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.125589Z"},"links":{"cited_paper":"/paper/2404.16244","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:b611bbdc2e9d2577c019dcd415fc8e6b26d707d41f43959c10a118ff350039a6","observation_id":"4cbccd92-ffbe-4212-98e0-67fa7f83e1a5","resolution":{"observed_at":"2026-08-06T18:10:12.125589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14344","last_updated":"2023-05-23T17:59:46Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:46Z","title":"Siamese Masked Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14344","snapshot_observed_at":"2026-08-06T18:10:12.195376Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.195376Z"},"links":{"cited_paper":"/paper/2305.14344","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:e855101ce39dcb4d1236d9be83537490dc3d16f2651d709fb89e2147ee6a6a58","observation_id":"963c17ec-82c8-4343-91e9-d85d06aa17ca","resolution":{"observed_at":"2026-08-06T18:10:12.195376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-06T18:10:12.307299Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.307299Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:ffa775454cbdaa647282fa29e4e0f13aa150d1c58b5701d314b180daa5db39fb","observation_id":"12718065-f4c4-4ac8-9980-1d22368d0953","resolution":{"observed_at":"2026-08-06T18:10:12.307299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07398","last_updated":"2024-08-08T19:48:10Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:05:15Z","title":"Visual Representation Learning with Stochastic Frame Prediction","version":2},"cited_work":{"arxiv_id":"2406.07398","doi":"10.48550/arxiv.2406.07398","metadata_source":"pith","pith_arxiv_id":"2406.07398","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"Visual Representation Learning with Stochastic Frame Prediction","venue":"cs.CV","work_id":"6087f764-06d6-4a4f-a446-8b01ff444dbd","year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.401921Z"},"links":{"cited_paper":"/paper/2406.07398","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:2d22aa63d9d973f02956aacf6fa23de7693a9b7e0b5f3a0d2c254fa23bbdb617","observation_id":"9110064f-0fc6-4002-a20d-c5fe49e3a397","resolution":{"observed_at":"2026-08-06T18:10:16.421305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-06T18:10:12.472087Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.472087Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:a97fb0f2e8c2f59943f1c64473d27c8b423ea0406832d444b8c18cc14c0952a4","observation_id":"2b5d77ea-50d5-4d97-8f44-c7bd15d9693d","resolution":{"observed_at":"2026-08-06T18:10:12.472087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01681","last_updated":"2025-01-03T07:57:38Z","snapshot_observed_at":"2026-07-06T20:16:03.707754Z","submitted_at":"2025-01-03T07:57:38Z","title":"SNeRV: Spectra-preserving Neural Representation for Video","version":1},"cited_work":{"arxiv_id":"2501.01681","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01681","snapshot_observed_at":"2026-08-06T18:10:16.885731Z","title":"SNeRV: Spectra-preserving Neural Representation for Video","venue":"eess.IV","work_id":"cbaafd65-e1ca-489c-813c-db992faeede7","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.519667Z"},"links":{"cited_paper":"/paper/2501.01681","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:283bbf139e41ec93a3da5107afceb8fd9ce9e0a2e7b46ef826f7bfcaef1e5315","observation_id":"0b728617-5100-420c-887d-8c52582f04f6","resolution":{"observed_at":"2026-08-06T18:10:16.964469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:17.936816Z","title":null,"venue":null,"work_id":"483d3cef-fb68-4c79-a0a0-94b22e429917","year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.559183Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:a03565b5a755190970a4b08ff571b88de6d351a94791a80a23b7091b16f31f57","observation_id":"fb2b3eb7-0cd3-4be0-bd16-9ca2d015fd81","resolution":{"observed_at":"2026-08-06T18:10:17.987768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.20444","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:16.184752Z","title":null,"venue":null,"work_id":"5696f847-3d90-481a-9434-01ddb548f82d","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.643858Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:b2776dd8c8fab05cb1275a53b9b5f3ef832750472b29b511f75938426e5a6209","observation_id":"7b403170-dbfe-452a-bdbd-19522ed26d68","resolution":{"observed_at":"2026-08-06T18:10:16.232019Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04625","last_updated":"2025-03-07T18:13:22Z","snapshot_observed_at":"2026-08-03T18:50:20.640936Z","submitted_at":"2025-03-06T17:11:51Z","title":"START: Self-taught Reasoner with Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04625","snapshot_observed_at":"2026-08-06T18:10:12.598324Z","title":"doi:10.48550/arXiv.2503.04625 arXiv:2503.04625 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.598324Z"},"links":{"cited_paper":"/paper/2503.04625","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:0c567903d5d2a5da741aae1f7511ffe8efcd3de4fcab14d6c309c417c3a76e00","observation_id":"43e3fa0f-361d-4cba-9e31-bc1fd9e80412","resolution":{"observed_at":"2026-08-06T18:10:12.598324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-06T18:10:12.714751Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.714751Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:b0aa9fd9525521d5c188cb3a255d4b8ed97fc219dd218f188b90aad2dd1a1143","observation_id":"97ac225c-a44b-48e7-b367-d1e266ecfdf5","resolution":{"observed_at":"2026-08-06T18:10:12.714751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-06T18:10:12.662954Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.662954Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:cdad7215b80e77af7c29e11e662d6f4d8225b1ee6f4abeb5e2eda88abe2ddde1","observation_id":"cc6d9d5e-c795-46dd-b38d-5aa40d4a9983","resolution":{"observed_at":"2026-08-06T18:10:12.662954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18478","last_updated":"2025-04-27T10:39:51Z","snapshot_observed_at":"2026-07-06T20:57:39.173371Z","submitted_at":"2025-03-24T09:21:48Z","title":"Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18478","snapshot_observed_at":"2026-08-06T18:10:12.773039Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.773039Z"},"links":{"cited_paper":"/paper/2503.18478","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:45597df008272bff69f30c2ee1020cf856542d92cb319ff16d73447aa3c02ad8","observation_id":"3633c010-534b-47ba-b99c-22c9cd1f6f03","resolution":{"observed_at":"2026-08-06T18:10:12.773039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-06T18:10:12.748486Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.748486Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:c268cdde58e5433a0a0d243072a078bb79b775c7d185dceef372db75bd1aa6d3","observation_id":"448a4907-dd0e-4419-9ed5-fba4759143ce","resolution":{"observed_at":"2026-08-06T18:10:12.748486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-07-06T16:07:21.951225Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-06T18:10:12.839920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.839920Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:bb56fa58581712d9f906736f74527dc511e28c6027f6b5ff0e7fbfddf6e8df83","observation_id":"e0001093-1c8d-428c-8368-db9820138888","resolution":{"observed_at":"2026-08-06T18:10:12.839920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:12.786822Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.786822Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:8e000a89f8db19e1c558a27b7e019097a47c934cb64bd4e0ade664357104eaef","observation_id":"6dcac48e-b7e6-4df2-9834-febd2b9658ff","resolution":{"observed_at":"2026-08-06T18:10:12.786822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-06T18:10:12.942821Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.942821Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:3baa04cf61c97413bd60c9a4ee8a2281829a38295ecb6ab43a6f93141295c9b3","observation_id":"01d0693d-1a66-4237-85d4-664f63fa52b0","resolution":{"observed_at":"2026-08-06T18:10:12.942821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:17.762167Z","title":null,"venue":null,"work_id":"5a92e728-566a-4aa3-be11-f19e63316929","year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:12.877764Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:ae3727c1846fa6bcd063f6672973ede2f786ef58697f2a94446aedbe004bb3df","observation_id":"20a4e7fb-271f-4a54-b77d-5c48378e0b2e","resolution":{"observed_at":"2026-08-06T18:10:17.807895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-06T23:04:53.910156Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-06T18:10:13.072860Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.072860Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:f04ac4a4a4c74773c95a48c4490ed9d8d7d72cce3c163f3e45725e3228e1b7fa","observation_id":"af469056-2597-4916-802c-3e9a4e6eb44a","resolution":{"observed_at":"2026-08-06T18:10:13.072860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16009","last_updated":"2024-05-25T02:22:09Z","snapshot_observed_at":"2026-07-06T18:19:42.946629Z","submitted_at":"2024-05-25T02:22:09Z","title":"Streaming Long Video Understanding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16009","snapshot_observed_at":"2026-08-06T18:10:13.022336Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.022336Z"},"links":{"cited_paper":"/paper/2405.16009","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:e8dee5bf9b5f2838de4f5fbfb6298fe7f0c20a88078381cf2a4dedaabd22d0c5","observation_id":"e76d6843-4626-47ad-ba97-c6f7c48102fe","resolution":{"observed_at":"2026-08-06T18:10:13.022336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T18:10:13.140709Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.140709Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:5106f976cc4f69cd9cc8423fe813f5c7e326d89d8626414b148d3214631e90eb","observation_id":"e32d3cd9-dbef-4bfe-8da5-bd1a7f618ab4","resolution":{"observed_at":"2026-08-06T18:10:13.140709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11369","last_updated":"2024-07-18T08:27:05Z","snapshot_observed_at":"2026-07-06T11:50:40.639504Z","submitted_at":"2021-09-23T13:30:18Z","title":"Recent Advances of Continual Learning in Computer Vision: An Overview","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11369","snapshot_observed_at":"2026-08-06T18:10:13.104601Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.104601Z"},"links":{"cited_paper":"/paper/2109.11369","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:52ae2d6213e53b151549bb4225a8790775fe31065b8482f00acdcc1ab969096e","observation_id":"2aaa3216-7106-47ce-b2e1-40f190617bbc","resolution":{"observed_at":"2026-08-06T18:10:13.104601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-06T18:10:13.260398Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoorthi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.260398Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:dd10d7d63245b7f6173c2845b42616356c3ef756cfe54014c4c1d698a35ca135","observation_id":"ea010615-2ce1-47d8-9be6-4ea8823abe73","resolution":{"observed_at":"2026-08-06T18:10:13.260398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19098","last_updated":"2025-05-19T10:18:07Z","snapshot_observed_at":"2026-07-06T20:28:57.453439Z","submitted_at":"2025-01-31T12:45:46Z","title":"$\\infty$-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation","version":2},"cited_work":{"arxiv_id":"2501.19098","doi":"10.48550/arxiv.2501.19098","metadata_source":"pith","pith_arxiv_id":"2501.19098","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"$\\infty$-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation","venue":"cs.CV","work_id":"35d85e1a-9287-48e0-9d2a-63663a8f6f28","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.200174Z"},"links":{"cited_paper":"/paper/2501.19098","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:b7eb759fcef63b8d66c0fb40216d88efb95b650895057332974df45335064947","observation_id":"edc308c6-cf1f-431d-b0d1-b121878aafd8","resolution":{"observed_at":"2026-08-06T18:10:15.807015Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:17.630980Z","title":null,"venue":null,"work_id":"80ad576e-9ec6-4da5-9173-cba0a6ac27c8","year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.328713Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:0db0118da515eb1f96b2545b38646d79c9aeb7119c8a7ac4f0fdf6ee9a40a16d","observation_id":"e76d195d-b50d-4df2-969f-288c3370d330","resolution":{"observed_at":"2026-08-06T18:10:17.698230Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T18:10:13.296306Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.296306Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:3bf44d118a916e86401405413b380bed12d382ba31993d6b0eee8b2a6f63fff6","observation_id":"c2df738d-2eb6-4bef-b7fd-a788422984d2","resolution":{"observed_at":"2026-08-06T18:10:13.296306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T18:10:13.446720Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.446720Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:b2440b0e9e74971d7e7156ee8f17e678d5510d111b96328e25b6e8a95cea4b35","observation_id":"6daaacba-cd5e-4c86-b121-09b740e1fcb6","resolution":{"observed_at":"2026-08-06T18:10:13.446720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-05T04:26:02.499259Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-06T18:10:13.357356Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.357356Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:674a6e20d21cdee7dc2068d25cd638c7107c6bb83c576a6ce76cea31142c3c1c","observation_id":"102ccd94-8ead-4ada-9021-3f44632e9396","resolution":{"observed_at":"2026-08-06T18:10:13.357356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T18:10:13.651494Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.651494Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:341871916ca4930151469218b156cee0a8dbc52daccd0eacd2a08b81ca6eac97","observation_id":"1d59b233-d2bb-4843-81a8-9b4565f0816f","resolution":{"observed_at":"2026-08-06T18:10:13.651494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-05T00:36:47.095250Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-06T18:10:13.574181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.574181Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:a5c7ea3ab6d004ee82c33d775dea402e57035a20747042da53ef1cb9b2b72b4c","observation_id":"8627080a-8146-4fd5-893f-d0b40c9a5e1c","resolution":{"observed_at":"2026-08-06T18:10:13.574181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00487","last_updated":"2024-02-06T09:12:09Z","snapshot_observed_at":"2026-08-04T15:12:27.741364Z","submitted_at":"2023-01-31T11:34:56Z","title":"A Comprehensive Survey of Continual Learning: Theory, Method and Application","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00487","snapshot_observed_at":"2026-08-06T18:10:13.775787Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.775787Z"},"links":{"cited_paper":"/paper/2302.00487","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:4d947d47e4bdc265ebbd98659fbf35fe92af187a38843c30bcacbb22720bacaf","observation_id":"5c8a1017-73f4-4f2c-9e4d-a780ab36782d","resolution":{"observed_at":"2026-08-06T18:10:13.775787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16727","last_updated":"2023-04-18T11:46:41Z","snapshot_observed_at":"2026-07-06T15:09:32.824067Z","submitted_at":"2023-03-29T14:28:41Z","title":"VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16727","snapshot_observed_at":"2026-08-06T18:10:13.711528Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.711528Z"},"links":{"cited_paper":"/paper/2303.16727","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:e3f9355b8058fe54ae4975aa2554c1409ea1433d5b0dd023e421c888e32d4e84","observation_id":"06bfa572-b497-4805-9795-6453d48c3512","resolution":{"observed_at":"2026-08-06T18:10:13.711528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17726","last_updated":"2025-03-28T17:32:31Z","snapshot_observed_at":"2026-08-02T04:32:31.860204Z","submitted_at":"2024-12-23T17:16:58Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","version":2},"cited_work":{"arxiv_id":"2412.17726","doi":"10.48550/arxiv.2412.17726","metadata_source":"pith","pith_arxiv_id":"2412.17726","snapshot_observed_at":"2026-08-06T18:16:30.548575Z","title":"VidTwin: Video VAE with Decoupled Structure and Dynamics","venue":"cs.CV","work_id":"b2d90e1c-0508-4014-b22e-dff5270cd25d","year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.101777Z"},"links":{"cited_paper":"/paper/2412.17726","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:719adca7bb5eee37f4a2a09c2911e8a57e3e3917fbfc3ebf14c6def72cd8ee12","observation_id":"ef828168-849f-4259-8d45-f7f2490571e5","resolution":{"observed_at":"2026-08-06T18:10:15.572551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:17.449839Z","title":null,"venue":null,"work_id":"d5150357-f373-4ed8-bdaf-94f0d3b81539","year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.937532Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:a84350908f82590d945c3bd5f512534b85ab21d50357285a82eb448c47c1dca3","observation_id":"a69f610b-c659-49d6-9892-4f1bf7f702e1","resolution":{"observed_at":"2026-08-06T18:10:17.529367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05173","snapshot_observed_at":"2026-08-06T18:10:14.257348Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.257348Z"},"links":{"cited_paper":"/paper/2502.05173","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:03cdbac653d4efeecb475e8ab066563daab05d65178f56e955e42db9a5c0a344","observation_id":"f519b7f8-72c3-4347-acda-48ca2a008599","resolution":{"observed_at":"2026-08-06T18:10:14.257348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03384","last_updated":"2024-07-20T07:17:00Z","snapshot_observed_at":"2026-07-06T17:55:36.748672Z","submitted_at":"2024-04-04T11:33:29Z","title":"LongVLM: Efficient Long Video Understanding via Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03384","snapshot_observed_at":"2026-08-06T18:10:14.298291Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.298291Z"},"links":{"cited_paper":"/paper/2404.03384","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:e0a611ebc50a35611633d9b9f57587dee8510c5b84075957e7bfde1dd976eb33","observation_id":"a30160aa-9053-40af-9c42-bef00968d3a7","resolution":{"observed_at":"2026-08-06T18:10:14.298291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-05T17:33:53.862042Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-06T18:10:14.223529Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.223529Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:f6313190c7e67be09364397b8a5b56dd557afbac39b9e9c888a177b8aee2584a","observation_id":"5d65b882-b812-4eb2-9817-d7922d9a8c0b","resolution":{"observed_at":"2026-08-06T18:10:14.223529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04644","last_updated":"2025-07-14T20:06:23Z","snapshot_observed_at":"2026-07-06T20:32:39.321377Z","submitted_at":"2025-02-07T04:08:46Z","title":"Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04644","snapshot_observed_at":"2026-08-06T18:10:14.365798Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.365798Z"},"links":{"cited_paper":"/paper/2502.04644","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:615302c5f5c0cc71dd667370d6237b95de7b3bc22f7c33c086f8a5128e97f8f0","observation_id":"88a9e838-e338-44d7-b0b5-2cabd1433fbc","resolution":{"observed_at":"2026-08-06T18:10:14.365798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05037","last_updated":"2025-03-27T09:39:11Z","snapshot_observed_at":"2026-07-06T20:18:35.429115Z","submitted_at":"2025-01-09T07:51:14Z","title":"LongViTU: Instruction Tuning for Long-Form Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05037","snapshot_observed_at":"2026-08-06T18:10:14.416661Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.416661Z"},"links":{"cited_paper":"/paper/2501.05037","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:cad9538f3809abb717b76e96c99a9870375803706f6aa9eeb3d64763ca9b97ca","observation_id":"aea3764e-83dd-40b8-9999-1eb2fca7070d","resolution":{"observed_at":"2026-08-06T18:10:14.416661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-06T18:10:14.340618Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.340618Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:51ea3c187e5af9bae95d3055f41bb74df75e1a0b93301e75250320de9047b626","observation_id":"b6143b35-bfaa-484d-9084-4430ec886d4b","resolution":{"observed_at":"2026-08-06T18:10:14.340618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05199","last_updated":"2023-04-05T02:32:59Z","snapshot_observed_at":"2026-07-06T14:28:56.301970Z","submitted_at":"2022-12-10T04:26:32Z","title":"MAGVIT: Masked Generative Video Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05199","snapshot_observed_at":"2026-08-06T18:10:14.507734Z","title":"Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.507734Z"},"links":{"cited_paper":"/paper/2212.05199","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:74fd391c9cd659031b669f83bac439d80b9c51a08822bb2fefcf8c51e53cb42c","observation_id":"9dda5626-d89f-474a-92d8-7620a5c62f59","resolution":{"observed_at":"2026-08-06T18:10:14.507734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T18:10:14.568887Z","title":"Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Vighnesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.568887Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:91d102493132e7889562566186a7b345283a243a1be48dbbf7daa44c23dc430f","observation_id":"a4883221-886c-418b-9b68-445e2b4784e5","resolution":{"observed_at":"2026-08-06T18:10:14.568887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2503.03803","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:15.349568Z","title":null,"venue":null,"work_id":"93a8c559-d8d9-4661-82f0-90b79e33046d","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.459822Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:b3cf06c444c5eb913346357424f9ecfad8c953811864a6f9fd29b1b0b13bdf15","observation_id":"5ab42a16-8fdb-4d71-84eb-02b6ab549f18","resolution":{"observed_at":"2026-08-06T18:10:15.381307Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.18079","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:15.174207Z","title":null,"venue":null,"work_id":"26456078-907a-40f9-8dde-faf4ae630fa7","year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.678140Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:4f0f23acc73003ae28fcd301fc66623db3130dccbaafb9e557eb60ec08a06b2e","observation_id":"ef731b3e-8c43-42d9-aa5e-109c6274611b","resolution":{"observed_at":"2026-08-06T18:10:15.203453Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:17.303747Z","title":"Gundavarapu, Liangzhe Yuan, Hao Zhou, Shen Yan, Jennifer J","venue":null,"work_id":"4437474d-322e-432b-8e46-d7a9aeead42e","year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.711077Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:6b75fe07d4f3e87283c8c0535bd308b3b9dff60274a0e02b581f009b04f84aca","observation_id":"0c444863-559e-43e1-8eb9-3f9de9561d65","resolution":{"observed_at":"2026-08-06T18:10:17.373787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-06T18:10:14.635404Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.635404Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:70749e3136eb74c90fa005ea0a36366bd4d40fd8a3b575a6b11270413778a7eb","observation_id":"631dce2d-c1ed-46e3-a663-7fb3e379b154","resolution":{"observed_at":"2026-08-06T18:10:14.635404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06391","last_updated":"2024-06-10T15:46:25Z","snapshot_observed_at":"2026-07-06T18:28:12.010251Z","submitted_at":"2024-06-10T15:46:25Z","title":"Towards Lifelong Learning of Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06391","snapshot_observed_at":"2026-08-06T18:10:14.841489Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.841489Z"},"links":{"cited_paper":"/paper/2406.06391","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:e2077446b68ac0ca49ce45694ef6acb8aa748815f9235533b37c0982be3ffeaa","observation_id":"bc707462-8bba-42d4-b63e-912ab0c3dfc9","resolution":{"observed_at":"2026-08-06T18:10:14.841489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-06T18:10:14.864857Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.864857Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:5c1f5623d384cb15203a0c744bb698e9f4b571d7d46ff458ffb9cd5d20a801b9","observation_id":"12c78463-a446-463e-8f21-9ae51e99a337","resolution":{"observed_at":"2026-08-06T18:10:14.864857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13217","last_updated":"2025-06-07T01:16:44Z","snapshot_observed_at":"2026-07-06T17:33:00.716054Z","submitted_at":"2024-02-20T18:29:49Z","title":"VideoPrism: A Foundational Visual Encoder for Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13217","snapshot_observed_at":"2026-08-06T18:10:14.749813Z","title":"doi:10.48550/arXiv.2402.13217 arXiv:2402.13217 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.749813Z"},"links":{"cited_paper":"/paper/2402.13217","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:4794b8fa152cfddc715e4f3081d849e135726a21ad5c69873972476ccb9cfc7f","observation_id":"398801a5-873c-4169-abf0-73e544e5bb62","resolution":{"observed_at":"2026-08-06T18:10:14.749813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09367","last_updated":"2025-03-07T09:40:34Z","snapshot_observed_at":"2026-08-03T15:46:09.775614Z","submitted_at":"2024-06-13T17:50:05Z","title":"Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09367","snapshot_observed_at":"2026-08-06T18:10:14.777464Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.777464Z"},"links":{"cited_paper":"/paper/2406.09367","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:9bc423b59c70b4a53e669ff5823f02f7a164e55a6e8fcd8414e83bd8a68a39eb","observation_id":"5da26043-a850-4fdd-8944-8fc06fdf7b6a","resolution":{"observed_at":"2026-08-06T18:10:14.777464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:10:14.887539Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.887539Z"},"links":{"citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:a35a8a73ea7cf08680c2bb4b04b62d1bb23c0a045cce9f9a31861ec1fa668119","observation_id":"168f0a8e-2993-48df-b4f0-266fb42fca75","resolution":{"observed_at":"2026-08-06T18:10:14.887539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18938","last_updated":"2024-12-03T03:56:52Z","snapshot_observed_at":"2026-07-06T19:23:33.343982Z","submitted_at":"2024-09-27T17:38:36Z","title":"From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18938","snapshot_observed_at":"2026-08-06T18:10:14.919272Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:14.919272Z"},"links":{"cited_paper":"/paper/2409.18938","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:e6d08d90be5c5970059d10c447281edeb1dbe2d305e8a70870892bb8f564ff52","observation_id":"ff6bf875-6dfb-403e-aa65-9bd3504869d2","resolution":{"observed_at":"2026-08-06T18:10:14.919272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-06T18:10:13.986726Z","title":"doi:10.48550/arXiv.2406.08035 arXiv:2406.08035 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:13.986726Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:0ba0e42c091cb3ea3e9836fbc0ef3c009db27af11f5a6b4086150fb29f032d27","observation_id":"004a05d9-6451-40e2-afb9-1e60ec5aa9fb","resolution":{"observed_at":"2026-08-06T18:10:13.986726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T18:10:11.970598Z","title":"doi:10.48550/arXiv.2503.21776 arXiv:2503.21776 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:11.970598Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:152b03e71bd267b814f31e22b95d28254452980d95534a846767ba8bd7dede57","observation_id":"5dfc5ac4-c02b-4cfa-9645-4613c33f3a71","resolution":{"observed_at":"2026-08-06T18:10:11.970598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:26:16.655495Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":54,"verified_exact":8,"verified_fuzzy":1},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2507.09068."}