{"as_of":"2026-08-20T13:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:928829a76dd750adb4b5189602778cfd4aafc705b7eb63dd9ab363c1ae807268","coverage":[{"denominator":148,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:14:20.027276Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T06:33:32.090913Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:56:47.335540Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2504.16082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16082","snapshot_observed_at":"2026-07-02T07:56:47.335540Z","title":"and Wang, Y .-X","venue":null,"work_id":"7d98896f-8029-4b90-ac2d-cc8a681a1cf0","year":2025},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2504.16082","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:60e9b7c0e1cf21ab709e80b40b32e2626e54bd39f7094ac7aec19b7cb1947953","observation_id":"9eaf1eeb-ce67-45d9-bd88-2d53b82834e9","resolution":{"observed_at":"2026-05-19T11:55:30.086813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2504.16082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16082","snapshot_observed_at":"2026-07-02T07:56:47.335540Z","title":"and Wang, Y .-X","venue":null,"work_id":"7d98896f-8029-4b90-ac2d-cc8a681a1cf0","year":2025},"citing_paper":{"arxiv_id":"2604.04372","last_updated":"2026-04-06T02:43:03Z","snapshot_observed_at":"2026-07-06T22:53:20.122451Z","submitted_at":"2026-04-06T02:43:03Z","title":"Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T19:46:16.975267Z"},"links":{"cited_paper":"/paper/2504.16082","citing_paper":"/paper/2604.04372"},"observation_digest":"sha256:dae59234631a9bdd2f0e02b8dc7e6a5ead69d55f16e05d0f1724b192f601d9e9","observation_id":"e2a32a97-bee5-4846-89e4-383a7787ce4e","resolution":{"observed_at":"2026-05-10T22:30:52.648369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2504.16082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16082","snapshot_observed_at":"2026-07-02T07:56:47.335540Z","title":"and Wang, Y .-X","venue":null,"work_id":"7d98896f-8029-4b90-ac2d-cc8a681a1cf0","year":2025},"citing_paper":{"arxiv_id":"2605.00444","last_updated":"2026-05-01T06:24:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T06:24:40Z","title":"Scaling Video Understanding via Compact Latent Multi-Agent Collaboration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T20:11:11.410051Z"},"links":{"cited_paper":"/paper/2504.16082","citing_paper":"/paper/2605.00444"},"observation_digest":"sha256:efc1a4d03bd42b802a835a8d5948060e343945949383c693c6ad7092021256d6","observation_id":"e7919ba8-883e-46b6-9af3-a94637f69d8b","resolution":{"observed_at":"2026-05-11T15:21:09.395092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2504.16082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16082","snapshot_observed_at":"2026-07-02T07:56:47.335540Z","title":"and Wang, Y .-X","venue":null,"work_id":"7d98896f-8029-4b90-ac2d-cc8a681a1cf0","year":2025},"citing_paper":{"arxiv_id":"2606.06532","last_updated":"2026-06-03T17:47:49Z","snapshot_observed_at":"2026-08-15T03:34:25.861188Z","submitted_at":"2026-06-03T17:47:49Z","title":"GOPAgen: Motion-Aware and Efficient Agentic Long-Video Understanding with Structural Memory and Hierarchical Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T06:33:32.090913Z"},"links":{"cited_paper":"/paper/2504.16082","citing_paper":"/paper/2606.06532"},"observation_digest":"sha256:c50421e59592643cf086aee1376f87d57614d2472ae9637943fb3fb4d77a7b48","observation_id":"b020e007-054f-4fde-a454-cbb756619e1f","resolution":{"observed_at":"2026-07-02T07:56:47.336859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16082/citation-record","integrity":"/paper/2504.16082/integrity","json":"/paper/2504.16082/citation-record.json","paper":"/paper/2504.16082"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:14:19.582563Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.582563Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:6fc46989b00013f98950f6fcd26f8d02f124fbf479d7a2329baeac8011c4f1ff","observation_id":"c1092f00-5e5c-4fb7-a37a-d7f1c007282f","resolution":{"observed_at":"2026-08-16T11:14:19.582563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-16T11:14:19.588215Z","title":"Qwen2.5-VL technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.588215Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:6bac8ae20b3469966b8177da59f12f9c119c138a0528d68411a85050bc356bda","observation_id":"33642b88-0fab-4c1c-919c-3fa238d837a8","resolution":{"observed_at":"2026-08-16T11:14:19.588215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-16T13:12:45.748381Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-16T11:14:19.593130Z","title":"AuroraCap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.593130Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:9ed6a7a6e4e92c2dc63c0b2e91e2c1fe9b8c3e46f80b5bf0cebe998ddb7132b3","observation_id":"647c0f4c-cd02-47b7-9f82-f91f92bb0ec4","resolution":{"observed_at":"2026-08-16T11:14:19.593130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.598473Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.598473Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:bb21a1b11000cd8344a567d9874bff1a00fe23db88b38ab0a97200782c0c3a68","observation_id":"646c31ea-ce45-47d4-a619-77cc32fd244c","resolution":{"observed_at":"2026-08-16T11:14:19.598473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-08-15T16:39:44.454451Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-08-16T11:14:19.602914Z","title":"Timemarker: A versatile video-llm for long and short video understanding with superior temporal localiza- tion ability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.602914Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:e4b6666508ab15e95f3ebffcea2b3efad7bb70b6f697d2c2d0bca2ea12489475","observation_id":"53603afc-4afc-44c7-8c83-35fec21371ac","resolution":{"observed_at":"2026-08-16T11:14:19.602914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.607385Z","title":"InternVL: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.607385Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:e5c5fa72c93abd139ec85cda4b23a3e37a4d3442bdff602d4f9c94890d9c1064","observation_id":"40466cbc-85d2-454c-8611-bf7245309421","resolution":{"observed_at":"2026-08-16T11:14:19.607385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.611681Z","title":"MapReduce: simplified data processing on large clusters","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.611681Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:65f8f96264e510f601640d32399780c21b4fec784337fb95935e9e4b915b6a5d","observation_id":"044f8aa0-8947-47cd-a3af-430818a1af6e","resolution":{"observed_at":"2026-08-16T11:14:19.611681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.615823Z","title":"VideoAgent: A memory-augmented mul- timodal agent for video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.615823Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:d769eb43babb7dbf408acb21f9e111e8e21ad97ba9cab3a2ccdf2285489a0b43","observation_id":"25d57e1b-059c-4663-b110-7506926c0ef9","resolution":{"observed_at":"2026-08-16T11:14:19.615823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-16T11:14:19.620433Z","title":"Video-MME: The first-ever comprehensive evaluation benchmark of multi-modal LLMs in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.620433Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:cbd9c7a9091dcf66a2d4a309f2ad4fa27ff002f9b8b3cd2eafb70ed363c5a8eb","observation_id":"920db2e5-7d9e-4302-8dee-ba661337c856","resolution":{"observed_at":"2026-08-16T11:14:19.620433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-16T11:14:19.625228Z","title":"ChatGLM: A family of large language models from GLM-130B to GLM-4 all tools","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.625228Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:9994e16d11926cb81dc16e4e4d9ac75da7b9ab7961314f739a053affa409a7e6","observation_id":"1b507845-0c48-40e7-b30c-10e946c75054","resolution":{"observed_at":"2026-08-16T11:14:19.625228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.629719Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.629719Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:23b540c3de29b2f5e1434171d6651f0ca23dc1caadb6e0076df38108b75fdba1","observation_id":"f58cfd34-1c92-42f1-a391-341a333d5e34","resolution":{"observed_at":"2026-08-16T11:14:19.629719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.633906Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.633906Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:d5e1684508597b275159b8b648206d588aec3a46192fe9ac9dee21fc2a7a32cc","observation_id":"0d1fc84e-f9af-4a15-9e36-c6e51ece875a","resolution":{"observed_at":"2026-08-16T11:14:19.633906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.637981Z","title":"Perceiver IO: A general architecture for structured inputs & outputs","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.637981Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:084b408bf669e23d61a9ba164d2e718b54849e7fbdeb4c0c3b9d13c2fcf5234e","observation_id":"6f686851-14c1-4309-b03d-55fa62707c2c","resolution":{"observed_at":"2026-08-16T11:14:19.637981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.642214Z","title":"SWE- Bench: Can language models resolve real-world github is- sues? In ICLR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.642214Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:6122968be0c84f1a7d3781701c4752d5974915baa34f7c0a970092e3b7d0d80b","observation_id":"130fe568-ca69-44f7-823f-3b2c2e6c4b16","resolution":{"observed_at":"2026-08-16T11:14:19.642214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T11:14:19.646991Z","title":"Llava-OneVision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.646991Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:d05f7af80b8e8123f690b278703798259fd9361398d2f827a14f5df50bb74dbb","observation_id":"3db1e49b-7a5c-4c55-93f7-4ff2c2d4f706","resolution":{"observed_at":"2026-08-16T11:14:19.646991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-16T11:14:19.651623Z","title":"LLaV A-NeXT- Interleave: Tackling multi-image, video, and 3d in large mul- timodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.651623Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:cc8f2038409d3746d20145e482dc2bb167cca67ab02c37bd2ba9ff43f4432cd7","observation_id":"d4b7b2d6-89d2-4c76-809a-f8873361e3d4","resolution":{"observed_at":"2026-08-16T11:14:19.651623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.656024Z","title":"BLIP: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.656024Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:e662ce60a1f7697dc0144ff71c2c14495a68926cfd8bdce46f63c112487811cf","observation_id":"e07fd8e3-a97e-40e5-9e84-3ad949312a3f","resolution":{"observed_at":"2026-08-16T11:14:19.656024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.660349Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.660349Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:66a783214b718e6b3d6e2533b0255c06c4d7494e45e529c5d035f766a302f5be","observation_id":"2f325a6f-7e85-4d76-bd63-4401f0c36c38","resolution":{"observed_at":"2026-08-16T11:14:19.660349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-16T11:14:19.664419Z","title":"VideoChat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.664419Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:6a11616d850a48e5eb7eab469fa8a5f06ef35a848fc47b37148ad4fa8f2d3857","observation_id":"e14c2bd4-2ab7-4d13-8ad6-b9816ba29287","resolution":{"observed_at":"2026-08-16T11:14:19.664419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-19T22:51:42.178594Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-08-16T11:14:19.668886Z","title":"Temporal preference optimization for long- form video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.668886Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:d9a1388009e60eea48dd42006b6e4f99698312397195fd06b3bcd55478bd1947","observation_id":"a09e42ab-705b-4d78-91d8-6d93e72fbbaa","resolution":{"observed_at":"2026-08-16T11:14:19.668886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-16T11:14:19.673130Z","title":"VideoChat-Flash: Hierarchical compression for long-context video modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.673130Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:2ebc6e75a6dde94b0bd11c32fb62a2a167a85eeab0891d5a3b1476df1ba20d92","observation_id":"565c56fc-a2a4-4cb9-9369-3c2a3140fe2e","resolution":{"observed_at":"2026-08-16T11:14:19.673130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.677426Z","title":"Llama-VID: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.677426Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:dbbd388fa1b2da24953158a810def2877237cb2e642d421392c11d45b650cc64","observation_id":"3ff42e3f-7bae-4540-8ace-e38ba110efef","resolution":{"observed_at":"2026-08-16T11:14:19.677426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.681805Z","title":"Video-LLaV A: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.681805Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:0b275c680391b7fda12402eaacc73b5efc87f9df5a77480e763cbdc3a80fc783","observation_id":"f5bb5563-1585-412d-823c-6fa687f70f84","resolution":{"observed_at":"2026-08-16T11:14:19.681805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.686041Z","title":"MM-Embed: Universal multimodal retrieval with multimodal LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.686041Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:4ed1dbaf67e9e3f768f2e0f9e22318b07b572fd5aa28124c6c3a4750b7f1c492","observation_id":"f71adb37-4c22-44ea-8147-9622b7c3fa46","resolution":{"observed_at":"2026-08-16T11:14:19.686041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-16T11:14:19.690520Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.690520Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:b05a81d47176b2b00973da72c58efbd2df08a8b7f4bca0ced4991ede0cae11cc","observation_id":"fd158bb0-d796-461a-bc07-2bf36b37103a","resolution":{"observed_at":"2026-08-16T11:14:19.690520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.695119Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.695119Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:d02c0a591a5f43d51d5147df26f858d70fc555ab04af6f4fd04635e1d27a4f54","observation_id":"4895218d-029d-4923-9f96-4481941b6cf2","resolution":{"observed_at":"2026-08-16T11:14:19.695119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.699628Z","title":"LLaV A-NeXT: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.699628Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:dc49629851405edfb1ea758a2f82e6229a71658ca5101e03c367fb083e647491","observation_id":"36346025-23e5-4f5d-be8c-d2f61fe60eed","resolution":{"observed_at":"2026-08-16T11:14:19.699628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-16T11:14:19.703851Z","title":"NVILA: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.703851Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:ddb0362f675809f9dfb9be6d329a207617ec5c5e7cf052ffa34e088be4310d95","observation_id":"b5c13e66-7bb2-4e3e-b177-f9af96ab17eb","resolution":{"observed_at":"2026-08-16T11:14:19.703851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.708339Z","title":"Oryx MLLM: On-demand spatial- temporal understanding at arbitrary resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.708339Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:02ca177cb1d21b0b859e6e1fcf79353b2e98a347c5afd0b3ba484fd4f482b327","observation_id":"06dcb4a4-afc2-4527-9f21-f89c9179bd94","resolution":{"observed_at":"2026-08-16T11:14:19.708339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.713041Z","title":"EgoSchema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.713041Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:99aa0041886c5cbeca1e1e9b8f76387f19a992dc80bba756ab74df030a3120c5","observation_id":"b4a5e991-59a3-493e-9e92-685b3f934419","resolution":{"observed_at":"2026-08-16T11:14:19.713041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.717062Z","title":"TimeChat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.717062Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:8c7dd4b2244ded25cdd8736737b02e0d93618bcc92d05633168c98639a78a942","observation_id":"330ec540-4a94-4708-b257-b0d74d2a36fb","resolution":{"observed_at":"2026-08-16T11:14:19.717062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.721193Z","title":"LLaV A-PruMerge: Adaptive token reduc- tion for efficient large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.721193Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:4690c7c3918cded6e8485dfe7c429bb3b4690a6bbc782b6b23979f2bf08e6d52","observation_id":"872ad005-aa6b-4ccb-90a8-45ff89ab1737","resolution":{"observed_at":"2026-08-16T11:14:19.721193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-16T11:14:19.725198Z","title":"LongVU: Spa- tiotemporal adaptive compression for long video-language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.725198Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:e0906a73de117edcf96707b6707478fa26b9e51dfa7edabc017979088fa357e0","observation_id":"cee9a261-f156-4da4-b1e5-65296ba20d83","resolution":{"observed_at":"2026-08-16T11:14:19.725198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.729858Z","title":"MovieChat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.729858Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:caa5bb327e716319f48e4a681ddb04979509cc9e097cf481689dd2dd9f8a73db","observation_id":"92cd8083-6679-4c6c-89a6-bc79d22f6b21","resolution":{"observed_at":"2026-08-16T11:14:19.729858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.734099Z","title":"ViperGPT: Visual inference via python execution for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.734099Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:0081b129fa00c372129f14222b411deb2b51beef0952dda1ec7d5e63c5d3f995","observation_id":"3d39cd2f-a0be-4c6f-a916-3c842c5be408","resolution":{"observed_at":"2026-08-16T11:14:19.734099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T11:14:19.738048Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.738048Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:f9b4c5457559c54553945ee2536d9f2bb47a4748caa057f9ed967686fca76940","observation_id":"fe553232-1f03-471e-b811-0b0615b95bf9","resolution":{"observed_at":"2026-08-16T11:14:19.738048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-16T11:14:19.742286Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.742286Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:7bc6ee4ce9c09d9d9a999726371152ef404631e9923448688ba47a5689681b0f","observation_id":"e46b2d20-0deb-4627-8f67-74315e2db408","resolution":{"observed_at":"2026-08-16T11:14:19.742286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-16T11:14:19.746574Z","title":"LVBench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.746574Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:ae4a1345e51cd98babeb83ccba154dc4a6e9313affe9ee44d02b9581ced61d36","observation_id":"a7d04396-d7b3-44ea-892d-a20693979b5b","resolution":{"observed_at":"2026-08-16T11:14:19.746574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20504","last_updated":"2025-03-24T02:17:34Z","snapshot_observed_at":"2026-08-18T07:36:07.148051Z","submitted_at":"2024-12-29T15:42:24Z","title":"ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20504","snapshot_observed_at":"2026-08-16T11:14:19.751131Z","title":"ReTaKe: Reducing temporal and knowledge redundancy for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.751131Z"},"links":{"cited_paper":"/paper/2412.20504","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:668d1a8b2692804a8364783c72401afd01b8c0f6d53dff6390e620da401d8f5f","observation_id":"8298e034-14e3-4253-b1f1-3ba82ca623d7","resolution":{"observed_at":"2026-08-16T11:14:19.751131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.755983Z","title":"LongLLaV A: Scaling multi-modal LLMs to 1000 images efficiently via a hybrid architecture","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.755983Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:0fa98215c9e1947fd72eda89f7b7e766ca00ea660ce927bf49eeff14624bbb54","observation_id":"0cfc33df-fa4d-4996-83c1-34b9513aa4f0","resolution":{"observed_at":"2026-08-16T11:14:19.755983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.760324Z","title":"VideoAgent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.760324Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:05120ac58ab3b94949309ccc91a73abe848bde72cf7d488636917a059b66207a","observation_id":"d300838f-fb52-4546-a345-221d53434497","resolution":{"observed_at":"2026-08-16T11:14:19.760324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-16T11:14:19.765679Z","title":"InternVideo2.5: Empowering video MLLMs with long and rich context modeling.arXiv preprint arXiv:2501.12386, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.765679Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:92910252f83ec606d0dded011ce122a8ba843c013969054015ecdafdf217e4dd","observation_id":"bd4a64fa-0b05-4b3d-b302-095a289f5579","resolution":{"observed_at":"2026-08-16T11:14:19.765679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-17T21:35:27.995630Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-16T11:14:19.770287Z","title":"VideoTree: Adaptive tree-based video represen- tation for LLM reasoning on long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.770287Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:5215ac95eca9ebe4c11a15fcb2d5f794997a654d58801b66cf494c5f5e404282","observation_id":"b40d3b04-17b8-4128-930d-09555e3d088c","resolution":{"observed_at":"2026-08-16T11:14:19.770287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.774505Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.774505Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:eb3266e3a7d264b078cdb794abbc1cae4d7e1c426282ebfbf0d4afb1804bbc66","observation_id":"32a72efd-32a9-4b5e-a15c-c514fbb23d26","resolution":{"observed_at":"2026-08-16T11:14:19.774505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.779557Z","title":"LongVLM: Efficient long video understand- ing via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.779557Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:de9cd6a47d1eb08bfe49f73d54995f1861e6da730e1259cddb198f56e9994b02","observation_id":"0881e717-e72e-4fc6-a042-58c45af04b66","resolution":{"observed_at":"2026-08-16T11:14:19.779557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.783702Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.783702Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:9d0af55d41de003a4f33e033d4f54412a66716b36738ce05ab20b37a4d1d31e8","observation_id":"bb3598c7-5a5b-45be-b697-da995de695ae","resolution":{"observed_at":"2026-08-16T11:14:19.783702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.787961Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy re- duction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.787961Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:ae274819cc7c785770f5754b37244c96577913460533388ae1ab89a7cd19a85c","observation_id":"54199bcc-917c-4bfa-8915-248812d00afc","resolution":{"observed_at":"2026-08-16T11:14:19.787961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-16T13:32:02.889396Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-16T11:14:19.792206Z","title":"Slowfast-llava: A strong training-free base- line for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.792206Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:2ce4298a188e32eba78761663d195e1af73e81ffeb26cbacaba6aae42cdc3262","observation_id":"33f83d22-0245-48ea-86b1-1551a5849916","resolution":{"observed_at":"2026-08-16T11:14:19.792206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-16T04:27:36.181491Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-16T11:14:19.796447Z","title":"LongVILA: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.796447Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:88d735d7f09b87fe166980d0ebbbc13bd300e8bc0f473dd09dedaa787c6ddfbe","observation_id":"4de1b057-12c3-4f1e-b9a5-9a0ebe6bb377","resolution":{"observed_at":"2026-08-16T11:14:19.796447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-16T11:14:19.800900Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.800900Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:b65a9a06e2b83cd4176427fcf68f2d4fe4a6d6bb3c4ea7e51ec97d5a1955b53c","observation_id":"6d766a48-3598-4139-954b-14a64ca56cf3","resolution":{"observed_at":"2026-08-16T11:14:19.800900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.805192Z","title":"SWE- Agent: Agent-computer interfaces enable automated soft- ware engineering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.805192Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:1f906d14e48b57ac721a9e3f924abe6a620bc1b47a35debd920acb9d047f655d","observation_id":"f7212029-79a4-4d1f-89ae-bb0c8a72fb50","resolution":{"observed_at":"2026-08-16T11:14:19.805192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-17T01:54:11.006899Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-16T11:14:19.809225Z","title":"HotpotQA: A dataset for diverse, ex- plainable multi-hop question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.809225Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:9f46a7953a95bde106cf326bba0d919cd27b9aa1a6514b6fc5e08cd1c220e032","observation_id":"91b4fb99-caa2-4321-91bc-fdaa74ab55fd","resolution":{"observed_at":"2026-08-16T11:14:19.809225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10471","last_updated":"2025-03-10T03:35:16Z","snapshot_observed_at":"2026-08-17T17:41:07.728217Z","submitted_at":"2024-12-12T23:39:54Z","title":"VCA: Video Curious Agent for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10471","snapshot_observed_at":"2026-08-16T11:14:19.813990Z","title":"VCA: Video curious agent for long video un- derstanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.813990Z"},"links":{"cited_paper":"/paper/2412.10471","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:5ba98535b7ecb155aa4ed6e588dcb514915e2eec19e16950018bddf5f08798fb","observation_id":"c15a3738-63ea-440d-8e9f-9a3f1d1c60da","resolution":{"observed_at":"2026-08-16T11:14:19.813990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.818233Z","title":"ReAct: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.818233Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:486962dd6845fd03ca8d93a276d19812235f4149feceb6517f17d6626d2462e6","observation_id":"4c7e8a2a-baa2-477f-b0a8-5ed4ca5d3938","resolution":{"observed_at":"2026-08-16T11:14:19.818233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.822257Z","title":"mPLUG- OWL3: Towards long image-sequence understanding in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.822257Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:7ed78fd45a1e7a304d98debe2fc3fff1abc917e45ab583f04d2742dd756debd3","observation_id":"d275e97a-2fce-4806-9c91-5f9d6900bd55","resolution":{"observed_at":"2026-08-16T11:14:19.822257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-16T11:14:19.830458Z","title":"VideoLLaMA 3: Frontier mul- timodal foundation models for image and video understand- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.830458Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:7638c219332d60827dbde3fe82c4d6736adb28b899767b0456c23e195d7a4914","observation_id":"59742282-5e13-4c3b-ab04-f50be511f0ff","resolution":{"observed_at":"2026-08-16T11:14:19.830458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.834901Z","title":"A simple LLM framework for long-range video question-answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.834901Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:297f14816f310c00de9690702616a6798f898256a71731888dd9a741c9d5e645","observation_id":"37451518-0140-4205-bde1-471fbf9a7401","resolution":{"observed_at":"2026-08-16T11:14:19.834901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.839194Z","title":"LLaV A-NeXT: A strong zero-shot video understanding model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.839194Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:d1dd16147d457242a8707acb7b9f6f61ebe20e8c02773521c71fe90d3ba73528","observation_id":"88f4134a-6376-4a23-84e8-649c40e784c7","resolution":{"observed_at":"2026-08-16T11:14:19.839194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.843436Z","title":"Language agent tree search unifies reasoning acting and planning in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.843436Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:1d28c847ff129e3bca769d2321f7894bb10087fbed8778ece34621afb6e9bd65","observation_id":"92d9400d-f343-4c4c-b24e-a6fb2824f3c0","resolution":{"observed_at":"2026-08-16T11:14:19.843436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-16T11:14:19.848274Z","title":"MLVU: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.848274Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:b9708ed090f41b9d063f30c12f9a5bb65daa5e8b563c647e6a96c5a7f5e9711e","observation_id":"21db97ff-f3fb-41ae-8e51-a1146d116a98","resolution":{"observed_at":"2026-08-16T11:14:19.848274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-15T17:40:10.309874Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-16T11:14:19.852868Z","title":"MapReduce","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.852868Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:ea2b99421f29e8ea14f9c7b8ceb91e0890788a3ce40c28f14411747d3e2c2e79","observation_id":"05b07131-905d-4b5f-9ab1-88579892eaed","resolution":{"observed_at":"2026-08-16T11:14:19.852868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.858786Z","title":"Scene Merging","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.858786Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:b20dc760188834ebd76a2b7b7e850a4b7a845be5901aa6cdc7171c921a8c7d10","observation_id":"cd6a3520-631c-423d-b5a4-ca589a53efa3","resolution":{"observed_at":"2026-08-16T11:14:19.858786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.863370Z","title":"The prompts are in Table C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.863370Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:6ec7e40b663debf670db7ee0724f2f54050e74b17e69854cb94cfb0f8da3eed5","observation_id":"acc6f42e-bf58-43e1-9831-85da297a9585","resolution":{"observed_at":"2026-08-16T11:14:19.863370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.867509Z","title":"Reduce: Consistent Characters and Objects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.867509Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:0abac24b17e1f8528bbadfbd6f9e9ee4434c7b5e2bb7f6c0ab7db711c9c47696","observation_id":"ec5cd9dd-512c-40ed-8ddb-7160f7bee4dd","resolution":{"observed_at":"2026-08-16T11:14:19.867509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.871945Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.871945Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:2ed09c0b0c8c122a9c7d303be027c2bef3014f254c67903e59010abc56c1d65a","observation_id":"85fbb2ac-147b-4767-bc6b-551b92346321","resolution":{"observed_at":"2026-08-16T11:14:19.871945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.876430Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.876430Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:13f9c07098cb8f2f06857ae8681be2b33210b8bbadfe0407874f92e0542d3834","observation_id":"b12c936a-2ff6-44c2-ba6b-bd61fb2a6bae","resolution":{"observed_at":"2026-08-16T11:14:19.876430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.881006Z","title":"[1. Description]:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.881006Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:e3aa027ea1504ab8a5b9462300f8e86544648eb22ea7e6a89c4a7f89b7fb90cd","observation_id":"d3751bd4-06f4-4bb4-899f-8af4c29b9153","resolution":{"observed_at":"2026-08-16T11:14:19.881006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.886414Z","title":"Is this video segment a single scene or a combination of multiple scenes?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.886414Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:13d3ff5e6d074f06a50211018ab35217c6e84d91af85152811fb6269040e0130","observation_id":"69c2a5c7-0be9-4c59-b1e2-f057e589a776","resolution":{"observed_at":"2026-08-16T11:14:19.886414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.890835Z","title":"no\", please provide the index of frame(s) separating the scenes from the given frame. Your answer should come with a header:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.890835Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:8b4f79b8b86b620f8c4f70b47ec26a9c9599eafa243f02f3c463bd89e3133760","observation_id":"01e668f1-f9ef-4662-ab1a-1455fe5c613c","resolution":{"observed_at":"2026-08-16T11:14:19.890835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.896280Z","title":"Try to be rigorous and faithful to the video without making assumptions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.896280Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:3ae5fbd499c070cded5d0d54513022048306194edb436bc75fafbd9b264fb3f2","observation_id":"437d2a4f-b3e6-4824-acdf-5148dc9a9b1b","resolution":{"observed_at":"2026-08-16T11:14:19.896280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.900527Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.900527Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:81407ccec8d522dc2e9387c382945d5c6f46d54472778c4d3f531da71caface5","observation_id":"e9728f37-3494-44b6-8c4c-9ceb3022b2b4","resolution":{"observed_at":"2026-08-16T11:14:19.900527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.904614Z","title":"person a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.904614Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:74ed6b03f6226f2fbdd56843a868e9a66ec1369d415af16c7e5321ebcd7be36f","observation_id":"0819d016-f84c-4d7f-a745-1c11ca072cac","resolution":{"observed_at":"2026-08-16T11:14:19.904614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.909673Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.909673Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:931a05e88fbece29c2e196567f6e0def5e652180dbccd96ec2595759b3b096cc","observation_id":"ab82b672-d59c-4cd2-ae9c-49c053dec7d4","resolution":{"observed_at":"2026-08-16T11:14:19.909673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.913885Z","title":"It could be a person in the movie, an animal in the documentary or cartoon, etc","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.913885Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:c38449c3181ebfb9289ab68fb3a787b19a46d6a0b600ff6c2cc3b29c44415c5d","observation_id":"a17f75b7-cc26-4323-8a35-4a5238b16621","resolution":{"observed_at":"2026-08-16T11:14:19.913885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.918285Z","title":"Please keep the strings in identical formattings to ensure smooth post-processing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.918285Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:35075e1d83e23ee49a4368d961ad9ee8d40b3d31a5e84f1219351273dfc4cb6e","observation_id":"4ae66a10-2ecf-40f7-af46-3009069ff4e3","resolution":{"observed_at":"2026-08-16T11:14:19.918285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.922457Z","title":"Character Selection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.922457Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:c191878f70d4d64a3c204b3343ffb772bc938752669eb2ae30df586ce36aee56","observation_id":"e826a54e-340a-4a7d-b9e5-1550d71b75ec","resolution":{"observed_at":"2026-08-16T11:14:19.922457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.926656Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.926656Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:cd7d12e6cf679f3d3ba3b1f6256f8472030cd0fc90fc7689d02ac9000581a248","observation_id":"ccebd5ff-889b-4e5a-816b-12db6a89b9fe","resolution":{"observed_at":"2026-08-16T11:14:19.926656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.930670Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.930670Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:ac1bc9263c691871463a106c3862dfc99f9fe5b778d3d13a3eff47348362b652","observation_id":"bb6e644d-be11-4cd5-b166-f08e1fac7d17","resolution":{"observed_at":"2026-08-16T11:14:19.930670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.934742Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.934742Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:9c5455ba99e9e30484fc3096ff22a151cc1391bb60b4b6dd864bb233bbbbe909","observation_id":"15af2956-cbdb-48e6-a04e-239ce4a1ba3f","resolution":{"observed_at":"2026-08-16T11:14:19.934742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.938858Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.938858Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:882bae788f668aa5da98cd0facf99ec8efbb0caad741503c67baf4888f27f318","observation_id":"a77dbbc9-6a2b-4899-8c84-582a5aec5d53","resolution":{"observed_at":"2026-08-16T11:14:19.938858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.943381Z","title":"If so, please list their name out","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.943381Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:055b5f8452bb3bdcbf04565c1812c020e0fd3b6fe30c09d484158c3a8f465d21","observation_id":"723026b6-4e2b-4be6-91f4-a96f3cd73642","resolution":{"observed_at":"2026-08-16T11:14:19.943381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.947634Z","title":"Some more detailed tips:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.947634Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:7277f057d4e651a9b43c5d574e01bd5afc2463372424c1aeecbae25bf0b6961c","observation_id":"d186c8d0-9601-459f-a9be-f017ba50f10d","resolution":{"observed_at":"2026-08-16T11:14:19.947634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.952037Z","title":"The goal is that a human should read your captions and feel like watching a continuous video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.952037Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:49b66427a81de32aa866c0c9c029224f6dd7d27178e67620a97eb5fb2c02e67c","observation_id":"8f4da4f3-e0c3-4159-a9ce-f1c7afe602e9","resolution":{"observed_at":"2026-08-16T11:14:19.952037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.956100Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.956100Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:ca1d756ed9f5e095169d0552d726ac27f5be90c5f84cfefe152976b57b72034b","observation_id":"2942e76c-f48d-4c7a-9328-80d8ac7d220a","resolution":{"observed_at":"2026-08-16T11:14:19.956100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.960533Z","title":"person a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.960533Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:16a75de5a3fa3e50a08d63aa8e07be6f859f5aba2119a07c9abbfcbc03173b76","observation_id":"dd50afd3-36df-460d-8dc5-482d90cfeb37","resolution":{"observed_at":"2026-08-16T11:14:19.960533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.965308Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.965308Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:0744154d14a7b1ae90234c516c077eda64d2e6910b3bf17987d28b69d02f2833","observation_id":"e3506fac-bf4a-4e1a-aa43-6455aa342b87","resolution":{"observed_at":"2026-08-16T11:14:19.965308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.970068Z","title":"Dense Captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.970068Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:6aac6dfe5cf7957e862644d8d9e8701bf95f4ca1346d1587706875a172b821c1","observation_id":"65767748-ecc0-41c8-860e-0b67ea170fee","resolution":{"observed_at":"2026-08-16T11:14:19.970068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.974562Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.974562Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:f5fc4aac61e176fd8ad8e0d0dd03fd55d324aedc20bd558782a130cb5210dd57","observation_id":"8b58c023-235f-4897-aa09-9aec933aca4f","resolution":{"observed_at":"2026-08-16T11:14:19.974562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.979218Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.979218Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:9ca1668c92382085b2aa43e5239ff9aeb50d63136940bf720a1ec8e799d07773","observation_id":"547a60e2-4328-4ee2-a6e0-18accb8c50e1","resolution":{"observed_at":"2026-08-16T11:14:19.979218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.983545Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.983545Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:97b2674062809d4f39d920147e91d7590feff2d466a98f72e4df2a4d1089696b","observation_id":"2fb64f7b-888f-4a57-9211-2df026864d44","resolution":{"observed_at":"2026-08-16T11:14:19.983545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.988423Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.988423Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:79822e4b97d5f89d85b33d11b38f2044646d34769820e4d7e96d6e2a5f9929b3","observation_id":"e0f22290-9772-4c17-b022-002571c640c4","resolution":{"observed_at":"2026-08-16T11:14:19.988423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.992841Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.992841Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:3c94f7c7b9c35683ce330e04f27c15a634baa94b612f01e5698fe9d7c8e3eea2","observation_id":"b2c06448-54ba-4e7e-bd37-caa872a49c2a","resolution":{"observed_at":"2026-08-16T11:14:19.992841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:19.996813Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:19.996813Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:e1cc4ddd4d2dd276639a5f5f40d4181c3e6251010f46dcb1bf14048258827be8","observation_id":"542db1c6-6e2c-408a-917f-609eda5eef0a","resolution":{"observed_at":"2026-08-16T11:14:19.996813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:20.000653Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:20.000653Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:9cf4be76b1a8fc3275c8f2c2929f7f4671425a0cb85a469a96fca729ad2404e3","observation_id":"fda50274-fd07-45cb-abc7-4f13e3f645e9","resolution":{"observed_at":"2026-08-16T11:14:20.000653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:20.004859Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:20.004859Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:9b58ed167ce172d08424864f6d1e99f03aabce25fe751f0dbf5a3ab1bdc6b3b4","observation_id":"3204551e-a098-4002-8e83-83705bb670bf","resolution":{"observed_at":"2026-08-16T11:14:20.004859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:20.009168Z","title":"Character Merging","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:20.009168Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:d815a9669a80664c1b950e952f83707782fb26a460a98dcab806ed1f4ef8d827","observation_id":"b707b233-79b9-4ebc-ac22-0a85f4b11191","resolution":{"observed_at":"2026-08-16T11:14:20.009168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:20.013506Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:20.013506Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:3aa38cba86d36aae55c81ca91dc02753dc58a91c33d50092a7e22a3fbb7360bb","observation_id":"0bb0c0d4-f311-4a52-8945-a45db7c2ba4f","resolution":{"observed_at":"2026-08-16T11:14:20.013506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:20.018995Z","title":"Output: Your output should be the modified description of the video clip strictly following the original format and contents, only with names changed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:20.018995Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:95a786c67cecbddb4c9c59c8aa944374de5223c9a2dcc6bdcb6fbb37701a5c5f","observation_id":"8cf94b18-4fd2-4e7d-a21e-95f7a5c1db5b","resolution":{"observed_at":"2026-08-16T11:14:20.018995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:21.521970Z","title":null,"venue":null,"work_id":"6d03655e-d5bb-4fde-ba49-9a499935d6f8","year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:20.023097Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:bb445eb3b2095a06a63d1ffdc7bb0a4bb3bac4cc89c9f5840192210aa652715c","observation_id":"c69f0c2b-e5f5-4303-9048-0f631db62514","resolution":{"observed_at":"2026-08-16T11:14:21.526142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:14:21.508101Z","title":null,"venue":null,"work_id":"d3d45e42-f47c-4839-86ba-e580dc85b345","year":null},"citing_paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-16T11:14:20.027276Z"},"links":{"citing_paper":"/paper/2504.16082"},"observation_digest":"sha256:5defc9cf51110ed675a335205367fe5ec9bd413dc57380bc5d7abc200f78acec","observation_id":"7dd82448-1b05-4a3f-b431-64901403ac32","resolution":{"observed_at":"2026-08-16T11:14:21.512320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.16082","last_updated":"2025-04-22T17:59:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T04:14:19.218331Z","submitted_at":"2025-04-22T17:59:41Z","title":"MR. Video: \"MapReduce\" is the Principle for Long Video Understanding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":148},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 148 outbound references and 4 inbound Pith citation observations for arXiv:2504.16082."}