{"as_of":"2026-08-07T10:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f56304c0ec0437502be604098d578927d7fcbd0d83f93eda021b50d4cbb63db6","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:59:17.302898Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02946/citation-record","integrity":"/paper/2507.02946/integrity","json":"/paper/2507.02946/citation-record.json","paper":"/paper/2507.02946"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:59:15.678922Z","title":"5-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.678922Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:e11de2784f689969dfacd453e15a297e781088636ac6b597c6cd8039227522df","observation_id":"2df4ca94-0573-4ef3-8129-00b94da7f0f4","resolution":{"observed_at":"2026-08-06T21:59:15.678922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-08-06T21:59:15.758936Z","title":"arXiv preprint arXiv:2311.14906","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.758936Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:809d65207a2f14690b3fa15bc2ad1626b037defd1156b5851b19ef1f94b35f28","observation_id":"29312749-d544-4313-a39f-c76c0a07fece","resolution":{"observed_at":"2026-08-06T21:59:15.758936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-07-06T21:03:35.698923Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-06T21:59:15.855545Z","title":"arXiv preprint arXiv:2504.02438","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.855545Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:204c21de4e9260b9c4a46ad53c3fff26281d1f97a506f73b6f5da757c6511ff7","observation_id":"b4e04e31-54a1-4856-ae77-3dd741cf5db7","resolution":{"observed_at":"2026-08-06T21:59:15.855545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T21:59:16.010886Z","title":"arXiv preprint arXiv:2503.21776","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.010886Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:ba88ee678041b58dde0cb4d0d772d926cf8d596b1a8433d1384777b144ed85e0","observation_id":"f02e1bab-94e6-4fcd-92b6-0f79569b36ec","resolution":{"observed_at":"2026-08-06T21:59:16.010886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T21:59:16.134001Z","title":"arXiv preprint arXiv:2405.21075","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.134001Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:fc102e7e3b146a3f46983adb14a88482995b777e8f87865ff5b599dee21f1123","observation_id":"48c49d92-36e3-48a5-acaf-059faa0018a9","resolution":{"observed_at":"2026-08-06T21:59:16.134001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-06T21:59:16.221161Z","title":"arXiv preprint arXiv:2305.14992","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.221161Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:c5f559c6a06321aefc5a56a9427b9cd207def92d9a6e3ba72338eefeaecbd01b","observation_id":"6048adb1-94be-4ff2-b950-086bcb07d394","resolution":{"observed_at":"2026-08-06T21:59:16.221161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11865","last_updated":"2025-05-16T06:50:09Z","snapshot_observed_at":"2026-07-06T18:01:57.998555Z","submitted_at":"2024-04-18T02:43:37Z","title":"From Image to Video, what do we need in multimodal LLMs?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11865","snapshot_observed_at":"2026-08-06T21:59:16.278173Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.278173Z"},"links":{"cited_paper":"/paper/2404.11865","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:1621444be7c5cb83e09e13f578e83f6745f73f0a52670a233b420e6ecd181d65","observation_id":"8faf21c6-a3bf-4ade-a893-cd6fe75dedf0","resolution":{"observed_at":"2026-08-06T21:59:16.278173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T21:59:16.444148Z","title":"arXiv preprint arXiv:2305.06355","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.444148Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:410a69933d07036d40fb9d336357ffdb14e43db0cfd94361c8e99718de447fae","observation_id":"110c9dea-d75d-4a06-9dd8-94baa733e875","resolution":{"observed_at":"2026-08-06T21:59:16.444148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T21:59:16.488837Z","title":"arXiv preprint arXiv:2311.10122","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.488837Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:14eb20c606bf53477b4ff517d85f3953d37b7df23f8ea7840b25e5406c47d645","observation_id":"08d20e2c-0330-46ff-9b67-fe558e1ebfba","resolution":{"observed_at":"2026-08-06T21:59:16.488837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02327","snapshot_observed_at":"2026-08-06T21:59:16.530036Z","title":"arXiv preprint arXiv:2411.02327","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.530036Z"},"links":{"cited_paper":"/paper/2411.02327","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:0ca50ff6ebcf0c8e805153a1a2d3b2d3cae30d0c2814db58437b5d7554c73668","observation_id":"a2ad6307-3313-41c9-887d-fdf025e90a0e","resolution":{"observed_at":"2026-08-06T21:59:16.530036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05615","last_updated":"2026-05-12T03:37:41Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-09T02:36:28Z","title":"Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05615","snapshot_observed_at":"2026-08-06T21:59:16.614884Z","title":"arXiv preprint arXiv:2406.05615","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.614884Z"},"links":{"cited_paper":"/paper/2406.05615","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:b9cc461b0a67e78b10c6597b97775795612206dc387cad8ffaba1fbe8fff9944","observation_id":"b822c8c7-c8c3-4c25-8055-bba79cbf1794","resolution":{"observed_at":"2026-08-06T21:59:16.614884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-06T21:59:16.696016Z","title":"arXiv preprint arXiv:2311.16103","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.696016Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:d28c181dd5df2ae6839085ca8e028e41ca214cfd7f06a3c51551ddea17289241","observation_id":"7d870a68-30b1-48c1-adc5-d6dd3459f69a","resolution":{"observed_at":"2026-08-06T21:59:16.696016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16044","last_updated":"2025-09-01T02:39:51Z","snapshot_observed_at":"2026-07-06T19:56:17.117739Z","submitted_at":"2024-11-25T02:15:30Z","title":"ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16044","snapshot_observed_at":"2026-08-06T21:59:16.773771Z","title":"Shu, Y .; Liu, Z.; Zhang, P.; Qin, M.; Zhou, J.; Liang, Z.; Huang, T.; and Zhao, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.773771Z"},"links":{"cited_paper":"/paper/2411.16044","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:4ae3831520ce5fb082e6a215e29d527235761e7db7e97f16b4f95e26e613f919","observation_id":"ca388100-361a-4ccc-b685-43025ec203b4","resolution":{"observed_at":"2026-08-06T21:59:16.773771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T21:59:16.899236Z","title":"arXiv preprint arXiv:2409.14485","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.899236Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:d7a1c5dbdd2a965ac0fb282b12f64c467104bd43bc0909f609522947c880942f","observation_id":"a03ecc67-4006-4690-9bf6-bdae02f2ad6f","resolution":{"observed_at":"2026-08-06T21:59:16.899236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T21:59:16.981202Z","title":"arXiv preprint arXiv:2403.05530","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.981202Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:71abada6c0cda656bcc644ff153b6022e7a84f8240f5be63169a5e385d93554f","observation_id":"91492b46-e8be-4b35-8952-a6a972a07059","resolution":{"observed_at":"2026-08-06T21:59:16.981202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-06T21:59:17.153103Z","title":"arXiv preprint arXiv:2404.16994","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:17.153103Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:a23d8e568f3290ef70edde27a0ea563ffbb5b505c246cb6c8d4e2a1e66b8fefe","observation_id":"587ba512-870c-4a04-bbaa-48b8069a308f","resolution":{"observed_at":"2026-08-06T21:59:17.153103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T21:59:17.302898Z","title":"arXiv preprint arXiv:2306.02858","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:17.302898Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:4749d2385f2ae37b327442bbf5de009ae6598b07548582e028309ef422e5718a","observation_id":"53a350c1-9421-43e5-a25b-1b0516cc88a1","resolution":{"observed_at":"2026-08-06T21:59:17.302898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T21:59:16.364927Z","title":"Artificial intelligence, 27(1): 97–109","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":1985,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.364927Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:32d3a16ab3bf70b61579efb98d6afe4264be88cb122042a7e2cb3a65dccd8ce1","observation_id":"ca2d00a3-b6ba-4815-aa27-272eeedd7da0","resolution":{"observed_at":"2026-08-06T21:59:16.364927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07394","last_updated":"2024-06-13T07:19:06Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:01:07Z","title":"Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07394","snapshot_observed_at":"2026-08-06T21:59:17.224605Z","title":"Current directions in psychological science, 16(2): 80–84","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:17.224605Z"},"links":{"cited_paper":"/paper/2406.07394","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:87219f0eb800ecb0eda51c8ea91032cd02afe56cf82358320f871837664639d0","observation_id":"a3101767-ba83-4287-90e5-94ed395b9614","resolution":{"observed_at":"2026-08-06T21:59:17.224605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T21:59:17.058810Z","title":"arXiv preprint arXiv:2203.11171","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:17.058810Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:39f143de5e7f12f17cc4244bcdb760a90eefeb0410ed95d1999df894a4cda199","observation_id":"ec3ffded-ef9e-43d7-ad38-a67c8cf17179","resolution":{"observed_at":"2026-08-06T21:59:17.058810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:59:15.515921Z","title":"arXiv preprint arXiv:2303.08774","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.515921Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:e1caeb22dde40bb22524d7e131026bb295907198c4f071adb2037409fd999109","observation_id":"a3e1ddd9-6e69-43fd-9211-6e2a79ced978","resolution":{"observed_at":"2026-08-06T21:59:15.515921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14515","last_updated":"2024-10-30T13:38:10Z","snapshot_observed_at":"2026-07-06T18:34:24.078145Z","submitted_at":"2024-06-20T17:26:01Z","title":"MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14515","snapshot_observed_at":"2026-08-06T21:59:15.950597Z","title":"arXiv preprint arXiv:2406.14515","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.950597Z"},"links":{"cited_paper":"/paper/2406.14515","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:4d49fb6ddd14a4a5257d3ddfa69ca31491fe26838f91530acaa69de3fef26e8a","observation_id":"07a3c23f-0848-4e87-9a93-13c1267286ba","resolution":{"observed_at":"2026-08-06T21:59:15.950597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02175","last_updated":"2025-04-01T19:02:04Z","snapshot_observed_at":"2026-07-06T20:46:09.097525Z","submitted_at":"2025-03-04T01:33:14Z","title":"DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02175","snapshot_observed_at":"2026-08-06T21:59:15.578220Z","title":"arXiv preprint arXiv:2503.02175","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.578220Z"},"links":{"cited_paper":"/paper/2503.02175","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:5fc066b8b6ace3af9ab2bac90663c2b9e24b5ddb830db48f128af572821c82d2","observation_id":"0ebdbcd1-1622-47c7-8529-22f36dd1d1dc","resolution":{"observed_at":"2026-08-06T21:59:15.578220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2507.02946."}