{"as_of":"2026-08-07T23:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:148e8e6d96242c57f3a9164a3dd894d9c9710fe03d4780699845f007a8a8bde2","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T22:26:25.786061Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15778/citation-record","integrity":"/paper/2607.15778/integrity","json":"/paper/2607.15778/citation-record.json","paper":"/paper/2607.15778"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:23.595392Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:23.595392Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:2bfc100732be91d17e149eb0c7dfdbf3f354d8515a73e2393f96aa215d73972a","observation_id":"71770873-c96e-41b7-8ea5-5f4f414eb406","resolution":{"observed_at":"2026-08-01T22:26:23.595392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:23.675835Z","title":"Vtimellm: Empower llm to grasp video moments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:23.675835Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:9daa00c2e6d8c87fe11234c6972d9d8160695644f1ac840ef1091c3c899a4ce0","observation_id":"b60c17eb-72d5-4278-9532-11abf5a921e2","resolution":{"observed_at":"2026-08-01T22:26:23.675835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:23.762387Z","title":"Moviechat: From dense token to sparse memory for long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:23.762387Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:b6fe534f339e8c067c4a0e4f2914f700881e66d8b125596db22b643b76acf60b","observation_id":"bca80b31-fcc4-4c19-a038-2e67946393ab","resolution":{"observed_at":"2026-08-01T22:26:23.762387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:23.851331Z","title":"Longvu: Spatiotemporal adaptive compression for long video-language understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:23.851331Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:0ee05892c4c60808b53e815496252877e7ec8040682c99e6dda1a683d953988e","observation_id":"516af506-3490-4cae-8328-df5f228a802f","resolution":{"observed_at":"2026-08-01T22:26:23.851331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:23.929607Z","title":"Adaptive keyframe sampling for long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:23.929607Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:a2fbc31651bc2531d95fca5f14879da50207ed54009f4bef1893a95d93f56827","observation_id":"fc751885-29c3-46e8-a23b-9341c4188ed2","resolution":{"observed_at":"2026-08-01T22:26:23.929607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.014552Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.014552Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:d8beebaeabc3c6acc5dd1a6332cc5f0f0eb8f80ccc1d22f197514b573a8198df","observation_id":"b26a6ad1-2c4c-4c83-a035-d270a02de89e","resolution":{"observed_at":"2026-08-01T22:26:24.014552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-01T22:26:24.098278Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.098278Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:755e0e15dfc6b7cb565f96e51876242f6b021faeaa1dfd5ed50757eb8a58d277","observation_id":"b4514555-9fbd-427b-b890-8d02cb6bd112","resolution":{"observed_at":"2026-08-01T22:26:24.098278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.184455Z","title":"Multi-modal generative ai: Multi-modal llms, diffusions and the unification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.184455Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:117c331789dbffa61ebcf01356acccd4994c6d4273c2c564bb19a875bf19d48e","observation_id":"619415b4-fd29-417c-a927-e3f6caaa5805","resolution":{"observed_at":"2026-08-01T22:26:24.184455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.262670Z","title":"Video-llama: An instruction-tuned audio- visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.262670Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:cc63597cca571f980e43492bd45983037f3ec6201e223c3e7d687544f7d1fbc9","observation_id":"99a99d8b-abf6-454d-9c75-d4977f9faf5f","resolution":{"observed_at":"2026-08-01T22:26:24.262670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.319973Z","title":"Fuyu-8b: A multimodal architecture for ai agents,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.319973Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:730018ee3970b3d66d118d4b41c767fa1859d9909be35f7602bf0b4d3226cd37","observation_id":"52d9003b-0352-48f2-97e9-ae08892790e7","resolution":{"observed_at":"2026-08-01T22:26:24.319973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.409429Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.409429Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:4fb927a46abc096cc6d79ad9033b6dd22856430d0de54552ce5b312a37b7e248","observation_id":"186f6d8e-07d2-4b51-bde7-d135f99109ad","resolution":{"observed_at":"2026-08-01T22:26:24.409429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.490559Z","title":"Multi-sentence video grounding for long video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.490559Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:76c93f9a7a8f389a9c1faf4f6cf28f95f582ad9853590e572dd0a5dfca0d1b7d","observation_id":"397a33f9-1e21-4be9-8587-1e01bb531ae1","resolution":{"observed_at":"2026-08-01T22:26:24.490559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.568442Z","title":"Modularagent: A task-aware modular framework for joint optimization of multimodal large language models and world models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.568442Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:7a576a5e267f8cbaa5b625acf986879a3f358a7096134d5d6e49ed7c8877ea65","observation_id":"06667faa-010d-4fcb-98b3-ba8c654cf06f","resolution":{"observed_at":"2026-08-01T22:26:24.568442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.659409Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.659409Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:6dc317404560893c1213fb31c0dee77eb3cd74dd45ee627019fa553d6e516c0a","observation_id":"27f6580e-b61b-4b21-8470-779f462246bf","resolution":{"observed_at":"2026-08-01T22:26:24.659409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.726194Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.726194Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:95d3836e4707c7c22a052553429f4b8a78e6d45348e7197bf73888570b1afb87","observation_id":"b9a81adf-f114-4fdd-b6ea-507aa91a415b","resolution":{"observed_at":"2026-08-01T22:26:24.726194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-01T22:26:24.782850Z","title":"Video-xl-2: Towards very long-video understanding through task-aware kv sparsification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.782850Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:067cbf6a1b1e9ddef7b766e852d4a3979ae5be578248c2fa2466cab20ced8bad","observation_id":"3e370153-360e-4d06-9b8a-c84ad2d9ff37","resolution":{"observed_at":"2026-08-01T22:26:24.782850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-01T22:26:24.831412Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.831412Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:1a34d11316e5c5ca23e289b3e953d975d94426017f7bedfee8cce748b1e6845e","observation_id":"bc3e9312-03be-4c05-9bc7-dd2aa0f38df6","resolution":{"observed_at":"2026-08-01T22:26:24.831412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-01T22:26:24.886162Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.886162Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:eab48c10b9ea2e16090bc929b39b287c54d2a5f14e5f49737d7fc95b5c565f4a","observation_id":"5e94b226-070e-4c91-8f2f-c5abcb729756","resolution":{"observed_at":"2026-08-01T22:26:24.886162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.942904Z","title":"Llava-video: Video instruction tuning with synthetic data,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.942904Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:9cfbbc12c64b0ca751cd286777e73127fae0acd6adbffe5a38492790c4103e7d","observation_id":"ffdb04a3-c6cc-41a7-8f42-bc62895b3193","resolution":{"observed_at":"2026-08-01T22:26:24.942904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:24.981811Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:24.981811Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:b222f31d9dd3a3de8dd6da836c69b406d416b936373e97a7ee8d222542bcd449","observation_id":"1d97a38c-90ec-48ce-8061-3c336499d9a1","resolution":{"observed_at":"2026-08-01T22:26:24.981811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.055475Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.055475Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:504482ea9e8c89b689b936fc5236dbf068167ed96d1df2cbaace468e0848663e","observation_id":"6ff3a8e3-9878-42e5-9d63-566d7077ad1c","resolution":{"observed_at":"2026-08-01T22:26:25.055475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.141517Z","title":"Modularized self-reflected video reasoner for multimodal llm with application to video question answering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.141517Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:c86196fd82c950664066893ca13bded1242f728b0bd9f4dc750178b9d600c402","observation_id":"cab6b849-c83f-4440-976c-279ef2738788","resolution":{"observed_at":"2026-08-01T22:26:25.141517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.216497Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.216497Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:408ce38c352c899544ede61a565998675adeb9cb7b10913d085bbb9e706bc830","observation_id":"c2f565c9-4d53-4318-b85c-26a6049b825d","resolution":{"observed_at":"2026-08-01T22:26:25.216497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.266600Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.266600Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:aef41d009f78b864da3c6ab50dd353be730302cd97439475ad6da19fab577963","observation_id":"349e2906-80de-4009-ae36-b0068cf5dddf","resolution":{"observed_at":"2026-08-01T22:26:25.266600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.321124Z","title":"Lvbench: An extreme long video understanding benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.321124Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:ee28b167e8ac128da8d421a76c9c3669e4c7f014274b69e8bf23e7f3d754ca16","observation_id":"7ee821ea-8269-4eae-b24c-152814391dbc","resolution":{"observed_at":"2026-08-01T22:26:25.321124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.405821Z","title":"Mlvu: Benchmarking multi-task long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.405821Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:e0a2935a9733a1dde85c31319043c0b00ccec80f6dd3539bae3784118f0e8a42","observation_id":"bf72d852-b689-4c96-af23-6c98535cefeb","resolution":{"observed_at":"2026-08-01T22:26:25.405821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.477899Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.477899Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:876b2e02fbfd2668123633051fd9d3487ae6990b8a4055133be834f4ed6cbfc6","observation_id":"157dd742-d96c-4a01-82fe-16c9341215c6","resolution":{"observed_at":"2026-08-01T22:26:25.477899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.559526Z","title":"Infinibench: A comprehensive benchmark for large multimodal models in very long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.559526Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:506ca1d402e7733d96a6b80b8af4aeb010373447b75ec1f24b853a804ba1a952","observation_id":"e56562a6-61e0-413a-9acd-5a1a5c1133d2","resolution":{"observed_at":"2026-08-01T22:26:25.559526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.637198Z","title":"Cg-bench: Clue-grounded question answering benchmark for long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.637198Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:8c235cb83a35dbf2efa2a160aaac875e666a4d440459e2aca0da6d549ea3c984","observation_id":"8e6a8668-c044-4dbd-8956-2902276bf543","resolution":{"observed_at":"2026-08-01T22:26:25.637198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.723913Z","title":"Videoitg: Multimodal video understanding with instructed temporal grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.723913Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:c05fcab4a1be77d79fa40e837d873f9f806f7ca66efd89fb3dd09487f621d10d","observation_id":"6b7562bd-dc6d-4bb7-b34c-a1c11e98e26e","resolution":{"observed_at":"2026-08-01T22:26:25.723913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:26:25.786061Z","title":"ordering,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T22:26:25.786061Z"},"links":{"citing_paper":"/paper/2607.15778"},"observation_digest":"sha256:f7839871a79e1fc87dcd8ab64433afecd22a89a8ec9677eed8850af0cc0b9511","observation_id":"d76e0c01-b8d1-4867-8c1c-aa60e84153fb","resolution":{"observed_at":"2026-08-01T22:26:25.786061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15778","last_updated":"2026-07-17T09:21:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:11:43.071607Z","submitted_at":"2026-07-17T09:21:52Z","title":"Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.15778."}