{"as_of":"2026-08-07T10:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a781aab73add7c590c93a7c24e54b06f2b69908ba775cfdee07b0e09605f3d5","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:38:20.743420Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.10302/citation-record","integrity":"/paper/2507.10302/integrity","json":"/paper/2507.10302/citation-record.json","paper":"/paper/2507.10302"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:38:13.744309Z","title":"arXiv:2303.08774 (2023) 4, 6, 9","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:13.744309Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:596905278a5b05697e69887cf14ec3ba9abd4aa8df5c1609d70cd4603b2840ed","observation_id":"c201e185-eee5-49ee-a9b0-c2ca80d845f4","resolution":{"observed_at":"2026-08-06T17:38:13.744309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:13.800454Z","title":"In: NeurIPS (2022) 1, 2","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:13.800454Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:59f6024eb2264f534379afe65645442df05a8e1b1d15e6a6688feafd62c4486e","observation_id":"43efa36a-bb39-4e18-8419-7712a080ed51","resolution":{"observed_at":"2026-08-06T17:38:13.800454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T17:38:13.887420Z","title":"Ablations on the weights different components in the total training loss of DisCo","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:13.887420Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:9202a6c313bec97a50cc68f6b037efcddbc3ce607a4c2db0478857b1124a0cdc","observation_id":"724bd4d6-c78a-45d0-a194-cfe9edf3479b","resolution":{"observed_at":"2026-08-06T17:38:13.887420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:13.993701Z","title":"In: ICCV (2021) 2, 6, 9","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:13.993701Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ff600d19f199cab3c9d141b983884dcb6999bafc49a6ab19075e78aab69d9627","observation_id":"9f9a2c07-49b6-4862-a614-6beafbde6294","resolution":{"observed_at":"2026-08-06T17:38:13.993701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:14.035353Z","title":"In: NeurIPS (2020) 2","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.035353Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:b361b3989fc67d1302c5f65bfd417ed86047d04d5318a85c37278a95bd74e2df","observation_id":"607be67e-a3c6-44a2-8956-93aab90f7d4d","resolution":{"observed_at":"2026-08-06T17:38:14.035353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:14.105134Z","title":"In: ECCV (2020) 4","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.105134Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:f9d924678fb27ac21db332d48f0afe6c1b01140281322b1b5be1a250b7bc6335","observation_id":"03173b9b-2712-4504-8da1-8ca05b4a22fe","resolution":{"observed_at":"2026-08-06T17:38:14.105134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:14.175728Z","title":"In: CVPR (2024) 1, 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.175728Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:b399b81b86f421685f43ae9bd23629a019f5f2b7038b4d82137a93d1fc083fec","observation_id":"7836d8d4-84b7-47c8-a079-162823de13a0","resolution":{"observed_at":"2026-08-06T17:38:14.175728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02768","last_updated":"2025-05-06T09:02:57Z","snapshot_observed_at":"2026-08-01T16:37:35.461629Z","submitted_at":"2024-09-17T05:17:37Z","title":"Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02768","snapshot_observed_at":"2026-08-06T17:38:14.260667Z","title":"arXiv:2410.02768 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.260667Z"},"links":{"cited_paper":"/paper/2410.02768","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:b24ea9e0cd98d300078b0e95fac9a6315deb56d2386309a9ecf05183217bdcf4","observation_id":"4f3e1cfc-98a5-41bd-9d90-15aea3596228","resolution":{"observed_at":"2026-08-06T17:38:14.260667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T17:38:14.332299Z","title":"arXiv:2310.09478 (2023) 3","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.332299Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:cd4e7c00304822b2da8c4950992f96901edffb4d8629dcff936ba5b599c1dcb8","observation_id":"345d4ff9-0653-4faf-8052-39fb18424663","resolution":{"observed_at":"2026-08-06T17:38:14.332299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-06T17:38:14.390971Z","title":"arXiv:2311.12793 (2023) 1","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.390971Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:8eddfbbf0875f3413ba3b9ff2d5802dad8b6f39be209f3ab83597ab1c5ae8d36","observation_id":"66fe3c21-9130-4585-a951-609915ea4b3a","resolution":{"observed_at":"2026-08-06T17:38:14.390971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T17:38:14.432529Z","title":"arXiv:2406.04325 (2024) 1, 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.432529Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:6ac172d6acf364069558067ea9cbb9a810638363c1859e5b075502be638a0a78","observation_id":"2da34952-7e06-42c6-ad0f-7a60dfe52fc0","resolution":{"observed_at":"2026-08-06T17:38:14.432529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:14.513288Z","title":"I see you, Batman!","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.513288Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:4a7b597900c4e3779566b73e4ab09508c77afdf8835c9596f6acecac94016219","observation_id":"86b558ce-f96b-4733-9f88-c59990bc0dd7","resolution":{"observed_at":"2026-08-06T17:38:14.513288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-06T17:38:14.586386Z","title":"arXiv:2312.06722 (2023) 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.586386Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:9b66c22b7889564a0d2e5c2e92e8650fa0af6b8b7a8842a9401ba80c46042b8e","observation_id":"5c4a722a-da2d-42d3-bc83-d5940e9691a8","resolution":{"observed_at":"2026-08-06T17:38:14.586386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:14.671358Z","title":"In: CVPR (2024) 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.671358Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:aef3b18b1609e5e14d953eb06b649d3f9d10f7016cee509ef5cb789885e13603","observation_id":"5498de92-18fa-4680-97ac-b93c70780507","resolution":{"observed_at":"2026-08-06T17:38:14.671358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T17:38:14.763233Z","title":"arXiv:2406.07476 (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.763233Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:073a4f2607a7fbf2d0235984ac4abd81a7082b9a6ce792cb4dd870d775aa4c9d","observation_id":"b7ae5fcc-f264-4131-9fb5-268430b92ae1","resolution":{"observed_at":"2026-08-06T17:38:14.763233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:14.830921Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.830921Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:69d32d3ed88e7bdce8cb44a3e3e8da80891c305f414ab64a87e418d235e1ea31","observation_id":"f0194408-f5ec-4a50-9cf6-5439a4022bcf","resolution":{"observed_at":"2026-08-06T17:38:14.830921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T17:38:14.924271Z","title":"arXiv:2402.03766 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:14.924271Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:c0142563e8ad40508f6500cfbc41c6b0226ede520612795e9eada698077f83a1","observation_id":"1eef3aac-44ed-4ba3-bf11-518e7d03ccfa","resolution":{"observed_at":"2026-08-06T17:38:14.924271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T17:38:15.022435Z","title":"arXiv:1810.04805 (2018) 2","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.022435Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:4aa9ef7f3aaf83debf41ebaa059d4b1622c71fca94979d1819ddd6bbcefc658b","observation_id":"eefbd9ad-4aaf-413d-9aaa-49f560c5227e","resolution":{"observed_at":"2026-08-06T17:38:15.022435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T17:38:15.079259Z","title":"arXiv:2010.11929 (2020) 3","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.079259Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:972268958d73a416f4da94ca3169ccf6bd9c1010817dc229d409852cb784d81c","observation_id":"cb31d280-a509-4892-8e52-0cb174b0c121","resolution":{"observed_at":"2026-08-06T17:38:15.079259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-06T17:38:15.184382Z","title":"arXiv:2303.03378 (2023) 1","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.184382Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:0cb61db40a32fdca9b2d0890f40f1762b8e5ad0fdbd7fde4e04cabebbf1f7d3a","observation_id":"41c84606-e81a-430b-9fc2-b1a174403ae8","resolution":{"observed_at":"2026-08-06T17:38:15.184382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T17:38:15.276356Z","title":"arXiv:2407.21783 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.276356Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:a92dda8363b0d8666b96149fc65e3388a485a3b8f6d6a1b9d15f458d0c0809f1","observation_id":"8cd5c9eb-8562-4209-a371-08b49ddf1272","resolution":{"observed_at":"2026-08-06T17:38:15.276356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:15.378346Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.378346Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:6eba113fe422d4dc05d579c9ec333638530aa44093c1669428ef73a8e2dc6db5","observation_id":"b2823f80-b137-44c5-b1ac-0516804f4955","resolution":{"observed_at":"2026-08-06T17:38:15.378346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:15.426339Z","title":"In: CVPR (2023) 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.426339Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:673504a56c8c95a7a582acddf748586cfacc0deff4cf2c223b453296fa3efb62","observation_id":"e3776ed1-c023-4dcb-b04b-50b221e334e1","resolution":{"observed_at":"2026-08-06T17:38:15.426339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T17:38:15.473346Z","title":"arXiv:2405.21075 (2024) 6","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.473346Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:2973faa51642d1fecd54ab26d7643c87bbab2a197608ce786e3379371c6c9c19","observation_id":"0ce230bb-953d-4a1e-8900-a855f7c56296","resolution":{"observed_at":"2026-08-06T17:38:15.473346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08041","last_updated":"2023-08-12T04:42:29Z","snapshot_observed_at":"2026-08-06T07:20:51.958343Z","submitted_at":"2023-07-16T13:41:39Z","title":"Planting a SEED of Vision in Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08041","snapshot_observed_at":"2026-08-06T17:38:15.540771Z","title":"arXiv:2307.08041 (2023) 1","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.540771Z"},"links":{"cited_paper":"/paper/2307.08041","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:2adf5296dd22d2a79e15485f0e18ca5b37273b9a10b3e81f8b63f379d03dfcc9","observation_id":"ff4062fc-f51c-4b6a-8b42-aeb20bd31974","resolution":{"observed_at":"2026-08-06T17:38:15.540771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:15.614673Z","title":"In: ICCV (2017) 6","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.614673Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:9415cf9b970732d8094007d5e26733378e39837a88833972956c8500ad43d5a8","observation_id":"02d3d1dd-4791-464b-b24d-bc252e7e3746","resolution":{"observed_at":"2026-08-06T17:38:15.614673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:15.687789Z","title":"In: ICLR (2022) 6","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.687789Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:b09864e78dd9b91438899b77327a936977d8bd4117e642ced447a3aeb566deff","observation_id":"1a15b683-b156-4d4c-9959-6d4ed0728984","resolution":{"observed_at":"2026-08-06T17:38:15.687789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:30.959593Z","title":"In: CVPR (2019) 2","venue":null,"work_id":"9a0f2df2-59b0-4e61-8f9f-86bdcfa00ad0","year":2019},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.781525Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:21fdab072d650c19ed135a6b9f8819f07a7260180a25af2a3485af2b16869995","observation_id":"607dafda-84ce-4743-9e65-46991d82fbb3","resolution":{"observed_at":"2026-08-06T17:38:31.066212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T17:38:15.849245Z","title":"arXiv:2310.06825 (2023) 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.849245Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:cc06b0edfbdff1ae48d6bfcbb4a3d22dfa752691ed0352fa5e6fcd85d44b6309","observation_id":"e98d4342-9857-4619-b6b2-377dac9c3b79","resolution":{"observed_at":"2026-08-06T17:38:15.849245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:30.697322Z","title":"In: CVPR (2024) 6","venue":null,"work_id":"fa51efb9-6c2f-46c6-a05f-d6d07f53ce82","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:15.963244Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:4a8f4cbe495761746a504efc2461e3a0409856e1a01b9e718b49217bfedc9b4d","observation_id":"2c7f589a-3863-4465-a417-2f691152cc5e","resolution":{"observed_at":"2026-08-06T17:38:30.848354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T17:38:16.022354Z","title":"arXiv:1705.06950 (2017) 6","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.022354Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:227926c6765c743578ddcc473e566e9f3dac8c5884650c39db89cb2788a429bc","observation_id":"6cdc7be4-f0c6-42f2-8e3d-3274e708f59b","resolution":{"observed_at":"2026-08-06T17:38:16.022354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:30.387596Z","title":"In: ECCV (2024) 1, 2","venue":null,"work_id":"012b12d3-b460-45a3-acf7-d3628371e7fb","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.087756Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:fc33264cc370145791e08e5685a0a9808d4d30b4e131687f026fd0c84b286a9f","observation_id":"0959ef81-d36f-470e-82ac-a4902e94d8aa","resolution":{"observed_at":"2026-08-06T17:38:30.531168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-06T17:38:16.116489Z","title":"arXiv:2306.05425 (2023) 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.116489Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:c4251ee52c87d9ea08ef51b000fe6d04a4a58487194bc1f12ffe489c352331a4","observation_id":"538bee68-24e6-4c16-ae51-3ecc023ed6df","resolution":{"observed_at":"2026-08-06T17:38:16.116489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-06T17:38:16.192030Z","title":"arXiv:2305.03726 (2023) 5","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.192030Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:f2c509a7dc8f8c6a9a2695e9f188e9544dc6815ec890c2c5ee7df9d62a289764","observation_id":"b348445d-e214-4a77-a551-d348e98fc3e9","resolution":{"observed_at":"2026-08-06T17:38:16.192030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T17:38:16.241699Z","title":"arXiv:2408.03326 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.241699Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:fa6c194dc76baaa1f082f94e81e7ea19964f0059c2c5cc15c6212ba73d603523","observation_id":"d59a25e4-0fa2-4725-9687-d6d4acfc89ff","resolution":{"observed_at":"2026-08-06T17:38:16.241699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:30.040287Z","title":"In: ICML (2023) 1, 2, 3","venue":null,"work_id":"0ca37aff-0eb0-498b-bd0d-0445e8300506","year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.297011Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:5d0d65cbeb7dc3b5ec1c9623f5f344a4ddbf6b134b73fc71f7db2d36868d8c3e","observation_id":"4520737c-1b66-4709-bf54-2658a49e8343","resolution":{"observed_at":"2026-08-06T17:38:30.215814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:29.763667Z","title":"In: ICML (2022) 4, 6","venue":null,"work_id":"89da97d1-5afc-4b5e-8436-456e4dc7789f","year":2022},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.371511Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:295dc14cc8a2e1fd720c0c42775686630d56956bec88291efb3cdd61956340f7","observation_id":"7542d54d-f7fc-4283-b69d-2ada832e5bca","resolution":{"observed_at":"2026-08-06T17:38:29.902598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T17:38:16.430652Z","title":"arXiv:2305.06355 (2023) 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.430652Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:a2ad8a31633ec799ff2806ed56b383255ec47d4d149b2f7739ea767cfdbbe70a","observation_id":"7c86479a-1c60-4aa1-b402-216da35395b0","resolution":{"observed_at":"2026-08-06T17:38:16.430652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:29.587016Z","title":"In: CVPR (2024) 1, 2, 5, 6","venue":null,"work_id":"d30cdf34-0f00-4e5b-852a-f6eaf3f33e25","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.489156Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:aeb17d4357926104060e3a3f27200f7a4737e240cd07fd46f71f3a44d7fbba1d","observation_id":"d8289b59-9e87-4593-b8c3-81e9643c4161","resolution":{"observed_at":"2026-08-06T17:38:29.657002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13911","last_updated":"2024-11-03T09:25:57Z","snapshot_observed_at":"2026-07-06T18:18:07.839497Z","submitted_at":"2024-05-22T18:35:10Z","title":"TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment","version":2},"cited_work":{"arxiv_id":"2405.13911","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.13911","snapshot_observed_at":"2026-08-06T17:38:21.212095Z","title":"TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment","venue":"cs.CV","work_id":"8afe9f53-b19d-4ff5-a826-56b7744db573","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.555603Z"},"links":{"cited_paper":"/paper/2405.13911","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ecc9a4068790b357704bfd1667623f4f02201673ad48a7be1537395334a16113","observation_id":"442b2771-6305-4adf-85c8-671c77800522","resolution":{"observed_at":"2026-08-06T17:38:21.336547Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T17:38:16.589632Z","title":"arXiv:2407.02392 (2024) 1, 2, 3, 10","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.589632Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ea95fb6fe080dcf812606ecdf07053613a06bf961460a76bd1acde580d3968dd","observation_id":"3243f840-cfe4-4a19-8f2d-3f79e8bfccb5","resolution":{"observed_at":"2026-08-06T17:38:16.589632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:29.424822Z","title":"In: ECCV (2024) 5, 6","venue":null,"work_id":"ba03c18b-7b8a-4221-9cc0-598eb7ceeb88","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.624560Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:55315cc6f5df94d78f2f36241ce4f6ef6c233001f5013f2c972859def1709a99","observation_id":"321d4b0d-5c05-495f-80a2-096a7362fa8d","resolution":{"observed_at":"2026-08-06T17:38:29.498383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T17:38:16.675424Z","title":"arXiv:2311.10122 (2023) 1, 3, 5","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.675424Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:2c2520e6e6e061d5bc226983acc5081efa4eacbdb8c7c7742fdd9e3c745b1929","observation_id":"32e494bc-9636-4bc8-9cc8-1b200e7e6b36","resolution":{"observed_at":"2026-08-06T17:38:16.675424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:29.179425Z","title":"In: ECCV (2014) 2","venue":null,"work_id":"0743e484-5e3c-4cb5-b8e0-de4a4290e506","year":2014},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.723028Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:20222ad630671f7d09210a63467012d627e67ec2fd8efa0bf783914da03966a9","observation_id":"883d0dd4-0754-4599-8909-105cbb6e0d87","resolution":{"observed_at":"2026-08-06T17:38:29.304790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:28.909512Z","title":"In: CVPR (2024) 1","venue":null,"work_id":"90a8706f-4b9b-4e7c-84fe-193ff062528a","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.765941Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:432a87aa14b1334228473eb7b9c4a09adc6498ef2f30e61739608cb81fda1d62","observation_id":"e629ad1a-c779-4479-8d24-7deba78bd179","resolution":{"observed_at":"2026-08-06T17:38:29.062686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:16.846803Z","title":"In: NeurIPS (2023) 1, 2, 3, 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.846803Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ec10079c3d5a420fd8a2cd38c370028249e5b351425e720c1d2d572a7b6809df","observation_id":"4a44d768-9562-4cc9-afbf-b67f35e7967f","resolution":{"observed_at":"2026-08-06T17:38:16.846803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:28.627622Z","title":"In: ECCV (2024) 5, 6, 9","venue":null,"work_id":"d1deebfa-3a82-4373-bd77-85136a45cf49","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.889577Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:561125c820ac7058c06ce5e1ef94e24efddf412bbdf16329d6b7b357d4b06bca","observation_id":"81f964ad-84e6-4297-9683-bfdb99e9498c","resolution":{"observed_at":"2026-08-06T17:38:28.764386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:28.449824Z","title":"In: NeurIPS (2020) 3","venue":null,"work_id":"1c70e9d5-2001-4147-a13d-ed6171aec7d4","year":2020},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.916656Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:b8183d04fd02481ff3c77eb95c64ff650657657cce7170052b87684165d6301e","observation_id":"8461f797-6b66-4aca-a0ad-f46468ac7f1f","resolution":{"observed_at":"2026-08-06T17:38:28.539521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:28.263977Z","title":"In: ICML (2023) 2","venue":null,"work_id":"dde331c0-f88b-4331-8064-445f9518c20d","year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.966244Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ca7c7b733d6473af5925aa244c868cf53ab6b65c2ccd72f9d4806d3d897e074e","observation_id":"7d6b7801-4119-411d-8ec9-75f68c7a6da9","resolution":{"observed_at":"2026-08-06T17:38:28.318729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-06T17:38:17.002664Z","title":"arXiv:2406.09418 (2024) 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.002664Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:942c3924882523369d358483b403beca6a67da1e145b4b250bbdc8662158d893","observation_id":"5bdbdf56-eabd-4041-96e7-58489e03b796","resolution":{"observed_at":"2026-08-06T17:38:17.002664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T17:38:17.072193Z","title":"arXiv:2306.05424 (2023) 2, 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.072193Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:3e9fe6a6f70da2600b716c06ded644bcaa05968bd426f408b8968c40e9403adb","observation_id":"8e14157d-7c11-4d81-a775-cbeed9b6125d","resolution":{"observed_at":"2026-08-06T17:38:17.072193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:28.045947Z","title":"In: NeurIPS (2023) 6","venue":null,"work_id":"72cba3f7-360f-43ef-afc8-24a57782240d","year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.130992Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:a5b3e150f326258b0d877aa8f66d74276e8170d4cb079c268f9aba03d4a96768","observation_id":"67b073d9-1d6a-4165-9ec4-b8d6bcc8e4ac","resolution":{"observed_at":"2026-08-06T17:38:28.175772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:27.823831Z","title":"In: NeurIPS (2024) 1","venue":null,"work_id":"3756975d-81bf-401b-8849-2f75b791a459","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.161209Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ce8be8fe3bdd3291d321872949d5fddbf35a91450a21d8fe220b6af6202454f8","observation_id":"386b79ff-461c-439c-8740-a77dfb464328","resolution":{"observed_at":"2026-08-06T17:38:27.903975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:27.565551Z","title":"In: NeurIPS (2024) 6","venue":null,"work_id":"d63cd09b-aeab-47c0-b0e0-1e54151cf88a","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.208737Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:f605b969529e9f3073b1364197b35a75cf4a08d684479c1c7e9c97b1ff197f90","observation_id":"49a829dd-f3dd-4985-bef6-b4571903db11","resolution":{"observed_at":"2026-08-06T17:38:27.677008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:27.352127Z","title":"In: ICCV (2015) 2","venue":null,"work_id":"073700f0-72d8-492f-a6dd-4d19ef109d32","year":2015},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.278269Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:8e80a5ce2f01f8e41162e8ed8905d702bc564e4e70edcaf46135ab67e97d377e","observation_id":"ee7759d0-0519-47ec-96a9-a2904642e3e4","resolution":{"observed_at":"2026-08-06T17:38:27.487305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16009","last_updated":"2024-05-25T02:22:09Z","snapshot_observed_at":"2026-07-06T18:19:42.946629Z","submitted_at":"2024-05-25T02:22:09Z","title":"Streaming Long Video Understanding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16009","snapshot_observed_at":"2026-08-06T17:38:17.320965Z","title":"arXiv:2405.16009 (2024) 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.320965Z"},"links":{"cited_paper":"/paper/2405.16009","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:4ea86a1995a9ad1564c062623d2eaaccab0b60f5db7a77be8ee58d8584a4b2c4","observation_id":"43c0b533-4ac5-4a04-9d05-714a5d021326","resolution":{"observed_at":"2026-08-06T17:38:17.320965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:27.179035Z","title":"In: ICML (2021) 4","venue":null,"work_id":"0d20093a-8fb8-4b5f-bcae-591f78267ecf","year":2021},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.439568Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:cd9a1fc46852388fc5b79f15a286b578db0a138964f46d25542b696cb635c97c","observation_id":"7233cdfa-b97e-478c-92fb-9754b71359eb","resolution":{"observed_at":"2026-08-06T17:38:27.263986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T17:38:17.535347Z","title":"arXiv:2307.09288 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.535347Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:7a2633309df733f0691eef73605f805836e9e9d87cdcabfa5f9419bc66b541f2","observation_id":"b7ffccc3-a817-4768-aebb-b72c3e2920ec","resolution":{"observed_at":"2026-08-06T17:38:17.535347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:26.851599Z","title":"In: NeurIPS (2017) 3","venue":null,"work_id":"89716e15-c53c-48bd-98b5-2f489e88c7b8","year":2017},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.677509Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ad9c475335426c89e27cf8de3bf625c16457948f8848c4c0d75168dfec25240b","observation_id":"6a05af73-cc51-4fa8-a9fe-06b5697fa399","resolution":{"observed_at":"2026-08-06T17:38:27.011795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T17:38:17.726972Z","title":"arXiv:2409.12191 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.726972Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:b1a6b52e41d984c5be4a76a59ada695813a8cfc507c925ed0fd69c0f1cba60d1","observation_id":"8d2417f6-8f7b-4124-ad1b-50160aa41901","resolution":{"observed_at":"2026-08-06T17:38:17.726972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:26.662530Z","title":"In: NeurIPS (2024) 3","venue":null,"work_id":"2d881958-27c6-4c55-8620-06b9f5650428","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.788180Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:eca9becc63f34e1fbe26ce894183132ec5b68eaea9c051ad37107d1d5ca20386","observation_id":"fbe2b09d-1871-496c-8ba4-195f40160540","resolution":{"observed_at":"2026-08-06T17:38:26.719355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:17.876527Z","title":"arXiv:2409.02889 (2024) 5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.876527Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ebaadaf5caeddf6bde86a96a4b2b67713be559a679c916cab3b2cde12e4ab8f4","observation_id":"d0e2a374-33f4-4108-a157-64655cfd577d","resolution":{"observed_at":"2026-08-06T17:38:17.876527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:26.435529Z","title":"In: ECCV (2024) 1, 2, 5, 6, 9","venue":null,"work_id":"29549632-b0a0-479e-8dae-0550322b0e5c","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:17.935120Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:21772137e6f8e70686987f6e042ee5847c78c1d5469e10c285d8b03572ffb252","observation_id":"a9e902cd-cb82-47cf-82d4-603c9f294408","resolution":{"observed_at":"2026-08-06T17:38:26.539128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:26.158357Z","title":"In: NeurIPS (2021) 2, 6","venue":null,"work_id":"2d0761e5-2589-45a4-85b9-3cfeabaf2a34","year":2021},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.007029Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:8de112d946052017f9dcca1cc2fa884e70f5c7fb51e14f387ad91fa3bc70a4ec","observation_id":"511b4426-8679-44f0-a05d-b86c191e34b7","resolution":{"observed_at":"2026-08-06T17:38:26.310005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:25.780205Z","title":"In: CVPR (2021) 6 12","venue":null,"work_id":"6e46a85c-5100-4bda-a0a6-136cf0c27fb8","year":2021},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.031278Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:847dcd8bcba9da7b09285659a2b61d8216a04160f81f5feba3e676421dbdd16e","observation_id":"0de2c905-712d-4d08-b347-fd91b045fc66","resolution":{"observed_at":"2026-08-06T17:38:25.983174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13088","last_updated":"2024-02-20T15:30:09Z","snapshot_observed_at":"2026-07-06T17:32:56.445791Z","submitted_at":"2024-02-20T15:30:09Z","title":"Slot-VLM: SlowFast Slots for Video-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13088","snapshot_observed_at":"2026-08-06T17:38:18.120829Z","title":"arXiv:2402.13088 (2024) 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.120829Z"},"links":{"cited_paper":"/paper/2402.13088","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:3b8e8e2b9f0d842bc1c6325e99b158c70b093f26d0a432ceb18bec4f16bd531f","observation_id":"f7d431bf-cb92-4640-a746-f6f2056a90d8","resolution":{"observed_at":"2026-08-06T17:38:18.120829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:25.488541Z","title":"In: CVPR (2016) 2","venue":null,"work_id":"ddcb90fc-2cb0-450a-8467-61d3c2a8d11e","year":2016},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.244765Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:6f7745018bcecf86e87be2ca2a548b6f5027fdb87c408f877a709983b89d0c15","observation_id":"ebaffa45-cddf-4b24-9b6d-ca4799c54f16","resolution":{"observed_at":"2026-08-06T17:38:25.628447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-06T17:38:18.355450Z","title":"arXiv:2404.16994 (2024) 1, 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.355450Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:77e90a4302d8826a6950f489cab454814769d8c05ef948dd00380afe4ebfac38","observation_id":"8da4eebb-4466-491b-b306-00581c9b7091","resolution":{"observed_at":"2026-08-06T17:38:18.355450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:25.216251Z","title":"RAL (2024) 1","venue":null,"work_id":"cf414538-091f-4eb6-83d5-38df6c4f0756","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.449200Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:f4fc799c23b17d29c58a9a59e4c8dd9d9a7f7693f671e7c5c61ab0c1e706e460","observation_id":"34460155-d1c6-48db-85f6-23598d400956","resolution":{"observed_at":"2026-08-06T17:38:25.341643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-04T13:01:39.904947Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T17:38:18.564455Z","title":"arXiv:2405.20985 (2024) 3, 10","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.564455Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:401c3779cb6b4b652b2bfe6005cbbca685f2ebe72fa712efa29bd30cd482e605","observation_id":"7bf3ec7f-6b4a-4085-a110-40881a5299fd","resolution":{"observed_at":"2026-08-06T17:38:18.564455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T17:38:18.659223Z","title":"arXiv:2304.14178 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.659223Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:205d498e169cd1c0b12336ef266e387c325a380225b8af350c9c767a9fc4c8ad","observation_id":"e5b3b342-ae0a-44a5-b0b4-153c0da017fd","resolution":{"observed_at":"2026-08-06T17:38:18.659223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:24.878566Z","title":"In: CVPR (2024) 1, 3","venue":null,"work_id":"7e6e6d9b-8697-40c9-b11d-3775db41bda6","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.725956Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:465fabc0db2c2a7dd180d17d506f454f14604532b4f353a40997b0da4d0aa2f5","observation_id":"8e0faf98-bfa6-4278-8748-473a2e7926dc","resolution":{"observed_at":"2026-08-06T17:38:25.052767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:24.560963Z","title":"In: ICLR (2020) 6","venue":null,"work_id":"834164b1-d375-4b12-a797-952c892188d2","year":2020},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.776700Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:30b087eaa9533f75c3e19c67dffe762ac5396194f67f2af5c17b9e36cd1f3fa9","observation_id":"81106527-a8cd-4c8f-a833-43e854334668","resolution":{"observed_at":"2026-08-06T17:38:24.698975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:24.253798Z","title":"In: ICLR (2024) 2","venue":null,"work_id":"78d90923-cb68-4df0-9592-de7184a5e45c","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.945497Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:fa3fbd581a6f13057eea38b72a64eb5531ba1e1b71b6d23986044889d05f1438","observation_id":"0beed7bf-d1b4-4ce8-8fe0-58119cbd0be3","resolution":{"observed_at":"2026-08-06T17:38:24.434302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:23.964169Z","title":"In: ECCV (2016) 2","venue":null,"work_id":"e5541ffa-81dd-4efd-bd42-6d11fbe1b349","year":2016},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.078605Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:10494d99fcd6f07f8f5a9797aef536a765f8cf65bc235eb0fb918e12ddbc8af2","observation_id":"0231cead-6e59-41bb-b365-ccd9cc2b50bf","resolution":{"observed_at":"2026-08-06T17:38:24.113166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:23.621830Z","title":"In: CVPR (2023) 2","venue":null,"work_id":"6352d618-ef3d-463f-9d45-dd90a6da8cef","year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.188805Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:5251f08f34999966d3146fe1a68adf9eb3fd365c1ca30f3c899d52acfc6fedfb","observation_id":"bc52b499-29e2-4fb4-a2ff-eff8f96974b8","resolution":{"observed_at":"2026-08-06T17:38:23.824932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T17:38:19.313543Z","title":"arXiv:2306.02858 (2023) 2, 3, 5, 6","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.313543Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:e9dbad5144cc8ed46d4b300083a34ad80eed63f800d77ff1d6315ced2abe0a6e","observation_id":"3726dca5-5270-440f-946b-40c29d849afe","resolution":{"observed_at":"2026-08-06T17:38:19.313543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-06T17:38:19.466169Z","title":"arXiv:2407.03320 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.466169Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:05070fc32179e75991e8b7be3d4f1b120e9352dc16c87f3bc0313e9522340aac","observation_id":"5c636545-9057-455b-86a3-c57df509d1d2","resolution":{"observed_at":"2026-08-06T17:38:19.466169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-06T17:38:19.548969Z","title":"arXiv:2303.16199 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.548969Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:5f878fb73dfaf8e76293529b7fc26bac545859c95a1d1231af8787137b7a98ef","observation_id":"cf98a928-97fb-49f1-a8b2-0426a301e87f","resolution":{"observed_at":"2026-08-06T17:38:19.548969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-07-06T17:54:03.923842Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-06T17:38:19.619551Z","title":"arXiv:2404.01258 (2024) 6, 9","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.619551Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:d872abb2adff7c86e94d096f2d5a02ea551435789375c3722ae08c87a49e4a00","observation_id":"bc289c9d-427d-4610-8baa-f295ed061a79","resolution":{"observed_at":"2026-08-06T17:38:19.619551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:23.259839Z","title":"In: ICLR (2025) 5, 6","venue":null,"work_id":"d4ec5948-bc75-466e-87cb-0144ef922e59","year":2025},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.736433Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:326505565879d84e83ed7aeca222a32c6378a965782d72bef8740740e018f327","observation_id":"e819ecc3-4df0-474b-b1df-8a031c12164b","resolution":{"observed_at":"2026-08-06T17:38:23.450916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:22.936045Z","title":null,"venue":null,"work_id":"64dae292-4afd-45a1-a7f1-18d1f445a8a7","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.814174Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:5058dd2f32fe643b3503b31cf5401d577afc5c34e190d21facf305070b0dcbbe","observation_id":"4bc26048-147c-4687-835c-a95a3e75083a","resolution":{"observed_at":"2026-08-06T17:38:23.105549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T17:38:19.891685Z","title":"arXiv:2410.02713 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.891685Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ab5d070d2a93473e28a03a2d04a6c6681da6701b50c74a9ea0aa7bdf48772f1e","observation_id":"904869a4-664e-4648-b434-788a107d910f","resolution":{"observed_at":"2026-08-06T17:38:19.891685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-06T17:38:19.968980Z","title":"arXiv:2309.07915 (2023) 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.968980Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:df3af28b597fc1ff59168d8b5bf42d482a0774d8dc272da04870ebf54c271542","observation_id":"17b80f1f-639d-4ed0-8004-9db7e39d7fca","resolution":{"observed_at":"2026-08-06T17:38:19.968980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:22.668270Z","title":null,"venue":null,"work_id":"fa6819b0-fb2d-4179-a886-b3acd8d422e4","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.040411Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:937664a4862dbbb72e4e9aacf6bbf43a0eb991ffafded9e9ea51cfb2a94a8c36","observation_id":"1cc34e76-338a-432b-b6d5-791c97873d5a","resolution":{"observed_at":"2026-08-06T17:38:22.784460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:22.345032Z","title":"In: NeurIPS (2023) 2","venue":null,"work_id":"176cbf5e-e636-4f8e-994d-b41437d0b71e","year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.130340Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:675d15e2bfac1a0a07e0aa6cf95a49211332179b775921993203d06ca741d093","observation_id":"291812b2-9a35-4724-8333-e582821e6ec1","resolution":{"observed_at":"2026-08-06T17:38:22.525218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:21.971699Z","title":"In: NeurIPS (2024) 1","venue":null,"work_id":"8c0c1063-665e-4c22-a38b-01ab0914b448","year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.238682Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:5ca4b4749f2f584f32333cb445cfbc83a5489f7713aec08b6ca22cba0155b5b7","observation_id":"3aa8ffb8-1d66-486b-9788-233ae4cc58c3","resolution":{"observed_at":"2026-08-06T17:38:22.186809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-06T17:38:20.326601Z","title":"arXiv preprint arXiv:2407.14500 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.326601Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:08420de81ba7f8086bf1dde19df11e86c7e4b1d0ffee6389473dc825d5b21a2b","observation_id":"d69fd75a-9aa7-4bd6-928c-b428aaaf0e05","resolution":{"observed_at":"2026-08-06T17:38:20.326601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-06T17:38:20.409072Z","title":"arXiv:2406.04264 (2024) 6","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.409072Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:7efa37a5609f333268e8c3177240484a62d9eef95454053ebbe73983b1b14bf4","observation_id":"e973c4df-534a-4661-8449-cf606e65c9f5","resolution":{"observed_at":"2026-08-06T17:38:20.409072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:38:21.648937Z","title":"In: AAAI (2018) 2","venue":null,"work_id":"4780697a-a01c-4b76-8d38-d23b6768e504","year":2018},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.527167Z"},"links":{"citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:19c1af9828b081cb26b0404b770476dc06552d048b67d6db16433486ac921e9e","observation_id":"e8ea2821-4834-40c5-8833-fc92a11bd334","resolution":{"observed_at":"2026-08-06T17:38:21.736590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T17:38:20.626312Z","title":"arXiv:2304.10592 (2023) 1","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.626312Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:15095407010016ce874a3cac9625a3c7500c93f0b4b2f4b422127d2779db91fa","observation_id":"4144ffb2-608f-478b-b583-7ffa57eae19f","resolution":{"observed_at":"2026-08-06T17:38:20.626312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09251","last_updated":"2023-12-14T18:59:43Z","snapshot_observed_at":"2026-07-06T17:02:05.607732Z","submitted_at":"2023-12-14T18:59:43Z","title":"VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09251","snapshot_observed_at":"2026-08-06T17:38:20.743420Z","title":"arXiv:2312.09251 (2023) 2 13","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.743420Z"},"links":{"cited_paper":"/paper/2312.09251","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:4e65c2040f76ada277221af8790c0e6359d91d0698057fbea517cb0b0359ce4b","observation_id":"f7f5f831-62fd-475b-bc0d-3474d9e72514","resolution":{"observed_at":"2026-08-06T17:38:20.743420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 0 inbound Pith citation observations for arXiv:2507.10302."}